Wat is Reinforcement learning?
In één zin
Reinforcement learning is een vorm van machine learning waarbij een AI door vallen en opstaan leert, doordat goede acties worden beloond en slechte acties minder opleveren.
Ook wel: bekrachtigingsleren, versterkend leren
Reinforcement learning is een manier van machine learning waarbij een AI leert door te proberen. Goede keuzes worden beloond en slechte keuzes niet of juist gestraft. In het Nederlands heet het ook wel bekrachtigingsleren.
Hoe werkt het?
Denk aan het trainen van een hond. Doet hij iets goed, dan krijgt hij een snoepje. Na een tijdje snapt hij wat hij moet doen. Bij reinforcement learning gebeurt iets vergelijkbaars.
- Een agent is het systeem dat keuzes maakt.
- De omgeving is de wereld waarin het handelt, zoals een spel.
- Na elke actie krijgt de agent een beloning, een score die zegt hoe goed de keuze was.
De agent probeert zoveel mogelijk punten te halen. In het begin doet hij vooral maar wat. Na duizenden of miljoenen pogingen ontdekt hij welke strategie het beste werkt. Niemand hoeft hem de juiste antwoorden voor te zeggen.
Een voorbeeld uit de praktijk
Een bekend voorbeeld zijn AI-systemen die leren om bordspellen of videogames te spelen. Ze spelen eindeloos tegen zichzelf en worden zo steeds beter. Ook robots die leren lopen of een voorwerp pakken, gebruiken het. Bij sommige chatbots wordt het gebruikt om antwoorden te verbeteren. Mensen geven dan een waardering aan antwoorden, en het model leert welke antwoorden mensen fijn vinden.
Waarom is dit belangrijk voor jou?
Reinforcement learning laat zien dat AI niet alleen van vaste voorbeelden leert, maar ook van ervaring. Dat maakt het krachtig. Er zijn ook risico’s:
- De AI zoekt de snelste weg naar de beloning. Soms vindt hij een sluiproute die niet bedoeld was.
- Een slecht gekozen beloning leidt tot ongewenst gedrag.
- Oefenen in de echte wereld kan gevaarlijk of duur zijn, dus gebeurt het vaak in simulaties.
Zo snap je beter waarom de gekozen doelen bij AI zo belangrijk zijn.