Wat is Transformer?
In één zin
Een transformer is een type neuraal netwerk dat met een aandachtsmechanisme alle delen van een tekst tegelijk bekijkt, en de basis vormt van de meeste moderne taalmodellen.
Ook wel: transformer-architectuur, transformermodel
Een transformer is een type neuraal netwerk dat heel goed is in het verwerken van tekst en andere reeksen gegevens. Bijna alle grote taalmodellen, zoals die achter chatbots, zijn erop gebouwd.
Hoe werkt het?
Vroeger lazen taalmodellen een zin woord voor woord. Daardoor vergaten ze vaak wat er aan het begin stond. Een transformer werkt anders. Hij kijkt naar alle woorden tegelijk en bepaalt welke woorden belangrijk zijn voor elkaar. Dit heet aandacht (in het Engels attention).
Neem de zin: ‘De hond pakte de bal en hij rende weg.’ Om te weten waar ‘hij’ naar verwijst, moet het model terugkijken naar ‘hond’. Door aandacht legt het model die link.
- De tekst wordt eerst opgeknipt in kleine stukjes, tokens genaamd.
- Elk stukje wordt omgezet in getallen.
- Het model weegt hoe sterk stukjes met elkaar te maken hebben.
- Op basis daarvan voorspelt het wat er logisch volgt.
Omdat dit tegelijk kan, zijn transformers goed te trainen op enorme hoeveelheden data.
Een voorbeeld uit de praktijk
Als je een chatbot vraagt om een lange e-mail samen te vatten, houdt het model de rode draad vast. Het begrijpt dat een naam in de eerste alinea hoort bij een opmerking in de laatste. Ook vertaalapps en tools die tekst bij een beeld maken, gebruiken transformers.
Waarom is dit belangrijk voor jou?
De transformer is de reden dat AI de laatste jaren zo’n sprong maakte. Als je dit weet, snap je beter waarom chatbots zo vloeiend schrijven.
- Een transformer voorspelt woorden. Hij weet niet automatisch of iets waar is.
- Daarom kunnen er nog steeds fouten of verzonnen feiten in zitten.
- Het trainen kost veel rekenkracht en dus veel energie.
Controleer belangrijke informatie altijd zelf.