Wat is Embedding?
In één zin
Een embedding is een lijst getallen die de betekenis van een woord, tekst of afbeelding weergeeft, zodat een computer kan vinden wat inhoudelijk op elkaar lijkt.
Ook wel: embeddings, vector embedding
Een embedding is een manier om de betekenis van een woord, zin, plaatje of document uit te drukken in een lijst getallen. Zo kan een computer rekenen met betekenis. Dingen die op elkaar lijken, krijgen getallen die dicht bij elkaar liggen.
Hoe werkt het?
Een computer begrijpt geen woorden, alleen getallen. Een AI-model leert daarom bij elke tekst een lijst getallen te maken, die we ook een vector noemen. Je kunt een vector zien als een punt op een enorme kaart. Het model leert tijdens het trainen de punten zo neer te zetten dat:
- woorden met een vergelijkbare betekenis dicht bij elkaar komen, zoals hond en puppy;
- niet verwante woorden ver uit elkaar liggen, zoals hond en belasting;
- ook hele zinnen en alinea’s een plek op de kaart krijgen.
Om te zoeken, maakt het systeem van je vraag ook een embedding. Daarna zoekt het de punten die er het dichtstbij liggen. Dat zijn de teksten met de meest vergelijkbare betekenis.
Een voorbeeld uit de praktijk
Je zoekt in het interne archief van je werk naar: hoe vraag ik vakantie aan? Het document heet verlofregeling en bevat het woord vakantie nauwelijks. Een gewone zoekfunctie mist het. Een zoekfunctie met embeddings snapt dat verlof en vakantie dicht bij elkaar liggen en toont het document toch. Webwinkels gebruiken het ook om vergelijkbare producten aan te raden.
Waarom is dit belangrijk voor jou?
Embeddings zitten achter slimme zoekfuncties, aanbevelingen en RAG. Ze maken AI beter in het vinden van wat je bedoelt. Houd rekening met een paar punten:
- Embeddings nemen ook vooroordelen uit de trainingsdata over.
- Ze kunnen nuances missen, zoals ironie of een ontkenning.
- Ook persoonlijke gegevens kunnen erin verwerkt zijn, dus ga er zorgvuldig mee om.