Wat is Multimodaal?
In één zin
Een multimodaal AI-model kan met meerdere soorten informatie tegelijk werken, zoals tekst, beeld, geluid en video, en daar verbanden tussen leggen.
Ook wel: multimodale AI, multimodaal model
Een multimodaal AI-model kan met meerdere soorten informatie werken, zoals tekst, beeld, geluid en video. Je kunt dus een foto laten zien, een vraag stellen en een antwoord in tekst of spraak krijgen.
Hoe werkt het?
Een modaliteit is een soort invoer of uitvoer. Tekst is één modaliteit, beeld een andere, geluid weer een andere. Oudere AI-systemen konden vaak maar één soort aan. Een multimodaal model leert verbanden tussen die soorten. Het ziet bijvoorbeeld heel veel foto’s met bijschriften en leert zo dat het woord kat hoort bij het beeld van een kat.
Intern worden alle soorten informatie omgezet in getallen. Het model kan die getallen met elkaar combineren. Daardoor kan het:
- een afbeelding beschrijven in woorden;
- een gesproken vraag begrijpen en beantwoorden;
- een grafiek lezen en samenvatten;
- een afbeelding maken op basis van een tekst.
Een voorbeeld uit de praktijk
Je fiets heeft een raar geluid en een onderdeel ziet er kapot uit. Je maakt een foto en vraagt aan een AI-app: Wat is dit onderdeel en wat moet ik doen? De app bekijkt de foto, leest je vraag en geeft uitleg in tekst. Of denk aan iemand die slecht ziet. Die laat de telefoon de omgeving beschrijven, zodat hij een menukaart kan horen.
Waarom is dit belangrijk voor jou?
Multimodale AI maakt het gebruik natuurlijker. Je hoeft niet alles uit te typen. Het maakt AI ook toegankelijker voor mensen met een beperking. Let wel op een paar zaken:
- Het model kan een afbeelding verkeerd begrijpen en toch zelfverzekerd antwoorden.
- Foto’s en opnames kunnen privégegevens bevatten, zoals gezichten of adressen.
- Controleer belangrijke uitkomsten, zeker bij medische of juridische vragen.
Zie het als een slimme hulp die veel kan, maar niet alles goed ziet.