AI 6 min

Wat is multimodale AI en wat kan het?

Kort antwoord

Multimodale AI is kunstmatige intelligentie die meerdere soorten data tegelijk kan begrijpen en combineren, zoals tekst, afbeeldingen, audio en video, in plaats van zich te beperken tot alleen tekst. Een multimodaal model kan bijvoorbeeld een foto van een factuur analyseren en er in gewone taal een vraag over beantwoorden, of een gesproken vraag beantwoorden met zowel tekst als een gegenereerde afbeelding. Bekende voorbeelden zijn GPT-4o, Gemini en Claude, die allemaal tekst en afbeeldingen kunnen combineren.

Multimodale AI kan meerdere soorten input tegelijk verwerken, zoals tekst, afbeeldingen, audio en video, in plaats van alleen tekst.

De eerste generatie populaire AI-modellen kon alleen tekst lezen en schrijven. Wilde je een foto laten analyseren, dan had je een apart, gespecialiseerd beeldherkenningsmodel nodig. Multimodale AI maakt dat onderscheid overbodig door meerdere soorten data in één model te combineren.

Wat “modaliteit” betekent

Een modaliteit is simpelweg een type of vorm van data: tekst, een afbeelding, een geluidsopname, een video. Een “unimodaal” model, zoals de eerste versies van ChatGPT, verwerkt maar één modaliteit: tekst in, tekst uit. Een multimodaal model kan meerdere modaliteiten tegelijk begrijpen en met elkaar in verband brengen.

Het verschil is meer dan alleen “meerdere functies in één model.” Een multimodaal model begrijpt de relatie tussen modaliteiten: het ziet dat een specifiek stuk tekst op een foto verwijst naar het bedrag op een factuur, of dat een gesproken zin verwijst naar iets wat eerder in een document staat. Die onderlinge verbinding maakt de output veel bruikbaarder dan losse tools die elk apart werken.

Hoe multimodale modellen werken

Onder de motorkap wordt elke modaliteit omgezet naar een gemeenschappelijke wiskundige representatie, vergelijkbaar met een embedding. Een afbeelding wordt niet als plaatje verwerkt, maar als een reeks getallen die de inhoud van die afbeelding vastleggen. Tekst wordt op vergelijkbare wijze omgezet. Omdat beide in dezelfde soort wiskundige ruimte terechtkomen, kan het model ze met elkaar combineren en er gezamenlijk conclusies uit trekken.

Dit is de reden waarom je een multimodaal model een foto van een handgeschreven notitie kunt geven samen met de tekstuele vraag “wat staat hier?”, en een samenhangend antwoord terugkrijgt in plaats van twee losse verwerkingen.

Praktische toepassingen voor bedrijven

Voor MKB-bedrijven levert multimodale AI concrete tijdsbesparing op bij taken die voorheen handmatig werk vereisten:

  • Documentverwerking: gescande facturen, bonnetjes en contracten, inclusief handgeschreven aantekeningen, automatisch uitlezen en in gestructureerde data omzetten.
  • Kwaliteitscontrole: foto’s van producten of installaties beoordelen op afwijkingen, zonder dat iemand handmatig elke foto hoeft te bekijken.
  • Vergaderverslagen: audio-opnames transcriberen, samenvatten en koppelen aan actiepunten, inclusief het herkennen van wie wat zei.
  • Klantenservice: een klant stuurt een foto van een defect product mee, en het systeem herkent direct om welk probleem het waarschijnlijk gaat.

Deze toepassingen combineren vaak meerdere modaliteiten in één workflow, bijvoorbeeld een foto plus een korte tekstuele beschrijving van het probleem, wat de nauwkeurigheid van het antwoord aanzienlijk verhoogt vergeleken met tekst alleen.

Bekende multimodale modellen

De grote AI-providers hebben hun vlaggenschipmodellen inmiddels allemaal multimodaal gemaakt. GPT-4o van OpenAI, Gemini van Google en Claude van Anthropic kunnen alle drie tekst en afbeeldingen combineren, en sommige varianten verwerken ook audio en video. Ze verschillen in hoe goed ze specifieke taken uitvoeren, zoals het lezen van tabellen in een gescand document of het herkennen van objecten in een foto, dus het testen op jouw specifieke use case blijft nodig, net als bij de keuze van een regulier large language model.

Niet elk multimodaal model kan ook zelf afbeeldingen of audio genereren; sommige zijn vooral sterk in het begrijpen van meerdere modaliteiten als input, terwijl de output nog steeds alleen tekst is. Check dit bij de modelkeuze als generatie van beeld of audio een vereiste is.

Onze tip: heb je processen waarin nu handmatig foto’s, scans of audio-opnames worden beoordeeld, bijvoorbeeld een postkamer die facturen uitleest of een supportteam dat foto’s van klanten beoordeelt, dan is dat vaak de snelste plek om multimodale AI concreet te testen. De tijdsbesparing is daar direct meetbaar, in tegenstelling tot minder tastbare toepassingen.

Veelgestelde vragen

Wat is het verschil tussen multimodale AI en een gewoon taalmodel?

Een regulier taalmodel (LLM) is getraind om alleen tekst te verwerken: het krijgt tekst als input en genereert tekst als output. Een multimodaal model is getraind om meerdere soorten data te begrijpen en met elkaar te combineren, bijvoorbeeld een afbeelding samen met een tekstvraag, of gesproken audio samen met context uit een document. Het model kan hierdoor taken uitvoeren die met tekst alleen onmogelijk zijn, zoals het beschrijven van wat er op een foto staat of het transcriberen en samenvatten van een gesprek.

Welke praktische toepassingen heeft multimodale AI voor bedrijven?

Veelvoorkomende toepassingen zijn het automatisch uitlezen van gescande facturen en bonnetjes inclusief handgeschreven notities, kwaliteitscontrole op basis van foto's van producten, het transcriberen en samenvatten van vergaderingen inclusief sprekersherkenning, en klantenservice waarbij een klant een foto van een kapot product kan opsturen en direct een diagnose krijgt. Deze toepassingen vervangen vaak handmatig, tijdrovend werk dat eerder aparte, gespecialiseerde software vereiste.

Kunnen multimodale modellen ook zelf afbeeldingen of audio genereren?

Sommige multimodale modellen kunnen naast tekst ook afbeeldingen genereren als output, zoals DALL-E en Gemini. Andere modellen zijn vooral sterk in het begrijpen van meerdere modaliteiten als input, maar genereren alleen tekst als output. Het is dus belangrijk om bij de keuze van een model te kijken naar welke combinatie van input- en output-modaliteiten je daadwerkelijk nodig hebt, in plaats van aan te nemen dat 'multimodaal' altijd hetzelfde betekent.

Is multimodale AI hetzelfde als edge AI of on-device AI?

Nee, dit zijn losse begrippen die soms samen voorkomen. Multimodale AI gaat over welke soorten data een model kan verwerken (tekst, beeld, audio, video). Edge AI gaat over waar een model draait, namelijk lokaal op een apparaat in plaats van in de cloud. Er bestaan multimodale modellen die in de cloud draaien en ook kleinere multimodale modellen die lokaal op een telefoon of camera draaien, dus de twee eigenschappen staan los van elkaar.

Hier over sparren?

Plan een vrijblijvend gesprek. We luisteren mee, schetsen een aanpak en geven een eerlijk beeld van wat haalbaar is, zonder verkoopdruk.