Lexikon

Multimodale Suche

Auch: Visuelle Suche, Multimodal Search, Google Lens

Multimodale Suche verbindet verschiedene Eingabeformen wie Text, Bild, Sprache und Video, etwa wenn ein Foto mit einer Frage kombiniert wird.

von Benjamin Kaim Aktualisiert:

Bei der multimodalen Suche kombinieren Nutzer verschiedene Eingaben, zum Beispiel ein Foto und eine Frage dazu. Ein bekanntes Werkzeug ist Google Lens: Laut Google wurde es im Oktober 2024 für fast 20 Milliarden visuelle Suchen pro Monat genutzt. Auch ChatGPT, Gemini und andere Assistenten verstehen inzwischen Bilder, Sprache und Dokumente.

Beispiele für multimodale Suche
EingabeBeispiel
Bild und TextFoto eines Sneakers mit der Frage, wo es ihn günstiger gibt
Sprachegesprochene Frage an einen Assistenten
VideoKamera auf ein Gerät richten und nach der Bedienung fragen
DokumentAngebot hochladen und mit Alternativen vergleichen lassen

Bedeutung für KI-Sichtbarkeit

Wer über Bilder gefunden werden will, braucht eindeutige Produktfotos, aussagekräftige Dateinamen und Alternativtexte sowie Produktdaten mit strukturierten Daten. Videos mit klaren Titeln und Beschreibungen helfen ebenfalls, siehe YouTube und KI-Sichtbarkeit.

Häufige Fragen

Gilt das nur für Onlineshops?

Nein. Auch lokale Anbieter, Hersteller und Dienstleister werden über Fotos gesucht, etwa von Gebäuden, Geräten oder Schäden.

Brauchen Bilder besondere Kennzeichnungen für KI?

Nein, aber gute Alternativtexte, passende Bildunterschriften und Produktdaten erleichtern die Zuordnung.