Multimodales Modell
multimodal · vision-language model · VLM
Kurz gesagt
Ein multimodales Modell kann mehr als eine Art von Eingabe in derselben Anfrage verarbeiten, am häufigsten Text zusammen mit Bildern und zunehmend auch Audio und Video. Nicht-Text-Eingaben werden in dieselbe interne Darstellung wie Tokens umgewandelt, weshalb ein einzelnes Bild einen erheblichen Teil des Kontextfensters beanspruchen kann.
Ein multimodales Modell verarbeitet Anfragen mit verschiedenen Eingabetypen in einer einzigen Anfrage – sei es die Abfrage eines Diagramms, die Transkription und Beantwortung von Audio oder das Lesen eines Screenshots einer Fehlermeldung.
Mechanisch wird die nicht-textuelle Eingabe durch einen Encoder geleitet, der Vektoren im selben Raum erzeugt, den das Sprachmodell verarbeitet. Aus Sicht des Modells gibt es eine einzige Sequenz; das Bild erscheint einfach als Block von Positionen darin.
Das hat eine direkte praktische Konsequenz: Bilder verbrauchen Kontextbudget. Ein hochauflösender Screenshot kann genauso viel vom Kontextfenster beanspruchen wie mehrere Textseiten und kostet genauso viel in der Abrechnung. Das Herunterskalieren vor dem Senden ist in der Regel eine kostenlose, genauigkeitsneutrale Einsparung für Aufgaben, die nicht von feinen Details abhängen.
Die Fähigkeiten sind ungleichmäßig ausgeprägt und es lohnt sich, diese zu testen, anstatt Annahmen zu treffen. Das Lesen von Text in einem Bild, das Beschreiben einer Szene und das Interpretieren eines Diagramms sind unterschiedliche Fähigkeiten mit unterschiedlicher Zuverlässigkeit. Dichte Tabellen, Handschrift und Diagramme, bei denen die Antwort von einem präzisen Wertvergleich abhängt, bleiben die Schwachstellen – das Modell kann eine selbstbewusste Zahl liefern, die einfach falsch gelesen wurde.
Häufige Fragen
- Wie viel des Kontextfensters verbraucht ein Bild?
- Es hängt von der Auflösung und dem Kodierungsschema des Anbieters ab, aber ein Vollbild-Screenshot kostet üblicherweise etwa tausend Token oder mehr. Überprüfen Sie die Formel des Anbieters, bevor Sie Bilder in großen Mengen senden.
- Können multimodale Modelle Bilder genauso gut generieren wie lesen?
- Lesen und Generieren sind getrennte Fähigkeiten. Viele Modelle akzeptieren Bilder als Eingabe, während sie nur Text ausgeben; Bilderzeugung ist oft ein eigenständiges Modell, das manchmal als Werkzeug aufgerufen wird.