Beim multimodalen KI-Benchmark MMMU-Pro (multidisziplinäres Verständnis über Bilder, Diagramme und Abbildungen hinweg) liegen die besten Modelle inzwischen über 80 %. OpenAI meldete im April 2026 81,2 % für GPT-5.5 (ohne Tools), Google im Februar 80,5 % für Gemini 3.1 Pro. Als das ursprüngliche MMMU Ende 2023 erschien, erreichte GPT-4V rund 56 %. MMMU-Pro ist eine schwierigere Fassung von MMMU (veröffentlicht im September 2024), also nicht derselbe Maßstab — trotzdem knacken die Modelle nun auf der schwereren Fassung die 80 %. Die Ära der „reinen Text“-KI ist endgültig vorbei.

Nicht nur die Werte haben sich verändert. Auch die Bauweise verschiebt sich von „zusammengefügt“ zu „nativ“. Früher war es üblich, getrennte Modelle hintereinanderzuschalten: eines für die Transkription, eines für das Denken über den Text, eines für das Vorlesen der Antwort (OpenAI beschreibt den Sprachmodus von ChatGPT vor GPT-4o genau als diese Kette aus drei Modellen). Heute sind Entwürfe verbreitet, bei denen ein Modell mehrere Eingabearten direkt annimmt, und Gemini sowie die Omni-Reihe von Qwen verarbeiten alle vier — Text, Bild, Audio und Video — in einem Modell. Aber nicht alle Anbieter sind diesen Weg gegangen: Stand September 2026 nehmen das Flaggschiffmodell von OpenAI und die Claude-API nur Text und Bilder als Eingabe an; Audio übernimmt bei OpenAI ein eigenes Sprachmodell wie gpt-realtime (siehe Tabelle in §4).

Meine Position vorab: Multimodal ist vom „nice to have“ zum „ohne geht nichts“ geworden. Ein Foto eines Fehlerbildschirms machen und KI das Problem auf der Stelle lösen lassen, einen PDF-Screenshot anfertigen und die Kernpunkte herausziehen, ein YouTube-Video transkribieren und zusammenfassen — das ist 2026 die Basis der KI-Kompetenz. Dieser Artikel behandelt die Definition, den Unterschied zwischen zusammengefügter und nativer Multimodalität, wovon die Stärke in der jeweiligen Modalität technisch abhängt, woran du die Wahl je nach Anwendungsfall festmachst, die Benchmarks und die Fallstricke. Weil er um die Art zu urteilen herum gebaut ist und nicht um die Rangfolge irgendeines Modells, bleibt er über Modellgenerationen hinweg brauchbar.

MULTIMODALE KI · 2026

KI für Text, Bild, Audio und Video

— wie viel davon ein einzelnes Modell annimmt, hängt vom Modell ab

TEXT
Text
Prosa, Code, Symbole
BILD
Bild
Fotos, Diagramme, Screenshots
AUDIO
Audio
Sprache, Musik, Umgebung
VIDEO
Video
Zeit + Bild + Audio

Bei MMMU-Pro liegen die Spitzenmodelle inzwischen im Bereich von 80 % (Herstellerangaben und Quellen in §1).
Die Ära „Bild als Zugabe“ ist vorbei. Aber nur manche — etwa Gemini und die Omni-Reihe von Qwen — nehmen alle vier in einem Modell an; das Flaggschiffmodell von OpenAI und die Claude-API enden beim Bild (Stand September 2026).

1. 2026 hat KI aufgehört, „nur Text“ zu sein — MMMU-Pro knackt 80 %

„Multimodal“ wurde 2024 zum Trendwort, doch die Modelle kurz davor konnten Bilder nur als Beigabe lesen: Als MMMU (multidisziplinäres multimodales Verständnis) Ende 2023 erschien, kam selbst das beste Modell, GPT-4V, nur auf rund 56 %. Der mittlere menschliche Experte (82,6 %) lag bei Bildaufgaben, die Fachwissen erforderten, weit außer Reichweite.

2026 sieht völlig anders aus. Veröffentlichte MMMU-Pro-Werte (die schwierigere Fassung von MMMU):

„80 % zu knacken bedeutet, dass der Benchmark sättigt“ ist die Realität 2026. Die Differenzierung hat sich auf Videoverständnis (Video-MMMU), OCR-lastige Dokumente und gemeinsames audiovisuelles Schlussfolgern verlagert — schwierigeres Terrain. Das öffentliche Leaderboard bei MMMU benchmark erlaubt jedem den Vergleich.

2. Was ist multimodale KI? — KI, die mehr als Text versteht

Definition: „ein KI-Modell, das auch andere Eingaben als Text annimmt (Bilder, Audio, Video usw.)“. Wie weit das reicht, hängt vom Modell ab — von Text plus Bild bis zu Audio und Video in einem einzigen Modell (siehe Begriffskasten unten).

Traditionelle KI war monomodal: GPT-3 verarbeitete Text; Whisper nur Sprache zu Text; Stable Diffusion nur Text zu Bild. Eine Kombination erforderte eine Pipeline, in der die Ausgabe eines Modells in das nächste eingespeist wurde, und an jeder Übergabe ging Information verloren.

Bei multimodaler KI betrachtet ein Modell mehrere Eingaben gleichzeitig und antwortet. Etwa: „Sieh dir die Fehlermeldung in diesem Screenshot (Bild) zusammen mit meiner Frage (Text) an und nenne mir die Ursache“ — erledigt in einem einzigen API-Aufruf.

Terminologie: LMM (Large Multimodal Model) = ein großes Modell mit multimodaler Fähigkeit. VLM (Vision-Language Model) = nur Text + Bild. Omnimodal = Modelle der nächsten Generation, die 4+ Modalitäten vereinen. Zwei Modelle können beide das Etikett „multimodal“ tragen und trotzdem völlig verschiedene Tiere sein — je nachdem, ob sie omnimodal sind oder ein VLM (nur Text + Bild). Wenn du mit Audio oder Video arbeiten willst, prüfe genau diese Unterscheidung, statt in einer Support-Matrix die ◎ zu zählen: VLM-basierte Modelle haben Audio und Video oft nur eingeschränkt.

3. Zusammengefügt vs. nativ — Die architektonische Trennlinie

Wer den Unterschied im Mechanismus versteht, kann die Stärken der Modelle leichter einordnen. Grob gibt es zwei Bauweisen.

Architekturvergleich

Zusammengefügt vs. nativ

① Zusammengefügt
  • Transkription, Denken und Sprachausgabe in getrennten Modellen
  • Die Modelle reichen sich Text weiter
  • Tonfall, mehrere Sprecher und Hintergrundgeräusche gehen unterwegs verloren
  • Jede zusätzliche Stufe kostet Zeit
  • z. B. der Sprachmodus von ChatGPT vor GPT-4o (drei verkettete Modelle)
VS
② Nativ
  • Ein Modell nimmt mehrere Eingaben direkt an
  • Von der Eingabe bis zur Ausgabe im selben Netz
  • Das Modell sieht Tonfall und das Zusammenspiel von Bild und Ton direkt
  • Wenig Informationsverlust durch Übergaben
  • z. B. GPT-4o (Mai 2024), Googles Gemini, die Omni-Reihe von Qwen

Nativ lässt sich „Ton und Bild eines Videos gemeinsam deuten“ — innerhalb eines Modells.
Zusammengefügt schiebt eine Übergabe ein — etwa zuerst Sprache in Text umwandeln — und dort gehen Informationen verloren.

Ein konkretes Beispiel: „Sieh dir ein Kochvideo auf YouTube an und fasse das Rezept zusammen.“ Zusammengefügt: Audio → Whisper zu Text → GPT zum Zusammenfassen; Video → Frames herausziehen → separat analysieren. Viele Schritte. Ein natives Modell, das Video direkt annimmt (etwa Gemini), nimmt die ganze Videodatei und liefert das Rezept in einem einzigen API-Aufruf — und ordnet die gesprochene Erklärung der sichtbaren Handlung im Modell selbst zu.

4. Wovon die Stärke in der jeweiligen Modalität abhängt

„Welches Modell ist das beste?“ wird mit jeder Generation neu beantwortet. Die Spitze bei Video und das beste Sprach-Erlebnis haben in den letzten Jahren im Halbjahrestakt den Besitzer gewechselt. Merken solltest du dir deshalb nicht die Rangfolge, sondern wovon die Stärke in einer Modalität technisch abhängt. Wer das kennt, kann beim nächsten Modell selbst urteilen, statt auf ein Ranking zu warten.

🎬 Was Videoverständnis entscheidet

① Die Sampling-Dichte der Frames (alle wie viel Sekunden wird ein Bild angesehen?) ② ein Kontext, der lange Laufzeiten überhaupt fassen kann ③ zeitliches und kausales Schlussfolgern. Ein einstündiges Video ergibt selbst bei 1 fps 3.600 Bilder — in Tokens gerechnet mehrere Hunderttausend. Video-Leistung und Kontextlänge hängen also zusammen: „Modelle, die bei Video stark sind“, haben ausnahmslos ein großes Fenster.

🎙 Was Sprachdialog entscheidet

① Die Latenz für einen Hin- und Rückweg ② Vollduplex oder nicht (kannst du dazwischenreden, während die KI noch spricht?) ③ der Erhalt von Prosodie und Emotion. Hier zeigt sich der Unterschied zwischen zusammengefügt und nativ aus §3 am deutlichsten: ein Aufbau, der Sprache erst in Text verwandelt und dann verarbeitet, ist prinzipbedingt langsamer und verliert Information.

📄 Was Dokumenten- und UI-Analyse entscheidet

① OCR-Genauigkeit ② der Erhalt des Layouts (bleiben Tabellen, Spaltensatz und Fußnoten intakt?) ③ ob Koordinaten zurückgegeben werden können. ③ wird gern übersehen, ist für Agenten, die einen Bildschirm bedienen sollen, aber entscheidend: Zu wissen, „da ist ein Button“, nützt nichts, solange „wo“ fehlt — anklicken kannst du ihn dann nicht.

🔓 Was bei Open-Weight entscheidet

① Ein echtes omnimodales Modell oder ein Flickwerk aus Einzelmodellen pro Modalität? ② Verfügbarkeit der Gewichte und Lizenz. Auch wo „offen“ draufsteht, sind Lizenzen mit Auflagen für die kommerzielle Nutzung keine Seltenheit. Wenn du selbst betreiben willst, lies das vor den Benchmarks.

Die folgende Tabelle ist unsere grobe Einschätzung mit Stand Mai 2026, gestützt auf das, was die Anbieter zu den unterstützten Eingaben veröffentlicht hatten — keine Benchmark-Messungen. Die Rangfolge ändert sich: Welche Modelle du heute wählen kannst, zeigt die Liste der aktuellen Modelle, den direkten Vergleich findest du im Vergleichsartikel GPT-5.6 Sol vs. Gemini oder in den Modellkarten der Anbieter. Lies die Tabelle hier am besten als Beispiel dafür, wie sich die vier Achsen oben tatsächlich als Unterschied niederschlagen.

ModellTextBildAudioVideoStärke
GPT-5.5◎◎××Liest Text + Bilder; die API nimmt weder Audio noch Video als Eingabe an
Gemini 3.1 Pro◎◎◎◎◎Stark im Videoverständnis, auch bei Langformat-Video
Claude Opus 4.7◎◎××UI-/Dokumenten-Parsing; stark für Agenten-Workloads
Qwen3.5-Omni◎◎◎◎Omnimodal: ein Modell nimmt alle vier Eingaben an. Per API angeboten (Gewichte Stand September 2026 nicht veröffentlicht)
DeepSeek V4-Pro◎×××Nur Text und günstig (Bildeingabe kam ab August 2026 mit der Flash-Reihe)

× = die API nimmt diese Eingabe nicht an (App-Funktionen, die über ein anderes Modell oder eine Transkription laufen, etwa Sprachchat, zählen nicht). Die Unterstützung wurde in Primärquellen geprüft: OpenAIs Modellseite zu GPT-5.5, Googles Modellseite zu Gemini 3.1 Pro, Anthropics Modellseite zu Claude Opus 4.7, der technische Bericht zu Qwen3.5-Omni, das API-Änderungsprotokoll von DeepSeek (abgerufen im September 2026).

Was sich aus dieser Tabelle ablesen lässt, ist: die vier Achsen wirken jeweils für sich:

  • Bei Video öffnet sich der Abstand über die Länge: Video-MME bewertet Videos von 11 Sekunden bis zu einer Stunde in drei Gruppen (kurz, mittel, lang), und alle Modelle auf seiner offiziellen Rangliste schneiden in der langen Gruppe schlechter ab. Bei langen Laufzeiten werden ① Frame-Dichte und ② Kontextlänge zum Flaschenhals. Wenn du ohnehin nur kurze Videos verarbeitest, geht dich die Rangfolge bei Langvideos nichts an
  • Bei Audio entscheidet die Architektur: Schnelle Antworten und gleichzeitig erhaltene Emotion lassen sich weit leichter verbinden, wo Sprache nativ verarbeitet und nicht erst in Text heruntergebrochen wird (eine Transkription bringt eigene Wartezeit und verliert die Betonung). Auch wenn in der Support-Matrix überall „Audio ◎“ steht — geht es über eine Transkription, ist das Erlebnis ein anderes
  • Bei Dokumenten trennt sich die Sache an den Koordinaten: Dass das Lesen von PDFs und UI-Screenshots in Agenten-Setups wie Cursor so geschätzt wird, liegt weniger an der Genauigkeit selbst als daran, ob die Position mitgeliefert wird
  • Bei Open Weight hängt der Wert daran, ob es omnimodal ist: Ein Modell, das alle Modalitäten allein abdeckt, ist im Betrieb ungleich leichter zu handhaben als ein Aufbau, der pro Modalität ein eigenes Modell zusammenschaltet. Und Qualität nahe der kommerziellen Spitze kommt inzwischen zu drastisch niedrigeren Preisen

5. Benchmarks, die zählen — MMMU / Video-MMMU / OCR / Audio

Du wählst das falsche Modell, wenn du nicht weißt, was jeder Benchmark tatsächlich misst. Vier Benchmarks, die man 2026 kennen muss:

Benchmarks × 4

Woran wir multimodale KI messen

① MMMU-Pro
Multidisziplinäres Verständnis aus Bildern + Abbildungen + Diagrammen. Die besten Modelle liegen über 80 %, gleichauf mit dem mittleren menschlichen Experten (80,8 %). Als Unterscheidungsmerkmal bereits schwach.
② Video-MMMU
300 Expertenvideos im Vorlesungsformat + 900 Fragen. Misst, ob ein Modell aus einem Video lernt und das Wissen anwendet – in drei Stufen: Wahrnehmung, Verständnis, Anwendung.
③ DocVQA / OCRBench
Dokumente + Text im Bild. Der Unterschied liegt darin, ob Tabellen, Spalten und Koordinaten unversehrt gelesen werden. Für UI-Parsing, Rechnungen und Formulare zählt dieser Wert mehr als MMMU.
④ AudioBench
Misst, wie gut Audio-Sprachmodelle (AudioLLMs) Gehörtes verstehen: Spracherkennung und -übersetzung, Umgebungsgeräusche sowie Emotion und Sprechermerkmale (über 50 Datensätze im offiziellen Repository). Latenz und Stimmerzeugung misst es nicht – die Geschwindigkeit von Sprachdialogen daher separat prüfen.

„Hohes MMMU = gut in allem“ ist falsch.
Für Video Video-MMMU prüfen; für Dokumente DocVQA; für Audio AudioBench — sonst geht die Auswahl daneben.

6. Nach Anwendungsfall — Woran du es festmachst

Fünf Muster, jeweils mit der Frage „was prüfst du, bevor du dich entscheidest?“. Konkrete Modellnamen nenne ich hier bewusst nicht — dieser Abschnitt wäre sonst in einem halben Jahr veraltet. Stattdessen ein Vorgehen, das bei jedem neuen Modell gleich funktioniert.

  • ① Handy-Foto-Fragen / Diagnose (Foto vom Essen → Nährwerte, Fehlerbildschirm → Lösung, Produktfoto → Suche)
    → Fast alles reicht dafür. Probier zwei kostenlose Pläne aus und nimm das, dessen Antworten dir von der Körnung her besser liegen. Hier ist der Abstand zwischen den Modellen am kleinsten — viel Zeit in die Auswahl zu stecken lohnt sich nicht
  • ② PDF-/Dokumenten-Parsing (Belege, Verträge, technische Spezifikationen, Fachartikel)
    → Teste es mit deinem eigenen Material. Drei Kriterien: Bleiben Tabellen heil? Wird der Spaltensatz in der richtigen Lesereihenfolge verfolgt? Hält das Modell auch bei mies gescannten Seiten durch? Aussagekräftiger als jede OCR-Angabe im Datenblatt ist die schmutzigste Seite, die du hast
  • ③ Video-Transkription und -Zusammenfassung (Meetings, Vorlesungen, YouTube)
    → Hier verzweigt es sich nach der Länge deiner Videos. Bei rund zehn Minuten sind die Unterschiede klein. Wenn du eine ganze Stunde am Stück hineinwirfst, greifen ① Frame-Dichte und ② Kontextlänge aus §4 — dann schaust du dir Video-Benchmarks für Langformat und die Fenstergröße an
  • ④ Sprachkonversation / Dolmetscher / Interview-Training
    → Kläre zuerst, ob nativ verarbeitet wird. „Audio unterstützt“ heißt wenig: Läuft es über eine Transkription, hast du Verzögerung und flache Betonung. Der Test ist einfach — versuch dazwischenzureden, während die KI noch spricht
  • ⑤ Kosten zuerst / Massenverarbeitung
    → Schau nicht nur auf den Stückpreis, sondern auf Batch-Rabatte und darauf, ob Eigenbetrieb realistisch ist. Wenn es Open Weight werden soll, lies vor der Leistung die kommerziellen Bedingungen der Lizenz
Wie man ans Kombinieren herangeht: Statt sich auf eines festzulegen, läuft es stabiler mit einem Hauptmodell plus einem, das dessen Schwachstelle abdeckt. Zwei Pläne der 20-$-Klasse kosten zusammen 40 $ — das liegt kaum über einem einzelnen höheren Tarif. Was du selten brauchst, etwa Video, schiebst du bei Bedarf auf ein kostenloses Kontingent wie Google AI Studio ab. Diese Aufteilungslogik selbst bleibt gleich, egal wie viele Modellgenerationen noch kommen.

7. Harte Grenzen — Nutzen, nicht blind vertrauen

Multimodale KI ist stark, doch drei Grenzen werden dir um die Ohren fliegen, wenn du sie ignorierst.

Grenze ①: Aus Fotos abgeleitete „Vermutungen“ nicht als Fakten lesen

„OCR den Betrag auf diesem Beleg“ zu fragen klingt einfach, aber wenn das Bild niedrig aufgelöst, dunkel oder schief ist, erfindet die KI plausibel klingende Zahlen. Selbst ein Modell mit über 80 % bei MMMU-Pro liegt noch bei fast jeder fünften Antwort daneben. Beträge, Daten, Eigennamen — immer von einem Menschen gegenprüfen lassen. Vor allem in Recht, Finanzen, Gesundheitswesen.

Grenze ②: Video-Genauigkeit fällt in der Mitte ab

Selbst für das Modell an der Spitze der Video-Benchmarks gilt: Informationen aus der Mitte eines einstündigen Videos abzurufen ist schwer — dasselbe „Lost in the Middle“-Problem wie beim Kontextfenster-Thema. Bei Schlüsselsegmenten Zeitstempel angeben: „Analysiere konkret das Segment 30:00–35:00“ liefert deutlich bessere Ergebnisse.

Grenze ③: Audio kämpft mit Dialekten und Fachjargon

Standardenglisch / -japanisch wird genau transkribiert, doch regionale Dialekte, Fachvokabular, Mehrsprecher-Durcheinanderreden und laute Umgebungen erhöhen die Fehler. Für Sitzungsprotokolle und andere kritische Nutzung mit spezialisierten Werkzeugen (Otter.ai, Notta etc.) kombinieren, oder Audio zuerst aufbereiten, bevor es an die KI geht.

Zusammenfassung

Rückblick:

  • 2026: GPT-5.5 und Gemini 3.1 Pro liegen bei MMMU-Pro über 80 % (Angaben der Hersteller; Werte und Quellen in §1). Multimodale KI ist vom „nice to have“ zum „must have“ geworden
  • Die Bauweise verschiebt sich von Ketten getrennter Modelle (zusammengefügt) zu nativen Modellen, die mehrere Eingaben direkt annehmen. Alle vier in einem Modell bieten aber nur Gemini, die Omni-Reihe von Qwen und wenige andere; das Flaggschiffmodell von OpenAI und die Claude-API enden beim Bild (Stand September 2026)
  • Über die Stärke entscheiden vier Achsen: Video = Frame-Dichte und Kontextlänge / Audio = native Verarbeitung oder Umweg über die Transkription / Dokumente = kommen Koordinaten zurück / Open Weight = omnimodal oder nicht, plus Lizenz. Die Rangfolge wechselt, diese Achsen nicht
  • Benchmarks: MMMU-Pro / Video-MMMU / DocVQA / AudioBench — alle vier Achsen vor der Wahl prüfen
  • Bei der Wahl nach Anwendungsfall ist „teste es mit deinem eigenen Material“ der kürzeste Weg. Gerade bei PDFs bringt dich die schmutzigste Seite auf deiner Festplatte schneller weiter als jeder Datenblattwert. Als Kombination ist ein Hauptmodell plus eines, das dessen Schwäche abdeckt, am stabilsten
  • Drei Grenzen: Vermutungen aus minderwertigen Bildern / Genauigkeitsabfall in der Video-Mitte / Dialekt- und Jargon-Audio. Kritische Ausgaben gegenprüfen

2026 schrumpft KI-Arbeit, die sich „nur mit Text“ erledigen lässt, rasant. Handyfotos, Besprechungsaufnahmen, YouTube-Videos, PDFs — sie der KI zu geben, ist inzwischen Alltag (ob ein einzelnes Modell alles annimmt, hängt vom Modell ab). Multimodal nutzen zu können ist keine „nützliche Funktion“ mehr, sondern die Grundlage der KI-Kompetenz 2026. Fang heute damit an, der KI ein Foto von deinem Handy zu geben — das reicht für den Anfang.

FAQ

Q1. Kann ich multimodale KI kostenlos ausprobieren?

Ja. Der kostenlose Plan von ChatGPT (Bildeingabe OK), Google AI Studio (kostenlose Stufe, inkl. Video) und der kostenlose Plan von Claude.ai (Bilder OK) ermöglichen alle den Test. Wichtig: In Google AI Studio und der kostenlosen Stufe der Gemini-API werden Eingaben zur Verbesserung von Google-Produkten genutzt und können von menschlichen Prüfern gelesen werden (Nutzungsbedingungen der Gemini-API). Sensible Bilder und Audiodateien daher nicht hochladen. Aber die Modelle in den kostenlosen Plänen wechseln mit jeder Generation. Statt Modellnamen zu merken, prüfe besser in der Oberfläche jedes Dienstes, welche Eingaben er annimmt (Bild, Audio, Video) und wie viel du pro Tag nutzen kannst. Manche Funktionen, etwa die Limits für Sprachgespräche und lange Videos, werden in kostenpflichtigen Stufen erweitert. Siehe Leitfaden für kostenlose KI-Tools.

Q2. Wie unterscheidet sich Bildgenerierungs-KI von multimodaler KI?

Unterschiedliche Begriffe. Werkzeuge wie Midjourney und Stable Diffusion sind darauf spezialisiert, aus Text Bilder zu generieren — ein einseitiger Text→Bild-Fluss. Multimodale KI bezieht sich auf das Verstehen von Bildern (und anderen Modalitäten) als Eingaben. Manche Dienste wie ChatGPT und Gemini können beides, aber Verstehen und Generieren sind getrennte Fähigkeiten: Wer in einem stark ist, ist es nicht automatisch im anderen — teste beides also getrennt für deinen Einsatzzweck. Siehe Bildgenerierungs-KI-Tools im Vergleich.

Q3. Wie sende ich Video über die API?

Die Gemini-API (die Entwickler-API auf ai.google.dev) nimmt Video direkt an. Für lange oder mehrfach genutzte Videos wird empfohlen, sie mit der Files API hochzuladen und die Referenz zu übergeben; kleine Videos lassen sich direkt in die Anfrage einbetten. Außerdem kannst du eine öffentliche YouTube-URL übergeben oder Cloud-Storage-Dateien bei der Files API registrieren (Entwicklerdokumentation von Google). Über Vertex AI in Google Cloud gibst du in fileData eine Cloud-Storage-URI mit gs:// an (Google-Cloud-Dokumentation). Die APIs von OpenAI und Claude nehmen Stand 26. September 2026 kein Video direkt an (OpenAIs Modellseite zu GPT-6 Astra führt Video als „Not supported“; laut Anthropic nehmen alle aktuellen Modelle Text und Bilder als Eingabe). In beiden Fällen gilt: Frames aus dem Video extrahieren und als Bilder senden — OpenAI zeigt das in seinem offiziellen Cookbook. Siehe Einsteigerleitfaden KI-API.

Q4. Wie steht es um den Datenschutz?

Bilder, Audio und Video enthalten oft sensible Daten. Die Nutzung fürs Training unterscheidet sich zwischen Apps für Privatnutzer und API bzw. Business-Tarifen. Bei den Privat-Apps kann ChatGPT deine Unterhaltungen fürs Training nutzen; das stoppst du, indem du in den Einstellungen „Improve the model for everyone“ ausschaltest (OpenAI-Hilfe). Claude (Free, Pro, Max) nutzt deine Chats fürs Training, wenn du es erlaubst (Anthropic Privacy Center). Die Gemini-Apps nutzen deine Chats — auch über menschliche Prüfung — zur Verbesserung von Google-Diensten, solange „Keep Activity“ an ist; Ausschalten beendet das (Datenschutz-Hub der Gemini-Apps). Dagegen werden die OpenAI-API und ChatGPT Business/Enterprise, die Anthropic-API und Business-Tarife sowie die kostenpflichtige Stufe der Gemini-API standardmäßig nicht fürs Training genutzt (Anthropics Erklärung für Geschäftskunden, Nutzungsbedingungen der Gemini-API). Die Ausnahme: Bei der kostenlosen Stufe der Gemini-API und in Google AI Studio werden Eingaben zur Verbesserung von Google-Produkten genutzt. Für Gesichter, medizinische Bilder oder interne Dokumente eine kostenpflichtige API oder einen Business-Tarif wählen. Für volle Geheimhaltung ein Open-Weight-Modell auf eigener Hardware betreiben (in der Qwen-Familie mit allen Modalitäten ist das die Vorgängergeneration Qwen3-Omni; das neueste Qwen3.5-Omni gibt es nur per API, Gewichte sind Stand September 2026 nicht veröffentlicht).

Q5. Ist multimodal teurer als nur Text?

Bilder und Videos werden über Token-Umrechnung abgerechnet. Ein Bild ≈ einige hundert bis ~1.000 Token (abhängig von Auflösung und Modell); bei Video zählt die Gemini-API in der Standardeinstellung etwa 100 Token pro Sekunde, bei hoher Auflösung etwa 300 (Entwicklerdokumentation von Google, abgerufen im September 2026). Eine Stunde in der Standardeinstellung ergibt 100 × 3.600 s ≈ 360.000 Token. Die Kostentechniken aus KI-Token-Kostenersparnis (nur Auszüge senden, Caching) funktionieren auch für Video.