Eine Nachricht, ein Foto und das Geräusch eines laufenden Geräts können verschiedene Hinweise auf denselben Vorgang liefern. Cloudflare hat am 9. Oktober mit Clef-omni ein KI-Modell vorgestellt, das solche Eingaben gemeinsam auswertet. Neben Text und Bildern verarbeitet es Audio und Video mit Ton. Als Ergebnis liefert es Bewertungen vorgegebener Antwortmöglichkeiten.
Die Erweiterung gehört zur Clef-Familie von Entscheidungsmodellen. Sie ist für Anwendungen gedacht, die einen Eingang einordnen oder einen nächsten Schritt auswählen müssen. Wer etwa kurze Aufnahmen vorsortieren möchte, kann Fragen und zulässige Antworten festlegen und diese zusammen mit den Medien übergeben. Das Modell erzeugt dabei keinen frei formulierten Bericht.
Ton und Bild gelangen in denselben Auswertungsschritt
Bei einer üblichen Verarbeitungskette könnte zunächst Sprache in Text umgewandelt und anschließend dieser Text ausgewertet werden. Bilder kämen womöglich über einen weiteren Schritt hinzu. Clef-omni übernimmt die unterschiedlichen Eingaben in einem Modellaufruf. Laut Cloudflare werden bei Videos Bild und Ton für die gemeinsame Verarbeitung zusammengeführt.
Das eröffnet einen anderen Zugang zu einer Aufnahme. Ein gesprochenes Wort trägt Inhalt, ein Geräusch einen akustischen Hinweis und das Bild einen sichtbaren Zusammenhang. Die Anwendung kann zu jeder dieser Ebenen passende Fragen stellen. Welche Merkmale sie prüfen will, muss sie vorher beschreiben. Eine allgemeine Aufforderung, alles Interessante zu berichten, entspricht nicht dem vorgesehenen Ausgabeprinzip.

Die Fragen bestimmen die Form des Ergebnisses
Die Workers-AI-Dokumentation beschreibt eine Eingabe aus dem zu bewertenden Zustand und einem Schema typisierter Fragen. Für eine Auswahlfrage stehen die erlaubten Kategorien bereits fest. Bei einer Ja-Nein-Frage kommt eine Wahrscheinlichkeit zurück, bei einer geordneten Bewertung ein Wert auf der festgelegten Skala. Die Software kann diese Ergebnisse direkt den ursprünglichen Fragen zuordnen.
Ein fiktiver Anwendungsfall wäre die Vorsortierung kurzer Kundenvideos: Zeigt die Aufnahme das gewünschte Gerät? Ist das gesuchte Bauteil im Bild sichtbar? Enthält sie verständliche Sprache? Die Fragen betreffen verschiedene Hinweise, können aber in derselben Auswertung stehen. Anschließend entscheidet das Programm, ob die Aufnahme weiterverarbeitet oder einer Person zur Prüfung vorgelegt wird.
Gerade bei solchen Abläufen lohnt eine genaue Trennung zwischen Hinweis und Aktion. Eine Bewertung kann die Warteschlange ordnen. Ob eine Aufnahme gelöscht, eine Reklamation abgeschlossen oder ein Vorgang freigegeben wird, bestimmt die Anwendung mit ihren eigenen Regeln und Zuständigkeiten.
Offene Gewichte, anspruchsvoller lokaler Betrieb
Cloudflare bietet das Modell über Workers AI an und veröffentlicht die Gewichte auf Hugging Face unter Apache-2.0. Nach der Modellkarte basiert Clef-omni auf Qwen3-Omni-30B-A3B. Bei dieser Mischung aus spezialisierten Teilnetzen umfasst das Modell insgesamt rund 30 Milliarden Parameter; etwa drei Milliarden werden aktiv verwendet. Die Komponente zur Sprachausgabe gehört nicht zum Entscheidungsweg.
Die offene Bereitstellung erlaubt einen eigenen Betrieb, verlangt aber passende Hardware. Die Modellkarte nennt für die beschriebenen Gewichte im bfloat16-Format einen Speicherbedarf von ungefähr 64 Gigabyte auf der Grafikkarte. Der gehostete Dienst nimmt einen Teil dieser Infrastrukturarbeit ab. Selbstbetrieb kann dagegen dort interessant sein, wo Datenverarbeitung und Betrieb bewusst im eigenen Umfeld bleiben sollen.
Auch die Größe der Eingabe setzt Grenzen. Beim Cloudflare-Dienst teilen sich Fragen, Text und Medien das Kontextfenster von 64.000 Tokens. Videos dürfen nach der aktuellen Dokumentation höchstens 60 Sekunden lang sein und werden mit zwei Bildern pro Sekunde abgetastet. Schnell wechselnde Details verdienen daher besondere Aufmerksamkeit beim Testen mit eigenen Aufnahmen.
Für Nutzer entsteht der Nutzen durch die konkrete Anwendung: passende Fragen, gut erkennbare Aufnahmen und eine sinnvolle Behandlung unsicherer Fälle. Clef-omni liefert dafür einen neuen Baustein, der Bild und Ton gemeinsam in eine begrenzte Entscheidung einbezieht.
Quellen
- Cloudflare: Introducing Clef-omni with full multimodality, plus a faster Clef and a cheaper Clef-flash (2026-10-09).
- Cloudflare: clef-omni – Workers AI documentation; Abruf 11.10.2026.
- Cloudflare / Hugging Face: Cloudflare/clef-omni model card; Abruf 11.10.2026.
Für diesen Artikel wurden KI-gestützte Recherche- und Editierwerkzeuge verwendet. Der Inhalt wurde redaktionell geprüft.