KI

Cloudflares Clef-omni ordnet auch Ton und Video ein

Cloudflares neues Entscheidungsmodell verarbeitet Text, Bilder, Ton und Video gemeinsam. Die Anwendung erhält Bewertungen fester Antwortmöglichkeiten.

Von Wolfgang

11. Okt. 20264 Min. Lesezeit

Editorial-Illustration eines Mikrofons und einer Kamera mit gemeinsamem digitalen Analysepfad

Eine Nachricht, ein Foto und das Geräusch eines laufenden Geräts können verschiedene Hinweise auf denselben Vorgang liefern. Cloudflare hat am 9. Oktober mit Clef-omni ein KI-Modell vorgestellt, das solche Eingaben gemeinsam auswertet. Neben Text und Bildern verarbeitet es Audio und Video mit Ton. Als Ergebnis liefert es Bewertungen vorgegebener Antwortmöglichkeiten.

Die Erweiterung gehört zur Clef-Familie von Entscheidungsmodellen. Sie ist für Anwendungen gedacht, die einen Eingang einordnen oder einen nächsten Schritt auswählen müssen. Wer etwa kurze Aufnahmen vorsortieren möchte, kann Fragen und zulässige Antworten festlegen und diese zusammen mit den Medien übergeben. Das Modell erzeugt dabei keinen frei formulierten Bericht.

Ton und Bild gelangen in denselben Auswertungsschritt

Bei einer üblichen Verarbeitungskette könnte zunächst Sprache in Text umgewandelt und anschließend dieser Text ausgewertet werden. Bilder kämen womöglich über einen weiteren Schritt hinzu. Clef-omni übernimmt die unterschiedlichen Eingaben in einem Modellaufruf. Laut Cloudflare werden bei Videos Bild und Ton für die gemeinsame Verarbeitung zusammengeführt.

Das eröffnet einen anderen Zugang zu einer Aufnahme. Ein gesprochenes Wort trägt Inhalt, ein Geräusch einen akustischen Hinweis und das Bild einen sichtbaren Zusammenhang. Die Anwendung kann zu jeder dieser Ebenen passende Fragen stellen. Welche Merkmale sie prüfen will, muss sie vorher beschreiben. Eine allgemeine Aufforderung, alles Interessante zu berichten, entspricht nicht dem vorgesehenen Ausgabeprinzip.

Text, Ton und Video mit Ton führen schematisch in Clef-omni und anschließend zu festen Antwortoptionen
Unterschiedliche Eingaben fließen in eine gemeinsame Auswertung mit vorgegebenen Antwortmöglichkeiten. Schematische Darstellung. (Quelle: KI generiert)

Die Fragen bestimmen die Form des Ergebnisses

Die Workers-AI-Dokumentation beschreibt eine Eingabe aus dem zu bewertenden Zustand und einem Schema typisierter Fragen. Für eine Auswahlfrage stehen die erlaubten Kategorien bereits fest. Bei einer Ja-Nein-Frage kommt eine Wahrscheinlichkeit zurück, bei einer geordneten Bewertung ein Wert auf der festgelegten Skala. Die Software kann diese Ergebnisse direkt den ursprünglichen Fragen zuordnen.

Ein fiktiver Anwendungsfall wäre die Vorsortierung kurzer Kundenvideos: Zeigt die Aufnahme das gewünschte Gerät? Ist das gesuchte Bauteil im Bild sichtbar? Enthält sie verständliche Sprache? Die Fragen betreffen verschiedene Hinweise, können aber in derselben Auswertung stehen. Anschließend entscheidet das Programm, ob die Aufnahme weiterverarbeitet oder einer Person zur Prüfung vorgelegt wird.

Gerade bei solchen Abläufen lohnt eine genaue Trennung zwischen Hinweis und Aktion. Eine Bewertung kann die Warteschlange ordnen. Ob eine Aufnahme gelöscht, eine Reklamation abgeschlossen oder ein Vorgang freigegeben wird, bestimmt die Anwendung mit ihren eigenen Regeln und Zuständigkeiten.

Offene Gewichte, anspruchsvoller lokaler Betrieb

Cloudflare bietet das Modell über Workers AI an und veröffentlicht die Gewichte auf Hugging Face unter Apache-2.0. Nach der Modellkarte basiert Clef-omni auf Qwen3-Omni-30B-A3B. Bei dieser Mischung aus spezialisierten Teilnetzen umfasst das Modell insgesamt rund 30 Milliarden Parameter; etwa drei Milliarden werden aktiv verwendet. Die Komponente zur Sprachausgabe gehört nicht zum Entscheidungsweg.

Die offene Bereitstellung erlaubt einen eigenen Betrieb, verlangt aber passende Hardware. Die Modellkarte nennt für die beschriebenen Gewichte im bfloat16-Format einen Speicherbedarf von ungefähr 64 Gigabyte auf der Grafikkarte. Der gehostete Dienst nimmt einen Teil dieser Infrastrukturarbeit ab. Selbstbetrieb kann dagegen dort interessant sein, wo Datenverarbeitung und Betrieb bewusst im eigenen Umfeld bleiben sollen.

Auch die Größe der Eingabe setzt Grenzen. Beim Cloudflare-Dienst teilen sich Fragen, Text und Medien das Kontextfenster von 64.000 Tokens. Videos dürfen nach der aktuellen Dokumentation höchstens 60 Sekunden lang sein und werden mit zwei Bildern pro Sekunde abgetastet. Schnell wechselnde Details verdienen daher besondere Aufmerksamkeit beim Testen mit eigenen Aufnahmen.

Für Nutzer entsteht der Nutzen durch die konkrete Anwendung: passende Fragen, gut erkennbare Aufnahmen und eine sinnvolle Behandlung unsicherer Fälle. Clef-omni liefert dafür einen neuen Baustein, der Bild und Ton gemeinsam in eine begrenzte Entscheidung einbezieht.

Quellen

Für diesen Artikel wurden KI-gestützte Recherche- und Editierwerkzeuge verwendet. Der Inhalt wurde redaktionell geprüft.