# Cloudflare veröffentlicht offene Entscheidungsmodelle Clef und Clef-Flash für schnelles Agenten-Routing

Source: TechNewsList (https://technewslist.com)
Canonical URL: https://technewslist.com/de/article/cloudflare-releases-clef-decision-models-routing-2026-10-09-night-de
Section: AI (https://technewslist.com/de/ai)
Author: TechNewsList
Language: de
Published: 2026-10-09T19:05:08.737+00:00
Updated: 2026-10-09T19:05:08.969128+00:00

> Cloudflare hat Clef und Clef-flash unter der Apache 2.0-Lizenz eingeführt und liefert offene Entscheidungsmodelle mit 27B- und 9B-Parametern, die nur eine Wahrscheinlichkeitsbewertung im Voraus ausfüllen, um den generativen Token-Overhead in KI-Agenten-Workflows zu eliminieren.

## TL;DR
- Cloudflare hat die Entscheidungsmodellfamilie Clef und Clef-Flash unter der Open-Source-Apache-2.0-Lizenz auf Hugging Face veröffentlicht.
- Die Modelle lassen sich auf 27 Milliarden und 9 Milliarden Parameter skalieren und wurden speziell für Klassifizierungs- und Routing-Entscheidungen entwickelt.
- Arbeitet mit einer reinen Vorausfüllungsbewertung und berechnet Wahrscheinlichkeitsverteilungen über Kandidatenpfade, ohne Textausgabetokens zu generieren.
- Reduziert die Latenz bei der Agenten-Orchestrierung um bis zu 80 Prozent im Vergleich zu allgemeinen Gesprächsbasismodellen.

## Key points
- Behebt die Rechen- und Latenzengpässe von Multi-Agent-Architekturen, die für das grundlegende Routing auf Large-Frontier-Modellen basieren.
- Bietet völlig unbelastete offene Gewichte auf Hugging Face für lokale Edge-Inferenz, private Cloud-VPCs und lokale Cluster.
- Die Spezialschulung konzentriert sich auf die Auswahl deterministischer Tools, die Kontexttriage, das Parsen von Absichten und das Sicherheits-Gating für Agent-Pipelines.
- Eliminiert die Kosten für die Generierung von Ausgabe-Token, indem Token-Darstellungen direkt gelesen und diskrete Wahrscheinlichkeitsprotokolle ausgegeben werden.
- Beschleunigt die Einführung der Agentenautomatisierung in Unternehmen, indem die Einheitsökonomie bei hochvolumigen automatisierten Arbeitsabläufen gesenkt wird.

## Was passiert ist

Anfang Oktober 2026 veröffentlichte der führende Web-Infrastruktur- und Cybersicherheitsanbieter Cloudflare offiziell Clef und Clef-flash, eine Familie spezialisierter Open-Weight-Entscheidungsmodelle, die unter Apache 2.0 lizenziert sind. Die Modelle wurden speziell für den strukturierten Kontrollfluss, die Absichtsklassifizierung und den Tool-Versand innerhalb autonomer Agenten-Workflows entwickelt und stellen eine radikale Abkehr von herkömmlichen Konversationsmodellen für große Sprachen dar. Anstatt Sequenzen von Textzeichen zu generieren, um eine Aktion anzuzeigen, fungiert Clef als dedizierter Klassifikator, der Eingaben auswertet und genaue Wahrscheinlichkeitswerte für vordefinierte Aktionen ausgibt.

Die Version umfasst zwei unterschiedliche Konfigurationen: Clef, ein Basismodell mit 27 Milliarden Parametern, das für maximale Kategorisierungsgenauigkeit in komplexen Agentendiagrammen optimiert ist, und Clef-Flash, eine destillierte Variante mit 9 Milliarden Parametern, die für die Ausführung mit extrem geringer Latenz auf Edge-Knoten und lokalen Entwickler-Workstations entwickelt wurde. Cloudflare stellte die vollständigen Modellprüfpunkte und Konfigurationsdateien auf dem Hugging Face Hub zur Verfügung, sodass Unternehmensentwickler die Modelle ohne proprietäre Cloud-Sperre oder wiederkehrende API-Zugriffsgebühren bereitstellen konnten.

Chief Executive Officer Matthew Prince betonte, dass die autonome Softwareentwicklung einen Wendepunkt erreicht habe, an dem die generative Generierung aktiv kontraproduktiv für das interne Routing sei. Indem Entwickler Zwischenentscheidungen – etwa ob eine Benutzeranfrage eine Datenbankabfrage, Codeausführung oder Ticketerstellung erfordert – auf spezialisierte Entscheidungsmodelle verlagern, können sie teure Grenzbegründungsmodelle für komplexe intellektuelle Synthesen beibehalten.

## Warum es wichtig ist

Der architektonische Aufstieg von Agenten-KI-Systemen hat zu einer unhaltbaren Latenz und einem Kostenaufwand bei der Entwicklung von Unternehmenssoftware geführt. In modernen Multi-Agent-Systemen ruft ein Orchestrator oft Dutzende Male ein Grenzmodell mit mehreren Hundert Milliarden Parametern auf, nur um die Absicht zu analysieren, ein API-Tool auszuwählen, Zwischenausgaben auszuwerten und Beendigungskriterien zu bestimmen. Jeder Aufruf erfordert sofortiges Parsing, Token-Generierung und Netzwerk-Roundtrips, was dazu führt, dass einfache automatisierte Aufgaben mehrere zehn Sekunden dauern und mehrere Dollar an API-Credits kosten.

![Die Führungsrolle von Cloudflare demonstriert verteilte Routing-Protokolle, Edge-Computing-Leistung und Entwickler-Tool-Ökosysteme](https://rkhynbcsbnkkcwgexzwg.supabase.co/storage/v1/object/public/media/api/1791567027698-f97fbs-cloudflare-releases-clef-decision-models-routing-2026-10-09-night-inside-1-6ed0e98fe3.webp "Cloudflare leadership demonstrates distributed routing protocols, edge compute performance, and developer tool ecosystems.")

Clef ändert diese Dynamik grundlegend, indem es eine Entscheidungsbewertung nur im Vorfeld einführt. Da das Modell die autoregressive Token-Generierung vollständig überspringt, berechnet es kategoriale Wahrscheinlichkeiten in einem einzigen Vorwärtsdurchlauf über die Eingabeaufforderung. Bei Produktions-Benchmarks verarbeitet Clef-Flash komplexe Werkzeugversandentscheidungen in weniger als zwanzig Millisekunden auf Standard-Beschleunigerhardware für Unternehmen – eine Verbesserung von etwa 80 Prozent im Vergleich zur Eingabe eines Allzweckmodells.

Aus Sicherheits- und Compliance-Sicht ermöglicht die Veröffentlichung unter Apache 2.0 den Risikoteams von Unternehmen, Agent-Routing auf einer souveränen privaten Cloud-Infrastruktur auszuführen. Kritische Unternehmensanwendungen im Gesundheitswesen, in der Verteidigung und im Bankwesen können lokale Absichtsfilterung und Sicherheitsleitplanken ausführen, bevor jemals eine externe API aufgerufen wird. Diese Architektur verhindert, dass sich Prompt-Injection-Angriffe über Agentenschwärme ausbreiten, indem sie Zwischenkontrollentscheidungen lokal validiert.

## Technische Details

Die Kerninnovation der Clef-Modellfamilie liegt in ihrem reinen Vorfüll-Klassifizierungskopf. Traditionelle große Sprachmodelle generieren Token nacheinander: Das Modell verarbeitet Eingabe-Token, berechnet eine interne verborgene Darstellung, projiziert in eine Vokabularverteilung und tastet iterativ das nächste Token ab. Clef modifiziert diese Pipeline, indem er die Vokabularprojektionsschicht durch einen kalibrierten Entscheidungskopf ersetzt, der auf Multitask-Klassifizierungsverluste trainiert ist.

Wenn eine Eingabeaufforderung angezeigt wird, die eine Benutzerabfrage, verfügbare Tools und den Konversationsstatus enthält, kodiert Clef den Kontext und extrahiert die endgültige Token-Einbettung. Der Entscheidungsleiter ordnet diese Darstellung in Logit-Scores entsprechend diskreter Optionen um: Auswahl spezifischer Tools, Signalisierung von Klärungsbedarf oder Weiterleitung an bestimmte Arbeitsagenten. Da keine Text-Token generiert werden, bleiben die Anforderungen an den Inferenzspeicher konstant und vorhersehbar, wodurch eine Aufblähung des Schlüsselwert-Cache während der Zwischenschritte der Argumentation vollständig vermieden wird.

![Cybersicherheitsingenieure und Systemforscher bewerten deterministische Routing-Kontrollen und Latenzreduzierung für automatisierte Netzwerke](https://rkhynbcsbnkkcwgexzwg.supabase.co/storage/v1/object/public/media/api/1791567031193-90922r-cloudflare-releases-clef-decision-models-routing-2026-10-09-night-inside-2-ec7cdf3851.webp "Cybersecurity engineers and systems researchers evaluate deterministic routing controls and latency reduction for automated networks.")

Das Clef-Modell mit 27 Milliarden Parametern wurde auf einem kuratierten Korpus von über vierhundert Millionen Multi-Turn-Agentenausführungsspuren, Werkzeugaufrufschemata und synthetischen Entscheidungsbäumen trainiert. Beim Training wurde die Grenzkalibrierung priorisiert, um sicherzustellen, dass die Konfidenzwahrscheinlichkeiten die Klassifizierungsunsicherheit genau widerspiegeln. Wenn Clef mehrere Tools genau bewertet, können Orchestratoren programmgesteuert auf größere Argumentationsmodelle zurückgreifen und so robuste hierarchische Kaskaden erstellen.

## Auswirkungen auf Markt und Branche

Die Veröffentlichung von Clef signalisiert eine umfassendere Architekturmigration im Bereich der künstlichen Intelligenz von monolithischen Grundmodellen hin zu heterogenen, geschichteten Agententopologien. Anstatt zu erwarten, dass ein einziges massives Modell gleichzeitig als Planer, Klassifizierer, Router und Schreiber fungiert, setzen Produktionstechnikteams auf modulare Architekturen, in denen spezialisierte kleinere Netzwerke Hochfrequenzsteuerungsaufgaben übernehmen.

Dieser Wandel stellt die kommerzielle Dominanz von Anbietern geschlossener Grenzmodelle in Frage. Hyperscaler verlassen sich stark auf tokenbasierte Preise und profitieren davon, wenn Unternehmensentwickler Dutzende von Zwischen-API-Aufrufen pro Benutzertransaktion durchführen. Durch die Open-Source-Lösung hochpräziser Routing-Modelle, die lokal auf einem Unternehmensserver oder Cloudflare Workers-Edge-Knoten ausgeführt werden können, hilft Cloudflare Entwicklern, das Volumen ausgehender API-Aufrufe um 40 bis 60 Prozent zu reduzieren.

Konkurrenzfähige Software-Ökosysteme, darunter Frameworks wie LangChain, AutoGen und CrewAI, integrieren bereits native Adapter für Clef. Plattform-Engineering-Teams berichten, dass durch das Ersetzen von Clef in Produktions-Triage-Pipelines die brüchigen JSON-Parsing-Fehler und Formatierungshalluzinationen, die häufig auftreten, wenn generative Modelle dazu überredet werden, als deterministische Router zu fungieren, weitgehend beseitigt werden.

## Worauf man als Nächstes achten sollte

In den kommenden Monaten wird sich die Aufmerksamkeit der Entwickler darauf konzentrieren, wie effektiv die Open-Source-Community Clef für domänenspezifische Tool-Ökosysteme optimiert. Von Framework-Autoren wird erwartet, dass sie spezielle Feinabstimmungen veröffentlichen, die auf Softwareentwicklungs-Workflows, SQL-Datenbankoperationen und Kundenbeziehungsmanagementsysteme zugeschnitten sind.

Eine weitere wichtige Kennzahl, die es zu verfolgen gilt, wird die kommerzielle Integration von Clef durch Cloudflare in seine serverlose Computing-Plattform Workers AI sein. Wenn Cloudflare in seinem globalen Edge-Netzwerk eine Entscheidungsinferenz in einer Millisekunde ermöglicht, könnten Entwickler global verteilte Agentennetzwerke aufbauen, die Routing-Logik am Netzwerkperimeter ausführen, bevor sie Anforderungen an Backend-Datenspeicher weiterleiten.

Schließlich werden Branchenbeobachter beobachten, ob konkurrierende Cloud-Anbieter und KI-Forschungslabore dem Beispiel von Cloudflare folgen und ihre eigenen Entscheidungsmodelle mit offener Gewichtung veröffentlichen. Mit zunehmender Unternehmensautomatisierung wird die Grenze zwischen generativer Synthese und deterministischer Entscheidungsfindung zum wichtigsten Schlachtfeld in der KI-Infrastruktur von Unternehmen.

## Quellen

- [Cloudflare-Blog](https://blog.cloudflare.com/clef-decision-models/)– Offizielle Ankündigung der Open-Weight-Entscheidungsmodelle Clef 27B und Clef-flash 9B, die unter der Apache 2.0-Lizenz veröffentlicht wurden.
- [Umarmender Gesichtshub](https://huggingface.co/cloudflare/clef-27b)- Modellgewichtungskarte, technische Architekturspezifikationen, Tokenizer-Konfigurationen und Bereitstellungsrichtlinien.
- [InfoQ-Technologie-News](https://www.infoq.com/news/2026/10/cloudflare-clef-decision-models/)- Unabhängige Software-Architekturanalyse, die die Vorteile der reinen Vorab-Klassifizierung für Multi-Agenten-Systeme detailliert beschreibt.

Mentions: Wolkenflare, Matthew Prince, Umarmendes Gesicht, TypeSafe KI

## Sources
- [Cloudflare-Blog](https://blog.cloudflare.com/clef-decision-models/)
- [Umarmender Gesichtshub](https://huggingface.co/cloudflare/clef-27b)
- [InfoQ-Technologie-News](https://www.infoq.com/news/2026/10/cloudflare-clef-decision-models/)