Zum Inhalt springen
sw
en

Tippe um zu suchen

KI entwickeln

Cloudflare Workers AI, AI Gateway und Vectorize

KI-Inferenz, Provider-Gateway und Vektorsuche im selben Edge-Netzwerk kombinieren - mit konkretem Beispiel fuer eine RAG-Integration im Cloudflare-Stack.

9 Min Lesezeit Fortgeschritten Zuletzt aktualisiert:

Drei Bausteine, ein Stack

Wer schon mit Workers, D1 und dem Cloudflare-Stack arbeitet, stolpert frueher oder spaeter ueber drei zusammenhaengende Produkte: Workers AI fuehrt KI-Modelle direkt im Cloudflare-Netzwerk aus, das AI Gateway legt sich als Kontrollschicht vor beliebige KI-Anbieter (auch externe wie OpenAI oder Anthropic), und Vectorize ist Cloudflares eigene Vektor-Datenbank fuer Aehnlichkeitssuche. Zusammen ergeben sie eine Plattform, mit der sich ein komplettes RAG-System bauen laesst, ohne dass eine einzige Anfrage das Cloudflare-Netzwerk verlassen muss.

Der Reiz liegt nicht darin, dass eines dieser drei Produkte das jeweils beste seiner Kategorie waere - dedizierte GPU-Anbieter sind bei grossen Modellen oft schneller, spezialisierte Vektor-DBs wie Qdrant bieten mehr Filtertiefe (siehe Vektor-Datenbanken im Vergleich). Der Reiz liegt darin, dass alle drei im selben Billing, demselben Dashboard und demselben Netzwerk leben - kein zusaetzlicher Vertrag, keine zusaetzliche Latenz durch einen Umweg zu einem fremden Rechenzentrum.

Workers AI: Inferenz am Edge

Workers AI ist eine serverlose Plattform, die Machine-Learning-Modelle auf Cloudflares globalem GPU-Netzwerk ausfuehrt. Statt eine GPU-Instanz zu mieten und zu betreiben, rufst du ein Modell per API auf - Cloudflare kuemmert sich um Hosting, Skalierung und Verteilung auf die naechstgelegene Rechenkapazitaet.

Das Angebot umfasst (Stand: 2026-07) ueber 50 quelloffene Modelle aus mehreren Kategorien:

KategorieBeispieleTypischer Einsatz
Textgenerierung (LLM)Llama-Familie, Mistral, spezialisierte Chat-ModelleChatbots, Zusammenfassungen, Klassifikation
Text-EmbeddingsBGE-Modelle (base/small/large)Vektorsuche, RAG-Indexierung
BildgenerierungFLUX, Stable DiffusionBildgenerierung aus Text-Prompts
BildanalyseResNet, Object-Detection-ModelleBildklassifikation, Objekterkennung
AudioWhisper (Transkription)Speech-to-Text
Uebersetzung / ModerationdiverseSprachuebersetzung, Content-Filterung

Der Aufruf aus einem Worker heraus laeuft ueber die AI-Bindung, die du in der wrangler.jsonc konfigurierst:

// wrangler.jsonc - AI-Binding hinzufuegen
{
  "ai": {
    "binding": "AI"
  }
}
// Worker: Textgenerierung mit einem Llama-Modell
export default {
  async fetch(request, env) {
    const antwort = await env.AI.run("@cf/meta/llama-3.1-8b-instruct", {
      messages: [
        { role: "system", content: "Du bist ein knapper, hilfreicher Assistent." },
        { role: "user", content: "Erklaer mir kurz, was ein Edge-Netzwerk ist." },
      ],
    });

    return Response.json(antwort);
  },
};

Modellnamen folgen dem Schema @cf/anbieter/modellname, z.B. @cf/meta/llama-3.1-8b-instruct oder @cf/baai/bge-base-en-v1.5 fuer Embeddings. Welches Modell aktuell empfohlen wird, aendert sich haeufig - die Model-Katalog-Seite zeigt immer den aktuellen Stand inklusive Kontextfenster-Groesse und unterstuetzten Faehigkeiten (z.B. Function Calling, JSON-Modus).

Abrechnung nach Neuronen

Workers AI rechnet nicht in klassischen Token-Preisen ab, sondern in einer eigenen Einheit namens Neuron - ein Mass fuer die GPU-Rechenleistung, die eine Anfrage verbraucht, unabhaengig davon, welches Modell im Hintergrund laeuft. Das macht Kosten ueber verschiedene Modelltypen (Text, Bild, Audio) hinweg vergleichbar.

(Stand: 2026-07) Auf Free- und Paid-Plan gibt es taeglich 10’000 Neuronen kostenlos, zurueckgesetzt um Mitternacht UTC. Darueber hinaus kostet es auf dem Paid-Plan 0.011 USD pro 1’000 Neuronen. Zum Einordnen ein paar Modellkosten in Neuronen pro Million Tokens bzw. pro Einheit:

ModellKosten (ungefaehr, Stand: 2026-07)
Llama 3.2 1B (Input / Output)ca. 2’457 / 18’252 Neuronen pro Mio. Tokens
Llama 3.1 70B (Input / Output)ca. 26’668 / 204’805 Neuronen pro Mio. Tokens
BGE Small (Embeddings)ca. 1’841 Neuronen pro Mio. Tokens
FLUX Schnell (Bildgenerierung)ca. 4.8 Neuronen pro 512x512-Kachel
Whisper (Transkription)ca. 41 Neuronen pro Audiominute

Kleinere Modelle (1B-8B Parameter) sind fuer die meisten Alltagsaufgaben - Klassifikation, kurze Zusammenfassungen, einfache Chatbots - ausreichend und deutlich guenstiger als grosse Modelle. Fuer anspruchsvolle Aufgaben (komplexes Reasoning, lange Kontexte) lohnt sich oft ein Blick auf wie du zwischen lokalen Modellen, Cloudflare und externen APIs abwaegst - Workers AI ist keine Universalloesung fuer jedes Modell, sondern am staerksten bei kleineren, latenzkritischen Aufgaben direkt am Edge.

AI Gateway: Kontrolle ueber jede KI-Anfrage

Das AI Gateway setzt sich als proxy-artige Kontrollschicht vor KI-Anfragen - und zwar nicht nur vor Workers AI, sondern auch vor externe Anbieter wie OpenAI, Anthropic, Google Gemini oder Replicate. Der Clou: Ein bestehender API-Aufruf an einen dieser Anbieter muss nur die Ziel-URL aendern, der Rest des Codes bleibt gleich.

Ohne Gateway:
  https://api.openai.com/v1/chat/completions

Mit AI Gateway davor:
  https://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_id}/openai/chat/completions
# Beispiel: OpenAI-Anfrage ueber das AI Gateway routen
curl https://gateway.ai.cloudflare.com/v1/DEIN_ACCOUNT_ID/DEIN_GATEWAY_NAME/openai/chat/completions \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-4.1-mini",
    "messages": [{"role": "user", "content": "Hallo!"}]
  }'

Innerhalb eines Workers laesst sich die AI-Bindung direkt mit einem Gateway verknuepfen, ohne die URL manuell zu bauen:

// Worker: Workers-AI-Aufruf durch ein benanntes Gateway routen
const antwort = await env.AI.run(
  "@cf/meta/llama-3.1-8b-instruct",
  { messages: [{ role: "user", content: "Kurzer Test" }] },
  { gateway: { id: "mein-gateway" } }
);

Die wichtigsten Funktionen im Ueberblick

FunktionWas sie bringt
Analytics & LoggingZentrales Dashboard fuer Requests, Tokens, Kosten und Fehlerraten - anbieteruebergreifend
CachingWiederkehrende identische Anfragen werden direkt aus dem Cloudflare-Cache beantwortet statt erneut an den Modellanbieter geschickt - spart Latenz und Kosten
Rate LimitingBegrenzung der Anfragen pro Zeitfenster, schuetzt vor Kostenexplosion bei Bugs oder Missbrauch
Retry & FallbackAutomatische Wiederholung bei Fehlern, optional automatischer Wechsel auf ein Ersatzmodell/-anbieter
Request-LoggingVollstaendige Anfrage-/Antwort-Historie zum Debugging, mit einstellbarer Aufbewahrungsdauer

Rate Limiting im AI Gateway ist besonders nuetzlich, wenn eine Anwendung Endnutzern direkten oder indirekten Zugriff auf ein KI-Modell gibt: Ohne Limit kann ein einzelner Nutzer (versehentlich per Skript oder absichtlich) hunderte Anfragen pro Minute abfeuern und die Kostenrechnung eines ganzen Monats in einer Stunde verursachen.

Das AI Gateway ist auf allen Cloudflare-Plaenen verfuegbar (Stand: 2026-07), inklusive Free-Plan - die Einrichtung dauert laut Cloudflare “eine Codezeile”, weil im einfachsten Fall nur die Basis-URL bestehender API-Aufrufe angepasst werden muss.

Vectorize: Vektorsuche im selben Netzwerk

Vectorize ist Cloudflares Vektor-Datenbank - eine ausfuehrliche Einordnung gegenueber pgvector, Qdrant und Pinecone steht in Vektor-Datenbanken im Vergleich. Der entscheidende Punkt fuer diesen Artikel: Vectorize laeuft im selben Edge-Netzwerk wie Workers und Workers AI, wodurch eine komplette RAG-Anfrage - Embedding erzeugen, Vektorsuche, Antwort generieren - ohne einen einzigen Sprung zu einem externen Anbieter auskommt.

# Vectorize-Index per Wrangler CLI anlegen (1536 Dimensionen, Cosine-Distanz)
npx wrangler vectorize create wissensbasis --dimensions=1536 --metric=cosine

Wichtige Limits (Stand: 2026-07): bis zu 1536 Dimensionen pro Vektor, bis zu 10 Millionen Vektoren pro Index, Metadaten bis 10 KiB pro Vektor mit maximal 10 filterbaren Feldern pro Index. Abgerechnet wird nach Vektor-Dimensionen statt nach Vektor-Anzahl - der Free-Plan enthaelt 30 Millionen abgefragte und 5 Millionen gespeicherte Vektor-Dimensionen pro Monat kostenlos.

Praxisbeispiel: RAG-Endpoint in einem Worker

Das folgende Beispiel kombiniert alle drei Bausteine in einem einzigen Worker: Embedding per Workers AI, Suche in Vectorize, Antwortgenerierung ueber das AI Gateway.

// worker.js - kompletter RAG-Flow in einem Cloudflare Worker
export default {
  async fetch(request, env) {
    const { frage } = await request.json();

    // 1. Frage in einen Vektor umwandeln (Workers AI, Embedding-Modell)
    const embedding = await env.AI.run("@cf/baai/bge-base-en-v1.5", {
      text: [frage],
    });

    // 2. Die 5 aehnlichsten Chunks aus Vectorize holen
    const treffer = await env.VECTORIZE.query(embedding.data[0], {
      topK: 5,
      returnMetadata: true,
    });

    const kontext = treffer.matches
      .map((m) => m.metadata?.text ?? "")
      .join("\n\n---\n\n");

    // 3. Antwort generieren, ueber ein AI Gateway geroutet (Caching + Logging)
    const antwort = await env.AI.run(
      "@cf/meta/llama-3.1-8b-instruct",
      {
        messages: [
          {
            role: "system",
            content: `Beantworte die Frage nur auf Basis dieses Kontexts:\n${kontext}`,
          },
          { role: "user", content: frage },
        ],
      },
      { gateway: { id: "wissensbasis-gateway" } }
    );

    return Response.json({ antwort: antwort.response, quellen: treffer.matches.length });
  },
};
// wrangler.jsonc - alle drei Bindings zusammen
{
  "ai": { "binding": "AI" },
  "vectorize": [
    { "binding": "VECTORIZE", "index_name": "wissensbasis" }
  ]
}

Entscheidungshilfe: Wann passt dieser Stack

Brauchst du KI-Funktionalitaet in deiner Anwendung?
├─ Bist du schon im Cloudflare-Stack (Workers, D1, Pages)?
│   ├─ Ja
│   │   ├─ Reichen kleinere Open-Source-Modelle (Llama 8B & Co.) fuer die Aufgabe?
│   │   │   → Workers AI direkt nutzen, AI Gateway fuer Caching/Analytics davorsetzen
│   │   │
│   │   └─ Brauchst du ein staerkeres Modell (z.B. Claude, GPT-4-Klasse)?
│   │       → Externe API nutzen, aber ueber AI Gateway routen
│   │         (gleiches Dashboard, Caching, Rate Limiting trotzdem verfuegbar)
│   │
│   └─ Nein, kein Cloudflare-Stack im Einsatz
│       → Direkter Anbieter-Zugriff oder anderer Stack ist oft der geradere Weg;
│         Workers AI/Vectorize lohnen sich selten allein wegen der KI-Features

└─ Brauchst du zusaetzlich Vektorsuche (RAG, semantische Suche)?
    → Vectorize, wenn schon im Cloudflare-Stack; sonst siehe
      [Vektor-Datenbanken im Vergleich](/wiki/vektor-datenbanken)

Kurz zusammengefasst

  • Workers AI fuehrt uber 50 Open-Source-Modelle direkt im Cloudflare-Netzwerk aus, abgerechnet in Neuronen (GPU-Recheneinheiten), mit taeglichem Gratiskontingent.
  • AI Gateway legt sich als Kontrollschicht vor Workers AI UND externe Anbieter (OpenAI, Anthropic, Gemini, …) - meist reicht eine URL-Anpassung im bestehenden Code.
  • Kernfunktionen des Gateways: Caching, Rate Limiting, Analytics/Logging, Retry & Fallback zwischen Modellen.
  • Vectorize ist die Edge-native Vektor-DB, optimal kombiniert mit Workers AI fuer RAG-Anwendungen ohne externe Netzwerksprünge.
  • Der Stack lohnt sich vor allem, wenn du bereits im Cloudflare-Oekosystem bist - ausserhalb davon ist er selten allein wegen der KI-Features ein Umstiegsgrund.
  • Preise und Modellnamen aendern sich staendig - immer die offizielle Pricing- und Model-Seite pruefen statt sich auf feste Zahlen zu verlassen.

Weiterlernen

Verwandte Themen: Vektor-Datenbanken im Vergleich · RAG selbst bauen · LLM-APIs: Grundlagen · MCP (Model Context Protocol)

Kommentare

Frage, Verbesserungsvorschlag oder eigene Erfahrung zu diesem Artikel? Schreib einen Kommentar. Neue Beiträge erscheinen nach kurzer Moderation.

  • Lade Kommentare …
Kommentar schreiben