OPENROUTER API
EIN KEY
400+ MODELLE.

OpenRouter API-Gateway verbindet GPT Claude Gemini und 400+ LLM-Modelle

Leitfaden: Separate API-Keys für OpenAI, Anthropic, Google und DeepSeek bedeuten fünf Dashboards, fünf Rate-Limits und eigene Failover-Logik. OpenRouter bündelt 70+ Anbieter und 400+ Modelle hinter einem OpenAI-kompatiblen Endpoint. Dieser datengetriebene Leitfaden liefert präzise Specs: Routing-Mechanismus, Vergleichstabelle vs. Direkt-API, fünf messbare Vorteile, DSGVO-relevante Ausschlusskriterien, 3-Schritt-Setup, Produktionscode (curl/Python/Node/OpenAI-SDK), Streaming und Fallback, Preismodell (5,5%-Gebühr, BYOK) sowie FAQ.

30-Sekunden-Überblick

DefinitionUnified LLM-Gateway: 70+ Anbieter, 400+ Modelle, OpenAI-kompatibles /v1
Endpointhttps://openrouter.ai/api/v1/chat/completions
PreisKein Token-Aufschlag; 5,5% auf Guthabenaufladung; 25+ Gratis-Modelle
Gratis-Tier50 Anfr./Tag ohne Kauf; 1.000/Tag nach $10-Aufladung
Latenz-Overhead10–80 ms Routing vs. Direkt-API
DSGVOUS-Drittanbieter-Routing — AVV/BYOK/Direkt-API prüfen

1. Was ist OpenRouter?

OpenRouter ist ein einheitliches LLM-API-Gateway. Statt sich bei OpenAI, Anthropic, Google, Meta, Mistral und DeepSeek separat zu registrieren, senden Sie alle Anfragen an einen einzigen OpenAI-kompatiblen Endpoint. OpenRouter übernimmt Authentifizierung, Provider-Auswahl, Failover und Abrechnung.

Kernspezifikationen:

  • Endpoint: https://openrouter.ai/api/v1 — Drop-in-Ersatz für OpenAIs Base-URL
  • Auth: Ein API-Key im Header Authorization: Bearer
  • Modellbenennung: Format provider/model-id — z. B. openai/gpt-4o, anthropic/claude-sonnet-4, google/gemini-2.5-pro
  • Kompatibilität: curl, Python requests, Node fetch, offizielles OpenAI-SDK — nur base_url und model ändern

Routing-Mechanismus

SchichtFunktionBeispiel
Modell-RoutingSie definieren Modell-ID; OpenRouter wählt besten verfügbaren Providerdeepseek/deepseek-chat
Provider-RoutingGleiches Modell auf mehreren Hosts; Routing nach Preis, Latenz, UptimeDeepSeek via Fireworks vs. DeepSeek direkt
FallbackAutomatischer Retry auf Backup-Modell bei 429/5xxPrimär Claude, Fallback GPT-4o
Gratis-Modelle25+ Modelle à $0; rate-limited nach Kontostufemeta-llama/llama-3.3-70b-instruct:free

2. OpenRouter vs. Direkt-API: Vergleichstabelle

DimensionOpenRouterDirekt-Anbieter-API
API-KeysEin Key für alle AnbieterSeparater Key pro Anbieter
SDK-ÄnderungenNur base_url anpassenAnbieter-spezifische SDKs/Endpoints
ModellwechselModellstring in einer Zeile ändernNeuer Account, Billing, Rate-Limits
FailoverIntegriertes Fallback Modell/ProviderEigene Retry-Logik erforderlich
Token-PreisAnbieter-Listenpreis (kein Aufschlag)Anbieter-Listenpreis
Plattformgebühr5,5% auf GuthabenkäufeKeine
Latenz+10–80 ms Routing-OverheadMinimal (direkt zum Anbieter)
Anbieter-FeaturesTeilmenge (kein Assistants API, begrenztes Caching)Voller Feature-Umfang
Compliance / DSGVOUS-Drittanbieter-Datenrouting; AVV prüfenDirekter DPA/AVV mit Anbieter möglich
Gratis-Modelle25+ Modelle, gestaffelte TageslimitsNur anbieter-spezifische Free-Tiers

3. Fünf messbare Gründe für OpenRouter

  1. Ein Key, 400+ Modelle. Prototyp mit GPT-4o, Produktion mit DeepSeek V4 Flash, Eskalation zu Claude Opus — ohne Re-Auth oder neue Billing-Accounts.
  2. OpenAI-SDK Drop-in. Bestehende openai.chat.completions.create()-Codebases: zwei Zeilen ändern (base_url, model).
  3. Integriertes Failover. Agent-Loops triggern 429s ständig. Provider-Routing und Modell-Fallback reduzieren Custom-Retry-Code von Hunderten Zeilen auf einen JSON-Block.
  4. Echte Nutzungsdaten. OpenRouter publiziert wöchentliche Token- und Dollar-Rankings — Produktionsgrundlage statt Benchmark-Rauschen. Siehe unseren Juni-2026-Rankings-Bericht.
  5. Gratis-Tier zum Validieren. 25+ kostenlose Modelle, 50 Anfragen/Tag (1.000/Tag nach $10-Aufladung) — Agent-Workflows testen vor Paid-Inference.

4. Wann OpenRouter nicht nutzen

OpenRouter ist nicht immer optimal. Gateway überspringen bei:

  • Latenz-kritischen Echtzeit-Apps: 10–80 ms Overhead relevant für Voice, Live-Coding, TTFT <100 ms.
  • Sehr hohem Token-Volumen: Bei Millionen Tokens/Tag summiert sich 5,5% auf Guthaben. Direktverträge oder Reserved Capacity günstiger.
  • Strikter DSGVO-Compliance: Personenbezogene Daten ohne dokumentierten AVV, Art.-28-Auftragsverarbeitung oder bei Verbot von US-Drittanbieter-Routing — Direkt-API oder BYOK mit EU-DPA.
  • Anbieter-spezifischen Features: OpenAI Assistants, Anthropic Prompt Caching mit garantierten Hit-Rates, Google Vertex Grounding — natives SDK erforderlich.

5. Schritt-für-Schritt: OpenRouter API-Key

Schritt 1 — Registrierung

Auf openrouter.ai anmelden (Google, GitHub oder E-Mail). Keine Kreditkarte für Gratis-Modelle nötig.

Schritt 2 — API-Key erstellen

Dashboard → KeysCreate Key, benennen (z. B. prod-agent), Key sofort kopieren. In Umgebungsvariable speichern — nie in Git committen.

export OPENROUTER_API_KEY="sk-or-v1-xxxxxxxx"

Schritt 3 — Erste Anfrage

Key mit minimalem curl-Aufruf verifizieren. Erwartete Antwort: JSON mit choices[0].message.content.

6. Code-Beispiele

6.1 curl

curl https://openrouter.ai/api/v1/chat/completions \ -H "Authorization: Bearer $OPENROUTER_API_KEY" \ -H "Content-Type: application/json" \ -H "HTTP-Referer: https://macgpu.com" \ -H "X-Title: MACGPU Blog Demo" \ -d '{ "model": "anthropic/claude-sonnet-4", "messages": [{"role": "user", "content": "Erkläre OpenRouter in einem Satz."}] }'

6.2 Python (requests)

import os, requests resp = requests.post( "https://openrouter.ai/api/v1/chat/completions", headers={ "Authorization": f"Bearer {os.environ['OPENROUTER_API_KEY']}", "Content-Type": "application/json", }, json={ "model": "google/gemini-2.5-flash", "messages": [{"role": "user", "content": "Hallo aus Python"}], }, ) print(resp.json()["choices"][0]["message"]["content"])

6.3 Python (OpenAI-SDK Drop-in)

from openai import OpenAI client = OpenAI( base_url="https://openrouter.ai/api/v1", api_key=os.environ["OPENROUTER_API_KEY"], ) completion = client.chat.completions.create( model="openai/gpt-4o", messages=[{"role": "user", "content": "Drop-in SDK Test"}], ) print(completion.choices[0].message.content)

6.4 Node.js (OpenAI-SDK)

import OpenAI from "openai"; const client = new OpenAI({ baseURL: "https://openrouter.ai/api/v1", apiKey: process.env.OPENROUTER_API_KEY, }); const res = await client.chat.completions.create({ model: "deepseek/deepseek-chat", messages: [{ role: "user", content: "Node.js via OpenRouter" }], }); console.log(res.choices[0].message.content);

6.5 Streaming

from openai import OpenAI client = OpenAI( base_url="https://openrouter.ai/api/v1", api_key=os.environ["OPENROUTER_API_KEY"], ) stream = client.chat.completions.create( model="anthropic/claude-sonnet-4", messages=[{"role": "user", "content": "Stream diese Antwort."}], stream=True, ) for chunk in stream: delta = chunk.choices[0].delta.content or "" print(delta, end="", flush=True)

6.6 Fallback-Konfiguration

{ "model": "anthropic/claude-sonnet-4", "models": [ "anthropic/claude-sonnet-4", "openai/gpt-4o", "google/gemini-2.5-flash" ], "messages": [{"role": "user", "content": "Agent-Aufgabe mit Failover"}] }

Das models-Array instruiert OpenRouter, Modelle der Reihe nach zu versuchen, wenn das vorherige einen Fehler oder Rate-Limit zurückgibt. Einfachstes produktionsreifes Failover-Muster für Agent-Loops.

6.7 Verfügbare Modelle auflisten

curl -s https://openrouter.ai/api/v1/models \ -H "Authorization: Bearer $OPENROUTER_API_KEY" \ | python3 -m json.tool | head -80

7. Streaming, Fallback und Kostenkontrolle

Streaming: "stream": true im Request-Body. OpenRouter liefert SSE-Chunks im OpenAI-Format. Für Chat-UIs und Agent-Tool-Call-Loops, wo Time-to-First-Token zählt.

Fallback: models-Array für Modell-Failover. Für Provider-Routing wählt OpenRouter günstigsten/schnellsten Provider, sofern nicht im Dashboard via provider-Präferenzen gepinnt.

Kostenkontrolle: Ausgabenlimits im Dashboard setzen. Günstigere Modelle (DeepSeek V4 Flash, Gemini Flash) für Entwürfe; Claude Opus/GPT-4o für Eskalation. Wöchentliche Ausgaben im Activity-Tab monitoren.

8. Preise: Gratis-Tier, 5,5%-Gebühr und BYOK

StufeDetails
Gratis-Modelle25+ Modelle à $0/Token; 50 Anfragen/Tag ohne Kauf; 1.000/Tag nach $10-Aufladung
Kostenpflichtige ModelleAnbieter-Listenpreis, kein per-Token-Aufschlag
Plattformgebühr5,5% auf Guthabenkäufe (nicht auf Token-Nutzung selbst)
BYOKEigener Anbieter-Key; 1 Mio. kostenlose geroutete Anfragen/Monat, danach geringe Überziehungsgebühr

Beispiel: $100 Guthabenkauf kostet $105,50 gesamt. Die $100 kaufen Tokens zu Anbieterpreisen. Bei 10 Mio. Tokens/Tag wird 5,5% material — Direktverträge evaluieren.

9. DSGVO-Checkliste für EU-Teams

PunktPrüffrageEmpfehlung
Art. 28 DSGVOAVV mit OpenRouter vorhanden?Vertrag prüfen; Subprozessor-Liste dokumentieren
Art. 44–49Drittlandtransfer USA?TIA durchführen; BYOK oder EU-Direkt-API bei sensiblen Daten
Gratis-ModelleStealth-Modelle loggen Prompts?Keine personenbezogenen Daten in Owl/Nemotron free
ProduktionGateway als Single Point of Failure?Fallback-Array + Spend-Caps + Audit-Log

10. FAQ

F: Ist OpenRouter kostenlos?
A: 25+ Gratis-Modelle, 50 Anfragen/Tag ohne Aufladung. Nach $10-Guthaben: 1.000/Tag. Kostenpflichtige Modelle zum Anbieter-Listenpreis.

F: Schlägt OpenRouter Token-Preise auf?
A: Kein per-Token-Aufschlag. 5,5% nur auf Guthabenaufladungen. BYOK: 1 Mio. kostenlose geroutete Anfragen/Monat.

F: Ist OpenRouter DSGVO-konform?
A: US-Drittanbieter-Gateway. Für personenbezogene Daten: AVV prüfen, BYOK oder Direkt-API mit EU-DPA wählen, Datenfluss dokumentieren.

F: Unterschied zu OpenAI-API?
A: OpenRouter = Multi-Provider-Gateway, ein Endpoint, 400+ Modelle. OpenAI-API = nur OpenAI-Modelle mit vollem Feature-Zugang.

F: OpenAI Python SDK nutzbar?
A: Ja. base_url="https://openrouter.ai/api/v1" und OpenRouter-Key — keine weiteren Code-Änderungen.

F: Wann OpenRouter überspringen?
A: Sub-10ms-Latenz, sehr hohes Volumen (5,5%-Gebühr), strikte DSGVO/HIPAA, Anbieter-Features wie Assistants API.

11. Abschluss: OpenRouter-Dev auf Mac — Agent-Stresstests auf Remote-Knoten

OpenRouter-Integration läuft auf jedem OS. Wer Cursor + Claude Code + OpenClaw mit Multi-Modell-Fallback-Ketten betreibt, belastet den primären Mac: Docker-Sandboxen, Agent-Loops und Long-Context-Batches konkurrieren um Unified Memory.

Pragmatische Aufteilung: Cursor-Review und leichte API-Calls auf dem Laptop; Agent-Stresstests, OpenRouter-Routing-Probes und 24/7-Gateway-Cron-Jobs auf einen MACGPU Remote Mac mini M4-Knoten auslagern. SSH-Isolation, On-Demand-Miete, MLX-Validierung nebenbei.