Schnellstart-Anleitung für die unzensierte LLM-API
Diese Schnellstart-Anleitung hilft dir, unsere Chat-Completions-API mit Standard-OpenAI-kompatiblen Clients zu integrieren. Du findest die Basis-URL, Authentifizierungsschritte, Code-Beispiele und Limits, um sofort Anfragen zu senden.
Authentifizierung & Header
Unsere API verwendet die Standard-API-Schlüssel-Authentifizierung. Du musst deinen Schlüssel für jede Anfrage im Authorization-Header angeben. Neue Konten erhalten sofort nach der Anmeldung auf der Seite API-Schlüssel erhalten einen Schlüssel. Wenn du deinen Schlüssel verlierst, kannst du ihn jederzeit neu generieren, wodurch der alte ungültig wird. Pro Konto ist nur ein aktiver Schlüssel erlaubt.
Die Basis-URL für alle Anfragen ist https://api.llmapistatus.com/v1. Dies funktioniert mit offiziellen OpenAI-SDKs und jedem OpenAI-kompatiblen Client, indem du einfach die base_url-Konfiguration aktualisierst. Es sind keine speziellen Header außer der Authentifizierung erforderlich.
Chat-Completions-Endpunkt
Sende Text und erhalte Text über den POST /v1/chat/completions Endpunkt. Die Modell-ID ist immer uncensored. Dies ist ein Open-Weight-Modell, das auf unseren eigenen GPU-Servern läuft und darauf abgestimmt ist, ohne Inhaltsfilter für die legale Nutzung durch Erwachsene zu antworten. Es ist nicht GPT, Claude oder das Modell eines anderen Anbieters.
Die API unterstützt Tool- und Function Calling. Du musst kein Routing zwischen verschiedenen Anbietern verwalten; wir bieten einen einzelnen, dedizierten unzensierten Endpunkt. Für allgemeine Vergleiche anderer Anbieter sieh dir unsere LLM-Rangliste an.
curl https://api.llmapistatus.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Streaming-Antworten
Für geringere Latenz kannst du das Streaming aktivieren, indem du stream: true im Anfragekörper festlegst. Die API gibt einen Server-Sent Events (SSE)-Stream zurück. Dies ist ideal für Chat-Schnittstellen, in denen du Token angezeigt werden lassen möchtest, sobald sie generiert werden.
Das Streaming funktioniert sowohl mit den offiziellen OpenAI-SDKs als auch mit generischen HTTP-Clients. Der Stream läuft weiter, bis das Modell fertig ist oder ein Fehler auftritt. Diese Methode reduziert die wahrgenommene Wartezeit für Benutzer und lässt das unzensierte Modell in Produktionsanwendungen responsiver wirken.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Unterstützung für Function Calling
Die API unterstützt strukturierte Ausgaben über Function Calling. Du kannst Tools in deiner Anfrage definieren, und das Modell gibt strukturiertes JSON zurück, das deinem Schema entspricht. Dies ist nützlich für den Aufbau von Agents oder Anwendungen, die mit anderen Systemen interagieren müssen.
Verwende den Parameter tools in deiner Chat-Completion-Anfrage. Das Modell antwortet bei Bedarf mit Tool-Aufrufen, sodass du Funktionen ausführen und die Ergebnisse zurück in die Konversation einspeisen kannst. Dieses Feature ist bei allen Anfragen ohne Mehrkosten verfügbar.
from openai import OpenAI
client = OpenAI(base_url="https://api.llmapistatus.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Modellliste & Kontextfenster
Du kannst verfügbare Modelle über den GET /v1/models-Endpunkt auflisten. Dies gibt Metadaten zurück, einschließlich der Modell-ID, die uncensored lautet. Das Modell unterstützt ein Kontextfenster von 100.000 Token für Prompt und Completion zusammen.
Dieses große Kontextfenster ermöglicht es dir, umfangreiche Systemanweisungen, Konversationsverläufe oder Dokumentinhalte in einer einzigen Anfrage zu übergeben. Es eignet sich zur Generierung langer Texte oder zur Verarbeitung großer Dokumente. Halte deine gesamte Token-Anzahl innerhalb der 100k-Grenze, um Fehler zu vermeiden.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llmapistatus.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
Ratenlimits & Kontingente
Jeder API-Schlüssel ist auf 300 Anfragen pro Minute begrenzt. Die maximale Größe des Anfragekörpers beträgt 8 MB. Wenn du das Ratenlimit überschreitest, erhältst du den Statuscode 429. Wenn dein API-Schlüssel ungültig ist, erhältst du einen 401-Fehler. Wenn du kein Prepaid-Guthaben hast, erhältst du einen 402-Fehler.
Die Preise sind transparent: $0,25 pro 1 Mio. Input-Token und $1,00 pro 1 Mio. Output-Token. Guthaben ist prepaid und verfällt nie. Du kannst ab $10 per Krypto (USDT oder USDC) aufladen. Siehe die Seite LLM-API-Preise für Details zu Bonusguthaben.
Technische Daten
Eine Tabelle mit jedem Limit, jeder Funktion und jedem Preis.
| Merkmal | Wert |
|---|---|
| API-Format | OpenAI-kompatibel: jedes OpenAI-SDK funktioniert – nur Base-URL und Schlüssel ändern |
| Modell-ID | uncensored |
| Endpunkte | POST /v1/chat/completions · GET /v1/models |
| Authentifizierung | Authorization: Bearer YOUR_KEY |
| Base-URL | https://api.llmapistatus.com/v1 |
| JSON-Modus | response_format: {"type": "json_object"} |
| Parameter | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Max. Ausgabe | bis zum Rest des 100.000-Token-Fensters; max_tokens optional (kein separates Limit) |
| Kontextfenster | 100.000 Tokens (Eingabe + Ausgabe) |
| Function Calling | ja – tools, tool_choice; Antworten mit tool_calls, auch im Stream; Ergebnisse als role: tool |
| Streaming | ja – Server-Sent Events, der letzte Chunk enthält die Token-Nutzung |
| Parallelität | 8 gleichzeitige Anfragen pro Schlüssel |
| Ratenlimit | 300 Anfragen pro Minute und Schlüssel |
| Anfragegröße | bis 8 MB |
| Antwort-Header | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Preis | $0,25 pro 1 Mio. Eingabe-Tokens · $1,00 pro 1 Mio. Ausgabe-Tokens |
| Testguthaben | $0,50 für 7 Tage, ohne Karte · Testschlüssel: 2 parallele Anfragen, 60 pro Minute; volle Limits (8 und 300) nach erster Aufladung |
| Bonus | +5 % ab $50, +10 % ab $100 |
| Aufladen | USDT (TRC20) oder USDC (Base), jeder ganze Betrag von $10 bis $500 |
| Gültigkeit | bezahltes Guthaben verfällt nie, kein Abo |
| Abrechnung | Prepaid-Guthaben nach echter Nutzung; Fehler und Ablehnungen sind kostenlos |
| Inhalte | Inhalte für Erwachsene erlaubt; sexuelle Inhalte mit Minderjährigen werden abgelehnt |
| Anmeldung | Google oder E-Mail und Passwort |
| Schlüssel | ein aktiver Schlüssel pro Konto; ein neuer ersetzt den alten |
Fehler und Lösungen
Fehler kommen als JSON mit festem type; fehlgeschlagene oder abgelehnte Anfragen kosten nichts.
| Code | Typ | Bedeutung |
|---|---|---|
400 | bad_request | ungültiges JSON, leere Nachrichten, falscher Parameter oder Kontext zu lang |
401 | missing_key · invalid_key · key_revoked | Schlüssel fehlt, ist falsch oder wurde ersetzt |
402 | no_credit | kein Guthaben – aufladen, dann geht es sofort weiter |
403 | content_blocked | sexuelle Inhalte mit Minderjährigen – abgelehnt, nicht berechnet |
404 | not_found | unbekannter Endpunkt |
413 | request_too_large | Anfrage größer als 8 MB |
429 | rate_limited · concurrency | über 300/Min. oder 8 parallel – kurz warten |
503 | upstream_busy | Modell ausgelastet – in Sekunden erneut versuchen |
Fragen und Antworten
Ist dieses Modell dasselbe wie GPT-4 oder Claude?
Nein. Die Modell-ID ist „uncensored“ und es handelt sich um ein Open-Weight-Modell, das auf unseren eigenen GPU-Servern läuft. Es ist für die legale Erwachsenen-Nutzung ohne Inhaltsfilter optimiert, unterscheidet sich aber von GPT, Claude, Gemini oder anderen Anbietern.
Wie starte ich mit dem Testguthaben?
Melde dich auf der Seite API-Schlüssel erhalten nur mit E-Mail und Passwort an. Du erhältst $0,50 kostenloses Testguthaben, das 7 Tage gültig ist. Keine Kreditkarte oder Telefonnummer erforderlich.
Was passiert, wenn ich das Ratenlimit erreiche?
Wenn du 300 Anfragen pro Minute überschreitest, gibt die API den Statuscode 429 zurück. Implementiere im Client eine exponentielle Backoff-Logik. Du kannst deinen Schlüssel bei Bedarf neu generieren, aber das Ratenlimit gilt pro Schlüssel.
Dein Schlüssel ist nur ein Formular entfernt
Erstelle ein Konto, kopiere den Schlüssel, ändere die Basis-URL. Das ist die gesamte Einrichtung.