Guide de démarrage rapide pour l'API LLM sans censure
Ce guide de démarrage rapide vous aide à intégrer notre API de chat-completions sans censure à l'aide de clients compatibles OpenAI standards. Vous y trouverez l'URL de base, les étapes d'authentification, des exemples de code et les limites nécessaires pour commencer à envoyer des requêtes immédiatement.
Authentification & En-têtes
Notre API utilise une authentification standard par clé API. Vous devez inclure votre clé dans l'en-tête Authorization pour chaque requête. Les nouveaux comptes reçoivent une clé immédiatement après l'inscription sur la page Obtenir clé API. Si vous perdez votre clé, vous pouvez la régénérer à tout moment, ce qui révoque l'ancienne. Une seule clé active est autorisée par compte.
L'URL de base pour toutes les requêtes est https://api.llmapistatus.com/v1. Cela fonctionne avec les SDK officiels OpenAI et tout client compatible OpenAI en mettant simplement à jour la configuration base_url. Aucun en-tête spécial n'est requis au-delà de l'authentification.
Endpoint Chat Completions
Envoyez du texte et recevez du texte en utilisant l'endpoint POST /v1/chat/completions. L'ID du modèle est toujours uncensored. Il s'agit d'un modèle à poids ouverts exécuté sur nos propres serveurs GPU, optimisé pour répondre sans refus de contenu pour un usage adulte légal. Ce n'est ni GPT, ni Claude, ni le modèle d'aucun autre fournisseur.
L'API prend en charge l'appel de fonctions et d'outils. Vous n'avez pas besoin de gérer le routage entre différents fournisseurs ; nous servons un endpoint sans censure dédié et unique. Pour des comparaisons générales d'autres fournisseurs, consultez notre LLM Leaderboard.
curl https://api.llmapistatus.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Réponses en streaming
Pour une latence plus faible, vous pouvez activer le streaming en définissant stream: true dans le corps de votre requête. L'API renvoie un flux Server-Sent Events (SSE). Cela est idéal pour les interfaces de chat où vous souhaitez afficher les tokens au fur et à mesure de leur génération.
Le streaming fonctionne avec les SDK officiels OpenAI et les clients HTTP génériques. Le flux continue jusqu'à ce que le modèle ait terminé ou qu'une erreur se produise. Cette méthode réduit le temps d'attente perçu pour les utilisateurs, rendant le modèle sans censure plus réactif dans les applications de production.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Prise en charge de l'appel de fonctions
L'API prend en charge les sorties structurées via l'appel de fonctions. Vous pouvez définir des outils dans votre requête et le modèle renverra du JSON structuré correspondant à votre schéma. Cela est utile pour créer des agents ou des applications qui doivent interagir avec d'autres systèmes.
Utilisez le paramètre tools dans votre requête de chat completions. Le modèle répondra par des appels de fonctions si nécessaire, vous permettant d'exécuter des fonctions et de renvoyer les résultats dans la conversation. Cette fonctionnalité est disponible sur toutes les requêtes sans coût supplémentaire.
from openai import OpenAI
client = OpenAI(base_url="https://api.llmapistatus.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Liste des modèles & Fenêtre de contexte
Vous pouvez lister les modèles disponibles en utilisant l'endpoint GET /v1/models. Cela renverra des métadonnées incluant l'ID du modèle, qui est uncensored. Le modèle prend en charge une fenêtre de contexte de 100 000 tokens pour le prompt et la complétion combinés.
Cette grande fenêtre de contexte vous permet de transmettre des instructions système détaillées, l'historique des conversations ou le contenu de documents dans une seule requête. Elle convient à la génération de textes longs ou au traitement de gros documents. Veillez à ce que le nombre total de tokens ne dépasse pas la limite de 100 000 tokens pour éviter les erreurs.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llmapistatus.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
Limites de débit & Quotas
Chaque clé API est limitée à 300 requêtes par minute. La taille maximale du corps de la requête est de 8 Mo. Si vous dépassez la limite de débit, vous recevrez un code d'état 429. Si votre clé API est invalide, vous obtiendrez une erreur 401. Si vous n'avez pas de crédit prépayé, vous recevrez une erreur 402.
La tarification est transparente : 0,25 $ par 1M de tokens d'entrée et 1,00 $ par 1M de tokens de sortie. Le crédit est prépayé et n'expire jamais. Vous pouvez recharger à partir de 10 $ par crypto (USDT ou USDC). Consultez la page Tarification API LLM pour plus de détails sur les crédits bonus.
Caractéristiques techniques
Toutes les limites et fonctions réelles de l'API au même endroit — vérifiez-les avant de recharger.
| Élément | Valeur |
|---|---|
| Format | compatible OpenAI : tout SDK OpenAI fonctionne en changeant la base URL et la clé |
| ID du modèle | uncensored |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Authentification | Authorization: Bearer YOUR_KEY |
| Base URL | https://api.llmapistatus.com/v1 |
| Mode JSON | response_format: {"type": "json_object"} |
| Paramètres | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Sortie max. | jusqu'au reste de la fenêtre de 100 000 tokens ; max_tokens optionnel (pas de plafond distinct) |
| Fenêtre de contexte | 100 000 tokens (entrée + sortie) |
| Appel de fonctions | oui — tools, tool_choice ; réponse avec tool_calls, aussi en streaming ; résultats en role: tool |
| Streaming | oui — server-sent events ; le dernier bloc contient l'usage des tokens |
| Concurrence | 8 requêtes simultanées par clé |
| Limite de débit | 300 requêtes par minute et par clé |
| Taille | jusqu'à 8 Mo par requête |
| En-têtes | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Prix | 0,25 $ par million de tokens en entrée · 1,00 $ par million en sortie |
| Essai gratuit | 0,50 $ pendant 7 jours, sans carte · Clé d'essai : 2 requêtes parallèles, 60 par minute ; limites complètes (8 et 300) après la 1re recharge |
| Bonus | +5 % dès 50 $, +10 % dès 100 $ |
| Recharge | USDT (TRC20) ou USDC (Base), tout montant entier de 10 $ à 500 $ |
| Validité | le crédit payé n'expire jamais, sans abonnement |
| Facturation | crédit prépayé selon l'usage réel ; erreurs et refus gratuits |
| Contenu | contenu adulte autorisé ; tout contenu sexuel impliquant des mineurs est refusé |
| Connexion | Google ou e-mail et mot de passe |
| Clés | une clé active par compte ; une nouvelle remplace l'ancienne |
Erreurs et solutions
Les erreurs arrivent en JSON avec un type stable ; les requêtes échouées ou refusées ne sont pas facturées.
| Code | Type | Signification |
|---|---|---|
400 | bad_request | JSON invalide, messages vides, mauvais paramètre ou contexte trop long |
401 | missing_key · invalid_key · key_revoked | clé absente, erronée ou remplacée |
402 | no_credit | plus de crédit — rechargez, la reprise est immédiate |
403 | content_blocked | contenu sexuel impliquant des mineurs — refusé, non facturé |
404 | not_found | endpoint inconnu |
413 | request_too_large | corps supérieur à 8 Mo |
429 | rate_limited · concurrency | au-delà de 300/min ou 8 en parallèle — patientez |
503 | upstream_busy | modèle occupé — réessayez dans quelques secondes |
Questions et réponses
Ce modèle est-il identique à GPT-4 ou Claude ?
Non. L'ID du modèle est « uncensored » et il s'agit d'un modèle à poids ouverts exécuté sur nos propres serveurs GPU. Il est optimisé pour un usage adulte légal sans refus de contenu, mais il est distinct des modèles GPT, Claude, Gemini ou d'autres fournisseurs.
Comment commencer avec le crédit d'essai gratuit ?
Inscrivez-vous sur la page Obtenir clé API avec simplement un e-mail et un mot de passe. Vous recevrez 0,50 $ de crédit d'essai gratuit valable 7 jours. Aucune carte bancaire ou numéro de téléphone n'est requis pour commencer.
Que se passe-t-il si je dépasse la limite de débit ?
Si vous dépassez 300 requêtes par minute, l'API renvoie un code d'état 429. Vous devez mettre en œuvre une rétrogradation exponentielle dans votre client. Vous pouvez régénérer votre clé si nécessaire, mais la limite de débit s'applique par clé.
Votre clé est à un formulaire de vous
Créez un compte, copiez la clé, modifiez l'URL de base. C'est toute la configuration.