Przewodnik szybkiego startu dla API LLM bez cenzury
Ten przewodnik pomoże Ci zintegrować nasze API chat-completions bez cenzury przy użyciu standardowych klientów kompatybilnych z OpenAI. Znajdziesz tu bazowy URL, kroki uwierzytelniania, przykłady kodu oraz limity potrzebne do natychmiastowego wysyłania zapytań.
Uwierzytelnianie i nagłówki
Nasze API używa standardowego uwierzytelniania kluczem API. Musisz dołączyć swój klucz w nagłówku Authorization do każdego zapytania. Nowe konta otrzymują klucz natychmiast po rejestracji na stronie Uzyskanie klucza API. Jeśli zgubisz klucz, możesz go wygenerować ponownie w dowolnym momencie, co unieważni poprzedni. Dozwolony jest tylko jeden aktywny klucz na konto.
Bazowy URL dla wszystkich zapytań to https://api.llmapistatus.com/v1. Działa on ze oficjalnymi SDK OpenAI oraz dowolnym klientem kompatybilnym z OpenAI poprzez prostą zmianę konfiguracji base_url. Nie są wymagane żadne specjalne nagłówki poza uwierzytelnianiem.
Endpoint Chat Completions
Wysyłaj tekst i otrzymuj tekst za pomocą endpointu POST /v1/chat/completions. ID modelu to zawsze uncensored. Jest to model o otwartych wagach uruchamiany na naszych własnych serwerach GPU, dostrojony do odpowiadania bez odrzuceń treści dla prawnego użytku dorosłego. Nie jest to GPT, Claude ani model żadnego innego dostawcy.
API obsługuje wywoływanie funkcji. Nie musisz zarządzać trasami między różnymi dostawcami; oferujemy pojedynczy, dedykowany endpoint bez cenzury. Porównania innych dostawców znajdziesz w naszym Rankingu LLM.
curl https://api.llmapistatus.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Odpowiedzi strumieniowe
Dla niższego opóźnienia możesz włączyć strumieniowanie, ustawiając stream: true w ciele żądania. API zwraca strumień Server-Sent Events (SSE). Jest to idealne dla interfejsów czatu, gdzie chcesz wyświetlać tokeny w miarę ich generowania.
Strumieniowanie działa zarówno z oficjalnymi SDK OpenAI, jak i ogólnymi klientami HTTP. Strumień trwa do momentu zakończenia pracy modelu lub wystąpienia błędu. Ta metoda zmniejsza postrzegany czas oczekiwania użytkowników, sprawiając, że model bez cenzury wydaje się bardziej responsywny w aplikacjach produkcyjnych.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Wsparcie dla wywoływania funkcji
API obsługuje wyjścia strukturalne poprzez wywoływanie funkcji. Możesz zdefiniować narzędzia w swoim żądaniu, a model zwróci strukturalny JSON zgodny z Twoim schematem. Jest to przydatne przy budowaniu agentów lub aplikacji, które muszą współpracować z innymi systemami.
Użyj parametru tools w żądaniu chat completion. Model odpowie wywołaniami funkcji, gdy będzie to odpowiednie, pozwalając Ci wykonać funkcje i przekazać wyniki z powrotem do rozmowy. Ta funkcja jest dostępna we wszystkich żądaniach bez dodatkowych kosztów.
from openai import OpenAI
client = OpenAI(base_url="https://api.llmapistatus.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Lista modeli i okno kontekstu
Możesz wyświetlić dostępne modele za pomocą endpointu GET /v1/models. Zwróci on metadane, w tym ID modelu, który to uncensored. Model obsługuje okno kontekstu 100 000 tokenów dla promptu i uzupełnienia łącznie.
Takie duże okno kontekstu pozwala przekazać rozległe instrukcje systemowe, historię rozmowy lub zawartość dokumentu w jednym żądaniu. Jest to odpowiednie do generowania długich tekstów lub przetwarzania dużych dokumentów. Utrzymuj całkowitą liczbę tokenów w limicie 100k, aby uniknąć błędów.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llmapistatus.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
Limity zapytań i kwoty
Każdy klucz API jest ograniczony do 300 zapytań na minutę. Maksymalny rozmiar ciała żądania to 8 MB. Jeśli przekroczysz limit zapytań, otrzymasz kod statusu 429. Jeśli Twój klucz API jest nieprawidłowy, otrzymasz błąd 401. Jeśli nie masz przedpłaconego kredytu, otrzymasz błąd 402.
Ceny są przejrzyste: $0.25 za 1M tokenów wejściowych i $1.00 za 1M tokenów wyjściowych. Kredyt jest przedpłacony i nigdy nie wygasa. Możesz doładować go od $10 za pomocą kryptowalut (USDT lub USDC). Szczegóły dotyczące kredytów bonusowych znajdziesz na stronie Cennik LLM API.
Specyfikacja techniczna
Wszystkie rzeczywiste limity i funkcje API w jednym miejscu — sprawdź je przed doładowaniem.
| Element | Wartość |
|---|---|
| Format API | zgodne z OpenAI: działa każdy SDK OpenAI — zmień base URL i klucz |
| ID modelu | uncensored |
| Endpointy | POST /v1/chat/completions · GET /v1/models |
| Uwierzytelnianie | Authorization: Bearer YOUR_KEY |
| Base URL | https://api.llmapistatus.com/v1 |
| Tryb JSON | response_format: {"type": "json_object"} |
| Parametry | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Maks. odpowiedź | do reszty okna 100 000 tokenów; max_tokens opcjonalne (bez osobnego limitu) |
| Okno kontekstu | 100 000 tokenów (wejście + odpowiedź) |
| Wywoływanie funkcji | tak — tools, tool_choice; odpowiedź zawiera tool_calls, także w strumieniu; wyniki jako role: tool |
| Strumieniowanie | tak — server-sent events; ostatni fragment zawiera zużycie tokenów |
| Równoległe zapytania | do 8 jednocześnie na klucz |
| Limit zapytań | 300 zapytań na minutę na klucz |
| Rozmiar zapytania | do 8 MB |
| Nagłówki odpowiedzi | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Cena | $0,25 za 1 mln tokenów wejścia · $1,00 za 1 mln tokenów wyjścia |
| Darmowy kredyt | $0,50 na 7 dni, bez karty · Klucz próbny: 2 równoległe żądania, 60 na minutę; pełne limity (8 i 300) po pierwszym doładowaniu |
| Bonus | +5% od $50, +10% od $100 |
| Doładowanie | USDT (TRC20) lub USDC (Base), dowolna pełna kwota od $10 do $500 |
| Ważność | opłacony kredyt nie wygasa, bez subskrypcji |
| Rozliczenie | przedpłacony kredyt według rzeczywistego zużycia; błędy i odmowy są darmowe |
| Treści | treści dla dorosłych dozwolone; treści seksualne z udziałem nieletnich są odrzucane |
| Logowanie | Google albo e-mail i hasło |
| Klucze | jeden aktywny klucz na konto; nowy zastępuje stary |
Kody błędów
Błędy wracają jako JSON ze stałym type; nieudane i odrzucone zapytania są bezpłatne.
| Kod | Typ | Znaczenie |
|---|---|---|
400 | bad_request | błędny JSON, puste wiadomości, zły parametr lub za długi kontekst |
401 | missing_key · invalid_key · key_revoked | brak klucza, zły klucz lub klucz zastąpiony nowym |
402 | no_credit | brak kredytu — doładuj, działa od razu |
403 | content_blocked | treści seksualne z nieletnimi — odmowa, bez opłaty |
404 | not_found | nieznany endpoint |
413 | request_too_large | treść większa niż 8 MB |
429 | rate_limited · concurrency | ponad 300/min lub 8 równolegle — odczekaj i ponów |
503 | upstream_busy | model zajęty — ponów za kilka sekund |
Pytania i odpowiedzi
Czy ten model jest taki sam jak GPT-4 lub Claude?
Nie. ID modelu to "uncensored" i jest to model o otwartych wagach uruchamiany na naszych serwerach GPU. Jest dostrojony do użytku dorosłego bez odrzuceń treści, ale jest to odrębny model od GPT, Claude, Gemini czy innych dostawców.
Jak zacząć korzystanie z darmowego kredytu próbnego?
Zarejestruj się na stronie Uzyskanie klucza API, podając tylko e-mail i hasło. Otrzymasz $0.50 darmowego kredytu próbnego ważnego przez 7 dni. Nie jest wymagana karta kredytowa ani numer telefonu.
Co się stanie, gdy przekroczę limit zapytań?
Jeśli wykonasz ponad 300 zapytań na minutę, API zwróci kod statusu 429. Powinieneś zaimplementować wykładnicze opóźnienie ponownych prób w swoim kliencie. Możesz wygenerować klucz ponownie, jeśli zajdzie taka potrzeba, ale limit zapytań dotyczy każdego klucza z osobna.
Twój klucz jest o jeden formularz stąd
Utwórz konto, skopiuj klucz, zmień bazowy URL. To cały proces konfiguracji.