Chat completions
Senast uppdaterad:
På denna sida
text
POST https://api.staik.se/v1/chat/completionsFullt OpenAI-kompatibel — befintliga SDK:er fungerar direkt med ny base_url.
python
from openai import OpenAI
client = OpenAI(api_key="sk-st-your-key", base_url="https://api.staik.se/v1")
response = client.chat.completions.create(
model="qwen3.6:35b-a3b",
messages=[
{"role": "system", "content": "Du är en hjälpsam assistent som svarar kort."},
{"role": "user", "content": "Vad är skillnaden mellan TCP och UDP?"},
],
max_tokens=500,
temperature=0.7,
)
print(response.choices[0].message.content)Parametrar
| Parameter | Typ | Beskrivning |
|---|---|---|
model | string | Modell-id, se Modeller. Krävs. |
messages | array | Konversationen: system, user, assistant (och tool). Krävs. |
max_tokens | int | Utrymme som reserveras för svaret. Utelämnas den sätts ett rimligt standardvärde per modell. |
temperature | float | 0–2, högre = mer kreativt. |
stream | bool | Token-för-token via SSE — se Streaming. |
tools / tool_choice | array | Funktionsanrop — se Tool calling. |
web_search | bool | Server-side webbsökning — se Web search. |
Kontext och max_tokens
Din prompt plus max_tokens måste rymmas inom modellens kontextfönster
(262K för chat-modellerna). Överskrids det returneras 400 — korta prompten
eller sänk max_tokens.
Vision
Endast gemma4:31b har vision. Skicka bilder som image_url i messages med en
base64-kodad data-URI (externa bild-URL:er hämtas inte). Vision-anrop körs med
16K kontextfönster.
python
response = client.chat.completions.create(
model="gemma4:31b",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Vad visar bilden?"},
{"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,..."}},
],
}],
)Thinking-läge
Aliasen qwen3.6:35b-a3b-thinking och qwen3.5:9b-thinking kör samma modeller
med resonemang aktiverat. Resonemanget levereras separat i
choices[0].message.reasoning_content (icke-streamat) respektive
choices[0].delta.reasoning_content (streamat) — själva svaret förblir rent.