03 · гайд
Чат / LLM
Текстовые модели работают через стандартный POST https://api.node404.ru/v1/chat/completions. Список моделей и цены за 1M токенов (вход/выход) — в разделе «Модели → Текст».
curl https://api.node404.ru/v1/chat/completions \
-H "Authorization: Bearer sk-ВАШ_КЛЮЧ" \
-H "Content-Type: application/json" \
-d '{
"model": "n4/claude-sonnet-5",
"messages": [
{"role": "system", "content": "Ты — технический ассистент."},
{"role": "user", "content": "Объясни, что такое идемпотентность."}
],
"temperature": 0.7,
"stream": false
}'
Стриминг
"stream": true — ответ приходит порциями в формате SSE: чанки chat.completion.chunk, текст в choices[0].delta.content, финальная строка data: [DONE]. Исключение — семейство GPT-5.6: оно стримит события Responses API (response.output_text.delta с текстом в delta, завершение — событие response.completed / response.failed, строки [DONE] может не быть) — см. блок ниже.
Особенность GPT-5.6 и Grok
n4/gpt-5.6-* (Luna, Terra, Sol) работают через Responses API: POST https://api.node404.ru/v1/responses с полем input вместо messages и обязательным "stream": true. Запрос в chat/completions для них вернёт 400 с кодом wrong_endpoint и подсказкой. Поле user этим моделям не передавайте — вернётся ошибка. Поля temperature и top_p у этой reasoning-серии не действуют. Модели n4/grok-4.* (4.3, 4.5, 4.6) тоже работают только через Responses API — POST https://api.node404.ru/v1/responses с полем input; стрим у них по желанию, поле user допустимо, запрос в chat/completions вернёт 400 с кодом wrong_endpoint. Остальные текстовые модели — обычный chat/completions, стрим по желанию.curl https://api.node404.ru/v1/responses \
-H "Authorization: Bearer sk-ВАШ_КЛЮЧ" \
-H "Content-Type: application/json" \
-d '{
"model": "n4/gpt-5.6-luna",
"input": "Коротко: что такое REST?",
"stream": true
}'
Ответ — SSE-события: текст приходит в response.output_text.delta (поле delta), финал — событие response.completed.
Инструменты и веб-поиск
Function calling работает у GPT-5.6 (поле tools в формате Responses API — события response.function_call_arguments.*) и у Gemini (tools в формате chat/completions — tool_calls в ответе). Веб-поиск у GPT-5.6: "tools": [{"type": "web_search"}] — в потоке появятся события response.web_search_call.*, найденное войдёт в ответ. Отдельной платы за поиск нет: тарифицируются токены запроса и ответа, как обычно.
Тарификация
Списание = входные токены × цена входа + выходные × цена выхода (цены за 1M — на странице модели). Фактический расход каждого вызова виден в кабинете («Логи», «Аналитика»).