Гайд собран из 9 источников с 4 независимых хостов: официальная документация Pi, официальные материалы Qwen (model card, GitHub, GGUF-карточка), страница Ollama и два независимых community-отчёта о деплое. Все параметры ниже взяты из этих страниц; официальные значения отделены от community-измерений. Данные проверены 2026-09-07.
qwen3_coder, а не JSON-парсер hermes — с ним вызовы инструментов ломаются. github.comreasoning_effort, а рассуждения из истории сохраняются через preserve_thinking. huggingface.coread, write, edit, bash — и уровни thinking off/minimal/low/medium/high/xhigh/max. github.comРекомендованная Qwen команда vLLM для достаточного GPU-пула (tensor parallel 4, полный нативный контекст):
vllm serve Qwen/Qwen3.8-27B --port 8000 \
--tensor-parallel-size 4 \
--max-model-len 262144 \
--reasoning-parser qwen3 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder
--reasoning-parser qwen3 --tool-call-parser qwen3_coder.Проверенный community-деплой: Qwen3.8-27B на одной 24 GB Ampere+ карте через vLLM, 150k контекста, OpenAI-совместимый API. Оба лаунчера рецепта ставят:
--enable-auto-tool-choice --tool-call-parser qwen3_coder
Это отдельный готовый deployment-рецепт: точный формат квантования и команды запуска берите из репозитория, а не воспроизводите по памяти. Нужны: 24 GB Ampere+ NVIDIA, свежий драйвер, Python 3.12, ~40 GB диска.
ollama pull qwen3.8:27b # Q4_K_M, ~17 GB
На основе официального минимального примера Pi для локальных OpenAI-совместимых серверов. Минимально гарантировано: baseUrl, api: openai-completions, локальный apiKey и id модели. contextWindow задаём явно (по умолчанию Pi считает 128 000) и никогда не выше реального --max-model-len сервера: 262144 для эталона, 150000 для 24 GB.
{
"providers": {
"local-qwen": {
"baseUrl": "http://localhost:8000/v1",
"api": "openai-completions",
"apiKey": "local",
"models": [
{
"id": "Qwen/Qwen3.8-27B",
"contextWindow": 262144
}
]
}
}
}
thinkingLevelMap, описывающий model-specific thinking controls) — надстройка, не обязательные ключи. Источник: github.com{
"defaultProvider": "local-qwen",
"defaultModel": "Qwen/Qwen3.8-27B",
"defaultThinkingLevel": "high",
"compaction": {
"enabled": true,
"reserveTokens": 16384,
"keepRecentTokens": 20000
},
"retry": {
"enabled": true,
"maxRetries": 3
}
}
Запуск с нужным уровнем разово: pi --thinking high. Уровни Pi — off, minimal, low, medium, high, xhigh, max, но как именно они отображаются в reasoning_effort, зависит от поддержки API и thinkingLevelMap; без подтверждённого маппинга не рассчитывайте, что xhigh/max реально дадут более глубокое мышление, чем high. Для сложной разработки — high; для простых правок переключайтесь на medium.
hermes читает JSON, а Qwen3.8 эмитит XML — используйте только qwen3_coder.unknown model architecture: 'qwen35'.Правильный harness, парсеры, thinking и дисциплина промптов заметно приближают UX к Claude Code, но локальная 27B-модель не станет Claude Opus/Sonnet по абсолютной надёжности, долгому планированию и самокоррекции. Компенсируйте процессом:
edit, не гадать об API, не подавлять ошибки, сохранять минимальный diff.# Правила агента
1. Перед любой правкой: изучи структуру репозитория и составь план. Не редактируй, пока план не подтверждён.
2. Работай маленькими шагами. Один шаг — одно проверяемое изменение.
3. После каждого шага запускай тесты и линтер. Не переходи дальше на красных тестах.
4. Всегда читай файл целиком перед edit. Никогда не редактируй вслепую.
5. Не выдумывай API: если сигнатура неизвестна — прочитай исходник или скажи, что не знаешь.
6. Не подавляй ошибки (никаких пустых catch, ignore, || true).
7. Минимальный diff: не переформатируй и не рефактори то, о чём не просили.
--reasoning-parser qwen3, --enable-auto-tool-choice, --tool-call-parser qwen3_coder.contextWindow в models.json ≤ --max-model-len сервера (262144 или 150000).pi --thinking high отвечает с рассуждением; tool-calls (read/write/edit/bash) исполняются без ошибок парсинга.| Источник | Тип | Что взяли | Ссылка |
|---|
Данные: 9 строк источников (официальная документация Pi, официальные материалы Qwen, Ollama, два независимых community deployment-отчёта), 4 независимых хоста, каждый URL встречается один раз; проверено 2026-09-07. Числа — параметры конфигурации и измерения производительности с исходных страниц; community-цифры (tok/s, размеры квантов) аппаратно-зависимы. Ради компактности схема показывает поток запроса, а не все опции CLI.