Pi + Qwen3.8-27B: максимум качества дают свежий vLLM, парсеры qwen3 / qwen3_coder и thinking на high

Спросили:
«pi.dev + qwen3.8 27b я хочу такую конфигурацию чтобы это ощущалось как claude code. то есть я хочу качество ответов, рассуждения и всего на высочайшем уровне!»

Гайд собран из 9 источников с 4 независимых хостов: официальная документация Pi, официальные материалы Qwen (model card, GitHub, GGUF-карточка), страница Ollama и два независимых community-отчёта о деплое. Все параметры ниже взяты из этих страниц; официальные значения отделены от community-измерений. Данные проверены 2026-09-07.

Архитектура качественного стека

Наведите на блок — подсказка объясняет его роль. Красным помечено то, что чаще всего ломает tool calling.
Парсер решает всё: chat-шаблон Qwen3.8 эмитит tool-calls в XML-формате, который читает именно qwen3_coder, а не JSON-парсер hermes — с ним вызовы инструментов ломаются. github.com
Thinking включён по умолчанию и отключается per-request; глубина управляется через reasoning_effort, а рассуждения из истории сохраняются через preserve_thinking. huggingface.co
Нативный контекст — 262 144 токена, расширяем до 1M через YaRN, но статический YaRN «может ухудшать качество на коротких текстах» — для coding-агента 1M не включаем. huggingface.co
Pi даёт модели четыре инструментаread, write, edit, bash — и уровни thinking off/minimal/low/medium/high/xhigh/max. github.com

1. Сервер: два проверенных варианта

Эталон качества официальный

Рекомендованная Qwen команда vLLM для достаточного GPU-пула (tensor parallel 4, полный нативный контекст):

vllm serve Qwen/Qwen3.8-27B --port 8000 \
  --tensor-parallel-size 4 \
  --max-model-len 262144 \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder
Источник: github.com (репозиторий QwenLM). Аналогичная команда есть и для SGLang: --reasoning-parser qwen3 --tool-call-parser qwen3_coder.

Один GPU 24 GB community

Проверенный community-деплой: Qwen3.8-27B на одной 24 GB Ampere+ карте через vLLM, 150k контекста, OpenAI-совместимый API. Оба лаунчера рецепта ставят:

--enable-auto-tool-choice --tool-call-parser qwen3_coder

Это отдельный готовый deployment-рецепт: точный формат квантования и команды запуска берите из репозитория, а не воспроизводите по памяти. Нужны: 24 GB Ampere+ NVIDIA, свежий драйвер, Python 3.12, ~40 GB диска.

Источник: github.com

Fallback: Ollama простой путь, не максимум качества

ollama pull qwen3.8:27b        # Q4_K_M, ~17 GB
Q4_K_M дал ~14 tok/s на Mac Studio M3 Ultra — аппаратно-зависимый ориентир, не универсальный benchmark. Источник: terminalbytes.com

2. Pi: ~/.pi/agent/models.json

На основе официального минимального примера Pi для локальных OpenAI-совместимых серверов. Минимально гарантировано: baseUrl, api: openai-completions, локальный apiKey и id модели. contextWindow задаём явно (по умолчанию Pi считает 128 000) и никогда не выше реального --max-model-len сервера: 262144 для эталона, 150000 для 24 GB.

{
  "providers": {
    "local-qwen": {
      "baseUrl": "http://localhost:8000/v1",
      "api": "openai-completions",
      "apiKey": "local",
      "models": [
        {
          "id": "Qwen/Qwen3.8-27B",
          "contextWindow": 262144
        }
      ]
    }
  }
}
Опциональные metadata-поля (например thinkingLevelMap, описывающий model-specific thinking controls) — надстройка, не обязательные ключи. Источник: github.com

3. Pi: ~/.pi/agent/settings.json

{
  "defaultProvider": "local-qwen",
  "defaultModel": "Qwen/Qwen3.8-27B",
  "defaultThinkingLevel": "high",
  "compaction": {
    "enabled": true,
    "reserveTokens": 16384,
    "keepRecentTokens": 20000
  },
  "retry": {
    "enabled": true,
    "maxRetries": 3
  }
}
Структура — из официального примера настроек Pi. Источник: github.com

Запуск с нужным уровнем разово: pi --thinking high. Уровни Pi — off, minimal, low, medium, high, xhigh, max, но как именно они отображаются в reasoning_effort, зависит от поддержки API и thinkingLevelMap; без подтверждённого маппинга не рассчитывайте, что xhigh/max реально дадут более глубокое мышление, чем high. Для сложной разработки — high; для простых правок переключайтесь на medium.

4. Sampling: официальные значения Qwen

Режимtemptop_ptop_kmin_ppresencerepetition
Thinking (по умолчанию)1.00.9520001.0
Non-thinking0.70.802001.51.0
Presence_penalty выше нуля снижает зацикливание, но может вызвать смешение языков и лёгкую просадку качества. Источник: huggingface.co

5. Не делайте так

Не hermes. Tool-call parser hermes читает JSON, а Qwen3.8 эмитит XML — используйте только qwen3_coder.
Не 1-bit для agentic-работы. Community-тест: 1-bit квант (6.7 GB) быстр, «gets facts right, but it cannot commit to an answer»; Unsloth прямо не рекомендует 1-bit для tool calling, минимум — Q2_K_XL (9.8 GB). terminalbytes.com
Не старый llama.cpp. Нужна свежая сборка: старые падают с unknown model architecture: 'qwen35'.
Не 1M YaRN без нужды. Статический YaRN может ухудшать короткие тексты; для coding-агента держите native 262 144 или реалистичные 150k на 24 GB.

6. Честное ограничение и рабочий режим

Правильный harness, парсеры, thinking и дисциплина промптов заметно приближают UX к Claude Code, но локальная 27B-модель не станет Claude Opus/Sonnet по абсолютной надёжности, долгому планированию и самокоррекции. Компенсируйте процессом:

AGENTS.md для проекта (рекомендуемая авторская надстройка, не цитата из документации)

# Правила агента

1. Перед любой правкой: изучи структуру репозитория и составь план. Не редактируй, пока план не подтверждён.
2. Работай маленькими шагами. Один шаг — одно проверяемое изменение.
3. После каждого шага запускай тесты и линтер. Не переходи дальше на красных тестах.
4. Всегда читай файл целиком перед edit. Никогда не редактируй вслепую.
5. Не выдумывай API: если сигнатура неизвестна — прочитай исходник или скажи, что не знаешь.
6. Не подавляй ошибки (никаких пустых catch, ignore, || true).
7. Минимальный diff: не переформатируй и не рефактори то, о чём не просили.

7. Проверочный checklist

8. Источники

ИсточникТипЧто взялиСсылка

Данные: 9 строк источников (официальная документация Pi, официальные материалы Qwen, Ollama, два независимых community deployment-отчёта), 4 независимых хоста, каждый URL встречается один раз; проверено 2026-09-07. Числа — параметры конфигурации и измерения производительности с исходных страниц; community-цифры (tok/s, размеры квантов) аппаратно-зависимы. Ради компактности схема показывает поток запроса, а не все опции CLI.

This report was generated automatically by Keenable SELECT at a user's request, from publicly available web sources linked herein. Keenable does not review, verify, or endorse its contents and makes no representation as to accuracy, completeness, or timeliness; AI-based extraction may contain errors. Nothing in this report is investment, legal, financial, or other professional advice. All trademarks and referenced content remain the property of their respective owners; no affiliation or endorsement is implied. To report an error, rights concern, or request removal: legal@keenable.ai.

Keenable SELECTAsk your own question
Made with Keenable SELECT