На 4 GB VRAM (Pascal sm_61) в 2026 выигрывают компактные сборки: GigaAM-v3 для русского STT, Silero и Chatterbox LiteRT для TTS

Спросили:«найди подходящие последние локальные LLM TTS и STT для видеокарт с 4Gb VRAM в 2026 году»

Итоговый shortlist на 2026-09-07 — 13 строк (STT и TTS) плюс 40 расширенных технических вариантов для деталей; дубли одного семейства (GigaAM, XTTS, Qwen3) на матрице объединены. CUDA 13 прекратила поддержку Pascal, поэтому безопасная база — CPU/ONNX/GGUF/OpenVINO либо сборки под CUDA 12.x; FlashAttention 2 на sm_61 тоже не вариант. Размеры ниже — это размер файла или параметры модели, не VRAM, если не сказано иначе.

gigastt — локальный сервер GigaAM-v3, INT8 ~225 MB: точнейший на 3 из 4 русских доменов (дальнее поле 4.08%, телефон 18.50%, YouTube 10.91%) — github.com
GGUF-вариант gigaam-v3-ctc (Q5_K_M, 195 MB) дает WER 8.29% на FLEURS ru через transcribe.cpp без Python — huggingface.co
Parakeet-TDT-0.6B-v3: русский WER 5.51 (FLEURS) и 3.00 (CoVoST2), минимум 2 GB RAM на загрузку — но это системная RAM, а NeMo/CUDA-стек на Pascal нужно тестировать — huggingface.co
Qwen3-TTS-0.6B: файл 2.52 GB, но заявленный минимум 4 GB и рекомендация 6 GB VRAM делают стандартную сборку пограничной; путь — GGUF/audio.cpp и CPU/offload — zimage.run · зеркало github (audio.cpp)

Рейтинг STT (русский)

  1. GigaAM-v3 — gigastt INT8 (~225 MB) как локальный сервер или transcribe.cpp GGUF (195–259 MB). Режим: CPU/ONNX/GGUF; CUDA 12+ опционально. Ставить первым.
  2. Parakeet-TDT-0.6B-v3 — запас для многоязычности. Режим: NeMo/CUDA 12.x (тестировать на Pascal) или NeMo-Speech.cpp на CPU.
  3. Qwen3-ASR-0.6B — новинка 2026. Только CPU (transformers) или подтвержденная квантованная сборка; vLLM-путь не считать sm_61-friendly.

Рейтинг TTS (русский)

  1. Silero TTS — 6 русских голосов, GPU не нужен, работает на одном потоке CPU. Максимум надежности.
  2. Chatterbox Multilingual LiteRT — INT8 ~0.5 GB на компонент, 24 kHz, эмоции и zero-shot клонирование; порт экспериментальный (сторонняя конверсия).
  3. Qwen3-TTS-0.6B — русский с обработкой фонетики; только через GGUF/audio.cpp, CPU/offload, короткий контекст.
  4. XTTS-v2 — резерв для клонирования: по отчетам ~2.6 GB VRAM фактически, но старее, тяжелее, лицензия CPML.

Практические пресеты

Максимум надежностиSTT: gigastt INT8 на CPU · TTS: Silero. Ни один компонент не трогает CUDA.
Качество русскогоSTT: GigaAM-v3 e2e-RNNT GGUF (WER 5.35% FLEURS ru) · TTS: Chatterbox LiteRT INT8.
Клонирование голосаChatterbox LiteRT (zero-shot, эмоции); резерв — XTTS-v2 (клон по 6 с аудио), следить за VRAM.
МногоязычностьSTT: Parakeet-TDT-0.6B-v3 (CPU/C++ путь безопаснее) · TTS: Chatterbox Multilingual.

Установка и совместимость

  • База: драйвер с CUDA 12.x или чистый CPU. CUDA 13 не поддерживает Pascal, FlashAttention 2 не собирается под sm_61.
  • gigastt: Linux x86_64, опционально образ GHCR :cuda (CUDA 12+).
  • transcribe.cpp / audio.cpp: cmake-сборка, чистый C++/ggml, без Python.
  • GigaAM ONNX: onnxruntime на CPU; onnxruntime-gpu 1.22.* — только после проверки на карте.
  • Не путать: параметры модели, размер файла на диске, системная RAM и VRAM — четыре разные величины.

Не выбирать по умолчанию

  • Whisper large-v3 / large-v3-turbo в полном FP16 — не помещается в 4 GB с запасом.
  • Qwen3-ASR-1.7B в стандартном PyTorch — SOTA-качество, но не для этой карты.
  • XTTS-v2 при расходе памяти выше лимита — сторонние карточки называют и 6–8 GB VRAM рекомендованными.
  • Любая сборка, требующая CUDA 13 или FlashAttention 2.

Пометки: Chatterbox LiteRT, GGUF-конверсии GigaAM/Qwen3 и оценка ~2.6 GB для XTTS — сторонние конверсии и неподтвержденные цифры; проверять на своей карте, скорость без замера не обещаем.

Shortlist: все 13 строк

ТипМодельРазмерРусскийRuntimeЛицензияИсточник

Данные: исследовательский shortlist из 13 моделей STT/TTS и 40 расширенных технических вариантов, собранные к 2026-09-07 с github.com, huggingface.co, zimage.run и зеркала GitHub; ни один URL не дал более 2 из 13 строк. Оси матрицы — экспертные оценки надежности на Pascal sm_61 / 4 GB VRAM и качества по заявленным метрикам (WER — доля ошибок слов, ниже лучше). Дубли семейств объединены на матрице; расширенные 40 строк использованы только для деталей и в таблицу не включены.

This report was generated automatically by Keenable SELECT at a user's request, from publicly available web sources linked herein. Keenable does not review, verify, or endorse its contents and makes no representation as to accuracy, completeness, or timeliness; AI-based extraction may contain errors. Nothing in this report is investment, legal, financial, or other professional advice. All trademarks and referenced content remain the property of their respective owners; no affiliation or endorsement is implied. To report an error, rights concern, or request removal: legal@keenable.ai.

Keenable SELECTAsk your own question
Made with Keenable SELECT