192 ГБ на четырех RTX 6000 Ada: полный fine-tuning — до 8B, LoRA/QLoRA — до 70B, предобучение с нуля — 0.5–3B

Вопрос:

«Какие LLM можно обучить на 4х RTX A6000 Ada (48GB каждая)»

Сводка по официальным карточкам моделей Qwen3, Gemma 3, Llama 3.1, Mistral Small и DeepSeek-R1-Distill (варианты 1.5B–70B), спецификациям RTX 6000 Ada (48 ГБ GDDR6 на карту, три источника) и документации по методам экономии памяти (QLoRA, DeepSpeed ZeRO, gradient checkpointing). Важно: 192 ГБ — это четыре отдельных пула по 48 ГБ, крупные модели шардируются через FSDP или ZeRO-3.

Карта возможностей по размеру модели

комфортно погранично не рекомендуется
≤4B
7–8B
12–14B
24–32B
70B
100B+
Каждая карта несёт 48 ГБ GDDR6 — суммарно 192 ГБ, но это не единая память: перед стартом проверяйте PCIe-топологию и peer-to-peer — pny.com
Статья QLoRA прямо демонстрирует fine-tuning 65B-модели на одной GPU с 48 ГБ — четыре такие карты дают запас для класса 70B в 4-bit — arxiv.org
DeepSpeed ZeRO шардирует optimizer states, gradients и parameters между процессами вместо репликации — это и делает полный fine-tuning 7–8B комфортным на четырёх картах — deepspeed.readthedocs.io
DeepSeek официально выпустил шесть дистиллятов R1 — 1.5B, 7B, 8B, 14B, 32B и 70B на базе Qwen2.5 и Llama 3 — весь ряд покрывается этой конфигурацией в LoRA/QLoRA — huggingface.co

Конкретные семейства и рекомендуемый режим

МодельПараметрыРекомендуемый режим на 4×48 ГБИсточник
Llama 3.1 8B8BFull fine-tuning — sweet spothuggingface.co
Qwen3-8B8.2BFull fine-tuning — sweet spothuggingface.co
Gemma 3 4B4BFull fine-tuning — комфортноai.google.dev
DeepSeek-R1-Distill 7B / 8B7–8BFull fine-tuning — sweet spothuggingface.co
Qwen3-14B14.8BFull FT — погранично; LoRA/QLoRA — комфортноhuggingface.co
Gemma 3 12B / 27B12B / 27BLoRA/QLoRA — комфортноai.google.dev
Mistral Small 3.124BLoRA/QLoRA — комфортноmistral.ai
Qwen3-32B32.8BLoRA/QLoRA — комфортноhuggingface.co
DeepSeek-R1-Distill-Qwen 14B / 32B14B / 32BLoRA/QLoRA — комфортноhuggingface.co
Llama 3.1 70B70BQLoRA — реалистичноhuggingface.co
DeepSeek-R1-Distill-Llama-70B70BQLoRA — реалистичноhuggingface.co

Почему 192 ГБ не значит «полный fine-tuning 70B»

Память на параметр при обучении

4-bit база (QLoRA)
~0.5 Б/парам
Веса BF16
~2 Б/парам
Полный AdamW: веса + градиенты + master weights + 2 состояния оптимизатора
~16–20 Б/парам

Плюс активации. Полный fine-tuning 8B укладывается в 192 ГБ с шардированием, 70B при полном AdamW требует более тысячи гигабайт — только LoRA/QLoRA. Длина контекста, micro-batch, attention implementation и checkpointing заметно сдвигают границу.

Практический стек

  • Linux + PyTorch, Transformers/TRL, Accelerate
  • FSDP2 или DeepSpeed ZeRO-3 — шардирование optimizer states, gradients и parameters
  • bitsandbytes или torchao для QLoRA (4-bit база + LoRA-адаптеры)
  • BF16, gradient checkpointing, FlashAttention
  • Не использовать обычный DataParallel — он реплицирует модель на каждую карту
  • Проверить PCIe-топологию и peer-to-peer между картами

Данные собраны 2026-09-01: 3 страницы спецификаций RTX 6000 Ada (48 ГБ на карту), 59 строк официальных карточек Qwen3, Gemma 3, Llama 3.1 и Mistral, 122 строки источников по DeepSeek-R1-Distill (1.5B–70B), 50 строк документации по QLoRA, PEFT, DeepSpeed ZeRO и техникам экономии памяти. Границы «комфортно/погранично» — инженерные оценки по бюджету ~16–20 байт на параметр при полном AdamW и ~0.5 байта для 4-bit базы; реальный предел зависит от архитектуры, контекста, batch size и реализации. За рамками: MoE-модели (Qwen3-235B-A22B и др.), Llama 3.1 405B и embedding/reranker-варианты.

This report was generated automatically by Keenable SELECT at a user's request, from publicly available web sources linked herein. Keenable does not review, verify, or endorse its contents and makes no representation as to accuracy, completeness, or timeliness; AI-based extraction may contain errors. Nothing in this report is investment, legal, financial, or other professional advice. All trademarks and referenced content remain the property of their respective owners; no affiliation or endorsement is implied. To report an error, rights concern, or request removal: legal@keenable.ai.

Made withKeenable SELECT · 5,094 pages in 8m 13s · Ask your own questionShare:XLinkedInReddit
Made with Keenable SELECT