«Какие LLM можно обучить на 4х RTX A6000 Ada (48GB каждая)»
Сводка по официальным карточкам моделей Qwen3, Gemma 3, Llama 3.1, Mistral Small и DeepSeek-R1-Distill (варианты 1.5B–70B), спецификациям RTX 6000 Ada (48 ГБ GDDR6 на карту, три источника) и документации по методам экономии памяти (QLoRA, DeepSpeed ZeRO, gradient checkpointing). Важно: 192 ГБ — это четыре отдельных пула по 48 ГБ, крупные модели шардируются через FSDP или ZeRO-3.
| Модель | Параметры | Рекомендуемый режим на 4×48 ГБ | Источник |
|---|---|---|---|
| Llama 3.1 8B | 8B | Full fine-tuning — sweet spot | huggingface.co |
| Qwen3-8B | 8.2B | Full fine-tuning — sweet spot | huggingface.co |
| Gemma 3 4B | 4B | Full fine-tuning — комфортно | ai.google.dev |
| DeepSeek-R1-Distill 7B / 8B | 7–8B | Full fine-tuning — sweet spot | huggingface.co |
| Qwen3-14B | 14.8B | Full FT — погранично; LoRA/QLoRA — комфортно | huggingface.co |
| Gemma 3 12B / 27B | 12B / 27B | LoRA/QLoRA — комфортно | ai.google.dev |
| Mistral Small 3.1 | 24B | LoRA/QLoRA — комфортно | mistral.ai |
| Qwen3-32B | 32.8B | LoRA/QLoRA — комфортно | huggingface.co |
| DeepSeek-R1-Distill-Qwen 14B / 32B | 14B / 32B | LoRA/QLoRA — комфортно | huggingface.co |
| Llama 3.1 70B | 70B | QLoRA — реалистично | huggingface.co |
| DeepSeek-R1-Distill-Llama-70B | 70B | QLoRA — реалистично | huggingface.co |
Плюс активации. Полный fine-tuning 8B укладывается в 192 ГБ с шардированием, 70B при полном AdamW требует более тысячи гигабайт — только LoRA/QLoRA. Длина контекста, micro-batch, attention implementation и checkpointing заметно сдвигают границу.
Данные собраны 2026-09-01: 3 страницы спецификаций RTX 6000 Ada (48 ГБ на карту), 59 строк официальных карточек Qwen3, Gemma 3, Llama 3.1 и Mistral, 122 строки источников по DeepSeek-R1-Distill (1.5B–70B), 50 строк документации по QLoRA, PEFT, DeepSpeed ZeRO и техникам экономии памяти. Границы «комфортно/погранично» — инженерные оценки по бюджету ~16–20 байт на параметр при полном AdamW и ~0.5 байта для 4-bit базы; реальный предел зависит от архитектуры, контекста, batch size и реализации. За рамками: MoE-модели (Qwen3-235B-A22B и др.), Llama 3.1 405B и embedding/reranker-варианты.