«Я хочу обучить smoLM от huggingface для ориентирования в русских документ по ГОСТ (VLM). Я хочу чтобы модель понимала где содержание, а где рисунок с подписью. Есть ли спрос на такую задачу? Как я могу это использовать?»
Короткое уточнение: для изображений документов подойдёт не текстовый SmolLM, а мультимодальный SmolVLM / SmolVLM2 (варианты 256M, 500M, 2B и SmolVLM2 2.2B; image+text → text). Отчёт собран из 76 строк источников: карточки Hugging Face по семейству SmolVLM (55 записей), российские сигналы SMART-стандартов (4), продуктовый рынок layout analysis ABBYY (2) и датасет DocLayNet на 80 863 размеченные страницы (15). Собрано к сентябрю 2026.
Наведите курсор на любой узел — подсветится его путь. Классификация «рисунок / содержание» — лишь один этап в середине цепочки; деньги находятся справа.
Оценка коммерческого потенциала — рекомендация на основе собранных сигналов, не измерение рынка. Точной оценки ниши в рублях нет.
Ключевой сигнал спроса в пилоте: клиент готов дать реальные документы, эксперта для разметки и бюджет. Лайки и «интересно» спросом не считать.
Если есть текстовый слой — сначала координаты текста напрямую; vision только для сканов и визуальных блоков.
Для точной геометрии сравнить SmolVLM со специализированным детектором (DocLayout-YOLO, RT-DETR, Detectron): малый детектор часто дешевле и стабильнее.
Метрики CER/WER отдельно от геометрии.
Связи figure_id↔caption_id и toc_entry↔section_id хранить отдельно. «Содержание» неоднозначно: различать оглавление и основной текст.
Здесь SmolVLM полезен: подписи, сложные случаи, JSON.
Начать со SmolVLM/SmolVLM2 2–2.2B, а не 256M/500M: русская техническая лексика, мелкий шрифт и строгий JSON сложнее общего captioning. На 4×48 ГБ модель очень мала — baseline на одной GPU, остальные карты под эксперименты, рендеринг и teacher inference. Большая GPU-конфигурация не компенсирует плохую разметку.
Bootstrap на DocLayNet, затем свой русский набор: MVP 3–5 тыс. страниц из 100–300 документов разных лет и качества; pilot 10–20 тыс. Делить train/val/test по документам, не страницам. Hard cases: двухколоночные страницы, «Рисунок А.1», повернутые схемы, штампы, старые сканы.
title, section_heading, body_text, list, table, table_caption, figure, figure_caption, formula, note, warning, header, footer, page_number, toc_title, toc_entry, annex_title.
F1 ≥ 0.90 по figure/caption, pairing ≥ 0.95 на чистых PDF, выигрыш времени специалиста ≥ 30%. Для бизнеса важнее end-to-end: Recall@k нужного требования, доля ответов с верной страницей и цитатой.
| Источник | Что даёт | Факт | Ссылка |
|---|---|---|---|
| SmolVLM (Hugging Face) | Модель image+text→text, компактная, Apache 2.0 | варианты 256M / 500M / 2B | huggingface.co |
| SmolVLM2 2.2B (блог HF) | Рекомендуемый стартовый чекпоинт | SmolVLM2-2.2B-Instruct доступен | huggingface.co/blog |
| SMART-стандарты (обзор) | Российский сигнал машиночитаемых стандартов | ПНСТ 864-2023 + 4 проекта ПНСТ | alee.ru |
| ISO SAG on Machine-Readable Standards | Международный тренд | определение machine-readable standard для ISO | stdforum.gostinfo.ru |
| Росстандарт: первые ГОСТы по ИИ | Госактивность в теме ИИ-стандартов | ГОСТ Р 58776-2019, ГОСТ Р 58777-2019 | ict.moscow |
| Росстандарт: ИИ в метрологии | Инициатива международного ИИ-стандарта | предложение 2026 года | vfokuse.mail.ru |
| ABBYY FineReader Engine | Существующий рынок layout analysis | выделяет параграфы, линии, изображения, штрихкоды | support.abbyy.com |
| ABBYY: архивирование документации | Сценарий архивов проектной документации | нет автоматического разделения на документы | help.abbyy.com |
| DocLayNet (датасет) | База для transfer learning | 80 863 страницы, 11 классов, 6 категорий | huggingface.co |
| DocLayNet (статья) | Категории: финансы, наука, патенты, законы, тендеры, руководства | human-annotated разметка bbox | arxiv.org |
Метод: 76 строк из четырёх наборов источников — 55 страниц Hugging Face по SmolVLM/SmolVLM2, 4 материала о SMART-стандартах и Росстандарте, 2 страницы документации ABBYY, 15 страниц о DocLayNet; собрано 2026-09-01. Оценки сегментов, целевые метрики и план 6–8 недель — рекомендации автора, не измеренные факты; точный размер ниши в рублях не оценивался. Из таблицы для экономии места убраны дубли коммитов и зеркал репозиториев.