Спрос есть — но платят не за детектор блоков, а за парсер ГОСТ с поиском, цитатой и проверкой соответствия

Вопрос:

«Я хочу обучить smoLM от huggingface для ориентирования в русских документ по ГОСТ (VLM). Я хочу чтобы модель понимала где содержание, а где рисунок с подписью. Есть ли спрос на такую задачу? Как я могу это использовать?»

Короткое уточнение: для изображений документов подойдёт не текстовый SmolLM, а мультимодальный SmolVLM / SmolVLM2 (варианты 256M, 500M, 2B и SmolVLM2 2.2B; image+text → text). Отчёт собран из 76 строк источников: карточки Hugging Face по семейству SmolVLM (55 записей), российские сигналы SMART-стандартов (4), продуктовый рынок layout analysis ABBYY (2) и датасет DocLayNet на 80 863 размеченные страницы (15). Собрано к сентябрю 2026.

Цепочка ценности: от PDF ГОСТ к платящим сегментам

Наведите курсор на любой узел — подсветится его путь. Классификация «рисунок / содержание» — лишь один этап в середине цепочки; деньги находятся справа.

этапы обработки продукты сегменты спроса

Матрица сегментов: ценность против сложности продаж

Оценка коммерческого потенциала — рекомендация на основе собранных сигналов, не измерение рынка. Точной оценки ниши в рублях нет.

Проверка спроса за 6–8 недель — до большого обучения

Ключевой сигнал спроса в пилоте: клиент готов дать реальные документы, эксперта для разметки и бюджет. Лайки и «интересно» спросом не считать.

Техника: не VLM-only, а конвейер

1 · Рендер PDF 200–300 dpi

Если есть текстовый слой — сначала координаты текста напрямую; vision только для сканов и визуальных блоков.

2 · Layout detector / segmenter

Для точной геометрии сравнить SmolVLM со специализированным детектором (DocLayout-YOLO, RT-DETR, Detectron): малый детектор часто дешевле и стабильнее.

3 · OCR русского текста

Метрики CER/WER отдельно от геометрии.

4 · Pairing рисунок ↔ подпись, reading order, иерархия разделов

Связи figure_id↔caption_id и toc_entry↔section_id хранить отдельно. «Содержание» неоднозначно: различать оглавление и основной текст.

5 · VLM/LLM для семантики и structured output

Здесь SmolVLM полезен: подписи, сложные случаи, JSON.

Модель

Начать со SmolVLM/SmolVLM2 2–2.2B, а не 256M/500M: русская техническая лексика, мелкий шрифт и строгий JSON сложнее общего captioning. На 4×48 ГБ модель очень мала — baseline на одной GPU, остальные карты под эксперименты, рендеринг и teacher inference. Большая GPU-конфигурация не компенсирует плохую разметку.

Данные

Bootstrap на DocLayNet, затем свой русский набор: MVP 3–5 тыс. страниц из 100–300 документов разных лет и качества; pilot 10–20 тыс. Делить train/val/test по документам, не страницам. Hard cases: двухколоночные страницы, «Рисунок А.1», повернутые схемы, штампы, старые сканы.

Схема классов MVP (17)

title, section_heading, body_text, list, table, table_caption, figure, figure_caption, formula, note, warning, header, footer, page_number, toc_title, toc_entry, annex_title.

Целевые ориентиры пилота (не отраслевые стандарты)

F1 ≥ 0.90 по figure/caption, pairing ≥ 0.95 на чистых PDF, выигрыш времени специалиста ≥ 30%. Для бизнеса важнее end-to-end: Recall@k нужного требования, доля ответов с верной страницей и цитатой.

Что говорят источники

SmolVLM — «компактная открытая мультимодальная модель, принимающая произвольные последовательности изображений и текста»; чекпоинты под Apache 2.0; доступен SmolVLM2 2.2B — huggingface.co, huggingface.co/blog
Росстандарт ведёт линейку SMART-стандартов: ПНСТ 864-2023 «Умные (SMART) стандарты. Общие положения» плюс проекты по архитектуре, форматам и SMART-сервисам — стратегический сигнал направления, а не выделенный бюджет на VLM — alee.ru
ISO вела SAG on Machine-Readable Standards (конвинер — Антон Шалаев, Росстандарт): машиночитаемые стандарты — международный тренд — stdforum.gostinfo.ru
Рынок layout analysis существует: ABBYY FineReader Engine выделяет параграфы, линии, изображения и штрихкоды и продаёт сценарий архивирования проектной документации; автоматического разделения на документы при этом нет — ниша открыта — support.abbyy.com, help.abbyy.com
DocLayNet даёт 80 863 страницы с bbox-разметкой 11 классов из шести категорий (финансы, наука, патенты, тендеры, законы, руководства) — зрелая база для transfer learning, но готового русского ГОСТ-бенчмарка нет — huggingface.co, arxiv.org

Ключевые источники

ИсточникЧто даётФактСсылка
SmolVLM (Hugging Face)Модель image+text→text, компакт­ная, Apache 2.0варианты 256M / 500M / 2Bhuggingface.co
SmolVLM2 2.2B (блог HF)Рекомендуемый стартовый чекпоинтSmolVLM2-2.2B-Instruct доступенhuggingface.co/blog
SMART-стандарты (обзор)Российский сигнал машиночитаемых стандартовПНСТ 864-2023 + 4 проекта ПНСТalee.ru
ISO SAG on Machine-Readable StandardsМеждународный трендопределение machine-readable standard для ISOstdforum.gostinfo.ru
Росстандарт: первые ГОСТы по ИИГосактивность в теме ИИ-стандартовГОСТ Р 58776-2019, ГОСТ Р 58777-2019ict.moscow
Росстандарт: ИИ в метрологииИнициатива международного ИИ-стандартапредложение 2026 годаvfokuse.mail.ru
ABBYY FineReader EngineСуществующий рынок layout analysisвыделяет параграфы, линии, изображения, штрихкодыsupport.abbyy.com
ABBYY: архивирование документацииСценарий архивов проектной документациинет автоматического разделения на документыhelp.abbyy.com
DocLayNet (датасет)База для transfer learning80 863 страницы, 11 классов, 6 категорийhuggingface.co
DocLayNet (статья)Категории: финансы, наука, патенты, законы, тендеры, руководстваhuman-annotated разметка bboxarxiv.org

Метод: 76 строк из четырёх наборов источников — 55 страниц Hugging Face по SmolVLM/SmolVLM2, 4 материала о SMART-стандартах и Росстандарте, 2 страницы документации ABBYY, 15 страниц о DocLayNet; собрано 2026-09-01. Оценки сегментов, целевые метрики и план 6–8 недель — рекомендации автора, не измеренные факты; точный размер ниши в рублях не оценивался. Из таблицы для экономии места убраны дубли коммитов и зеркал репозиториев.

This report was generated automatically by Keenable SELECT at a user's request, from publicly available web sources linked herein. Keenable does not review, verify, or endorse its contents and makes no representation as to accuracy, completeness, or timeliness; AI-based extraction may contain errors. Nothing in this report is investment, legal, financial, or other professional advice. All trademarks and referenced content remain the property of their respective owners; no affiliation or endorsement is implied. To report an error, rights concern, or request removal: legal@keenable.ai.

Made withKeenable SELECT · 4,135 pages in 6m 26s · Ask your own questionShare:XLinkedInReddit
Made with Keenable SELECT