Отчет построен на 13 подтвержденных строках документации и технических публикаций с 7 независимых хостов (Microsoft, Google Cloud, Elastic, Hugging Face, arXiv), собранных 22.09.2026. Строки покрывают три семейства инструментов: строковое сопоставление, энкодеры, поиск и ранжирование; ни один URL не подтверждает больше одной строки (7,7%).
Fuzzy-поиск решает опечатки и поиск имен пользователей, но даже state-of-the-art реализация Левенштейна в Lucene «намного медленнее обычного match-запроса», а большие расстояния не обрабатываются вовсе — elastic.co
BERT эффективен в NLU (question answering, language inference), но «не оптимален для генерации текста» — граница между энкодером и LLM проходит именно здесь — moon-ci-docs.huggingface.co
Гибридный поиск — рекомендуемая отправная точка для большинства продакшн-задач; reranker в конфигурации Databricks дает примерно +10% качества ценой ~1,5 с задержки на запрос — цифры этой конкретной конфигурации, не универсальные — learn.microsoft.com
Доменное дообучение BERT дает убывающую отдачу: чем дольше pre-training, тем дороже каждый процент улучшения, и выигрыш не всегда переносится на другие задачи — ar5iv.labs.arxiv.org
| Семейство | Подход | Когда уместен | Ограничение | Источник |
|---|
Метод: 13 строк из документации и технических публикаций (7 независимых хостов, максимум одна строка на URL, 7,7%), собраны 2026-09-22. Каждая строка — подход, сценарии применения, ограничение и источник; визуально сходные региональные копии документации сгруппированы на лестнице, но все строки и ограничения сохранены в таблице. Позиции на лестнице — качественные оценки сложности и стоимости, не измерения. Цитаты сокращены для места.