Жюри моделей даёт стабильную вторую и третью разметку, но только вокруг неизменяемого человеческого якоря

Asked (кратко):

Как автоматически размечать качество подсказок бота (шкала A–E, генерирует DeepSeek, судит Claude; κ=0,641 на 140 парах одного человека, бинарно 0,584) без второго живого разметчика и не обмануть себя: жюри из моделей и агрегация, разрыв круга калибровки, слабые метки из копирования/сходства/времени/исхода, active learning на 30–50 пар, синтетические A–E и дрейф, метрики и пороги, инструменты для маленькой команды, стоимость 1 000 пар и месяца.

Отчёт построен на 60 отобранных исследованиях и инженерных блогах (жюри и судьи, weak supervision, active learning, синтетика, метрики; 47 исследовательских строк и 13 блогов/вторичных), 20 официальных страницах инструментов, объединённых в 10 продуктов, и 22 строках официальных API-цен. Все данные собраны 2026-09-13. Свидетельство о пользе жюри смешанное: панели иногда улучшают точность, но коррелированные ошибки резко уменьшают эффективное число голосов, а в одном клиническом примере лучший одиночный судья обошёл жюри.

Рекомендуемый конвейер: три независимых модельных судьи, label model поверх поведенческих сигналов, abstention и арбитраж, human anchor и canary. Пунктир — диагностические и калибровочные связи, сплошные — поток меток.

Панель судей несёт меньше информации, чем кажется: девять судей ≈ 2–2.5 эффективных голоса из-за коррелированных ошибок — поэтому базовое жюри ограничено тремя разными семействами моделей. arxiv.org

Жюри не гарантирует прироста над лучшим одиночным судьёй: в клиническом кейсе κ=.74 у жюри против κ=.75 у Gemini — рост относительно текущих κ=0.641/0.584 нельзя обещать без доменного held-out теста. arxiv.org

Внутренний консенсус моделей без внешнего человеческого якоря вводит в заблуждение: Dawid–Skene оценивал точность GPT в 90.7% там, где внешняя проверка её не подтверждала — anchor из 140 пар остаётся неприкосновенным. lrec.elra.info

Универсального «процента ручной проверки» не существует: rule of three даёт при нуле ошибок в 50 случайных проверках лишь верхнюю 95%-границу ≈6%; практический ритм — 10–15 пар в неделю плюс месячный аудит 30–50. jatinbansal.com

1. Жюри из моделей: состав, агрегация, арбитраж

Три независимые семейства (Claude Sonnet 5, Gemini 3.1 Pro, Grok 4.20 reasoning), общий контекст и rubric, JSON-ответ с вероятностями и evidence spans. DeepSeek — только challenger: он генерирует подсказки, возможна self-preference. Majority vote — baseline; веса/матрицы ошибок обучать только на calibration-fold. Конфликт с D или отсутствие уверенного A+B → abstain, не оптимистичное большинство.

среднее — один arXiv/preprint

Коррелированные ошибки: панель из 9 судей несёт ~2–2.5 эффективных голоса; разрыв с независимым идеалом 8–22 п.п.

Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels — neff≈2.0–2.5; Condorcet gap is 8–22 percentage points (pp; permutation p<10^-4)

arxiv.org

среднее — один arXiv/preprint

Смешанное свидетельство: в клиническом кейсе лучший одиночный судья κ=.75, жюри κ=.74 — панель не гарантирует прироста

aipsy-judge: A Specialized, Psychologist-Corrected Local Judge for the Psychological Safety of Conversational AI — Gemini kappa=.75, jury kappa=.74

arxiv.org

среднее — один arXiv/preprint

Специализированная панель (судья на критерий) даёт +10.9 п.п. к лучшему одиночному судье

Who judges the judges? Governance from metrics: a runtime framework for continuous LLM compliance monitoring — +10.9 pp

arxiv.org

среднее — один arXiv/preprint

Reference-free панели показывают коррелированные ложноотрицательные; консенсус-риск нужно диагностировать на калибровочном probe

JuryProbe: An Empirical Consensus-Risk Diagnostic for Routing Reference-Free Factuality Judge Panels to Grounded Verification — FN-only correlations 0.402 and 0.368; lifts 3.13x and 18.13x

arxiv.org

низкое — блог/вторичный источник

Инженерный опыт: три разные линии моделей и стоп — дальнейшие судьи возвращают коррелированные ошибки

We Audited Our Own LLM-Judge Panel — $0.002 a candidate

workloft.ai

2. Как не замкнуть круг калибровки

Неизменяемый human anchor из 140 пар делится на calibration и untouched test по диалогам; авто-метки никогда не становятся gold, provenance обязательна. Раз в квартал — независимый второй человек на 30–50 пар, чтобы оценить человеческий потолок. Универсального «процента ручной проверки» нет: rule of three даёт при 0 ошибок в n случайных проверках верхнюю 95%-границу ≈3/n (n=50 → ~6%, n=100 → ~3%), кластеризация диалогов её ухудшает.

высокое — peer-reviewed

Внутренний консенсус LLM без внешнего человеческого якоря серьёзно вводит в заблуждение (Dawid–Skene переоценивает точность)

Multi-Source Emotion Annotation in Children’s Language: When LLM Consensus Diverges from Human Judgment — Dawid-Skene estimates GPT-5.2 valence accuracy at 90.7%, whereas evaluation against human gold yields 71.0%

lrec.elra.info

среднее — один arXiv/preprint

Без корректного reference судьи согласны с экспертами только там, где сами могут решить задачу — «нет бесплатных меток»

No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding — 54% of the question-response pairs received unanimously consistent annotations

arxiv.org

высокое — peer-reviewed

Уточнение annotation guidelines подняло согласие 0.593 → 0.84 — вклад rubric сравним с вкладом модели

Automating Annotation Guideline Improvements using LLMs: A Case Study — inter-annotator agreement going from 0.593 to 0.84 when improving WNUT-17’s guidelines

aclanthology.org

среднее — один arXiv/preprint

Клинический пример: согласие модель–человек κ≈.68–.75 — реалистичный ориентир потолка, не 1.0

Using LLM-as-a-Judge/Jury to Advance Scalable, Clinically-Validated Safety Evaluations of Model Responses to Users Demonstrating Psychosis — Cohen’s Khuman×gemini = .75, Khuman×qwen = .68, Khuman×kimi = .56, Khuman×jury = .74

arxiv.org

3. Поведенческие сигналы как слабые метки

Логировать копирование, точный вставленный фрагмент, последующие правки, тему, длину, исход. Abstaining labeling functions: точная копия/малые правки → слабый плюс к A/B; существенные добавления → C; topic mismatch → E; противоречие по числам/дате/ставке → D. Время и бизнес-исход — ковариаты и диагностика, не прямая истина. Объединять label model / Dawid–Skene как диагностический baseline.

среднее — один arXiv/preprint

Слабая супервизия по поведению пользователя улучшает выявление ошибочных меток на 36.7%

LabelAId: Just-in-time AI Interventions for Improving Human Labeling Quality and Domain Knowledge in Crowdsourcing Systems — 36.7%

arxiv.org

среднее — один arXiv/preprint

Отбор подмножества слабых меток (cut statistic) даёт до +19% точности пайплайнов weak supervision

Training Subset Selection for Weak Supervision — up to 19% (absolute) on benchmark tasks

arxiv.org

среднее — один arXiv/preprint

Редкие turn-level свидетельства отказа (1–10% диалогов) достаточны для обучения предиктора при правильной архитектуре

When Evidence is Sparse: Weakly Supervised Early Failure Alerting in Dialogs and LLM-Agent Trajectories — 1-10%

arxiv.org

низкое — блог/вторичный источник

Имплицитный фидбэк смещён: менее 5% ответов получают отметку — селекция портит eval-набор без строгого разделения сигналов

The Thumbs-Up Button That Poisoned Your Eval Set Through the Back Door — fewer than five percent of responses receive any user feedback at all

tianpan.co

среднее — один arXiv/preprint

LLM-аннотация исхода диалога коррелирует с оценкой клиента 0.47 против 0.36 у сентимента; тон и удовлетворённость расходятся в 44%

What sentiment analysis can't see: Measuring whether customers were helped, and what went wrong, across 70,000 support conversations — 70,450 support conversations; correlation of 0.47 versus 0.36; tone and satisfaction disagreed in 44% of conversations

arxiv.org

4. Очередь 30–50 пар для человека

Стратификация: ~40% расхождения жюри/низкий margin, 20% границы B/C и C/D, 20% редкие темы, новые KB-записи и числовые ответы, 20% чисто случайные — иначе нельзя оценить реальную частоту ошибок. Дедупликация и bootstrap — по диалогам.

низкое — блог/вторичный источник

Отбор по границе rubric даёт 50–80% экономии бюджета аннотаций при том же качестве; но uncertainty-only переиндексирует edge cases

Human-in-the-Loop Feedback Loops for LLM Systems — 50–80% reductions in annotation budget

jatinbansal.com

низкое — блог/вторичный источник

LLM-метки + выборочная человеческая проверка неопределённых строк: качество полной ручной разметки при 6–7% усилий

Human-in-the-Loop Feedback Loops for LLM Systems — 6–7% of the human annotation effort

jatinbansal.com

низкое — блог/вторичный источник

Контрпример: active learning не даёт надёжного преимущества над случайной выборкой при LLM-аннотаторе

Do We Still Need Humans in the Loop? Comparing Human and LLM Annotation in Active Learning for Hostility Detection — \28 for GPT-5.2 Batch API vs. \316 for Prolific

arcxiv.org

низкое — блог/вторичный источник

ActiveLab: консенсус-метки при 5× меньшем числе аннотаций в задачах перепроверки меток

ActiveLab: Active Learning with Data Re-Labeling — 5x fewer total annotations

cleanlab.ai

5. Синтетические A–E и ловля дрейфа

Canary-набор вне обучения: A — парафраза проверенной пары; B — только стиль; C — удалить обязательный слот; D — заменить ставку/дату/статус/знак; E — ответ другой темы. Paired metamorphic tests, seed и версия фиксируются, реалистичность проверяется вручную; фиксированная доля canary/anchor интерливится при каждом релизе судьи.

среднее — один arXiv/preprint

Фиксированный human-labeled anchor, пересчитываемый текущим судьёй, отделяет дрейф судьи от дрейфа системы (anytime-valid)

Who Drifted: the System or the Judge? Anytime-Valid Attribution in LLM Evaluation Pipelines — On two real judge changes, a silent version bump is detected as judge drift in 60/60 runs with zero judge-to-system misattribution, and a contaminating strict-prompt change is correctly attributed on 110 of 120 runs at guard width 300 -- while the industry-default rolling z-test false-alarms on 75% of drift-free streams.

arxiv.org

низкое — блог/вторичный источник

Синтетические контрастные пары + rejection sampling: судья вырос 75.4 → 88.3 на RewardBench без человеческих меток

Synthetic Eval Bootstrapping: How to Build Ground-Truth Datasets When You Have No Labeled Data — 75.4 to 88.3

tianpan.co

низкое — блог/вторичный источник

Метаморфические отношения (инвариантность смысла, негация) масштабируются до сотен тысяч тестов

Synthetic Eval Bootstrapping: How to Build Ground-Truth Datasets When You Have No Labeled Data — 560,000

tianpan.co

низкое — блог/вторичный источник

Critique shadowing против human-labeled validation поднял точность авто-судьи 68% → 94% (блог, не переносить цифру как факт)

Synthetic Eval Bootstrapping: How to Build Ground-Truth Datasets When You Have No Labeled Data — 68% to 94%

tianpan.co

6. Метрики, CI и внутренние пороги

Pairwise Cohen κ (модель–человек, человек–человек); Fleiss κ для панели; Krippendorff α ordinal только для A–D и nominal для A–E; weighted κ для A–D; бинарный A+B vs C+D; coverage/abstention, macro-F1, confusion matrix, recall D и C+D. CI — stratified/cluster bootstrap по диалогам. Предрегистрированный внутренний gate (не универсальный стандарт): нижняя граница 95% CI binary κ ≥ baseline и 0.60; recall D ≥ .95, C+D ≥ .90; ordinal α ≥ .67, для жёстких решений ~.80.

среднее — один arXiv/preprint

Скан 24 работ: поле не имеет единой практики отчётности agreement-метрик — фиксируйте набор заранее

Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why — 24 papers; 11 graded or continuous evaluations; 7 pairwise-preference evaluations; 3 binary-verdict evaluations; 2 judge ensembles; 1 scale-matched mix

arxiv.org

среднее — один arXiv/preprint

Krippendorff α = 0.78 между людьми на агентных задачах — ориентир достижимого согласия

Counsel: A Meta-Evaluation Dataset for Agentic Tasks — Krippendorff’s alpha 0.78; strongest judge achieving 88% agreement on location and 65% on reasoning

arxiv.org

среднее — один arXiv/preprint

Trust-or-escalate: калибровка уверенности судьи снижает ECE на 50% и даёт управляемую эскалацию к человеку

Trust or Escalate: LLM Judges with Provable Guarantees for Human Agreement — reducing ECE by 50% and improving AUROC by 13% for GPT-4

arxiv.org

среднее — один arXiv/preprint

Согласие эксперт–LLM гетерогенно: weighted κ от 0.17 до 0.86 по 21 измерению — считать по классам, не в среднем

Augmenting Human Evaluation with LLM Judges: How Many Human Reviews Do You Need? — 0.17 to 0.86 of weighted kappa across 21 evaluation dimensions

arxiv.org

среднее — один arXiv/preprint

Конформный risk control для панелей: acceptance .973 при контролируемом риске .098 — формальный каркас для abstention

Multi-Expert Conformal Risk Control for Pairwise LLM Judging in Open-Ended Dialogue — Acceptance Rate .973, Accuracy .887, Risk .098 for Decision Voting on ESConv (Homogeneous)

arxiv.org

7. Инструменты для маленькой команды

Label Studio OSS или Argilla — человеческая очередь и ревью; Langfuse — если нужна self-hosted трассировка с annotation queues; Promptfoo или Inspect — версионированные regression/canary evals; LangSmith/Braintrust — облачная альтернатива, публичные цены частично не указаны; OpenAI Evals/API — программные graders, не замена UI разметки. Пропуски в официальных страницах отмечены «не указано», не додуманы.

высокое — peer-reviewed

Режим «человек редактирует вердикт LLM» повышает согласие 0.64 → 0.71 — аргумент за review-очередь, а не чистую автоматизацию

Exploring the Reliability of Large Language Models as Customized Evaluators for Diverse NLP Tasks — from 0.64 to 0.71

aclanthology.org

среднее — один arXiv/preprint

Rubric-based оценка даёт больше выполненных оценок и более полезные объяснения, чем pairwise (n=15, 131 оценка)

Aligning Human and LLM Judgments: Insights from EvalAssist on Task-Specific Evaluations and AI-assisted Assessment Strategy Preferences — n=15 practitioners completing 6 tasks yielding 131 evaluations; judge strategy impact on number of evaluations F(1, 14) = 12.64, p = 0.003; pairwise strategy led to significantly fewer evaluations than the rubric strategy with mean difference = 0.72, p = 0.007; positional bias appeared in 35% of 196 total evaluations; perceived helpfulness when positional bias was present vs absent t(28) = 2.98, p = 0.003; rubric explanations rated higher than pairwise explanations with mean difference = 0.73

arxiv.org

низкое — блог/вторичный источник

Практика панелей: crowd-vs-expert согласие 72–83%, expert-vs-expert 79–90% — ориентиры для ожиданий от ревью

Weak judges, strong panel: an ensemble approach to LLM eval — crowd-vs-expert agreement of 72–83%, and expert-vs-expert at 79–90%

orq.ai

8. Стоимость жюри

По официальным ценам на 2026-09-13, при 3 000 input + 200 output токенов на судью: Claude Sonnet 5 $8.00, Gemini 3.1 Pro Preview $8.40, Grok 4.20 reasoning $4.25 — итого ≈$20.65 за 1 000 пар на три судьи. При 150–200 пар/нед (≈650–866 пар/мес) ≈$13.4–17.9/мес; с арбитром на ~30% конфликтов, ретраями и canary — порядка $15–20/мес. Замена Grok на deepseek-reasoner даёт ≈$18.49/1 000, но ломает независимость от генератора подсказок. Не включены платформа, embeddings/NLI и человеческое время; оценки чувствительны к длине reasoning-вывода и preview-статусу.

среднее — один arXiv/preprint

Средняя модель с правильным дебиасингом может обойти frontier-судью за долю цены (κ=0.549 у Gemini 2.5 Flash)

Judging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines — 71.0%, kappa=0.549

arxiv.org

низкое — блог/вторичный источник

Инженерный ориентир: панель малых судей из разных семейств — около $0.002 за кандидата

We Audited Our Own LLM-Judge Panel — $0.002 a candidate

workloft.ai

среднее — один arXiv/preprint

Self-preference bias судьи измерим и снижается калиброванными многомерными rubric — довод против DeepSeek-судьи над DeepSeek-подсказками

Quantifying and Mitigating Self-Preference Bias of LLM Judges — achieving a twofold reduction in prediction error compared to uncalibrated baselines

arxiv.org

Рекомендуемый конвейер: 12 шагов

1
Заморозить rubric v1Явные критерии A–D, E как «не сравнимо», контрпримеры, обязательные поля JSON-ответа.
2
Собрать anchor140 человеческих пар делятся по диалогам на calibration и untouched test; test не меняется по результатам.
3
Три судьиClaude Sonnet 5, Gemini 3.1 Pro, Grok 4.20 reasoning: одинаковый контекст, KB/reference, rubric; JSON с label, вероятностями, evidence spans, E-reason.
4
Baseline-агрегацияПростое majority vote; сравнение с одиночными судьями на untouched test.
5
Взвешивание на calibrationВеса/матрицы ошибок только на calibration-fold; Dawid–Skene — диагностика, не истина.
6
Арбитр и abstentionЧетвёртая линия только на расхождениях/низком margin; конфликт с D или нет уверенного A+B → abstain.
7
Поведенческие LFКопирование, правки, topic mismatch, слоты/NLI → abstaining labeling functions; label model поверх.
8
Active-learning очередь30–50 пар/цикл: 40% конфликтов, 20% границ B/C и C/D, 20% редких тем, 20% случайных.
9
Ручной ритм10–15 пар/нед (5 случайных + 5–10 конфликтных), 30–50 в месячный аудит, второй человек 30–50 раз в квартал.
10
Canary-наборСинтетические A–E парами, seed и версия фиксируются, ручная проверка реалистичности; вне обучения.
11
Метрики и gatesκ/α, recall D и C+D, coverage; cluster bootstrap по диалогам; предрегистрированный gate.
12
Версионирование и отчётPrompt/model/temperature/rubric/KB версионируются; отчёт раздельно по test, random audit, AL-set, canary; provenance у всех авто-меток.

Риски и проверки

Риск
Проверка
Shared model bias, ложный консенсус
корреляционная матрица ошибок судей на anchor; JuryProbe-подобный probe
Self-preference к DeepSeek
DeepSeek не судья, только challenger; сравнение вердиктов на anchor
Размытость B/C и C/D
контрпримеры в rubric; целевые 20% границ в AL-очереди
Менеджер не безошибочный эталон
квартальная вторая человеческая разметка 30–50 пар; E как отдельный класс
Копирование из лени / переписывание по стилю
страты по менеджеру, leave-one-manager-out
Latency confounded нагрузкой/сменой
время — только ковариата; страты по смене
Исход сделки confounded ценой и спросом
только диагностика; никакой прямой метки из исхода
Leakage между диалогами
split и bootstrap на уровне диалога; дедупликация
Synthetic artifacts
ручная проверка реалистичности; canary вне обучения; paired tests
Дисбаланс классов, редкость D/E
стратифицированный отбор; recall D как отдельный gate
Model/API drift
frozen anchor + canary interleave при каждом релизе; версионирование
Оптимизм AL-only выборки
20% чисто случайной контрольной выборки; random audit
Приватность CRM
self-hosted очередь разметки; provenance и доступ по ролям

Сигнал → что измеряет → confounder → проверка

Сигнал
Что измеряет
Confounder
Как валидировать
Кнопка копирования + вставленный фрагмент
менеджер счёл подсказку пригодной как есть
копирование из лени, привычка всегда переписывать
стратификация по менеджеру, leave-one-manager-out, slot-level аудит
Малая правка после вставки
верно, но нужна доводка (B)
стилевые правки по привычке
сравнение распределения правок по менеджеру и теме
Существенное добавление менеджера
подсказка неполна (C)
длина ответа зависит от темы
страты по теме, калибровка порогов на human-gold
Противоречие по числам/ставке/дате (слоты + NLI)
подсказка неверна (D)
ошибки извлечения слотов
ручной slot-level аудит выборки
Topic mismatch (embedding cosine)
менеджер ответил про другое (E)
смена темы внутри диалога
дедупликация и bootstrap по диалогам
Время ответа менеджера
косвенная сложность/доверие
нагрузка, смена, сложность вопроса
использовать как ковариату, не как метку
Исход диалога / сделка
бизнес-эффект подсказки
цена, спрос, менеджер
только диагностика; никогда не прямая истина

Внутренняя схема команды: строки — предложенные abstaining labeling functions, объединяемые label model / Dawid–Skene как диагностическим baseline, не как ground truth.

Метрики и предрегистрированные внутренние пороги

Метрика
Внутренний порог / gate
Примечание
Binary κ (A+B vs C+D)
нижняя граница 95% CI ≥ текущего baseline 0.584 и цели 0.60
главный gate; cluster bootstrap по диалогам
Pairwise Cohen κ модель–человек
сравнивать с человеческим потолком (текущий κ=0.641 на 140 парах)
считать на untouched test, не на calibration
Krippendorff α ordinal (только A–D)
≥ 0.67 для предварительных выводов; ~0.80 для жёстких решений
E исключается из порядковой шкалы
Krippendorff α nominal (A–E) и Fleiss κ
отчётность, без жёсткого порога
несколько номинальных судей
Recall класса D
≥ 0.95
стоимость пропуска неверной подсказки максимальна
Recall C+D
≥ 0.90
вместе с confusion matrix и macro-F1
Coverage / abstention
отчётность; рост abstain — сигнал дрейфа
конфликт с D → abstain, не большинство
Canary и random audit
нет значимого падения между релизами
интерливить фиксированную долю при каждом релизе судьи

Пороги — внутренние, предрегистрированные до запуска, настраиваются по стоимости false positive/false negative; это не универсальный стандарт из литературы.

Инструменты: 10 продуктов из 20 официальных страниц (дубли объединены)

Инструмент
Hosting
Лицензия/план
LLM-разметка
Human review
Публичная цена и источники
Label Studio
оба
Open Source
да
да
$99/month
heartex.com · humansignal.com
Argilla
облако
open-source
да
да
публично не указано
argilla.io · docs.argilla.io
Langfuse
оба
не указано
да
да
публично не указано
langfuse.com
Promptfoo
оба
Community: Free Forever; Enterprise: Custom; On-Premise: Custom
да
не найдено
Free Forever / Custom
promptfoo.dev
Inspect (+ Hawk, Scout)
cloud/self-hosted
open-source
да
да
публично не указано
huggingface.co · hawk.metr.org · inspect.aisi.org.uk
LangSmith
оба
не указано
да
да
$0 / seat per month
docs.langchain.com
Braintrust
не указано
не указано
не найдено
да
публично не указано
braintrustdata.com
OpenAI Evals / Evals API
облако
MIT license
да
да
публично не указано
developers.openai.com · platform.openai.com · github.com · platform.openai.com · developers.openai.com · developers.openai.com
Amazon Bedrock Model Evaluation
облако
не указано
да
да
$0.21 per completed human task
aws.amazon.com · aws.amazon.com
Potato
не указано
не указано
да
да
публично не указано
potatoannotator.readthedocs.io

«Не найдено / публично не указано» означает отсутствие сведений на собранных официальных страницах, а не отсутствие функции.

Калькулятор стоимости жюри

Официальные API-цены на 2026-09-13. Допущение: 3 000 input + 200 output токенов на каждого судью и пару. Базовое жюри: Claude Sonnet 5 ($8.00) + Gemini 3.1 Pro Preview ($8.40) + Grok 4.20 reasoning ($4.25) ≈ $20.65 за 1 000 пар. При 150–200 новых пар в неделю (×4.33 ≈ 650–866 пар/мес) это ≈ $13.4–17.9/мес; с арбитром на ~30% конфликтов, ретраями и canary — ориентир $15–20/мес. Не включены платформа разметки, хранение, embeddings/NLI и человеческое время; оценка чувствительна к длине reasoning-вывода и preview-статусу моделей.

Модель
Провайдер
$/1M input / output
$ за 1 000 пар
Источник
grok-4.20-0309-reasoning жюри
xAI
$1.25 / $2.50
$4.25
docs.x.ai
Claude Sonnet 5 жюри
Anthropic
$2.00 / $10.00
$8.00
docs.anthropic.com
Gemini 3.1 Pro Preview жюри
Google
$2.00 / $12.00
$8.40
ai.google.dev
Gemini 2.0 Flash
Google
$0.10 / $0.40
$0.38
ai.google.dev
DeepSeek-V3
DeepSeek
$0.27 / $1.10
$1.03
api-docs.deepseek.com
qwen3.5-35b-a3b
Alibaba Cloud Model Studio
$0.40 / $3.20
$1.84
help.aliyun.com
deepseek-reasoner
DeepSeek
$0.55 / $2.19
$2.09
api-docs.deepseek.com
Grok 4.6
xAI
$2.00 / $6.00
$7.20
docs.x.ai
qwen-max
Alibaba Cloud Model Studio
$2.40 / $9.60
$9.12
help.aliyun.com
Claude Opus 5
Anthropic
$5.00 / $25.00
$20.00
docs.anthropic.com

Замена Grok на deepseek-reasoner снижает сумму до ≈$18.49/1 000 пар, но DeepSeek генерирует сами подсказки — возможна self-preference, поэтому он предложен только как challenger.

Все 60 источников: исследования и блоги

ТипТемаРаботаКоличественная детальУровеньИсточник
блогactive learningHuman-in-the-Loop Feedback Loops for LLM Systems6–7% of the human annotation effortнизк.jatinbansal.com
блогactive learningHuman-in-the-Loop Feedback Loops for LLM Systems50–80% reductions in annotation budgetнизк.jatinbansal.com
блогactive learningActiveLab: Active Learning with Data Re-Labeling5x fewer total annotationsнизк.cleanlab.ai
блогжюри и судьиQuorum Drift: When LLM Juries Slowly Converge on Wrong Answers43.2% consensus rate and mean panel variance of 1,753.6 on 7,063 Armalo jury judgmentsнизк.trust.armalo.ai
блогжюри и судьиWeak judges, strong panel: an ensemble approach to LLM evalcrowd-vs-expert agreement of 72–83%, and expert-vs-expert at 79–90%низк.orq.ai
блогжюри и судьиWe Audited Our Own LLM-Judge Panel$0.002 a candidateнизк.workloft.ai
блогжюри и судьиLLM Jury-on-Demand Framework+6.7% accuracy gain in crowd-comparative evaluation, +11–22 points in violation detectionнизк.emergentmind.com
блогжюри и судьиBuilding a Reliable LLM-as-a-Judge: Bias and Calibrationover 80% agreement with humansнизк.aitechconnect.in
блогжюри и судьиLLM-as-a-judge: when a model can grade another model50% error ratesнизк.artifipedia.com
блогимплицитный фидбэкThe Thumbs-Up Button That Poisoned Your Eval Set Through the Back Doorfewer than five percent of responses receive any user feedback at allнизк.tianpan.co
блогсинтетика и дрейфSynthetic Eval Bootstrapping: How to Build Ground-Truth Datasets When You Have No Labeled Data68% to 94%низк.tianpan.co
блогсинтетика и дрейфSynthetic Eval Bootstrapping: How to Build Ground-Truth Datasets When You Have No Labeled Data75.4 to 88.3низк.tianpan.co
блогсинтетика и дрейфSynthetic Eval Bootstrapping: How to Build Ground-Truth Datasets When You Have No Labeled Data560,000низк.tianpan.co
исследованиеactive learningDo We Still Need Humans in the Loop? Comparing Human and LLM Annotation in Active Learning for Hostility Detection\28 for GPT-5.2 Batch API vs. \316 for Prolificнизк.arcxiv.org
исследованиеactive learningWhich Examples to Annotate for In-Context Learning? Towards Effective and Efficient Selection4.4% accuracy pointsсред.arxiv.org
исследованиеactive learningRevisiting Active Learning under (Human) Label Variationнизк.pith.science
исследованиеactive learningNext Generation Active Learning: Mixture of LLMs in the Loopвыс.ojs.aaai.org
исследованиеactive learningLLMs Capture Emotion Labels, Not Emotion Uncertainty: Distributional Analysis and Calibration of Human-LLM Judgment Gapsсред.arxiv.org
исследованиежюри и судьиAugmenting Human Evaluation with LLM Judges: How Many Human Reviews Do You Need?0.17 to 0.86 of weighted kappa across 21 evaluation dimensionsсред.arxiv.org
исследованиежюри и судьиAugmenting Human Evaluation with LLM Judges: How Many Human Reviews Do You Need?0.17 to 0.86 of weighted kappaсред.arxiv.org
исследованиежюри и судьиAutomating Annotation Guideline Improvements using LLMs: A Case Studyinter-annotator agreement going from 0.593 to 0.84 when improving WNUT-17’s guidelinesвыс.aclanthology.org
исследованиежюри и судьиJuryProbe: An Empirical Consensus-Risk Diagnostic for Routing Reference-Free Factuality Judge Panels to Grounded VerificationFN-only correlations 0.402 and 0.368; lifts 3.13x and 18.13xсред.arxiv.org
исследованиежюри и судьиExploring the Reliability of Large Language Models as Customized Evaluators for Diverse NLP Tasksfrom 0.64 to 0.71выс.aclanthology.org
исследованиежюри и судьиMore Human, More Efficient: Aligning Annotations with Quantized SLMs0.5774сред.arxiv.org
исследованиежюри и судьиWho judges the judges? Governance from metrics: a runtime framework for continuous LLM compliance monitoring+10.9 ppсред.arxiv.org
исследованиежюри и судьиAligning Human and LLM Judgments: Insights from EvalAssist on Task-Specific Evaluations and AI-assisted Assessment Strategy Preferencesn=15 practitioners completing 6 tasks yielding 131 evaluations; judge strategy impact on number of evaluations F(1, 14) сред.arxiv.org
исследованиежюри и судьиMargin-Adaptive Confidence Ranking for Reliable LLM Judgementсред.arxiv.org
исследованиежюри и судьиTrust or Escalate: LLM Judges with Provable Guarantees for Human Agreementreducing ECE by 50% and improving AUROC by 13% for GPT-4сред.arxiv.org
исследованиежюри и судьиCyclicJudge: Mitigating Judge Bias Efficiently in LLM-based Evaluation27-40% variance reduction at budget E=1сред.arxiv.org
исследованиежюри и судьиWho judges the judges? Governance from metrics: a runtime framework for continuous LLM compliance monitoring49 annotated prompt/response pairs; 1.7B-7B parameters; agreement rates range from 51.5% (mistral:7b) to 69.1% (phi4-minсред.arxiv.org
исследованиежюри и судьиMulti-Source Emotion Annotation in Children’s Language: When LLM Consensus Diverges from Human JudgmentDawid-Skene estimates GPT-5.2 valence accuracy at 90.7%, whereas evaluation against human gold yields 71.0%выс.lrec.elra.info
исследованиежюри и судьиNo Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding54% of the question-response pairs received unanimously consistent annotationsсред.arxiv.org
исследованиежюри и судьиAgreement Metrics for LLM-as-Judge Evaluation: What to Report and Why24 papers; 11 graded or continuous evaluations; 7 pairwise-preference evaluations; 3 binary-verdict evaluations; 2 judgeсред.arxiv.org
исследованиежюри и судьиMulti-Expert Conformal Risk Control for Pairwise LLM Judging in Open-Ended DialogueAcceptance Rate .973, Accuracy .887, Risk .098 for Decision Voting on ESConv (Homogeneous)сред.arxiv.org
исследованиежюри и судьиA Unified Framework for Rubric-Based LLM Evaluation5,586 individual criterion-level judgments (931 criteria 3 systems 2 judges)сред.arxiv.org
исследованиежюри и судьиA Statistical Framework for Auditing Behavioral Dependence and Induced Bias in LLM Judges3.5 and 2.6 percentage-point gains in accuracy and precision, respectively, over majority votingсред.arxiv.org
исследованиежюри и судьиAuditing and Debiasing LLM-as-a-Judge Evaluation with a Bias-Aware Panelmore than 1,000,000 simulated pairwise judgments; single judge agreement 87.6%; 0.73-rate position, verbosity, and self низк.ijisae.org
исследованиежюри и судьиMitigating Biases to Embrace Diversity: A Comprehensive Annotation Benchmark for Toxic Languageвыс.aclanthology.org
исследованиежюри и судьиJudging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines71.0%, kappa=0.549сред.arxiv.org
исследованиежюри и судьиAligning with Human Judgement: The Role of Pairwise Preference in Large Language Model EvaluatorsMAE shifts from 1.62 to 1.16 on HANNA and from 0.78 to 0.86 on SummEvalсред.arxiv.org
исследованиежюри и судьиNine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panelsneff≈2.0–2.5; Condorcet gap is 8–22 percentage points (pp; permutation p<10^-4)сред.arxiv.org
исследованиежюри и судьиQuantifying and Mitigating Self-Preference Bias of LLM Judgesachieving a twofold reduction in prediction error compared to uncalibrated baselinesсред.arxiv.org
исследованиежюри и судьиDoes Capability Transfer to Subjective Behavior -- and Would Our Instruments Tell Us? A Self-Evolving, Trust-by-Construction Evaluation Paradigmr = 0.050 on 2,565 cellsсред.arxiv.org
исследованиежюри и судьиLLM Judges as Raters: A Pre-Registered Audit of Severity, Halo, Reliability, and Version Instability in LLM Essay Scoring on Public Corpora2,377 essays, 12 judges, 4 providers, 5 version contrasts, Judge severity spans 219 points on ENEM's 0-1000 scale, panelсред.arxiv.org
исследованиежюри и судьиUsing LLM-as-a-Judge/Jury to Advance Scalable, Clinically-Validated Safety Evaluations of Model Responses to Users Demonstrating PsychosisCohen’s Khuman×gemini = .75, Khuman×qwen = .68, Khuman×kimi = .56, Khuman×jury = .74сред.arxiv.org
исследованиежюри и судьиJuryProbe: An Empirical Consensus-Risk Diagnostic for Routing Reference-Free Factuality Judge Panels to Grounded Verificationсред.arxiv.org
исследованиежюри и судьиPERSONAJUDGE: Simulating Individual Human Preference Judgments with Evaluator-Specific Demonstration Dataup to 9.9 pointsнизк.pith.science
исследованиежюри и судьиCounsel: A Meta-Evaluation Dataset for Agentic TasksKrippendorff’s alpha 0.78; strongest judge achieving 88% agreement on location and 65% on reasoningсред.arxiv.org
исследованиежюри и судьиaipsy-judge: A Specialized, Psychologist-Corrected Local Judge for the Psychological Safety of Conversational AIGemini kappa=.75, jury kappa=.74сред.arxiv.org
исследованиежюри и судьиCalibrate, Don’t Curate: Label-Efficient Estimation from Noisy LLM JudgesOn RewardBench2, retaining all judges achieves negative log-likelihood (NLL) of versus under top-5 selection, halving thсред.arxiv.org
исследованиежюри и судьиWhen the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliabilityнизк.pith.science
исследованиежюри и судьиLLMEval-3: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models90% agreement with human expertsсред.arxiv.org
исследованиеимплицитный фидбэкWhat sentiment analysis can't see: Measuring whether customers were helped, and what went wrong, across 70,000 support conversations70,450 support conversations; correlation of 0.47 versus 0.36; tone and satisfaction disagreed in 44% of conversationsсред.arxiv.org
исследованиеимплицитный фидбэкUser Feedback in Human-LLM Dialogues: A Lens to Understand Users But Noisy as a Learning Signal48%низк.alphaxiv.org
исследованиесинтетика и дрейфWho Drifted: the System or the Judge? Anytime-Valid Attribution in LLM Evaluation PipelinesOn two real judge changes, a silent version bump is detected as judge drift in 60/60 runs with zero judge-to-system misaсред.arxiv.org
исследованиеслабая супервизияLabelAId: Just-in-time AI Interventions for Improving Human Labeling Quality and Domain Knowledge in Crowdsourcing Systems36.7%сред.arxiv.org
исследованиеслабая супервизияMetadata Predictability Is Not Evidence Dependence: An Intervention-Based Audit for Weak-Label Benchmarks0.643сред.arxiv.org
исследованиеслабая супервизия[2606.05414] When Evidence is Sparse: Weakly Supervised Early Failure Alerting in Dialogs and LLM-Agent Trajectories1-10%низк.academ.us
исследованиеслабая супервизияWhen Evidence is Sparse: Weakly Supervised Early Failure Alerting in Dialogs and LLM-Agent Trajectories1-10%сред.arxiv.org
исследованиеслабая супервизияTraining Subset Selection for Weak Supervisionup to 19% (absolute) on benchmark tasksсред.arxiv.org

Уровень подтверждения: выс. — peer-reviewed (ACL/AAAI/LREC); сред. — один arXiv-препринт; низк. — инженерный блог или вторичный источник. Цифры из блогов не переносятся как установленные факты.

Метод: 60 строк исследований и блогов (каждая с URL и хостом; уровень подтверждения присвоен по типу площадки: peer-reviewed, arXiv-препринт, блог), 20 официальных страниц инструментов, сведённых к 10 продуктам, и 22 строки официальных API-цен; всё собрано 2026-09-13. Стоимость за 1 000 пар рассчитана из опубликованных цен при допущении 3 000 input + 200 output токенов на судью; калькулятор пересчитывает формулу, а не фиксированный счёт. Пороги κ/α — внутренние предрегистрированные ориентиры команды, не универсальный стандарт. Для места сокращены поля limitation и даты публикаций отдельных работ; отсутствующие в официальных страницах цены отмечены «публично не указано».

This report was generated automatically by Keenable SELECT at a user's request, from publicly available web sources linked herein. Keenable does not review, verify, or endorse its contents and makes no representation as to accuracy, completeness, or timeliness; AI-based extraction may contain errors. Nothing in this report is investment, legal, financial, or other professional advice. All trademarks and referenced content remain the property of their respective owners; no affiliation or endorsement is implied. To report an error, rights concern, or request removal: legal@keenable.ai.

Keenable SELECTAsk your own question
Made with Keenable SELECT