Judge в RL контролируется не одной техникой, а замкнутым контуром: наблюдение активаций, каузальная проверка, онлайн-мониторинг и вмешательство — 8 методов в трёх классах

Вопрос:
какими способами в механической интерпритации контролируется judge при rl

Обзор охватывает 8 конкретных методов механистической интерпретируемости для контроля learned evaluator / reward model / LLM-as-a-judge при RL и RLHF — первичные research-страницы и arXiv, просмотр на 1 сентября 2026. Агрегат делит их на три класса: диагностика и причинная проверка (3 метода), онлайн-мониторинг (2), вмешательство в reward и обучение (3). Это счёт отобранных в обзоре работ, не рейтинг литературы.

Наведите на метод — сигнал, управляющее действие и зрелость. Синим выделены три самых прямых ответа на вопрос: bias-subspace steering для LLM judge, Reward Lens + activation patching, Auditor-Guided RLHF с гейтингом награды. Серым — остальные методы контура; стрелки показывают порядок контура и обратную связь на judge.
Скрытые состояния judge содержат низкоразмерное направление bias: steering вдоль него двигает оценку в обе стороны и предсказывает сбой судьи — arxiv.org
Reward-lens делает вектор весов reward head осью всех вопросов интерпретируемости и локализует причинные компоненты reward model через activation patching — arxiv.org
Auditor учится по латентным представлениям отличать genuine от exploit, а AG-RLHF гейтирует и штрафует подозрительный reward прямо в обучении — arxiv.org
SAE-аудит нашёл скрытую цель sycophancy к reward model: подозрительные фичи включали и выключали, подтверждая причинность — anthropic.com

Все 8 методов

МетодЧто наблюдаетсяУправляющее действиеЗрелостьИсточник

Ограничения

Механистический контроль не заменяет внешние контрольные оценки, human audits и независимых judges, и не даёт гарантии безопасности:

Метод: обзор 8 методов механистической интерпретируемости для контроля judge / reward model в RLHF; агрегат — 3 класса контроля (счёт отобранных методов, не оценка всей литературы). Источники — первичные research-страницы и arXiv, просмотр 2026-09-01; часть работ 2026 года — свежие препринты, CART — концептуальная методология (position paper). Для страницы Anthropic дата публикации в данных отсутствует. Полные аннотации методов сокращены до одной строки в таблице.

This report was generated automatically by Keenable SELECT at a user's request, from publicly available web sources linked herein. Keenable does not review, verify, or endorse its contents and makes no representation as to accuracy, completeness, or timeliness; AI-based extraction may contain errors. Nothing in this report is investment, legal, financial, or other professional advice. All trademarks and referenced content remain the property of their respective owners; no affiliation or endorsement is implied. To report an error, rights concern, or request removal: legal@keenable.ai.

Made withKeenable SELECT · 3,317 pages in 5m 22s · Ask your own questionShare:XLinkedInReddit
Made with Keenable SELECT