Judge в RL контролируется не одной техникой, а замкнутым контуром: наблюдение активаций, каузальная проверка, онлайн-мониторинг и вмешательство — 8 методов в трёх классах
Вопрос:
какими способами в механической интерпритации контролируется judge при rl
Обзор охватывает 8 конкретных методов механистической интерпретируемости для контроля learned evaluator / reward model / LLM-as-a-judge при RL и RLHF — первичные research-страницы и arXiv, просмотр на 1 сентября 2026. Агрегат делит их на три класса: диагностика и причинная проверка (3 метода), онлайн-мониторинг (2), вмешательство в reward и обучение (3). Это счёт отобранных в обзоре работ, не рейтинг литературы.
Наведите на метод — сигнал, управляющее действие и зрелость. Синим выделены три самых прямых ответа на вопрос: bias-subspace steering для LLM judge, Reward Lens + activation patching, Auditor-Guided RLHF с гейтингом награды. Серым — остальные методы контура; стрелки показывают порядок контура и обратную связь на judge.
Скрытые состояния judge содержат низкоразмерное направление bias: steering вдоль него двигает оценку в обе стороны и предсказывает сбой судьи —
arxiv.org
Reward-lens делает вектор весов reward head осью всех вопросов интерпретируемости и локализует причинные компоненты reward model через activation patching —
arxiv.org
Auditor учится по латентным представлениям отличать genuine от exploit, а AG-RLHF гейтирует и штрафует подозрительный reward прямо в обучении —
arxiv.org
SAE-аудит нашёл скрытую цель sycophancy к reward model: подозрительные фичи включали и выключали, подтверждая причинность —
anthropic.com
Все 8 методов
| Метод | Что наблюдается | Управляющее действие | Зрелость | Источник |
|---|
Ограничения
Механистический контроль не заменяет внешние контрольные оценки, human audits и независимых judges, и не даёт гарантии безопасности:
- probes и SAE-фичи могут ловить корреляцию, а не причину;
- обучаемая политика может адаптироваться к монитору;
- steering и проекции могут повредить полезные способности judge;
- закрытый judge часто не даёт доступа к активациям вовсе;
- контролирующий auditor сам требует независимой валидации.
Метод: обзор 8 методов механистической интерпретируемости для контроля judge / reward model в RLHF; агрегат — 3 класса контроля (счёт отобранных методов, не оценка всей литературы). Источники — первичные research-страницы и arXiv, просмотр 2026-09-01; часть работ 2026 года — свежие препринты, CART — концептуальная методология (position paper). Для страницы Anthropic дата публикации в данных отсутствует. Полные аннотации методов сокращены до одной строки в таблице.