Заголовки

Исследование моделей reasoning: новый взгляд на уверенность и рассуждения

Команда из Goodfire AI и Гарвардского университета провела исследование, в котором выяснила, что reasoning-модели, такие как DeepSeek-R1 (671B) и GPT-OSS (120B), часто демонстрируют так называемое «театральное рассуждение». Хотя модель может быть уверена в ответе на 90%, она продолжает генерировать объяснения, как будто все еще раздумывает. Простые техники, основанные на внутренней активации, показывают ответ модели задолго до его появления в рассуждениях.

В исследовании использовались три метода, включая анализ скрытых состояний и принудительное прерывание рассуждений. Так, на элементарных вопросах из MMLU была замечена значительная разница между независимыми пробами и мониторами, свидетельствующая о том, что моделям удавалось «узнать» ответ раньше, чем они его формулировали. На более сложных задачах из GPQA-Diamond рост уверенности происходил синхронно с развитием текста.

Особо интересными являются моменты «перелома», когда модель признает свои ошибки, которые возникают лишь в случаях реальной неуверенности. Это позволяет заключить, что «backtracking» — это не показуха, а проявление внутренних сомнений.

Методы, показывающие уверенность модели, могут эффективно сокращать генерацию, экономя токены, но сохраняя высокую точность ответов.

Вопрос-ответ

Какое явление называют «театральным рассуждением» в работе Goodfire AI и Гарварда?

Театральное рассуждение — это ситуация, когда модель уверенно отвечает на вопрос, но продолжает генерировать внутренние объяснения и рассуждения, как будто все еще раздумывает. Модель может демонстрировать высокий уровень уверенности в ответе до того, как закончится внутренний процесс рассуждений, что выглядит как «последовательное» объяснение своих шагов, даже если ответ уже ясен.

Какие методы использовались для выявления внутренних рассуждений моделей?

Исследование применяло три метода: анализ скрытых состояний, принудительное прерывание рассуждений и сравнение независимых проб с мониторами. Эти подходы позволяли заметить, что модели «узнавали» ответы раньше, чем формулировали их, и отслеживать синхронность роста уверенности с развитием текста на сложных задачах.

Что означают «переломы» и «backtracking» в контексте диагностики сомнений модели?

«Переломы» — моменты, когда модель признает ошибку только при реальной неуверенности, демонстрируя внутреннее сомнение. Backtracking здесь рассматривается как отражение внутренней сомнительности, а не как трюк: модель может возвращаться к своим рассуждениям и корректировать вывод, если обнаруживает ошибку.

Как результаты исследования могут повлиять на разработку более эффективных систем?

Методы, демонстрирующие уверенность модели (например, с помощью контроля за внутренними активациями), могут сокращать длину генерируемого текста и экономить токены, сохраняя при этом высокую точность. Это позволяет строить более эффективные интервалы подтверждений и оптимизировать ответы без снижения качества, особенно в задачах, где требуется верификация выводов.