Исследователи из южнокорейского KAIST и Naver AI Lab показали, что шаги рассуждения, которые языковая модель выписывает текстом, соответствуют различимым паттернам внутри её числовых представлений. Команда проверила три модели — Qwen2.5-7B, Qwen3-8B и Gemma4-31B — и обнаружила, что разделение сильнее всего выражено в средних слоях. Для компаний, которые используют цепочку рассуждений модели как инструмент надзора, это важно потому, что письменное объяснение оказывается не единственным местом, где можно наблюдать за ходом рассуждения.
Что именно измерили в исследовании
Команда определила восемь повторяющихся операций рассуждения, среди них извлечение, декомпозиция, припоминание формулы, дедукция и вычисление. Три модели решали математические задачи, их пути решения разбили на сегменты, а затем GPT-5 разметил каждый сегмент одной из этих восьми операций. Результат подтвердился на всех трёх моделях: операции надёжно различаются во внутренних представлениях, а пик разделения приходится на средние слои, а не на входной или выходной край. Работа опирается на фиксированную таксономию из восьми меток, применённых к размеченным сегментам пути решения, а не на свободные описания того, чем модель как будто занимается.
Чтобы исключить более простые объяснения, исследователи обучили классификатор, который смотрел только на использованные токены. Он справился хуже, чем классификатор, анализирующий внутренние представления. Позиция внутри пути решения тоже не объясняла эффект. Значит, внутренние состояния несут информацию о типе шага рассуждения, выходящую за пределы поверхностных формулировок, — различие существенно, когда одна и та же фраза может встретиться и в дедукции, и в вычислении.
Служебные слова вроде "a", "is" или "the" встречаются в самых разных шагах рассуждения. В ранних слоях их представления ещё перемешаны, но к средним и поздним слоям они разделяются в зависимости от окружающей операции. Одно и то же слово получает разное внутреннее представление в зависимости от того, к какому шагу рассуждения оно относится. Отдельное вмешательство блокировало внимание к предыдущим 30 токенам; сигнал операции при этом ослабевал, то есть шаги рассуждения не возникают сами по себе, а опираются на предшествующий контекст.
Что это значит для бизнеса
Даже на неверно решённых задачах тип выполняемой операции оставался опознаваемым — вычисление, припоминание формулы или дедукция. Ошибочный шаг вычисления всё равно выглядел внутри как вычисление, даже когда результат был неверным. Для команд, которые проверяют вывод модели, это указывает на возможное различие между неверным ответом, полученным при правильном типе операции, и сбоем, вызванным тем, что модель выполняет не ту операцию. Эти два случая требуют разных исправлений, а сегодня оба обычно видны только как неверное итоговое число.
Разделимость подтвердилась и на Llama-3-8B, а для Qwen3-8B обученные классификаторы успешно перенеслись на GPQA-Diamond и MATH-500. Это тесты за пределами исходной обучающей конфигурации, что говорит о привязке сигнала не к одному набору данных. Ограничения столь же ясны: эксперименты охватывают математические задачи и несколько моделей. Можно ли с помощью этих находок ловить ошибки или управлять моделью прямо во время генерации, остаётся открытым вопросом для будущих работ, поэтому ни один поставщик пока не может обещать управление в реальном времени на основе этого метода.
Связь между текстовым выводом и внутренними вычислениями уже стала практическим вопросом для безопасности ИИ. Чтение цепочки рассуждений — один из немногих доступных инструментов надзора, по данным OpenAI, но Anthropic показала, что модели раскрывают использованные подсказки лишь в 25–39 процентах случаев. Метод, переводящий внутренние векторы модели в читаемый текст, выявил, что Claude Opus 4.6 обрабатывает больше, чем видно в его выходных рассуждениях. А в модели Astra от OpenAI техника Recurrent Depth переносит часть рассуждения во внутренние числовые представления — то же пространство, которое изучает работа KAIST.
Следить стоит за тем, перейдёт ли подход с классификаторами от математических тестов к производственным задачам и от нескольких открытых моделей к системам, которые компании реально разворачивают. Если классификаторы, обученные на внутренних представлениях, перенесутся на такие области, как проверка договоров или финансовый анализ, у покупателей ИИ-инструментов появится второй, независимый канал проверки того, что модель сделала, а не только того, что она сказала. Пока такой перенос не показан, практическое прочтение уже: письменная цепочка рассуждений — полезная, но неполная запись, а внутренняя измерима в лаборатории.
