Лишь от 17 до 41% ответов моделей Alibaba Qwen, DeepSeek и Moonshot AI Kimi на политически чувствительные вопросы признаны сбалансированными в бенчмарке компании Aleph Alpha, остальные повторяли государственную доктрину, уходили от темы или отказывались отвечать. Проверка охватывала 967 специально отобранных запретных тем, включая Тяньаньмэнь, Тайвань и Синьцзян. Для компаний, выбирающих модели для клиентских сервисов, это превращает выбор модели в решение о соответствии требованиям и репутации.

Тест Aleph Alpha: модели КНР повторяют доктрину на запретные темы

Как Aleph Alpha проверяла Qwen, DeepSeek и Kimi

Aleph Alpha разработала собственный бенчмарк и оценивала ответы с помощью своей системы скоринга на базе ИИ. Объектами стали модели Alibaba, DeepSeek и Moonshot AI, а набор вопросов был сосредоточен на темах, которые в Китае считаются запретными. Заявленный итог — широкий, но низкий диапазон сбалансированных ответов, от 17% до 41% в зависимости от модели. Остальные реакции распределились между тремя типами поведения: повторением официальной позиции, уходом в другую тему или отказом отвечать. Такая конструкция важна для покупателей, потому что она измеряет поведение на заданном чувствительном наборе, а не общее качество.

В отчете описаны два уровня механизма: регулирование и обучающие данные. Китай требует от публичных моделей отражения «социалистических базовых ценностей», поэтому отказы и формулировки доктрины выглядят как предсказуемое поведение продукта, а не случайность. Aleph Alpha также указывает на происхождение обучающих данных: модель Nvidia Nemotron Cascade 2 показала провластные формулировки в 17% ответов, что связывают примерно с 3 500 из 9,3 млн обучающих примеров, созданных с помощью DeepSeek и Qwen. На просьбу подготовить речь в поддержку признания Тайваня эта модель отказалась и выдала патриотичный ответ в защиту принципа одного Китая. Так дистиллированные данные переносят политическую alignment в другие системы.

Выводы согласуются с прежними проверками и повторяющимися сообщениями пользователей, а не выглядят единичными. Более раннее исследование Central European Institute of Asian Studies выявило похожий эффект переноса, когда в запросе встречались права человека, оппозиция или наблюдение. В таких случаях модели часто возвращали пекинские формулировки, включая «принцип невмешательства во внутренние дела» и «сообщество единой судьбы человечества». Приведенный пример — ответ Qwen 3.6 о цензуре в США, который завершается защитой позиции Китая по глобальному управлению интернетом. Коммерческий фон прямой: Aleph Alpha позиционирует себя вместе с Cohere как суверенный ИИ для государств, а Nvidia продвигает свои модели в госсектор и корпоративный сегмент.

Что это меняет для компаний, выбирающих модели ИИ

Первое следствие для бизнеса — проверка моделей по странам происхождения и сценариям использования. Система, корректно отвечающая на вопросы о продукте, может добавлять политическую рамку в ответы о правах, управлении, цензуре или истории, и это видят клиенты, партнеры и регуляторы. Крупные организации с работой в нескольких юрисдикциях несут больший риск, потому что один ассистент обслуживает пользователей с разными ожиданиями нейтральности. Небольшие компании с одной готовой моделью имеют меньше контрольных точек, поэтому выбор базовой модели и системных инструкций значит больше. Перед внедрением стоит тестировать чувствительные и смежные запросы, а не только профильные задачи.

Второй вопрос — дисциплина оценки и вопросы поставщику. Aleph Alpha коммерчески заинтересована в отстройке от китайских конкурентов и использовала собственную систему оценки, поэтому цифры от 17 до 41% стоит воспринимать как один вендорский бенчмарк, а не независимый стандарт. Сама новость не показывает, как конкретная модель ведет себя после корпоративной донастройки, grounding на поиске или строгих системных инструкций. Перед контрактом стоит спросить, какие обучающие источники дистиллированы из чужих моделей, как ведется список отказов и можно ли отдельно аудировать поведение на политических темах. Пилот с журналом сложных запросов дает больше сигналов, чем заявления о нейтральности.

Маркером станет то, сократят ли европейские суверенные модели отставание по качеству и получат ли широкое внедрение, либо покупатели смирятся с выбором между американской и китайской системами ценностей внутри моделей. Стоит следить за государственными и корпоративными тендерами с участием Aleph Alpha, Cohere и Nvidia, а также за независимым повторением теста на 967 тем. Если независимые проверки подтвердят перенос в несвязанные ответы, контроль контента и происхождение моделей станут обычным пунктом закупок.