Совместное исследование ученых из Германии, Мексики и США показало, что автоматическое добавление текущей даты в системный промпт подрывает оценку LLM. На 9 моделях, 6 датасетах и четырех задачах эти скрытые метаданные меняли результаты и перетасовывали позиции в рейтингах. Эффект превысил разброс от размера батча и числовой точности, и это важно для покупателей, которые сравнивают поставщиков по бенчмаркам.
Как скрытая дата меняет результаты тестов
Команда проверила каждый день 2024 года, с 1 января по 31 декабря, сохраняя пользовательские промпты и настройки и меняя только дату в системном промпте. Вопросы с привязкой ко времени исключили. Использовались шесть бенчмарков: MMLU, GPQA и ARC-Challenge для вопросов с выбором ответа, GSM8K для математики, HumanEval для генерации кода на Python и WMT для перевода с английского на немецкий, финский и чешский. Проверялись девять моделей с открытыми весами, включая Llama 3.1 Instruct 8B и 70B, Gemma 3 Instruct 4B и 27B, Qwen3 4B, Qwen3-Next 80B, Phi-4 14B и GPT-OSS 20B и 120B.
Одна лишь смена даты меняла точность на тех же вопросах. Разброс достигал до 6% на вопросах с выбором ответа, 14% на математических рассуждениях и 7% на генерации кода, оценки перевода тоже заметно колебались. Точность отражала долю верных ответов, Expected Calibration Error показывал соответствие уверенности и результата, код оценивали через pass@1, а перевод через BLEU и chrF. Задачи со свободной генерацией ответа оказались чувствительнее, чем выбор ответа по вероятности токена. В итоге модель могла подняться или опуститься в рейтинге без реального изменения возможностей.
Эффект сохранился и в проприетарных системах, где пользователь не управляет промптом. Модель GPT-5.1 тестировали на трех бенчмарках с выбором ответа семь дней подряд в декабре 2025 года с пустым системным промптом, отключенными рассуждениями и нулевой случайностью. Точность все равно колебалась до 4%, максимальный разрыв зафиксировали на GPQA. Провайдер автоматически подставлял дату вопреки фиксированным настройкам. Пошаговые рассуждения усиливали разброс, а обучение на пяти примерах снизило среднюю вариацию лишь с 2,52% до 2,27%.
Что нестабильные бенчмарки означают для бизнеса
Для компаний, выбирающих модели, шум от даты ослабляет ценность публичных рейтингов и таблиц поставщиков. Разрыв в несколько процентных пунктов может отражать день тестирования, а не реальный прогресс между версиями или конкурентами. Закупочные команды, сравнивающие ассистентов продаж, агентов поддержки или помощников для кода, рискуют переплатить за лидерство, которое исчезнет при повторе. Малые компании, опирающиеся на открытые рейтинги, уязвимы сильнее, а крупные могут усреднять замеры за несколько дней, но тратят больше вычислений и времени специалистов.
Вероятной причиной авторы называют хрупкость к формулировке промпта. По их версии, системный промпт может фиксироваться на этапах supervised fine-tuning и reinforcement learning from human feedback, поэтому модели чувствительны к малым изменениям. Шесть альтернативных формулировок системного промпта меняли точность на 0,78%, примерно так же, как смена даты. Также проверяли оборудование, размер батча, точность, порядок ответов и формулировки, причем порядок ответов и формулировки оказались ближе всего к эффекту даты. Рекомендация авторов — убирать дату там, где возможно, либо фиксировать и документировать ее.
Практическим маркером служит документирование условий оценки. Бизнесу стоит запрашивать у поставщиков точный системный промпт, фиксированную дату тестирования и оценки, усредненные за несколько дат, а не за один запуск. В контрактах на агентов и автоматизацию можно требовать повторные прогоны на данных покупателя с раскрытыми настройками. Если провайдеры начнут публиковать воспроизводимые бенчмарки с фиксированной датой и усредненные результаты, риск выбора снизится, а пока разница в несколько пунктов не должна определять решение о покупке.
