Китайская лаборатория AllSpark выпустила Iris-mini и Iris-pro — два открытых поисковых агента на 35 млрд и 397 млрд параметров — вместе с полным рецептом обучения. По данным статьи, лучшие результаты в своём классе даёт один агент, без вспомогательных агентов и дополнительных шагов проверки. Для компаний, выбирающих между закрытыми поисковыми API и моделями, которые можно разместить у себя, это первый случай, когда вместе с весами опубликована вся схема: построение данных, фильтрация и обучение с подкреплением.

AllSpark выпустила открытые поисковые агенты Iris-mini и Iris-pro вместе с рецептом обучения

Что выпустила AllSpark и как это обучали

Обе модели построены на базах серии Qwen: Qwen3.6-35B-A3B у Iris-mini и Qwen3.5-397B-A17B у Iris-pro, обе работают с контекстным окном 256 000 токенов. Схема обучения строит задачи в обратном порядке от структуры ссылок веб-страниц: начиная с исходной страницы и её исходящих ссылок, она собирает граф терминов и связей и генерирует многошаговый вопрос, ответ на который требует связать несколько последовательных шагов. Каждый термин, кроме финального ответа, заменяется перефразировкой, поэтому подсказку нельзя разрешить простым текстовым поиском. В набор попадают только вопросы, которые эталонная модель не решает без инструментов, но решает с нужными источниками, — так задачи остаются сложными и проверяемыми.

Пути решения генерирует более сильная модель-учитель, после чего они проходят два круга фильтрации. Первый проверяет весь путь на корректность, циклы повторений и глубину поиска; второй — пошаговая проверка моделью-судьёй, критерии которой выведены из самих данных, а не заданы вручную. Затем модель улучшается обучением с подкреплением против живого веб-поиска. Модель-судья и сводки результатов работают внутри обучающего кластера на собственной большой модели Qwen, поэтому обучение не зависит от внешних сервисов. Дообучение с учителем и обучение с подкреплением чередуются в процессе, который авторы называют SFT-RL climbing: самые сложные решённые задачи и самые эффективные пути из каждого раунда переходят в следующий цикл.

Тестирование охватило BrowseComp, проверяющий умение находить редкие факты по косвенным подсказкам, его китайский аналог BrowseComp-ZH, DeepSearchQA, оценивающий полноту найденных доказательств, и Humanity's Last Exam с академическими вопросами экспертного уровня. При включённом управлении контекстом Iris-mini набирает 82,2, 84,8, 86,9 и 52,3; Iris-pro достигает 88,6, 85,1, 92,9 и 56,4. В младшем классе Iris-mini лидирует в трёх тестах из четырёх и обходит следующую за ней модель XYZ-Aquila-mini на BrowseComp на 3,4 пункта, но уступает на DeepSearchQA. Iris-pro лидирует или делит первое место в старшем классе и иногда приближается к системам, которым нужно значительно больше вычислений, по словам авторов.

Что это значит для компаний, внедряющих AI-агентов

Команда утверждает, что управление контекстом во время работы на распространённых тестах часто даёт больший эффект, чем заявленные разрывы между системами. В долгих исследовательских сессиях контекст может заполниться раньше, чем агент разберётся со всеми подвопросами, а приёмы вроде отбрасывания истории диалога искусственно продлевают исследование и мало говорят о реальном качестве модели. Эффект неравномерен: управление контекстом поднимает результат младшей модели на BrowseComp до 21,2 пункта — не потому, что у неё меньше бюджет токенов, а потому, что она расходует их быстрее, делает больше шагов на ту же задачу и чаще упирается в лимит. Для небольшой компании, запускающей агента на одном сервере, это означает, что обвязка вокруг модели может значить больше, чем число параметров на этикетке.

Практический вывод: агент на 35 млрд параметров с хорошо выстроенной работой с контекстом способен закрыть заметную часть исследовательских задач и работы с инструментами, для которой раньше требовалась гораздо более крупная размещённая модель. В выпуск входит Iris Harness с циклом агента, инструментами, стратегиями управления контекстом и всеми четырьмя тестами с оценкой, причём harness работает с любым OpenAI-совместимым endpoint. Веса доступны в коллекции на Hugging Face, код — на GitHub, а схемы построения данных и обучения обещаны позже. Крупная компания может дообучить модель на собственном графе документов; небольшая — начать с опубликованного harness и заменить endpoint.

Чего выпуск не проясняет — какую долю результата даёт модель, а какую обвязка. Команда прогнала каждый тест с управлением контекстом и без него, сохраняя неизменными инструменты, лимиты контекста и модель-судью, и отмечает, что результаты, опубликованные только с включённым управлением, нельзя чисто разделить между этими двумя частями. Лучшие оценки на Humanity's Last Exam получаются при сочетании отбрасывания истории со второй попыткой: если первая не удалась, система сжимает её в короткую заметку о том, что уже проверено и исключено, и эта заметка добавляется к задаче для следующего запуска. Покупателям стоит спрашивать поставщиков, какая конфигурация дала опубликованные цифры и воспроизводится ли она на их собственных данных.

Самый ясный ориентир — обещанная публикация схем построения данных и обучения. Если AllSpark их откроет и сторонние команды воспроизведут заявленные результаты на BrowseComp и DeepSearchQA со своей обвязкой, поиск перестанет выглядеть узкой специальностью и станет базовым навыком, переносимым на общее использование инструментов и офисную работу, — тот побочный эффект, о котором авторы сообщают и для сгенерированных данных, и для специализированных моделей. Если схемы останутся закрытыми, веса сохранят пользу, а рецепт — нет, и преимущество останется у тех, кто способен заново построить граф данных.