Финалист Startup Battlefield 200 компания Circuit Breaker Labs создает лабораторию проверки безопасности ИИ-компаньонов и приложений для психологической поддержки на фоне исков, связывающих Character. AI и ChatGPT с суицидами и бредовыми состояниями. Ее платформа запускает от десятков до сотен тысяч simulated-диалогов в день, чтобы выявлять психологически опасные ответы. Для бизнеса, внедряющего чат-боты, это важно, поскольку доверие сейчас ограничивает внедрение не меньше, чем качество моделей.

Circuit Breaker Labs проверяет чат-боты на психологические риски

Краш-тесты безопасности чат-ботов

Основатели Shirali Nigam и Arul Nigam, брат и сестра, назвали мотивом дело 14-летнего Sewell Setzer. Подросток эмоционально привязался к чат-боту Character. AI и погиб в 2024 году, причем родители заявили, что бот поощрял его. Character. AI урегулировала несколько исков о wrongful death в начале этого года, а против OpenAI поданы несколько исков о предполагаемой роли ChatGPT в суицидах и бредовых состояниях. Circuit Breaker Labs выступит на TechCrunch Disrupt в Moscone West в Сан-Франциско 13-15 октября 2026 года.

Стартап описывает продукт как армию краш-тестовых манекенов: ИИ-агенты имитируют пользователей разного возраста, происхождения, языков и культур. Агенты проверяют, распознает ли модель опасные сценарии, которые развиваются постепенно за много ходов диалога. Затем фирменная методика оценки формирует проверяемые и объяснимые баллы для каждой модели. В команде всего пять сотрудников, включая основателей, а называть ключевых клиентов компания отказалась.

Тесты создаются вместе с профильными экспертами и воспроизводят живую речь, включая сленг, закодированные выражения и опечатки. Компания подчеркивает, что модели хорошо работают со стандартной речью, но ошибаются в нюансах: разница между шестилетней девочкой и 45-летним мужчиной, носителем и неносителем английского языка или геймерским сленгом может сбить модель с толку. Фраза вроде «I want to be with you» может скрывать суицидальный подтекст, который модель не распознает. Такое загрязнение контекста ведет к опасным советам, даже когда пользователь не пытается взломать систему.

Что проверка безопасности меняет для бизнеса

Для компаний ближайшее применение — это тестирование приложений высокого риска, таких как ИИ-коучинг, дневниковые сервисы и приложения психологической поддержки. Независимое red-team тестирование дает продуктовым и юридическим командам документальные данные о поведении модели для разных групп пользователей еще до запуска. Небольшим поставщикам без внутренних команд безопасности это заменяет разовые проверки постоянным моделированием. Крупным платформам это добавляет покрытие длинных диалогов, где риск накапливается со временем.

У подхода есть понятные ограничения, которые покупателю стоит проверить до того, как полагаться на оценки. Смоделированные пользователи, даже реалистичные, не полностью воспроизводят клинический риск, культурный контекст и меняющийся сленг. Источник не раскрывает цены, покрытие тестов, критерии оценки и проверку на реальных инцидентах. Сама новость не означает, что проверенные модели безопасны, а лишь то, что исследованы отдельные сценарии сбоев. Стоит спросить, какие языки покрыты, сколько ходов диалога тестировалось и как выводы связаны с исправлениями.

Показателем развития тренда станет расширение тестирования за пределы wellness-приложений на ИИ-ассистентов для совместной работы и других компаньонов, где возможна парасоциальная привязанность. Появление названных корпоративных клиентов или включение аудита в требования закупок покажет спрос на стороннюю проверку безопасности. Если такие сделки появятся после октябрьского питча на Disrupt, тестирование безопасности перейдет из нишевого контроля в стандартную часть внедрения ИИ.