🔴 Пять ведущих AI-лабораторий не показали полного плана остановки опасной модели
Исследование выявило не отсутствие внутренних мер, а нехватку публичных правил, связывающих опасный сигнал с ограничением или отключением модели.
🔴 Пять ведущих AI-лабораторий не показали полного плана остановки опасной модели
Что произойдёт, если модель уже пытается обойти человеческий контроль? Guidelight изучила публичные материалы Anthropic, Google, OpenAI, Meta и xAI. В материале TechCrunch о результатах исследования вывод жёсткий: готовых публичных протоколов сдерживания мало.
Протокол должен связывать сигнал мониторинга — попытку подорвать контроль или всплеск отмеченного опасного поведения — с ответом компании: отозвать разрешения, ограничить работу или отключить модель. Это не разбор одной аварии: исследование не устанавливает причинённый ущерб, а оценивает готовность к нему.
Лучший результат у OpenAI — 3 из 5: компания уже приостанавливала или завершала отдельные процессы после инцидентов, но формального публичного плана на будущее исследователи не нашли. Meta и Anthropic получили самые низкие оценки за публикацию таких планов.
Низкий балл не доказывает, что внутренних мер нет. Google и OpenAI заявили, что оценка не охватывает всей их практики. OpenAI сообщила, что у неё есть и уже применялся процесс ограничения прав, приостановки задач, сокращения развёртывания или полного отключения. Но из опубликованных материалов по-прежнему нельзя понять главное: какой сигнал запускает каждую из этих мер.
Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.
#ИИ #AISafety #Безопасность #AIконтроль #AravanaAI
Хотите получать подобные материалы раньше?
Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.
Узнать про IntelligenceНе пропускайте важное
Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.
Исследователь Anthropic: риск гибели человечества от ИИ в ближайшие десять лет — выше 10%
Эван Хубингер поддержал предупреждение ушедшего коллеги и признал, что у Anthropic пока нет готового решения для контроля будущего сверхразума.
🔴 Astra от OpenAI будет рассуждать «по кругу» — следить за логикой модели станет сложнее
Recurrent depth позволяет Astra обрабатывать запрос циклически, но может оставить исследователям меньше читаемых следов для контроля.
🔴 Fable 5.1: меньше ложных блокировок и дешевле работа модели
Anthropic сокращает стоимость работы Fable и число ошибочных отказов, сохраняя мониторинг злоупотреблений, — но данные об ухудшении поведения раскрыты только для Mythos.