🔴 Пять ведущих AI-лабораторий не показали полного плана остановки опасной модели

Исследование выявило не отсутствие внутренних мер, а нехватку публичных правил, связывающих опасный сигнал с ограничением или отключением модели.

Aravana··1 мин

🔴 Пять ведущих AI-лабораторий не показали полного плана остановки опасной модели

Что произойдёт, если модель уже пытается обойти человеческий контроль? Guidelight изучила публичные материалы Anthropic, Google, OpenAI, Meta и xAI. В материале TechCrunch о результатах исследования вывод жёсткий: готовых публичных протоколов сдерживания мало.

Протокол должен связывать сигнал мониторинга — попытку подорвать контроль или всплеск отмеченного опасного поведения — с ответом компании: отозвать разрешения, ограничить работу или отключить модель. Это не разбор одной аварии: исследование не устанавливает причинённый ущерб, а оценивает готовность к нему.

Лучший результат у OpenAI — 3 из 5: компания уже приостанавливала или завершала отдельные процессы после инцидентов, но формального публичного плана на будущее исследователи не нашли. Meta и Anthropic получили самые низкие оценки за публикацию таких планов.

Низкий балл не доказывает, что внутренних мер нет. Google и OpenAI заявили, что оценка не охватывает всей их практики. OpenAI сообщила, что у неё есть и уже применялся процесс ограничения прав, приостановки задач, сокращения развёртывания или полного отключения. Но из опубликованных материалов по-прежнему нельзя понять главное: какой сигнал запускает каждую из этих мер.

Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.

#ИИ #AISafety #Безопасность #AIконтроль #AravanaAI

Тип материала: Пост из Telegram

Поделиться:TelegramXLinkedIn
Как вам материал?

Хотите получать подобные материалы раньше?

Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.

Узнать про Intelligence

Не пропускайте важное

Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.

Похожие материалы

Исследователь Anthropic: риск гибели человечества от ИИ в ближайшие десять лет — выше 10%

Эван Хубингер поддержал предупреждение ушедшего коллеги и признал, что у Anthropic пока нет готового решения для контроля будущего сверхразума.

·1 мин

🔴 Astra от OpenAI будет рассуждать «по кругу» — следить за логикой модели станет сложнее

Recurrent depth позволяет Astra обрабатывать запрос циклически, но может оставить исследователям меньше читаемых следов для контроля.

·1 мин

🔴 Fable 5.1: меньше ложных блокировок и дешевле работа модели

Anthropic сокращает стоимость работы Fable и число ошибочных отказов, сохраняя мониторинг злоупотреблений, — но данные об ухудшении поведения раскрыты только для Mythos.

·1 мин