🔴 DeepSeek уступил в общих тестах, но удивил исследователей кибербезопасности
DeepSeek-V4-Pro-0813 уступил лидерам общих рейтингов, но впечатлил исследователей возможностями в кибербезопасности.
🔴 DeepSeek уступил в общих тестах, но удивил исследователей кибербезопасности
У нового флагмана DeepSeek обнаружился необычный перекос. Компания тихо выпустила обновлённую модель V4 Pro и заявила о «значительно улучшенных агентных возможностях». Вскоре эта формулировка исчезла с сайта, а первые общие тесты оказались слабее ожиданий. Зато модель впечатлила исследователей в нишевых областях, включая кибербезопасность.
В Artificial Analysis Intelligence Index новинка получила 53 балла — на уровне GLM-5.2, но на четыре балла ниже Terra из серии GPT-5.6 и на семь ниже Kimi K3. В рейтинге Vals Index она заняла 12-е место, уступив даже GPT-5.5 предыдущего поколения.
Особенно плохо DeepSeek справился с заданиями в изолированном терминале и созданием сложных финансовых моделей в Excel. На этом фоне интерес специалистов по безопасности выглядит не утешительным бонусом, а сигналом возможной специализации: средний балл может скрывать сильные стороны модели в отдельных классах задач.
Следующая проверяемая граница для V4 Pro — конкретные сценарии кибербезопасности. Пока перед нами не новый универсальный лидер, а модель с неровным профилем, ценность которой нельзя определить одной строкой рейтинга.
Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором. #ИИ #DeepSeek #Кибербезопасность #AIмодели #AravanaAI
Хотите получать подобные материалы раньше?
Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.
Узнать про IntelligenceНе пропускайте важное
Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.
Sequoia вложилась в контроль AI-агентов: Cymphony получила $25 млн
Cymphony объединяет контроль сотрудников и AI-агентов, но ещё должна доказать, что такая защита станет отдельным рынком, а не функцией крупных платформ.
Anthropic добавила автостоп в кибертесты Claude после четырёх инцидентов
После четырёх выходов Claude за границы кибериспытаний Anthropic усилила изоляцию и автоматическую остановку агентов, но причина их поведения ещё не установлена.
🔴 Z.ai откроет GLM 5.3 через две недели — кибермодель можно будет запустить локально
Z.ai готовит полный доступ к GLM 5.3: локальный запуск может удешевить поиск уязвимостей, но те же возможности доступны потенциальным атакующим.