Aikido опубликовали интересный benchmark по AI Pentesting: 10 моделей, 32 актуальные CVE и по 3 независимых запуска каждой модели.
В лидерах по совокупному recall:
• DeepSeek V4 Pro — 28/32 CVE
• Grok 4.6 — 26/32
• Opus 5 — 26/32
• Qwen 3.8 Max — 26/32
• Kimi K3 — 25/32
Но для меня интереснее не сам рейтинг моделей.
Один и тот же агент может находить разные уязвимости при повторных запусках. Поэтому несколько независимых проходов могут давать существенно больший результат, чем один запуск даже очень сильной модели.
Отсюда довольно очевидная архитектура для AI Pentesting:
несколько агентов → независимые исследования → объединение findings → verification → проверка exploitability.
То есть вопрос постепенно смещается от «какая модель лучше?» к «какая связка моделей и агентов эффективнее на каждый потраченный доллар?».
Именно orchestration и verification, на мой взгляд, будут становиться всё более важной частью AI Pentesting.
https://www.aikido.dev/blog/ai-model-benchmarks-aug-21-2026
#AISecurity #AIPentesting #CyberSecurity #LLM #DevSecOps #AppSec
В лидерах по совокупному recall:
• DeepSeek V4 Pro — 28/32 CVE
• Grok 4.6 — 26/32
• Opus 5 — 26/32
• Qwen 3.8 Max — 26/32
• Kimi K3 — 25/32
Но для меня интереснее не сам рейтинг моделей.
Один и тот же агент может находить разные уязвимости при повторных запусках. Поэтому несколько независимых проходов могут давать существенно больший результат, чем один запуск даже очень сильной модели.
Отсюда довольно очевидная архитектура для AI Pentesting:
несколько агентов → независимые исследования → объединение findings → verification → проверка exploitability.
То есть вопрос постепенно смещается от «какая модель лучше?» к «какая связка моделей и агентов эффективнее на каждый потраченный доллар?».
Именно orchestration и verification, на мой взгляд, будут становиться всё более важной частью AI Pentesting.
https://www.aikido.dev/blog/ai-model-benchmarks-aug-21-2026
#AISecurity #AIPentesting #CyberSecurity #LLM #DevSecOps #AppSec