🤒 Локальная LLM для SOC | ИИ-триаж CVE без утечки за периметр
Аналитик копирует бюллетень в облачный чат и ловит блок от DLP, ответ: поднять инференс локально на Ollama. Главный лимит тут не ядра, а VRAM: модель с KV-кешем должна влезть целиком, иначе offload в RAM роняет скорость в разы, а квантование Q4/Q5 ужимает 13B до пары гигабайт.
— В данной статье разберем таблицы VRAM от RTX 3060 до A100, выбор модели под CVE и OSINT и почему локальный инференс сам становится мишенью: LeftoverLocals и голый порт Ollama.
⛓ Читать подробнее
#LocalLLM #ThreatIntel #AISecurity || LIZARD
Проблема облачных моделей не в качестве, а в том, что вместе с логом туда уходят внутренние IP, имена хостов и версии из SBOM.
Аналитик копирует бюллетень в облачный чат и ловит блок от DLP, ответ: поднять инференс локально на Ollama. Главный лимит тут не ядра, а VRAM: модель с KV-кешем должна влезть целиком, иначе offload в RAM роняет скорость в разы, а квантование Q4/Q5 ужимает 13B до пары гигабайт.
— В данной статье разберем таблицы VRAM от RTX 3060 до A100, выбор модели под CVE и OSINT и почему локальный инференс сам становится мишенью: LeftoverLocals и голый порт Ollama.
⛓ Читать подробнее
#LocalLLM #ThreatIntel #AISecurity || LIZARD