Главное из ЛигалТех-каналов | неделя 17-18
Эксперименты и практика
➡️[Тестирование моделей, Архитектура RAG]
Сравнение эмбеддинг-моделей и реранкеров для RAG в юриспруденции
— Draft AI | Иван Кундиль
Автор протестировал 6 эмбеддинг-моделей на 858 актах СИП и 30 юридических вопросах для своего RAG-агента. Реранкер оказался важнее выбора эмбеддинга, так как подтягивает качество слабых моделей, а гибрид из двух разных эмбеддингов увеличивает покрытие релевантных документов на 28 процентных пунктов. Для практики: при построении юридического RAG стоит в первую очередь внедрить реранкер и рассмотреть комбинацию из двух разных эмбеддингов для повышения полноты поиска.
➡️[Архитектура бота]
Почему ИИ-бот для юристов перестал отвечать на 3 дня: долгий ответ системы и как это исправили
— Делай RAG
Автор разобрал причину трёхдневного простоя своего LegalTech-бота: долгий ответ от API Gemini заблокировал event loop для всех пользователей, а не для одного. В результате внедрён таймаут для нейросетевых запросов и улучшены уведомления администратора.
➡️[Свой проект]
Разработка RAG-бота в Яндекс Мессенджере для фарм-юристов
— Евдокия | Legal AI
Автор с коллегой из IT самостоятельно разработали RAG-бота для юридических запросов в корпоративном Яндекс Мессенджере, обойдя сторонних подрядчиков. Юрист может использовать этот кейс как пример быстрого прототипирования инструмента с контролем безопасности и метрик, вдохновив IT-специалиста на приоритетную задачу.
➡️[Архитектура RAG, Тестирование моделей]
Разбор IP Agent: архитектура, тесты моделей и создание бота юристом
— AI Скрепка | Евгений Мирошниченко
Автор провёл вебинар с создателем IP Agent, где показали архитектуру RAG-бота, включая эмбеддинги и реранкер, и протестировали 10 LLM на юридических задачах. Юрист-практик может использовать этот опыт для оценки подхода к созданию специализированных RAG-систем и выбора моделей под конкретные юридические кейсы.
Полезные разборы
➡️[Безопасность ИИ]
Уязвимость LLM через «отравление» обучающей выборки
— LawCoder
Исследование Anthropic и британского AISI показало, что для создания устойчивого бэкдора в модели достаточно внедрить всего 250 вредоносных документов в массив данных для обучения. Для юристов это означает критический риск безопасности при использовании моделей, обученных на открытых данных, так как атака срабатывает независимо от общего объема выборки.
➡️[Разбор инструмента]
Локальный PII-детектор от OpenAI для английского языка
— Дамасские чернила | AI и M&A
OpenAI выпустила модель-классификатор для детекции персональных данных в текстах на английском языке с лицензией Apache 2.0. Юрист может встроить её в пайплайн перед отправкой данных в облачную LLM, чтобы технически минимизировать риски утечки ПДн, но для русского языка потребуется искать аналоги.
➡️[Разбор инструмента, Опыт внедрения]
Разбор вебинара Anthropic: как юристы настраивают Claude для реальной работы
— ИИ для юриста🤖
Автор разобрал вебинар Anthropic для юристов, где показали, как команда настроила ИИ для анализа речи в суде в реальном времени и выиграла дело. Ключевой вывод: готовые плагины бесполезны — ИИ-инструмент нужно кастомизировать под внутренние регламенты и процессы компании. Юрист, внедряющий ИИ, должен не использовать его «из коробки», а настраивать на свои данные и создавать собственные сценарии работы.
@AI_Skrepka
Эксперименты и практика
➡️[Тестирование моделей, Архитектура RAG]
Сравнение эмбеддинг-моделей и реранкеров для RAG в юриспруденции
— Draft AI | Иван Кундиль
Автор протестировал 6 эмбеддинг-моделей на 858 актах СИП и 30 юридических вопросах для своего RAG-агента. Реранкер оказался важнее выбора эмбеддинга, так как подтягивает качество слабых моделей, а гибрид из двух разных эмбеддингов увеличивает покрытие релевантных документов на 28 процентных пунктов. Для практики: при построении юридического RAG стоит в первую очередь внедрить реранкер и рассмотреть комбинацию из двух разных эмбеддингов для повышения полноты поиска.
➡️[Архитектура бота]
Почему ИИ-бот для юристов перестал отвечать на 3 дня: долгий ответ системы и как это исправили
— Делай RAG
Автор разобрал причину трёхдневного простоя своего LegalTech-бота: долгий ответ от API Gemini заблокировал event loop для всех пользователей, а не для одного. В результате внедрён таймаут для нейросетевых запросов и улучшены уведомления администратора.
➡️[Свой проект]
Разработка RAG-бота в Яндекс Мессенджере для фарм-юристов
— Евдокия | Legal AI
Автор с коллегой из IT самостоятельно разработали RAG-бота для юридических запросов в корпоративном Яндекс Мессенджере, обойдя сторонних подрядчиков. Юрист может использовать этот кейс как пример быстрого прототипирования инструмента с контролем безопасности и метрик, вдохновив IT-специалиста на приоритетную задачу.
➡️[Архитектура RAG, Тестирование моделей]
Разбор IP Agent: архитектура, тесты моделей и создание бота юристом
— AI Скрепка | Евгений Мирошниченко
Автор провёл вебинар с создателем IP Agent, где показали архитектуру RAG-бота, включая эмбеддинги и реранкер, и протестировали 10 LLM на юридических задачах. Юрист-практик может использовать этот опыт для оценки подхода к созданию специализированных RAG-систем и выбора моделей под конкретные юридические кейсы.
Полезные разборы
➡️[Безопасность ИИ]
Уязвимость LLM через «отравление» обучающей выборки
— LawCoder
Исследование Anthropic и британского AISI показало, что для создания устойчивого бэкдора в модели достаточно внедрить всего 250 вредоносных документов в массив данных для обучения. Для юристов это означает критический риск безопасности при использовании моделей, обученных на открытых данных, так как атака срабатывает независимо от общего объема выборки.
➡️[Разбор инструмента]
Локальный PII-детектор от OpenAI для английского языка
— Дамасские чернила | AI и M&A
OpenAI выпустила модель-классификатор для детекции персональных данных в текстах на английском языке с лицензией Apache 2.0. Юрист может встроить её в пайплайн перед отправкой данных в облачную LLM, чтобы технически минимизировать риски утечки ПДн, но для русского языка потребуется искать аналоги.
➡️[Разбор инструмента, Опыт внедрения]
Разбор вебинара Anthropic: как юристы настраивают Claude для реальной работы
— ИИ для юриста🤖
Автор разобрал вебинар Anthropic для юристов, где показали, как команда настроила ИИ для анализа речи в суде в реальном времени и выиграла дело. Ключевой вывод: готовые плагины бесполезны — ИИ-инструмент нужно кастомизировать под внутренние регламенты и процессы компании. Юрист, внедряющий ИИ, должен не использовать его «из коробки», а настраивать на свои данные и создавать собственные сценарии работы.
@AI_Skrepka