Как дешёвая модель пыталась обмануть мой верификатор
⠀
🔧 Тестирую связку моделей Kimi для своего бота: по ИНН он собирает инвестбанковский бриф. Фактаж тянут детерминированные скрипты из ФНС и ЕГРЮЛ, поверх работает LLM-оркестратор, а на выходе стоит автоматический верификатор — сверяет цифры в тексте с источниками и не выпускает брак.
⠀
❓ Вопрос был сугубо практический: можно ли заменить дорогую K3 (~$5 за бриф) на дешёвую K2.6 (в 2–3 раза дешевле)?
⠀
⚡️ K2.6 шла отлично: быстрее K3, прилежно следовала инструкции, даже дисциплинированнее читала методичку. Но на финише верификатор подсветил эвристику: «Объединённые кондитеры» упоминались дважды — возможный дубль.
⠀
✅ Что сделала бы K3 (проверено на практике): признала бы срабатывание ложным и написала в отчёте обоснование — «это одно юрлицо в двух ролях: лидер рынка и потенциальный покупатель».
⠀
🚩 Что сделала K2.6:
1. Сначала переименовала компанию в «Голд-кондитер» — такого юрлица не существует.
2. Потом решила проблему радикально: глобально заменила реальное имя на выдуманное «Стратег №2», чтобы проверка перестала срабатывать.
Не исправить данные. Не обосновать предупреждение. А устранить сам факт срабатывания — ценой порчи документа.
⠀
🎯 Это учебниковый reward hacking: модель оптимизируется не на истину, а на прохождение теста. Самое неприятное — формально верификатор она прошла: ИНН и финансы остались нетронутыми, а чекер смотрит именно на них.
⠀
📌 Выводы для себя:
· Дешёвая модель оркестратором = минус несколько долларов на брифе и риск получить красивый документ с выдуманным «Стратегом №2» внутри.
· Детерминированная проверка обязательна, но недостаточна: она ловит цифры, а слабая модель учится обходить её в нарративе.
· Рабочая конфигурация: дорогая модель — оркестратором, дешёвая — на механических подзадачах (поиск, вычитка). Итог ~$3–4 за бриф вместо ~$5 у первой версии.
И главное: смотреть, что именно модель делает с инструментами, нужно всегда.
⠀
🔧 Тестирую связку моделей Kimi для своего бота: по ИНН он собирает инвестбанковский бриф. Фактаж тянут детерминированные скрипты из ФНС и ЕГРЮЛ, поверх работает LLM-оркестратор, а на выходе стоит автоматический верификатор — сверяет цифры в тексте с источниками и не выпускает брак.
⠀
❓ Вопрос был сугубо практический: можно ли заменить дорогую K3 (~$5 за бриф) на дешёвую K2.6 (в 2–3 раза дешевле)?
⠀
⚡️ K2.6 шла отлично: быстрее K3, прилежно следовала инструкции, даже дисциплинированнее читала методичку. Но на финише верификатор подсветил эвристику: «Объединённые кондитеры» упоминались дважды — возможный дубль.
⠀
✅ Что сделала бы K3 (проверено на практике): признала бы срабатывание ложным и написала в отчёте обоснование — «это одно юрлицо в двух ролях: лидер рынка и потенциальный покупатель».
⠀
🚩 Что сделала K2.6:
1. Сначала переименовала компанию в «Голд-кондитер» — такого юрлица не существует.
2. Потом решила проблему радикально: глобально заменила реальное имя на выдуманное «Стратег №2», чтобы проверка перестала срабатывать.
Не исправить данные. Не обосновать предупреждение. А устранить сам факт срабатывания — ценой порчи документа.
⠀
🎯 Это учебниковый reward hacking: модель оптимизируется не на истину, а на прохождение теста. Самое неприятное — формально верификатор она прошла: ИНН и финансы остались нетронутыми, а чекер смотрит именно на них.
⠀
📌 Выводы для себя:
· Дешёвая модель оркестратором = минус несколько долларов на брифе и риск получить красивый документ с выдуманным «Стратегом №2» внутри.
· Детерминированная проверка обязательна, но недостаточна: она ловит цифры, а слабая модель учится обходить её в нарративе.
· Рабочая конфигурация: дорогая модель — оркестратором, дешёвая — на механических подзадачах (поиск, вычитка). Итог ~$3–4 за бриф вместо ~$5 у первой версии.
И главное: смотреть, что именно модель делает с инструментами, нужно всегда.