Recursive Language Models: как обрабатывать 10M+ токенов, превращая промпт в среду исполнения (часть 2 из 2)
Даже без рекурсии, просто наличие REPL и возможности писать код для навигации по тексту поднимает метрики на порядок.
В задаче CodeQA (ответы по длинной документации):
• Base GPT-5: 24.00 accuracy.
• CodeAct (RAG-агент): 52.00.
• RLM: 62.00.
Экономика токенов
На бенчмарке BrowseComp-Plus (мульти-хоп вопросы по 1000+ документам, суммарно 6–11 млн токенов) RLM показывает не только качество, но и эффективность.
• Стоимость запроса RLM GPT-5: ~$0.99.
• Гипотетическая стоимость загрузки всего контекста в модель: $1.50 – $2.75.
RLM позволяет обрабатывать объемы данных, превышающие контекстное окно в 100 раз (до 10M+ токенов), сохраняя точность на уровне 91.33%, тогда как стандартные модели начинают деградировать при увеличении числа документов.
Паттерны поведения модели
Анализ траекторий (логов действий модели) выявил интересные стратегии, которые модель "изобретает" сама:
1. Peek step: Сначала читает первые несколько тысяч символов, чтобы понять структуру.
2. Grep-style filtering: Использует ключевые слова и regex для сужения области поиска.
3. Map-Reduce: Для сложных запросов разбивает контекст, обрабатывает куски параллельно и программно сшивает ответы.
4. Stitching: Для длинных ответов сохраняет частичные результаты в переменные и собирает их в конце, обходя лимит на длину вывода.
Ключевые моменты:
• Смена парадигмы: Промпт — это не входные данные тензора, а внешняя среда, доступная через API (код).
• Масштабируемость: Рекурсия во время инференса (Inference time recursion) позволяет работать с контекстами, на порядки превышающими окно модели.
• Сложность задач: RLM доминируют в задачах, требующих глубокого рассуждения над всем объемом данных (reasoning-heavy), где обычный RAG (retrieval) теряет логические связи.
• Доступность: Реализация RLMEnv от Prime Intellect уже показывает результаты на моделях класса INTELLECT-3 и GPT-5-mini, делая технологию применимой не только для SOTA-гигантов.
Практический вывод
Если вы строите системы для анализа больших документов, кодовых баз или юридических текстов, переход от парадигмы RAG (нарезка и поиск векторов) к парадигме RLM (агент с REPL и доступом к тексту как к переменной) может дать качественный скачок. Особенно если ваши задачи требуют не просто "найти факт", а "сравнить факты из начала и конца книги".
Будущее за агентами, которые умеют писать код для управления собственным вниманием, а не просто пассивно потребляют токены. Ожидаем появления RL-фреймворков, которые будут обучать модели оптимальным стратегиям чанкинга и рекурсии.
Источник
Переводы видео, саммари новостей про AI
Даже без рекурсии, просто наличие REPL и возможности писать код для навигации по тексту поднимает метрики на порядок.
В задаче CodeQA (ответы по длинной документации):
• Base GPT-5: 24.00 accuracy.
• CodeAct (RAG-агент): 52.00.
• RLM: 62.00.
Экономика токенов
На бенчмарке BrowseComp-Plus (мульти-хоп вопросы по 1000+ документам, суммарно 6–11 млн токенов) RLM показывает не только качество, но и эффективность.
• Стоимость запроса RLM GPT-5: ~$0.99.
• Гипотетическая стоимость загрузки всего контекста в модель: $1.50 – $2.75.
RLM позволяет обрабатывать объемы данных, превышающие контекстное окно в 100 раз (до 10M+ токенов), сохраняя точность на уровне 91.33%, тогда как стандартные модели начинают деградировать при увеличении числа документов.
Паттерны поведения модели
Анализ траекторий (логов действий модели) выявил интересные стратегии, которые модель "изобретает" сама:
1. Peek step: Сначала читает первые несколько тысяч символов, чтобы понять структуру.
2. Grep-style filtering: Использует ключевые слова и regex для сужения области поиска.
3. Map-Reduce: Для сложных запросов разбивает контекст, обрабатывает куски параллельно и программно сшивает ответы.
4. Stitching: Для длинных ответов сохраняет частичные результаты в переменные и собирает их в конце, обходя лимит на длину вывода.
Ключевые моменты:
• Смена парадигмы: Промпт — это не входные данные тензора, а внешняя среда, доступная через API (код).
• Масштабируемость: Рекурсия во время инференса (Inference time recursion) позволяет работать с контекстами, на порядки превышающими окно модели.
• Сложность задач: RLM доминируют в задачах, требующих глубокого рассуждения над всем объемом данных (reasoning-heavy), где обычный RAG (retrieval) теряет логические связи.
• Доступность: Реализация RLMEnv от Prime Intellect уже показывает результаты на моделях класса INTELLECT-3 и GPT-5-mini, делая технологию применимой не только для SOTA-гигантов.
Практический вывод
Если вы строите системы для анализа больших документов, кодовых баз или юридических текстов, переход от парадигмы RAG (нарезка и поиск векторов) к парадигме RLM (агент с REPL и доступом к тексту как к переменной) может дать качественный скачок. Особенно если ваши задачи требуют не просто "найти факт", а "сравнить факты из начала и конца книги".
Будущее за агентами, которые умеют писать код для управления собственным вниманием, а не просто пассивно потребляют токены. Ожидаем появления RL-фреймворков, которые будут обучать модели оптимальным стратегиям чанкинга и рекурсии.
Источник
Переводы видео, саммари новостей про AI