Если вам вдруг захочется повторить результаты
karpathy/autoresearch, то вам наверняка пригодится такая штука как
hooks. С помощью хуков можно, например, вызывать нужные вам функции когда Codex/Claude вызывает инструменты, заканчивает сессию и т.д. Это очень удобно, я пока настроил себе hook, который автоматически продолжат эксперименты autoresearch когда Codex останавливается. Если просто прописать Codex в
AGENTS.md инструкцию никогда не останавливаться, это
не будет работать. Пока эксперименты говорят что, возможно, было бы полезнее запустить обычную оптимизацию гиперпараметров, чем автономные идеи для резерча через Codex. Возможно, агенту могли бы помочь какие-то дополнительные метрики, источники идей. Добавил агенту mcp сервер alphaxiv, расскажу про результаты попозже.
Что такое autoresearch?
Это проект Andrej Karpathy, в котором берётся упрощенная реализация nanochat(ещё один проект Karpathy - маленькая LLM-ка, на которой удобно ставить эксперименты, тренировать её на одной GPU) и запускается агент, который пытается улучшить целевую метрику. У агента есть файлы prepare.py, train.py, program.md и pyproject.toml. Файлы program.md, prepare.py, pyproject.toml агент не может менять, в них задаются инструкции того что нужно делать, код для оценки натренированной модели, набор зависимостей окружения. Файл train.py агент может менять, ставить автономные эксперименты(например, менять гиперпараметры модели). Эксперименты потом сохраняются в файлик с небольшим комментарием того что агент поменял. В итоге у агента есть среда с ограничениями и понятная метрика для оптимизации, за счёт этого можно запустить агента на ночь, проснуться утром и увидеть что он что-то наоптимизировал. У меня это пока вызывает совершенно детский восторг(сегодня утром как раз проснулся с кучей готовых экспериментов).