Codex vs Claude Code кто кого?(на скриншоте 6 воркеров пишут решение одного ишью параллельно)
В
продолжение поста решился провести такой генеративный экспиримент кодирования на моделях Terra и Luna и принять свое собственное мнение, насколько хороши эти модели.
На выполнение одно и того ишью запускал Кодекс и Клод Код. Каждый воркер создавал свой ПР. Дальше эти ПРы сравнивались LLM judge и выбирался победитель.
Сначала я запускал luna и terra, а и против них ставил Opus 5, но потом я подумал, что в чате многие жалуются, что Opus 5 им не нравится, как программирует, я начал запускать еще и параллельно Sonnet 5.
Чувствую
сейчас в меня полетят помидоры и тухлые яица, но за первые 5 прогонов Luna выиграл 1 раз, на каком-то маленьком ПРе на 54 строки.
Но, я хотел тотального доминирования и сделал 5 прогонов еще раз, в этот раз я запускал по три воркера (все на medium effort):
• GPT-5.6 Sol
• Opus 5
• Sonnet 5
Ну и так же было интересно сравнить Opus 5 и Sonnet 5.
Итого 1:9 (из 10 прогонов) в пользу Clade Code.
При запуске нескольких воркеров на решение одной и той же задачи почти всегда побеждал Claude Code на Opus 5. Sonnet 5 победил тоже всего 1 раз.
Но, какие в этом методе есть допущения и почему этот метод нельзя считать научным:
1. Я тестировал на своих задачах (Пайтон + Бэкенд), возможно на других задачах (на фронте) результаты были бы другие.
2. Как оценивает этот LLM judge — чистой воды загадка. По хорошему надо 2 LLM запускать оценивать победителя, одну на Claude Code другую на Codex.
3. Иногда я запускал в режиме планирования и в ручную переключал в auto, иногда сразу запускал в авто. Если каждый раз запускать с режима планирования, а потом переключать в авто, результат может быть другой. /opusplan я тоже не тестировал.
4. Если вы предпочитаете программировать на xhigh то опять же результат может быть другой.
5. Цена прогона никак не влияла на выбор победителя.
5. Не понятно, не является ли более качественное решение просто оверинжиниригом, если на боевом прогоне программа выполняет все поставленные ей задачи, то нужно ли еще улучшать и рассматривать все теоретические краевые случаи? Обычно у ЛЛМ как раз такие решения и побеждают.
В заключении скажу, что токенов на такие экспирименты уходит несоизмеримо больше, чем на обычное линейное программирование. Ну и автоматизируется это как-то все не очень.