Vibe Coding: OpenCode, Claude Code, Codex, Cursor, Kilo


Гео и язык канала: Весь мир, Русский
Категория: Технологии


Пишу про полностью автоматическую отгрузку Вайб Кода, свежие апдейты, промпты и тесты ИИ-инструментов.

Связанные каналы

Гео и язык канала
Весь мир, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Страйп покупает OpenRouter за 7 ярдов.


Каждый раз, при запуске Playwright CLI Codex крашится с ошибкой

Оказалось, это от того, как Codex запускает команды вне песочницы.

Плагин сам отключить sandbox не может. Он лишь сообщает Codex, что конкретную команду нужно запустить с расширенными правами. Дальше Codex получает разрешение и создаёт отдельный процесс вне macOS Seatbelt. Глобально песочница при этом не отключается.

Если команда всё-таки запущена внутри sandbox, CLI должен распознавать CODEX_SANDBOX=seatbelt и завершает работу до запуска Chromium, создания блокировок и записей аудита. Иначе, останутся ложные запуски со статусом uncertain.

Имеет смысл протестить, что CODEX_SANDBOX_NETWORK_DISABLED=1 не крашится.

Итого: плагин задаёт правило, Codex выполняет повышение прав для конкретной команды, а CLI страхует от неправильного запуска.

Но, многие тут зададут совершенно правильный вопрос, а зачем?

• Ну я много раз уже писал о том, что не люблю режим --dangerously-skip-permissions (и очень редко когда его использую)
• Важное правило сисадмина — не выдавать лишних прав там, где это не нужно.

Этаж критическая ошибка, когда Кодекс rm -rf ~/ происходит 1 раз на миллион, и лучше, чтобы это произошло в песочнице. Тогда он просто сам себе напишет "так, я что-то сделал не так" и вы об этом даже не узнаете.

Документация


Вот и Codex отправился в след за Fable 5


Ребята, эта функция Computer History очень крутая функция!

Пост об этом

Почативишься с ChatGPT (Codex) он мне выдал идейку:


$ gh needs-user

hhru#491 Нужно выбрать порог скоринга
wordstat#29 Воркер потерял связь с AO

Я gh needs-user воспринял как просто пример, а не настолько буквально, и в такой вот форме выдал задание Zcode. За жалкие 20% 5ти часового лимита GLM-5.3 выдал мне MVP needs attention т.е. просто показывает список элементов, которые у меня зависли в системе. И он его даже улучшил указав число дней, у каждого забытого элемента.

Следующий шаг, написать хуки для Клод Кода (или найти готовые), которые будут двигать эти элементы внутри виртуального канбана.


Репост из: КайфКодинг
Коммиты на GitHub удвоились за четыре месяца. Столько разработчиков за четыре месяца нигде не появилось.

Влад Фёдоров, технический директор GitHub, разбирает аварию 17 августа — семь часов сорок семь минут — и по дороге приводит цифру: с апреля коммитов в месяц стало 2,9 миллиарда вместо 1,4. Обе августовские аварии он называет отказами по ёмкости, а не по коду. В его формулировке:

Рост объясняет давление на наши системы, но не оправдывает эти аварии.


Слова «агент» в постмортеме нет ни разу.

Счётчик коммитов больше не меряет, сколько работали люди. Если ёмкость своего CI вы планируете от числа людей в команде, база устарела ещё в апреле.

https://github.blog/news-insights/company-news/the-august-17-outage-and-the-work-ahead/


Когда OpenAI добавили Computer History в Codex мы как-то всем миром поржали

И зря! Очень полезная функция оказалась, но не очевидная.

Теперь кодекс может изучить каждое нажатие клавиши у вас в Маке и дать советы, что вообще с этим делать.

Мне сегодня он сам предложил:

Составь для меня забавный обзор данных из [@История действий на компьютере](plugin://computer-history@openai-bundled). Расскажи о моих рабочих привычках, о том, что меня отвлекает, о любимых сочетаниях клавиш и моём стиле письма, а напоследок слегка меня подколи


Видимо будет теперь каждую неделю предлагать.

Ну я сразу сообразил, и написал второй промпт:

Что я не добрабатываю в автоматизации своих регулярно повторяющихся действий?


Ну и он мне как бы озвучил то, что для меня само собой было очевидно, только вот я что-то боялся за это браться.


У z.ai появились ресеты лимитов

Вовремя я в аккаунт вошел, оказалось, что ресет истекает через 2 часа.


На Оллама завезли ornith-1.5

Чем примечательна эта модель?

1 .При размере всего 397b по некоторым бенчам модель уделывает Opus 4.8 который скорее всего куда большего размера.

2. Эта уже как бы вторая версия этой модели и она способна как бы к самообучению (самосовершенствованию). Т.е. в процессе работы эта модель она генерирует примеры, на которых потом сама и обучается.

Вместо того чтобы полагаться на фиксированный набор задач, созданных людьми, и вручную разработанные шаблоны, Ornith-1.5 постоянно генерирует новые обучающие задачи, находит эффективные стратегии их решения и улучшает политику с помощью обучения с подкреплением.


Контекстное окно 256K

Может быть все бросать и бежать тестировать не стоит, но небольшой заметки эта модель достойна.

https://ollama.com/library/ornith-1.5


Теперь компактация Claude Code в /remote-control показывает, сколько токенов было ужато

Осталось только индикатор этого самого контекстного окна добавить, а то в Web есть, а в приложении нет.


DeepSeek V4 Flash Vision

Релиз, который мы чуть было не пропустили, т.к. на оллама еще не завезли.

Как видим по бенчам, по некоторым стало даже чуть помощнее, чем не вижен версия. Но по некоторым чуть слабее.

Цена осталось на уровне не вижен версии. На опенроутере сейчас скидки по $0.66 дают попробовать.

GLM-5.3 конкретно выкуси.

https://api-docs.deepseek.com/news/news260821/


Опишитесь в комментах


В общем, зачисли мне этот сброс, но он не вечный, истекает 21 сентября.


Ребята, а кто понял, какой сюрприз обещал Тибо на выходных?

Генерацию музыки в Кодекс?

https://now-thats-what-i-call-slop.openai.chatgpt.site/album/vol-1


Frontend лидерборд с designarena.ai

Чтобы закрыть гештальт с фронтом, я решил пойти на дизайн арену, у них там обычно GPT модели доминируют.

И результат меня сильно Удивил! Оказалось не OpenAI на первом месте. Ох не ОпенАЙ.

https://www.designarena.ai/leaderboard?section=agentic-web-dev


Codex vs Claude Code кто кого?

(на скриншоте 6 воркеров пишут решение одного ишью параллельно)

В продолжение поста решился провести такой генеративный экспиримент кодирования на моделях Terra и Luna и принять свое собственное мнение, насколько хороши эти модели.

На выполнение одно и того ишью запускал Кодекс и Клод Код. Каждый воркер создавал свой ПР. Дальше эти ПРы сравнивались LLM judge и выбирался победитель.

Сначала я запускал luna и terra, а и против них ставил Opus 5, но потом я подумал, что в чате многие жалуются, что Opus 5 им не нравится, как программирует, я начал запускать еще и параллельно Sonnet 5.

Чувствую сейчас в меня полетят помидоры и тухлые яица, но за первые 5 прогонов Luna выиграл 1 раз, на каком-то маленьком ПРе на 54 строки.

Но, я хотел тотального доминирования и сделал 5 прогонов еще раз, в этот раз я запускал по три воркера (все на medium effort):
• GPT-5.6 Sol
• Opus 5
• Sonnet 5

Ну и так же было интересно сравнить Opus 5 и Sonnet 5.

Итого 1:9 (из 10 прогонов) в пользу Clade Code. При запуске нескольких воркеров на решение одной и той же задачи почти всегда побеждал Claude Code на Opus 5. Sonnet 5 победил тоже всего 1 раз.

Но, какие в этом методе есть допущения и почему этот метод нельзя считать научным:

1. Я тестировал на своих задачах (Пайтон + Бэкенд), возможно на других задачах (на фронте) результаты были бы другие.
2. Как оценивает этот LLM judge — чистой воды загадка. По хорошему надо 2 LLM запускать оценивать победителя, одну на Claude Code другую на Codex.
3. Иногда я запускал в режиме планирования и в ручную переключал в auto, иногда сразу запускал в авто. Если каждый раз запускать с режима планирования, а потом переключать в авто, результат может быть другой. /opusplan я тоже не тестировал.
4. Если вы предпочитаете программировать на xhigh то опять же результат может быть другой.
5. Цена прогона никак не влияла на выбор победителя.
5. Не понятно, не является ли более качественное решение просто оверинжиниригом, если на боевом прогоне программа выполняет все поставленные ей задачи, то нужно ли еще улучшать и рассматривать все теоретические краевые случаи? Обычно у ЛЛМ как раз такие решения и побеждают.

В заключении скажу, что токенов на такие экспирименты уходит несоизмеримо больше, чем на обычное линейное программирование. Ну и автоматизируется это как-то все не очень.


Тут Рейтерс пишет по снижении цены на GPT-5.6 Sol более чем на 20%

Но подтверждения на сайте OpenAI найти не удалось.

Может это обещанный сюрприз от Tibo?

UPD: в комментах пишут, что вчера в Х был пост, и что это касается только АПИ, подписки мимо.

https://www.reuters.com/technology/openai-cuts-developer-pricing-frontier-gpt-56-sol-model-by-more-than-20-2026-08-21/


Тибо таки сделал заявление

Мы не хотим признавать прямо, что нестабильность попадания в наш долбаный кэш (кто бы сомневался) сжигает лимиты пользователей быстрее.

Типа как будто OpenAI в этом плане чем-то отличается от Антропик.

Тем не менее, уже хотя бы признание проблем — большая заслуга.

https://x.com/thsottiaux/status/2091033630147854385


Новый модный harness Oh My Pi (omp)

Какие преимущества:
• Pi под капотом, такой же как в OpenClaw, уже писал про него тут.
• Поддержка Винды без WSL
• В OMP ox-alpha работает, а в OpenCode виснет

Но, на мой взгляд, бросать все и устанавливать — пока может быть и рано. Предлагаю подождать пока 100к звезд не наберет.

Установка:


curl -fsSL https://omp.sh/install | sh



brew install can1357/tap/omp



irm https://omp.sh/install.ps1 | iex


Создатель этого харнесс Can Bölük https://github.com/can1357

Security researcher and reverse engineer. Interested in Windows kernel development, low-level programming, static program analysis and cryptography.


https://github.com/can1357/oh-my-pi Уже набрал 26к звезд на GitHub


Видео недоступно для предпросмотра
Смотреть в Telegram
Ребята, посмотрите какую игру в Змейка создала stealth модель ox-alpha в Oh My Pi (omp)!

Промпт:

Создайте Nokia 3310 с пиксельным экраном, игрой Змейка, составлением SMS и визуализатором классического рингтона.

Т.е. с этими ошибками TimeoutError: The operation timed out дело скорее всего не в OpenRouter (хотя раньше с бесплатными моделями там уже бывали такие косяки).

Итого:
• Корпус все равно, все кнопки издают звуки на первый взгляд все круто!
• Цена бесплатно.

Не работает:
• Кнопки на клавиатуре телефона (но смс отправляется)
• Змейка полностью поломаная (то ради чего все затевалось)

Ждем, что за модель такая, я вангую это qwen-3.8-27b по скорости работы и по контекстному окну в 1М.


О чем же таком написал Tibo в Х?

Что бы отпраздновать 20 млн. пользователей Кодекс — каждому пользователю БУДЕТ начислен 1 несгораемый сброс на этих выходных (мне еще не начислили).

Но куда интереснее текст дальше:

Теперь о сообщениях, что лимиты использования стали расходоваться быстрее. Пока мы не видим ничего аномального, но относимся к этому крайне серьёзно и продолжаем расследование. Если мы что-нибудь обнаружим, я сообщу.


Пример жалобы

А мой пост ниже на самом деле посвящён разъяснению одного конкретного паттерна, который мы заметили и на который я хотел обратить внимание.


Они расследовали жалобы на изменение лимитов Codex. У многих пожаловавшихся обнаружилось использование sub2api.

Суть позиции OpenAI:

OpenAI утверждает, что сами лимиты они не меняли.
Использование подписки через sub2api, когда подписочный трафик превращается в API и затем перепродаётся/раздаётся/делится между пользователями, не поддерживается и может срабатывать антифрод.
При этом использовать подписку через Sign in with ChatGPT разрешено не только в официальном Codex, но и в сторонних open-source клиентах — Tibo прямо называет Pi и OpenCode.
При этом Tibo отдельно уточнил в новом посте: расследование жалоб на ускоренный расход лимитов продолжается, и sub2api — лишь один обнаруженный паттерн, а не окончательное объяснение всех жалоб.

А еще Тибо обещал сюрприз сегодня! Ну что кроме ресета они нам могут предложить? @KrisArt31

https://x.com/thsottiaux/status/2090766694897619318

Показано 20 последних публикаций.