⚪️ Текущие впечатления от поколения 5.6 и флоу
Много обсуждали в чате, и, пользуясь служебным положением, резюмирую впечатления от поколения gpt моделей 5.6
Использую, как и все, наверное, Sol и Luna. Terra остаётся не у дел: не ясно зачем она нужна - расход немаленький, а качество пониже Sol.
▶️ Планирую Sol. Попытки планирования Луной не сказать чтобы провальные, но она заметно больше упускает, не так глубоко прорабатывает, и делает все сильно дольше.
Что у Sol хорошо: он действительно может глубоко проработать. High / Xhigh ризонинга мне хватало. Max / Ultra практически не включал, смысла не вижу.
Что у Sol плохо: мощная тяга все усложнять. Без промптинга на жёсткое упрощение навыком Ponytail/аналогами все время получаем космолёт. И в предыдущих поколениях такое было - но сейчас это правило усложнить на ровном месте . Снижение ризонинга помогает слабо и заметно слабее проработка деталей - поэтому приходится спасаться промпингом.
Что ещё плохо: лимиты Sol просто кушает. Кодинг на Sol по качетсву ок, времени мало занимает, пишет сразу все хорошо, но даже на Medium/Low лимиты тают
▶️ Что у Луны хорошо: лимиты практически не кончаются. Я уже и количество подписко в пуле снизил (пока на четверть), потому что у меня остались лимиты при текущей загрузке! Думаю, с таким расходом можно повышать использование, больше проектов одновременно и больше сессий. Надо добивать облачный оркестратор.
Что у Луны ещё хорошо: она, в принципе, недурственно справляется со всеми конкретно поставленными задачами.
Что у Луны плохо: она не так внимательна, как Sol. Может что-то упускать. Спасает ревью.
Что ещё у Луны плохо: скорость. Модель не особо летает, и думает она медленно, токенов на max тратит немало.
Что ещё у Луны плохо: если встретилась проблема в протоколе (что то не учли заранее или прописали так, что остаётся люфт) - может под goal очень и очень долго ходить кругами и предлагать ерунду вместо решения проблемы. За долгими сессиями надо следить - благо сейчас /side во время сессии позволяет получить справку чего там происходит, что сделано, что не сделано, какие проблемы.
▶️ Насчёт флоу: не могу нащупать баланс - рельсовые флоу получаются очень долго все прорабатывают, могут крутится часами. Качество, конечно, хорошее - но оптимизации затруднены. Попытки делать роутинг простых задач в более простой флоу автоматически приводят к тому, что модели часто видят ситуацию сложнее, чем оно того стоит, в итоге выбирая более тяжёлые флоу чем я бы выбрал "руками" и чем оно того стоит. Не уверен в том, как это чинить - вроде бы упрощать флоу не хочется, для сложных вопросов оно такое надо, но проблему траты кучи времёни надо решать. Пока склоняюсь к созданию облачного оркестратора и работе просто с большим количеством параллельных сессий.
Интерактивные сессии с простыми вручную вызываемыми скиллами - тоже вариант, но чтобы получилось качественно, надо много руками дёргать скиллов/субагентов. Без проработки скиллами/субагентами на проектах крупнее 30-50к loc уже получается слоп.
▶️ В целом, я скорее за рельсовые флоу по мотивам SDD / TDD/ BDD, но надо придумывать как бороть их недостаток: очень "тяжелые". Уже разные оптимизации придумываю, всякий роутинг автоматический, всякий вариант не фокусными агентами делать, а группировать в субагентов аспекты пачками. Есть ещё одна задумка: дорабатывать фичи более лёгким флоу, с последующей глубокой проработкой рефакторингом в фоновом режиме (ночью, в облаке, например) - но это все упирается в слабую способность моделей пилить качественную и простую архитектуру. Надежда на астру в этом плане - нужна не оверинжиниринг в моделях, а сеньёрность, умение сделать максимально просто но с полным функционалом. Ponytail это пробует зафорсить, становится лучше, но здравого смысла к сожалению, добавить не всегда может. Возможно, секрет в нескольких агентах и их коллаборации по таким вопросам. Вопрос требует исследований и экспериментов - делитесь если кто то туда же думает.
👉 Примерно так. Можно спрашивать если что то развернуть или невнятно описал.
@deksden_notes
Много обсуждали в чате, и, пользуясь служебным положением, резюмирую впечатления от поколения gpt моделей 5.6
Использую, как и все, наверное, Sol и Luna. Terra остаётся не у дел: не ясно зачем она нужна - расход немаленький, а качество пониже Sol.
▶️ Планирую Sol. Попытки планирования Луной не сказать чтобы провальные, но она заметно больше упускает, не так глубоко прорабатывает, и делает все сильно дольше.
Что у Sol хорошо: он действительно может глубоко проработать. High / Xhigh ризонинга мне хватало. Max / Ultra практически не включал, смысла не вижу.
Что у Sol плохо: мощная тяга все усложнять. Без промптинга на жёсткое упрощение навыком Ponytail/аналогами все время получаем космолёт. И в предыдущих поколениях такое было - но сейчас это правило усложнить на ровном месте . Снижение ризонинга помогает слабо и заметно слабее проработка деталей - поэтому приходится спасаться промпингом.
Что ещё плохо: лимиты Sol просто кушает. Кодинг на Sol по качетсву ок, времени мало занимает, пишет сразу все хорошо, но даже на Medium/Low лимиты тают
▶️ Что у Луны хорошо: лимиты практически не кончаются. Я уже и количество подписко в пуле снизил (пока на четверть), потому что у меня остались лимиты при текущей загрузке! Думаю, с таким расходом можно повышать использование, больше проектов одновременно и больше сессий. Надо добивать облачный оркестратор.
Что у Луны ещё хорошо: она, в принципе, недурственно справляется со всеми конкретно поставленными задачами.
Что у Луны плохо: она не так внимательна, как Sol. Может что-то упускать. Спасает ревью.
Что ещё у Луны плохо: скорость. Модель не особо летает, и думает она медленно, токенов на max тратит немало.
Что ещё у Луны плохо: если встретилась проблема в протоколе (что то не учли заранее или прописали так, что остаётся люфт) - может под goal очень и очень долго ходить кругами и предлагать ерунду вместо решения проблемы. За долгими сессиями надо следить - благо сейчас /side во время сессии позволяет получить справку чего там происходит, что сделано, что не сделано, какие проблемы.
▶️ Насчёт флоу: не могу нащупать баланс - рельсовые флоу получаются очень долго все прорабатывают, могут крутится часами. Качество, конечно, хорошее - но оптимизации затруднены. Попытки делать роутинг простых задач в более простой флоу автоматически приводят к тому, что модели часто видят ситуацию сложнее, чем оно того стоит, в итоге выбирая более тяжёлые флоу чем я бы выбрал "руками" и чем оно того стоит. Не уверен в том, как это чинить - вроде бы упрощать флоу не хочется, для сложных вопросов оно такое надо, но проблему траты кучи времёни надо решать. Пока склоняюсь к созданию облачного оркестратора и работе просто с большим количеством параллельных сессий.
Интерактивные сессии с простыми вручную вызываемыми скиллами - тоже вариант, но чтобы получилось качественно, надо много руками дёргать скиллов/субагентов. Без проработки скиллами/субагентами на проектах крупнее 30-50к loc уже получается слоп.
▶️ В целом, я скорее за рельсовые флоу по мотивам SDD / TDD/ BDD, но надо придумывать как бороть их недостаток: очень "тяжелые". Уже разные оптимизации придумываю, всякий роутинг автоматический, всякий вариант не фокусными агентами делать, а группировать в субагентов аспекты пачками. Есть ещё одна задумка: дорабатывать фичи более лёгким флоу, с последующей глубокой проработкой рефакторингом в фоновом режиме (ночью, в облаке, например) - но это все упирается в слабую способность моделей пилить качественную и простую архитектуру. Надежда на астру в этом плане - нужна не оверинжиниринг в моделях, а сеньёрность, умение сделать максимально просто но с полным функционалом. Ponytail это пробует зафорсить, становится лучше, но здравого смысла к сожалению, добавить не всегда может. Возможно, секрет в нескольких агентах и их коллаборации по таким вопросам. Вопрос требует исследований и экспериментов - делитесь если кто то туда же думает.
👉 Примерно так. Можно спрашивать если что то развернуть или невнятно описал.
@deksden_notes