Это Гришанов


Гео и язык канала: не указан, не указан
Категория: не указана


Разработчик из МГТУ им. Н. Э. Баумана, 20 лет, @busyleap
Тружусь в RuTube
К интернету я имею гораздо более глубокое отношение, чем ты. Я его не пользую, я его развиваю

Связанные каналы  |  Похожие каналы

Гео и язык канала
не указан, не указан
Категория
не указана
Статистика
Фильтр публикаций


harness_176_configurations_results.png
442.9Кб
2609.20804v1.pdf
7.0Мб
§ Harness агента важен или нет?

🔵 Пишу по горячим следам исследования из топовых универов. Ребята дропнули статью под названием “An Empirical Study of Harness Design for Coding Agents”, во вложениях можно найти оригинал исследования.

Исследователи попытались ответить на вопрос, а насколько harness (tool calling, planning, context management) влияет на результат работы агента и у них получилось.

Краткий вывод: меньше всего harness влияет на frontier-моделях и сильнее всего на слабых. Ниже разберем основные выводы из документа.

➡️ Сначала исходные данные как тестили, что и с чем:

Модели: Nemotron-3 (30B, 120B, 550B), Mistral-Medium-3.5 (128B)

Бенчи: SWE-Bench Verified, Terminal-Bench 2.1

Planning: On/Off

Tools: On/Off

5 вариантов Context Managment:
T0 (ничего), T1 (Elision — старый большой output tool’a заменяется коротким stub’ом), T2 (Elision + Recall — замененный output сохранялся во внешнее хранилище, а агенту предоставлялась возможность вызвать весь output), T3 (Summarization — Elision нет. Старую историю периодически сжимает сама LLM в running summary.), T4 (Elision + Recall + Summarization).
Как итог: 176 конфигураций

➡️ Самые интересные выводы:

1️⃣ Context management критичен, пока контекст ограничен. При окне 32k на SWE-Bench managed-context в среднем давал около +35.7 п.п. success rate относительно отсутствия управления контекстом. При 128k преимущество сокращалось уже до +2.7 п.п.
Не нужно сразу summariz'ить всё через LLM. Лучший cost/accuracy trade-off показал подход: сначала дешево удалить старые тяжелые outputs от tool, а summarization запускать только если контекст всё ещё переполнен

2️⃣ Долгосрочная память сама по себе не волшебная таблетка. Авторы сделали recall_event, через который модель могла восстановить ранее удалённый кусок контекста. В 56% конфигураций агент не воспользовался им вообще, а заметного прироста accuracy относительно обычного удаления старого контента не получили

3️⃣ Planning нужен моделям по-разному. Слабой 30B модели планирование помогало реально решать больше задач: на SWE-Bench прирост составил +11.6 п.п. У более сильных моделей planning уже скорее выступал оптимизатором

4️⃣ Больше tools ≠ лучше agent. Слабым моделям структурированные read_file / edit_file / grep сильно помогают. Но сильная Nemotron-550B с одним bash на SWE-Bench одновременно подняла success rate и снизила стоимость примерно на 53%: она просто объединяла несколько операций в одну сложную shell-команду

Короче итоговый самый главный вывод: нельзя проектировать agent harness отдельно от модели.


§ Обучение

Привет! Как всегда, происходит очень много. Ожидаем релиз slaash на следующей неделе, о чём расскажу здесь, а пока

У меня освободилось 10–15 ч в неделю, которые хочется потратить на то, чтобы делиться знаниями. Готов помочь с изучением:

1. Разработка на Go (с нуля, Mock-собеседования, production-ready проекты для портфолио, computer science, system design, погружение в конкретную технологию, построение roadmap)

2. AI-Driven Development (про эффективное использование ИИ в разработке и не только)

3. Tech Base для далёких от разработки (расскажу технические основы, чтобы добиваться лучших результатов в вайб-кодинге)

4. StartUp база (CustDev, Product Discovery, разделение ролей, питчи, как устроен венчур в России, куда идти)
Потенциально можем рассмотреть любой ваш запрос, подскажу, могу помочь или нет.
Формат работы

Индивидуально 1:1.
Пишите мне на @busyleap, созваниваемся или обсуждаем ваш запрос, обговариваем формат и условия работы, и, если всё всех устраивает, то начинаем работу.

Чуть напомню о себе:
Меня зовут Клим, сейчас 22 года. Начал работать с первого курса университета, за это время поработал в Yandex.Delivery, VK Ads, RuTube Ads как Golang Developer.

Сам заканчивал МГТУ им. Н. Э. Баумана, сейчас в ИТМО x AI Talent Hub. Из дополнительного образования: VK Education, Школа стажёров WildBerries, МФТИ (бизнес-планирование).

Преподавал в БАШНЯ, VK Education, Terra School, Эйч.Навыки.

Сейчас работаю разработчиком в криминалистике и веду свой проект slaash.ru.
Подробно можно почитать здесь: https://www.linkedin.com/in/klimentii-grishanov-486353301/

Что за это время сделал

1. Оптимизировал нагрузку на БД с 1 млрд операций в сутки до 17 к, построил систему оффлайн-конверсии и обогащение рекомендательной системы рекламы (VK)
2. Запускал MVP рекламы в RuTube
3. В Яндекс.Доставке внедрял InApp-звонки для водителей, платные отмены в тарифах доставки. Участвовал в запуске Яндекс.Помощник.
4. Рефакторил систему продукта в production-ready, внедрял ИИ-агентов и построение контекста системы для эффективной работы агентов (NDA)

По всем вопросам @busyleap




§ Как перестать тратить сотни тысяч и кучу времени на сайты

Всем привет! Хочу рассказать о новом проекте, который мы запускаем в РФ — команда с опытом в VK, OZON, Yandex, RuTube и других компаниях.

Мы часто видим одну и ту же ситуацию: бизнес не понимает, почему веб-студии выкатывают огромные сметы за, казалось бы, простое приложение или лендинг. А разработчики, в свою очередь, знают, сколько времени на самом деле требует даже небольшой проект — и почему быстрее и дешевле не получится.

Чтобы разорвать этот замкнутый круг, мы создали SLAASH — платформу, где сайт любой сложности собирается через диалог с ИИ. Любые правки и доработки — без миллиона согласований и недель ожидания.

Сейчас мы готовимся к релизу и открываем бесплатный доступ первым 100 пользователям из вейтлиста. Вы будете на прямой связи с нами, а мы — адаптировать продукт под ваши задачи.

Присоединиться к вейтлисту: https://slaash.ru


§ Мысли после фильма о Plata

После 2022 года иммиграция для многих стала выглядеть как единственное морально верное решение.

Уехал — значит, с совестью.
Остался — значит, соучастник.
У этого есть понятная мотивация, желание отгородиться от происходящего.

Одно дело — уехать за карьерой, безопасностью, рынком, будущим для семьи.

И совсем другое — уехать, не найти себя в новых реалиях, а потом годами строить вокруг этого решения красивую легенду:
“Я не мог иначе.”
“Кто остался — тот просто смирился.”
Но уехать из России — не значит автоматически победить.

Можно сидеть в обшарпанном клоповнике Берлина, доедая крошки от кренделя, купленного на последние деньги с единственного заказа на фрилансе.
А можно остаться в России, строить бизнес, помогать семье и развивать себя.

И пострадавшим от осколков после взрыва дрона глубоко без разницы, откуда ты пишешь гневные посты про политическую и экономическую обстановку — из Тбилиси или Москвы.

Твоя моральная позиция не измеряется расстоянием от границы.

Оставшиеся не всегда трусы, а уехавшие не всегда герои.
И главный вопрос не в том, где ты сейчас находишься.

А в том, ты реально строишь свою жизнь — или просто доказываешь всем, что не зря сбежал.

P.S Это должен был быть ролик, но мы поняли что это не совсем наш сегмент, но грустно терять такой хороший текст


§ Anthropic вы че творите!?

Помните, как Anthropic продавала себя как этичную, заботящуюся о приватности альтернативу? После того как OpenAI подписала контракт с Пентагоном, именно к Claude побежали те, кто боялся слежки — регистрации в феврале выросли на 60%.

Запомните этот момент. Потому что спустя четыре месяца та же компания просит этих самых людей загрузить государственное удостоверение и фотографию собственного лица, чтобы продолжить пользоваться сервисом.

Что теперь от вас хотят
1. паспорт / права / национальный ID
2. селфи в камеру
3. И всё это - через стороннюю контору Persona, которой вы лично ничего не подписывали

Давайте честно о «безопасности данных». Anthropic обещает строгую защиту, но передача чувствительных документов любому стороннему сервису несёт неустранимые риски.

Политика прямо не объясняет, что именно запускает проверку. То есть в любой момент, по непрозрачным критериям, вас могут поставить перед выбором: лицо в обмен на доступ. Сегодня это «некоторые пользователи и некоторые функции». А завтра? Anthropic не взяла на себя никаких обязательств об ограничении охвата. Это и есть scope creep — сначала разработчики, потом все подряд.

Не дайте себя обмануть «новизной». Механизм проверки личности тихо включили ещё в апреле 2026-го, а июльское обновление политики просто узаконивает то, что уже работает.

И вишенка: конкуренты - ChatGPT и Gemini - лица у вас не просят

https://cyberpress.org/anthropic-updates-privacy-policy/


§ Кажется что Claude обучался на китайских моделях

Недавно появился странный эксперимент: Claude спрашивают на китайском “какая ты модель?”, а он внезапно отвечает, что он Qwen или DeepSeek.

В интернете сразу пошел разгон, что под капотом у Claude находится китайский Qwen или DeepSeek, но это гипотеза кажется мне далекой от правды.

Я бы скорее сказал следующее:

Claude мог обучаться для китайской аудитории на публичных диалогах Qwen’a / DeepSeek’a, а может они даже построили систему для того чтобы Claude вытягивал ответы из китайских моделей и учился на этом.

В этом нет ничего плохо и уж явно не говорит о том что под капотом Claude находится Qwen. Он вполне может отвечать о том что он китайская модель просто потому что в контексте китайского языка он прочитал слишком много диалогов с китайской моделью. Если LLM не сказать напрямую кто она, то она будет отвечать так как это было в большинстве обучающих выборок.

Еще раз LLM предсказывает следующий токен по распределению вероятностей, зависящему от контекста, системных инструкций, обучающих данных и decoding-параметров.

Важно: самоидентификация модели — это не доказательство того, какая модель реально стоит на backend


§ Агентный курс по Golang

В этом семестре решили чуть модифицировать курс по Go и сделали его сложнее. Теперь не приходится рассказывать про мапы и слайсы)

Основная идея - чтобы студенты в группах разработали AI Code Reviewer, то есть их основная задача создать ИИ агента, который будет реагировать на новые предложения по изменению коду и проводить ревью этих изменений. Вчера вел первый урок, связанный с архитектурой проекта, так как есть ребята которые не поняли типы подходов, так как информации было много. Решил поделиться здесь хорошими видео по сложным паттернам структуры проекта:

Domain-Driven Design

https://www.youtube.com/watch?v=6FY9urgIjqo
https://www.youtube.com/watch?v=EntrbDAD-DU

Hexagonal

https://www.youtube.com/watch?v=bDWApqAUjEI
https://www.youtube.com/watch?v=3YTLDYG5MnQ

А еще напоминаю, что у нас есть продукт, который позволяет быстро готовиться к любому техническому собеседованию по Go за считанные часы. Если даже у вас нет собеседования, но нужно быстро понять как устроен Golang, то приходите к нам на платформу:

https://whycode.io


§ Фокус

Фокус будет становиться одним из главных дифференциалов богатых от бедных.


Количество раздражителей в современном мире становится всё больше и больше, будущее поколение утратит возможность фокусироваться и перестроит свои продукты на новый лад, но наше поколение будет бороться за власть через фокусировку.

Люди с фокусом будут владельцами систем, остальные будут становиться обслуживающим персоналом. Так уже было, но сейчас масштаб этой разницы будет только увеличиваться.

Кажется, что нет ничего такого в том, чтобы постоянно переключаться между приложениями, залипать в рилсах, но на самом деле — это не просто потеря времени, вы теряете свои возможности, цели. Вы медленно, но проигрываете.

⭐ А пока рассказываю, как вернуть себе фокус

1️⃣ Читайте каждый день хотя бы по 5 минут, но каждый день. Со временем вы научитесь всё больше и больше фокусироваться.

2️⃣ Отключите все уведомления. Уже два года живу с выключенными уведомлениями везде, я смотрю мессенджеры тогда, когда у меня есть время, и не переключаю контекст работы, пока не закончу основную задачу.

3️⃣ Листок и ручка. Выписывайте свои задачи на день на листочек/ежедневник. Все существующие трекеры перегружаются функционалом, попробуйте писать просто на лист, если понадобится что-то дополнительное, то это всегда можно будет добавить.

В мире, где все отвлечены, сфокусированный человек становится монополистом.


Продуктивного вторника всем, а как вы держите фокус в течение дня?


§ WhyCode

Так, пришло время релиза первого продукта. WhyCodeIO - это возможность быстро подготовиться к собеседованию по Go в любую компанию, в том числе бигтехи. Я подготовил платформу в виде тренажера, где вы можете готовиться к собеседованию в формате вопросов и ответов.

Что мы предлагаем:
— 490+ вопросов, 40 тестов по Go разной степени сложности по самым основным топикам, которые спрашивают на собеседовании.
— Для каждого вопроса вверху будет написано в какой конкретной компании встречался похожий вопрос
— Если вы не знаете ответа, у вас есть возможность попросить подсказку
— После каждого вопроса, есть максимально понятное объяснение (насколько это возможно) и приложены дополнительные источники, где вы можете изучить вопрос глубже.

https://whycode.io

Подписка на ресурс стоит 990 рублей и дает доступ вам до всех тестов, подсказки, информация о том где задавался конкретный вопрос.

По любым вопросам/предложениям можете писать мне в ЛС:
https://t.me/busyleap


§ Безопасность в угоду развитию

Ох, давайте поговорим о недавнем феномене с OpenClaw.

OpenClaw — автономный агент, который управляет компьютером. Он сам принимает решения, выполняет действия, выбирает инструменты для задач.

Почему вокруг него так много разговоров?

Потому что это прототип будущего агента: у него высокая степень доверия со стороны человека, и из-за хайпа вокруг него всё больше людей начинают устанавливать его к себе на компьютеры.

И это, конечно, всё супер — технологии идут вперёд. Но суть в том, что мы попали в момент, с которым уже встречались в истории. Хайп среди большего количества людей, тем более тех, кто далёк от инженерного/технического взгляда, приводит к ситуации, когда люди не понимают, чем им может навредить агент.

История с изоляцией окружения для слабо просвещённого в технологиях человека ничего ему не даёт. Он не понимает, что можно помещать в окружение, а что — нет.

AI сегодня — это интернет до защищенного соединения.

Тогда все гнались за развитием и думали, что с безопасностью разберутся потом. Что произошло потом? Кевин Митник, спам, ботнеты, массовые утечки. Десятилетия исправления ошибок, допущенных в начале.

Сейчас мы делаем то же самое — даём неподготовленным людям доступ к технологии, чтобы развивать её.

Что нас ждёт?
Мы снова будем пожинать плоды таких решений в следующие десятилетия. И проблема в том, что стартапы, которые решают эти проблемы сейчас, не будут получать финансирование, пока рынок не взвоет и не начнёт молить о помощи в сфере безопасности AI.

А что вы ожидаете от рынка AI?

Ваши учёные были так озабочены тем, могут ли они это сделать, что даже не подумали, стоит ли вообще это делать.
— «Парк юрского периода»


§ Терпение

Самый важный навык, которому меня учили с детства, — не быть сильным и не быть умным. Меня учили терпеть.

Терпение — это не бездействие и не смирение. Это способность продолжать делать шаги, даже когда результата не видно.

Зачем нужно терпеть?

Потому что жизнь нелинейна: сегодня у вас всё хорошо, завтра случается то, чего никто не мог предположить. Если вы не обладаете терпением в такие моменты, то вы скатываетесь в безвыходную яму, где вы сами себя копаете.

Мы все хотим жить определённую жизнь, но жизнь устроена так, что получить желаемое можно только через определённое время, выполняя определённые шаги. Если вы не умеете терпеть, то и в жизни будет тяжело: вы будете бросать то или иное дело, потому что сразу не получилось, хотя, возможно, нужно было просто выждать.

Если долго сидеть на берегу реки, то можно увидеть, как по ней проплывёт труп твоего врага


Всегда ли нужно терпеть?

Во взрослой жизни у вас есть две вещи: обстоятельства и обязательства. Инфант — тот, кто убегает от них. Взрослый — тот, кто терпит, ищет выход и продолжает идти, не сбрасывая ответственность.

Все мужчинские мужчины, которые собираются задвигать мне за терпилу, — обычно вы представляете гораздо меньше, чем говорите. Газ нажать можно всегда, не все умеют им правильно работать.


§ Startup Diary // 1

Всем привет! Хочется чуть-чуть подоткрыть завесу тайны и рассказать о том, чем я сейчас занимаюсь. Мы с моим бывшим коллегой и одногруппником Семеном, строим сейчас стартап.

Основная идея: полностью автоматизированный AI-Developer, который забирает задачу из Jira (any Task Tracker), проводит изменения в изолированном контейнере и самостоятельно отправляет код на проверку.

У пользователя есть возможность влиять на разработку задачи, если есть новые продуктовые правки, то пользователь оставляет комментарий в Jira, а наш агент сам их подхватит. Если правки технические, то их можно оставить в Merge Request и агент, тоже их примет во внимание.

Мы уже побывали в нашем первом акселераторе — Лимб, а сейчас мы собираем PoC (Proof-Of-Concept) хотим побенчить наше решение через SWE и если окажется, что мы хороши, то придет время к сбору первого трекшена.

Этот проект собирается изначально под венчурную истории, потому что капитала под такие амбиции нет, но есть знания и возможности, однако мы не торопимся брать деньги. Нам неинтересно брать деньги под идею и отстегнуть большую часть компании, так что стараемся максимально оттянуть этот момент.

В скором нас будет ожидать отбор в стартап-школу Сколково и Московский инновационный кластер


Дайте сил пользоваться современным UX в приложениях.

Почему каждый раз, когда я открываю приложение Я.Маркета, хочется с разбега в стену дать? Покажите мне хотя бы одного пользователя, который реально пользуется AI Маркета. В какой жизненной ситуации человек предпочитает объяснять тупому боту, что ему нужно, вместо того чтобы просто набрать ключевые слова в поиске?

Почему каждое открытие приложения сопровождается миллионами поп-апов и рекламных блоков? Я в 2012 году?

В какой момент Ozon решил, что кнопка категорий должна находиться в середине всего контентного блока, посреди обычных товаров, а не в нижнем баре? Что за тотальная глупость — как до этого вообще можно было додуматься?

А знаете, почему это происходит? Потому что в корпорациях внедрена метрика-дрочка. Это когда всем плевать на логику, главное — чтобы росли метрики, ведь мы data-driven company. Человек заходит в приложение, чтобы посмотреть конкретную категорию, а её спрятали. В итоге он тратит на 20–30 секунд больше времени в приложении — круто, метрики вверх. Только вы создали проблему пользователю на пути к покупке, а не решили её. Спасибо data-driven anti-logic остолопам.

А что вас бесит в современных приложениях?

307 0 0 14 27

§ Уроки от Revolut: как распознать top-talent среди кандидатов

Так, теперь, как нам убедиться, что человек, который пришёл к нам на интервью, — top-talent? Revolut считает, что для этого нужно два этапа интервью.

🔵 Problem-Solving Interview

Нужно предоставить кандидату реальную бизнес-проблему с вложенной сложностью. Нам нужно посмотреть, как он думает, как подходит к проблеме.

➡️ Что мы ожидаем от кандидата:

1. Разделяет проблему на компоненты.
2. Проактивная позиция на тему данных. Он не должен бросаться сразу в решение проблемы, его задача — задавать вопросы, чтобы определить проблематику и разобраться в бизнесе.
3. Изучает слои проблем в бизнесе. Кандидат пытается разобраться в каждом слое и углубляется в проблему.
4. Учитывает практичность и подмечает трейд-оффы в тех или иных решениях.

➡️ Чего кандидат делать не должен:

Прыгать сразу в предложение решений без погружения в данные.
Фокусировка на поверхностных данных. Нет попыток узнать о проблеме больше.

🔵 Bar Raising
Это отдельный тип интервью, где наша задача — понять, сможет ли кандидат стать мультипликатором для нашей команды. Спрашиваем о его прошлом опыте, принципах решения проблем, как он себя ведёт в команде.

➡️ Что мы ожидаем от кандидата:

1. Мышление роста. Нужно увидеть, что он брал сложные задачи, даже из другой зоны ответственности. Думал из позиции: «мне больше всех надо, поэтому я …».
2. Лидерство без титула. Он руководил даже тогда, когда не обладал нужной позицией. Помогал и решал проблемы, направлял коллег.
3. Саморефлексия. Он честно говорит о своих проблемах, недостатках.

➡️ Чего кандидат делать не должен:

1. Говорит, что не сделал задачу, потому что …. При этом попыток решить задачу в обход проблемы не было.
2. Рассказывает, что у него не было опыта управления, лидерства, потому что не было возможности, его недооценили. Возможность проявить лидерские качества есть всегда.
3. Говорит, что он самый лучший кандидат. Минусов нет, идеальнее нет. Если человек искренне верит, что он уже на пике, то и возможности вырасти у него нет.

🔵 На какие вопросы мы должны ответить сами себе после рассказа кандидата?

1️⃣ Куда человек движется? Он готовится стать экспертом или работает просто ради денег? Пытается ли он стать лучше?

2️⃣ Сможет ли он построить вокруг себя команду A-игроков? Поверят ли ему эксперты и согласятся ли с ним работать?

А по Revolut собственно все.

Расскажите, как вы считаете в чем Revolut прав/не прав?


§ Уроки от Revolut: кто такие top-talent?

Великие компании не нанимают уже сильных топ-менеджеров. Они нанимают людей, которые собираются ими стать. Ядро культуры компании заключается в людях с мышлением “проблема-решение”. Revolut интересует тяга, решительность и способность разбираться в хаосе.

⭐Характеристики будущего топ-менеджера:

1️⃣ Сильный характер. Человек готов взяться за решение задачи, которую он никогда не видел и не делал раньше.

2️⃣ Огромное стремление. Он не просто работает, он пытается сделать свою зону ответственности лучше.

3️⃣ Способность вырастить команду A-игроков. Он обладает навыком объяснять сложные вещи простым языком и доносить их до сотрудников.

🔵 Кто нам точно не подходит:

➡️ Типичный корпоративный профиль. Тусуется на одном месте >5-10 лет, согласен медленно расти.
➡️ Уже A-Игрок. Опыта более 20+ лет, большой запрос по зарплате.

🔵 Кто нам нужен:

➡️ Меньше 10 лет опыта.
➡️ 2-3 года был в индустрии как индивидуальный игрок
➡️ Имеет опыт в управлении.

Важный момент о котором говорит Revolut:
Опыт очень редко коррелируется с пользой для компании


🔵 Как подготовиться

1. Все роли в организации должны быть определены систематическим способом, 3-4 основных скила для каждой позиции.
2. Определить старших руководителей, ответственных за роли в команде и за разработку процесса найма
3. Стандартизировать требования к ролям
4. Определять скилы через scorecards (идеальное поведение сотрудника на этой позиции)
5. Определить какой именно уровень каждого скилла должен быть для каждой позиции

Показано 16 последних публикаций.