я ненавижу csv


Гео и язык канала: не указан, не указан
Категория: не указана


Prompt Engineering is cute i guess. But for pussies.

Связанные каналы

Гео и язык канала
не указан, не указан
Категория
не указана
Статистика
Фильтр публикаций


некоторые забавные вещи уголовно наказуемы


я за 20 минут собеса раскидал архитектуру RLAIF среды-симулятора для агента болталки с оптимизаций политик (ну, в данном случае промпта) на ходу
если в этот раз не оффер то идите нахуй просто


чел который меня собесил год назад на гигаконфе рассказывал что в душе не ебет как оценивать агентов с недетерминированными траекториями


Репост из: Адель и МЛь
OpenAI на две недели полностью остановила RL для последних моделей, готовящихся к релизу. Самый крупный запланированный RL-run пока так и не возобновили. Вместо него OpenAI проводит более компактные эксперименты и дополнительные проверки поведения текущего чекпоинта.

Речь, понятно, про Astra. Предварительные оценки показали, что она может уже достигать уровня Critical по кибервозможностям в рамках OpenAI Preparedness Framework. Дополнительным сигналом стал недавний инцидент между OpenAI и Hugging Face, после которого компания пересмотрела требования к безопасности своей инфраструктуры.

В результате часть обучения и тестирования Astra сейчас разрешена только в значительно более изолированной среде. OpenAI усиливает sandboxing для запуска сгенерированного моделью кода, ограничивает сетевой доступ высокорисковых нагрузок, убирает потенциально уязвимые общие сервисы и вводит более жесткие security рамки. Некоторые задачи уже удалось перенести на новую инфраструктуру, однако значительная часть экспериментов с Astra по-прежнему заморожена. В первую очередь компания восстанавливает работы, связанные с safety и alignment.

Одновременно OpenAI существенно расширила мониторинг размышления моделей. Теперь для наиболее мощных систем анализируются не только tool calls, но и доступные reasoning traces и вся последовательность действий. Система ищет признаки попыток получить несанкционированный доступ, украсть данные, разрушить ресурсы или обойти защитные механизмы. Для критических случаев действует схема быстрого реагирования: если тревогу нельзя уверенно признать ложной в течение примерно 30 минут, соответствующий процесс должен быть остановлен.

Причем такой контроль оказался довольно дорогим - по оценке OpenAI, дополнительный мониторинг сейчас требует примерно 20% вычислительных ресурсов поверх самого инференса. После того как 7 августа Astra была предварительно отнесена к моделям с потенциально критическими кибервозможностями, усиленный мониторинг стал обязательным для всех ее запусков с инструментами, а не только для RL и evaluation.

Компания также меняет сам процесс alignment-training. Для наиболее сильных моделей защитные методы теперь будут применяться на большем числе этапов обучения: отдельно усиливаются reward models, борьба с reward hacking, deception и попытками эксплуатировать слабости graders, tools или систем надзора.

Модели, очевидно, становятся мощнее быстрее, чем компании успевают делать их безопасными. И уже это, а не компьют, может стать боттленеком.

https://openai.com/index/pacing-model-development-cyber-capabilities/


Номер сабмита на конфу - 16
За час до конца дедлайна подачи абстрактов :)




трум трум лайфхаки как сбросить историю откликов в яндекс


все будет малая, все будет


Ну зато релокейт в армению






Хуй его знает




Репост из: Danil
Rating: 2: Reject: For instance, a paper with technical flaws, weak evaluation, inadequate reproducibility and incompletely addressed ethical considerations.

Questions:

How often do the high-tension profiles studied by TabTension occur in real document workloads? Please provide an empirical analysis of row count, column count, row-span intensity, and column-span intensity distributions in real TSR datasets or production-like document corpora.

Can you report workload-weighted TabTension metrics using empirical profile distributions from real datasets, in addition to the current balanced profile-space metrics? This would help clarify whether the observed brittleness affects common real-world tables or is concentrated mainly in rare stress-test regions.

How well do TabTension scores correlate with downstream table-use performance, such as table QA, information extraction, header-cell association, or document-level reasoning? In LLM/VLM pipelines, exact HTML reconstruction may not always be necessary if the downstream semantic answer is still correct.

Do the conclusions remain stable across more realistic rendering styles, such as different border styles, fonts, spacing, background shading, scan noise, partial/no grid lines, and surrounding document context?

Could you include examples of real tables whose profiles correspond to the high-failure regions identified by TabTension? This would make it easier to assess whether the benchmark is diagnosing practically important failure modes.


это про это


Пришли рецензии с NeurIPS'26

The core reframing is the real contribution, and it's a good one
The metric design is thoughtful
The size-conditional Relative Robustness metric was my favorite part. Smart move and not an obvious one

НО ОДИН ИЗ ТРЕХ ВХУЯРИЛ ОЦЕНКУ 2 ИЗ 6 БЛЯТЬ ПОТОМУ ЧТО У НЕГО ХУЙ НЕ ВСТАЛ (остальные по 4кам)


столько шизов это просто пизд..

в гугле site:chat.deepseek.com/share/


там чаты дипсик утекли в сеть ахахах


собесы в итоге так выглядят


пора перестать пиздеть в резюме ладно
по нескольким собесам понятно что до техлида (а райфайзен чуть ли не cto предлагал) вообще не дотягиваю

Показано 20 последних публикаций.