Фильтр публикаций


Репост из: DL in NLP
Self-rewarding Language Models
Yuan et al., Meta AI
arxiv.org/abs/2401.10020

Кликбейтная версия заголовка: LLAMA2 обошла GPT4 🔥🔥

Зачем делать отдельную модель реворда если можно обучать реворду вашу языковую модель? Так по-видимому подумали в FAIR и придумали новый метод: Iterative DPO

1. Файнтюните вашу модель на начальном (чат-)датасете
2. Опционально тюните эту модель на данных которые оценивают качество генерации числом от 1 до 5 с помощью chain of thought
3. Используете few-shot prompting чтобы сгенерировать новые промпты
4. Генерируете N ответов на каждый промпт и оцениваете их этой же моделью
5. Goto 1

Интересным получается то что от числа итераций растет не только качество генерации ответов но и и качество оценки ответов.

После трех таких итераций LLAMA2-70B на бенчмарке AlpacaEval обходит ChatGPT3.5, Claude и даже GPT4 (версия 13 июня 2023). конечно верить только одному бенчмарку не стоит, но к сожалению других в статье нет, даже MMLU.

В любом случае очень классный и простой подход, к сожалению подходящий только GPU-богатым, но зато не требующий огромного количества пользовательских данных


Репост из: Нейронавт | Нейросети в творчестве
LucidDreamer: Towards High-Fidelity Text-to-3D Generation via Interval Score Matching

Генертор 3D модели по тексту. Под капотом сопоставление интервальных оценок (ISM) и гауссианы.

Код
Демо

#textto3D


Репост из: Нейронавт | Нейросети в творчестве
Видео недоступно для предпросмотра
Смотреть в Telegram
FlowZero:Zero-Shot Text-to-Video Synthesis withLLM-Driven Dynamic Scene Syntax

Очередной генератор видео по тексту. Но на согласованность во времени здесь работает большая языковая модель (#LLM), подробно синтаксически описывая объекты, движение, сцену, фон и т д.

Код обещают выложить

#text2video


Репост из: GPTTG | Новости | ChatGPT
Всё в народ

Абсолютно сумасшедший гений потратил дни своей жизни, чтобы собрать 7000 промтов для ChatGPT в одном месте.

Промты полезные, очень спасает сортировка по спискам. Отдельное советуем заглянуть в раздел Jailbreak — не все из них работают с GPT-4, но генерируют тонны рофлов.

GPT | Новости | 'https://t.me/addlist/4HdkUOAx0RJjM2Ni' rel='nofollow'>Для Вас


Репост из: Сиолошная
Кажется, лучшего момента посмотреть свежайший Ted Talk от Ilya Sutskever по теме AGI не будет — а его релизнули только что:

тык

(записано 17го октября...так недавно, но так далеко...)

Каких-то инсайдов не будет, просто поможет посмотреть на мир глазами Ilya, чтобы понимать масштаб изменений, связанных с AI, которые он ожидает.

(и ещё вдогонку сразу можно посмотреть 11-минутную документалку про Ilya от The Guardian. Она была снята во время разработки ChatGPT)


Репост из: Сиолошная
Видео недоступно для предпросмотра
Смотреть в Telegram
Главные результаты:
✅ отрыв от стола произошёл быстрее, чем в прошлый раз. Мы не видели фото с места событий, но предполагаемо урона площадке нанесено куда меньше, чем весной.
✅ все 33 двигателя работали от первой до последней секунды, ни один не был потерян. Это само по себе великое достижение, так как многие критиковали программу за подражание советской и никогда не дошедшей до орбиты H1
✅ разделение корабля и ускорителя прошло номинально, после нескольких минут полёта Starship имел расчётную орбиту, то есть от проблем с подрывом бустера он никак не пострадал

Вероятно, следующая цель уже будет раздельной:
— для бустера долететь до воды
— для корабля сойти с орбиты (но может сгореть в процессе)

Прикерплённое видео — момент разделения ступеней.


Репост из: Psy Eyes
Видео недоступно для предпросмотра
Смотреть в Telegram
Story-2-Motion — генерим видео любой длины с контролем движения персонажа. Языковая модель анализирует промт и вытаскивает из него пару текст-поза для планирования движений в кадре.

Другим любопытным проектом на тему длинных видео является NUWA, где из промт-раскадровки тебе генерится результат. Но там нет контроля движения персонажа в пространстве.

У обоих проектов пока нет кода


Репост из: Psy Eyes
Дайджест:

📹 ВИДЕО + АРТ 🎨

Alibaba: выкатили I2VGen-XL для генерации видео в 1280x720.

YOLO-NAS: детектируем людей в кадре и их движение в кадре.

S-LoRA: новый метод позволяющий работать с тысячами лор на одном или ряде GPU.

EmerNeRF: прогнозирование движения на дороге с помощью нерф.

Tinygrad: проект геохота (George Hotz) сделал генератор в SD на WebGPU.

🎸 ЗВУК 🎸

Запрещёнка выкатила демо Musicgen, генерящее стерео звук. Все модели линейки обновлены. Примеры тут.

OpenAI: выпустили Whisper V3 для получения транскрипта аудио и его перевода. Можно вкидывать наговорить в диктовон, скнуть видео, или ссыль на YouTube. И ещё TTS от них.

🤖 ЧАТЫ 🤖

x.ai: Илон анонсировал свою LLM Grok-33B, которая постепенно будет раскатывать среди владельцев премиумов в твиттер. Можно будет генерить текст, код, и чатиться по контенту.

01.ai: тоже новый игрок на рынке LLM с моделью Yi. Показывает себя лучше Falcon и ламы 2, имеет контекст 200k (больше, чем GPT-4 Turbo), и опенсорс, плюс есть дружелюбная лицензия.

В LLaVA добавили интерактив, и теперь можно сегментировать объекты в кадре для удаления/замены, есть инпейтинг, и генерация на основе.

На арену чат-ботов добавили GPT-4 Turbo. Лавочку скоро прикроют, можно на халяву потестить.

DeepSeek Coder: модель для написания кода, контекст 16К, размеры до 33B, демо.

mPLUG-Owl2: обновлённая версия модели сочетающей в себе визуальную языковую модель (VLM) и большую языковую модель (LLM). Можно чатиться по картинкам, и даже даёт ссылки в ответах.

Microsoft: представили SoM (Set-of-Mark), это VLM соединённый с GPT-4V API для сегментации картинок и чата по ним.

CogVLM: ещё одна VLM, хорошо показывающая себя на бенчмарках.

CodeFuse: мульти-тасковый файнтюнинг кодовых LLM.

WebcamGPT: чат по кадрам с вебкамеры.

Исследование:
* Распределённое обучение трансформеров на ультра-длинных текстах. Получилось в 5 раз быстрее и в 10 раз дешевле вывести вывести текст, чем на 144 Nvidia V100.

💬 Делайте выжимки из доков и чатьтесь по ним с помощью Claude




Репост из: Psy Eyes
Дайджест:

📹 ВИДЕО + АРТ 🎨

Runway: улучшили генерацию на основе картинок, добавили раздел с историей генераций, внесли правки в контроль камеры и движения, а также добавили возможность расширить уже сгенерённую ранее картинку.

Колаб для latent consistency model (LCM), чтобы быстро генерить картинки и видео. Плюс генерация в реальном времени через SD, также через LCM.

На Snapdragon Summit тоже показали генерацию в реальном времени, только на телефоне без интернета и на 1 картинку уходит меньше секунды.

Orillusion: обновился до v 0.7 опенсорсный бесплатный игровой движок на основе WebGPU.

FreeNoise: метод для генерации длинных видео на основе VideoCrafter.

Cuebric: генерируем реалистичный 2,5D фон для видео.

Moonvalley: добавили к генерации видео сид и негативные промты для контроля.

CSM: можно бесплатно натренировать свою text-2-image лору через их дискорд бота.

PixArt-α: генератор картинок по качеству метящий в сторону SD и Midjourney.

SEINE: генерим видео из картинки с хорошей четкостью и стабильностью. Пока без кода.

ZeroNVS: генерация 3D и 360 сцен по картинке у нас уже были, а вот нерфы по одной картинке это что-то новое.

Игра Super Godot Galaxy прямо на Hugging Face. Тут коллекция AI-игр.

Twelve Labs: у которых годный сервис по поиску нужного футажа через его описание, выпустили модель Pegasus-1 для генерации детального описания видео и выжимки по нему.

🎸 ЗВУК 🎸

YouTube Music: теперь можно генерить обложку своим плейлистам.

AudioSet: модель для динамической разметки аудиоданных.

🤖 ЧАТЫ 🤖

QMoE: архитектура взаимодействия LLM-экспертов, позволяющая запустить LLM с более 1 триллиона параметров на 8x3090. Для сравнения по слухам у GPT-4 тоже гидра из экспертов каждый по 175B параметров, с общим числом параметров 1,5 триллионов или больше.

К Mistral пришили SeamlessM4T и теперь с ним можно общаться голосом на 100 языках. Есть и колаб.

HuggingFace: выпустили Alignment Handbook для наставления LLM моделей генерить нужным образом, и выкатили модель Zephyr-7B, которая на некоторых тестах показывает себя лучше ламы 70B.

Min-K% Prob: тестируем была ли модель натренирована на данных, защищённых авторским правом.

XAgent: новый AI-агент, который умеет планировать и выполнять задания, и работает изолированно через Docker.

TogetherComputer: выпустили датасет RedPajama V2 на основе 100B текстов из 84 снимков сети от CommonCrawl.

Microsoft: библиотека FP8-LM для эффективной и распределённой тренировки LLM.

Исследования:
* Рассматриваем оффлайн RLHF для LLM.
* Beyond U — ускоряем диффузионные модели и делаем их легче.
* Обучение на своих ошибках делает AI-модели рассудительнее.

💬 Делайте выжимки из доков и чатьтесь по ним с помощью Claude


Репост из: Сиолошная
А ещё выделяются уровни автономности, от инструмента или консультанта (пройденные этапы) до полностью автономного агента. Обратите внимание на колонку "Example Risks
Introduced" :) Уже на текущем уровне указываются "радикалиация" и "целевое манипулирование"


Репост из: Сиолошная
Levels of AGI: Operationalizing Progress on the Path to AGI

Статья от DeepMind, в которой предлагается фреймворк оценки AGI-шности систем.
Для этого авторы проанализировали существующие определения AGI и выделили шесть принципов, которые нужно учитывать.

К ним относятся: концентрация на возможностях в отличие от механизмов или процессов (AGI/не AGI не дожлно определяться тем, работает ли там LLM, другая неросеть или хоть что: важно фокусироваться на возможностях), отдельная оценка универсальности и производительности (см. ниже). Больше всего мне понравился принцип «Focus on Potential, not Deployment», ибо достижение чего-то в лабораторных условиях как MVP/прохождение бенчмарков и разворачивание системы в реальном мире, интеграция её в экономику — это очень разные задачи.

Учитывая эти принципы, предлагаются «Уровни AGI», основанные на глубине (производительности) и широте (общности) возможностей, и проводится анализ того, как существующие системы вписываются в эту классификацию.

Ну и по бенчмарку получается, что следующий этап, который нас ждет — это Competent AGI, достигающий уровня медианного человека. Предыдущий уровень — Emerging AGI, эквивалентный или нескольким лучший, чем неквалифицированный для конкретной задачи человек, уже достигнут ChatGPT и даже Llama 2 (хотя тут я бы поспорил).


Репост из: 🇺🇦☮️🇷🇺 MR. FREEMAN ☿
Устройства в стиле plug and play – типа «воткни и используй», нравятся всем. Просто, легко и удобно.

Эволюция не исключение. Наш мозг работает примерно также. Органы чувств – устройства, пристыкованные к нему. И мозгу, по большому счету, все равно, откуда поступает информация.

Допустим, мы воткнули в голову новое устройство. Какую-нибудь новую версию Neuralink от Илона Маска.

Если чип станет отправлять сигналы в читаемом мозгом формате, то мозг станет искать в новом потоке информации закономерности. Найдет. После чего встроит их в привычную нам картину мира. А мы – получим новый орган чувств.

В экспериментах уже реализовано. Например, зрительную информацию кодируют и передают посредством легких ударов тока через пластинку на теле. И человек понимает, где находится препятствие. В прямом смысле видит через кожу. Причем мозг обучается распознавать новый тип информации - что она означает и с чем ее следует связать - без какого-либо сознательного участия.

Можно реализовывать идеи «Аватара». Люди уже умеют мысленно управлять отсоединенными от них механическими руками, которые способные находиться где угодно, расширяя образ нашего тела.

Что приводит к интересному выводу. С точки зрения психологии, физические характеристики являются базисом, на котором строится наша личность. Физиология задает основу того, как мы думаем и чувствуем.

Поэтому механические конечности, новые органы чувств и потоки информации делают нас по-настоящему иными.

Очень возможно, что психологически нам будет легче понять кроманьонца, жившего 50 000 лет назад, нежели нашего потомка через жалких 300 лет.

Николай Молчанов

Фриман в Телеграм


Репост из: Сиолошная
Слух оказался правдой — UI ChatGPT существенно переработали, и добавили возможность создавать отдельных чатботов (GPTs). Он состоит из промпта, нескольких вспомогательных маленьких файлов, на которые бот может опираться, и набора функций/инструментов. Помимо стандартных DALLE-3 и интерпретатора кода, можно свободно добавлять любые произвольные function calls к внешним сервисам (и прикрутить авторизацию для вызова).

Дальше ботом можно поделиться, и таким образом предоставить доступ определенному сценарию. Например, чатбот для записи в клиники или шиномонтаж, Q&A бот, и так далее.


Репост из: Сиолошная
GPTs: кастомизированные AI-ассистенты

https://openai.com/blog/introducing-gpts


Репост из: Сиолошная
https://github.com/openai/whisper

уже в гите


Репост из: Сиолошная
Whisper V3 сегодня выйдет в опенсорс — это новая SOTA модель для распознавания голоса на десятках языков


Репост из: Сиолошная
Новая модель:
— контекст длиннее. 128K токенов (365 страниц обычной книги)
— модель более аккуратна при работе с длинным текстом, не теряет то, что было в серединке
— фича для разрабов: можно заставить модель писать ответы в JSON-формате
— можно вызывать несколько функций за раз
— можно указать seed генерации, чтобы получать воспроизводимость
— скоро добавят logprobs в API
— Retrieval прямо из коробки, можно загружать документы на платформу и они будут подтягиватсья (F стартапам chatWithPDF)
— Теперь модель знает события не до сентября 2021го, а до апреля 2023го
— Эта новая модель принимает картинки на вход через API

— DALLE-3 + text-to-speech (6 голосов) сегодня появятся в API
— Для GPT-4 появится файнтюнинг сегодня (но на узкую выборку пользователей)
— Custom Models: программа плотной работы инженеров OpenAI с вашей компанией, чтобы помочь адаптировать файнтюнинг под ваши проблемы

ЦЕНА НА GPT-4-TURBO (Sam говорит, что эта модель ещё и умнее GPT-4) уменьшена в 3 раза для промпта и в 2 раза для генерации!

Обещают скоро ещё больше ускорить GPT-4 Turbo


Репост из: Сиолошная
На разогреве перед конференцией OpenAI у нас сегодня Elon Musk. Только что он анонсировал xAI PromptIDE — среду работы с промптами для языковой модели Grok.

Базовый функционал — это редактор промптов с поддержкой Python-кода. Все промпты версионируются, результаты работы моделей сохраняются. То есть можно в любой момент сравнить, насколько лучше или хуже работает новый подход. Вот этот новый трюк «take a deep breath and answer step-by-step» — он рабоатет вообще или нет? А вот это? Ну реально удобно!

Также можно подгружать свои файлы вроде CSV, читать из них информацию, и каким-то образом влиять на работу модели (от вставки в промпт до пост-обработки валидности выдаваемых значений).

Промпты можно шарить в один клик, причём как текущий промпт, так и все дерево развития, эволюцию магических команд!

Подать заявку на доступ
Читать анонс
Документация SDK


Репост из: Нейронавт | Нейросети в творчестве
Видео недоступно для предпросмотра
Смотреть в Telegram
Loop Copilot: Conducting AI Ensembles for Music Generation and Iterative Editing

Система генерации и изменения музыки через указания на естественном языке.
За понимание указаний, разумеется, отвечает языковая модель. Ну а для собственно музыки под капотом присутствуют генератор MusicGen, экстрактор стемов (отдельных источников звука) Demucs, генератор VampNet и описатель LP-MusCaps

Тренд интеграции разных нейросеток в один инструмент продолжает усиливаться.

Кода пока нет

#LLM #text2music #music2music #audio2audio

Показано 20 последних публикаций.

28

подписчиков
Статистика канала