TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
AI и грабли

18 Jul, 18:24

Открыть в Telegram Поделиться Пожаловаться

Несуществующие агенты для аудио

В последнее время много работаю с генерацией аудио. И удивляет, что в основном аудио пайплайны собираются в условном comfy – визуальном блочном редакторе. Удивляет, потому что это как писать код пайплайном в n8n вместо клода/кодекса

Основная проблема тут – нет полноценного агентного цикла, где модель видит, а точнее слышит, результаты предыдущих действий и может сама выбирать что с этим делать дальше

Но тут есть одна техническая сложность, которая многое объясняет: у моделей пока тупо нет нативного восприятия аудио. Например, умение "видеть" картинки уже есть. Поэтому клод код может посмотреть скриншоты лендинга, который он сделал, увидеть косяки и поправить их. Картинки – в контексте той же модели, которая пишет код

А с аудио так не работает – большинство моделей не умеют в нативный аудио input

Вы скажете: так есть же gemini. Это да. Но: ни одна агентная обертка не поддерживает чтение аудио файлов чисто на уровне тулов. Агентный экзоскелет просто не может просунуть аудиофайл в API запрос к "мозгу".

Да, можно подключить gemini по api к основному агенту и отправлять туда аудио с промптом, мол "расскажи, чего не хватает" (кстати, китайская glm-5.2 все еще с картинками работает именно так). Но это все равно что глухой композитор, который зовет своего племянника послушать музыку и сказать, что он там слышит – работает, очевидно, плохо из-за эффекта глухого телефона

Вот и получается, что сейчас просто нет привычного нам агентного решения (со скиллами, запуском терминальных комманд, форками сессий, субагентами и т.д.), которое может полноценно работать с аудио (= замыкая фидбэк луп)

———

UPD: Спустя два часа после написания текста выше:

1. Собран простенький самодельный агент вокруг gemini на 300 js строк, с агентным циклом, интерактивностью, fork/edit/resume – чисто проверить подход

2. Это все перенесено в PI в виде экстеншна, который патчит тул чтения файлов (он там by design умеет и текст читать, и бинарные данные)

Короче, теперь добавить своему агенту "уши" можно в 1-2 строки:

npm install -g pi-agent
pi install git:github.com/toolittlecakes/pi-gemini-audio-read

(не забываем потом /login → google → api key и выбрать модель gemini-3.5-flash)

Где нужно: генерация музыки, качественные аудио переводы, работа с voice cloning, монтаж аудио (и видео, если это подкаст)

Ограничения: 20мб на файл – не добавлял загрузку файлов через file api. И нет видео инпута

Вообще, забавно, как вдохновляют задачки, у которых в целом нет существующего решения (по крайней мере публичного). Ощущение, что оказываешься на землях, где "ни ступала нога человека"


💻Репо
GitHub - toolittlecakes/pi-gemini-audio-read: Pi extension adding native audio reads for Gemini 3.5 Flash
Pi extension adding native audio reads for Gemini 3.5 Flash - toolittlecakes/pi-gemini-audio-read

6.8k 1 140 3 78
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot