TGViewer
AI и грабли AI и грабли @oestick · 13.7K subscribers
Post #528 7.35K
Несуществующие агенты для аудио

В последнее время много работаю с генерацией аудио. И удивляет, что в основном аудио пайплайны собираются в условном comfy – визуальном блочном редакторе. Удивляет, потому что это как писать код пайплайном в n8n вместо клода/кодекса

Основная проблема тут – нет полноценного агентного цикла, где модель видит, а точнее слышит, результаты предыдущих действий и может сама выбирать что с этим делать дальше

Но тут есть одна техническая сложность, которая многое объясняет: у моделей пока тупо нет нативного восприятия аудио. Например, умение "видеть" картинки уже есть. Поэтому клод код может посмотреть скриншоты лендинга, который он сделал, увидеть косяки и поправить их. Картинки – в контексте той же модели, которая пишет код

А с аудио так не работает – большинство моделей не умеют в нативный аудио input

Вы скажете: так есть же gemini. Это да. Но: ни одна агентная обертка не поддерживает чтение аудио файлов чисто на уровне тулов. Агентный экзоскелет просто не может просунуть аудиофайл в API запрос к "мозгу".

Да, можно подключить gemini по api к основному агенту и отправлять туда аудио с промптом, мол "расскажи, чего не хватает" (кстати, китайская glm-5.2 все еще с картинками работает именно так). Но это все равно что глухой композитор, который зовет своего племянника послушать музыку и сказать, что он там слышит – работает, очевидно, плохо из-за эффекта глухого телефона

Вот и получается, что сейчас просто нет привычного нам агентного решения (со скиллами, запуском терминальных комманд, форками сессий, субагентами и т.д.), которое может полноценно работать с аудио (= замыкая фидбэк луп)

———

UPD: Спустя два часа после написания текста выше:

1. Собран простенький самодельный агент вокруг gemini на 300 js строк, с агентным циклом, интерактивностью, fork/edit/resume – чисто проверить подход

2. Это все перенесено в PI в виде экстеншна, который патчит тул чтения файлов (он там by design умеет и текст читать, и бинарные данные)

Короче, теперь добавить своему агенту "уши" можно в 1-2 строки:

npm install -g pi-agent
pi install git:github.com/toolittlecakes/pi-gemini-audio-read


(не забываем потом /login → google → api key и выбрать модель gemini-3.5-flash)

Где нужно: генерация музыки, качественные аудио переводы, работа с voice cloning, монтаж аудио (и видео, если это подкаст)

Ограничения: 20мб на файл – не добавлял загрузку файлов через file api. И нет видео инпута

Вообще, забавно, как вдохновляют задачки, у которых в целом нет существующего решения (по крайней мере публичного). Ощущение, что оказываешься на землях, где "ни ступала нога человека"


💻Репо
  • ❤ 39
  • 🔥 25
  • 👍 14
  • 👏 2
  • 🤯 1
More from @oestick
  1. Sep 19, 2026⬆️ Расскажу про vscode moment для агентов и нативный способ дать клод коду оркестрировать…
  2. Sep 19, 2026Что вы знаете про bb? Они называют себя "AI IDE that builds itself". Достаточно молодой пр…
  3. Sep 16, 2026Поспорил я тут на днях в баре с одной дизейнеркой интерьеров Говорит, что ваши эти ИИшки н…
  4. Sep 13, 2026Разбор аудиорежима в кодексе Будет особенно интересно тем, кто сам разрабатывает что-то по…
  5. Sep 6, 2026↑ Cейчас разбирал с Фейблом system card gpt-6-astra и чет опять такими вайбами ai-2027.com…
  6. Sep 4, 2026Видел недавно интересный тейк, мол, все только хвастаются как внедряют ИИ, но конкретных у…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →