Честно: я думал, соберу за вечер.
А оказалось - это был тест на нервы, где каждый шаг подкидывал новую проблему.
Ограничения YouTube, галлюцинации модели, лимиты API, ротация ключей, протухшие куки, сжатие аудио, таймауты — и так по кругу.
Но именно в этом и кайф:
мне реально было пиздец как интересно всё это фиксить, и никакой апатии вообще не ловил.
С помощью OpenClaw я прошёл этот путь и сделал рабочий продукт, которым уже можно пользоваться.
Что сделал ?
• Telegram-бот принимает ссылку на YouTube
• достаёт транскрипт
• делает выжимку без воды
• отдаёт всё прямо в чат
Как устроено: 4 уровня fallback
Одного метода недостаточно — YouTube регулярно режет доступ.
1.
youtube-transcript-api + прокси2.
youtube-transcript-api напрямую3.
yt-dlp субтитры (.vtt)4.
yt-dlp аудио → WhisperКаждый следующий уровень включается только если прошлый не дал результат.
API-цепочка
Чтобы бот не падал из-за лимитов одного провайдера, сделали связку:
• Gemini — основной
• Groq — fallback
• OpenRouter — запасной fallback
Какие модели у нас в работе:
• Gemini 2.5 Flash-Lite — основная суммаризация
• Llama 3.3 70B (Groq) — fallback для суммаризации
• Llama 3.3 70B Instruct:free (OpenRouter) — запасной fallback
• Whisper Large v3 Turbo (Groq) — распознавание аудио, когда нет субтитров
С чем конкретно ебался:
Прокси
YouTube жёстко банит серверные IP.
Прокси надо прокидывать и в transcript API, и в
yt-dlp, иначе всё разваливается.Куки
Без cookies на части видео ловишь “confirm you’re not a bot”.
С cookies лучше, но они протухают - нужно обновлять.
Лимиты API
На длинных видео быстро съедаются токены.
Поэтому сделали fallback по нескольким ключам/провайдерам.
Длинные видео
За один проход модель часто режет важные куски.
Решили так: делим на части → делаем частичные выжимки → собираем финальный конспект.
Галлюцинации
С галлюцинациями тоже пришлось повозиться: модель иногда додумывала то, чего в видео вообще не было.
Худо-бедно но лешили это жёстким системным промптом: модель работает только с текстом транскрипта как с источником, ничего не додумывает и не добавляет от себя. По сути - как NotebookLM от Google: берёт конкретный документ и делает выжимку строго по нему. Никакой отсебятины.
И еще мелочи, которые отъели кучу времени
• чистка VTT от дублей/мусора
• Telegram-лимит длины сообщений
• автоочистка временных файлов после
yt-dlp/ffmpegПо моделям, как есть:
Codex 5.3 не в разы, но заметно слабее Opus 4.6.
Именно Opus помог мне больше всего. Причём я использовал его не через Claude напрямую, а через Antigravity (он тоже работает через Claude API).
И многие говорят, что если бы я юзал Opus 4.6 напрямую через Claude, результат был бы ещё лучше.
Только начавши билдить, я реально ощутил все прелести OpenClaw.
Завтра допиливаю проект и покажу его.
Сейчас хочу взять 5 человек на тест: прогнать бота, собрать фидбек и найти баги до полноценного релиза в канал.
Если хочешь в тест - напиши мне в личку.
Только начавши билдить, я реально ощутил все прелести OpenClaw. И мой вердикт такой:
Если не знаешь, чем заняться - начни вайб-кодить. Скучно точно не будет: постоянно что-то тестишь, чинишь и двигаешься дальше.
❤️ Vimol: Канал | Чатик | Gpt на год за 30$ | Вся альфа тут
