tl;dr: Value Object: как победить примитивную одержимость
Но пост не про содержание, а про процесс написания статью. И да, снова без ИИ не обошлось. Но если у вас акк на хабре, добавить карму всегда вам будет плюсиком в вашу карму)
Входные данные: опубликованное видео и презентация в PDF. Сценарий дословного я не делал. Только якоря.
Поэтому, чтобы не писать с нуля, прогнал через:
1. Получил звук из видео:
yt-dlp -f bestaudio --extract-audio --audio-format wav -o "talk_raw.%(ext)s" "url"2. Перевёл в 16кГц для оптимизации дальнейшеней работы
ffmpeg -i talk_raw.wav -ac 1 -ar 16000 talk_16k.wav3. Скачал модельку
ggml-large-v3-turbo и прогнал с помощью whisper-cli
whisper-cli \
-m ~/whisper-models/ggml-large-v3-turbo.bin \
-l ru \
-otxt \
talk_16k.wav
Получил сырой текст, в начале даже получился перевод на англ. Полный результат можно почитать на GitHub
4. После этого взял попробовать ChatGPT 5.2 Thinking для создания текста статьи из текста речи + PDF презентации в формате MarkDown. Получилось не с первого раза, пришлось сделать более человечным, в формате прозы, а не таблиц и списков. Все примеры из презентации отлично перенёс, но тут спасибо мне, так как примеры были в виде текста, а не скриншотов.
5. А вот тут пошла ручная работа – по настоящему очеловечивание текста. Правка форматирования и подгонка под себя. В итоге получилась хорошая статья.
✋ Ничего нового тут нет, такой подход очень широко можно использовать, просто набалтываете что угодно – распознаете и превращаете в нужный контент.
Сейчас в телефонах, в мессенджерах есть возможности speech-to-text. А если и нет, или качество ужасное, то надеюсь у вас найдется 2гб видеопамяти на запуск модельки для распознования.
Ну и карму или коммент на забудьте оставить или скажите, насколько запах ИИ в статье имеется)