Lipflow — open-source инструмент, который превращает движения губ в текст. Никакого микрофона, голоса и звуков — достаточно обычной веб-камеры.
Работает почти как голосовой ввод, только без голоса: зажимаете горячую клавишу, беззвучно произносите нужную фразу, отпускаете — и нейросеть вставляет распознанный текст прямо в активное приложение.
🔥 Что интересного:
🖍 Читает по губам с помощью модели компьютерного зрения Auto-AVSR.
🖍 Работает локально — видео с камеры и распознавание обрабатываются на вашем компьютере.
🖍 Поддерживает Windows, macOS и Linux — без обязательной облачной обработки.
🖍 Подключает ИИ для исправления ошибок — Claude, ChatGPT через Codex CLI, Ollama или локальную Qwen.
🖍 Подстраивается под пользователя — можно потренировать модель на собственном лице и привычных фразах.
🖍 Умеет распознавать речь из видеофайлов, а не только с веб-камеры.
Есть даже гибридный режим: нейросеть одновременно анализирует движения губ и тихий шёпот, повышая точность распознавания.
Установка и запуск
macOS (Apple Silicon):
git clone https://github.com/amywork777/lipflow.git
cd lipflow
./setup.sh
open /Applications/Lipflow.app
Windows (PowerShell):
git clone https://github.com/amywork777/lipflow.git
cd lipflow
powershell -ExecutionPolicy Bypass -File setup.ps1
После установки запускаем Lipflow через меню «Пуск».
Linux:
git clone https://github.com/amywork777/lipflow.git
cd lipflow
curl -LsSf https://astral.sh/uv/install.sh | sh
uv sync
./scripts/download-models.sh
uv run lipflow
🚀 Как пользоваться:
1. При первом запуске разрешаем доступ к камере и проходим настройку с тренировочными фразами.
2. Открываем любой текстовый редактор или мессенджер.
3. Зажимаем Right Option на macOS или Right Ctrl на Windows/Linux.
4. Беззвучно произносим фразу одними губами и отпускаем клавишу.
5. Нейросеть распознаёт движения губ и вставляет текст в активное поле.
💡 Бонус: двойное нажатие горячей клавиши включает режим без удержания кнопки. А для повышения точности можно подключить Claude, Codex CLI или Ollama.
❗️ Важно: при установке скачиваются модели объёмом около 1,2 ГБ. Для базового распознавания интернет после настройки не нужен.
⚡️ Особенно интересно для работы в тишине, экспериментов с компьютерным зрением и альтернативного управления компьютером.
Важный нюанс: технология пока не идеальна. Похожие движения губ могут соответствовать разным словам, поэтому ошибки возможны, особенно при полностью беззвучной речи. Именно для этого предусмотрена дополнительная AI-коррекция.
💬 По сути, это диктовка нового поколения: вы молча шевелите губами, а компьютер печатает за вас.
⚙️ GitHub/Инструкция
#python #github #soft
