Сколько стоит превратить два Telegram-чата в бота, который отвечает со ссылками на исходные сообщения
Резонный вопрос, стоит ли игра свеч? Для моего экспертного бота по Данангу мы обработали сразу два больших чата по Вьетнаму: 96 386 сообщений в за год. Представьте, читать это самому? А вы так и делаете с вашими чатами, пока не передадите это агентам.
Очистили историю от шлака, сохранили даты, ветки ответов и точные ссылки на каждое сообщение, затем построили векторный индекс.
Подготовка корпуса оказалась почти бесплатной. 9.66 млн токенов эмбеддингов обошлись в $1.26, или примерно 97 ₽. С учётом первичных проверок бота и деплоя весь подготовительный этап стоил $1.40, около 107 ₽.
Дальше мы сравнили три модели на главной задаче бота:
• MiniMax M3;
• GPT-5.5 Luna Low;
• GPT-5.5 Luna High.
Собрали 10 реальных сценариев: прямой поиск факта, объединение нескольких сообщений, SIM-карты, банкоматы, визы, трансфер из аэропорта, поздние поправки в чате, клиники, коворкинги и контрольный вопрос без ответа в архиве.
Все модели получали один и тот же найденный контекст. Ответы оценивал слепой судья без названий моделей. Порядок ответов полностью развернули и повторили проверку, чтобы убрать перекос позиции. Каждую Telegram-ссылку прогнали по полному корпусу отдельно.
Результаты:
MiniMax M3: 8.90/10, медиана 12.51 секунды, 105 из 105 валидных ссылок.
Luna Low: 9.55/10, медиана 14.28 секунды, 106 из 106 валидных ссылок.
Luna High: 9.60/10, медиана 35.69 секунды, 95 из 95 валидных ссылок.
Все три модели отработали 10 из 10 запросов и правильно отказались отвечать на контрольный вопрос без источника.
Основной моделью стала Luna Low. Она уступила High всего 0.05 балла, зато отвечала в 2.5 раза быстрее. M3 была быстрее Low лишь на 1.77 секунды, но потеряла 0.65 балла качества, прежде всего на сложных запросах с несколькими источниками и поправками.
То есть, новая модель GPT 5.6 хороша даже в "минимальной комплектации" Luna low thinking.
Теперь экономика одного запроса. Расчёт основан на среднем расходе токенов из теста и тарифах OpenRouter на 11 июля 2026 года:
• MiniMax M3: $0.0039 ≈ 0.30 ₽ за запрос;
• Luna Low: $0.050 ≈ 3.84 ₽;
• Luna High: $0.086 ≈ 6.61 ₽.
На тысячу таких запросов это примерно 297 ₽, 3 840 ₽ и 6 608 ₽ соответственно. Поиск по векторной базе добавляет доли копейки.
Два чата мы превратили в готовую базу знаний дешевле обычного обеда. Основные расходы начинаются позже, когда бот каждый день отвечает пользователям.
High как модель по умолчанию здесь не оправдывает себя: почти незаметная прибавка качества обходится в 2.5 раза большей задержкой и примерно на 72% более дорогим ответом. Luna Low даёт лучший баланс качества, скорости и цены.
Это же дорого, скажете вы. Но в нашей сборке Luna работала через квоту Codex без отдельного списания за каждый ответ. OpenRouter здесь просто используется как единая публичная шкала для сравнения моделей.
Подписки субсидируются х20 от обычных цен и спасают вайбкодеров от разорения :)
Цены рассчитаны по официальным тарифам OpenRouter и средней длине запросов в этом тесте. Итог зависит от объёма контекста и ответа: короткий запрос будет дешевле, большой контекст обойдётся дороже.
Бот, о котором речь: https://t.me/human20/395.
Среда внедрения ИИ:
Внедрить | ТГ | ВК | YouTube
Post #397
527

- ❤ 8
- 🏆 1