Если хочешь что-то сделать - сделай локальный прокси. Мне вот такой понадобился под Gemma 3 на 27B от Гугл (и я теперь жду линейку номер 4), чтобы проверить пару теорий, провести хардтест и не разворачивать ее где-то на арендованных видеокартах/сервере. Изначально идея заключалась в локальных тестах для ассистента с векторной памятью и вагоном технической информации с жестким лимитом контекстного окна, потому именно фритир от АИ-Студио подходил идеально. Название временное и в будущем ожидается ребрендинг.
Сам прокси поддерживает стриминг, принимает в конфигурацию ваш промпт и ключ - они никогда не покидают вашего устройства, автоматически выбирает свободный порт (от 3000 и далее делает +1 сам если нужный порт занят), автоматически генерирует эндпоинт-ссылку которую можно использовать на необходимой вам платформе или в интерфейсе.
Порядок заполнения такой:
Ссылка на эндпоинт подобного вида
http://localhost:3000/v1/chat/completions
Где вместо 3000 будет конкретно ваш активный порт, терминал сам выдаст вам активную ссылку. Подходит для десктопа (ставить через терминал) и для мобильного (через Termux).
Вы просто вводите ссылку в нужное поле, а там где нужен ключ не пишете ничего (если интерфейс все же обязательно требует ключ - напишите что угодно, к примеру слово proxy). Это все что необходимо для подключения.
Так же имеется дашборд с состоянием сервера, статичными токенами от промпта и подсчетом токенов вашего занятого контекста. Для этого использовался gpt-tokenizer, в первую очередь потому что Гугл не отдает конкретную информацию по токенам - сервер принимает ваши данные и считает сколько токенов получилось, а потом обновляет статистику.
🌚 Из будущих важных апдейтов: выделю что хочу добавить совместимость с различными провайдерами/моделями, как и доступные конфигурации между которыми можно выбирать.
Минутка информации о модели для боевого крещения (потому что я ее люблю и что вы мне сделаете?):
🧠 создана на архитектуре Gemini 2.0 recipe, но облегчена и оптимизирована под опенсорс - отсюда такие мощности под капотом, комьюнити даже сравнивает ее с опенсорс GPT на 120B
🤖 у модели нет thinking режима - dense decoder без chain-of-thought, в первую очередь это плюс при творческом применении
Из плюсов модели укажу:
✨ мультимодальность (что очень удобно)
✨ очень послушна инструкциям
✨ среди опенсорс моделей Gemma 3 одна из лучших даже на фоне более крупных собратьев
✨ по опыту работы с ней - она в эпоху 2.5 серии Gemini давала решения не хуже, чем флеш, а это сильно для такой маленькой модели
✨ качество текста у нее обычно высокое, мне напомнило Claude 3.7/4 серий
✨ она довольно быстрая
Конкретика по квотам от Гугл:
☀️14400 запросов в сутки
☀️30 запросов в минуту
🌦15000 токенов в минуту (это ограничение фритира через АИ-Студио)
Зачем все это:
У меня есть план сделать из этого пет-проекта полноценного карманного ассистента, с живущей внутри (прямо на сервере) embedding-моделью для улучшения памяти и векторизации. Так же вместе с сервером будет в дальнейшем запускаться Gemini CLI и появится огромное количество функций. Каждое обновление я буду пинговать на канале.
И ссылка будет в комментариях🐕