Хроники @eyespoken продолжаются.
Что может быть проще чем сделать перевод текста с одного сверхпопулярного человеческого языка на другой?(с английского на русский)
Закинул в буквально любую ЛЛМку(даже в gpt oss 20b) и получил перевод. Вроде всё просто.
Но когда я внедрил перевод к себе(кликнул на слово - увидел +- умный перевод) - оказалось, что не всё так просто:
1. Модели жудко медленные. Если будет 60-70t/s в среднем - это уже хорошо
2. Модели думают ОООООООООООчень много. Даже 300 токенов ризонинга при скорости в 80t/s - это около 4 секунд ожидания ТОЛЬКО на ризонинге.
3. Многие модели в принципе не дают отключать ризонинг(антропик, кими, опенаи, гпт привет). А low(там где он есть) - это минимум 1000(ТЫСЯЧЯ!!) токенов на ризонинг.
4. И в такой ситуации даже церебрас с их 500t/s не спасает, так как 1000 токенов(low у gpt oss 120b) - это всё равно 2 секунды.
Славься дипсик, который позволяет в принципе отключать ризонинг, но у них другая проблема. Они не умеют в structured output. И в итоге получается, что реатайма, де факто, в мире ЛЛМ не существует. Нужно прямо очень поприседать, чтобы модель предсказуемо и быстро отвечала.
Пока я вижу только 1 выход:
- пользоваться моделями у которых можно тупо отключить ризонинг
- самому через structured output(https://developers.openai.com/api/docs/guides/structured-outputs) или tool_calls(https://api-docs.deepseek.com/guides/tool_calls) задать то куда думать модели, чтобы повышать качество в тестах.
А так - пока хз куда копать для реалтайма
Post #377
1.13K