TGViewer
Андруша пишет код Андруша пишет код @xavescor_code · 1.33K subscribers
Post #377 1.13K
Хроники @eyespoken продолжаются.

Что может быть проще чем сделать перевод текста с одного сверхпопулярного человеческого языка на другой?(с английского на русский)
Закинул в буквально любую ЛЛМку(даже в gpt oss 20b) и получил перевод. Вроде всё просто.

Но когда я внедрил перевод к себе(кликнул на слово - увидел +- умный перевод) - оказалось, что не всё так просто:
1. Модели жудко медленные. Если будет 60-70t/s в среднем - это уже хорошо
2. Модели думают ОООООООООООчень много. Даже 300 токенов ризонинга при скорости в 80t/s - это около 4 секунд ожидания ТОЛЬКО на ризонинге.
3. Многие модели в принципе не дают отключать ризонинг(антропик, кими, опенаи, гпт привет). А low(там где он есть) - это минимум 1000(ТЫСЯЧЯ!!) токенов на ризонинг.
4. И в такой ситуации даже церебрас с их 500t/s не спасает, так как 1000 токенов(low у gpt oss 120b) - это всё равно 2 секунды.

Славься дипсик, который позволяет в принципе отключать ризонинг, но у них другая проблема. Они не умеют в structured output. И в итоге получается, что реатайма, де факто, в мире ЛЛМ не существует. Нужно прямо очень поприседать, чтобы модель предсказуемо и быстро отвечала.

Пока я вижу только 1 выход:
- пользоваться моделями у которых можно тупо отключить ризонинг
- самому через structured output(https://developers.openai.com/api/docs/guides/structured-outputs) или tool_calls(https://api-docs.deepseek.com/guides/tool_calls) задать то куда думать модели, чтобы повышать качество в тестах.

А так - пока хз куда копать для реалтайма
OpenAI Developers Structured model outputs | OpenAI API Understand how to ensure model responses follow specific JSON Schema you define.
  • 🤡 7
  • ❤ 4
  • 💩 3
  • 🔥 2
More from @xavescor_code
  1. Sep 24, 2026Тут в моём казахстанском пузыре происходит прикольная вещь. Ща, в пятницу, в кз обьявлен т…
  2. Sep 22, 2026Чуть чуть проснусь от спячки по важному поводу. Мы походу пришли к AGI в ЛЛМках. Ну, точне…
  3. Aug 6, 2026Уже почти месяц прошел после взлома моделями OpenAI – HuggingFace. Спустя это время каждая…
  4. Jul 28, 2026https://t.me/denissexy/11581 Знаете, меня очень сильно удивляет вопрос: какого чёрта подоб…
  5. Jul 28, 2026Антропик: китайцы дистилируют наши модели, надо забанить их Опенаи: китайцы дистилируют на…
  6. Jul 26, 2026При разработке сервисов, кмк, стоит думать не только о том как офигенно можно всё сделать,…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →