TGViewer
Андруша пишет код Андруша пишет код @xavescor_code · 1.33K subscribers
Post #367 1.9K
Не задумывались для кого делаются все эти мелкие локальные модели размерами 4b-70b, которые вы типа можете запускать на своих машинках?
Тип, если запустить модельку у себя, подключить в какой-то CLine и попробовать написать код, то получится полная шляпа. А если учесть цену на подписку на решения от openai, антропика или дипсика, то окажется, что локальные решения ещё и экономически неоправданы.

Но всё меняется в тот момент, когда ты делаешь какой-нибудь сервис по обработке текста. К примеру, поисковую систему по решениям судов. Да, можно пользоваться большими моделями, но учитывая их ценник, ты скорее обанкротишься, чем найдёшь людей, которые готовы будут тебе платить.

Если вы глянете в спецификацию openai протокола, то увидите любопытное поле text_format. Или же так называемый structured output. Он сейчас есть буквально у всех провайдеров https://developers.openai.com/api/docs/guides/structured-outputs?lang=python&example=structured-data.
Эта штука позволяет буквально управлять тем что модель генерирует на выход.
Простой пример: вы задаёте что контент должен быть формата

type Output = {
foo: string,
}

И обработчик ответа будет отбрасывать все токены в аутпуте, пока модель не сгенерирует в ответе именно "foo": "<и тут дальше строка>.

И тут уже пригождаются маленькие модели. Потому что они, да, тупые, но мы можем делегировать программисту самую главную задачу: думать.
Мы можем форматом ответа тупо задавать то в какую сторону может думать модель(см. картинки 1 и 2)

К примеру, я сейчас использую gpt oss 20b для своего сервиса переводов для сериалов и ютуба и её вполне достаточно. Надо просто сделать почти всю работу за модель:
- достать из словарей возможные значения слов
- описать контекст сцены
- подсветить всякие нюансы по типу "эти слова в языках слишком похожи(ложные друзья переводчика), поэтому давай переводить по-другому"
- задать пайплайн рассуждений через structured output
И, внезапно, модель, которая на церебрасе стоит $0.4/$0.4 за 1М токенов и скоростью 500 t/s начинает иметь смысл.

А вот для работы с человеком брать что-то меньше чем всякие попусы и гопоты 5.5 смысла нет, это правда. Слабые модели только для всяких узеньких и конкретных задач

Ссылки:
- https://developers.openai.com/api/docs/guides/structured-outputs?lang=python&example=structured-data
- https://abdullin.com/schema-guided-reasoning/
  • 👍 13
  • 💩 3
  • 🤡 2
  • ❤ 1
  • 👎 1
  • 🔥 1
More from @xavescor_code
  1. Sep 24, 2026Тут в моём казахстанском пузыре происходит прикольная вещь. Ща, в пятницу, в кз обьявлен т…
  2. Sep 22, 2026Чуть чуть проснусь от спячки по важному поводу. Мы походу пришли к AGI в ЛЛМках. Ну, точне…
  3. Aug 6, 2026Уже почти месяц прошел после взлома моделями OpenAI – HuggingFace. Спустя это время каждая…
  4. Jul 28, 2026https://t.me/denissexy/11581 Знаете, меня очень сильно удивляет вопрос: какого чёрта подоб…
  5. Jul 28, 2026Антропик: китайцы дистилируют наши модели, надо забанить их Опенаи: китайцы дистилируют на…
  6. Jul 26, 2026При разработке сервисов, кмк, стоит думать не только о том как офигенно можно всё сделать,…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →