Не задумывались для кого делаются все эти мелкие локальные модели размерами 4b-70b, которые вы типа можете запускать на своих машинках?
Тип, если запустить модельку у себя, подключить в какой-то CLine и попробовать написать код, то получится полная шляпа. А если учесть цену на подписку на решения от openai, антропика или дипсика, то окажется, что локальные решения ещё и экономически неоправданы.
Но всё меняется в тот момент, когда ты делаешь какой-нибудь сервис по обработке текста. К примеру, поисковую систему по решениям судов. Да, можно пользоваться большими моделями, но учитывая их ценник, ты скорее обанкротишься, чем найдёшь людей, которые готовы будут тебе платить.
Если вы глянете в спецификацию openai протокола, то увидите любопытное поле
text_format. Или же так называемый structured output. Он сейчас есть буквально у всех провайдеров
https://developers.openai.com/api/docs/guides/structured-outputs?lang=python&example=structured-data.
Эта штука позволяет буквально управлять тем что модель генерирует на выход.
Простой пример: вы задаёте что контент должен быть формата
type Output = {
foo: string,
}
И обработчик ответа будет отбрасывать все токены в аутпуте, пока модель не сгенерирует в ответе именно
"foo": "<и тут дальше строка>.
И тут уже пригождаются маленькие модели. Потому что они, да, тупые, но мы можем делегировать программисту самую главную задачу: думать.
Мы можем форматом ответа тупо задавать то в какую сторону может думать модель(см. картинки 1 и 2)
К примеру, я сейчас использую gpt oss 20b для своего сервиса переводов для сериалов и ютуба и её вполне достаточно. Надо просто сделать почти всю работу за модель:
- достать из словарей возможные значения слов
- описать контекст сцены
- подсветить всякие нюансы по типу "эти слова в языках слишком похожи(ложные друзья переводчика), поэтому давай переводить по-другому"
- задать пайплайн рассуждений через structured output
И, внезапно, модель, которая на церебрасе стоит $0.4/$0.4 за 1М токенов и скоростью 500 t/s начинает иметь смысл.
А вот для работы с человеком брать что-то меньше чем всякие попусы и гопоты 5.5 смысла нет, это правда. Слабые модели только для всяких узеньких и конкретных задач
Ссылки:
-
https://developers.openai.com/api/docs/guides/structured-outputs?lang=python&example=structured-data-
https://abdullin.com/schema-guided-reasoning/