Перечитал полностью docs+api refs openai,anthropic,gemini,grok,cerebras,groq,deepseek,litellm,openrouter вместо вас
Последний раз читал год назад. Тогда рассказывали про кэширование, ризонинг - решил изучить, что сейчас есть "перспективного" в апихах
- в конце текста вам подарок
из прикольного:
- грок берет 5 центов штрафа если запрос "улетел в этику"
- openai responses api boost accuracy in 3% by mean (comparing to completions api)
- (старая фича) открыл для себя predicted outputs = можно вывести в ответ текст в 10к токенов, при этом генерироваться будет лишь малая часть (стоит чуть дороже, но работает сильно быстрее)
- prefill output позволяет начинать ответ с правильного персонажа/текста etc., сразу пропуская "преамбулу"
- грок апи самый бедный по фичам, ниче нет, даже батч апи без скидки
- у image-edit моделей есть МАСКИ на вход (нативно и параметром!)
- у опенаи есть прикольный flex tier, понижающий стоимость в 2 раза (по-другому поданный batching)
- батч+кэш = скидка до 95% = платим меньше или юзаем модели больше
- работать с видео не так уж и дорого, если использовать самые крошечные модели + батчинг + кэширование
- o3 (и выше) умеют ДУМАТЬ картинками (в процессе размышлений рассматриваются участки изображения, например модель может приблизить картинку в каком-то месте и рассмотреть подробнее (н. прочитать мелкий текст)
- у gpt-image есть параметр input_fidelity=high, который превращает ее в ультимативный фотошоп - есть ощущение, что на аренах он отключен
- у gpt-image есть параметр для прозрачности фона: auto/transparent/opaque
- анторпик дает несколько чекпоинтов для кэширования промптов
- на оперрутере есть моделька cognitivecomputations/dolphin-mistral-24b-venice-edition:free (uncensored)
- в опенаи ответ можно получать на вебхук (не батчевый!)
- VLM очень точно возвращают box_2d (границы предметов на изображении, относительными координатами) [проверил гугл, тропик, оаи]
- image-edit модели очень точно создают маску для объекта
- (на всякий случай решил напомнить) у tool_call_mode есть режим required
- у дипсика есть fill in the middle completion (блин это очень круто, представляю сколько всего надо было сделать ради этой фичи)
- антропик упоминает у себя XML промптинг среди самых мощных техник
- в api gigachat&yandexgpt всё еще нет кучи параметров начиная с банальных stop, что даже хз что говорит о продактах (или их ресурсах) - под капотом в моделях больше 100 параметров по управлению "пулом токенов для генерации" (в я. в конце 2025 года так вообще кроме температуры ничего нет)
- proprietary vlm's находятся в больгинстве на уровне понимания изображений, сопоставимом с уровнем пониманием текста gpt-3.5. Все еще хорошо работают техники с ролями "You have perfect vision and pay great attention to detail" (прочитал 20+ статей по vlm за неделю, напишите в комменты если нужен пост на эту тему)
- про текущие VLM: поворот изображения = смерть. изменение экспозиции = смерть. изменение освещения = смерть. spatial understanding & counting везде слабый. ждем обучение на videogen моделях
- фичами в апи обычно занимаются целые команды, поэтому у маленьких провайдеров типа groq/cerebras/etc нет почти никаких фич - паттерн
- гемини 2.5 поддерживает сегментацию из коробки (шок) (возвращает label + box_2d + base64 маску для каждого объекта)
- gemini несовместим с reasoning_effort в litellm и кажется не будет
- подарок: все дают 0.1-1тб бесплатного диска для files api, который можно использовать для каких угодно задач = можно на все аккаунты наспамить себе хранилищ
А еще сильно разочаровался в litellm. Про это будет следующий пост
Post #17
1.12K

- 🔥 17
- ❤ 5