TGViewer
Аналитик данных Аналитик данных @dataanlitics · 6.25K subscribers
Post #228 1.29K
✔️ Бенчмарки vs реальные задачи

Несмотря на то что модели o3 и o4‑mini сейчас лидируют в задачах рассуждения, но для «обычных» офисных пользователей разница между 95% и 98% качества по бенчмаркам почти неощутима.

Они уже готовы пользоваться ИИ‑помощниками — главное не абсолютный рекорд, а удобство и надёжность в повседневной работе.

Ограниченный контекст (context window)
Сохранение и обработка длинных фрагментов текста (чата, документов, сценариев) до сих пор сильно ограничено: модель просто «забывает» начало разговора, как только контекст вырастает за рамки окна. Это ключевая проблема для всех провайдеров ИИ, и её решение окажет гораздо больший эффект, чем рост точности на синтетических тестах.

Упрощение выбора модели
Люди путаются, когда и какую модель лучше выбрать: для творчества, для вычислений, для перевода и т. д. Если пользователь в панели видит «o3», «o4‑mini», «reasoning», «non‑reasoning» — он в итоге часто запускает самую мощную (и самую дорогую) модель «на всякий», даже если она избыточна. Нужен автоматический «маршрутизатор», который подберёт оптимальную модель под задачу сам (надеются, что появится в GPT‑5).

Стоимость использования

Идеальные модели всё ещё требуют значительных ресурсов: каждый запрос стоит денег. Чем дешевле модель при сопоставимой производительности, тем быстрее ИИ войдёт в массовое применение и принесёт экономический эффект. Здесь у Google есть преимущество благодаря собственным TPU, которые дают более низкую себестоимость.

Итог: пользователям уже не важна «последняя сотая доля процента» в тестах — им нужны

большие и стабильные контексты,

простота и автоматический выбор «правильной» модели,

и низкая цена использования. Име
  • 👍 5
  • 🤔 2
  • 👎 1
  • 🤡 1
More from @dataanlitics
  1. Sep 22, 2026👣 Google открыла исходный код AX, среды для запуска AI-агентов в продакшене. AX изолирует…
  2. Sep 15, 2026📘 Бесплатный 17-страничный PDF по Hidden Markov Models (HMM) Короткий материал от Stanfor…
  3. Sep 15, 2026🔥 Один из лучших обучающих курсов на StepiK по SQL SQL можно знать годами и всё равно тер…
  4. Sep 10, 2026✔️ Hugging Face запустила агента для ML-экспериментов Платформа встроила в свой чат-бот от…
  5. Aug 19, 2026Как нормально тестировать AI-агента, если правильный ответ ещё ничего не доказывает У обыч…
  6. Aug 16, 2026⚡️ Harness Engineering - полный курс на русском Как заставить AI-агента писать код надёжно…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →