TGViewer
AbstractDL AbstractDL @abstractdl · 18.6K subscribers
Post #171 4.46K
Существуют ли задачи, которые большие языковые модели решают хуже чем маленькие?

По результатам Inverse Scaling Prize было найдено 4 типа задач, для которых перформанс ухудшался по мере роста моделей:
1. Вопросы с отрицанием.
2. Вопросы с ложной подсказкой.
3. Повторение искажённых цитат.
4. Вопросы со странной математикой.

Для ребят из Google этот результат показался подозрительным и они решили увеличить количество параметров ещё больше — в результате обнаружился U-shaped scaling law — точность моделей, по мере их роста, падала только в начале, а затем начинала повышаться.

Возможно, это из-за того, что каждая из тех задач на самом деле состоит из двух частей — настоящей и отвлекающей (ложной). И только гигантские модели могут правильно в этом разобраться, а модели поменьше ошибочно фокусируются на ложной задаче.

Ещё оказалось, что использование подхода Chain-of-Thought тоже позволяет предотвратить падение качества, а иногда даже получить 100% accuracy 💁‍♂️

Статья
  • 👍 33
More from @abstractdl
  1. Sep 25, 2026Evidence of Linear Superposition in LLMs Языковые модели ЕЩЁ ЛИНЕЙНЕЕ, чем мы думали. Это,…
  2. Sep 22, 2026GPT-6-sol и luna. Куда ещё дешевле то? Демпингуют) UPD: раздали всем reset-ы лимитов
  3. Sep 22, 2026Антропик дропнули сброс лимитов, доступен до 22 октября
  4. Sep 22, 2026Opus-5.5
  5. Sep 21, 2026Grok-4.7
  6. Sep 21, 2026Замечаете, как Codex иногда неожиданно тупеет? Возможно, вместо Astra вам отвечает… Luna.…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →