TGViewer
ML прокачка ML прокачка @ml_prokachka · 97 subscribers
Post #94 117
Почему LLM выдает разные ответы на один и тот же вопрос?

Некоторое время назад обсуждали с знакомыми MLOps-ами тему воспроизводимости ответов LLM. То есть способность многократно выдавать один и тот же ответ на неизменный вопрос. Я в данном посте рассказывал, что модель генерирует слово за словом (токен за токеном, если быть точнее). Каждый токен она берет из распределения вероятностей. Логично, что нужно брать тот, у кого наибольшая вероятность. Но придумали специальный параметр, позволяющий брать менее вероятный токен, что делает модель более вариативной и непредсказуемой, и в то же время привносит некоторую случайность в ответ. Этот параметр назвали температурой.

Я был убежден, что установив температуру в 0, можно сделать LLM гарантированно детерменированной (т.е. всегда один и тот же ответ при одинаковом запросе). Как оказалось, в теории так и должно быть, но на практике — не всегда. И недавно один небезызвестный стартап рассказал как раз об этом в своей статье.

Ответ в параллельности вычислений с плавающей точкой (float). Нас в школе учили, что при перестановке слагаемых сумма не меняется. Вот только с float-числами это не всегда верно. В статье хорошо показан пример, когда сложение чисел разных порядков приводит к округлению и, как следствие, потере информации. А в LLM таких операций миллиарды. И небольшая потеря в точности в итоге может привести к иной вероятности токена, что вполне может повлиять на всю последовательность слов.

А при чем тут параллельность?

Разработчики знают, чтобы нейронка работала эффективнее, запросы можно обрабатывать параллельно. Для этого входные данные аккумулируются и обрабатываются пачкой, правильнее сказать батчом. Если запросов от пользователей много, за секунду соберется батч размера 64. Если запросов мало, то 10 или 5. И это почти всегда непредсказуемо в реальном мире. Авторы доказывают, что в LLM огромнейшее число операций с плавающей точкой может приводить к различным ответам при разном размере батча.

И что предлагают?
В статье описаны альтернативные способы реализации некоторых операций внутри нейронки, что поможет устранить проблему. Можете почитать, если интересно.

А нужно ли это вообще?
Да, возможно, при стандартном использовании LLM проблема невоспроизводимости не стоит так остро. Однако, если требуется модель тщательно протестировать, посчитать метрики или как-то поисследовать, новые ответы LLM из раза в раз на один и тот же вопрос могут быть препятствием, чтобы сделать дальнейший вывод.
Thinking Machines Lab Defeating Nondeterminism in LLM Inference Connectionism: Research Blog by Thinking Machines Lab
  • 👍 3
  • 🔥 1
  • 🤩 1
More from @ml_prokachka
  1. Jun 7, 2026Всем привет! Давно не делился полезным контентом. Решил вчера позалипать в Ютубчике и натк…
  2. May 8, 2026OpenCode vs Continue.dev Говоря про ИИ‑ассистент для кода, кто‑то предпочитает отдельные и…
  3. Apr 14, 2026Оставит ли вас в живых LLM? Есть интересное исследование, оформленное в виде бенчмарка, ко…
  4. Mar 10, 2026Как мы внедряли менеджер ML‑экспериментов На Хабре опубликовали статью о том, как мы в ком…
  5. Feb 24, 2026Форматы датасетов Обзорный пост для тех, кто работает с большими датасетами. Недавно мы вз…
  6. Feb 17, 2026AI‑прогресс наглядно Сегодня наткнулся на такой видос и крутил его на репите раз 15, навер…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →