Causal AI и оценка неопределенности (Unсertainity Quantification)
Надежность и верификация — понятия, применимые не только к традиционному ПО. Сегодня это один из главных вызовов для больших языковых моделей. Как понять, что LLM действительно «знает», что делает, а не галлюцинирует?
Рады поделиться препринтом нашей новой статьи «Measuring Uncertainty in Transformer Circuits with Effective Information Consistency», которая посвящена именно этой проблеме. А через неделю, 17го сентября, представим нашу работу на конференции AI ZAMAN в рамках Kazan Digital Week.
В чём суть?
Мы предлагаем EICS (Effective Information Consistency Score) — это white-box метрика, которая за один проход измеряет неопределенность внутри цепочек-подсетей (circuits) трансформера (база от Anthropic). Вместо того чтобы просто смотреть на конечный результат, EICS проверяет, насколько согласованно работает базовый причинный механизм, отвечающий за ответ. По сути, это прямая оценка надежности конкретных частей «мыслительного процесса» модели. Эта работа напрямую развивает идеи причинной эмерджентности, которые мы представляли ранее.
Post #9
797

