TGViewer
демшиза ии киберпанк демшиза ии киберпанк @dempunk · 69 subscribers
Post #23187 8
Это прямо тренд сегодняшнего дня – оценка того, насколько модели не просто справляются с работой, а насколько делают её правильно, точнее это тренд нового этапа в развитии LLM - зрелости моделей, они стали взрослыми и требования к ним теперь соответствующие, правда, в этом случае это скорее исправление проблемы в бенчмарке, которая приводила к неправильной завышенной оценке – Artificial Analysis (на этот раз это действительно Artificial Analysis) выпустили новую версию юридического бенчмарка Harvey LAB-AA (Legal Agent Benchmark), в которой учитывается есть ли в ответе галлюцинации и это обрушило результаты моделей и перестроило лидерборд (1 картинка - старый лидерборд вверху, новый внизу). Вторая картинка это количество галлюцинаций на ответ: красный столбик серьёзные ошибки, они и учитываются, аннулируя результат модели, голубой - незначительные, они не учитываются. Третья картинка полный набор протестированных на данный момент моделей
More from @dempunk
  1. Oct 9, 2026Борт, на котором Путин прилетел с визитом в Туркменистан, на обратном пути, вероятно, не с…
  2. Oct 9, 2026👌
  3. Oct 9, 2026Реально есть россияне (думаю, таких особенно много в Москве), которые не в курсе, что идёт…
  4. Oct 9, 2026Факты: 1) США - крупнейший в мире ЭКСПОРТЕР дизеля. Покупать российский им нахер не упало.…
  5. Oct 9, 2026Миру завдяки слабкості ніколи не буває. Сьогодні в Києві були представники Конгресу США –…
  6. Oct 9, 2026На самом деле это хуйня, потому что он сам подписал закон об "адских санкциях" – у него се…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →