TGViewer
демшиза ии киберпанк демшиза ии киберпанк @dempunk · 57 subscribers
Post #22556 5
И опять про бенчмарки. Это самое крутое, что было в истории человечества. Создана лаборатория для биологических, химических и материаловедческих исследований под управлением LLM, и в ней запущен бенчмарк SciUniverse, который сравнил умения моделей вести исследование – выяснилось, что с теорией с (разработкой экспериментов) у них всё хорошо, а вот в лаборантской деятельности они лажают, что и отражается на результатах бенчмарка. Мне осталось неясно только одно, почему использовался уровень усилий xhigh, а не max, по опыту других бенчмарков, можно предположить, что у моделей это самый лажовый уровень
More from @dempunk
  1. Sep 26, 2026СБУ разом із іншими складовими Сил оборони уразила Азовський оптико-механічний завод та Іл…
  2. Sep 26, 2026Прогноз от Andon Labs: человеческий уровень будет превзойдён к концу года
  3. Sep 26, 2026Blueprint-Bench 2 - бенчмарк на визуально-пространственное мышление моделей (модель должна…
  4. Sep 26, 2026Ukrainian military successes 🇺🇦 continue along a front spanning nearly 90 km, between Bo…
  5. Sep 26, 2026Вночі по Азову Ростовської області застосували реактивні БПЛА або крилаті ракети. Експерти…
  6. Sep 26, 2026😌 Карта активности украинских БПЛА на территории РФ по состоянию на утро 26 сентября. Ата…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →