TGViewer
Новости про ИИ от ICAIG Новости про ИИ от ICAIG @icaig_ai · 6 subscribers
Post #162 9
🛡 Разрыв переноса safety-бенчмарков на малые ЯМ

Safety-бенчмарки для больших языковых моделей стали стандартом оценки надёжности ИИ. Но при переносе на малые языковые модели (SLM) исследователи фиксируют рост неоднозначных ответов и разброс оценок: тесты, работающие для LLM, плохо различают реальные риски у компактных систем. Использовать эти бенчмарки как единственный критерий безопасности SLM — значит опираться на шаткую метрику. Либо индустрия разработает отдельные протоколы оценки для малых моделей, либо продолжит переносить LLM-бенчмарки и получать оценки безопасности, которым нельзя доверять.

Полный разбор → https://icaig.net/ru/trend/concept-slm-safety-benchmark-gap

#ИКИИГУ #безопасность
More from @icaig_ai
  1. Sep 8, 2026🏛 Трилемма конституционного покрытия в управлении ИИ Аудит конституций ведущих LLM показа…
  2. Sep 8, 2026🏛 Model Hardware Standard (MHS) для физических ИИ-агентов Anthropic опубликовала research…
  3. Sep 7, 2026🛡 PATE-Forensics: объяснимая deepfake-криминалистика Perception-as-Tool PATE-Forensics ра…
  4. Sep 6, 2026🛡 Прогноз адверсариального захвата популяций LLM-агентов Даже индивидуально калиброванные…
  5. Sep 6, 2026🏛 Картирование управления GPAI в юрисдикциях средних ИИ-держав Картирование норм GPAI в д…
  6. Sep 6, 2026🛡 AISA: LLM-ассистент безопасности дорожного строительства На стройках дорог травмы случа…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →