TGViewer
AI.Insaf AI.Insaf @ai_tablet · 1.19K subscribers
Post #163 6.27K
Интересный обзор архитектур open-source LLM за 2025г The Big LLM Architecture Comparison

Забавно, как каждая из моделей по-своему комбинирует уже известные подходы, придуманные еще в прошлых года, при этом получая разнонаправленное влияние на метрики (Qwen3 почти не отличается по GPT-OSS. Тут детальнее про GPT-OSS). Например:
• Переход от ванильного Multi-Head Attention к Grouped-Query Attention (GQA), который появился ещё в 2023 году
• Attention Bias, который не использовали со времён GPT-2 и Attention Sinks обучаемый параметр для каждого блока внимания, которые применили в gpt-oss, хотя придумали его ещё в 2023 году
• NoPE (No Positional Encoding) — интересная идея, но её пока применили только в одной модели из обзора
• MoE (mixture of experts) - тоже известная больше года история

За деталями рекомендую к статье. Интересно на каких данных и как именно обучали модели. Но этой информацией зачастую делятся очень верхнеуровнево
  • 🔥 10
  • 👍 6
  • ❤ 4
More from @ai_tablet
  1. Sep 29, 2026Хороший друг Никита Зелинский со школой ml inside запускает курс по AI-агентам для продакт…
  2. Sep 21, 2026Agents Trust Tools Too Much (arxiv) Почему-то агенты слишком доверяют вызовам тулов как ед…
  3. Sep 20, 2026Measuring LLM Sycophancy under Sustained Multi-Turn Pressure (arxiv) Сложное название для…
  4. Sep 12, 2026Post #252
  5. Sep 9, 2026MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use (arxiv) Забавная статья, в ко…
  6. Sep 7, 2026Feedback That Backfires arxiv Контринтуитивный вывод в статье. Дефакто в harness-решениях…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →