TGViewer
DataWorkshop - AI & ML DataWorkshop - AI & ML @data_work · 1.88K subscribers
Post #508 481
Ключевые наблюдения:

1️⃣ Падение (временной?) гегемонии OpenAI:
OpenAI долгое время доминировала, а Google, что удивительно, казалось, проспала революцию LLM.

2️⃣ Пробуждение гиганта:
Google наконец наверстала упущенное и в январе 2025 года ярко заявила о себе в числе лидеров (по крайней мере, согласно Arena).

3️⃣ GPT-4o (май 2024), лидер июня с ELO 1287, упал на 13-е место в январе!
Новый лидер (Gemini 2) имеет ELO 1374 – почти на 100 пунктов больше. В мире LLM, где несколько пунктов создают преимущество, это настоящая пропасть.

4️⃣ Открытые модели поймали волну:
Например, Yi и DeepSeek v3 не только сравнялись с лучшими моделями июня, но и превзошли их. Это революция!

5️⃣ DeepSeek v3 – это не только высокое качество, но и доказательство того, что мощные модели можно тренировать дешево и эффективно.
Миф о бюджетах в сотни миллионов долларов разрушен! Эта модель также дешева и быстра в использовании. Определенно заслуживает отдельного поста.

6️⃣ xAI и Grok:
На сцену вышел новый игрок – Grok от xAI Илона Маска. Сейчас это версия 2, ждем v3 (уже завершена тренировка).

7️⃣ Arena – это не всё!
Помни, что Arena – это общий рейтинг. В наших внутренних тестах, основанных на реальных бизнес-задачах, рейтинги часто выглядят (немного) иначе. Например, Claude 3.5 Sonnet, который отлично справляется на практике (часто в ТОП-3) и хорошо понимает русский, польский и другие языки, в Arena занимает более низкие позиции.

Рынок LLM развивается с головокружительной скоростью.

Что ты думаешь? Ставь реакцию, если хочешь больше 🔥

P.S. Практический курс по LLM!
Хочешь научиться у меня практическому применению LLM, контролировать входные и выходные данные и строить надежные системы? Следи, скоро сообщу как можно будет записаться.

#llm
@data_work
  • 🔥 17
More from @data_work
  1. Jul 16, 2025Помнишь, как прятали невидимые команды (prompt injection) в статьи на arXiv, чтобы влиять…
  2. Jul 14, 2025👆👆👆 Исследователи из 14 университетов (в том числе ведущие учреждения!) начали “взламыв…
  3. Jul 14, 2025Думаешь, что схитришь, поручая ИИ читать 100-страничные отчеты? Что может пойти не так, пр…
  4. Apr 7, 2025👆👆👆 (часть 1) Теперь конкретно, по моделям: 1️⃣ Llama 4 Scout: Это «младшая» версия с 1…
  5. Apr 7, 2025🚨 Вышла Llama 4 — проверил лично и делюсь впечатлениями! 🔥 TLDR: Давно ждал Llama 4 — и…
  6. Apr 6, 2025Закончился первый поток курса "Практический LLM". В нём прежде всего уделяется больше вним…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →