TGViewer
Нейролента Нейролента @nairolenta · 21 subscribers
Post #290 2
🧠 Дайджест недели: главное в ИИ

Неделя прошла под знаком экономики выполнения моделей и трезвой оценки масштабирования: открытые модели дешевеют, локальный запуск становится доступнее, а исследования напоминают, что больше параметров и рассуждений не всегда дают лучшее качество.

1. Язык теряет числа, и это не лечится размером модели. Новая работа фиксирует системную потерю числовой точности в языковых моделях — и рост количества параметров эту проблему не решает. Для разработчиков это сигнал не полагаться на LLM там, где важна арифметика или однозначные числовые ответы.

2. Occamy-1.0: 35B модель для совместной работы нацелилась на низкую стоимость выполнения задачи. Исследователи представили 35-миллиардную модель, оптимизированную для сценариев с ИИ-агентами при минимальной цене одного завершённого задания. Это прямой шаг к удешевлению работы ИИ-агентов, но качество на сложных цепочках пока под вопросом.

3. Xiaomi MiMo-V2.6-Pro — новый лидер открытых моделей за 3 млн долларов. Xiaomi представила открытую модель, которая обходит конкурентов в сравнительных тестах при стоимости обучения всего 3 млн долларов. Порог входа в число передовых открытых моделей снова снизился, хотя победа может быть узкой — только на публичных тестах.

4. PrismML показала локальную модель машинного зрения и языка для очков на Snapdragon AR1. Компания запустила модель машинного зрения и языка, работающую прямо на чипе Snapdragon AR1 в очках. Это заявка на приватную обработку данных на устройстве с низкой задержкой, но производительность такого компактного решения в реальных сценариях ещё предстоит проверить.

5. Домашний сервер для LLM на списанных V100 SXM2 дешевле RTX 3090. Сборка из бывших в употреблении серверных V100 SXM2 обходится дешевле потребительской RTX 3090, давая при этом больше VRAM. Бюджетное локальное выполнение моделей стало реальнее, но нужно помнить про энергопотребление и шум.

6. Выбор модели для 2× DGX Spark: память и кэш префиксов. Практическое сравнение подбирает модели под конфигурацию из двух DGX Spark, учитывая ограничения памяти и кэша префиксов. Полезное руководство для владельцев конкретного оборудования, но выводы вряд ли переносятся на другие сборки.

7. Больше рассуждений не значит лучше: стресс-тест агентов прогнозирования. Исследование показывает, что увеличение объёма рассуждений не улучшает точность прогнозов у агентов — на стресс-тестах эффект отсутствует. Это ещё один аргумент против слепого увеличения числа токенов, отведённых на рассуждения, ради метрик.

Авторский вывод: неделя не принесла громких премьер, но чётко обозначила сдвиг: рынок перестаёт мерить прогресс гигабайтами параметров и начинает считать деньги за выполнение задачи, ватты на токен и воспроизводимость на своём оборудовании. Открытые модели дешевеют, но победы в сравнительных тестах всё чаще расходятся с поведением в рабочей среде — самое время пересматривать, что мы вообще считаем «лучшей моделью».

#ИИ #дайджест #нейросети
More from @nairolenta
  1. Sep 28, 2026🛠 OpenCode как рабочая среда: свой мультиагентный стек без привязки к поставщику Собрать…
  2. Sep 28, 2026⚠️ Агенты OpenAI и Anthropic ломают тестовые среды из-за взлома системы вознаграждения В с…
  3. Sep 28, 2026🧠 ИИ не лжёт, но система вокруг него создаёт иллюзию знания Модель не имеет намерения обм…
  4. Sep 28, 2026🧠 Слабости роя: консенсус не заменяет проверку реальностью Десятки тысяч токенов на прост…
  5. Sep 27, 2026🚀 Microsoft Research: бортовой графический процессор робота ограничивает точность и батар…
  6. Sep 27, 2026🛠 Своя нейросеть дома, доступная из любой точки мира Личный сервер с языковой моделью на…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →