🧠 Дайджест недели: главное в ИИ
Неделя прошла под знаком экономики выполнения моделей и трезвой оценки масштабирования: открытые модели дешевеют, локальный запуск становится доступнее, а исследования напоминают, что больше параметров и рассуждений не всегда дают лучшее качество.
1. Язык теряет числа, и это не лечится размером модели. Новая работа фиксирует системную потерю числовой точности в языковых моделях — и рост количества параметров эту проблему не решает. Для разработчиков это сигнал не полагаться на LLM там, где важна арифметика или однозначные числовые ответы.
2. Occamy-1.0: 35B модель для совместной работы нацелилась на низкую стоимость выполнения задачи. Исследователи представили 35-миллиардную модель, оптимизированную для сценариев с ИИ-агентами при минимальной цене одного завершённого задания. Это прямой шаг к удешевлению работы ИИ-агентов, но качество на сложных цепочках пока под вопросом.
3. Xiaomi MiMo-V2.6-Pro — новый лидер открытых моделей за 3 млн долларов. Xiaomi представила открытую модель, которая обходит конкурентов в сравнительных тестах при стоимости обучения всего 3 млн долларов. Порог входа в число передовых открытых моделей снова снизился, хотя победа может быть узкой — только на публичных тестах.
4. PrismML показала локальную модель машинного зрения и языка для очков на Snapdragon AR1. Компания запустила модель машинного зрения и языка, работающую прямо на чипе Snapdragon AR1 в очках. Это заявка на приватную обработку данных на устройстве с низкой задержкой, но производительность такого компактного решения в реальных сценариях ещё предстоит проверить.
5. Домашний сервер для LLM на списанных V100 SXM2 дешевле RTX 3090. Сборка из бывших в употреблении серверных V100 SXM2 обходится дешевле потребительской RTX 3090, давая при этом больше VRAM. Бюджетное локальное выполнение моделей стало реальнее, но нужно помнить про энергопотребление и шум.
6. Выбор модели для 2× DGX Spark: память и кэш префиксов. Практическое сравнение подбирает модели под конфигурацию из двух DGX Spark, учитывая ограничения памяти и кэша префиксов. Полезное руководство для владельцев конкретного оборудования, но выводы вряд ли переносятся на другие сборки.
7. Больше рассуждений не значит лучше: стресс-тест агентов прогнозирования. Исследование показывает, что увеличение объёма рассуждений не улучшает точность прогнозов у агентов — на стресс-тестах эффект отсутствует. Это ещё один аргумент против слепого увеличения числа токенов, отведённых на рассуждения, ради метрик.
Авторский вывод: неделя не принесла громких премьер, но чётко обозначила сдвиг: рынок перестаёт мерить прогресс гигабайтами параметров и начинает считать деньги за выполнение задачи, ватты на токен и воспроизводимость на своём оборудовании. Открытые модели дешевеют, но победы в сравнительных тестах всё чаще расходятся с поведением в рабочей среде — самое время пересматривать, что мы вообще считаем «лучшей моделью».
#ИИ #дайджест #нейросети
Post #290
2