TGViewer
Channel Public Channel
Machinelearning

Machinelearning

@ai_machinelearning_big_data

Погружаемся в машинное обучение и Data Science

Показываем как запускать любые LLm на пальцах.

По всем вопросам - @haarrp

@itchannels_telegram -🔥best channels

Реестр РКН: clck.ru/3Fmqri
Subscribers
279K
Photos
5.5K
Videos
1.3K
Links
5.8K

Showing posts older than #10864 · Back to latest

Older Posts 14 shown
Post #10863 20.3K
Главный учёный OpenAI призвал притормозить гонку ИИ

Якуб Пахоцкий заявил, что развитие моделей требует предельной осторожности. По его мнению, гонка любой ценой выглядит абсурдной, если осознать масштаб рисков.

Он предлагает согласованно замедлять разработку, когда безопасность не успевает за возможностями моделей, и сделать международную координацию приоритетом для правительств. Об этом он написал в эссе An Alien Mind.

Автор исходного поста возражает: односторонняя пауза американских лабораторий может дать Китаю преимущество. Он считает, что остановить технологическую гонку уже не получится.
  • 🤣 108
  • 🤔 58
  • 👍 41
  • ⚡ 7
  • ❤ 5
  • 😁 3
  • 🥱 3
  • 😐 3
  • 👨‍💻 2
  • 👌 1
  • 💯 1
Post #10857 20.7K
Что общего у йогурта на полке, нейросетей и квантовых вычислений?

Все это встречается в задачах MAGNIT TECH - IT-команды крупнейшего ритейлера страны «Магнита». Здесь прогнозируют спрос, автоматизируют поставки, разрабатывают компьютерное зрение, а сейчас и вовсе исследуют потенциал квантовых вычислений вместе с Росатомом. В работе - более 400 IT-проектов и продуктов. И это не предел! В духе главного слогана компании Без_предела.

С 6 по 8 сентября команда проводит в Суздале tech-тур для IT-блогеров и своих топ-специалистов. Среди участников - Алексей Голобурдин, Сергей Калюжный, Никита Соболев, Алексей Гладков и Антон Кулинский.

В программе - встречи с экспертами, обсуждение GenAI, роботизации складов и инженерных задач ритейла: как рассчитать поставки, управлять ассортиментом и обеспечить работу тысяч магазинов.

Между техническими обсуждениями - прогулки по Суздалю, знакомство с городом и полет на воздушном шаре. Однозначно лайк.
  • 👍 48
  • 🔥 30
  • 🤩 10
  • ❤ 5
  • 👏 4
  • 😁 4
  • 🥱 3
  • 🤬 2
  • 😍 2
  • 🗿 2
Post #10856 22.7K
🥊 Роботы Unitree провели бой без управления человеком

За их действия отвечает UnifoLM-X2-1.0 - модель мира, которая прогнозирует развитие ситуации и планирует движения прямо во время боя.

По заявлению Unitree, роботы самостоятельно реагируют на противника и корректируют свои действия в реальном времени. Компания называет это первым полностью автономным боем гуманоидов под управлением модели мира.

@ai_machinelearning_big_data

#Unitree #robots
  • 🤩 102
  • 👍 85
  • 👏 32
  • 🤔 19
  • ❤ 7
  • 🔥 5
  • 😁 4
  • 💅 1
Post #10855 21.9K
⚡️ Tencent обновила Hy4 Preview

Пользователи жаловались, что модель слишком долго рассуждает и повторно проверяет ответы в сложных задачах. Команда оптимизировала этот процесс.

По данным Tencent, обновлённая версия:

* делает меньше промежуточных шагов
* расходует меньше входных и выходных токенов
* сохраняет прежнее качество выполнения задач
* быстрее справляется со сложными агентными сценариями

Результаты проверили внутренними бенчмарками и оценкой людей. Обновление уже доступно всем пользователям WorkBuddy.

Hy4 Preview - открытая MoE-модель на 770 млрд параметров, из которых 49 млрд активируются при обработке токена. Контекст - до 1 млн токенов.

https://workbuddy.ai

https://github.com/Tencent-Hunyuan/Hy4-preview
  • ⚡ 52
  • 👍 25
  • ❤ 8
  • 🔥 5
  • 👏 4
  • 🗿 1
Post #10852 22.8K
✔️ Китайская Ханьсюй показала архитектуру инференса на магнитной памяти

Компания, которую в Китае называют первой отечественной MRAM-компанией магнитных вычислений, представила два архитектурных уровня для инференса - uHBM и uLPU.

Ханьсюй предлагает держать веса целевой модели постоянно в массиве в массиве энергонезависимой MRAM - матрично-векторные операции выполняются на том же кристалле, а наружу идут только векторы активаций, которые заметно меньше.

Магниторезистивная память хранит бит не зарядом, как обычная память, а направлением намагниченности.

В ней ячейка - это магнитный туннельный переход: два ферромагнитных слоя, разделённые тончайшим изолятором.

Когда намагниченность слоёв сонаправлена, сопротивление низкое, когда противоположна - высокое, и по нему считывается ноль или единица.

У MRAM почти нулевой ток утечки, скорость переключения наносекундная, а ресурс перезаписи практически неограниченный в отличие от флеш-памяти.


uHBM - это кристалл вычислительной памяти на MRAM, работающий в паре с GPU или NPU через UCIe, LPDDR5X или GDDR7.

uLPU - инференс-чип, построенный поверх uHBM.

Заявленные расчётные показатели первого поколения uHBM - 24 ТБ/с внутрикристальной полосы на чтение и цель выше 2000 токенов в секунду при декодировании мультимодальной модели на 4 млрд параметров.

Из реальных прототипов есть верификационный чип SpinPU-ED01 со 120 банками MRAM, который прошёл независимую проверку и отработал 24 часа в стабильном режиме.

Сроков, техпроцесса и цен компания не называет, но декларирует планы от кристалла до модуля, 2U-лотка и стойки.


@ai_machinelearning_big_data

#news #ai #ml
  • 👍 75
  • 🔥 43
  • 🤔 40
  • ❤ 11
  • 👏 4
  • ⚡ 2
  • 😁 1
Post #10851 33.1K
🖥 Дженсен Хуанг заявил, что с выходом GPT-6 Astra «AGI уже наступил»

Глава Nvidia сообщил, что модель обучалась на инфраструктуре с более чем 100 тысячами Grace Blackwell, объединёнными через NVLink. Путь от появления ChatGPT до Astra занял около четырёх лет.

Вскоре к инфраструктуре добавят ещё 400 тысяч ускорителей, и связывает дальнейшее масштабирование с возможным движением к ASI и рекурсивному самосовершенствованию AI-систем.

https://x.com/JensenHuang/status/2096700264569090384

@ai_machinelearning_big_data

#openai #agi #chatgpt
  • 😁 174
  • 🔥 62
  • 🤔 55
  • ❤ 19
  • 🤣 18
  • 🥱 11
  • 👍 9
  • 👏 8
  • 👻 6
  • 🗿 5
  • 🎅 2
Post #10850 26.3K
✔️ Google DeepMind выпустила метеорологическую модель WeatherNext 3

WeatherNext 3 - глобальная модель прогноза погоды на архитектуре Functional Generative Network.

По независимым замерам сервиса Brightband, это самая точная глобальная модель погоды на сегодня.


В третьей версии отказались от тяжелых физических симуляций численного прогноза и модель напрямую обрабатывает потоковые мозаики с геостационарных спутников и показания наземных метеостанций.

Это позволило сократить цикл генерации нового прогноза до одного часа, а пространственное разрешение температуры и влажности повысить до сетки 5 × 5 км, что в пять раз детальнее чем у WeatherNext 2 с её сеткой в 25 километров.

Существенный прогресс достигнут и в моделировании осадков - обучение на спутниковых радарах и массивах NASA IMERG снизило вероятностную ошибку на величину до 60%, что дает модели точнее очерчивать границы штормовых фронтов без размытия.

Отдельно добавили величины для возобновляемой энергетики: скорость ветра на ста метрах (примерно на высоте турбины), плюс облачность и уровень солнечной радиации.

Данные доступны через BigQuery, Earth Engine и Cloud Storage. В Google Search, приложении Gemini, Google Maps и Weather API модель уже подключена.


@ai_machinelearning_big_data

#news #ai #ml
  • ❤ 82
  • 👍 73
  • 🔥 43
  • 👏 15
  • 🎉 9
  • 💯 5
  • 🤩 1
  • 🐳 1
  • 🤝 1
Post #10846 23.4K
✔️ OpenAI открыла доступ к GPT-6 Astra

Модель стала доступна подписчикам Pro, Enterprise и Business Premium - сразу в ChatGPT Work, в среде разработки Codex и через API.

Пользователям Plus и обычного Business её раскатают в течение нескольких дней.
OpenAI в X

✔️ Агенты Claude за 11 дней формализовали знаменитую теорему Ферма

За основу взята упрощенная версия доказательства Уайлса от Дармона, Даймонда и Тейлора. Сгенерировано 13 млн строк кода и 30 300 промежуточных теорем, из которых в финальное доказательство вошли 29 500. Результат проверил компилятор Lean и подтвердил математик Кевин Баззард, ведущий проект формализации этой теоремы с 2024 года.

Первые попытки проваливались. Агенты теряли состояние проекта и переставали координироваться, их неудачные заходы дали около 7% строк итогового кода. Сработало после перехода на платформу Prove2Me, которая держит граф теорем и позволяет агентам работать параллельно, смягчая деградацию памяти на длинной дистанции.

Полностью автономным процесс не был - человек изредка давал указания верхнего уровня. Смысл автоматизации в том, что люди-рецензенты уже не успевают проверять поток доказательств, а формализация снимает с них часть нагрузки.
anthropic.com

✔️ NVIDIA сделала роутер, который раскидывает запросы по видеокартам в локальной сети

PAIR (Personal AI Router) - открытый маршрутизатор, объединяющий видеокарты внутри локальной сети под одной точкой входа.

Он сам находит хосты с GeForce RTX, RTX Pro и машины на macOS. При локальном инференсе роутер следит за загрузкой оборудования, свободной видеопамятью и статусом запущенных моделей, а входящие запросы отправляет на наименее занятые узлы. Настраивать кластер руками не нужно.

Приложениям и средам разработки все это видится как один локальный эндпоинт, совместимый с API OpenAI.

Бета-версия доступна для Windows, macOS и Linux.
nvidia.com

✔️ Sakana AI предложила универсальный детектор ИИ-изображений

Японский стартап выпустил Percept-Lens - бенчмарк на 36 млн изображений и метод распознавания синтетики, основанный на связке визуальных энкодеров и линейном классификаторе а основе расстояния Махаланобиса.

Проблема, которую лечит метод - потеря от 20 до 36 процентных пунктов точности у существующих детекторов при смене модели или типа сжатия. Эксперименты Sakana показали, что обычные визуальные представления общего назначения уже содержат сигнал, разделяющий настоящие кадры и сгенерированные, - специально его выучивать не нужно.

На 39 датасетах энкодер PE-Core и метод Mah-NCM дали среднюю точность 94,46%. Причем хватило 219 размеченных опорных изображений, чтобы выйти на 90,89% и обойти существующие решения.
sakana.ai

✔️ Cohere измерила, насколько MCP-инструменты закрывают рабочие задачи

Cohere Labs выложила открытый датасет Agentic Task Ecosystem из 700 тысяч инструментов на базе MCP, собранных со 123 тысяч публичных серверов.

Анализ набора показал, что довести профессиональную задачу от начала до конца без человека способны только 2,6% инструментов. Для 419 профессий из 923 базы ONET не создано вообще ничего. Остальное - микрозадачи и инфраструктура для управления агентами. Лучше всего автоматизация приживается там, где работа и раньше шла через специализированный софт.

Роли делятся по-разному в зависимости от области. В юриспруденции, производстве и продажах агенты забирают рутину, а в ИТ и здравоохранении наоборот - ИИ берет на себя сложную аналитику, оставляя людям базовые процессы.
cohere.com

@ai_machinelearning_big_data

#news #ai #ml
  • 👍 69
  • ❤ 28
  • 🤩 17
  • 🔥 10
  • 👏 6
  • 🤷‍♂ 1
  • 🎉 1
Post #10845 23.4K
🙂 Цену покупки Hugging Face выбрали не случайно

Объявляя о покупке Hugging Face, сооснователь компании Томас Вольф написал:

... особые поздравления тому, кто найдёт отсылки к Hugging Face и Nvidia, спрятанные в цене сделки - 12 930 300 000 долларов.


Разгадывать бросились всем твиттером и первую нашли быстро.

Число 129 303 - это десятичная запись Unicode U+1F917, то есть эмодзи 🤗, который официально так и называется: Hugging Face.

Вольф подтвердил догадку и намекнул, что есть и вторая, связанная с Nvidia. С ней помучались.

Число разобрали на составные части 12, 93 и 03, объясняя, что двенадцать - это цена акции Nvidia на IPO 1999 года, девяносто три - год основания компании, ноль три - три сооснователя: Дженсен Хуанг, Крис Малаховски и Кёртис Прием.

Версия красивая, стройная и неверная.

Правильный ответ подсказал гендиректор Hugging Face Клеман Деланг, отправив комментатору ссылку на реестр названий цветов.

Если записать то же число как шестнадцатеричный код цвета #129303, получится зелёный, цвет Nvidia.

Педантичности ради - официальный зелёный Nvidia это #76B900, оттенок другой. Так что отсылка тут не к точному фирменному цвету бренда, а к зелёному цвету как таковому.


@ai_machinelearning_big_data

#news #ai #ml
  • 🤗 176
  • 🔥 22
  • 🤔 20
  • 👍 17
  • ❤ 14
  • 👏 13
  • 😁 7
  • 🥱 3
  • 🎉 1
Post #10844 27K
⚡️ OpenAI опубликовала подробный гайд по GPT-6 Astra API

В документации разобрали, как правильно использовать новую модель и чем она отличается от предыдущих поколений.

Главные нововведения:

- Async tool calling - Astra может продолжать рассуждать или выполнять другие части задачи, пока внешний tool ещё работает
- Mid-turn steering - инструкции можно менять прямо во время выполнения длинной задачи, не начиная всё заново
- Динамический reasoning - уровень reasoning effort можно повышать или снижать посреди диалога с сохранением prompt cache
- поддержка computer use, Structured Outputs, multi-agent orchestration, programmatic tool calling, persisted reasoning и compaction
- модель лучше держит длинные многошаговые workflows между кодом, браузером и внешними инструментами

OpenAI также отмечает, что Astra часто использует заметно меньше output-токенов для решения той же задачи, поэтому реальная стоимость выполненной задачи может быть ниже, несмотря на более высокую цену одного токена.

Для API:

model: gpt-6-astra

При миграции есть несколько важных изменений:

- reasoning_effort: none больше не поддерживается - рекомендуется начинать с low
- для tool calling нужен Responses API
- temperature, top_p и top_logprobs не поддерживаются
- Astra сильнее реагирует на инструкции из AGENTS.md, skills и других файлов, поэтому их советуют внимательно проверять
- модель может чаще задавать уточняющие вопросы, поэтому для автономных агентов OpenAI отдельно рекомендует явно просить её доводить задачу до конца

Отдельный акцент гайда на агентах: Astra рассчитана уже не только на отдельный ответ, а на длинную работу с инструментами, изменением требований на ходу и несколькими агентами.

https://developers.openai.com/api/docs/guides/latest-model

#chatgpt #OpenAI

@ai_machinelearning_big_data
  • 👍 109
  • ❤ 39
  • 👨‍💻 22
  • 🤔 10
  • 🔥 9
  • 🙉 1
Post #10843 24.5K
DeepSeek готовит гигантский кластер на 160 000 чипов Huawei

По данным Bloomberg, DeepSeek планирует развернуть во Внутренней Монголии не менее 160 000 ускорителей Huawei Ascend 950DT - это может стать одним из крупнейших известных AI-кластеров на китайском железе.

Чипы будут использоваться для запуска моделей DeepSeek. Для обучения компания пока продолжает опираться на Nvidia.

По заявленным характеристикам Ascend 950DT выглядит серьёзно:

- 144 ГБ HBM
- 4 ТБ/с пропускной способности памяти

Для сравнения, Nvidia H200 предлагает:

- 141 ГБ HBM
- 4,8 ТБ/с

По памяти Huawei уже очень близка к H200, хотя это не означает сопоставимой реальной производительности. Bloomberg ставит Ascend 950DT примерно на уровень поколения Nvidia Hopper, включая H100 и H200.

https://www.bloomberg.com/news/articles/2026-09-04/deepseek-plans-big-huawei-ai-chip-order-to-power-new-data-center

@ai_machinelearning_big_data

#DeepSeek #ai #ml
  • 🔥 168
  • ❤ 36
  • 🤔 35
  • 👏 23
  • 👍 19
  • 🥱 4
  • 🗿 2
Post #10842 24.8K
🧠 GLM‑5.3: модель с открытыми весами для агентских и кодовых задач теперь в MWS Cloud

MWS Cloud первой в России развернула GLM‑5.3 на своей инфраструктуре. Модель доступна в MWS GPT Model Hub, все вычисления и данные — строго в российском контуре, тариф не вырос относительно GLM‑5.2. Можно строить агентные системы и пайплайны без риска утечки промптов и данных за рубеж.

Ключевые возможности:
— генерация, рефакторинг и анализ кода;
— поиск ошибок;
— работа с репозиториями;
— автоматизация многошаговых процессов;
— сборка ИИ‑агентов под конкретные домены.

По бенчмаркам модель стабильно обходит Claude Opus 4.8 в задачах программирования, сопоставима с Claude Fable 5 и GPT‑5.6 Sol. В Design Arena — топ‑3 в общем зачёте и второе место среди моделей с открытыми весами: это хороший сигнал для задач, где важна генерация UI/UX‑элементов.

@ai_machinelearning_big_data
  • 👍 76
  • ❤ 20
  • 👏 15
  • 🤣 13
  • 🔥 12
  • 🤓 8
  • 😁 7
  • 🎉 6
  • 🙊 1
Post #10841 21.2K
✔️ Минторг США вернул Anthropic в круг доверенных партнеров

Министр торговли Говард Латник заявил Axios, что власти снова считают Anthropic надежным партнером, так как компания выполнила требования и, по его словам, вернулась на правильную сторону.

Это разворот в затяжном конфликте. Пентагон пытался внести Anthropic в черный список угроз цепочкам поставок, но федеральный суд это решение заблокировал.

Отношения нормализовал сооснователь Anthropic Том Браун - он провел серию закрытых консультаций с Латником и кибердиректором Шоном Кэрнкроссом.

На встрече министров стран G20 глава Минторга лично представил Брауна международной аудитории, а сам Браун публично поддержал курс властей США на форсированное строительство дата-центров, энергетических мощностей и вычислительной инфраструктуры. 
axios.com

✔️ Основательница AI Frontiers ушла из Microsoft на фоне реорганизации

Microsoft перевела лабораторию AI Frontiers из Microsoft Research в подразделение Microsoft AI, которым руководит Мустафа Сулейман. Одновременно корпорацию покинула Эдже Камар, основавшая AI Frontiers и проработавшая в Microsoft 16 лет.

Лабораторию создали осенью 2023 года под мультиагентные системы и компактные модели. Оттуда вышли семейство Phi и фреймворк AutoGen, на котором построен Microsoft Agent Framework, а также проекты FARA, Magentic-One и Magentic-UI.

В новой структуре команда продолжит заниматься прикладными агентами и усилит направление, которое Сулейман называет гуманистическим суперинтеллектом, - ИИ-системы, ориентированные на человека и подконтрольные оператору.
Microsoft AI в X

✔️ Inworld выпустила синтезатор речи, который возглавил Voice Arena

Realtime TTS-2 генерирует речь в реальном времени и поддерживает больше 100 языков, включая русский.

Модель подстраивается под собеседника: считывает ритм, тембр и эмоциональное состояние по ходу разговора и меняет собственную речь.

Стилем можно управлять текстом - попросить говорить шепотом или звучать уставшим. Она умеет вставлять вздохи, смех и дыхание, а также клонировать голос, сохраняя тембр при переходе на другой язык.

В слепых тестах Voice Arena от Artificial Analysis модель заняла первое место, обойдя Cartesia Sonic 3.6 по естественности произношения, расстановке пауз и реалистичности интонаций.

Доступ открыт через Inworld Realtime API, тарифы - от 25 до 1500 долларов в месяц.
InworldAI в X

✔️ Агенты Cursor научатся собирать приложения для iOS и Mac

Namespace договорилась с Cursor о запуске агентов в своей облачной инфраструктуре. Логику агентов по-прежнему ведет Cursor, а правка репозиториев, запуск команд, сборка и тесты уходит в изолированные среды Devboxes.

Они разворачиваются как полноценные окружения с доступом к базам данных, коду и сети. Кроме Linux поддерживаются инстансы macOS на процессорах Apple M5, поэтому агент может собирать приложения для iOS и Mac. Windows обещают позже.

Из коробки идут кэширование слоев Docker, удаленная сборка через Bazel, фильтрация исходящего трафика и политики доступа. Раньше Namespace так же подключила свои среды к Devin и Claude Code.
namespace.so

✔️ Alibaba делает среду разработки для умных очков

Qoder Glasses Edition - версия ИИ-среды разработки Qoder для умных очков Qwen и Rokid. Очки работают интерфейсом от первого лица, а считает и работает с кодовой базой десктопный клиент.

Общение с агентом идет по полнодуплексному голосовому каналу, через который можно ставить задачи, узнавать статус сборки и править код. Уведомления показываются карточками с краю поля зрения, а операции подтверждаются голосом или касанием дужки, не останавливая фоновые процессы.

Камера нужна для отладки того, что происходит вне экрана: ассистент считывает коды ошибок с мониторов, разбирает индикаторы на серверных стойках и распознает схемы на маркерных досках. Дальше он сопоставляет увиденное с логами и выдает варианты по устранению неполадки.

Продукт в закрытом тестировании, релиз обещают на сентябрьской конференции Apsara. 
Alibaba Cloud в WeChat


@ai_machinelearning_big_data

#news #ai #ml
  • 👍 80
  • ❤ 20
  • 👏 16
  • 🎉 12
  • 🔥 10
  • 🤓 5
  • 😁 2
Post #10840 21.3K
✔️ Одна модель заменила каскад из 15+ моделей, объединив генерацию кандидатов и ранжирование

Sumit Kumar, Senior ML Engineer в Meta* и автор блога о рекомендательных системах, поделился новым тех репортом Яндекса Sona. В техническом отчёте команда подробно разбирает архитектуру и результаты в проде.

🟡 А 19 сентября на Practical ML Conf об этом расскажет Николай Савушкин. Можно будет узнать больше про подход и задать вопросы напрямую.


🟡 Ещё один доклад о моделях, которые решают задачу не в один шаг, представит Данил Кашин, руководитель команды претрейна VLM в Яндекс R&D. Он разберёт Agentic Vision: такие модели сначала строят план, затем при необходимости запрашивают дополнительную визуальную информацию, подключают OCR, детекторы, поиск или код и корректируют решение по промежуточным результатам.


Послушать оба доклада можно будет офлайн в Москве или онлайн. Регистрация на Practical ML Conf уже открыта.


* Meta признана экстремистской организацией, её деятельность запрещена в РФ

Реклама. ООО "ЯНДЕКС". ИНН: 7736207543. Erid: 2VtzqvGyx6w
  • 🥱 55
  • 🤝 46
  • 👍 28
  • ❤ 14
  • 🤓 14
  • 🤣 13
  • 🔥 5
  • 😁 4
  • 🗿 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →