TGViewer
Channel ✦ Verified Channel
Data Secrets

Data Secrets

@data_secrets

Главный по машинному обучению

Сотрудничество: @veron_28

РКН: clck.ru/3FY3GN
Subscribers
94.1K
Photos
7.4K
Videos
869
Links
3.4K

Showing posts older than #9779 · Back to latest

Older Posts 15 shown
Post #9778 27.2K
Hugging Face выпустили опенсорсную робо-утку 🦆

https://pollen-robotics.com/microduck/

Стоит малютка 399 долларов. Умеет ходить, поднимать предметы, вставать после падения, кувыркаться и, внезапно, кататься на роликах.

Но основная фишка в том, что утку можно самостоятельно учить новым трюкам с помощью RL: просто обучаете свою политику в симуляции MuJoCo (можно прямо в Hugging Face Jobs или локально), и на утку она переносится без дообучения.

Предзаказ уже открыт. Отличный подарок к Новому Году
  • 🔥 233
  • ❤ 76
  • 👍 23
  • 😁 21
  • 😍 6
  • 🤯 3
  • 🐳 2
  • 🍾 2
  • ⚡ 1
  • 👏 1
  • 🍓 1
Post #9777 21.8K
Nvidia согласилась купить Hugging Face за $12,9 млрд

Сделка пока не окончательная, но она была одной из крупнейших у Nvidia за всю историю.

Годовая выручка Hugging Face оценивается примерно в $150 млн, саму компания во время переговоров оценивали в 13 миллиардов. Nvidia немножко сбросили цену 🗿

Интересно, что ранее Hugging Face отклонила предложение Nvidia об инвестиции в $500 млн, это было в январе. Тогда они заявили, что не хотят одного доминирующего инвестора, который сможет влиять на решения, особенно в лице такого крупного вендора чипов. Видимо, когда речь идет о 13 миллиардах, принципы немного другие 😐
  • 🤯 228
  • 😁 123
  • ❤ 16
  • 👍 10
  • 😢 6
  • 🎄 3
  • 🏆 2
  • 🤔 1
  • 👾 1
Post #9776 21.7K
Data Secrets На OpenRouter появилась таинственная модель Ox Alpha, которая превосходит Sol и Fable на кодинге https://openrouter.ai/stealth/ox-alpha Никто не знает, кто разработчик, моделька числится как stealth. Что известно: – Контекст 1М токенов. – Мультимодальная.…
Ox Alpha все-таки оказалась GLM-5.3-Flash: состоялся официальный релиз

Веса | Блог

Нативно мультимодальная, заточена под эффективный кодинг и длинные агентные задачи. Контекст 1М.

По метрикам уровень примерно Opus 4.8, кое-где даже лучше. Отличный скор на Automation Bench: 48.8 против 41 у того же Opus 4.8 и 37.2 у GPT-5.6 Terra. При этом это небольшая модель: 320B-A18B.

Модель доступна всем пользователям GLM Coding Plan + в API.

Цена сейчас: $0.075 за млн входных токенов, $0.25 за млн выходных (это со скидкой 50% на Open Router).

P.S. Интерсная деталь архитектуры – гибридное внимание. Z.ai объединили sparse + linear attention, чтобы удерживать точность на длинных контекстах без раздувания вычислительных затрат.
  • 👏 84
  • 👍 35
  • ❤ 27
  • 🔥 7
  • 🤨 3
  • 😁 2
  • 😎 2
  • ❤‍🔥 1
  • ⚡ 1
Post #9775 27.6K
Вышло интервью с Тибо: главой Codex/ChatGPT в OpenAI

Это тот самый парень-инсайдер, который постоянно намекает в X на релизы и объявляет об обнулении лимитов. Возможно, по вырезке из интервью вы его не узнаете, но это он (жизнь в OpenAI немного помотала, и на свою аватарку из X инженер мало похож) 😐

Он выдал мощное заявление: через 2-3 месяца текущий Codex будет казаться примитивным. Агенты на базе следующего поколения моделей OpenAI (Astra) перестанут работать локально, им потребуется облако, в котором будет запускаться гораздо больше параллельных процессов, чем сможет потянуть обычный ноутбук.

При этом скорость агентов существенно вырастет, и то, что сейчас мы называем Ultra Fast (750 токенов в секунду и больше), станет настройкой по умолчанию.

Кроме того, нас ждет еще более плотное слияние Codex и ChatGPT. Будущие модели будут работать из коробки на одном и том же харнессе для кодинга, рисерча, дизайна, поиска и пр. Так что конечная цель – это единое высоко персонализированное приложение Personal AGI, интерфейс которого будет меняться в зависимости от того, чем конкретно вы занимаетесь.

Полное интервью идет 45 минут, посмотреть можно здесь: https://youtu.be/4qjEgPojjzM
  • ❤‍🔥 62
  • ❤ 27
  • 👍 19
  • 🔥 14
  • 🏆 10
  • 😁 8
  • 🤔 7
  • 👏 5
  • 🤗 2
  • 😢 1
Post #9772 22.2K
Data Secrets Архитектура Qwen-4 уже почти здесь Model Scope запустили отсчет до выхода Qwen3.8-Flash-Next. Ее релизнут ровно через сутки, и это будет первая модель, построенная на архитектуре следующего поколения, на которой будет также основан Qwen-4. Пока деталей…
Вышел Qwen-3.8 Flash-Next

Это MoE 125B + 51B N-gram таблица (но активных всего 6B), которая бьет Opus 4.6 Max на 8 из 9 бенчмарков!

Также превосходит Qwen3.8-27B и DeepSeek-V4-Flash. При этом обучение стоило в 9 раз дешевле, чем Qwen3.7-Plus.

Немного про архитектуру. Ключевых новшества всего четыре:

1. Те самые N-gram эмбеддинги aka дешевая память. Это таблица, которая индексируется не по одному токену, а по коротким последовательностям. Модель как бы запоминает типичные локальные комбинации токенов напрямую в виде векторов, а не выучивает их заново на каждом шаге. Потом происходит обычный lookup вместо матричного умножения, поэтому такие эмбеддинги почти не добавляют вычислений на токен, зато сильно увеличивают общую емкость модели.

2. Gated DeltaNet + Qwen Sparse Attention для скорости на длинных контекстах. Модель не запоминает весь контекст целиком, а выбирает небольшие релевантные блоки и работает только с ними. Gated DeltaNet – линейный механизм внимания с гейтами, которые как раз управляют тем, что модель запоминает, а что забывает. Результат: на 1М контекста prefill стал в 7.6 раз быстрее, а decode – в 4.9 раз.

3. Gated Residual connections. Обычные residual-связи просто прокидывают информацию между слоями, а здесь добавлены гейты, которые решают, сколько именно информации пропустить дальше.

4. Оптимизатор Muon вместо классического Adam. Как раз один из факторов, давших 9-кратную экономию на обучении.

В итоге обучение дешевле, параметров больше, а вычислений на токен меньше. Очередное достижение китайского опенсорса.

Модель | Репорт | Блог
  • ❤ 153
  • 🔥 83
  • 👍 23
  • 😍 5
  • 🤩 4
  • 😎 3
  • 😁 1
  • 👌 1
  • 🤝 1
Post #9770 20.4K
Data Secrets В OpenAI новая волна уходов. За последний месяц компанию покинули аж четыре очень заметных менеджера. — Хлоя Бакалар, отвечала за ИИ-этику. Проработала в стартапе всего год, но была единственным штатным специалистом по этике в компании, то есть занимала…
В OpenAI еще минус один

Глава подразделения дата-центров Крис Малон покинул стартап прямо перед IPO.

Итого с начала года свои должности покинули (это только руководители):

- Руководитель направления дата-центров
- Коммерческий директор
- Операционный директор
- Директор по коммуникациям
- Руководитель по робототехнике
- Директор по маркетингу
- Руководитель научного направления
- Руководитель Sora
- Технический директор B2B
- Генеральный директор по внедрению AGI
- Руководитель отдела оценки рисков
- Главный футуролог
- Руководитель отдела безопасности
- Ведущий специалист по этике ИИ (единственный в компании)
  • 🫡 14
  • 🤔 11
  • ❤ 7
  • 😁 5
  • 🕊 5
  • 🤯 1
  • 🤝 1
  • 🤗 1
Post #9769 23.3K
FigureAI собирают самый гигантский и разнообразный в мире датасет для обучения роботов

https://www.figure.ai/news/introducing-index

Оказывается, стартап 4 месяца в закрытом режиме тестировал приложение Index, через которое обычные люди записывают видео повседневных задач и получают за это деньги.

За это время компания заплатила пользователям уже 15 миллионов долларов, приложение скачали более 264 000 в 100+ странах. WAU – примерно 44к человек.

Собрано на данный момент более 15 миллионов роликов, каждую секунду приложение обрабатывает 30 минут видео. Это почти 5 лет человеческого труда в день. На этих данных уже обучают Helix, и в блоге написано, что разработчики «наблюдают существенные результаты в генерализации».

Figure заявляют, что планируют нарастить сбор еще в 100 раз и потратить >$1 млрд на данные и вычисления в следующем году. Масштаб!

Само приложение уже есть в AppStore и GooglePlay
  • ❤ 98
  • 👍 35
  • 🤯 20
  • 🔥 10
  • 😁 3
  • 🤔 2
  • 😎 2
  • 😍 1
  • 🏆 1
Post #9767 21.8K
Apple выпустили M6 и M5 Ultra

Цены сильно выросли, но приросты в метриках есть.

M6 – базовый чип, 12-core CPU, 12-core GPU, сдвоенный 16-core Neural Engine, до 32 ГБ unified memory, до 170 ГБ/с bandwidth. По цифрам Apple до 4.8x быстрее prompt processing, чем на M4. При 32 ГБ комфортно живут модели 7B–14B, квантованные 27-32B (Gemma 3, Qwen) тоже влезают. Mac mini с M6 от $899.

M5 Pro (тоже в Mac mini, старшая конфигурация) – до 18-core CPU, 20-core GPU, до 64 ГБ памяти, 307 ГБ/с. Норм для квантованных 70B-моделей (Llama 3 70B в 4-bit – это ~40 ГБ). Цена от $1699.

M5 Ultra (Mac Studio) – уже совсем другая весовая категория: до 36-core CPU, 80-core GPU, до 512 ГБ памяти, 1.2 ТБ/с bandwidth. Позволяет держать в памяти хорошие крупные модели, включая тяжёлые MoE. От $5499, а топовая конфигурация – за $18 000.

Так что полноценные 70B locally все-таки пока не выйдет, если вы случайно не Скрудж Макдак
  • 😁 94
  • ❤ 39
  • 🔥 18
  • 👍 12
  • ☃ 2
  • 😍 2
  • 🍓 2
Post #9766 30.9K
Нейросеть в роли ИБ-специалиста: GigaChat 3.5 Ultra успешно сдал профессиональный экзамен

Модель ответила на 250 вопросов итогового теста программы «Информационная безопасность», превысив проходной балл на 14%. Знания проверяли специалисты УЦ «Информзащита» и департамента кибербезопасности Сбербанка.

Нейросеть обучали на массиве из более чем 300 тыс. документов, среди которых:
• лучшие практики ИБ и законодательство
• описания уязвимостей
• тактики и техники кибератак

Такой уровень знаний делает GigaChat 3.5 Ultra инструментом для реальных сценариев. Бизнесу без штатного безопасника он послужит первой линией консультаций по защите данных + профильным специалистам поможет в подготовке документов и управлении инцидентами.
  • 😁 174
  • 🗿 35
  • ✍ 24
  • 🔥 21
  • 🫡 6
  • 😎 3
  • 🎉 2
  • 🤔 1
  • 😢 1
  • 🍓 1
Post #9763 21K
Data Secrets ⚡️ OpenAI сделали собственный чип Архитектура разработана с нуля вместе с Broadcom, а назвали чип Jalapeño. Предназначен халапеньо специально для инференса LLM и соответсвующих систем а-ля Codex. Сейчас чип проходит стадию тестирования, но ранние внутренние…
Новые замеры собственного чипа OpenAI

https://openai.com/index/jalapeno-first-results/

Заявляют, что Халапеньо превосходит Nvidia GB200 и GB300 по скорости и эффективности. Для высоко интерактивных нагрузок говорят о производительности в 2,1–4,1 раза выше.

Начать использовать планируют уже в конце 2026
  • 🤯 107
  • ❤ 27
  • ⚡ 9
  • 🤩 5
  • 😁 3
  • 🕊 3
  • ☃ 2
  • 🤔 2
  • 🎉 2
Post #9762 20.6K
Архитектура Qwen-4 уже почти здесь

Model Scope запустили отсчет до выхода Qwen3.8-Flash-Next. Ее релизнут ровно через сутки, и это будет первая модель, построенная на архитектуре следующего поколения, на которой будет также основан Qwen-4.

Пока деталей нет, пишут только, что изменения затронут внимание, residual-связи, эмбеддинг-слои и оптимизацию.

https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next/summary
  • 🔥 147
  • ❤ 36
  • 😍 11
  • 👍 4
  • 🤔 3
  • 💯 2
  • 😁 1
  • 🎉 1
Post #9760 22.9K
Хайп зашел слишком далеко: прокуратура Алабамы расследует инцидент со взломом Hugging Face

Генпрокурор штата уже выдал OpenAI повестку, в которой запрошены все документы, данные и информацию о взломе в июле, включая данные всех сотрудников OpenAI, причастных к инциденту + материалы об обнаружении компанией взлома + данные о мерах безопасности во время тестирования моделей.

В рамках расследования могут доказать, что OpenAI нарушила Deceptive Trade Practices Act штата, местный закон о защите прав потребителей. Вследствие этого генпрокурор может даже добиться временного или постоянного запрета на определенную деятельность компании.
  • 😁 77
  • 👍 35
  • ❤ 18
  • 🤯 6
  • 🗿 5
  • 🔥 4
  • 😍 3
  • 🕊 2
  • 💯 2
Post #9759 22.8K
Кадры с World Humanoid Robot Games в Пекине можно разбирать на мемы бесконечно

Вес на видео 16кг, если что 💪
  • 😁 343
  • 🔥 33
  • 👍 14
  • 🏆 5
  • ❤ 2
  • ☃ 2
  • ⚡ 2
  • 😭 2
  • 👏 1
  • 👌 1
  • 💯 1
Post #9758 19.9K
У российских сайтов массово отзывают сертификаты безопасности. Разбираемся, что это значит, и как справляться.

Не так давно вступили в силу новые правила международного консорциума CA/Browser Forum. Это организация, которая устанавливает стандарты для всех удостоверяющих центров в мире.

На фоне этого часть сертификатов у российских сайтов начали отзывать, и разработчики стали переходить на российские сертификаты – их выдает Национальный удостоверяющий центр. Но проблема не решилась: после этого в большинстве браузеров сайты перестали открываться.

Дело в том, что когда браузер открывает защищенный сайт (https), он проверяет сертификат и выпустивший его удостоверяющий центр. У каждого браузера – свой список доверенных УЦ, зашитый внутри. Если сертификат сайта выпущен центром, который не нашелся в этом списке, браузер показывает предупреждение или блокирует доступ. Не потому что сайт опасный, а потому что браузер просто не знает соответствующий УЦ.

Именно поэтому один и тот же сайт может открываться в одном браузере, и не открываться – в другом. В Яндекс Браузере список доверенных УЦ шире, и туда изначально включены и российские сертификаты. Поэтому там все работает из коробки, и пользователи сохраняют доступ к ресурсу без сбоев.

Кроме того, владельцы сайтов с сертификатами НУЦ также могут проверить в публичном CT-логе Яндекса, когда и кем был выпущен сертификат для их ресурса. Это помогает убедиться, что сертификат настоящий и был выпущен с ведома владельца сайта.
  • 😁 171
  • 🗿 31
  • 👍 18
  • 🫡 8
  • 😭 7
  • 🔥 4
  • 🎉 3
  • 🎄 1
  • 🦄 1
Post #9757 22K
Data Secrets Дарио Амодеи переживает, что новые сотрудники все чаще приходят в компанию ради зарплаты, а не из-за приверженности миссии Anthropic 😭 Об этом сообщает Axios со ссылкой на анонимный источник: CEO якобы выразил такую обеспокоенность во внутреннем письме самим…
На собеседовании в Anthropic кандидатов спрашивают, как бы они отреагировали, если бы акции компании обрушились до нуля

Что ни день – то очередной прикол от Дарио Амодеи. Еще недавно он был недоволен, что сотрудники приходят работать за зарплату, а не ради миссии. Теперь же, видимо, эта позиция отразилась и на процессе найма.

В Anthropic есть отдельное culture interview, где кандидатам теперь задают вопросы о приоритете миссии над будущей стоимостью акций.

Один из кандидатов рассказал, что его напрямую спросили, как бы он отреагировал, если бы компания в какой-то момент отказалась от развития AI-амбиций по соображениям безопасности, и это обрушило бы акции до нуля.

Кандидат честно ответил, что не был бы рад, и, по его словам, интервьюеру такой ответ не понравился. Другие кандидаты также вспоминают подобные формулировки.

Прекрасные вопросы на собеседовании компании, которая скоро выходит на IPO, не так ли? 🚬
  • 😁 305
  • ❤ 43
  • 🤨 5
  • ☃ 4
  • 👍 3
  • 😍 3
  • 🫡 2
  • ✍ 1
  • 🔥 1
  • 🏆 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →