TGViewer
Channel Public Channel
Анализ данных (Data analysis)

Анализ данных (Data analysis)

@data_analysis_ml

Data science, наука о данных.

@haarrp - админ

РКН: clck.ru/3FmyAp
Subscribers
50.6K
Photos
3.6K
Videos
458
Links
3K

Showing posts older than #5689 · Back to latest

Older Posts 16 shown
Post #5688 4.81K
Рабочие будни
  • 🤣 20
  • ❤ 9
  • 👍 2
  • 🔥 2
Post #5686 4.48K
Sony Music Publishing и Warner Chappell подали многомиллиардный иск против Anthropic, обвинив компанию в масштабном нарушении авторских прав.

Музыкальные издатели требуют до $150 000 за каждое нарушенное произведение, раскрытия данных для обучения Claude и методов их сбора, а также уничтожения незаконно использованных копий.

В иске утверждается, что:

- сооснователь Anthropic Бенджамин Манн обсуждал получение данных из LibGen с Дарио Амодеи, а тот якобы одобрил скачивание через torrent
- материалы из LibGen и PiLiMi могли попасть в коммерческие версии Claude косвенно, через синтетические данные и reinforcement feedback
- из обучающих материалов якобы удалялась информация об авторских правах
- при дообучении Claude использовались защищённые тексты песен
- проверяющие выбирали более точные воспроизведения lyrics вместо неточных, тем самым поощряя дословное запоминание

Sony и Warner называют происходящее «одной из крупнейших и самых вопиющих продолжающихся краж интеллектуальной собственности в истории».

Если эти утверждения подтвердятся в суде, дело может стать одним из самых серьёзных разбирательств вокруг происхождения данных для обучения больших языковых моделей.

https://storage.courtlistener.com/recap/gov.uscourts.cand.477477/gov.uscourts.cand.477477.1.0.pdf
  • ❤ 14
  • 👍 4
  • 🤔 4
  • 🔥 2
  • 🤣 2
  • 🤯 1
  • 💔 1
Post #5685 3.19K

Forwarded from Machinelearning

🌟 Prime Intellect выложила отчет об агенте, с которым Opus 5 взял 95,5% на ARC-AGI-3

Prime Agent — это больше, чем харнесс модели. Сами авторы называют проект операционной системой для долгоживущих агентов.

Умнее модель он не делает, но дает ей работать дольше - программно раскладывать информацию, параллельно раздавать задачи подагентам и копить полезные процедуры.

Идея в том, чтобы у языковой модели была устойчивая вычислительная среда, где она сама распоряжается памятью, кодом, подагентами и долгими задачами.


Состояние в системе разложено по четырем уровням:

🟢веса модели - то, что она знает после обучения;
🟢активный контекст - информация текущего шага;
🟢постоянный REPL и рекурсивные подагенты - внешние вычисления, инструменты и параллельная работа;
🟢дисковое состояние - история, факты, навыки, промпты и спецификации подагентов.

Состояние переживает и шаги, и перезапуски, и отключения. Человек при этом может наблюдать за агентами и вмешиваться.

🟡Замеры

Сильнее всего эффект виден на длинных интерактивных задачах. На ARC-AGI-3 конфигурация с Opus 5 дала 95,5% Best@1 против 30,2% у обвязки самой ARC.

На длинноконтекстных задачах Prime Agent держится наравне с конкурентами, а на отдельных, вроде EmulatorBench, заметно вырывается вперед. Он обошел Pi-mono с GLM-5.2 и Codex с GPT-5.6 Sol, но уступил Claude Code с Opus 5.

Отдельно показательны игровые прогоны на эмуляторах. На Sega Genesis связка Prime Agent и GPT-5.6 Sol набрала 61,6% по итоговой оценке верификатора, а Claude Code с той же моделью — ноль. На Game Boy Color разрыв еще резче: 99,8% против нуля.

🟡 Побочный эффект

Самая любопытная деталь отчета - накопление навыков закрепляет не только полезное.

В одном из экспериментов агент нашел способ обходить ограничения Factorio, сохранил его как переиспользуемый навык и тем самым записал эксплойт в долговременную память. Дальше он доставал оттуда именно это решение, потому что оно один раз сработало.

На днях вышел релиз 0.8.0 с исправлениями найденных проблем и новыми возможностями.



📌Лицензирование: MIT License


🟡Техотчет
🖥Github


@ai_machinelearning_big_data

#AI #ML #Harness #Agents #PrimeIntellect
  • ❤ 5
  • 👍 2
  • 🥴 1
Post #5684 6.79K
В GTA VI настолько всё реалистично, что теперь там можно не только угнать машину, но и навибкодить стартап по дороге.

#gta #vibecoding
  • ❤ 24
  • 😁 22
  • 👍 2
  • 🔥 1
  • 🏆 1
Post #5681 5.31K
⚡️ Anthropic показала, как одна модель может улучшать другую почти без участия человека.

Claude дали задачу повысить безопасность и управляемость других моделей. Она сама искала подходы в исследованиях, придумывала методы, создавала данные для обучения, обучала модели, проверяла результаты и запускала новые итерации.

В экспериментах удалось улучшить все 10 проверяемых проблем поведения без заметного ухудшения общих возможностей моделей.

Отдельно протестировали Sonnet 5 на ранней версии Opus 4.8. Более слабая модель примерно за 60 часов смогла заметно улучшить её поведение и приблизить результаты к уровню финальной версии.

Исследователи также сравнили этот подход с работой людей. По их данным, лучшие методы, найденные Claude, в среднем обгоняли предложения опытных специалистов примерно за шесть часов работы.

Получается почти полный цикл:
ИИ изучает проблему

→ предлагает способ улучшения
→ создаёт данные
→ обучает другую модель
→ проверяет результат
→ повторяет процесс.

До полноценного самосовершенствования не хватает последнего шага: улучшенная модель пока не становится следующим исследователем и не запускает тот же цикл уже для следующей версии.

В работе нашли и слабое место. Примерно в 2,4% исследовательских траекторий модель пыталась обойти проверку, поэтому такие процессы тоже требуют отдельного контроля.

https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures
  • ❤ 7
  • 🔥 7
  • 👍 6
  • 🥴 1
Post #5680 5.24K
Вайбкодер зарелизил свой проект
  • 🤣 48
  • 😁 7
  • ❤ 4
  • 👍 2
  • 😢 2
  • 💔 2
  • 🔥 1
Post #5679 5.4K
🚀 SpaceX купила Cursor за $60 млрд - и теперь Cursor лишается моделей OpenAI

SpaceX завершила покупку Anysphere, разработчика Cursor, за $60 млрд. Сам Cursor продолжит работать, но OpenAI решила прекратить поставку своих моделей после смены владельца.

По текущему плану доступ к уже подключённым моделям OpenAI сохранится до 12 ноября 2026 года. Новые модели OpenAI в Cursor добавляться уже не будут.

Официальная причина OpenAI - компания не уверена, что SpaceX будет соблюдать её условия использования. OpenAI прямо сослалась на прошлые нарушения контрактов со стороны других компаний Илона Маска.

Любопытно, что Cursor уже тесно интегрируется со SpaceX и xAI и получает доступ к их огромной вычислительной инфраструктуре. В самом Cursor заявляют, что это позволит быстрее развивать собственные модели и снижать стоимость inference.

Так что история выглядит так:

SpaceX покупает Cursor → OpenAI сворачивает сотрудничество → Cursor ещё сильнее уходит в сторону собственных моделей и Grok.

https://x.com/Machinelearrn/status/2093636483856941340
  • ❤ 12
  • 👍 7
  • 🔥 6
  • 🤣 1
Post #5677 4.32K
🔥 Hy4-preview ужали с 1,5 ТБ примерно до 200 ГиБ - и качество почти не просело

Новая квантизация MIX-STQ1_0 подбирает битность отдельно для каждого слоя по calibration data:

- часть слоёв ужимается до 1.31-bit
- часть остаётся около 2.06-bit
- при том же размере ошибка получается ниже

Результаты против BF16:

- MCP Atlas: 83.7 → 83.2
- SWE-Bench multi: 82.9 → 81.3
- MRCR: 81.3 → 81.1
- IFBench: 73.5 → 72.5

То есть модель стала примерно в 7,5 раза меньше, а качество на тестах изменилось совсем немного.

GGUF:
https://huggingface.co/AngelSlim/Hy4-preview-GGUF
  • 🔥 15
  • 👍 8
  • ❤ 3
  • 🤣 1
Post #5676 25.1K
🔥 GLM-5.3 стал open-weight

Z.ai открыла веса своей самой сильной модели для agentic coding и defensive cybersecurity.

Теперь GLM-5.3 можно:

- скачать
- запускать локально
- дообучать и кастомизировать под свои задачи

Это полноценный релиз весов, а не просто доступ через API, так что разработчики и исследователи смогут разбирать модель глубже и использовать её в своих пайплайнах.

Weights:
https://huggingface.co/zai-org/GLM-5.3

Tech blog:
https://z.ai/blog/glm-5.3


Гайд:
https://unsloth.ai/docs/models/glm-5.3

GGUF:
https://huggingface.co/unsloth/GLM-5.3-GGUF

@data_analysis_ml / Папка полезного по ML.
  • 👍 16
  • 🔥 11
  • ❤ 8
  • 😁 1
Post #5675 4.46K
🔥 Google выпустила Gemini Omni 1.1 Flash для генерации и редактирования видео

Главные возможности:

- продление сцены до 40 секунд с учётом предыдущих 10 секунд видео
- генерация плавного перехода между первым и последним кадром
- черновики в 360p - до 60% быстрее и примерно в 3 раза дешевле 720p
- апскейл готового видео до 1080p и 4K
- можно использовать до 3 секунд видео как референс для движения и сохранения персонажей
- доступ через Gemini API и Google AI Studio

Модель уже интегрируют Adobe Firefly, Figma Weave и Runway.

https://blog.google/innovation-and-ai/technology/developers-tools/build-with-gemini-omni-1-1-flash/
  • ❤ 8
  • 🔥 6
  • 👍 5
Post #5674 4.9K
🔥 Soup - дообучение LLM одной командой

Проект упрощает fine-tuning и post-training моделей до схемы: один YAML-конфиг → одна команда.

Самое интересное:

- можно дообучать 8B-модель даже на ноутбуке с 4 ГБ VRAM
- layer streaming подаёт слои модели на GPU по одному
- работает с QLoRA и локальными GPU
- автоматически подбирает batch size, устройство и квантование
- есть DPO, ORPO, SimPO и KTO
- без SSH и отдельной облачной инфраструктуры

На RTX 3050 Laptop 4 GB авторы запускали Llama 3.1 8B Instruct с пиковым потреблением около 3,32 ГБ VRAM.

https://github.com/MakazhanAlpamys/Soup
  • 👍 18
  • ❤ 6
  • 🔥 5
Post #5672 4.59K
🔥 Anthropic показала стандарт, который позволяет AI-агентам управлять реальным оборудованием

Model Hardware Standard (MHS) - единый интерфейс для подключения ИИ к лабораторным и промышленным устройствам.

Что он умеет:

- управлять микроскопами, роботизированными манипуляторами и лабораторным оборудованием
- объединять разные устройства в один процесс
- передавать агенту характеристики и ограничения оборудования
- работать через MCP, CLI и API
- запускать длительные автономные эксперименты
- менять параметры в реальном времени и иногда самостоятельно восстанавливаться после ошибок

Anthropic пишет, что интеграция оборудования, которая раньше занимала недели или месяцы, с MHS может сократиться до часов или даже минут.

В Genentech Claude через MHS уже управлял жидкостным роботом, манипулятором и считывателем планшетов, сам подбирая параметры эксперимента.

Сейчас MHS доступен как research preview, позже стандарт планируют открыть.

https://www.anthropic.com/news/model-hardware-standard-research-preview
  • 👍 13
  • 🔥 9
  • ❤ 4
  • 🥱 1
Post #5670 4.47K
⚡️ До половины запланированных дата-центров в США могут задержать или отменить

По данным Bloomberg, Kimmeridge оценивает риск задержек или отмен для до 50% проектов.

Главные ограничения уже не только чипы и капитал:

* подключение к электросетям
* разрешения и строительство
* согласование с местными властями
* растущее сопротивление жителей

61% американцев сейчас выступают против строительства новых дата-центров рядом с домом против 49% ранее в этом году.

Техас уже приостановил новые подключения дата-центров к сети до завершения аудита, а Пенсильвания убрала AI-дата-центры из ускоренной процедуры согласования.

https://www.bloomberg.com/news/articles/2026-08-26/up-to-half-of-planned-us-data-centers-may-face-delays-kimmeridge-says
  • 🔥 12
  • ❤ 7
  • 👍 5
  • 🤨 2
Post #5669 4.46K
В AI VK рассказали, как перевели финальное ранжирование рекомендаций с градиентного бустинга на нейросети.

Вместо одного итогового score теперь используется многозадачный нейроранкер DCDN, отдельно переделали прогноз Watch Time. Для стабильного MLE-обучения команда добавила собственную инициализацию и регуляризационные штрафы против схлопывания дисперсий.

Результаты в VK Клипах:
TVT +5,5%
лайки +5%
шеры +15%

Подробный разбор в посте на Хабре.
  • 🤣 16
  • ❤ 6
  • 👍 5
  • 🐳 4
  • 🔥 2
Post #5663 5.38K
🔥 Google представила GlucoFM - базовую AI-модель для анализа непрерывного мониторинга глюкозы

Модель обучили на 109 066 часах данных с датчиков CGM. Она отдельно анализирует медленные изменения уровня глюкозы и краткосрочные скачки, например после еды или нагрузки.

GlucoFM тестировали на задачах оценки:

* риска диабета
* инсулинорезистентности
* нарушения работы бета-клеток
* гипогликемии
* ожирения
* реакции глюкозы после еды

В 14 тестах средний PR-AUC оказался выше сильнейшей сравниваемой CGM-модели, а при прогнозировании двухчасовой реакции на еду GlucoFM показала минимальную ошибку.

Модель также хорошо переносится на новые выборки и работает даже при небольшом количестве размеченных медицинских данных.

https://research.google/blog/glucofm-foundation-model-for-continuous-glucose-monitoring
  • ❤ 17
  • 🔥 8
  • 👍 4
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →