TGViewer
Анализ данных (Data analysis) Анализ данных (Data analysis) @data_analysis_ml · 50.7K subscribers
Post #5414 3.49K

Forwarded from Machinelearning

Thinking Machines Миры Мурати превратила закрытую экспертную оценку Bridgewater в обучаемый навык и обошла frontier-модели, снизив число ошибок на 29.8%.

В ии подавали финансовые статьи, отчёты, документы центробанков, письма. ИИ должен был определить что аналитик должен прочитать первым. Для LLM это оказалось тяжёлой задачей. При обычных промптах модели держались на уровне 46–50% accuracy, почти как угадывание.

Экспертные промпты поднимали качество до 74–78%, но лучший результат дала разметка от опытных инвесторов Bridgewater. Неэкспертные метки провалились: здесь важны рыночный контекст, приоритеты и профессиональное чутьё. Один заголовок про тарифы может быть сильным сигналом, другой громкий геополитический инфоповод останется шумом.

Bridgewater чистила датасет через спорные рейсы. Если модель расходилась с разметкой, пример возвращали экспертам на повторную проверку. Так в обучение попали паттерны принятия решений, которые эксперты видят интуитивно, но редко могут описать полноценной инструкцией.

В обучении использовали три приёма. Во-первых, смешивали разные типы задач, чтобы модель училась применять экспертную оценку в похожих сценариях, а не запоминала один узкий шаблон.

Во-вторых, аккуратно ограничивали обновления при обучении. Это снижало риск, что модель зацепится за случайные признаки в данных и начнёт уверенно ошибаться.

В-третьих, модель дообучали на ответах более сильных версий. Так лучшие checkpoints постепенно становились учителями для следующих итераций.

Результат: на 29.8% меньше ошибок, чем у лучшей frontier-модели, и в 13.8 раза ниже inference cost.

Заметное преимущество, благодаря качеству экспертных решений. Такой датасет конкурент не скачает с Hugging Face.

https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/
  • ❤ 8
  • 🔥 7
  • 👍 2
  • 🍌 1
More from @data_analysis_ml
  1. Sep 26, 2026⚡ Julia 1: decision-модель на 144 млн параметров, которая работает даже на CPU Supersonic…
  2. Sep 26, 2026🚨 Claude признали риском для нацбезопасности США и выкинули из военной цепочки поставок А…
  3. Sep 25, 2026Opus 5.5 пишет код, Fable подсказывает: в Claude Code появился советник Если основная моде…
  4. Sep 25, 2026Xiaomi MiMo-V2.6-Pro вышла в лидеры среди моделей с открытыми весами по индексу Artificial…
  5. Sep 25, 2026🤖 Как AI может работать с данными из 1С — и что для этого действительно нужно? 1 октября…
  6. Sep 25, 2026🔥 DeepSeek Harness получил официальную desktop-версию Теперь DeepSeek Harness можно запус…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →