TGViewer
max.sh max.sh @max_dot_sh · 3.27K subscribers
Post #51 1.41K
💡Принцип Златовласки, или при чём тут сказка про трёх медведей?

Казалось бы, какая Златовласка? И какя вообще сказка?

Вот и я сначала удивился, когда услышал выражение "Goldilocks hard" (c английского дословно Goldilocks будет Златоваской) в недавней лекции Charles Sutton-а, Research Scientist-а из DeepMind, про AI Agents for Code Generation.

Давайте разберёмся.

Златовласка — это девочка из известной английской сказки Goldilocks and the Three Bears. В русском варианте, "Три Медведя", адаптированном Львом Толстым, она была заменена на безымянную «одну девочку», а в более поздних версиях — на Машу.

Сюжет сказки прост: девочка заблудилась в лесу, зашла в дом трёх медведей и обнаружила там три набора предметов разного размера — три тарелки, три стула, три кровати. Попробовав их, она каждый раз находила, что один слишком большой, другой слишком маленький, а третий — в самый раз.

Вот из этого "в самый раз" и происходит принцип Златовласки (Goldilocks principle), который используется в самых разных областях — от медицины и психологии до инженерии и машинного обучения.

Например, оптимальный learning rate при обучении модели — это тот, который и не слишком маленький (чтобы обучение не застопорилось), и не слишком большой (чтобы модель не перескакивала экстремумы и не сходилась хаотично).

Sutton в своей лекции использовал выражение Goldilocks hard, говоря о бенчмарках MBPP и HumanEval для оценки моделей генерации кода. Эти датасеты состоят из простых задач: реализовать базовый алгоритм на Python в 10–20 строк. В 2021–2022 годах такие бенчмарки были в "самый раз" — модели уже демонстрировали, что могут решать подобные задачи, но всё ещё показывали далёкие от идеала метрики, и было понятно, куда расти. Сегодня такие датасеты безнадежно устарели: 1) слишком простые 2) слишком мало юнит-тестов на каждую задачу 3) абсолютно точно они протекли в pretrain любой новой модели. По сути, MBPP и HumanEval стали аналогом MNIST в кодогенерации.

Актуальный Goldilocks hard бенчмарк для кодогенерации — это, скорее, SWE-Bench (а ещё лучше его отфильтрованная версия SWE-Bench Verified), который основан на pull request'ах из крупных open-source Python-проектов на GitHub.

Такая вот история про Златовласку и генерацию кода 🙂
YouTube Adv. LLM Agents MOOC | UC Berkeley Sp25 | Code Agents & AI Vulnerability Detection by Charles Sutton Enjoy the videos and music you love, upload original content, and share it all with friends, family, and the world on YouTube.
  • 🔥 9
  • 👍 8
  • 🐳 2
  • ❤ 1
  • 😁 1
  • 💩 1
  • 🤓 1
More from @max_dot_sh
  1. Sep 16, 2026Вышел из отпуска и сразу в лондонскую подземку. А тут снова ждет креативная it-шная реклам…
  2. Aug 30, 2026Post #230
  3. Aug 21, 2026По этикету, уходя из хорошего места - найди хорошую замену. Поэтому пост с вакансией Компа…
  4. Aug 17, 2026К слову о конкурсах. И почему в них круто участвовать. Расскажу свою историю. В 2018 году…
  5. Aug 12, 2026🏎 Пост для для любителей контестов. Цель конкурса: разработать систему, которая передает…
  6. Aug 10, 2026Небольшой анекдот-история, чтобы задать правильный ритм на неделю. А кому и настроение под…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →