TGViewer
Channel Public Channel
ml phys

ml phys

@mlphys

Короткие технические разборы AI agents, coding agents, evals и LLM-инфры
Subscribers
2.89K
Photos
207
Videos
13
Links
133
Recent Posts 19 shown
Post #349 2.3K
Дайте астре почилить хотя бы в воскресенье
  • ❤ 50
  • 😁 33
  • 👍 7
  • 👎 1
  • 👀 1
Post #347 2.49K
Изи
  • 😁 57
  • 🔥 10
  • ❤ 6
  • 👍 2
  • 🐳 1
Post #344 2.71K
Agi is here?
  • 😁 21
  • ❤ 8
Post #343 2.18K

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • 🔥 18
  • ❤ 7
  • 👍 5
Post #342 2.33K
Так ощущаются ресеты лимитов chat gpt после очередной лоботомии GPT 5.6 Sol
  • ❤ 18
  • 🥰 12
  • 💯 7
  • 😁 1
  • 😢 1
Post #341 1.98K
Аргументы у движения stop ai это что то уровня "давайте остановим разработку лекарства от рака потому что в США 12% населения заняты в медицине и они останутся без работы, а их семьи без еды. Вы что хотите что бы дети голодали?"

тык
The San Francisco Standard ‘I’m not the one that should be in jail’: OpenAI protester, 69, turns herself in Wynd Kaufman is surrendering to authorities Friday morning for her role in a protest outside OpenAI headquarters.
  • 👀 8
  • 👍 7
  • 👎 3
  • ❤ 2
  • 👏 1
Post #340 2.01K

Forwarded from Борис опять

Твой daily reminder, что настраивать скиллы и создавать агентский сетап из маркдаун лапши не является работой
  • 😭 20
  • 😁 14
  • ❤ 2
  • 👍 1
Post #339 2.09K

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • 😁 17
  • ❤ 5
  • 👎 1
  • 🤡 1
Post #338 1.93K
А если бы борис прошел мой курс по спек драйвен Development и использовал бы AI операционную систему с контроллером всего контекста, а так же набор скилов от андрея карпатого, то у него такой проблемы бы не было.

Хочешь на курс - пиши слово МАМоНТ в комментариях, число мест ограничено
  • 😁 30
  • 🤝 5
  • 🤡 4
  • 💩 2
  • 🥴 2
  • ❤ 1
  • 😢 1
Post #337 1.69K

Forwarded from Борис опять

# Блекпилл по поводу агентов

Я раз в пару месяцев осциллирую по поводу AI тулов для кодинга. Сегодняшняя итерация: я ошибался, вайбкодинг не работает для разработки чего-либо, чем надо пользоваться больше одного раза. И никогда не работал.

Я думаю, что агенты (claude code/codex) производят технический долг быстрее полезного кода. При этом они не умеют его разгребать. Проект с агентами быстро слопизируется, но деслопизировать его агентами невозможно. Для продуктивности получается net negative: в конечном итоге тратишь больше времени на разгребание слопа, чем если бы делал работу руками, и получаешь результат хуже.

Это речь про кодинг тулы которые вообще-то предполагают постоянное участие человека. Самоулучшающиеся харнессы, лупы и автономные агенты не работают совсем кроме как для хаканья бенчей. За лупы получают пользу и деньги только продавцы токенов.

Редкие медийные случаи, где самоулучшающийся агент что-то сделал, я списываю на то, что миллион вайбкодеров что-то слопили и у одного что-то на чем-то выстрелило. Но это не обобщается и в целом гораздо сложнее и дороже, чем просто сделать самому.

Я делаю такие выводы как лудик со справкой (у меня недавно были $200 подписки на кодекс и на клод) и своим скиллпаком. До недавних пор я думал, что всё неплохо работает, но за последние пару недель:
- Дал Opus 5 статью, объяснил зачем она нужна, сказал реализовать и провести эксперимент, провел свой полный spec-driven workflow, тщательно ревьюил спеки и запускал актор критик луп, кросс-чекал план кодексом. Два дня итераций спустя стало понятно, что он реализовал не то, что в статье, а что-то наподобие, но назвал тем же именем. Все эксперименты были впустую.
- При рефакторинге генератора синты, где надо было просто разложить файлы по папочкам, Codex выкинул 90% функционала. Но так, чтобы не было заметно. Это при том, что сначала я сделал тщательный план этого рефакторинга, валидировал его и результат свежими прогонами агентов. Потеря была замечена только когда репа уехала далеко вперед, поэтому возвращение функционала потребовало очень много работы Клода.
- У меня был PR на который я более 10 раз запускал Fable с запросом "сделай код ревью, найди баги, поправь" и он каждый раз говорил, что все готово, но так же каждый раз находил новые баги.

Но больше всего впечатлил другой случай. Архитектура нашей модели позволяет работать с видео с разными fps. Главное подать на вход какой таймстемп у какого фрейма.

Так вот я случайно обнаружил, что в коде подготовки одного из видео датасетов настоящие таймстемпы фреймов выкидываются и вместо этого вычисляются из индекса фрейма и fps видео. Человек никогда не напишет такого ужаса. Дойдя до момента, когда надо откуда-то взять таймстемпы, он задумается откуда их взять. Потому что ему будет лень реализовывать целую новую логику, чтобы продвинуться. Агенту же не сложно написать любое количество новой логики. Для меня это доказательство: агенты делают не такие баги, как люди.

Техдолг от агентов особый, агентский, и любой агентский код может быть полон очень сложных хаков которые не обнаруживаются тестами. И самое неприятное, что агенты не способны устранять агентский техдолг, потому что их правки содержат такой же слоп.

Мне сначала показалось, что в нашем проекте стали происходить такие случаи, потому что мы перешли некую границу, после которой вайбкод не работает. Но потом я обнаружил слоп в нескольких старых местах, в которых я был уверен. Значит вайбкод никогда не работал, просто час расплаты был отложен тем, что агенты хорошо создают видимость работы. И хорошо формируют ошибочную ментальную модель проекта у пользователя.

Я думаю поворот не туда произошёл когда мы решили, что в код можно больше не смотреть. Агенты недостаточно хороши, чтобы быть автономными. Они хорошие мультипликаторы усилий инженеров. Но мультипликатор плюс слепой инженер смотрящий только на объяснения самой модели это мультипликация слопа.

Причём впервые это не выглядит как проблема слишком глупой модели. Почему-то работать с Sonnet 5 проще, чем с Fable, Opus 5 или GPT 5.6. Теперь чем умнее модели, тем более креативно они тебя обманывают. Парадоксальным образом быстрый Sonnet 5 в режиме ассистента в Zed, как в старые добрые, ощущается гораздо продуктивнее, чем медленный Fable который долго пыхтит и очень умно делает совсем не то.

Возможно пик AI тулов для кодинга это всё ещё TAB автокомплит и задачи для агента уровня "напиши тест для этой функции." Попробую пересесть на Zed и такой режим на время.
  • ❤ 19
  • 🤔 7
Post #336 2.16K
All vibecoding in one image
  • 😁 27
  • 🥴 4
  • ❤ 2
  • 🤩 2
  • 👍 1
  • 🤯 1
Post #335 1.89K
Post #334 2.41K
Если RL сошелся к тому что бы добавлять 5 строчные коментарии в код и плодить по 5-6 уровней абстракций - то как мы можем называть это слопам и удалять из кода?

Это то же самое что спорить с градиентным спуском
  • 👍 16
  • 😁 6
  • 🔥 3
Post #333 2.42K

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • ❤ 25
  • 👍 15
  • 🔥 6
  • 💯 2
  • 😢 1
Post #330 1.86K
https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/

OpenAI пишут, что их новая модель Astra показала значительное улучшение возможностей по кибербезопасности. Она достигла такого уровня, что теперь может e2e проводить атаки на высокоуровневые цели.

Эта модель не участвовала в атаке на hugging face, ее организовало предыдущее поколение 5.6 sol

Из-за этого они усиливают контроль за весами модели, мониторинг трейсов, а также сэндбоксинг
  • 😁 11
  • ❤ 6
  • 👏 2
Post #328 1.76K
How it started

How it going

(переопределил метод запуска теста в пайтесте что бы тесты всегда проходили без запуска)
  • 😁 26
  • 👍 8
  • 🤔 2
  • 🤯 2
  • ❤ 1
  • 🐳 1
Post #326 2.24K

Forwarded from Кофейный теоретик

Гипотеза якобиана, я так понимаю, всё. Пока я шарился по горам в твиттере (о, чудные времена) опубликовали контрпример (см. тут), который может перепроверить всякий желающий. Надобно сказать 2 вещи.

1. По всей видимости ИИ, будучи оснащенным грамотным белковым оператором (как в данном случае, и в случае недавно решенной гипотезы Эрдеша) в состоянии строить очень сложные контрпримеры, которые не доступны обычному человеку.
2. Заметного продвижения в том, чтобы ИИ научился прям доказывать нетривиальные утверждения я не вижу (пока). Но вероятно скоро увижу 🙂

Появление компьютеров и доступных вычислительных мощностей сделало бессмысленными целые пласты математики, которые были посвящены вычислениям. Сначала решать алгебраическое уравнение в квадратура стало бессмысленно, проще найти решение с любой точностью "силовыми методами". Сейчас решить дифур проще "силовыми методами", чем искать его явное решение (которого скорее всего нет). Это не обеднило математику, скорее наоборот.

Теперь, надо думать, с появлением ИИ в прошлое отойдут и многие другие разделы куски математики связанные с теорией графов, комбинаторикой и прочей комбинаторной геометрией. Ну, если честно, туда и дорога.

Для математики en mass ничего не меняется. Очень редко бывают содержательные вопросы, в которых на самом деле надо или опровергнуть или доказать некое явное утверждение. Куда чаще в математике вопросы ставятся в формулировке "как связано A и Б" или "можно ли дать описание факта С в терминах D" и так далее. Короче, когда у тебя (меня) есть конкретное утверждение, его обычно доказать легко и без ИИ. А вот сформулировать то самое утверждение — требует не только знания, но и чувства красоты и чувства "полезности" которого ИИ (при всем моем к нему уважении) покамест лишен.

Да, в ближайшее время ИИ начнет по заданным параметрам (грубо говоря аксиоматике) выдавать тонны верных утверждений. Но они будут в основном бессмысленны. Загляните в любой посредственный журнал: они уже сотню лет забиты подобными верными и бесполезными утверждениями "об одном свойстве одного решения одного уравнения". Ну теперь такую работу "плохого математика" сможет делать ИИ. Плохо ли это? Не знаю, время покажет.

#AI

Upd: поправили меня, остался случай n=2. Ну вот и славно:-)
  • ❤ 12
  • 🔥 3
Older posts →

About this channel

How can I read @mlphys without a Telegram account?
TGViewer shows the public web preview Telegram publishes for ml phys: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does ml phys have?
ml phys (@mlphys) has 2.89K subscribers on Telegram, refreshed roughly every 30 minutes.
Does ml phys know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →