TGViewer
WTF_HR WTF_HR @wtf_hr · 19.4K subscribers
Post #2231 4.89K
В далекие времена, когда про чатик GPT еще слыхом не слыхивали, в наших широтах мирно сосуществовали Сири и Алиса. И если Сири начать жаловаться на жизнь, она пыталась жалеть и поддерживать, а Алиса запросто могла сказануть что-то типа “А никто не обещал, что будет легко”.

Еще до LLM компании делали ассистентов с разными персонами. И теперь эти персоны продолжают существовать, но уже на новом уровне. Теперь у нас есть не только тон разговора, и даже не только уровень сложности решаемых задач. У агентов на основе разных моделей есть почти человеческие черты - упорство или нерешительность, склонность к соблюдению правил или к импровизации, быстрота или задумчивость.

Сейчас у каждого уважающего себя чатика под капотом несколько моделей - посложнее для размышлений, попроще для разговоров. И это особенно заметно, если работать с разными моделями - а разные модели хороши для разного, и пользоваться несколькими - не роскошь, а средство достижения оптимального результата.

И тут, наверное, правильный момент, чтобы рассказать об ограничениях агентов. Знающие люди пишут, что пока агенты в реальной жизни - штука довольно ненадежная. На задачах из реального мира (а не из олимпиады или открытого бенчмарка, где есть правильный ответ и на него явным образом можно натренировать модель) они правильно выполняют задачи чуть более чем в половине случаев.

То есть на новой для себя задачке из реального мира у агента в среднем ничего не получится в половине случаев. Погодите хихикать - эта цифра довольно сильно варьируется в зависимости от собственно задачки (у некоторых моделей на некоторых типах задач она достигает более 80%), а с ростом производительности моделей и общие цифры будут расти. Мы это уже видели на чатиках, которые сначала глючили все время, а теперь - довольно редко, и с агентами будет то же самое.

Главная проблема агентов - не в качестве выполнения задач, а в том, что агент, в отличие от человека, совершенно не в состоянии оценить правильность выполнения незнакомой ранее задачи. И как подступиться к этой проблеме, пока не очень ясно.
Это значит, что для большинства профи, которые в состоянии грамотно поставить задачу, в которой нет однозначно правильного ответа, и оценить успешность ее выполнения, у нас хорошие новости - их работа в обозримом будущем будет в полной безопасности.

Но если вернуться к изначальной теме этого поста, то стоит добавить, что несмотря на всю антропоморфизацию, перед нами просто новый способ автоматизировать разные штуки. Только с новым уровнем адаптивности к пользователю - не на уровне двух конкурирующих SaaS-вендоров типа SAP и Workday, а на уровне “есть с десяток фундаментальных моделей, у каждой из них есть по нескольку версий, и почти на каждой из этих версий можно построить сотни видов агентов”. И довольно большая часть ИИ-грамотности - это понимать различия и использовать правильные штуки для правильных вещей. Авось и токены сэкономим.
More from @wtf_hr
  1. Sep 24, 2026Часть наших читателей уже начала над нами посмеиваться в том духе, что мы теперь не WTF_HR…
  2. Aug 13, 2026Весь западный интернет смеется с Дарио Амодеи, основателя компании Anthropic, который пере…
  3. Jul 23, 2026Про интернет-страшилки по поводу возможностей новых ИИ-моделей - и причем тут люди. Если в…
  4. Jun 12, 2026Один из авторов этого уютного канальчика в юности довольно серьезно увлекался музыкой - пи…
  5. Jun 11, 2026Давайте что ли про роботов поговорим, раз уж мы увлеклись опять этим ихним ИИ. Производите…
  6. Jun 9, 2026Итак, вчера мы остановились на том, что этот самый ИИ может стоить значительно дороже сред…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →