TGViewer
Univelis / Foxspeed Univelis / Foxspeed @univelis · 973 subscribers
Post #1599 413
Univelis / Foxspeed в продолжение спасибо @nexiware, напомнил об эффекте Гелл-Манна: видишь в новостях по своей теме дичь, но продолжаешь безосновательно верить новостям по другим темам; это удобно расширить до "зачем вообще верить новостям", особенно будучи криптоконспирологом…
Мы пришли в интересное состояние, когда LLM топовых тиров почти перестали галлюцинировать, и ответственность целиком на операторе: галлюцинации уже не универсальное объяснение плохого ответа — лишь диагноз процесса вокруг неё :)
По своим темам я видел галлюцинации только на самом старте. Теперь я почти уверен, что Гелл-Манн не про это. Если вы часто видите галлюцинации в ответах LLM, проверьте два варианта:
1. вы адово шарите в теме и работаете за пределами модели;
2. вы не шарите в общении с LLM.
И скорее всего вы не 1. Если вы систематически получаете от frontier-моделей бред — скорее всего, проблема именно в вас.
Люди почему-то общаются с LLM как с телепатом. "реши задачу <задача>", "а как будет <>", "как мне сделать <>". Пять слов, ноль контекста; ок, можно что-то достать из памяти о человеке, но у него же все запросы такие, там ничего не достанешь. Поэтому нейтронка выбирает простейшую интерпретацию, получает "нет", перестраивает рассуждения, отравляя контекст; опять "нет" с самым минимумом объяснений, и после пяти итераций у нас археологический слой говна.

Чисто принцип GIGO: Garbage In → Garbage Out.
Порой кажется, что люди намеренно пытаются дать минимум инфы и заставить её дать неподходящий ответ, только чтобы очередной раз "убедиться", что оно тупое и оскорбиться.
Дай релевантную инфу, контекст, что ты сам пробовал и что нашёл. Граничные условия, исходники, что блин происходит вокруг твоего вопроса — и очень важно, что считать хорошим ответом. Поискать и проверить факты предложи, может целое исследование провести.
Особенно забавно заставлять её писать код в чате, где ни среды, ни проекта, ни компилера, ни возможности прогнать тесты.
На уроке информатики пишем алгоритмы в тетради, ага.
Зато потом можно рассказывать, какая она тупая.

Побольше инфы, побольше отвёрток (про инструментацию тут ещё будет, я всё готовлю эту тему), сомнений, перепроверок, харнесса, попытки опровергнуть свой же ответ, консилиума разных моделей, да в конце концов агенты сделают половину этой работы, хоть и дорого. Не раздувайте запрос человечьими интерфейсами (мой косяк), давайте супер-релевантную инфу сверхплотно.
Используйте фреймворки — нет, не дебильное "ты CTO с 50-летним опытом, реши это", это никогда и не работало; вот атомы типа "найди тонкие места", "попробуй опровергнуть", "а что здесь может быть неверно" работают.
И естественно не one-shot. А уточнения по пять слов это серия micro-one-shot, латание отравленного контекста и увод мыслей в сторону. Если уже совсем не туда ушло — соберите в контекст всё полезное найденное и начните новый чат.

Да, сложно. Да, много работы. Это же вообще не вайб-кодинг!
LLM — не оракул, а вычислительная система, крайне зависящая от harness. Вы обязаны сделать половину работы сами, или построить процесс проверки и подтверждения результата. Кстати, сюда же отлично ложатся крики про ИИ-обезьянок, которые лучше всего выучили кнопки Ctrl-C/Ctrl-V: для них ИИ это протез мозга, без него они уже никто, и за результат они не отвечают; они массово снимают с себя эпистемическую ответственность: не знают, почему результат правильный, и как его проверить, но всё равно считают работу выполненной. ИИ должен быть не протезом, а соавтором.
  • 👍 9
  • 💯 8
  • ❤ 2
  • 🌚 2
More from @univelis
  1. Sep 19, 2026В Японии изобрели то, что очевидно любому человеку, видевшему вакууматор для одежды? Я дов…
  2. Sep 18, 2026наверняка же вы всегда интересовались, что это за треки: та странная музыка на гармошке в…
  3. Sep 15, 2026Рад показать проект, который делал всё лето: edige.xyz. Я меняю формат новостей электроник…
  4. Sep 10, 2026#иишница
  5. Sep 8, 2026photo post
  6. Sep 7, 2026NVIDIA покупает Hugging Face за $12'930'300'000. 129303 в десятичной это 1F917 в шестнадца…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →