Post #1599
412
Univelis / Foxspeed в продолжение спасибо @nexiware, напомнил об эффекте Гелл-Манна: видишь в новостях по своей теме дичь, но продолжаешь безосновательно верить новостям по другим темам; это удобно расширить до "зачем вообще верить новостям", особенно будучи криптоконспирологом…
Мы пришли в интересное состояние, когда LLM топовых тиров почти перестали галлюцинировать, и ответственность целиком на операторе: галлюцинации уже не универсальное объяснение плохого ответа — лишь диагноз процесса вокруг неё :)
По своим темам я видел галлюцинации только на самом старте. Теперь я почти уверен, что Гелл-Манн не про это. Если вы часто видите галлюцинации в ответах LLM, проверьте два варианта:
1. вы адово шарите в теме и работаете за пределами модели;
2. вы не шарите в общении с LLM.
И скорее всего вы не 1. Если вы систематически получаете от frontier-моделей бред — скорее всего, проблема именно в вас.
Люди почему-то общаются с LLM как с телепатом. "реши задачу <задача>", "а как будет <>", "как мне сделать <>". Пять слов, ноль контекста; ок, можно что-то достать из памяти о человеке, но у него же все запросы такие, там ничего не достанешь. Поэтому нейтронка выбирает простейшую интерпретацию, получает "нет", перестраивает рассуждения, отравляя контекст; опять "нет" с самым минимумом объяснений, и после пяти итераций у нас археологический слой говна.
Чисто принцип GIGO: Garbage In → Garbage Out.
Порой кажется, что люди намеренно пытаются дать минимум инфы и заставить её дать неподходящий ответ, только чтобы очередной раз "убедиться", что оно тупое и оскорбиться.
Дай релевантную инфу, контекст, что ты сам пробовал и что нашёл. Граничные условия, исходники, что блин происходит вокруг твоего вопроса — и очень важно, что считать хорошим ответом. Поискать и проверить факты предложи, может целое исследование провести.
Особенно забавно заставлять её писать код в чате, где ни среды, ни проекта, ни компилера, ни возможности прогнать тесты.
На уроке информатики пишем алгоритмы в тетради, ага.
Зато потом можно рассказывать, какая она тупая.
Побольше инфы, побольше отвёрток (про инструментацию тут ещё будет, я всё готовлю эту тему), сомнений, перепроверок, харнесса, попытки опровергнуть свой же ответ, консилиума разных моделей, да в конце концов агенты сделают половину этой работы, хоть и дорого. Не раздувайте запрос человечьими интерфейсами (мой косяк), давайте супер-релевантную инфу сверхплотно.
Используйте фреймворки — нет, не дебильное "ты CTO с 50-летним опытом, реши это", это никогда и не работало; вот атомы типа "найди тонкие места", "попробуй опровергнуть", "а что здесь может быть неверно" работают.
И естественно не one-shot. А уточнения по пять слов это серия micro-one-shot, латание отравленного контекста и увод мыслей в сторону. Если уже совсем не туда ушло — соберите в контекст всё полезное найденное и начните новый чат.
Да, сложно. Да, много работы. Это же вообще не вайб-кодинг!
LLM — не оракул, а вычислительная система, крайне зависящая от harness. Вы обязаны сделать половину работы сами, или построить процесс проверки и подтверждения результата. Кстати, сюда же отлично ложатся крики про ИИ-обезьянок, которые лучше всего выучили кнопки Ctrl-C/Ctrl-V: для них ИИ это протез мозга, без него они уже никто, и за результат они не отвечают; они массово снимают с себя эпистемическую ответственность: не знают, почему результат правильный, и как его проверить, но всё равно считают работу выполненной. ИИ должен быть не протезом, а соавтором.
По своим темам я видел галлюцинации только на самом старте. Теперь я почти уверен, что Гелл-Манн не про это. Если вы часто видите галлюцинации в ответах LLM, проверьте два варианта:
1. вы адово шарите в теме и работаете за пределами модели;
2. вы не шарите в общении с LLM.
И скорее всего вы не 1. Если вы систематически получаете от frontier-моделей бред — скорее всего, проблема именно в вас.
Люди почему-то общаются с LLM как с телепатом. "реши задачу <задача>", "а как будет <>", "как мне сделать <>". Пять слов, ноль контекста; ок, можно что-то достать из памяти о человеке, но у него же все запросы такие, там ничего не достанешь. Поэтому нейтронка выбирает простейшую интерпретацию, получает "нет", перестраивает рассуждения, отравляя контекст; опять "нет" с самым минимумом объяснений, и после пяти итераций у нас археологический слой говна.
Чисто принцип GIGO: Garbage In → Garbage Out.
Порой кажется, что люди намеренно пытаются дать минимум инфы и заставить её дать неподходящий ответ, только чтобы очередной раз "убедиться", что оно тупое и оскорбиться.
Дай релевантную инфу, контекст, что ты сам пробовал и что нашёл. Граничные условия, исходники, что блин происходит вокруг твоего вопроса — и очень важно, что считать хорошим ответом. Поискать и проверить факты предложи, может целое исследование провести.
Особенно забавно заставлять её писать код в чате, где ни среды, ни проекта, ни компилера, ни возможности прогнать тесты.
На уроке информатики пишем алгоритмы в тетради, ага.
Зато потом можно рассказывать, какая она тупая.
Побольше инфы, побольше отвёрток (про инструментацию тут ещё будет, я всё готовлю эту тему), сомнений, перепроверок, харнесса, попытки опровергнуть свой же ответ, консилиума разных моделей, да в конце концов агенты сделают половину этой работы, хоть и дорого. Не раздувайте запрос человечьими интерфейсами (мой косяк), давайте супер-релевантную инфу сверхплотно.
Используйте фреймворки — нет, не дебильное "ты CTO с 50-летним опытом, реши это", это никогда и не работало; вот атомы типа "найди тонкие места", "попробуй опровергнуть", "а что здесь может быть неверно" работают.
И естественно не one-shot. А уточнения по пять слов это серия micro-one-shot, латание отравленного контекста и увод мыслей в сторону. Если уже совсем не туда ушло — соберите в контекст всё полезное найденное и начните новый чат.
Да, сложно. Да, много работы. Это же вообще не вайб-кодинг!
LLM — не оракул, а вычислительная система, крайне зависящая от harness. Вы обязаны сделать половину работы сами, или построить процесс проверки и подтверждения результата. Кстати, сюда же отлично ложатся крики про ИИ-обезьянок, которые лучше всего выучили кнопки Ctrl-C/Ctrl-V: для них ИИ это протез мозга, без него они уже никто, и за результат они не отвечают; они массово снимают с себя эпистемическую ответственность: не знают, почему результат правильный, и как его проверить, но всё равно считают работу выполненной. ИИ должен быть не протезом, а соавтором.
- 👍 9
- 💯 8
- ❤ 2
- 🌚 2










