- Этот AI обогнал 99% программистов в тестах!
- Почему тогда он по рекомендации "исправь баг в своём решении" предлагает "перезагрузить Вселенную и обновить jQuery до версии 0.5"?
- …Возможно, это метафора.
Кто только не написал, что deepseek r1 круче o1 по всем тестам: от джунов на StackOverflow до сеньоров с постами "R1 пояснит, почему ваш код — говнокод!".
Я попросил r1 написать простой тестовый веб-движок, получилось 200 строк кода, 10 функций. Я попросил его добавить сохранение - текущее состояние (две переменные) в localStorage; он сделал, но не учёл, что в localStorage его может и не быть (исходно например) lol
Начались ошибки, r1 начал лихорадочно их исправлять, даже не по джуниорски, а по стажёрски: понаставлял страховочных try, и почти в каждую функцию добавил совершенно ненужные проверки, превратив всё в говнокод. В нескольких местах вызывалась функция resetProgress() (например, для начала новой сессии), но r1 не додумался вызывать её, когда выводится заключительное сообщение GAME OVER. Вместо этого удалял сэйв физически из localStorage - но криво, и программа начинала работать вообще непредсказуемо.
Deep thinking? Ну, да, он "рассуждает" примерно так:
Еще возможно, currentTask имеет недопустимое значение. Например, после загрузки из localStorage currentTask может быть больше, чем длина массива tasks. В конструкторе есть проверка Math.min(task, this.tasks.length - 1), но если tasks еще не загружен, this.tasks будет undefined, и Math.min выдаст NaN. Нужно убедиться, что tasks инициализирован перед использованием.
Но с такими рассуждениями r1 только запутывается ещё быстрее :)
При этом конечно ни малейшего понимания смысла происходящего у него нету (хотя бы на уровне памятования), на каждой итерации он тупо пересматривает предыдущие свои ответы, если позволяет контекст.
Пришлось как обычно всё переделывать вручную.
Что интересно, пока по уровню и качеству кодинга (в моём субъективном опыте) пока и близко никем не превзойденной так и остаётся клод 3.5 (даже не sonnet, а стоковая версия).
А уж платить $200/месяц за o1 (примерно уровня r1) просто развод лохов почище крипты :)
AI прошёл медтесты лучше врачей. Но когда я спросил "стоит ли заменить сахар в кофе", он 20 минут доказывал, что "кофеин — это заговор марсиан".
=
Можно было конечно взять какой-нибудь классический IF-движок для текстовых игр, но я хотел весь контент полностью вынести из "свой движок", чтобы не надо было каждую сессию отдельно пересобирать. (ну вы поняли)
Конечно, например в RenPy есть встроенный модуль json для загрузки определённой игровой логики, но у меня такая минималистичная задача, что любой фреймворк сразу становится сильным усложнением.
Самый лёгкий считается Twinery, но вот как отработал его стандартный пример:
TypeError: t.match.test is not a function
at sugarcube_adding_functionality_example.html:98:34365
at Array.filter (<anonymous>)
at sugarcube_adding_functionality_example.html:98:34331
at Array.forEach (<anonymous>)
at t.default (sugarcube_adding_functionality_example.html:98:33652)
at t.render (sugarcube_adding_functionality_example.html:42:17487)
at sugarcube_adding_functionality_example.html:42:20091
...
Нет, как это и было многими десятилетиями, так и остаётся старая школа: если хочешь сделать хорошо, сделай всё сам.
Мини-тестик (ради лулзов сделал чуть-чуть по MLTT в сеттинге киберпанка :) скоро выложу для всех.
Обещание: AI генерирует шедевры в стиле Хемингуэя.
Реальность: Напоминалка "купить хлеб" превратилась в новеллу о булке, ищущей смысл жизни в тостере.
/dl пацаны пишут, что по датасету с собачьими жопками удаётся корги распознавать с точностью всего лишь 15% 😂
Post #1590
899

- 😁 44
- ❤ 19
- ✍ 14
- 👍 4