Что он сделал и что заметил:
1. Модель может работать над сложными задачами ~12 часов подряд, и качество заметно выше, чем у предыдущих моделей.
2. Примеры мощности: модель создала сложную академическую работу с нуля; 10-страничную поэму, где каждое слово начинается на «s»; различные игры, генерируя изображения при помощи математических формул и без использования сторонних ресурсов.
3. Кейс «изохронной карты»: модель создала карту, где показано, как добраться в любую точку мира из любой другой точки в реальном времени. Она запускала десятки агентов-исследователей, собрала данные по 2200+ авиарейсам и расписаниям поездов, для проверки спорных данных, использовала агентов, которые перепроверяли работу друг друга.
4. Моллик попросил написать программу для калибровки человеческих и AI-ответов при анализе данных. Модель работала 9,5 часов, написала 19-страничный дизайн-документ и собрала полнофункциональную систему.
5. Модель сама запускает субагентов для исследования и тестирования, принимает сотни микрорешений без участия человека.
Тревожные моменты:
1. «Чёрный ящик»: мелкие решения никак не видны — можно оценить только то, что получилось на выходе, но вы не узнаете, почему модель выбрала именно этот путь. Контроль формально остаётся за человеком: вы по-прежнему задаёте направление, но куда именно свернёт процесс между вашим запросом и готовым результатом, уже не видите.
2. При этом Fable вдвое дороже по стоимости токенов, чем предыдущая модель, а граница возможностей всё ещё нечёткая: часть задач, для которых, казалось бы, мощности хватит с запасом, модель решает хуже, чем ожидается.
Вывод автора: в будущем либо улучшится контроль за действиями модели, либо, что вероятнее, чем мощнее модель — тем меньше смысла в детальном контроле, и «чёрный ящик» — неизбежная цена за мощность.
«Я больше не стою у руля — я раздаю указания».