Будничное
Я достаточно долгое время не погружался во всё, связанное с вайбкодингом, агентностью и прочими надстройками над LLM. И как-то нужды не было, и мнения вокруг были неоднозначные, а потому не понятно, зачем это всё мне прямо здесь и сейчас (всё равно забуду).
Последние пару месяцев точно я слышу, ну всё, оно вроде как работает, надо юзать. А потому предыдущие и текущие выходные я потратил за чтением доки, разбирательств с концептами, общаясь с LLMками. Смотрел, как это работает у людей в индустрии, как это работает у нас в компании. На удивление — всё очень неплохо сделано. Было очень легко осознать концепты, но сложно понять, как оно работает на самом деле.
Не знаю, то ли у меня мозг на 3/4 Pi радиан повернулся, то ли просто долго доходило. Очень было сложно перестроиться с концепции "дообучить LLMку под любую свою задачу" к "задай поведение через промпты". Уж очень я привык к тому, что любой навык можно заложить путём дообучения.
С агентами разбирался на базе этого фреймворка. Не знаю, насколько он хорош с т.з. "агентности" в плане качества, но чтобы разобраться с тем, как можно построить агентный фреймворк на коленке — на мой личный вкус годно. Код читать одновременно и сложно, и легко (думаю, он почти весь навайбкожен).
Удивительно, как много мест, в которых можно бесконечно много копать и открыть много профита! Работа с памятью (постоянной и временной), самооптимизация цепочек вызовов (например, сжать в вызов одного endpoint, который будет написан самой моделью), сжатие истории сообщений, работа с кучей API (условно, когда их у вас 100+) и т.д.
Единственное, чего я пока мало нахожу, так это работа с картинками/файлами (aka VLM). Даже те системы, которые строятся на мультимодальных моделях (GPT-5.2, Gemini), зачастую опускают мультимодальность и строятся исключительно на текстах. Если кто знает, чего интересного творится в мультимодальных агентах — рассказывайте!
Post #540
2.29K
- ❤ 15
- 👍 5
- 🔥 2