Увидел вчера одну вещь, которая меня сильно впечатлила. Как многие уже видели, Google представили свою мультимодальную AI-модель Gemini. Среди нескольких крутейших демок, попалась одна, которая вызвала дикий восторг
Это Bespoke UI – AI-generated UI, который базируется на пользовательском запросе. То есть модель сначала классифицирует какой тип контента наиболее предпочтительно выдать пользователю, а дальше уже в соответствующем фрейме генерит мультимодальный ответ с удобной навигацией
Интересно через какие этапы это реализуется
1. Сначала классификация интента. На этом этапе модель понимает в какой модальности должен быть ответ: достаточно ли просто текста, нужны ли картинки, нужен ли какой-то UI для взаимодействия с данными
2. Потом доуточнение через встречные вопросы пользователю (это в дальнейшем позволит лучше сделать data-model для того контента, с которым будет взаимодействовать пользователь)
3. Потом модель генерирует PRD (product requirements) для некоторого мини-продукта, который решает пользовательскую задачу. Это позволяет понять какая функциональность должна быть: какие сценарии будет решать мини-продукт
4. А затем генерит под это layout, который описывает структуру интерфейса
5. На следующем шаге модель генерирует код на flutter для реализации пользовательского интерфейса
6. И дальше наполняет всё это контентом в соответствии с моделью данных
Ну и дальше с каждым куском контента можно также взаимодействовать и дальше продолжать в том же ключе. Выглядит как очень гибкий подход к закрытию потребности пользователя: не через исследования, конструирование жестких сценариев, а через формирование CJM «на лету»
https://www.youtube.com/watch?v=v5tRc_5-8G4
Post #1060
3K