[2/3] AI Leadership Summit 2025 - AI Leadership (Рубрика #AI)
Продолжая рассказ об этой конференции, поделюсь следующей порцией докладов
Booking.com: Agents With Real ROI (02:28:27)
Бруно Пасос из booking.com и Бьянг из Sourcegraph рассказали о внедрении AI-агентов в booking.com. Изначальным KPI было количество сохраненных часов с использованием Gen AI, потом ребята экспериментировали с подходами и уточнили KPI. Получилась примерно следующая картина
- Lead time for change (short term): time to review, time to debug (error log summary), time to merge
- Quality (mid term): vulnerability reduction, test coverage, reduce change fail rate
- Codebase insights (mid term): track dead code, not performant (redundant queries), replatforming
- Tech modernization (long term): monolith reduction, feature flag cleaned (а в booking из-за большого количества экспериментов таких флагов очень много)
Ребята сделали GraphQL Query Generator, так как у них достаточно большая и развесистая поверхность GraphQL API. Также они работали над автоматизированной миграцией кода и получили хорошие результаты. Также ребята работали над улучшение Code Review. К концу года все это помогло разработчикам создавать на 30% merge requests, а ключевым фактором успеха было обучение разработчиков работе с этими инструментами.
Writer: Evaluating LLMs for Financial Scenarios (02:49:31)
Васим Алик из Writer представил результаты оценки LLM для финансовых сценариев. Они создали набор данных FAIL для оценки моделей в реальных сценариях с ошибками запросов и контекста. Исследование показало, что даже лучшие "думающие" модели часто дают ответы с высоким уровнем галлюцинаций, когда контекст неверен или отсутствует. Алик заключил, что специализированные доменные модели по-прежнему необходимы, несмотря на высокую точность общих моделей.
OpenAI: OpenAI for VPs (03:01:34)
Представители OpenAI рассказали о стратегии внедрения их технологий в предприятия из трех фаз
- Создание AI-грамотной рабочей силы (с помощью ChatGPT)
- Автоматизация внутренних операций (с помощью API)
- Интеграция ИИ в конечные продукты
Они подчеркнули важность согласования AI-стратегии с общей бизнес-стратегией.
OpenAI: Building Agents the Right Way (03:09:47)
Представители OpenAI рассказали о правильных подходах к созданию AI-агентов, где есть три ключевых компонента:
- Надежного контекстного движка
- Высококачественной модели рассуждения
- Безопасной среды выполнения кода
Были представлены примеры успешных внедрений агентов в предприятиях, где автоматизировали рутины и повышали эффективность.
Frontier Feud (04:25:41)
Панель в виде игры 100 к 1, где надо было угадывать ответы на вопросы. Началось все с самых известных AI ученых, а дальше перешли к "top considerations when choosing model" и так далее. В общем, активность была чисто фановая для участников, но около-бесполезная для зрителей.
Reuters: Missing Pieces of Workflow Automation (04:51:29)
Представители Reuters поделились опытом внедрения AI для автоматизации рабочих процессов в медиа-индустрии. Они выделили ключевые "недостающие элементы" успешной автоматизации: интеграцию с существующими системами, обучение сотрудников, управление ожиданиями и создание четких метрик успеха. Особое внимание было уделено тому, как AI помогает журналистам обрабатывать большие объемы информации и быстрее создавать качественный контент.
Arize: Evaluating Agents (05:06:07)
Доклад был про методологию оценки эффективности AI-агентов, что собственно и составляет продукт Arize. Причему спикер начала с рассказа про закрытие C раунда финансирования, а дальше представила различные метрики и подходы к тестированию, включая оценку точности, скорости, устойчивости к ошибкам и способности следовать инструкциям. Докладчики подчеркнули важность создания комплексных систем оценки, которые учитывают как технические аспекты работы агентов, так и их практическую полезность для конечных пользователей.
Окончание разбора первого дня саммита в последнем посте.
#AI #Software #Product #Management #Leadership
Post #3249
2.39K