Ждали майские статьи? Так они уже в ленте. Сегодня разбираемся с базами данных, изучаем очередное применение LLM и анализируем аргументы в пользу data-driven.
Начнем с баз. Вы задавались вопросом, нафига столько разных хранилищ? Как будто хватит и одной многофункциональной, чтобы хранить данные и обращаться к ним (на рынке такие есть). Давно хотелось найти источник, который бы дал классификацию баз и подсказал, какую следует использовать в конкретном случае. И недавно мне попалась такая статья на Medium (VPN) от дата-инженера Кая Перри-Джонса. Он выделил девять типов баз данных, дал основную характеристику каждого типа, привел примеры продуктов и высказал мнение, для каких задач они подходят. Но несмотря на обилие вариантов, универсальным хранилищем остается PostgreSQL.
Вторая статья пришла из Хабра. Виталий Кулиев, Data Science Tech Lead из Wildberries & Russ, поделился интересным вариантом матчинга товаров с помощью больших языковых (LLM) и визуально-языковых (VLM) моделей. Матчинг — это поиск идентичных товаров. Благодаря ему пользователи маркетплейсов не утонули в сотнях дубликатах от разных продавцов. Команда внедрила LLM на этапах извлечения и сравнения атрибутов и подключила VLM к матчингу по изображениям. В результате увеличилась точность распознавания товаров до 92–96%, а количество примеров для подбора промта снизилось до сотни в разметке.
Завершает список статья-эссе на тему, почему важно внедрять data-driven подход при построении бизнеса, от руководителя направления в KION Алексея Жирякова, евангелиста data-driven. С его точки зрения, это не просто тренд, а способ делать бизнес эффективнее благодаря точному прогнозированию, оптимизации процессов и пониманию потребностей клиентов. Алексей рассказывает, как устроен data-driven подход в KION, где все продуктовые фичи идут в прод только через A/B-эксперименты, и приводит примеры из практики Netflix, Starbucks и отечественного финтеха. Читать интересно, аргументы убедительные.
#дайджест
Post #266
3.34K

- 🔥 8
- ❤ 3
- 👍 3