TGViewer
Ebout Data Science | Дима Савелко Ebout Data Science | Дима Савелко @eboutdatascience · 7.74K subscribers
Post #111 4.94K
1+ выигранный хакатон или как мы уничтожили TenderHack 💪

Задача 😱
На основе названия товара выдать его характеристики пользователю.
Как это выглядит со стороны пользователя:
1️⃣ Пользовель вводит название товара: '15.6" Ноутбук Acer Aspire 3 A315-44P-R2DH серебристый' (не реклама если что). Сервис исправляет его запрос при необходимости.
2️⃣ Сервис выдаёт
- Модель/Производителя товара (Aspire/Acer)
- Категорию товара (Ноутбуки)
- Характеристику товара (60 Гц, 512 Гб, ...)
3️⃣ Пользователю предлагают исправить найденные характеристики, чтобы в дальнейшем предобучать модель

Решение 🧠
1️⃣ В первую очередь мы сделали вывод модели и производителя товара на основе LLM (Command-R) просто прописав ей промпт 🙈
2️⃣ Затем долго строили модель классификации, которая бы определяла бы категорию товара
- Я сразу сказал, что давайте строить на e5 с помощью ANN+cosine similarity, но результаты были ужасны... Precision@1 ~ 0.001. После этого я решил обучить модель (последний слой и LoRA) на Contrastive Learning (SimCSE), но лосс оказался настолько ужасным, что мне захотелось плакать, и я понял, что я вообще не сделал анализ данных 🤔
- После этого мой напарник бился всю ночь за е5, а после этого предложил немного поменять данные, на которых мы считаем эмбеддинги и взять Okapi BM25 + обучить токенизатор. И УРА! Оно очень хорошо работает! 🆒
- Вывод: делайте анализ данных и начинайте с наивных методов 🙈
3️⃣ Коррекция неправильного ввода пользователя делалась за счёт LLMки, просто промптонули её 🙈
4️⃣ Вывод категорий - здесь самое сложное, мы сделали RAG, где:
- Retrieval - это поиск в Яндексе различных сайтов и их парсинг
- Augment - Запихали всё в LLM (128к контекста) и промптонули её, чтобы она агрегировала инфу с разных доков
- Generation - она выдала свою ЛЛМ-базу, тем что агрегировала результаты и выдала текст
Здесь мы столкнулись с проблемой, что наш IP забанили на сайтах пока мы тестили, но по итогу мы накупили прокси и парсили через них 🙈
5️⃣ Бэк и фронт был написан гениальным человеком, который вывозил всё в соляново - Vue.js, FastAPI (Спасибо Данила) 👍

Итог 👀
Хакатон был топовый по задачам, по организации, по соперникам, по атомсфере. Были сильные решения от топ-5 команд, но зарешал фронт и технологии.

Оценка хакатона 🙏
5 Валериев Бабушкина из 5 Валериев Бабушкинов
😯 😯 😯 😯 😯 / 😯 😯 😯 😯 😯
  • 🏆 18
  • ❤ 4
  • 😁 1
  • 💩 1
  • 🍌 1
More from @eboutdatascience
  1. Oct 1, 2026Симулятор Дата Суетолога - отзыв действующего слона 🚬 В предыдущих постах (первый пост, в…
  2. Sep 29, 2026Как выбрать трек: Classic ML, NLP/LLM или Agents 🍔 Мне часто прилетает вопрос в ЛС: Дим,…
  3. Sep 28, 2026Запись эфира про накрутку, ИИ на собесах, двух работах со стороны лида из Сбера 🤑 Ребят,…
  4. Sep 25, 2026Эфир - Что спросим у лида из Сбера? 👀 УЖЕ ЗАВТРА, то есть в субботу, 26 сентября в 18:00…
  5. Sep 25, 2026РАЗБОР СОБЕСА в Т-Банк на 350к middle+ по NLP, LLM, Agents - НОВЫЙ ДРОП 😎 Выложил разбор…
  6. Sep 24, 2026Нужна ваша помощь - собираем данные для нас же 👒 Так как я копаюсь в рынке найма, IT и DS…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →