Наткнулся на статью https://blog.wilsonl.in/search-engine/, где чел весьма подробно рассказывает, как с нуля зафигачил семантический поиск (включая сбор данных) по 3млрд документов
Понравилось, что описывается не просто "я сделал так-то", а "попробовал так-то, не получилось, поэтому сделал вот так"
Рекомендую почитать + погулять по референсам — там много интересного как про ML, так и про инфру и бэкенд
Post #187
10.8K