Big Data Science [RU] — канал о жизни Data Science.
Для сотрудничества: a.chernobrovov@gmail.com
🌏 — https://t.me/bdscience — Big Data Science channel (english version)
💼 — https://t.me/bds_job — channel about Data Science jobs and career
Post #379
2.19K
🤔ТОП-4 рисков embedding’ов в ML
Встраиваемые модели широко используются в машинном обучении чтобы перевести необработанные входные данные в низкоразмерный вектор, который фиксирует их семантическое значение и может использоваться для различных последующих моделей. Предварительно обученные встраивания в качестве экстракторов признаков используются для разработки фичей различных типов входных данных (текст, изображение, аудио, видео, мультимодальный) или категориальные признаки с высокой кардинальностью.
Главными рисками embedding’ов считаются:
• Высокая запутанность - изменение выходных данных восходящей модели встраивания влияет на производительность нижестоящей модели. Полагаясь на выходные данные embedding-модели, следует переобучать нижестоящие модели.
• Скрытые петли обратной связи. Предварительно обученные фичи встраивания часто используются как черный ящик. Но знание того, на чем обучалось встраивание необработанных входных данных, очень важно для качества модели и ее интерпретируемости.
• Высокие затраты на вывод в реальном времени требует больших затрат (хранение и обслуживание). Это напрямую влияет на рентабельность инвестиций в ML. Важно обеспечить качество во время сбоев в обслуживании встраивания, стоимость обучения и стоимость обслуживания за запрос.
• Высокая стоимость отладки - отладка и мониторинг встроенных фичей или основных причин сбоев обходится очень дорого. Поэтому следует отказаться от встроенных фичей, которые не имеют большого значения для модели.
https://medium.com/better-ml/embeddings-the-high-interest-credit-card-of-feature-engineering-414c00cb82e1
Встраиваемые модели широко используются в машинном обучении чтобы перевести необработанные входные данные в низкоразмерный вектор, который фиксирует их семантическое значение и может использоваться для различных последующих моделей. Предварительно обученные встраивания в качестве экстракторов признаков используются для разработки фичей различных типов входных данных (текст, изображение, аудио, видео, мультимодальный) или категориальные признаки с высокой кардинальностью.
Главными рисками embedding’ов считаются:
• Высокая запутанность - изменение выходных данных восходящей модели встраивания влияет на производительность нижестоящей модели. Полагаясь на выходные данные embedding-модели, следует переобучать нижестоящие модели.
• Скрытые петли обратной связи. Предварительно обученные фичи встраивания часто используются как черный ящик. Но знание того, на чем обучалось встраивание необработанных входных данных, очень важно для качества модели и ее интерпретируемости.
• Высокие затраты на вывод в реальном времени требует больших затрат (хранение и обслуживание). Это напрямую влияет на рентабельность инвестиций в ML. Важно обеспечить качество во время сбоев в обслуживании встраивания, стоимость обучения и стоимость обслуживания за запрос.
• Высокая стоимость отладки - отладка и мониторинг встроенных фичей или основных причин сбоев обходится очень дорого. Поэтому следует отказаться от встроенных фичей, которые не имеют большого значения для модели.
https://medium.com/better-ml/embeddings-the-high-interest-credit-card-of-feature-engineering-414c00cb82e1
- 👍 1



