К предыдущему посту:
Современные мультимодальные модели искусственного интеллекта успешно объединяют зрение с языком, звуком и осязанием, однако обоняние до сих пор остается неизученным из-за дефицита связанных данных.
Авторы представляют SmellNet-V, масштабируемый визуо-ольфакторный датасет, который объединяет реальные временные ряды показаний газовых датчиков с визуальными фотографиями природных ингредиентов из открытых источников.
Этот датасет относится к прикладной сенсорике искусственного носа и компьютерному зрению; пока что не к нейрофизиологии или изучению мозговой активности живых организмов. В нем оцифрованные данные летучих органических соединений от пятидесяти различных пищевых продуктов и специй программно сопоставляются с семантически подходящими изображениями тех же объектов.
На основе этого набора данных разработана самоконтролируемая нейросетевая структура See & Sniff, которая делит длительные записи на короткие временные окна, имитирующие вдохи-сниффы.
Предложенный подход использует плотное локальное выравнивание для построения совместных представлений визуальных и ольфакторных модальностей. За счет этого модель естественным образом генерирует карты значимости, которые точно указывают пространственное расположение источника аромата в кадре.
В исследовании также вводится принципиально новая задача локализации запахов на уровне отдельных пикселей и создается специализированный бенчмарк для ее оценки.
Эксперименты доказывают, что обучение на визуо-ольфакторных парах повышает точность классификации ароматов на семь процентов по сравнению с моделями, использующими только химические данные.
Разработанный фреймворк успешно решает задачи кросс-модального поиска изображений по запаху и обратного поиска запаха по картинке.
Детальный анализ подтверждает стабильный рост качества модели для фруктов, орехов, овощей и специй благодаря четкой связи химических профилей с их визуальными образами.
https://arxiv.org/pdf/2606.27307
Post #15639
303

- 👍 1
- 💯 1