Искусственный американо-немецкий интеллект
Наборы данных — основа для машинного обучения и построения моделей.
Если набор данных основан преимущественно на поведении антилоп в Африке, вряд ли он позволит создать хорошую модель поведения медведей в Америке.
Поведение людей в соответствующих странах, конечно, отличается меньше, чем поведение антилоп и медведей, но, тем не менее, отличается.
Бернард Кох и коллеги изучили, откуда ИИ-исследователи берут наборы данных. Для этого они проанализировали более 60 тысяч ИИ-исследований за 2015-2020 годы.
Как оказалось, в этих исследованиях были использованы 4 384 набора данных, но более чем 50% из них происходят из одних и тех же 12 источников:
1. Стэнфордский университет (их наборы данных наиболее популярны)
2. Майкрософт
3. Принстонский университет
4. Общество Макса Планка
5. Гугл
6. Китайский университет Гонконга
7. AT&T
8. Технологический институт Тойота в Чикаго
9. Нью-Йоркский университет
10. Технологический институт Джорджии
11. Калифорнийский университет в Беркли
12. Фейсбук
При этом большинство наборов данных происходят из США (27 тысяч случаев использования) и Германии (2,6 тысяч случаев использования).
В то же время наборы данных из Бразилии использовались только в 11 случаях, из России — в 8 случаях, из Индонезии — в 2 случаях. Из всей Африки в выборки попал только Египет, и то только в 12 случаях.
Очевидно, что об универсальной точности и применимости моделей, обученных на таких данных, пока говорить не приходится.
Post #338
1.38K

- 👍 8