Во-первых: чтобы создать «интеллект» — нужно сначала понять, что такое интеллект или сознание, и как оно устроено 🙄
Открываем Википедию и читаем определение интеллекта:
Способность к абстракции, логике, пониманию, самосознанию, обучению, эмоциональному знанию, рассуждению, планированию, творчеству, критическому мышлению и решению проблем.
Получается ИИ от этого ещё очень далёк 😅
Во-вторых: возьмём большие языковые модели: Generative Pre-trained Transformer — «генеративный предварительно обученный трансформер» или нейросети для генерации изображений.
Пример из продуктовой задачи, которую мне нужно было решить.
Открываем ChatGPT-4 (Dall-E) и пытаемся сделать следующую картинку:
Мне нужна картинка робота-итальянца, который делает типичный итальянский эмоциональный жест: Pinched Fingers, пример emoji 🤌
(тут опустим все технически дополнения к промпту)
Все же представили себе примерную картинку в голове? 😁 Мне не важно было как и где будет стоять этот робот, важен был лишь жест и что его покажет робот.
И вот тут начинаются танцы с бубном: жест этот Dall-E 3 воспроизвести не может, Midjourney тоже, Stable Diffusion туда же.
Сам жест в итальянском может называться по-разному: a carciofo (артишок), a borsa (сумка), a sacchetto (пакет/мешок), a tulipano (тюльпан), и так далее, плюс региональные разновидности в зависимости от диалекта... 😩
Никакое из этих уточнений не помогло, потому что, например, векторный вес слова «артишок» в модели относится больше к овощу, а не жесту, поэтому на картинках появляется не жест, а овощная культура 🤷♂️
Помимо этого, изначально в запросе был ключ не «робот», а «андроид» — человекоподобный робот, в результате все картинки были в форме операционной системы Android 🤪
Мир, пока ещё может спать спокойно ¯\_(ツ)_/¯
Закинь друзьям | Канал Прожарка от ДГ
