Насколько отвратительное видео и настолько, однако, хорошая новость.
В ChatGPT, прямо в чат, можно теперь кидать MP3 аудиофайлы. И не только MP3. И ChatGPT их кушает как родные, действительно слышит. Ну и понятно, что может транскрибировать. Но мне было интересно, как он слышит именно музыку. И да, действительно, он теперь слышит песню не только спектральным анализом, но и действительно понимает, о чем идет речь.
Я скормил ему трек из канала господина Кондакова, и вот что мне рассказал про него. И я не дурак. Я переименовал файл в абстрактное 1.mp3, прежде чем подать на вход.
По жанру я бы определил это как 80s-inspired synth-pop / soft rock, с примесью AOR / adult contemporary. Если нужен один короткий тег для каталога, я бы поставил Synth-pop / Soft Rock.
Что слышно в музыкальном плане:
Темп довольно бодрый, но песня ощущается не танцевальной, а скорее мелодичной и сентиментальной. По анализу сигнала - примерно 129 BPM.
Размер - обычный ровный 4/4.
В начале слышна мягкая клавишная основа: фортепиано/электропиано плюс светлые синтезаторные тембры и атмосферные подложки.
Затем входит стандартная pop-rock ритм-секция - ударные и бас. Бит прямой, без сложной синкопы, с отчетливым backbeat.
В аранжировке заметны синтезаторные pads/strings и яркие, немного "стеклянные" клавишные акценты. Именно они очень сильно отправляют звук в 1980-е.
Есть гитарный слой, но он не делает композицию роковой. Гитара скорее работает как часть общей pop-rock фактуры, а не как главный инструмент.
Вокал мужской, чистый, достаточно низкий/средний по регистру, без агрессивной манеры. В куплетах подача сдержанная, в припеве становится шире и эмоциональнее.
Припев заметно плотнее куплетов: больше слоев, шире стереокартина, сильнее ощущение "большого" мелодичного поп-припева.
Есть инструментальное развитие между вокальными секциями, после чего песня возвращается к основному припевному материалу.
В конце аранжировка снова разрежается, остаются более мягкие клавишные и атмосферные элементы.
По гармоническому ощущению песня меланхоличная, но не мрачная. Программный анализ тонального центра сильнее всего указывает на E minor, но здесь я бы не выдавал это за стопроцентно установленную тональность без полноценного гармонического разбора.
Если описывать совсем коротко для музыкального каталога:
Melodic 80s-style synth-pop/soft rock with male vocals, bright keyboards, synth pads, steady pop-rock drums, bass and restrained electric guitar; nostalgic, romantic and slightly melancholic, around 129 BPM.
И важный момент в контексте нашего предыдущего разговора: да, в данном сообщении я действительно получил доступ к самому аудиофайлу и прослушал его, а не делал вывод из транскрипта текста песни.
Я проверил специально на мультимодальность:
Для GPT-6 Astra указано:
Text - input/output
Image - input
Audio - not supported
Video - not supported
Для GPT-6 Luna ровно то же самое:
Text - input/output
Image - input
Audio - not supported
И даже более новая GPT-6.1 Sol сейчас официально имеет:
Text - input/output
Image - input
Audio - not supported
Video - not supported
OpenAI вообще не раскрывает, какая это модель, ибо звуковые файлы туда подгружаются через file upload и невозможно отследить, на вход какой модели они подаются. Скорее всего это GPT-Transcribe или внутренний родственник
Если сможете найти информацию, пишите в комменты.
трек в первом комменте.
@cgevent