Подготовка музыкальных файлов

Подготовка музыкальных файлов

Категория статьи: Нейронные сети

Проект: Shazam своими руками

Подготовка музыкальных файлов для обучения модели нейронной сети

При подготовке данных для обучения модели нейронной сети я взял несколько музыкальных файлов в формате mp3 (около 40 штук) нарезал их на кусочки и отдал на обучение в модель с простенькой структурой (все эти действия подробно будут описаны в следующих статьях) и обучил модель.

На проверочных данных модель показала очень даже хорошие результаты! Но при реальном тестировании, когда 2х секундный кусочек записанный с микрофона я отдавал на распознавание, модель выдавала, откровенно говоря, ерунду!

Начал разбираться и первое, что я сделал - это записал полностью музыкальную композицию с микрофона и прослушал её! Конечно, звуковой файл слишком отличался от оригинала, т.к. микрофоны, в большинстве мобильных устройств и не только мобильных не являются профессиональными и не способны качественно производить звукозапись. Так же при записи появляется дополнительный шум в зависимости от того в каком помещении производится звукозапись.

Вот, например, как звучит оригинальная композиция

А вот так, записанная с микрофона


Стало понятно, что данные, на которых обучалась модель очень сильно отличаются от тех данных, которые подаются для предсказания

Сначала я подумал, может выделить шум из записи с микрофона, наложить его на оригинальные композиции и снова обучить модель, но полученные композиции с наложенным шумом, могут сильно отличаться от реально записанных с микрофона, тем более при записи микрофон обрезает высокие и низкие частоты. Эта задача мне показалась достаточно трудоемкой. Возможно позже я вернусь к этой задаче и попробую реализовать её, но в данном проекте я принял другое решение: записать все композиции на микрофон и уже из этих записей сделать обучающую выборку.