Przejdź do treści

Dynamoi — Baza wiedzy

Analiza dźwięku Spotify: CNN i 13 funkcji dźwiękowych

Spotify wykorzystuje sieci neuronowe konwolucyjne do wydobycia 13 funkcji audio z surowych form fal.

Poradnik 6 min czytania
A paper craft diorama showing a sound wave entering a machine and becoming data dials for energy and valence.

Najważniejszy wniosek

Spotify wykorzystuje sieci neuronowe konwolucyjne (CNN) do analizy spektrogramów surowych fal dźwiękowych i wydobycia 13 mierzalnych funkcji na trasę, w tym tempo, energię, walencję, taniecność i klucz. Funkcje te napędzają radio i Autoplay poprzez znalezienie kompatybilnych sąsiadów dźwiękowo, a rozwiązują problem zimnego startu dla nowych artystów bez historii słuchania.

Jak działa analiza dźwięku w Spotify

Kiedy ścieżka jest przesyłana do Spotify za pośrednictwem dystrybutora, przechodzi ona przez automatyczną analizę dźwięku. System przetwarza surową formę fali i wyciąga dziesiątki mierzalnych cech.

Główna technologia to sieci neuronowe konwolucyjne (CNN), to ten sam rodzaj modeli uczenia maszynowego stosowanych do rozpoznawania obrazu. Zamiast analizować piksele, CNNS Spotify analizuje spektrogramy, które są wizualizowanymi reprezentacjami częstotliwości dźwięku w czasie.

CNN uczy się wykrywać wzorce w tych spektrogramach: silne bicia bębna i syntezatory sugerują muzykę elektroniczną lub tańczącą; miękkie wzorce gitary akustycznej wskazują na gatunki ludowe lub śpiewacze-zamysłodawcy; złożone struktury harmonijne mogą sygnalizować jazz lub klasykę.

W audio funkcjonuje wyciągi Spotify

API Spotify ujawnia 13 funkcji dźwiękowych dla każdego utworu.

Funkcje rytmu i tempo

Funkcja Definicja Zakres
tempo Szacunkowe uderzenia na minutę (BPM) 0-250
time_signature Wyniki w przypadku, gdy w przypadku, w przypadku, gdy w przypadku, w przypadku, gdy w przypadku, w przypadku, w przypadku, gdy w przypadku, w przypadku, w przypadku, w przypadku, gdy w przypadku, w przypadku, w przypadku, gdy w przypadku, w przypadku, w przypadku, gdy w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, gdy w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, gdy w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, 1-7
danceability Jak odpowiednio do tańca na podstawie tempo, stabilności rytmu, siły uderzenia 0.0-1.0

Danceability to nie tylko tempo. 120 BPM ścieżka z nieregularnymi rytmami wyniki niższe niż 100 BPM ścieżka z stałym rzutem.

Funkcje energetyczne i intensywności

Funkcja Definicja Zakres
Wyroby Wskaźnik percepcyjny intensywności i aktywności 0.0-1.0
Wyroby Ogólna głośność w decibelach (dB) -60 do 0 dB

Energy łączy wiele sygnałów: zakres dynamiczny, odczuwana głośność, timbre, szybkość rozpoczęcia (jak często zaczynają się nowe dźwięki) i ogólną entropię.

Właściwości dźwiękowe

Funkcja Definicja Zakres
Wyroby Środek tonalny toru 0-11 (C=0, C#=1, itp.)
mode Główne (1) lub niegłówne (0) 0 lub 1

Funkcje te pomagają algorytmowi grupy ścieżek z kompatybilnymi strukturami harmonijnymi, tak Radio i Autoplay mogą poruszać się między nimi bez zakłócających zmian klucza.

Sposób rozmowy i charakteru

Funkcja Definicja Zakres
Wyroby Pozytytatywność muzyczna (szczęśliwa w stosunku do smutnej) 0.0-1.0
Wyroby Z pewnością, że ścieżka jest akustyczna 0.0-1.0
Wyroby Przewidywać, czy utwór nie ma wokalu 0.0-1.0
Wyroby Obecność wypowiedzianych słów 0.0-1.0
Wyroby Prawdopodobieństwo wykonania toru na żywo 0.0-1.0

Valence jest szczególnie ważny w przypadku zaleceń opartych na nastroju. ścieżka o wysokiej wartości (0,8+) brzmi radosnie lub euforycznie. ścieżka o niskiej wartości (0,2 lub poniżej) brzmi smutnie, melancholicznie lub złością.

Jak funkcje dźwiękowe wpływają na zalecenia

Analiza dźwięku rozwiązuje problem "chłodnego startu". Kiedy nowy artysta przesyła swój pierwszy utwór, nie ma historii słuchania ani danych filtrowania współpracy.

Oto jak każdy algorytm wykorzystuje analizę dźwięku:

Radio i odtwarzanie automatyczne

Kiedy Radio generuje kolejkę opartą na ścieżce z nasion, podobieństwo dźwiękowe jest głównym sygnałem.

  • Tempo (w rozsądnym zakresie dla płynnych przejściu)
  • Poziom energii (dla utrzymania intensywności sesji)
  • Klucz i tryb (dla zgodności harmonijnej)
  • Valence (przy zachowaniu emocjonalnego tonu)

Dlatego stacja radiowa, która pochodzi z elektronicznego utworu o wysokiej energii, nie włączy nagle wolnej bałady akustycznej, nawet jeśli obie piosenki mają wspólne tagy gatunkowe.

Odkryj co tydzień

Discover Weekly wykorzystuje głównie filtrowanie wspólne, ale analiza dźwięku działa jako rozkład. Kiedy wiele utworów kandydatów ma podobne wyniki słuchania, algorytm faworyzuje te z funkcjami dźwiękowymi najbliższymi istniejącemu profilowi smaku.

Czego artyści mogą się nauczyć z funkcji audio

Nie możesz kontrolować sposobu analizy dźwięku przez Spotify, ale znając te funkcje, możesz dowiedzieć się, jak algorytm słucha muzyki i z jakimi utworami będzie gromadził twoją.

Sprawdzanie funkcji dźwiękowych ścieżki

Tip Narzędzia zewnętrzne mogą wyciągnąć funkcje audio Twojej traczki z API Spotify. Szukaj usług, które pozwalają wprowadzić adres URL ścieżki Spotify i zwrócić wartości funkcji.

Co szukać:

  • Jeśli ścieżki różnią się bardzo dużą ilością energii, tempo i wartości, algorytm nie potrafi przewidzieć, kto z nich będzie się cieszył.
  • ** Funkcje pasujące do Twojej docelowej publiczności** poprawiają umieszczenie w radiu.

Problem z wprowadzeniem

Analiza dźwięku bada cały utwór, ale zachowanie słuchacza jest silnie wpływane przez pierwsze 30 sekund. Jeśli wprowadzenie ma inne cechy niż reszta piosenki (ciche wprowadzenie przed głośnym odtłaczeniem), funkcje dźwiękowe mogą nie odzwierciedlać tego, co słuchacze doświadczają najpierw.

W ten sposób można wywołać niezgodność: algorytm zaleca ścieżkę na podstawie ogólnej energii, ale słuchacze przechodzą, ponieważ wprowadzenie nie odpowiada ich oczekiwaniom.

Ograniczenia analizy dźwiękowej

Analiza dźwięku jest potężna, ale ma ślepe plamy:

** Brakuje kontekstu kulturalnego.** Algorytm wie, że twój utwór ma wysoką energię i tempo 128 BPM, ale nie wie, czy teksty odnoszą się do konkretnego momentu kulturalnego lub że styl produkcji wywołuje określoną erę.

Skorowe dźwięki nie są takie same jak podobne odbiorców. Dwie utwory mogą mieć prawie identyczne funkcje dźwiękowe, ale odwołują się do zupełnie innych słuchaczy.

Genery jest wywnioskowane, nie deklarowane. Spotify wykorzystuje tagy gatunkowe dostarczone przez dystrybutora, ale analiza dźwięku może je przeniesić, jeśli nie pasują do siebie cechy dźwiękowe.

Rola dźwięku w szerszym algorytmie

Analiza dźwięku jest jednym z trzech głównych źródeł danych wykorzystywanych przez algorytm Spotify:

Źródło danych Co to załapa Najlepsze dla
Filtrujące wspólnie Wzorce słuchania wśród użytkowników Znalezienie publiczności
Prawo przetwarzania języka naturalnego Teksty, tytuły playlist, wspomnienie w sieci Zrozumienie kontekstu kulturalnego
** Analiza dźwiękowa** Charakterystyki dźwiękowe formy fali Znalezienie podobnych ścieżek dźwiękowych

Dla artystów, którzy już się rozpoczęli, filtrowanie współpracy dominuje, a dla nowych artystów analiza dźwięku ma większą wagę, ponieważ nie ma historii słuchania do analizy.

Celem jest wydawanie muzyki z jasnymi, spójnymi cechami dźwięku, a jednocześnie budowanie bazy słuchaczy.