Jak działa analiza dźwięku w Spotify
Kiedy ścieżka jest przesyłana do Spotify za pośrednictwem dystrybutora, przechodzi ona przez automatyczną analizę dźwięku. System przetwarza surową formę fali i wyciąga dziesiątki mierzalnych cech.
Główna technologia to sieci neuronowe konwolucyjne (CNN), to ten sam rodzaj modeli uczenia maszynowego stosowanych do rozpoznawania obrazu. Zamiast analizować piksele, CNNS Spotify analizuje spektrogramy, które są wizualizowanymi reprezentacjami częstotliwości dźwięku w czasie.
CNN uczy się wykrywać wzorce w tych spektrogramach: silne bicia bębna i syntezatory sugerują muzykę elektroniczną lub tańczącą; miękkie wzorce gitary akustycznej wskazują na gatunki ludowe lub śpiewacze-zamysłodawcy; złożone struktury harmonijne mogą sygnalizować jazz lub klasykę.
W audio funkcjonuje wyciągi Spotify
API Spotify ujawnia 13 funkcji dźwiękowych dla każdego utworu.
Funkcje rytmu i tempo
| Funkcja | Definicja | Zakres |
|---|---|---|
tempo |
Szacunkowe uderzenia na minutę (BPM) | 0-250 |
time_signature |
Wyniki w przypadku, gdy w przypadku, w przypadku, gdy w przypadku, w przypadku, gdy w przypadku, w przypadku, w przypadku, gdy w przypadku, w przypadku, w przypadku, w przypadku, gdy w przypadku, w przypadku, w przypadku, gdy w przypadku, w przypadku, w przypadku, gdy w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, gdy w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, gdy w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, w przypadku, | 1-7 |
danceability |
Jak odpowiednio do tańca na podstawie tempo, stabilności rytmu, siły uderzenia | 0.0-1.0 |
Danceability to nie tylko tempo. 120 BPM ścieżka z nieregularnymi rytmami wyniki niższe niż 100 BPM ścieżka z stałym rzutem.
Funkcje energetyczne i intensywności
| Funkcja | Definicja | Zakres |
|---|---|---|
| Wyroby | Wskaźnik percepcyjny intensywności i aktywności | 0.0-1.0 |
| Wyroby | Ogólna głośność w decibelach (dB) | -60 do 0 dB |
Energy łączy wiele sygnałów: zakres dynamiczny, odczuwana głośność, timbre, szybkość rozpoczęcia (jak często zaczynają się nowe dźwięki) i ogólną entropię.
Właściwości dźwiękowe
| Funkcja | Definicja | Zakres |
|---|---|---|
| Wyroby | Środek tonalny toru | 0-11 (C=0, C#=1, itp.) |
mode |
Główne (1) lub niegłówne (0) | 0 lub 1 |
Funkcje te pomagają algorytmowi grupy ścieżek z kompatybilnymi strukturami harmonijnymi, tak Radio i Autoplay mogą poruszać się między nimi bez zakłócających zmian klucza.
Sposób rozmowy i charakteru
| Funkcja | Definicja | Zakres |
|---|---|---|
| Wyroby | Pozytytatywność muzyczna (szczęśliwa w stosunku do smutnej) | 0.0-1.0 |
| Wyroby | Z pewnością, że ścieżka jest akustyczna | 0.0-1.0 |
| Wyroby | Przewidywać, czy utwór nie ma wokalu | 0.0-1.0 |
| Wyroby | Obecność wypowiedzianych słów | 0.0-1.0 |
| Wyroby | Prawdopodobieństwo wykonania toru na żywo | 0.0-1.0 |
Valence jest szczególnie ważny w przypadku zaleceń opartych na nastroju. ścieżka o wysokiej wartości (0,8+) brzmi radosnie lub euforycznie. ścieżka o niskiej wartości (0,2 lub poniżej) brzmi smutnie, melancholicznie lub złością.
Jak funkcje dźwiękowe wpływają na zalecenia
Analiza dźwięku rozwiązuje problem "chłodnego startu". Kiedy nowy artysta przesyła swój pierwszy utwór, nie ma historii słuchania ani danych filtrowania współpracy.
Oto jak każdy algorytm wykorzystuje analizę dźwięku:
Radio i odtwarzanie automatyczne
Kiedy Radio generuje kolejkę opartą na ścieżce z nasion, podobieństwo dźwiękowe jest głównym sygnałem.
- Tempo (w rozsądnym zakresie dla płynnych przejściu)
- Poziom energii (dla utrzymania intensywności sesji)
- Klucz i tryb (dla zgodności harmonijnej)
- Valence (przy zachowaniu emocjonalnego tonu)
Dlatego stacja radiowa, która pochodzi z elektronicznego utworu o wysokiej energii, nie włączy nagle wolnej bałady akustycznej, nawet jeśli obie piosenki mają wspólne tagy gatunkowe.
Odkryj co tydzień
Discover Weekly wykorzystuje głównie filtrowanie wspólne, ale analiza dźwięku działa jako rozkład. Kiedy wiele utworów kandydatów ma podobne wyniki słuchania, algorytm faworyzuje te z funkcjami dźwiękowymi najbliższymi istniejącemu profilowi smaku.
Czego artyści mogą się nauczyć z funkcji audio
Nie możesz kontrolować sposobu analizy dźwięku przez Spotify, ale znając te funkcje, możesz dowiedzieć się, jak algorytm słucha muzyki i z jakimi utworami będzie gromadził twoją.
Sprawdzanie funkcji dźwiękowych ścieżki
Tip Narzędzia zewnętrzne mogą wyciągnąć funkcje audio Twojej traczki z API Spotify. Szukaj usług, które pozwalają wprowadzić adres URL ścieżki Spotify i zwrócić wartości funkcji.
Co szukać:
- Jeśli ścieżki różnią się bardzo dużą ilością energii, tempo i wartości, algorytm nie potrafi przewidzieć, kto z nich będzie się cieszył.
- ** Funkcje pasujące do Twojej docelowej publiczności** poprawiają umieszczenie w radiu.
Problem z wprowadzeniem
Analiza dźwięku bada cały utwór, ale zachowanie słuchacza jest silnie wpływane przez pierwsze 30 sekund. Jeśli wprowadzenie ma inne cechy niż reszta piosenki (ciche wprowadzenie przed głośnym odtłaczeniem), funkcje dźwiękowe mogą nie odzwierciedlać tego, co słuchacze doświadczają najpierw.
W ten sposób można wywołać niezgodność: algorytm zaleca ścieżkę na podstawie ogólnej energii, ale słuchacze przechodzą, ponieważ wprowadzenie nie odpowiada ich oczekiwaniom.
Ograniczenia analizy dźwiękowej
Analiza dźwięku jest potężna, ale ma ślepe plamy:
** Brakuje kontekstu kulturalnego.** Algorytm wie, że twój utwór ma wysoką energię i tempo 128 BPM, ale nie wie, czy teksty odnoszą się do konkretnego momentu kulturalnego lub że styl produkcji wywołuje określoną erę.
Skorowe dźwięki nie są takie same jak podobne odbiorców. Dwie utwory mogą mieć prawie identyczne funkcje dźwiękowe, ale odwołują się do zupełnie innych słuchaczy.
Genery jest wywnioskowane, nie deklarowane. Spotify wykorzystuje tagy gatunkowe dostarczone przez dystrybutora, ale analiza dźwięku może je przeniesić, jeśli nie pasują do siebie cechy dźwiękowe.
Rola dźwięku w szerszym algorytmie
Analiza dźwięku jest jednym z trzech głównych źródeł danych wykorzystywanych przez algorytm Spotify:
| Źródło danych | Co to załapa | Najlepsze dla |
|---|---|---|
| Filtrujące wspólnie | Wzorce słuchania wśród użytkowników | Znalezienie publiczności |
| Prawo przetwarzania języka naturalnego | Teksty, tytuły playlist, wspomnienie w sieci | Zrozumienie kontekstu kulturalnego |
| ** Analiza dźwiękowa** | Charakterystyki dźwiękowe formy fali | Znalezienie podobnych ścieżek dźwiękowych |
Dla artystów, którzy już się rozpoczęli, filtrowanie współpracy dominuje, a dla nowych artystów analiza dźwięku ma większą wagę, ponieważ nie ma historii słuchania do analizy.
Celem jest wydawanie muzyki z jasnymi, spójnymi cechami dźwięku, a jednocześnie budowanie bazy słuchaczy.