Miten ääniteoksen analyysi toimii Spotify:ssa
Kun musiikki ladatetaan Spotify:lle jakajan kautta, se menee automaattisen ääninalyysin läpi. Järjestelmä käsittelee raakaa aaltomuotoa ja saa pois kymmeniä mitattavia ominaisuuksia.
Ydinteknologia on konvoluutionneuraaliset verkot (CNN), samat kuin kuvien tunnistamiseen käytetyt koneoppimäden mallit.
CNN oppii havaitsemaan malleja näissä spektrogrammissa: vahvat rummujuutukset ja synteesiot viittaavat sähköiseen tai tanssimusiikkaan; pehmeät akustiset kitaran mallit viittaavat folk- tai laulaja-laulujen kirjoittajan genreihin; monimutkaiset harmoniset rakenteet voivat signaalittää jazzia tai klassista.
Kuuntelu sisältää Spotify-erät
Spotify:n API paljastaa 13 äänimuotoisuutta jokaisesta kappaleesta.
Rytmikohdat ja tempo
| Merkintä | Määritelmä | Kaikkiaan |
|---|---|---|
| Kylmyt | Arvioituja lyöntejä minuutissa (BPM) | 0-250 |
| Kylmyt | Pystytys mittauksen kohden (3/4, 4/4, jne.) | 1-7 |
| Kylmyt | Miten sopivia tanssimaan tempoon, rytmin vakauteen, lyöntivoimaan perustuen | 0.0-1.0 |
Danceability ei ole vain tempo. 120 BPM-raito, jossa on epäjohdonmukainen rytmi, on vähemmän kuin 100 BPM-raito, jossa on tasainen ratti.
Energian ja voimakkuuden ominaisuudet
| Merkintä | Määritelmä | Kaikkiaan |
|---|---|---|
| Kylmyt | Intenssiivisuuden ja toiminnan havainnolliset mittaukset | 0.0-1.0 |
| Kylmyt | Kokonaislaatu decibelissä (dB) | -60 - 0 dB |
Energy yhdistää useita signaaleja: dynaaminen valikoima, havaittu ääntävyys, timbre, alkamisnopeus (mitkä usein uudet äänet alkavat) ja yleinen entropia.
Tonaliset ominaisuudet
| Merkintä | Määritelmä | Kaikkiaan |
|---|---|---|
| Kylmyt | Rautan äänenkeskus | 0-11 (C=0, C#=1, jne.) |
| Kylmyt | Suuret (1) tai pienet (0) | 0 tai 1 |
Nämä ominaisuudet auttavat algoritmin ryhmäjälkiä yhteensopivilla harmonisillä rakenteilla, joten Radio ja Autoplay voivat liikkua niiden välillä ilman kiihdyttävää avaimenmuutosta.
Häätilan ja luonteen ominaisuudet
| Merkintä | Määritelmä | Kaikkiaan |
|---|---|---|
| Kylmyt | Musiikillinen positiivisuus (hyvää vs. surullista) | 0.0-1.0 |
| Kylpylä | Luottamus siitä, että radan on akustinen | 0.0-1.0 |
| Kylmyt | Ennustetaan, jos kappaleella ei ole soittelua | 0.0-1.0 |
| Kylmyt | Puhuttujen sanojen läsnäolo | 0.0-1.0 |
| Kylmyt | Todennäköisyys, että radan suoritettiin live-elokuvassa | 0.0-1.0 |
Valence on erityisen tärkeä mielialan perusteella tehtävissä suosituksissa. Korkeavalenssi (0.8+) kuulostaa iloiselta tai euphoriseksi.
Miten äänenominaisuudet vaikuttavat suosituksiin
Audio-analyysi ratkaisee kylmän aloitusongelman. Kun uusi taiteilija laittaa ensimmäisen kappaleen, hänellä ei ole kuunteluhistoriaa tai yhteistyöfiltrointitietoja.
Tässä on, miten jokainen algoritminen pinta käyttää ääninalyysiä:
Radio ja automaattinen leikki
Kun Radio luo jonon, joka perustuu siemenjälkeen, äänen vastaavuus on ensisijainen signaali.
- Tempo (suuntavainen vaihteluvalikoima)
- Energiataso (session voimakkuuden ylläpitämiseksi)
- Avain ja käyttötilan (harmonisen yhteensopivuuden osalta)
- Valence (säästäksesi tunteet)
Tämän vuoksi radioasema, joka on syntynyt korkean energian sähköisestä kappaleesta, ei yhtäkkiä laita hitaaa akustista baladaa, vaikka molemmat lauluja olisivat samankaltaisia.
Tutki viikot
Discover Weekly käyttää pääasiassa yhteistyösuodatus:tä, mutta äänen analyysi toimii tyybreakerina. Kun useilla kandidaattilauluilla on samanlaisia kuuntelu-osanotteluarvoja, algoritmi suosittelee niitä, joilla on äänen ominaisuudet, jotka ovat lähimpänä olemassa olevaa makuprofiiliasi.
Mitä taiteilijat voivat oppia äänenmuotoista
Spotify ei voi hallita äänesi analysointia, mutta näiden ominaisuuksien tunteminen kertoo, miten algoritmi kuulee musiikkiasi ja mitkä jäljet se yhdistää sinun musiikkiisi.
Tarkistan kappaleen äänimuotoisuuden
Tip Spotify:n API:stä voi saada jälkiesi äänenominaisuuksia.
Mitä etsiä:
- Kohtainen ominaisuus kataloogissa auttaa algoritmia keräämään musiikkia. Jos musiikkilaitteesi vaihtelevat voimakkaasti energiassa, tempoissa ja valenssissa, algoritmilla on vaikeampaa ennustaa, kuka nauttii niistä.
- Kohjeet, jotka sopivat kohdepuhelminne parantavat radion asettamista.
Esitelmäongelma
Kuuntelu analyysi tutkii koko kappaleen, mutta kuulijan käyttäytyminen vaikuttaa voimakkaasti ensimmäisten 30 sekunnin aikana.
Tämä voi aiheuttaa epäsopivuutta: algoritmi suosittelee kappaleen kokonaisen energian perusteella, mutta kuuntelijat ohjaavat, koska intro ei vastaa heidän odotuksiaan.
Kuunteluanalyysin rajoitukset
Äänetalous on voimakas, mutta siinä on sokea pisteitä:
** Kulttuurinen konteksti puuttuu.** Algoritmi tietää, että kappaleesi on voimakas ja 128 BPM:n tempo, mutta ei tiedä, että laulu viittaa tiettyyn kulttuuriseen hetkeen tai että tuotantotyyli herättää tiettyyn aikakauteen.
** Samanlaiset äänet eivät ole samanlaisia kuin samanlaiset yleisöt.** Kaksi kappaleesta voi olla lähes samanlaisia äänenominaisuuksia, mutta ne vetoavat täysin eri kuulijoille.
** Genre on johdettu, ei ilmoitettu.** Spotify käyttää jakelijan tarjoamia genre-merkkejä, mutta äänen analyysi voi korvata ne, jos äänen ominaisuudet eivät vastaa.
Äänestä johtuva rooli laajemmassa algoritmissa
Audio-analyysi on yksi Spotify-algoritmin käyttämästä kolmista tärkeimmistä tietolähteestä:
| Tiedonlähde | Mitä se saa kiinni | Parasta |
|---|---|---|
| ** Yhteistyösuodatus** | Kuuntelu- ja kuunteluvaikutukset käyttäjien välillä | Näyttelykysymykset |
| Todellinen kieli käsittely | Laulu, levylistat, verkkosivujen maininnat | Kulttuurikehyksen ymmärtäminen |
| Audio-analyysi | Aaltomuodon äänenominaisuudet | Kuulosta vastaavien jälkien löytäminen |
Uusien taiteilijoiden kannalta äänen analyysi on painokkaampi, koska kuuntelemista ei ole.
Tavoitteena on julkaista musiikki selkeillä ja johdonmukaisilla äänenominaisuuksilla samalla kun rakennetaan kiinnostunut kuuntelija.