Vai al contenuto

Attiva l'algoritmo di Spotify con Dynamoi

Inizia gratis

Dynamoi Formazione

Analisi audio Spotify: CNN e le funzionalità audio 13

Spotify utilizza reti neurali convoluzionali per estrarre le caratteristiche audio 13 dalle forme d'onda crude. Queste raccomandazioni di Radio, Autoplay e avviamento a freddo per le nuove versioni.

Guida pratica 6 min di lettura
A paper craft diorama showing a sound wave entering a machine and becoming data dials for energy and valence.

Chiave da asporto

Spotify utilizza reti neurali convoluzionali (CNN) per analizzare spettrogrammi di forme d'onda audio grezze ed estrarre le caratteristiche misurabili 13 per traccia, tra cui tempo, energia, valenza, ballabilità e chiave. Queste caratteristiche alimentano Radio e Autoplay trovando vicini solutamente compatibili, e risolvono il problema di partenza freddo per nuovi artisti senza storia di ascolto. Per Discover Weekly, l'analisi audio agisce come tiebreaker quando le tracce dei candidati condividono punteggi di filtraggio collaborativi simili.

Come funziona l'analisi audio a Spotify

Quando una traccia viene caricata a Spotify attraverso un distributore, passa attraverso un canale di analisi audio automatizzato. Il sistema elabora la forma d'onda grezza ed estrae decine di caratteristiche misurabili.

La tecnologia principale è ** reti neurali convoluzionali (CNN)**, lo stesso tipo di modelli di apprendimento automatico utilizzati per il riconoscimento delle immagini. Invece di analizzare i pixel, le CNN di Spotify analizzano spectrograms, che sono rappresentazioni visive delle frequenze sonore nel tempo.

La CNN impara a rilevare i modelli in questi spettrogrammi: forti tamburi e sintetizzatori suggeriscono musica elettronica o da ballo; schemi di chitarra acustica mellow indicano generi folk o cantautore; strutture armoniche complesse potrebbero segnalare jazz o classici.

L'audio presenta estratti Spotify

Spotify API espone le caratteristiche audio 13 per ogni traccia. Questi sono i blocchi di costruzione che l'algoritmo utilizza per misurare la somiglianza sonica.

Caratteristiche ritmiche e tempo

Caratteristica Definizione Ampiezza
tempo Beati stimati al minuto (BPM) 0-250
time_signature Beats per misura (3/4, 4/4, ecc.) 1-7
danceability Come adatto per ballare in base al tempo, alla stabilità del ritmo, alla forza del battito 0.0-1.0

Danceability non è solo tempo. Una traccia 120 BPM con ritmi irregolari segna meno di una traccia 100 BPM con scanalatura costante.

Caratteristiche di energia e intensità

Caratteristica Definizione Ampiezza
energy Misura percettiva di intensità e di attività 0.0-1.0
loudness Potenza complessiva in decibel (dB) -60 a 0 dB

Energy combina segnali multipli: gamma dinamica, rumorosità percepita, timbro, frequenza di insorgenza (come spesso iniziano nuovi suoni), e entropia complessiva. Il death metal segna un punteggio alto; un preludio di Bach segna bassi.

Caratteristiche tonali

Caratteristica Definizione Ampiezza
key Il centro tonale della pista 0-11 (C=0, C#=1, ecc.)
mode Maggiore (1) o minore (0) 0 o 1

Queste caratteristiche aiutano le tracce del gruppo algoritmo con strutture armoniche compatibili, in modo che Radio e Autoplay possono muoversi tra loro senza un cambiamento chiave di Jarring.

Mood e caratteristiche del carattere

Caratteristica Definizione Ampiezza
valence Positività musicale (felice vs triste) 0.0-1.0
acousticness Confidenza che la pista è acustica 0.0-1.0
instrumentalness Predetti se la traccia non ha voce 0.0-1.0
speechiness Presenza di parole parlate 0.0-1.0
liveness Probability la traccia è stata eseguita dal vivo 0.0-1.0

Valence è particolarmente importante per le raccomandazioni basate sull'umore. Una traccia ad alta frequenza (0.8+) suona allegra o euforica. Una pista a bassavalenza (0.2 o sotto) suona triste, malinconico, o arrabbiato.

Come le caratteristiche audio influenzano le raccomandazioni

L'analisi audio risolve il problema dell'inizio del freddo. Quando un nuovo artista carica la sua prima traccia, non ha alcuna storia di ascolto o dati di filtraggio collaborativi. Ma le caratteristiche audio sono disponibili immediatamente.

Ecco come ogni superficie algoritmica utilizza l'analisi audio:

Radio e Autoplay

Quando Radio genera una coda basata su una traccia di seme, la somiglianza audio è il segnale principale. L'algoritmo trova tracce con simili:

  • Tempo (entro una gamma ragionevole per transizioni lisce)
  • Livello energetico (per mantenere l'intensità della sessione)
  • Chiave e modalità (per compatibilità armonica)
  • Valenza (per preservare il tono emotivo)

Ecco perché una stazione radio semenzata da una traccia elettronica ad alta energia non inserirà improvvisamente una ballata acustica lenta, anche se entrambe le canzoni condividono tag di genere.

Discover Weekly

Discover Weekly utilizza principalmente filtraggio collaborativo, ma l'analisi audio agisce come tiebreaker. Quando più brani candidati hanno punteggi simili sovrapposizioni di ascolto, l'algoritmo favorisce quelli con caratteristiche audio più vicine al tuo profilo di gusto esistente.

Quali artisti possono imparare dalle caratteristiche audio

Non è possibile controllare come Spotify analizza l'audio. Ma conoscere queste caratteristiche ti dice come l'algoritmo ascolta la tua musica, e con quali tracce raggruppa la tua.

Controllare le caratteristiche audio della tua traccia

Tip Strumenti di terze parti possono tirare le caratteristiche audio della tua traccia da Spotify API. Cercare servizi che consentono di inserire una traccia Spotify URL e restituire i valori delle funzionalità.

Cosa cercare:

  • Le funzioni costanti nel tuo catalogo aiutano l'algoritmo a raggruppare la tua musica. Se le tue tracce variano selvaggiamente in energia, tempo e valenza, l'algoritmo ha un tempo più difficile predire chi li godrà.
  • Caratteristiche che corrispondono al pubblico target migliorano il posizionamento Radio. Se il tuo suono è ad alta energia e ballabile, le tue tracce sono più propensi a comparire in sessioni di allenamento e party-oriented Radio.

Il problema intro

L'analisi audio esamina la traccia completa, ma il comportamento dell'ascoltatore è fortemente influenzato dai primi secondi 30. Se il vostro intro ha caratteristiche diverse rispetto al resto della canzone (un intro ambiente tranquillo prima di un forte calo), le caratteristiche audio potrebbero non riflettere ciò che gli ascoltatori sperimentano prima.

Questo può creare un errore: l'algoritmo consiglia la tua traccia in base all'energia complessiva, ma gli ascoltatori saltano perché l'introduzione non corrisponde alle loro aspettative. Ottimizzare l'introduzione è un'abilità separata da ottimizzare il profilo audio complessivo.

Limitazioni di analisi audio

L'analisi audio è potente, ma ha punti ciechi:

Il contesto culturale manca. L'algoritmo sa che la tua traccia ha un'alta energia e un tempo 128 BPM, ma non sa che i testi fanno riferimento a un momento culturale specifico o che lo stile di produzione evoca un'epoca particolare.

I suoni similari non sono uguali a quelli simili. Due tracce possono avere caratteristiche audio quasi identiche, ma appello a ascoltatori completamente diversi. L'analisi audio trova vicini sonici, non vicini di pubblico.

Il gene è deferito, non dichiarato. Spotify utilizza i tag di genere forniti dal distributore, ma l'analisi audio può ignorarli se le caratteristiche soniche non corrispondono. Una traccia contrassegnata come "hip-hop" che suona come gente acustica può ottenere raccomandato agli ascoltatori popolari invece.

Il ruolo dell'audio nell'algoritmo più ampio

L'analisi audio è una delle tre principali fonti di dati che l'algoritmo Spotify utilizza:

Fonte di dati Cosa cattura Il meglio per
** Filtro collaborativo ** Ascoltare i modelli tra gli utenti Trovare sovrapposizione del pubblico
Elaborazione linguistica naturale Lyrics, titoli di playlist, citazioni web Comprensione del contesto culturale
**Audio analisi ** Caratteristiche Sonic della forma d'onda Trovare tracce sonicamente simili

Per artisti affermati, il filtraggio collaborativo domina. Per i nuovi artisti, l'analisi audio porta più peso perché non c'è storia di ascolto da analizzare.

L'obiettivo è quello di rilasciare la musica con caratteristiche audio chiare e coerenti durante la costruzione di una base di ascoltatori impegnati. L'analisi audio ti fa scoprire; i segnali di coinvolgimento determinano se continui a essere raccomandato.