Comment fonctionne l'analyse audio à Spotify
Lorsqu'une piste est téléchargée sur Spotify par l'intermédiaire d'un distributeur, elle passe par un pipeline d'analyse audio automatisé. Le système traite la forme d'onde brute et extrait des dizaines de caractéristiques mesurables.
La technologie de base est les réseaux neuronaux convolutionnels (RCN), le même type de modèles d'apprentissage automatique utilisés pour la reconnaissance d'images. Au lieu d'analyser les pixels, les CNN de Spotify analysent spectrogrammes, qui sont des représentations visuelles des fréquences sonores au fil du temps.
Le CNN apprend à détecter les motifs dans ces spectrogrammes : des rythmes de tambour et des synthétiseurs forts suggèrent de la musique électronique ou de la danse; des motifs de guitare acoustiques moelleux indiquent des genres folkloriques ou chanteur-compositeur; des structures harmoniques complexes peuvent signaler le jazz ou le classique.
L'audio comprend des extraits Spotify
Spotify API expose les fonctionnalités audio 13 pour chaque piste. Ce sont les éléments de base que l'algorithme utilise pour mesurer la similarité sonique.
Caractéristiques du rythme et du tempo
| Fonctionnalité | Définition | Portée |
|---|---|---|
tempo |
Nombre estimé de battements par minute (BPM) | 0-250 |
time_signature |
Battements par mesure (3/4, 4/4, etc.) | 1-7 |
danceability |
Comment convient pour la danse basée sur le tempo, la stabilité du rythme, la force de battement | 0.0-1.0 |
Danceability n'est pas que du tempo. Une piste 120 BPM avec des rythmes irréguliers scores inférieurs à une piste 100 BPM avec une rainure constante.
Caractéristiques énergétiques et d'intensité
| Fonctionnalité | Définition | Portée |
|---|---|---|
energy |
Mesure perceptive de l'intensité et de l'activité | 0.0-1.0 |
loudness |
Sonorité générale en décibels (dB) | -60 à 0 dB |
Energy combine plusieurs signaux : portée dynamique, sonorité perçue, timbre, vitesse d'apparition (combien de nouveaux sons commencent) et entropie globale. Death metal marque haut; un prélude Bach marque bas.
Caractéristiques tonales
| Fonctionnalité | Définition | Portée |
|---|---|---|
key |
Le centre tonal de la piste | 0-11 (C=0, C#=1, etc.) |
mode |
Major (1) ou mineur (0) | 0 ou 1 |
Ces fonctionnalités aident le groupe algorithme à suivre des pistes avec des structures harmoniques compatibles, de sorte que Radio et Autoplay peuvent se déplacer entre eux sans changer de clé.
Caractéristiques de l'humeur et du caractère
| Fonctionnalité | Définition | Portée |
|---|---|---|
valence |
positif musical (heureuse ou triste) | 0.0-1.0 |
acousticness |
Confiance que la piste est acoustique | 0.0-1.0 |
instrumentalness |
Prévoit si la piste n'a pas de voix | 0.0-1.0 |
speechiness |
Présence de mots parlés | 0.0-1.0 |
liveness |
Probabilité la piste a été effectuée en direct | 0.0-1.0 |
Valence est particulièrement important pour les recommandations basées sur l'humeur. Une piste haute-valence (0.8+) semble gaie ou euphorique. Une piste à faible valence (0.2 ou moins) semble triste, mélancolique ou en colère.
Comment les fonctionnalités audio influencent les recommandations
L'analyse audio résout le problème froid de démarrage. Lorsqu'un nouvel artiste télécharge sa première piste, il n'a pas d'historique d'écoute ni de données de filtrage collaborative. Mais les fonctionnalités audio sont immédiatement disponibles.
Voici comment chaque surface algorithmique utilise l'analyse audio:
Radio et Autoplay
Lorsque Radio génère une file d'attente basée sur une piste de semences, la similarité audio est le signal principal. L'algorithme trouve des pistes avec similaire:
- Tempo (dans une plage raisonnable pour les transitions en douceur)
- Niveau d'énergie (pour maintenir l'intensité de la session)
- Clé et mode (pour la compatibilité harmonique)
- Valence (pour préserver le ton émotionnel)
C'est pourquoi une station de radio ensemencée d'une piste électronique à haute énergie n'insèrera pas soudainement une ballade acoustique lente, même si les deux chansons partagent des étiquettes de genre.
Discover Weekly
Discover Weekly utilise principalement filtrage collaboratif, mais l'analyse audio agit comme un bris d'attache. Lorsque plusieurs pistes candidates ont des scores de chevauchement d'écoute similaires, l'algorithme favorise ceux avec des fonctionnalités audio plus proches de votre profil de goût existant.
Ce que les artistes peuvent apprendre des fonctionnalités audio
Vous ne pouvez pas contrôler comment Spotify analyse votre audio. Mais la connaissance de ces fonctionnalités vous indique comment l'algorithme entend votre musique, et avec quelles pistes il regroupera la vôtre.
Vérification des fonctionnalités audio de votre piste
Tip Des outils tiers peuvent tirer les fonctionnalités audio de votre piste de Spotify API. Recherchez les services qui vous permettent d'entrer une piste Spotify URL et retournez les valeurs de la fonctionnalité.
Que chercher:
- Les fonctionnalités cohérentes de votre catalogue aident l'algorithme à regrouper votre musique. Si vos pistes varient sauvagement en énergie, tempo et valence, l'algorithme a un temps plus difficile à prévoir qui les appréciera.
- Caractéristiques qui correspondent à votre public cible améliorer le placement radio. Si votre son est à haute énergie et dansable, vos pistes sont plus susceptibles d'apparaître dans des séances d'entraînement et de radio orientées vers la fête.
Le problème de l'intro
L'analyse audio examine la piste complète, mais le comportement de l'auditeur est fortement influencé par les premières secondes 30. Si votre intro a des caractéristiques différentes du reste de la chanson (une intro ambiante tranquille avant une forte goutte), les fonctionnalités audio peuvent ne pas refléter ce que les auditeurs éprouvent en premier.
Cela peut créer un décalage : l'algorithme recommande votre piste en fonction de l'énergie globale, mais les auditeurs sautent parce que l'intro ne correspond pas à leurs attentes. Optimiser votre intro est une compétence distincte de l'optimisation de votre profil audio global.
Limites de l'analyse audio
L'analyse audio est puissante, mais elle a des points aveugles :
Le contexte culturel est absent. L'algorithme sait que votre piste a une énergie élevée et un tempo 128 BPM, mais il ne sait pas que les paroles font référence à un moment culturel spécifique ou que le style de production évoque une époque particulière.
Les sons similaires ne sont pas les mêmes que les auditoires semblables. Deux pistes peuvent avoir des fonctionnalités audio presque identiques mais séduisent des auditeurs complètement différents. L'analyse audio trouve des voisins soniques, pas des voisins du public.
Le genre est inféré, non déclaré. Spotify utilise les étiquettes de genre fournies par votre distributeur, mais l'analyse audio peut les surcharger si les caractéristiques sonores ne correspondent pas. Une piste marquée comme "hip-hop" qui sonne comme folk acoustique peut être recommandé aux auditeurs folk à la place.
Le rôle de l'audio dans l'algorithme plus large
L'analyse audio est l'une des trois principales sources de données utilisées par l'algorithme Spotify:
| Source des données | Ce qu'il capture | Meilleur pour |
|---|---|---|
| ** Filtrage collaboratif** | Modèles d'écoute parmi les utilisateurs | Trouver des chevauchements d'audience |
| ** Traitement des langues naturelles** | Lyrics, titres de playlist, mentions web | Comprendre le contexte culturel |
| Analyse audio | Caractéristiques soniques de la forme d'onde | Trouver des pistes soniques similaires |
Pour les artistes établis, le filtrage collaboratif domine. Pour les nouveaux artistes, l'analyse audio a plus de poids parce qu'il n'y a pas d'histoire d'écoute à analyser.
Le but est de diffuser de la musique avec des caractéristiques audio claires et cohérentes tout en construisant une base d'auditeurs engagés. L'analyse audio vous fait découvrir ; les signaux d'engagement déterminent si vous continuez à être recommandé.