Passer au contenu

Déclenchez l'algorithme Spotify avec Dynamoi

Commencer gratuitement

Apprendre avec Dynamoi

Spotify Analyse audio: CNN et les fonctionnalités audio 13

Spotify utilise des réseaux neuronaux convolutionnels pour extraire des fonctions audio 13 de formes d'onde brutes. Ces recommandations de puissance Radio, Autoplay et de démarrage à froid pour les nouvelles versions.

Guide pratique 6 min de lecture
A paper craft diorama showing a sound wave entering a machine and becoming data dials for energy and valence.

À retenir

Spotify utilise des réseaux neuronaux convolutionnels (RCN) pour analyser des spectrogrammes de formes d'ondes audio brutes et extraire des caractéristiques mesurables 13 par piste, y compris le tempo, l'énergie, la valence, la danceabilité et la clé. Ces fonctions de puissance Radio et Autoplay en trouvant des voisins soniques compatibles, et ils résolvent le problème de démarrage froid pour les nouveaux artistes sans histoire d'écoute. Pour Discover Weekly, l'analyse audio agit comme un tiebreaker lorsque les pistes candidates partagent des scores de filtrage collaboratifs similaires.

Comment fonctionne l'analyse audio à Spotify

Lorsqu'une piste est téléchargée sur Spotify par l'intermédiaire d'un distributeur, elle passe par un pipeline d'analyse audio automatisé. Le système traite la forme d'onde brute et extrait des dizaines de caractéristiques mesurables.

La technologie de base est les réseaux neuronaux convolutionnels (RCN), le même type de modèles d'apprentissage automatique utilisés pour la reconnaissance d'images. Au lieu d'analyser les pixels, les CNN de Spotify analysent spectrogrammes, qui sont des représentations visuelles des fréquences sonores au fil du temps.

Le CNN apprend à détecter les motifs dans ces spectrogrammes : des rythmes de tambour et des synthétiseurs forts suggèrent de la musique électronique ou de la danse; des motifs de guitare acoustiques moelleux indiquent des genres folkloriques ou chanteur-compositeur; des structures harmoniques complexes peuvent signaler le jazz ou le classique.

L'audio comprend des extraits Spotify

Spotify API expose les fonctionnalités audio 13 pour chaque piste. Ce sont les éléments de base que l'algorithme utilise pour mesurer la similarité sonique.

Caractéristiques du rythme et du tempo

Fonctionnalité Définition Portée
tempo Nombre estimé de battements par minute (BPM) 0-250
time_signature Battements par mesure (3/4, 4/4, etc.) 1-7
danceability Comment convient pour la danse basée sur le tempo, la stabilité du rythme, la force de battement 0.0-1.0

Danceability n'est pas que du tempo. Une piste 120 BPM avec des rythmes irréguliers scores inférieurs à une piste 100 BPM avec une rainure constante.

Caractéristiques énergétiques et d'intensité

Fonctionnalité Définition Portée
energy Mesure perceptive de l'intensité et de l'activité 0.0-1.0
loudness Sonorité générale en décibels (dB) -60 à 0 dB

Energy combine plusieurs signaux : portée dynamique, sonorité perçue, timbre, vitesse d'apparition (combien de nouveaux sons commencent) et entropie globale. Death metal marque haut; un prélude Bach marque bas.

Caractéristiques tonales

Fonctionnalité Définition Portée
key Le centre tonal de la piste 0-11 (C=0, C#=1, etc.)
mode Major (1) ou mineur (0) 0 ou 1

Ces fonctionnalités aident le groupe algorithme à suivre des pistes avec des structures harmoniques compatibles, de sorte que Radio et Autoplay peuvent se déplacer entre eux sans changer de clé.

Caractéristiques de l'humeur et du caractère

Fonctionnalité Définition Portée
valence positif musical (heureuse ou triste) 0.0-1.0
acousticness Confiance que la piste est acoustique 0.0-1.0
instrumentalness Prévoit si la piste n'a pas de voix 0.0-1.0
speechiness Présence de mots parlés 0.0-1.0
liveness Probabilité la piste a été effectuée en direct 0.0-1.0

Valence est particulièrement important pour les recommandations basées sur l'humeur. Une piste haute-valence (0.8+) semble gaie ou euphorique. Une piste à faible valence (0.2 ou moins) semble triste, mélancolique ou en colère.

Comment les fonctionnalités audio influencent les recommandations

L'analyse audio résout le problème froid de démarrage. Lorsqu'un nouvel artiste télécharge sa première piste, il n'a pas d'historique d'écoute ni de données de filtrage collaborative. Mais les fonctionnalités audio sont immédiatement disponibles.

Voici comment chaque surface algorithmique utilise l'analyse audio:

Radio et Autoplay

Lorsque Radio génère une file d'attente basée sur une piste de semences, la similarité audio est le signal principal. L'algorithme trouve des pistes avec similaire:

  • Tempo (dans une plage raisonnable pour les transitions en douceur)
  • Niveau d'énergie (pour maintenir l'intensité de la session)
  • Clé et mode (pour la compatibilité harmonique)
  • Valence (pour préserver le ton émotionnel)

C'est pourquoi une station de radio ensemencée d'une piste électronique à haute énergie n'insèrera pas soudainement une ballade acoustique lente, même si les deux chansons partagent des étiquettes de genre.

Discover Weekly

Discover Weekly utilise principalement filtrage collaboratif, mais l'analyse audio agit comme un bris d'attache. Lorsque plusieurs pistes candidates ont des scores de chevauchement d'écoute similaires, l'algorithme favorise ceux avec des fonctionnalités audio plus proches de votre profil de goût existant.

Ce que les artistes peuvent apprendre des fonctionnalités audio

Vous ne pouvez pas contrôler comment Spotify analyse votre audio. Mais la connaissance de ces fonctionnalités vous indique comment l'algorithme entend votre musique, et avec quelles pistes il regroupera la vôtre.

Vérification des fonctionnalités audio de votre piste

Tip Des outils tiers peuvent tirer les fonctionnalités audio de votre piste de Spotify API. Recherchez les services qui vous permettent d'entrer une piste Spotify URL et retournez les valeurs de la fonctionnalité.

Que chercher:

  • Les fonctionnalités cohérentes de votre catalogue aident l'algorithme à regrouper votre musique. Si vos pistes varient sauvagement en énergie, tempo et valence, l'algorithme a un temps plus difficile à prévoir qui les appréciera.
  • Caractéristiques qui correspondent à votre public cible améliorer le placement radio. Si votre son est à haute énergie et dansable, vos pistes sont plus susceptibles d'apparaître dans des séances d'entraînement et de radio orientées vers la fête.

Le problème de l'intro

L'analyse audio examine la piste complète, mais le comportement de l'auditeur est fortement influencé par les premières secondes 30. Si votre intro a des caractéristiques différentes du reste de la chanson (une intro ambiante tranquille avant une forte goutte), les fonctionnalités audio peuvent ne pas refléter ce que les auditeurs éprouvent en premier.

Cela peut créer un décalage : l'algorithme recommande votre piste en fonction de l'énergie globale, mais les auditeurs sautent parce que l'intro ne correspond pas à leurs attentes. Optimiser votre intro est une compétence distincte de l'optimisation de votre profil audio global.

Limites de l'analyse audio

L'analyse audio est puissante, mais elle a des points aveugles :

Le contexte culturel est absent. L'algorithme sait que votre piste a une énergie élevée et un tempo 128 BPM, mais il ne sait pas que les paroles font référence à un moment culturel spécifique ou que le style de production évoque une époque particulière.

Les sons similaires ne sont pas les mêmes que les auditoires semblables. Deux pistes peuvent avoir des fonctionnalités audio presque identiques mais séduisent des auditeurs complètement différents. L'analyse audio trouve des voisins soniques, pas des voisins du public.

Le genre est inféré, non déclaré. Spotify utilise les étiquettes de genre fournies par votre distributeur, mais l'analyse audio peut les surcharger si les caractéristiques sonores ne correspondent pas. Une piste marquée comme "hip-hop" qui sonne comme folk acoustique peut être recommandé aux auditeurs folk à la place.

Le rôle de l'audio dans l'algorithme plus large

L'analyse audio est l'une des trois principales sources de données utilisées par l'algorithme Spotify:

Source des données Ce qu'il capture Meilleur pour
** Filtrage collaboratif** Modèles d'écoute parmi les utilisateurs Trouver des chevauchements d'audience
** Traitement des langues naturelles** Lyrics, titres de playlist, mentions web Comprendre le contexte culturel
Analyse audio Caractéristiques soniques de la forme d'onde Trouver des pistes soniques similaires

Pour les artistes établis, le filtrage collaboratif domine. Pour les nouveaux artistes, l'analyse audio a plus de poids parce qu'il n'y a pas d'histoire d'écoute à analyser.

Le but est de diffuser de la musique avec des caractéristiques audio claires et cohérentes tout en construisant une base d'auditeurs engagés. L'analyse audio vous fait découvrir ; les signaux d'engagement déterminent si vous continuez à être recommandé.