So funktioniert die Audioanalyse bei Spotify
Wenn ein Track über einen Distributor auf Spotify hochgeladen wird, durchläuft er eine automatisierte Audioanalyse-Pipeline. Das System verarbeitet die rohe Wellenform und extrahiert Dutzende messbarer Eigenschaften.
Die Kerntechnologie sind konvolutionale neuronale Netze (CNNs), also derselbe Typ maschineller Lernmodelle, der bei der Bilderkennung verwendet wird. Statt Pixel zu analysieren, untersuchen Spotifys CNNs Spektrogramme – visuelle Darstellungen von Schallfrequenzen im Zeitverlauf.
Das CNN lernt, Muster in diesen Spektrogrammen zu erkennen: starke Schlagzeugbeats und Synthesizer deuten auf elektronische Musik oder Dance hin; sanfte Akustikgitarrenmuster auf Folk oder Singer-Songwriter; komplexe harmonische Strukturen können Jazz oder Klassik signalisieren.
Die Audio-Merkmale, die Spotify extrahiert
Spotifys API stellt für jeden Track 13 Audio-Merkmale bereit. Sie bilden die Grundlage, mit der der Algorithmus klangliche Ähnlichkeit misst.
Merkmale für Rhythmus und Tempo
| Merkmal | Definition | Wertebereich |
|---|---|---|
tempo |
Geschätzte Schläge pro Minute (BPM) | 0-250 |
time_signature |
Schläge pro Takt (3/4, 4/4 usw.) | 1-7 |
danceability |
Eignung zum Tanzen anhand von Tempo, Rhythmusstabilität und Beatstärke | 0.0-1.0 |
Danceability ist nicht nur eine Frage des Tempos. Ein Track mit 120 BPM und unregelmäßigen Rhythmen erzielt einen niedrigeren Wert als ein Track mit 100 BPM und einem gleichmäßigen Groove.
Merkmale für Energie und Intensität
| Merkmal | Definition | Wertebereich |
|---|---|---|
energy |
Wahrnehmungsbasierte Messung von Intensität und Aktivität | 0.0-1.0 |
loudness |
Gesamtlautstärke in Dezibel (dB) | -60 bis 0 dB |
Energy kombiniert mehrere Signale: Dynamikumfang, wahrgenommene Lautheit, Klangfarbe, Einsatzrate (wie oft neue Klänge beginnen) und Gesamtentropie. Death Metal erzielt einen hohen Wert, ein Bach-Präludium einen niedrigen.
Tonale Merkmale
| Merkmal | Definition | Wertebereich |
|---|---|---|
key |
Tonales Zentrum des Tracks | 0-11 (C=0, C#=1 usw.) |
mode |
Dur (1) oder Moll (0) | 0 oder 1 |
Diese Merkmale helfen dem Algorithmus, Tracks mit kompatiblen harmonischen Strukturen zu gruppieren, sodass Radio und Autoplay ohne störenden Tonartwechsel zwischen ihnen wechseln können.
Merkmale für Stimmung und Charakter
| Merkmal | Definition | Wertebereich |
|---|---|---|
valence |
Musikalische Positivität (fröhlich vs. traurig) | 0.0-1.0 |
acousticness |
Wahrscheinlichkeit, dass der Track akustisch ist | 0.0-1.0 |
instrumentalness |
Prognose, ob der Track keinen Gesang enthält | 0.0-1.0 |
speechiness |
Anteil gesprochener Wörter | 0.0-1.0 |
liveness |
Wahrscheinlichkeit, dass der Track live aufgenommen wurde | 0.0-1.0 |
Valence ist für stimmungsbasierte Empfehlungen besonders wichtig. Ein Track mit hoher Valenz (0.8+) klingt fröhlich oder euphorisch. Ein Track mit niedriger Valenz (0.2 oder weniger) klingt traurig, melancholisch oder wütend.
Wie Audio-Merkmale Empfehlungen beeinflussen
Die Audioanalyse löst das Cold-Start-Problem. Wenn ein neuer Künstler seinen ersten Track hochlädt, gibt es noch keine Hörhistorie und keine Daten aus kollaborativem Filtern. Die Audio-Merkmale sind jedoch sofort verfügbar.
So nutzt jede algorithmische Fläche die Audioanalyse:
Radio und Autoplay
Wenn Radio eine Warteschlange auf Basis eines Seed-Tracks erstellt, ist die Audioähnlichkeit das wichtigste Signal. Der Algorithmus findet Tracks mit ähnlichen:
- Tempi (in einem angemessenen Bereich für weiche Übergänge)
- Energiepegeln (um die Intensität der Sitzung beizubehalten)
- Tonarten und Modi (für harmonische Kompatibilität)
- Valenzen (um den emotionalen Ton zu bewahren)
Deshalb fügt eine von einem energiegeladenen elektronischen Track gestartete Radio-Station nicht plötzlich eine langsame Akustikballade ein, selbst wenn beide Songs dieselben Genre-Tags haben.
Discover Weekly
Discover Weekly nutzt hauptsächlich kollaboratives Filtern, aber die Audioanalyse dient als Tiebreaker. Wenn mehrere Kandidaten ähnliche Scores beim Hör-Overlap haben, bevorzugt der Algorithmus jene mit Audio-Merkmalen, die deinem bestehenden Geschmacksprofil am nächsten kommen.
Was Künstler aus Audio-Merkmalen lernen können
Du kannst nicht steuern, wie Spotify dein Audio analysiert. Wenn du diese Merkmale kennst, verstehst du jedoch, wie der Algorithmus deine Musik hört und mit welchen Tracks er sie gruppiert.
Die Audio-Merkmale deines Tracks prüfen
Tip Drittanbieter-Tools können die Audio-Merkmale deines Tracks aus Spotifys API abrufen. Suche nach Diensten, bei denen du eine Spotify-Track-URL eingeben und die Merkmalswerte abrufen kannst.
Darauf solltest du achten:
- Konsistente Merkmale in deinem Katalog helfen dem Algorithmus, deine Musik zu clustern. Wenn sich deine Tracks bei Energie, Tempo und Valenz stark unterscheiden, kann der Algorithmus schwerer vorhersagen, wem sie gefallen.
- Merkmale, die zu deiner Zielgruppe passen, verbessern die Radio-Platzierung. Wenn dein Sound energiegeladen und tanzbar ist, erscheinen deine Tracks eher in Workout- und partyorientierten Radio-Sessions.
Das Intro-Problem
Die Audioanalyse untersucht den gesamten Track, aber das Verhalten der Hörer wird stark von den ersten 30 Sekunden beeinflusst. Wenn dein Intro andere Eigenschaften als der restliche Song hat (ein ruhiges Ambient-Intro vor einem lauten Drop), spiegeln die Audio-Merkmale möglicherweise nicht wider, was Hörer zuerst erleben.
Das kann zu einer Diskrepanz führen: Der Algorithmus empfiehlt deinen Track aufgrund seiner Gesamtenergie, aber Hörer skippen, weil das Intro nicht ihren Erwartungen entspricht. Dein Intro zu optimieren ist eine andere Fähigkeit als die Optimierung deines gesamten Audio-Profils.
Grenzen der Audioanalyse
Die Audioanalyse ist leistungsstark, hat aber blinde Flecken:
Kultureller Kontext fehlt. Der Algorithmus weiß, dass dein Track energiegeladen ist und ein Tempo von 128 BPM hat. Er weiß jedoch nicht, dass der Text auf einen bestimmten kulturellen Moment verweist oder der Produktionsstil an eine bestimmte Ära erinnert.
Ähnliche Klänge sind nicht dasselbe wie ähnliche Zielgruppen. Zwei Tracks können nahezu identische Audio-Merkmale haben, aber völlig unterschiedliche Hörer ansprechen. Die Audioanalyse findet klangliche Nachbarn, keine Publikumsnachbarn.
Genre wird abgeleitet, nicht festgelegt. Spotify nutzt die von deinem Distributor gelieferten Genre-Tags, aber die Audioanalyse kann sie überschreiben, wenn die klanglichen Eigenschaften nicht passen. Ein als „Hip-Hop“ getaggter Track, der wie akustischer Folk klingt, wird möglicherweise stattdessen Folk-Hörern empfohlen.
Die Rolle von Audio im größeren Algorithmus
Die Audioanalyse ist eine von drei wichtigen Datenquellen des Spotify-Algorithmus:
| Datenquelle | Was sie erfasst | Besonders geeignet für |
|---|---|---|
| Kollaboratives Filtern | Hörmuster über verschiedene Nutzer hinweg | Zielgruppenüberschneidungen finden |
| Verarbeitung natürlicher Sprache | Lyrics, Playlist-Titel, Erwähnungen im Web | Kulturellen Kontext verstehen |
| Audioanalyse | Klangeigenschaften der Wellenform | Klanglich ähnliche Tracks finden |
Bei etablierten Künstlern dominiert das kollaborative Filtern. Bei neuen Künstlern wiegt die Audioanalyse stärker, weil keine Hörhistorie zur Analyse vorhanden ist.
Das Ziel ist, Musik mit klaren, konsistenten Audio-Eigenschaften zu veröffentlichen und gleichzeitig eine engagierte Hörerbasis aufzubauen. Die Audioanalyse sorgt für Entdeckung; Engagement-Signale entscheiden, ob du weiterhin empfohlen wirst.