Zum Inhalt springen

Aktiviere den Spotify-Algorithmus mit Dynamoi

Kostenlos starten

Dynamoi Lernen

Spotify-Audioanalyse: CNNs und die 13 Audio-Merkmale

Spotify nutzt konvolutionale neuronale Netze, um aus rohen Wellenformen 13 Audio-Merkmale zu extrahieren. Sie speisen Radio, Autoplay und Cold-Start-Empfehlungen für neue Veröffentlichungen.

Anleitungsleitfaden 6 Min. Lesezeit
A paper craft diorama showing a sound wave entering a machine and becoming data dials for energy and valence.

Schlüssel zum Mitnehmen

Spotify nutzt konvolutionale neuronale Netze (CNNs), um Spektrogramme roher Audio-Wellenformen zu analysieren und pro Track 13 messbare Merkmale zu extrahieren, darunter Tempo, Energie, Valenz, Tanzbarkeit und Tonart. Diese Merkmale ermöglichen Radio und Autoplay, indem sie klanglich kompatible Nachbarn finden, und lösen das Cold-Start-Problem neuer Künstler ohne Hörhistorie. Für Discover Weekly dient die Audioanalyse als Tiebreaker, wenn Kandidaten ähnliche Scores des kollaborativen Filterns haben.

So funktioniert die Audioanalyse bei Spotify

Wenn ein Track über einen Distributor auf Spotify hochgeladen wird, durchläuft er eine automatisierte Audioanalyse-Pipeline. Das System verarbeitet die rohe Wellenform und extrahiert Dutzende messbarer Eigenschaften.

Die Kerntechnologie sind konvolutionale neuronale Netze (CNNs), also derselbe Typ maschineller Lernmodelle, der bei der Bilderkennung verwendet wird. Statt Pixel zu analysieren, untersuchen Spotifys CNNs Spektrogramme – visuelle Darstellungen von Schallfrequenzen im Zeitverlauf.

Das CNN lernt, Muster in diesen Spektrogrammen zu erkennen: starke Schlagzeugbeats und Synthesizer deuten auf elektronische Musik oder Dance hin; sanfte Akustikgitarrenmuster auf Folk oder Singer-Songwriter; komplexe harmonische Strukturen können Jazz oder Klassik signalisieren.

Die Audio-Merkmale, die Spotify extrahiert

Spotifys API stellt für jeden Track 13 Audio-Merkmale bereit. Sie bilden die Grundlage, mit der der Algorithmus klangliche Ähnlichkeit misst.

Merkmale für Rhythmus und Tempo

Merkmal Definition Wertebereich
tempo Geschätzte Schläge pro Minute (BPM) 0-250
time_signature Schläge pro Takt (3/4, 4/4 usw.) 1-7
danceability Eignung zum Tanzen anhand von Tempo, Rhythmusstabilität und Beatstärke 0.0-1.0

Danceability ist nicht nur eine Frage des Tempos. Ein Track mit 120 BPM und unregelmäßigen Rhythmen erzielt einen niedrigeren Wert als ein Track mit 100 BPM und einem gleichmäßigen Groove.

Merkmale für Energie und Intensität

Merkmal Definition Wertebereich
energy Wahrnehmungsbasierte Messung von Intensität und Aktivität 0.0-1.0
loudness Gesamtlautstärke in Dezibel (dB) -60 bis 0 dB

Energy kombiniert mehrere Signale: Dynamikumfang, wahrgenommene Lautheit, Klangfarbe, Einsatzrate (wie oft neue Klänge beginnen) und Gesamtentropie. Death Metal erzielt einen hohen Wert, ein Bach-Präludium einen niedrigen.

Tonale Merkmale

Merkmal Definition Wertebereich
key Tonales Zentrum des Tracks 0-11 (C=0, C#=1 usw.)
mode Dur (1) oder Moll (0) 0 oder 1

Diese Merkmale helfen dem Algorithmus, Tracks mit kompatiblen harmonischen Strukturen zu gruppieren, sodass Radio und Autoplay ohne störenden Tonartwechsel zwischen ihnen wechseln können.

Merkmale für Stimmung und Charakter

Merkmal Definition Wertebereich
valence Musikalische Positivität (fröhlich vs. traurig) 0.0-1.0
acousticness Wahrscheinlichkeit, dass der Track akustisch ist 0.0-1.0
instrumentalness Prognose, ob der Track keinen Gesang enthält 0.0-1.0
speechiness Anteil gesprochener Wörter 0.0-1.0
liveness Wahrscheinlichkeit, dass der Track live aufgenommen wurde 0.0-1.0

Valence ist für stimmungsbasierte Empfehlungen besonders wichtig. Ein Track mit hoher Valenz (0.8+) klingt fröhlich oder euphorisch. Ein Track mit niedriger Valenz (0.2 oder weniger) klingt traurig, melancholisch oder wütend.

Wie Audio-Merkmale Empfehlungen beeinflussen

Die Audioanalyse löst das Cold-Start-Problem. Wenn ein neuer Künstler seinen ersten Track hochlädt, gibt es noch keine Hörhistorie und keine Daten aus kollaborativem Filtern. Die Audio-Merkmale sind jedoch sofort verfügbar.

So nutzt jede algorithmische Fläche die Audioanalyse:

Radio und Autoplay

Wenn Radio eine Warteschlange auf Basis eines Seed-Tracks erstellt, ist die Audioähnlichkeit das wichtigste Signal. Der Algorithmus findet Tracks mit ähnlichen:

  • Tempi (in einem angemessenen Bereich für weiche Übergänge)
  • Energiepegeln (um die Intensität der Sitzung beizubehalten)
  • Tonarten und Modi (für harmonische Kompatibilität)
  • Valenzen (um den emotionalen Ton zu bewahren)

Deshalb fügt eine von einem energiegeladenen elektronischen Track gestartete Radio-Station nicht plötzlich eine langsame Akustikballade ein, selbst wenn beide Songs dieselben Genre-Tags haben.

Discover Weekly

Discover Weekly nutzt hauptsächlich kollaboratives Filtern, aber die Audioanalyse dient als Tiebreaker. Wenn mehrere Kandidaten ähnliche Scores beim Hör-Overlap haben, bevorzugt der Algorithmus jene mit Audio-Merkmalen, die deinem bestehenden Geschmacksprofil am nächsten kommen.

Was Künstler aus Audio-Merkmalen lernen können

Du kannst nicht steuern, wie Spotify dein Audio analysiert. Wenn du diese Merkmale kennst, verstehst du jedoch, wie der Algorithmus deine Musik hört und mit welchen Tracks er sie gruppiert.

Die Audio-Merkmale deines Tracks prüfen

Tip Drittanbieter-Tools können die Audio-Merkmale deines Tracks aus Spotifys API abrufen. Suche nach Diensten, bei denen du eine Spotify-Track-URL eingeben und die Merkmalswerte abrufen kannst.

Darauf solltest du achten:

  • Konsistente Merkmale in deinem Katalog helfen dem Algorithmus, deine Musik zu clustern. Wenn sich deine Tracks bei Energie, Tempo und Valenz stark unterscheiden, kann der Algorithmus schwerer vorhersagen, wem sie gefallen.
  • Merkmale, die zu deiner Zielgruppe passen, verbessern die Radio-Platzierung. Wenn dein Sound energiegeladen und tanzbar ist, erscheinen deine Tracks eher in Workout- und partyorientierten Radio-Sessions.

Das Intro-Problem

Die Audioanalyse untersucht den gesamten Track, aber das Verhalten der Hörer wird stark von den ersten 30 Sekunden beeinflusst. Wenn dein Intro andere Eigenschaften als der restliche Song hat (ein ruhiges Ambient-Intro vor einem lauten Drop), spiegeln die Audio-Merkmale möglicherweise nicht wider, was Hörer zuerst erleben.

Das kann zu einer Diskrepanz führen: Der Algorithmus empfiehlt deinen Track aufgrund seiner Gesamtenergie, aber Hörer skippen, weil das Intro nicht ihren Erwartungen entspricht. Dein Intro zu optimieren ist eine andere Fähigkeit als die Optimierung deines gesamten Audio-Profils.

Grenzen der Audioanalyse

Die Audioanalyse ist leistungsstark, hat aber blinde Flecken:

Kultureller Kontext fehlt. Der Algorithmus weiß, dass dein Track energiegeladen ist und ein Tempo von 128 BPM hat. Er weiß jedoch nicht, dass der Text auf einen bestimmten kulturellen Moment verweist oder der Produktionsstil an eine bestimmte Ära erinnert.

Ähnliche Klänge sind nicht dasselbe wie ähnliche Zielgruppen. Zwei Tracks können nahezu identische Audio-Merkmale haben, aber völlig unterschiedliche Hörer ansprechen. Die Audioanalyse findet klangliche Nachbarn, keine Publikumsnachbarn.

Genre wird abgeleitet, nicht festgelegt. Spotify nutzt die von deinem Distributor gelieferten Genre-Tags, aber die Audioanalyse kann sie überschreiben, wenn die klanglichen Eigenschaften nicht passen. Ein als „Hip-Hop“ getaggter Track, der wie akustischer Folk klingt, wird möglicherweise stattdessen Folk-Hörern empfohlen.

Die Rolle von Audio im größeren Algorithmus

Die Audioanalyse ist eine von drei wichtigen Datenquellen des Spotify-Algorithmus:

Datenquelle Was sie erfasst Besonders geeignet für
Kollaboratives Filtern Hörmuster über verschiedene Nutzer hinweg Zielgruppenüberschneidungen finden
Verarbeitung natürlicher Sprache Lyrics, Playlist-Titel, Erwähnungen im Web Kulturellen Kontext verstehen
Audioanalyse Klangeigenschaften der Wellenform Klanglich ähnliche Tracks finden

Bei etablierten Künstlern dominiert das kollaborative Filtern. Bei neuen Künstlern wiegt die Audioanalyse stärker, weil keine Hörhistorie zur Analyse vorhanden ist.

Das Ziel ist, Musik mit klaren, konsistenten Audio-Eigenschaften zu veröffentlichen und gleichzeitig eine engagierte Hörerbasis aufzubauen. Die Audioanalyse sorgt für Entdeckung; Engagement-Signale entscheiden, ob du weiterhin empfohlen wirst.