Langsung ke konten

Belajar Dynamoi

Analisis Audio Spotify: CNNs dan 13 Fitur Audio

Spotify menggunakan jaringan saraf konvolutional untuk mengekstrak 13 fitur audio dari bentuk gelombang mentah.

Panduan Cara 6 menit baca
A paper craft diorama showing a sound wave entering a machine and becoming data dials for energy and valence.

Poin penting

Spotify menggunakan jaringan saraf konvolutional (CNN) untuk menganalisis spektrum bentuk gelombang audio mentah dan mengekstrak 13 fitur terukur per lagu, termasuk tempo, energi, valensi, kecernaan, dan kunci. Fitur ini mendukung Radio dan Autoplay dengan menemukan tetangga yang kompatibel dengan suara, dan mereka memecahkan masalah awal dingin untuk seniman baru tanpa sejarah mendengarkan. Untuk Discover Weekly, analisis audio bertindak sebagai tiebreaker ketika lagu kandidat berbagi skor penyaringan kolaborasi yang sama.

Bagaimana analisis audio bekerja di Spotify

Ketika lagu diunggah ke Spotify melalui distributor, ia melalui pipa analisis audio otomatis. Sistem memproses bentuk gelombang mentah dan mengekstrak lusinan karakteristik yang dapat diukur.

Teknologi inti adalah jaringan saraf konvolutional (CNN) **, jenis model pembelajaran mesin yang sama yang digunakan untuk pengenalan gambar. Alih-alih menganalisis piksel, CNN Spotify menganalisis spektrogram **, yang merupakan representasi visual dari frekuensi suara dari waktu ke waktu.

CNN belajar untuk mendeteksi pola dalam spektrum ini: denyut drum dan sintesis yang kuat menunjukkan musik elektronik atau tari; pola gitar akustik lembut menunjukkan genre rakyat atau penyanyi-penulis lagu; struktur harmonik yang kompleks dapat menandakan jazz atau klasik.

Audio fitur Spotify ekstrak

API Spotify mengekspos 13 fitur audio untuk setiap lagu. Ini adalah blok bangunan yang digunakan algoritma untuk mengukur kesamaan suara.

Fitur ritme dan tempo

Fitur Definisi Jarak
tempo Perkiraan denyut per menit (BPM) 0-250
time_signature Pertimbangan per ukuran (3/4, 4/4, dll.) 1-7
danceability Bagaimana cocok untuk menari berdasarkan tempo, stabilitas ritme, kekuatan detak 0.0-1.0

Danceability bukan hanya tempo. Lagu 120 BPM dengan irama yang tidak teratur skor lebih rendah dari lagu 100 BPM dengan alur yang stabil.

Fitur energi dan intensitas

Fitur Definisi Jarak
energy Persepsi ukuran intensitas dan aktivitas 0.0-1.0
loudness Kecepatan suara keseluruhan dalam decibel (dB) -60 sampai 0 dB

Energy menggabungkan beberapa sinyal: kisaran dinamis, ketegangan yang dirasakan, timbre, tingkat awal (berapa sering suara baru dimulai), dan entropia secara keseluruhan.

Fitur nada

Fitur Definisi Jarak
key Pusat tonal trek 0-11 (C=0, C#=1, dll.)
mode Mayor (1) atau minor (0) 0 atau 1

Fitur ini membantu algoritma kelompok trek dengan struktur harmonik yang kompatibel, sehingga Radio dan Autoplay dapat bergerak di antara mereka tanpa perubahan kunci yang mengganggu.

Sentuhan mood dan karakter

Fitur Definisi Jarak
valence Positivitas musik (senang vs sedih) 0.0-1.0
acousticness Keyakinan bahwa trek adalah akustik 0.0-1.0
instrumentalness Prediksi jika lagu tidak memiliki vokal 0.0-1.0
speechiness Kehadiran kata-kata yang diucapkan 0.0-1.0
liveness Kemungkinan trek dilakukan secara live 0.0-1.0

Valence sangat penting untuk rekomendasi berdasarkan mood. Lagu dengan nilai tinggi (0,8+) terdengar ceria atau euforik. Lagu dengan nilai rendah (0,2 atau di bawah) terdengar sedih, melankolik, atau marah.

Bagaimana fitur audio mempengaruhi rekomendasi

Analisis audio memecahkan masalah ** cold start **. Ketika seorang seniman baru mengunggah lagu pertamanya, mereka tidak memiliki riwayat mendengarkan atau data penyaringan kolaboratif. Tapi fitur audio tersedia segera.

Berikut adalah bagaimana setiap permukaan algoritma menggunakan analisis audio:

Radio dan Autoplay

Ketika Radio menghasilkan antrian berdasarkan lagu benih, kesamaan audio adalah sinyal utama. Algoritma menemukan lagu dengan serupa:

  • Tempo (dalam kisaran yang wajar untuk transisi yang lancar)
  • Tingkat energi (untuk menjaga intensitas sesi)
  • Kunci dan mode (untuk kompatibilitas harmonik)
  • Valence (untuk menjaga nada emosional)

Inilah sebabnya mengapa stasiun radio yang ditanam dari trek elektronik energi tinggi tidak akan tiba-tiba memasukkan balada akustik yang lambat, bahkan jika kedua lagu berbagi tag genre.

Temukan Seminggu

Discover Weekly terutama menggunakan Filter kolaboratif, tetapi analisis audio bertindak sebagai tiebreaker. Ketika beberapa lagu kandidat memiliki skor penyampaian pendengaran yang sama, algoritma memihak kepada mereka yang memiliki fitur audio yang paling dekat dengan profil selera Anda yang ada.

Apa yang dapat dipelajari para seniman dari fitur audio

Anda tidak dapat mengontrol bagaimana Spotify menganalisis audio Anda. Tapi mengetahui fitur-fitur ini memberi tahu Anda bagaimana algoritma mendengar musik Anda, dan lagu mana yang akan dikelompokkan dengan Anda.

Memverifikasi fitur audio lagu Anda

Tip Alat pihak ketiga dapat menarik fitur audio lagu Anda dari API Spotify. Cari layanan yang memungkinkan Anda memasukkan URL lagu Spotify dan mengembalikan nilai fitur.

Apa yang harus dicari:

  • ** Fitur yang konsisten di seluruh katalog Anda** membantu algoritma mengelompokkan musik Anda. Jika lagu Anda bervariasi secara liar dalam energi, tempo, dan valensi, algoritma memiliki waktu yang lebih sulit untuk memprediksi siapa yang akan menikmati mereka.
  • ** Fitur yang sesuai dengan audiens target Anda** meningkatkan penempatan radio. Jika suara Anda tinggi energi dan menari, lagu Anda lebih mungkin muncul di sesi radio latihan dan berorientasi pesta.

Masalah intro

Analisis audio memeriksa seluruh lagu, tetapi perilaku pendengar sangat dipengaruhi oleh 30 detik pertama. Jika intro Anda memiliki karakteristik yang berbeda dari sisa lagu (introduksi lingkungan yang tenang sebelum drop yang keras), fitur audio mungkin tidak mencerminkan apa yang didengar pertama kali mengalami.

Ini dapat menciptakan ketidakcocokan: algoritma merekomendasikan lagu Anda berdasarkan energi keseluruhan, tetapi pendengar melewatkan karena intro tidak sesuai dengan harapan mereka.

Batas dari analisis audio

Analisis audio kuat, tapi memiliki titik buta:

Kontext budaya hilang. Algoritma tahu lagu Anda memiliki energi tinggi dan tempo 128 BPM, tetapi tidak tahu bahwa liriknya mengacu pada momen budaya tertentu atau bahwa gaya produksi menganggu era tertentu.

** Suara yang sama tidak sama dengan penonton yang sama.** Dua lagu dapat memiliki fitur audio hampir identik tetapi menarik bagi pendengar yang sama sekali berbeda.

** Genre adalah inferensi, tidak dinyatakan.** Spotify menggunakan tag genre yang disediakan distributor Anda, tetapi analisis audio dapat mengabaikan mereka jika karakteristik sonik tidak sesuai. Lagu yang ditandai sebagai "hip-hop" yang terdengar seperti folk akustik mungkin direkomendasikan kepada pendengar folk.

Peran audio dalam algoritma yang lebih luas

Analisis audio adalah salah satu dari tiga sumber data utama yang digunakan algoritma Spotify:

Sumber data Apa yang ia capture Yang terbaik untuk
** Filtrasi kolaboratif** Pola mendengarkan di seluruh pengguna Penemuan penonton tumpang tindih
Pelaksanaan bahasa alami Lirik, judul playlist, sebutan web Memahami konteks budaya
** Analisis audio** Karakteristik sonik bentuk gelombang Menemukan jejak yang mirip dengan suara

Untuk seniman yang sudah mapan, pemfilteran kolaboratif mendominasi. Bagi seniman baru, analisis audio membawa lebih banyak berat karena tidak ada sejarah mendengarkan untuk dianalisis.

Tujuannya adalah untuk merilis musik dengan karakteristik audio yang jelas dan konsisten sambil membangun basis pendengar yang terlibat. Analisis audio membuat Anda terdeteksi; sinyal keterlibatan menentukan apakah Anda terus mendapatkan rekomendasi.