Bagaimana analisis audio bekerja di Spotify
Ketika lagu diunggah ke Spotify melalui distributor, ia melalui pipa analisis audio otomatis. Sistem memproses bentuk gelombang mentah dan mengekstrak lusinan karakteristik yang dapat diukur.
Teknologi inti adalah jaringan saraf konvolutional (CNN) **, jenis model pembelajaran mesin yang sama yang digunakan untuk pengenalan gambar. Alih-alih menganalisis piksel, CNN Spotify menganalisis spektrogram **, yang merupakan representasi visual dari frekuensi suara dari waktu ke waktu.
CNN belajar untuk mendeteksi pola dalam spektrum ini: denyut drum dan sintesis yang kuat menunjukkan musik elektronik atau tari; pola gitar akustik lembut menunjukkan genre rakyat atau penyanyi-penulis lagu; struktur harmonik yang kompleks dapat menandakan jazz atau klasik.
Audio fitur Spotify ekstrak
API Spotify mengekspos 13 fitur audio untuk setiap lagu. Ini adalah blok bangunan yang digunakan algoritma untuk mengukur kesamaan suara.
Fitur ritme dan tempo
| Fitur | Definisi | Jarak |
|---|---|---|
tempo |
Perkiraan denyut per menit (BPM) | 0-250 |
time_signature |
Pertimbangan per ukuran (3/4, 4/4, dll.) | 1-7 |
danceability |
Bagaimana cocok untuk menari berdasarkan tempo, stabilitas ritme, kekuatan detak | 0.0-1.0 |
Danceability bukan hanya tempo. Lagu 120 BPM dengan irama yang tidak teratur skor lebih rendah dari lagu 100 BPM dengan alur yang stabil.
Fitur energi dan intensitas
| Fitur | Definisi | Jarak |
|---|---|---|
energy |
Persepsi ukuran intensitas dan aktivitas | 0.0-1.0 |
loudness |
Kecepatan suara keseluruhan dalam decibel (dB) | -60 sampai 0 dB |
Energy menggabungkan beberapa sinyal: kisaran dinamis, ketegangan yang dirasakan, timbre, tingkat awal (berapa sering suara baru dimulai), dan entropia secara keseluruhan.
Fitur nada
| Fitur | Definisi | Jarak |
|---|---|---|
key |
Pusat tonal trek | 0-11 (C=0, C#=1, dll.) |
mode |
Mayor (1) atau minor (0) | 0 atau 1 |
Fitur ini membantu algoritma kelompok trek dengan struktur harmonik yang kompatibel, sehingga Radio dan Autoplay dapat bergerak di antara mereka tanpa perubahan kunci yang mengganggu.
Sentuhan mood dan karakter
| Fitur | Definisi | Jarak |
|---|---|---|
valence |
Positivitas musik (senang vs sedih) | 0.0-1.0 |
acousticness |
Keyakinan bahwa trek adalah akustik | 0.0-1.0 |
instrumentalness |
Prediksi jika lagu tidak memiliki vokal | 0.0-1.0 |
speechiness |
Kehadiran kata-kata yang diucapkan | 0.0-1.0 |
liveness |
Kemungkinan trek dilakukan secara live | 0.0-1.0 |
Valence sangat penting untuk rekomendasi berdasarkan mood. Lagu dengan nilai tinggi (0,8+) terdengar ceria atau euforik. Lagu dengan nilai rendah (0,2 atau di bawah) terdengar sedih, melankolik, atau marah.
Bagaimana fitur audio mempengaruhi rekomendasi
Analisis audio memecahkan masalah ** cold start **. Ketika seorang seniman baru mengunggah lagu pertamanya, mereka tidak memiliki riwayat mendengarkan atau data penyaringan kolaboratif. Tapi fitur audio tersedia segera.
Berikut adalah bagaimana setiap permukaan algoritma menggunakan analisis audio:
Radio dan Autoplay
Ketika Radio menghasilkan antrian berdasarkan lagu benih, kesamaan audio adalah sinyal utama. Algoritma menemukan lagu dengan serupa:
- Tempo (dalam kisaran yang wajar untuk transisi yang lancar)
- Tingkat energi (untuk menjaga intensitas sesi)
- Kunci dan mode (untuk kompatibilitas harmonik)
- Valence (untuk menjaga nada emosional)
Inilah sebabnya mengapa stasiun radio yang ditanam dari trek elektronik energi tinggi tidak akan tiba-tiba memasukkan balada akustik yang lambat, bahkan jika kedua lagu berbagi tag genre.
Temukan Seminggu
Discover Weekly terutama menggunakan Filter kolaboratif, tetapi analisis audio bertindak sebagai tiebreaker. Ketika beberapa lagu kandidat memiliki skor penyampaian pendengaran yang sama, algoritma memihak kepada mereka yang memiliki fitur audio yang paling dekat dengan profil selera Anda yang ada.
Apa yang dapat dipelajari para seniman dari fitur audio
Anda tidak dapat mengontrol bagaimana Spotify menganalisis audio Anda. Tapi mengetahui fitur-fitur ini memberi tahu Anda bagaimana algoritma mendengar musik Anda, dan lagu mana yang akan dikelompokkan dengan Anda.
Memverifikasi fitur audio lagu Anda
Tip Alat pihak ketiga dapat menarik fitur audio lagu Anda dari API Spotify. Cari layanan yang memungkinkan Anda memasukkan URL lagu Spotify dan mengembalikan nilai fitur.
Apa yang harus dicari:
- ** Fitur yang konsisten di seluruh katalog Anda** membantu algoritma mengelompokkan musik Anda. Jika lagu Anda bervariasi secara liar dalam energi, tempo, dan valensi, algoritma memiliki waktu yang lebih sulit untuk memprediksi siapa yang akan menikmati mereka.
- ** Fitur yang sesuai dengan audiens target Anda** meningkatkan penempatan radio. Jika suara Anda tinggi energi dan menari, lagu Anda lebih mungkin muncul di sesi radio latihan dan berorientasi pesta.
Masalah intro
Analisis audio memeriksa seluruh lagu, tetapi perilaku pendengar sangat dipengaruhi oleh 30 detik pertama. Jika intro Anda memiliki karakteristik yang berbeda dari sisa lagu (introduksi lingkungan yang tenang sebelum drop yang keras), fitur audio mungkin tidak mencerminkan apa yang didengar pertama kali mengalami.
Ini dapat menciptakan ketidakcocokan: algoritma merekomendasikan lagu Anda berdasarkan energi keseluruhan, tetapi pendengar melewatkan karena intro tidak sesuai dengan harapan mereka.
Batas dari analisis audio
Analisis audio kuat, tapi memiliki titik buta:
Kontext budaya hilang. Algoritma tahu lagu Anda memiliki energi tinggi dan tempo 128 BPM, tetapi tidak tahu bahwa liriknya mengacu pada momen budaya tertentu atau bahwa gaya produksi menganggu era tertentu.
** Suara yang sama tidak sama dengan penonton yang sama.** Dua lagu dapat memiliki fitur audio hampir identik tetapi menarik bagi pendengar yang sama sekali berbeda.
** Genre adalah inferensi, tidak dinyatakan.** Spotify menggunakan tag genre yang disediakan distributor Anda, tetapi analisis audio dapat mengabaikan mereka jika karakteristik sonik tidak sesuai. Lagu yang ditandai sebagai "hip-hop" yang terdengar seperti folk akustik mungkin direkomendasikan kepada pendengar folk.
Peran audio dalam algoritma yang lebih luas
Analisis audio adalah salah satu dari tiga sumber data utama yang digunakan algoritma Spotify:
| Sumber data | Apa yang ia capture | Yang terbaik untuk |
|---|---|---|
| ** Filtrasi kolaboratif** | Pola mendengarkan di seluruh pengguna | Penemuan penonton tumpang tindih |
| Pelaksanaan bahasa alami | Lirik, judul playlist, sebutan web | Memahami konteks budaya |
| ** Analisis audio** | Karakteristik sonik bentuk gelombang | Menemukan jejak yang mirip dengan suara |
Untuk seniman yang sudah mapan, pemfilteran kolaboratif mendominasi. Bagi seniman baru, analisis audio membawa lebih banyak berat karena tidak ada sejarah mendengarkan untuk dianalisis.
Tujuannya adalah untuk merilis musik dengan karakteristik audio yang jelas dan konsisten sambil membangun basis pendengar yang terlibat. Analisis audio membuat Anda terdeteksi; sinyal keterlibatan menentukan apakah Anda terus mendapatkan rekomendasi.