콘텐츠로 건너뛰기

Dynamoi로 Spotify 알고리즘을 작동시키세요

무료로 시작

Dynamoi 학습 센터

Spotify 오디오 분석: CNN과 13가지 오디오 특성

Spotify는 합성곱 신경망을 사용해 원시 파형에서 13가지 오디오 특성을 추출합니다. 이 특성은 Radio, Autoplay, 청취 기록이 없는 신작을 위한 콜드 스타트 추천을 구동합니다.

사용 가이드 5분 읽기
A paper craft diorama showing a sound wave entering a machine and becoming data dials for energy and valence.

핵심 내용

Spotify는 합성곱 신경망(CNN)을 사용해 원시 오디오 파형의 스펙트로그램을 분석하고, 트랙마다 템포, 에너지, 긍정성, 댄서빌리티, 키를 비롯한 13가지 측정 가능한 특성을 추출합니다. 이 특성은 음향적으로 잘 맞는 이웃 트랙을 찾아 Radio와 Autoplay를 구동하며, 청취 기록이 없는 신인 아티스트의 콜드 스타트 문제를 해결합니다. Discover Weekly에서는 후보 트랙들의 협업 필터링 점수가 비슷할 때 오디오 분석이 동점자 결정 기준으로 작동합니다.

Spotify에서 오디오 분석은 어떻게 작동하나요?

트랙을 유통사를 통해 Spotify에 업로드하면 자동화된 오디오 분석 파이프라인을 거칩니다. 시스템은 원시 파형을 처리하고 측정 가능한 특성을 수십 가지 추출합니다.

핵심 기술은 이미지 인식에 사용되는 것과 같은 종류의 머신러닝 모델인 **합성곱 신경망(CNN)**입니다. 픽셀을 분석하는 대신 Spotify의 CNN은 시간에 따른 음 주파수의 시각적 표현인 스펙트로그램을 분석합니다.

CNN은 이 스펙트로그램에서 패턴을 찾아내는 방법을 학습합니다. 강한 드럼 비트와 신시사이저는 일렉트로닉 또는 댄스 음악을 암시하고, 부드러운 어쿠스틱 기타 패턴은 포크 또는 싱어송라이터 장르를 나타내며, 복잡한 화성 구조는 재즈나 클래식을 나타낼 수 있습니다.

Spotify가 추출하는 오디오 특성

Spotify API는 모든 트랙에 대해 13가지 오디오 특성을 제공합니다. 이 특성들이 알고리즘이 음향적 유사성을 측정할 때 사용하는 구성 요소입니다.

리듬 및 템포 특성

특성 정의 범위
tempo 추정 분당 비트 수(BPM) 0-250
time_signature 마디당 비트 수(3/4, 4/4 등) 1-7
danceability 템포, 리듬 안정성, 비트 강도를 기준으로 춤추기에 적합한 정도 0.0-1.0

Danceability는 단순히 템포만을 뜻하지 않습니다. 불규칙한 리듬의 120 BPM 트랙은 일정한 그루브를 가진 100 BPM 트랙보다 점수가 낮습니다.

에너지 및 강도 특성

특성 정의 범위
energy 지각되는 강도와 활동성의 측정값 0.0-1.0
loudness 데시벨(dB)로 표시한 전체 음량 -60 to 0 dB

Energy는 다이내믹 레인지, 지각 음량, 음색, 온셋 비율(새로운 소리가 시작되는 빈도), 전체 엔트로피 등 여러 신호를 결합합니다. 데스 메탈은 높은 점수를 받고, 바흐의 프렐류드는 낮은 점수를 받습니다.

음조 특성

특성 정의 범위
key 트랙의 조성 중심 0-11 (C=0, C#=1 등)
mode 장조(1) 또는 단조(0) 0 또는 1

이 특성은 알고리즘이 화성 구조가 서로 맞는 트랙을 묶는 데 도움을 줍니다. 따라서 Radio와 Autoplay가 갑작스러운 조성 변화 없이 트랙 사이를 이동할 수 있습니다.

분위기 및 성격 특성

특성 정의 범위
valence 음악의 긍정성(행복함과 슬픔의 정도) 0.0-1.0
acousticness 트랙이 어쿠스틱일 것이라는 확신도 0.0-1.0
instrumentalness 트랙에 보컬이 없을지 예측하는 값 0.0-1.0
speechiness 말로 하는 단어의 존재 정도 0.0-1.0
liveness 트랙이 라이브로 연주되었을 확률 0.0-1.0

Valence는 분위기 기반 추천에서 특히 중요합니다. 높은 valence의 트랙(0.8 이상)은 명랑하거나 황홀하게 들립니다. 낮은 valence의 트랙(0.2 이하)은 슬프거나, 우울하거나, 화난 느낌을 줍니다.

오디오 특성은 추천에 어떤 영향을 주나요?

오디오 분석은 콜드 스타트 문제를 해결합니다. 신인 아티스트가 첫 트랙을 올리면 청취 기록이나 협업 필터링 데이터가 없습니다. 하지만 오디오 특성은 즉시 이용할 수 있습니다.

각 알고리즘 노출 영역은 다음과 같이 오디오 분석을 사용합니다.

Radio와 Autoplay

Radio가 시드 트랙을 바탕으로 대기열을 만들 때 음향적 유사성이 주요 신호입니다. 알고리즘은 다음 특성이 비슷한 트랙을 찾습니다.

  • 템포(매끄러운 전환을 위해 합리적인 범위 안에서)
  • 에너지 수준(세션의 강도를 유지하기 위해)
  • 키와 모드(화성적 호환성을 위해)
  • Valence(감정적 분위기를 유지하기 위해)

따라서 고에너지 일렉트로닉 트랙에서 시작한 Radio 스테이션에 두 곡의 장르 태그가 같다는 이유만으로 갑자기 느린 어쿠스틱 발라드가 삽입되지는 않습니다.

Discover Weekly

Discover Weekly는 주로 협업 필터링을 사용하지만 오디오 분석이 동점자 결정 기준으로 작동합니다. 여러 후보 트랙의 청취 중복 점수가 비슷하면 알고리즘은 기존 취향 프로필과 오디오 특성이 가장 가까운 트랙을 선호합니다.

아티스트가 오디오 특성에서 배울 수 있는 점

Spotify가 오디오를 분석하는 방식은 통제할 수 없습니다. 하지만 이 특성을 알면 알고리즘이 내 음악을 어떻게 듣는지, 또 어떤 트랙과 함께 묶을지를 이해할 수 있습니다.

트랙의 오디오 특성 확인하기

Tip 서드파티 도구는 Spotify API에서 트랙의 오디오 특성을 가져올 수 있습니다. Spotify 트랙 URL을 입력하면 특성 값을 반환하는 서비스를 찾아보세요.

살펴볼 내용은 다음과 같습니다.

  • 카탈로그 전반의 일관된 특성은 알고리즘이 음악을 클러스터링하는 데 도움을 줍니다. 트랙마다 에너지, 템포, valence가 크게 다르면 알고리즘이 누가 좋아할지 예측하기 더 어려워집니다.
  • 타깃 오디언스와 맞는 특성은 Radio 배치를 개선합니다. 사운드가 고에너지이고 댄서블하다면 운동 및 파티 중심의 Radio 세션에 트랙이 나타날 가능성이 높습니다.

인트로 문제

오디오 분석은 트랙 전체를 살펴보지만, 리스너의 행동은 첫 30초에 큰 영향을 받습니다. 인트로의 특성이 곡의 나머지 부분과 다르면(큰 드롭 전에 조용한 앰비언트 인트로가 나오는 경우처럼) 오디오 특성이 리스너가 처음 경험하는 내용을 반영하지 못할 수 있습니다.

이로 인해 불일치가 생길 수 있습니다. 알고리즘은 전체 에너지를 바탕으로 트랙을 추천하지만, 리스너는 인트로가 기대와 달라서 건너뜁니다. 인트로를 최적화하는 일은 전체 오디오 프로필을 최적화하는 것과 별개의 기술입니다.

오디오 분석의 한계

오디오 분석은 강력하지만 사각지대도 있습니다.

문화적 맥락이 없습니다. 알고리즘은 트랙의 에너지와 128 BPM 템포는 알지만, 가사가 특정한 문화적 순간을 언급하는지 또는 프로덕션 스타일이 특정 시대를 떠올리게 하는지는 알지 못합니다.

비슷한 사운드가 비슷한 오디언스를 뜻하지는 않습니다. 두 트랙의 오디오 특성이 거의 같아도 완전히 다른 리스너에게 호소할 수 있습니다. 오디오 분석은 오디언스 이웃이 아니라 음향 이웃을 찾습니다.

장르는 추론되는 것이지 선언되는 것이 아닙니다. Spotify는 유통사가 제공한 장르 태그를 사용하지만, 음향적 특성이 맞지 않으면 오디오 분석이 태그를 덮어쓸 수 있습니다. "힙합"으로 태그했지만 어쿠스틱 포크처럼 들리는 트랙은 포크 리스너에게 추천될 수 있습니다.

더 넓은 알고리즘에서 오디오의 역할

오디오 분석은 Spotify 알고리즘이 사용하는 세 가지 주요 데이터 소스 중 하나입니다.

데이터 소스 포착하는 내용 가장 유용한 영역
협업 필터링 사용자 간의 청취 패턴 오디언스 중복 찾기
자연어 처리 가사, 플레이리스트 제목, 웹 언급 문화적 맥락 이해
오디오 분석 파형의 음향적 특성 음향적으로 유사한 트랙 찾기

기성 아티스트에게는 협업 필터링의 영향이 가장 큽니다. 신인 아티스트에게는 분석할 청취 기록이 없기 때문에 오디오 분석이 더 큰 비중을 차지합니다.

목표는 명확하고 일관된 오디오 특성을 가진 음악을 발매하면서 참여도 높은 리스너 기반을 만드는 것입니다. 오디오 분석은 발견되게 만들고, 참여 신호는 계속 추천될지를 결정합니다.