Pular para o conteúdo

Ative o Algoritmo do Spotify com a Dynamoi

Começar gratuitamente

Aprenda com a Dynamoi

Análise de Áudio do Spotify: CNNs e os 13 Recursos de Áudio

O Spotify usa redes neurais convolucionais para extrair 13 recursos de áudio de formas de onda brutas. Eles alimentam Radio, Autoplay e recomendações de cold start para novos lançamentos.

Guia prático 7 min de leitura
A paper craft diorama showing a sound wave entering a machine and becoming data dials for energy and valence.

Conclusão importante

O Spotify usa redes neurais convolucionais (CNNs) para analisar espectrogramas de formas de onda de áudio brutas e extrair 13 recursos mensuráveis por faixa, incluindo tempo, energia, valência, dançabilidade e tom. Esses recursos alimentam o Radio e o Autoplay ao encontrar vizinhas sonoramente compatíveis e resolvem o problema de cold start para novos artistas sem histórico de escuta. No Discover Weekly, a análise de áudio funciona como critério de desempate quando faixas candidatas têm pontuações semelhantes de filtragem colaborativa.

Como funciona a análise de áudio no Spotify

Quando uma faixa é enviada ao Spotify por meio de um distribuidor, ela passa por um pipeline automatizado de análise de áudio. O sistema processa a forma de onda bruta e extrai dezenas de características mensuráveis.

A tecnologia central são as redes neurais convolucionais (CNNs), o mesmo tipo de modelo de machine learning usado para reconhecimento de imagens. Em vez de analisar pixels, as CNNs do Spotify analisam espectrogramas, que são representações visuais das frequências sonoras ao longo do tempo.

A CNN aprende a detectar padrões nesses espectrogramas: batidas fortes de bateria e sintetizadores sugerem música eletrônica ou dançante; padrões suaves de violão acústico indicam gêneros folk ou de cantor e compositor; estruturas harmônicas complexas podem indicar jazz ou música clássica.

Os recursos de áudio que o Spotify extrai

A API do Spotify expõe 13 recursos de áudio para cada faixa. Eles são os blocos de construção que o algoritmo usa para medir a similaridade sonora.

Recursos de ritmo e tempo

Recurso Definição Intervalo
tempo Batidas por minuto estimadas (BPM) 0-250
time_signature Batidas por compasso (3/4, 4/4 etc.) 1-7
danceability Adequação para dançar com base no tempo, na estabilidade rítmica e na força da batida 0.0-1.0

Danceability não é apenas tempo. Uma faixa de 120 BPM com ritmos irregulares recebe uma pontuação menor que uma faixa de 100 BPM com groove constante.

Recursos de energia e intensidade

Recurso Definição Intervalo
energy Medida perceptual de intensidade e atividade 0.0-1.0
loudness Volume geral em decibéis (dB) -60 a 0 dB

Energy combina vários sinais: faixa dinâmica, volume percebido, timbre, taxa de início (com que frequência novos sons começam) e entropia geral. Death metal recebe uma pontuação alta; um prelúdio de Bach recebe uma pontuação baixa.

Recursos tonais

Recurso Definição Intervalo
key Centro tonal da faixa 0-11 (C=0, C#=1 etc.)
mode Maior (1) ou menor (0) 0 ou 1

Esses recursos ajudam o algoritmo a agrupar faixas com estruturas harmônicas compatíveis, para que o Radio e o Autoplay possam passar de uma para outra sem uma mudança de tom brusca.

Recursos de humor e características

Recurso Definição Intervalo
valence Positividade musical (feliz vs. triste) 0.0-1.0
acousticness Confiança de que a faixa é acústica 0.0-1.0
instrumentalness Prevê se a faixa não tem vocais 0.0-1.0
speechiness Presença de palavras faladas 0.0-1.0
liveness Probabilidade de a faixa ter sido executada ao vivo 0.0-1.0

Valence é especialmente importante para recomendações baseadas em humor. Uma faixa de valência alta (0.8+) soa alegre ou eufórica. Uma faixa de valência baixa (0.2 ou menos) soa triste, melancólica ou raivosa.

Como os recursos de áudio influenciam as recomendações

A análise de áudio resolve o problema de cold start. Quando um artista novo envia sua primeira faixa, ele não tem histórico de escuta nem dados de filtragem colaborativa. Mas os recursos de áudio ficam disponíveis imediatamente.

Veja como cada superfície algorítmica usa a análise de áudio:

Radio e Autoplay

Quando o Radio gera uma fila com base em uma faixa-semente, a similaridade de áudio é o sinal principal. O algoritmo encontra faixas com características semelhantes de:

  • Tempo (dentro de um intervalo razoável para transições suaves)
  • Nível de energia (para manter a intensidade da sessão)
  • Tom e modo (para compatibilidade harmônica)
  • Valência (para preservar o tom emocional)

É por isso que uma estação de Radio iniciada por uma faixa eletrônica de alta energia não insere de repente uma balada acústica lenta, mesmo que as duas músicas compartilhem tags de gênero.

Discover Weekly

O Discover Weekly usa principalmente a filtragem colaborativa, mas a análise de áudio funciona como critério de desempate. Quando várias faixas candidatas têm pontuações semelhantes de sobreposição de escuta, o algoritmo favorece aquelas cujos recursos de áudio são mais próximos do seu perfil de gostos existente.

O que os artistas podem aprender com os recursos de áudio

Você não consegue controlar como o Spotify analisa seu áudio. Mas conhecer esses recursos mostra como o algoritmo ouve sua música e com quais faixas ele vai agrupá-la.

Como conferir os recursos de áudio da sua faixa

Tip Ferramentas de terceiros podem obter os recursos de áudio da sua faixa pela API do Spotify. Procure serviços que permitam inserir a URL de uma faixa do Spotify e retornem os valores dos recursos.

O que observar:

  • Recursos consistentes em todo o catálogo ajudam o algoritmo a agrupar sua música. Se suas faixas variam muito em energia, tempo e valência, fica mais difícil para o algoritmo prever quem vai gostar delas.
  • Recursos que combinam com seu público-alvo melhoram o posicionamento no Radio. Se seu som é dançante e de alta energia, suas faixas têm mais chances de aparecer em sessões de Radio voltadas para exercícios e festas.

O problema da introdução

A análise de áudio examina a faixa inteira, mas o comportamento dos ouvintes é fortemente influenciado pelos primeiros 30 segundos. Se sua introdução tem características diferentes do restante da música (uma introdução ambiente silenciosa antes de uma virada alta), os recursos de áudio podem não refletir o que os ouvintes experimentam primeiro.

Isso pode criar uma incompatibilidade: o algoritmo recomenda sua faixa com base na energia geral, mas os ouvintes pulam porque a introdução não corresponde às expectativas. Otimizar sua introdução é uma habilidade diferente de otimizar seu perfil geral de áudio.

Limitações da análise de áudio

A análise de áudio é poderosa, mas tem pontos cegos:

Falta contexto cultural. O algoritmo sabe que sua faixa tem muita energia e um tempo de 128 BPM, mas não sabe que a letra faz referência a um momento cultural específico ou que o estilo de produção evoca uma época determinada.

Sons semelhantes não significam públicos semelhantes. Duas faixas podem ter recursos de áudio quase idênticos, mas atrair ouvintes completamente diferentes. A análise de áudio encontra vizinhas sonoras, não vizinhas de público.

O gênero é inferido, não declarado. O Spotify usa as tags de gênero fornecidas pelo seu distribuidor, mas a análise de áudio pode substituí-las se as características sonoras não corresponderem. Uma faixa marcada como "hip-hop" que soa como folk acústico pode ser recomendada a ouvintes de folk.

O papel do áudio no algoritmo mais amplo

A análise de áudio é uma das três principais fontes de dados usadas pelo algoritmo do Spotify:

Fonte de dados O que captura Melhor para
Filtragem colaborativa Padrões de escuta entre usuários Encontrar sobreposição de público
Processamento de linguagem natural Letras, títulos de playlists, menções na web Entender o contexto cultural
Análise de áudio Características sonoras da forma de onda Encontrar faixas sonoramente semelhantes

Para artistas estabelecidos, a filtragem colaborativa predomina. Para artistas novos, a análise de áudio tem mais peso porque não há histórico de escuta para analisar.

O objetivo é lançar músicas com características de áudio claras e consistentes enquanto você constrói uma base de ouvintes engajada. A análise de áudio ajuda na descoberta; os sinais de engajamento determinam se você continuará recebendo recomendações.