Como funciona a análise de áudio no Spotify
Quando uma faixa é enviada ao Spotify por meio de um distribuidor, ela passa por um pipeline automatizado de análise de áudio. O sistema processa a forma de onda bruta e extrai dezenas de características mensuráveis.
A tecnologia central são as redes neurais convolucionais (CNNs), o mesmo tipo de modelo de machine learning usado para reconhecimento de imagens. Em vez de analisar pixels, as CNNs do Spotify analisam espectrogramas, que são representações visuais das frequências sonoras ao longo do tempo.
A CNN aprende a detectar padrões nesses espectrogramas: batidas fortes de bateria e sintetizadores sugerem música eletrônica ou dançante; padrões suaves de violão acústico indicam gêneros folk ou de cantor e compositor; estruturas harmônicas complexas podem indicar jazz ou música clássica.
Os recursos de áudio que o Spotify extrai
A API do Spotify expõe 13 recursos de áudio para cada faixa. Eles são os blocos de construção que o algoritmo usa para medir a similaridade sonora.
Recursos de ritmo e tempo
| Recurso | Definição | Intervalo |
|---|---|---|
tempo |
Batidas por minuto estimadas (BPM) | 0-250 |
time_signature |
Batidas por compasso (3/4, 4/4 etc.) | 1-7 |
danceability |
Adequação para dançar com base no tempo, na estabilidade rítmica e na força da batida | 0.0-1.0 |
Danceability não é apenas tempo. Uma faixa de 120 BPM com ritmos irregulares recebe uma pontuação menor que uma faixa de 100 BPM com groove constante.
Recursos de energia e intensidade
| Recurso | Definição | Intervalo |
|---|---|---|
energy |
Medida perceptual de intensidade e atividade | 0.0-1.0 |
loudness |
Volume geral em decibéis (dB) | -60 a 0 dB |
Energy combina vários sinais: faixa dinâmica, volume percebido, timbre, taxa de início (com que frequência novos sons começam) e entropia geral. Death metal recebe uma pontuação alta; um prelúdio de Bach recebe uma pontuação baixa.
Recursos tonais
| Recurso | Definição | Intervalo |
|---|---|---|
key |
Centro tonal da faixa | 0-11 (C=0, C#=1 etc.) |
mode |
Maior (1) ou menor (0) | 0 ou 1 |
Esses recursos ajudam o algoritmo a agrupar faixas com estruturas harmônicas compatíveis, para que o Radio e o Autoplay possam passar de uma para outra sem uma mudança de tom brusca.
Recursos de humor e características
| Recurso | Definição | Intervalo |
|---|---|---|
valence |
Positividade musical (feliz vs. triste) | 0.0-1.0 |
acousticness |
Confiança de que a faixa é acústica | 0.0-1.0 |
instrumentalness |
Prevê se a faixa não tem vocais | 0.0-1.0 |
speechiness |
Presença de palavras faladas | 0.0-1.0 |
liveness |
Probabilidade de a faixa ter sido executada ao vivo | 0.0-1.0 |
Valence é especialmente importante para recomendações baseadas em humor. Uma faixa de valência alta (0.8+) soa alegre ou eufórica. Uma faixa de valência baixa (0.2 ou menos) soa triste, melancólica ou raivosa.
Como os recursos de áudio influenciam as recomendações
A análise de áudio resolve o problema de cold start. Quando um artista novo envia sua primeira faixa, ele não tem histórico de escuta nem dados de filtragem colaborativa. Mas os recursos de áudio ficam disponíveis imediatamente.
Veja como cada superfície algorítmica usa a análise de áudio:
Radio e Autoplay
Quando o Radio gera uma fila com base em uma faixa-semente, a similaridade de áudio é o sinal principal. O algoritmo encontra faixas com características semelhantes de:
- Tempo (dentro de um intervalo razoável para transições suaves)
- Nível de energia (para manter a intensidade da sessão)
- Tom e modo (para compatibilidade harmônica)
- Valência (para preservar o tom emocional)
É por isso que uma estação de Radio iniciada por uma faixa eletrônica de alta energia não insere de repente uma balada acústica lenta, mesmo que as duas músicas compartilhem tags de gênero.
Discover Weekly
O Discover Weekly usa principalmente a filtragem colaborativa, mas a análise de áudio funciona como critério de desempate. Quando várias faixas candidatas têm pontuações semelhantes de sobreposição de escuta, o algoritmo favorece aquelas cujos recursos de áudio são mais próximos do seu perfil de gostos existente.
O que os artistas podem aprender com os recursos de áudio
Você não consegue controlar como o Spotify analisa seu áudio. Mas conhecer esses recursos mostra como o algoritmo ouve sua música e com quais faixas ele vai agrupá-la.
Como conferir os recursos de áudio da sua faixa
Tip Ferramentas de terceiros podem obter os recursos de áudio da sua faixa pela API do Spotify. Procure serviços que permitam inserir a URL de uma faixa do Spotify e retornem os valores dos recursos.
O que observar:
- Recursos consistentes em todo o catálogo ajudam o algoritmo a agrupar sua música. Se suas faixas variam muito em energia, tempo e valência, fica mais difícil para o algoritmo prever quem vai gostar delas.
- Recursos que combinam com seu público-alvo melhoram o posicionamento no Radio. Se seu som é dançante e de alta energia, suas faixas têm mais chances de aparecer em sessões de Radio voltadas para exercícios e festas.
O problema da introdução
A análise de áudio examina a faixa inteira, mas o comportamento dos ouvintes é fortemente influenciado pelos primeiros 30 segundos. Se sua introdução tem características diferentes do restante da música (uma introdução ambiente silenciosa antes de uma virada alta), os recursos de áudio podem não refletir o que os ouvintes experimentam primeiro.
Isso pode criar uma incompatibilidade: o algoritmo recomenda sua faixa com base na energia geral, mas os ouvintes pulam porque a introdução não corresponde às expectativas. Otimizar sua introdução é uma habilidade diferente de otimizar seu perfil geral de áudio.
Limitações da análise de áudio
A análise de áudio é poderosa, mas tem pontos cegos:
Falta contexto cultural. O algoritmo sabe que sua faixa tem muita energia e um tempo de 128 BPM, mas não sabe que a letra faz referência a um momento cultural específico ou que o estilo de produção evoca uma época determinada.
Sons semelhantes não significam públicos semelhantes. Duas faixas podem ter recursos de áudio quase idênticos, mas atrair ouvintes completamente diferentes. A análise de áudio encontra vizinhas sonoras, não vizinhas de público.
O gênero é inferido, não declarado. O Spotify usa as tags de gênero fornecidas pelo seu distribuidor, mas a análise de áudio pode substituí-las se as características sonoras não corresponderem. Uma faixa marcada como "hip-hop" que soa como folk acústico pode ser recomendada a ouvintes de folk.
O papel do áudio no algoritmo mais amplo
A análise de áudio é uma das três principais fontes de dados usadas pelo algoritmo do Spotify:
| Fonte de dados | O que captura | Melhor para |
|---|---|---|
| Filtragem colaborativa | Padrões de escuta entre usuários | Encontrar sobreposição de público |
| Processamento de linguagem natural | Letras, títulos de playlists, menções na web | Entender o contexto cultural |
| Análise de áudio | Características sonoras da forma de onda | Encontrar faixas sonoramente semelhantes |
Para artistas estabelecidos, a filtragem colaborativa predomina. Para artistas novos, a análise de áudio tem mais peso porque não há histórico de escuta para analisar.
O objetivo é lançar músicas com características de áudio claras e consistentes enquanto você constrói uma base de ouvintes engajada. A análise de áudio ajuda na descoberta; os sinais de engajamento determinam se você continuará recebendo recomendações.