Cómo funciona el análisis de audio en Spotify
Cuando un track se sube a Spotify a través de un distribuidor, pasa por un pipeline automatizado de análisis de audio. El sistema procesa la forma de onda sin procesar y extrae docenas de características medibles.
La tecnología central son las redes neuronales convolucionales (CNN), el mismo tipo de modelos de aprendizaje automático que se utilizan para reconocer imágenes. En lugar de analizar píxeles, las CNN de Spotify analizan espectrogramas, representaciones visuales de las frecuencias del sonido a lo largo del tiempo.
La CNN aprende a detectar patrones en estos espectrogramas: los golpes fuertes de batería y los sintetizadores sugieren música electrónica o dance; los patrones suaves de guitarra acústica indican géneros folk o de cantautor; las estructuras armónicas complejas pueden señalar jazz o música clásica.
Las características de audio que extrae Spotify
La API de Spotify expone 13 características de audio para cada track. Son los componentes básicos que utiliza el algoritmo para medir la similitud sonora.
Características de ritmo y tempo
| Característica | Definición | Rango |
|---|---|---|
tempo |
Golpes por minuto (BPM) estimados | 0-250 |
time_signature |
Golpes por compás (3/4, 4/4, etc.) | 1-7 |
danceability |
Adecuación para bailar según el tempo, la estabilidad rítmica y la fuerza del beat | 0.0-1.0 |
Danceability no es solo una cuestión de tempo. Un track de 120 BPM con ritmos irregulares obtiene una puntuación menor que uno de 100 BPM con un groove constante.
Características de energía e intensidad
| Característica | Definición | Rango |
|---|---|---|
energy |
Medida perceptiva de intensidad y actividad | 0.0-1.0 |
loudness |
Volumen general en decibelios (dB) | -60 a 0 dB |
Energy combina varias señales: rango dinámico, volumen percibido, timbre, tasa de aparición (la frecuencia con la que empiezan sonidos nuevos) y entropía general. El death metal obtiene una puntuación alta; un preludio de Bach, una baja.
Características tonales
| Característica | Definición | Rango |
|---|---|---|
key |
Centro tonal del track | 0-11 (C=0, C#=1, etc.) |
mode |
Mayor (1) o menor (0) | 0 o 1 |
Estas características ayudan al algoritmo a agrupar tracks con estructuras armónicas compatibles, de modo que Radio y Autoplay puedan pasar de uno a otro sin un cambio de tonalidad brusco.
Características de estado de ánimo y carácter
| Característica | Definición | Rango |
|---|---|---|
valence |
Positividad musical (feliz frente a triste) | 0.0-1.0 |
acousticness |
Confianza en que el track sea acústico | 0.0-1.0 |
instrumentalness |
Predice si el track no tiene voces | 0.0-1.0 |
speechiness |
Presencia de palabras habladas | 0.0-1.0 |
liveness |
Probabilidad de que el track se interpretara en directo | 0.0-1.0 |
Valence es especialmente importante para las recomendaciones basadas en el estado de ánimo. Un track con valencia alta (0.8+) suena alegre o eufórico. Uno con valencia baja (0.2 o menos) suena triste, melancólico o enfadado.
Cómo influyen las características de audio en las recomendaciones
El análisis de audio resuelve el problema del arranque en frío. Cuando un artista nuevo sube su primer track, no tiene historial de escucha ni datos de filtrado colaborativo. Pero las características de audio están disponibles de inmediato.
Así utiliza cada superficie algorítmica el análisis de audio:
Radio y Autoplay
Cuando Radio genera una cola basada en un track semilla, la similitud de audio es la señal principal. El algoritmo encuentra tracks con características similares de:
- Tempo (dentro de un rango razonable para transiciones suaves)
- Nivel de energía (para mantener la intensidad de la sesión)
- Tonalidad y modo (para la compatibilidad armónica)
- Valencia (para conservar el tono emocional)
Por eso una emisora de Radio iniciada con un track electrónico de alta energía no inserta de repente una balada acústica lenta, aunque ambas canciones compartan etiquetas de género.
Discover Weekly
Discover Weekly utiliza principalmente el filtrado colaborativo, pero el análisis de audio sirve como desempate. Cuando varios tracks candidatos tienen puntuaciones similares de coincidencia de escucha, el algoritmo favorece los que tienen características de audio más cercanas a tu perfil de gustos actual.
Qué pueden aprender los artistas de las características de audio
No puedes controlar cómo analiza Spotify tu audio. Sin embargo, conocer estas características te indica cómo escucha el algoritmo tu música y con qué tracks la agrupará.
Comprobar las características de audio de tu track
Tip Las herramientas de terceros pueden extraer las características de audio de tu track desde la API de Spotify. Busca servicios que te permitan introducir la URL de un track de Spotify y devuelvan los valores de sus características.
En qué fijarte:
- Características coherentes en todo tu catálogo ayudan al algoritmo a agrupar tu música. Si tus tracks varían mucho en energía, tempo y valencia, al algoritmo le cuesta más predecir quién los disfrutará.
- Características que coinciden con tu audiencia objetivo mejoran la aparición en Radio. Si tu sonido es energético y bailable, es más probable que tus tracks aparezcan en sesiones de Radio orientadas al entrenamiento y a las fiestas.
El problema de la intro
El análisis de audio examina el track completo, pero el comportamiento del oyente está muy influido por los primeros 30 segundos. Si tu intro tiene características distintas a las del resto de la canción (una intro ambiental tranquila antes de un drop fuerte), las características de audio quizá no reflejen lo primero que experimentan los oyentes.
Esto puede crear un desajuste: el algoritmo recomienda tu track según su energía general, pero los oyentes hacen skip porque la intro no coincide con sus expectativas. Optimizar la intro es una habilidad distinta de optimizar tu perfil de audio general.
Limitaciones del análisis de audio
El análisis de audio es potente, pero tiene puntos ciegos:
Falta el contexto cultural. El algoritmo sabe que tu track tiene mucha energía y un tempo de 128 BPM, pero no sabe que la letra hace referencia a un momento cultural concreto o que el estilo de producción evoca una época determinada.
Los sonidos similares no equivalen a audiencias similares. Dos tracks pueden tener características de audio casi idénticas y atraer a oyentes completamente distintos. El análisis de audio encuentra vecinos sonoros, no vecinos de audiencia.
El género se infiere, no se declara. Spotify utiliza las etiquetas de género que proporciona tu distribuidor, pero el análisis de audio puede imponerse si las características sonoras no coinciden. Un track etiquetado como «hip-hop» que suena a folk acústico podría recomendarse a oyentes de folk.
El papel del audio en el algoritmo general
El análisis de audio es una de las tres fuentes de datos principales que utiliza el algoritmo de Spotify:
| Fuente de datos | Qué captura | Mejor para |
|---|---|---|
| Filtrado colaborativo | Patrones de escucha entre usuarios | Encontrar coincidencias de audiencia |
| Procesamiento del lenguaje natural | Letras, títulos de playlists, menciones en la web | Entender el contexto cultural |
| Análisis de audio | Características sonoras de la forma de onda | Encontrar tracks sonoramente similares |
En artistas consolidados, domina el filtrado colaborativo. En artistas nuevos, el análisis de audio tiene más peso porque no hay historial de escucha que analizar.
El objetivo es publicar música con características de audio claras y coherentes mientras construyes una base de oyentes implicados. El análisis de audio ayuda a que te descubran; las señales de interacción determinan si seguirás recibiendo recomendaciones.