El Problema: Insights de Datos a Escala
En Spotify, con más de 70,000 datasets y petabytes de datos, ningún experto puede saberlo todo. El enfoque tradicional—preguntar a un colega en Slack—no escala. Simplemente meter todos los esquemas en un LLM falla: las ventanas de contexto son pequeñas y los esquemas no capturan semántica. Una columna INT64 puede contener datos de prueba legacy o conteos reales de usuarios, y el modelo no puede diferenciar.
La Solución: Una Capa de Contexto
Spotify construyó un asistente de datos (llamado Vedder) que se sitúa entre los datos brutos y el LLM. Usa un bucle ReAct para razonar, generar SQL y ejecutar consultas, devolviendo respuestas con fuentes. La innovación clave es el modelo de clúster: un paquete de contexto específico de dominio curado por expertos humanos.
Cada clúster incluye:
- Datasets: tablas relevantes con esquema completo, perfil de columnas (ej: valores comunes como 'US', 'GB') y particiones.
- Pares: ejemplos pregunta-SQL verificados que enseñan al modelo los patrones correctos.
- Docs: contexto de negocio, terminología y trampas.
La curaduría está a cargo de científicos de datos e ingenieros de analytics que entienden profundamente los datos. Ellos deciden qué incluir y aprueban cada par.
Por Qué Importa la Curaduría Humana
Spotify probó un enfoque automatizado: usar el historial completo de consultas para generar pares pregunta-SQL. Pero cuando los curadores revisaron, aceptaron solo 12.5%. El resto eran exploraciones ad-hoc, sesiones de debugging o consultas que enseñaban patrones incorrectos. El historial de consultas es ruidoso; la señal no se etiqueta sola.
Así que cada ejemplo pasa por un experto. No se trata de reemplazar humanos—sino de amplificar su experiencia de manera escalable.

El Modelo de Clúster en la Práctica
Aquí tienes un ejemplo simplificado de cómo se ve un par curado:
# Ejemplo de un par pregunta-SQL curado en un clúster
pares_curados = [
{
"pregunta": "¿Cuántos usuarios activos en EE.UU. la semana pasada?",
"sql": """
SELECT COUNT(DISTINCT user_id) AS usuarios_activos
FROM actividad_usuario
WHERE pais = 'US'
AND fecha_actividad >= DATE_SUB(CURRENT_DATE(), INTERVAL 7 DAY)
AND es_usuario_prueba = FALSE
"""
}
]
Este par enseña al LLM a filtrar usuarios de prueba y usar el rango de fechas correcto—algo que un esquema bruto no transmitiría.
Manteniendo Clústeres Saludables
Los datos cambian constantemente. Los clústeres tienen un health score basado en señales como:
- Drift de esquema: los pares que referencian columnas renombradas se degradan inmediatamente.
- Cobertura: qué tan bien responde el contexto a preguntas reales de los usuarios.
- Reproducibilidad: ¿el SQL generado puede reejecutarse con éxito?
Los dueños de clústeres ven estos scores en un dashboard y deciden dónde invertir tiempo de curaduría.

Limitaciones y Precauciones
- La curaduría es laboriosa: los expertos deben revisar cada par, y esto no escala sin herramientas dedicadas.
- Contexto desactualizado: incluso con health scores, hay un desfase entre cambios de datos y actualizaciones de curaduría.
- No es una solución universal: la arquitectura funciona bien en Spotify porque tienen una cultura de datos sólida. Para empresas con datos desordenados, el costo de curaduría puede ser prohibitivo.
Próximos Pasos
- Explora el paper de ReAct para más sobre bucles de razonamiento.
- Mira los servidores MCP para integrar asistentes de IA con IDEs.
- Estudia cómo adaptar el enfoque de Spotify a tu propia stack de datos.

Conclusión
El asistente de datos de Spotify muestra que la clave para insights confiables con IA no es solo un mejor modelo—es una capa de contexto curada construida por expertos humanos. Al codificar conocimiento de dominio en clústeres, han hecho posible que usuarios no-SQL obtengan respuestas confiables a escala.
Si estás construyendo un sistema similar, enfócate en: ownership, curaduría y loops de feedback. Deja que los expertos curen el contexto, monitorea la salud y mejora continuamente.
Para más sobre infraestructura de datos a escala, revisa nuestro artículo sobre cómo Meta escaló FFmpeg para miles de millones de videos. Y para un vistazo a cómo las grandes tecnológicas manejan gobernanza de IA en entornos desconectados, mira nuestra pieza sobre el cloud soberano de Microsoft.