O Problema: Insights de Dados em Escala
No Spotify, com mais de 70.000 datasets e petabytes de dados, nenhum especialista consegue saber tudo. A abordagem tradicional—perguntar a um colega no Slack—não escala. Simplesmente jogar todos os schemas em um LLM falha: janelas de contexto são pequenas e schemas não capturam semântica. Uma coluna INT64 pode conter dados de teste legados ou contagens reais de usuários, e o modelo não consegue distinguir.
A Solução: Uma Camada de Contexto
O Spotify construiu um assistente de dados (chamado Vedder) que fica entre os dados brutos e o LLM. Ele usa um loop ReAct para raciocinar, gerar SQL e executar consultas, retornando respostas com fontes. A inovação principal é o modelo de cluster: um pacote de contexto específico de domínio curado por especialistas humanos.
Cada cluster inclui:
- Datasets: tabelas relevantes com schema completo, perfil de colunas (ex: valores comuns como 'US', 'GB') e partições.
- Pares: exemplos pergunta-SQL verificados que ensinam ao modelo os padrões corretos.
- Docs: contexto de negócio, terminologia e pegadinhas.
A curadoria é feita por cientistas de dados e engenheiros de analytics que entendem profundamente os dados. Eles decidem o que incluir e aprovam cada par.
Por Que a Curadoria Humana Importa
O Spotify testou uma abordagem automatizada: usar o histórico completo de consultas para gerar pares pergunta-SQL. Mas quando os curadores revisaram, aceitaram apenas 12,5%. O resto eram explorações ad-hoc, sessões de debugging ou consultas que ensinavam padrões errados. O histórico de consultas é ruidoso; o sinal não se rotula sozinho.
Então cada exemplo passa por um especialista. Não se trata de substituir humanos—mas de amplificar sua expertise de forma escalável.

O Modelo de Cluster na Prática
Aqui está um exemplo simplificado de como um par curado pode parecer:
# Exemplo de um par pergunta-SQL curado em um cluster
pares_curados = [
{
"pergunta": "Quantos usuários ativos nos EUA na última semana?",
"sql": """
SELECT COUNT(DISTINCT user_id) AS usuarios_ativos
FROM atividade_usuario
WHERE pais = 'US'
AND data_atividade >= DATE_SUB(CURRENT_DATE(), INTERVAL 7 DAY)
AND is_usuario_teste = FALSE
"""
}
]
Esse par ensina ao LLM a filtrar usuários de teste e usar o intervalo de datas correto—algo que um schema bruto não transmitiria.
Mantendo Clusters Saudáveis
Os dados mudam constantemente. Clusters têm um health score baseado em sinais como:
- Drift de schema: pares que referenciam colunas renomeadas degradam imediatamente.
- Cobertura: quão bem o contexto responde a perguntas reais dos usuários.
- Reproducibilidade: o SQL gerado pode ser reexecutado com sucesso?
Os donos dos clusters veem esses scores em um dashboard e decidem onde gastar tempo de curadoria.

Limitações e Cuidados
- Curadoria é trabalhosa: especialistas precisam revisar cada par, e isso não escala sem ferramentas dedicadas.
- Contexto desatualizado: mesmo com health scores, há um atraso entre mudanças de dados e atualizações de curadoria.
- Não é uma solução universal: a arquitetura funciona bem no Spotify porque eles têm uma cultura forte de dados. Para empresas com dados bagunçados, o custo de curadoria pode ser proibitivo.
Próximos Passos
- Explore o paper do ReAct para mais sobre loops de raciocínio.
- Olhe para servidores MCP para integrar assistentes de IA com IDEs.
- Estude como adaptar a abordagem do Spotify para sua própria stack de dados.

Conclusão
O assistente de dados do Spotify mostra que a chave para insights confiáveis com IA não é apenas um modelo melhor—é uma camada de contexto curada construída por especialistas humanos. Ao codificar conhecimento de domínio em clusters, eles tornaram possível para usuários não-SQL obter respostas confiáveis em escala.
Se você está construindo um sistema similar, foque em: ownership, curadoria e loops de feedback. Deixe especialistas curadores de contexto, monitore a saúde e melhore continuamente.
Para mais sobre infraestrutura de dados em escala, veja nosso artigo sobre como o Meta escalou o FFmpeg para bilhões de vídeos. E para um olhar sobre como grandes empresas de tecnologia lidam com governança de IA em ambientes desconectados, veja nossa peça sobre o cloud soberano da Microsoft.