MLOps no Brasil: Stack Recomendado e Arquitetura de Produção em 2026
Stack de MLOps recomendado em 2026: orquestração, feature store, registry, observabilidade de LLMs e custo. Arquitetura de referência.
Modelos saem do notebook todos os dias; poucos sobrevivem em produção por mais de três meses sem MLOps maduro. Em 2026, com agentes e LLMs no centro das aplicações, o termo se expandiu para LLMOps: além de pipelines de treino, é preciso orquestrar prompts, ferramentas, custos por token e avaliação contínua. Este guia traz uma arquitetura de referência testada em projetos brasileiros.
Camadas essenciais
- Dados: ingestão, qualidade, catalogação, lineage.
- Treino e experimentação: orquestração de jobs, tracking, registry.
- Serving: APIs de inferência, batch, streaming, edge.
- Observabilidade: latência, custo, drift, qualidade de respostas.
- Governança: model cards, fairness, compliance LGPD, política de acesso.
Stack recomendado em 2026
| Camada | Open source | Gerenciado |
|---|---|---|
| Orquestração | Airflow, Prefect, Dagster | Vertex Pipelines, AWS Step Functions |
| Feature store | Feast | Vertex Feature Store, Tecton |
| Experiment tracking | MLflow | Weights & Biases, Comet |
| Model serving | BentoML, Ray Serve, vLLM | SageMaker, Vertex Endpoints |
| Vector store | pgvector, Qdrant, Weaviate | Pinecone, Vertex Matching Engine |
| LLM observability | Langfuse, Phoenix | Datadog LLM, Helicone |
| Avaliação | Ragas, DeepEval | Braintrust, LangSmith |
Arquitetura de referência para LLMOps
O fluxo típico em produção: a aplicação chama um gateway de LLM que cuida de roteamento, fallback entre provedores, cache semântico e quotas. O gateway delega ao orquestrador de agente, que invoca ferramentas internas, consulta a vector store e registra cada passo no tracer de observabilidade. Avaliações automatizadas rodam offline diariamente sobre amostras anonimizadas e disparam alertas de regressão.
Decisões de arquitetura críticas
- Multi-provedor: nunca depender de um único fornecedor de LLM. Roteie por custo, latência e disponibilidade.
- Cache semântico: reduz 20–40% do custo de inferência em casos repetitivos.
- Guardrails de entrada e saída: prevenção de prompt injection, PII e conteúdo sensível.
- Avaliação contínua: golden set versionado, métricas por release, alertas de drift de qualidade.
Custo: o vetor mais subestimado
Sem observabilidade granular, o custo de IA escapa em semanas. O padrão recomendado é tagging de cada chamada por feature, time e cliente, com dashboards diários e budget alerts automáticos. Empresas maduras separam custo de pesquisa, custo de produção e custo por usuário ativo.
Erros comuns
- Adotar todas as ferramentas do mercado sem definir SLOs.
- Ignorar versionamento de prompts como se fossem código menor.
- Confundir avaliação humana ad-hoc com avaliação sistemática.
Próximos passos
A WSS desenha plataformas de IA com foco em sustentabilidade operacional. Veja implementação de IA e o artigo sobre por que projetos de IA falham em produção.