Marcelo Bertho
Tech Lead SRE / DevOps / Platform Engineering · Cloud · IA para Infraestrutura
Campinas e Região, Brasil
Líder de tecnologia com mais de 20 anos de experiência e forte atuação recente em SRE, DevOps, Cloud e Platform Engineering. Liderei transformações cloud-native, formei times de engenharia e operei plataformas de missão crítica em AWS, GCP e Azure.
Tenho profundidade em Kubernetes/EKS, Terraform, GitOps, CI/CD, observabilidade, service mesh, reliability engineering e FinOps. Operei sistemas sob tráfego extremo — grandes eventos de bilheteria, Black Friday, campanhas nacionais de TV e cargas de bilhões de mensagens por mês.
Hoje, meu foco é construir Agentes de IA para Infraestrutura & SRE: automação de troubleshooting, correlação de sinais entre AWS, Datadog e Cloudflare e resposta inteligente a incidentes. É a base da minha plataforma de AI Ops — levar IA do experimento à operação confiável.
Áreas de atuação
- Agentes de IA para Infraestrutura & SRE (AI Ops)
- SRE: SLA/SLO, MTTR/MTTD, alta disponibilidade, DR (RPO/RTO)
- Platform Engineering & Internal Developer Platform (IDP)
- Cloud multi-nuvem: AWS · GCP · Azure
- Kubernetes/EKS, Terraform, GitOps (ArgoCD), service mesh (Istio)
- Observabilidade: Datadog, Prometheus, Grafana, New Relic
- FinOps, gestão de incidentes e postmortems
Experiência
Lidero infraestrutura cloud, SRE e platform engineering para sistemas de bilheteria de altíssima concorrência (Eliminatórias da Seleção, Guns N' Roses, Festival de Parintins, Tardezinha). Desenvolvo Agentes de IA para Infra & SRE para troubleshooting automatizado, análise cross-system e resposta mais rápida a incidentes. Stack: AWS, EKS, Terraform, ArgoCD, Istio, Vault, Datadog, GitOps.
Liderei a transformação cloud-native do agronegócio (empresa controlada por LDC, ADM, Cargill e Amaggi), sustentando picos sazonais e campanhas nacionais de TV com zero downtime. AWS, GCP, Kubernetes, Terraform, ArgoCD, Istio, New Relic.
Liderei a transformação em organização cloud-native, com SRE, DevOps e DataOps sobre Kubernetes, AWS e GCP. Datadog, New Relic, Terraform, Crossplane, ArgoCD.
Preparei e operei infraestrutura para Black Friday e campanhas nacionais de TV do maior e-commerce pet do Brasil, sob tráfego extremo. Kubernetes, Istio, GitOps, IaC e observabilidade.
Liderei iniciativas de DevOps e DataOps no Brasil como parte de um time global, construindo uma das maiores plataformas de dados corporativas. Azure, Azure DevOps, Key Vault, Talend, Power BI.
Operei plataformas de mensageria em escala massiva — ~1,2 bilhão de SMS e 30 milhões de mensagens WhatsApp por mês. 900+ instâncias multi-cloud (AWS, GCP, Azure, Oracle, VMware, XenServer).
Projeto SISFRON (Sistema Integrado de Monitoramento de Fronteiras — Exército Brasileiro): infraestrutura de missão crítica altamente disponível, CI/CD e um NOC para monitoramento nacional de comunicações.
Liderei a infraestrutura, CI/CD e operações de TI da rápida expansão do centro de pesquisa da Samsung no Brasil — de ~40 para mais de 450 colaboradores. Processos CMMI nível 2 e 3.
Experiência anterior: IBM, FITec e CPQD como Configuration Management Analyst (2002–2006) — release management, governança de SCM, CMMI nível 2/3, ClearCase/Perforce e automação em Perl/CSH.
Formação acadêmica
Vamos colocar sua IA em operação?
Conheça a plataforma de AI Ops ou fale diretamente comigo sobre o seu desafio de infraestrutura e IA.
Agendar conversa