TOTVS logo
TOTVS

263 open roles

[Tech] Especialista SRE | IA | REMOTO

Remote, BrazilPosted Oct 10, 2026

Job description

Vagas 〉 [Tech] Especialista SRE | IA | REMOTO [Tech] Especialista SRE | IA | REMOTO TOTVS | Remoto Você fará parte do time de Site Reliability Engineering (SRE), sendo responsável por estabelecer padrões de qualidade dos serviços de infraestrutura, acompanhando as inovações do mercado e garantindo a excelência do ecossistema tecnológico dos ambientes Cloud TOTVS.

Será responsável por assegurar a confiabilidade, disponibilidade, desempenho, segurança e evolução contínua dos serviços sob sua responsabilidade, atuando como referência técnica na implementação de soluções, automação de processos, observabilidade, governança e melhoria contínua, contribuindo diretamente para os objetivos estratégicos da companhia.

Faixa salarial A combinar Regime de contratação CLT Benefícios Universidade em Rede TOTVS, uma universidade Corporativa com conteúdos e certificações gratuitos para cada pessoa colaboradora; Programa +Saudáveis, que cuida de cada TOTVER com assessoria e ações voltadas para o bem estar em corpo, mente e finanças pessoais; Programa +Vantagens, a maior rede de descontos da América Latina, exclusivos para nossas pessoas colaboradoras; Programa + Cuidado, programa de apoio pessoal para pessoas colaboradoras e familiares, com orientações em diversas especialidades como: psicologia, serviço social, pet consultoria...

Einstein Conecta, benefício de orientação médica online pelos médicos do Hospital Israelita Albert Einstein, totalmente gratuito; Plano de saúde e odontológico; Vale refeição e / ou alimentação; Vale transporte e fretados em algumas estações do metrô; Licença maternidade e paternidade estendida; Espaço de lactário; Bicicletário; Vestiário; Seguro de vida; Auxílio creche; Previdência privada; Escritório que estimula a criatividade e produtividade com ambientes para lanches, salas de jogos, mesas de bilhar e poltronas para relaxar; Gympass.

O QUE VOCÊ VAI FAZER: Monitorar continuamente a saúde dos sistemas, criar alertas eficazes e garantir cobertura proativa de incidentes. Responder rapidamente a incidentes críticos, coordenando mitigação, comunicação e resolução. Gerir mudanças, atualizações e implantações com foco em segurança, estabilidade e disponibilidade.

Construir e manter pipelines, bibliotecas e automações para provisionamento, deploy e operação em ambientes Cloud de alta disponibilidade. Estabelecer e garantir padrões de security by design em infraestrutura, código e dados. Projetar e evoluir soluções de observabilidade ponta a ponta, integrando logs, métricas, traces e eventos.

Criar, gerenciar e melhorar indicadores de confiabilidade (SLIs, SLOs, MTTR, MTTA). Conduzir post-mortems blameless e implementar ações corretivas e preventivas. Influenciar decisões arquiteturais e operacionais visando resiliência, escalabilidade e custo eficiente. Documentar padrões técnicos, playbooks e comunicar impactos técnicos em linguagem de negócio.

Definir prioridades estratégicas do backlog de SRE, equilibrando confiabilidade, velocidade de entrega, segurança e custos. Apoiar auditorias, conformidade e governança de segurança em alinhamento com times de risco e compliance. Capacidade de mentorar e influenciar tecnicamente outros times, promovendo cultura de automação, segurança e confiabilidade e fomentando a cultura de ownership sobre sistemas em produção.

Disseminar conhecimento técnico por meio de mentorias, treinamentos, workshops, documentações e apresentações internas e externas, contribuindo para o desenvolvimento da equipe. Buscar continuamente novas tecnologias, soluções e referências de mercado junto a fabricantes e fornecedores, avaliando sua viabilidade técnica e de negócio.

O QUE ESPERAMOS DE VOCÊ: Domínio de conceitos avançados de SRE, Dev. Sec. Ops e gestão de incidentes. Automação de infraestrutura e pipelines em alto nível, utilizando Shell, Python, Go, Node.js ou Groovy. Experiência com monitoramento e observabilidade distribuída (Prometheus, Grafana, Loki, ELK/Elastic Stack, Datadog, New Relic, Open.

Telemetry). Atuação sólida com Cloud pública (GCP, AWS ou equivalente), incluindo provisionamento, automação e otimização de custos. Experiência em CI/CD e Dev. Sec. Ops avançado, com ferramentas como Git/Git. Ops, Jenkins, ArgoCD, Maven, Sonar. Qube/Cloud. Proficiência em contêineres e orquestração (Docker, Kubernetes) e Infraestrutura como Código (Terraform, Ansible, Cloud.

Formation, Chef). Vivência com serviços de mensageria e data streaming como Kafka, Redis Streams, Google Pub/Sub, Dataflow. Experiência com bancos de dados SQL e NoSQL, incluindo PostgreSQL, AloyDB, MySQL, MongoDB, Elasticsearch, Big. Query. Experiência em gestão de incidentes e troubleshooting em sistemas complexos, utilizando Pager.

Duty, Opsgenie, Status. Page, Splunk ou equivalentes. Conhecimento em segurança da informação, compliance e governança de ambientes cloud (LGPD, Privacy by Design, SAST/DAST, IAM, Secret Management). Familiaridade com ambientes de alto volume de dados, tráfego e experiência com design resiliente. Experiência ou interesse em Data.

Ops/MLOps, atuando com pipelines de dados e IA em larga escala (desejável). Background em arquitetura e desenvolvimento de software, com domínio de versionamento, APIs, microserviços e padrões REST/gRPC. Vivência em metodologias ágeis (Scrum, Kanban ou similares). Uso de IA assistiva e ferramentas de produtividade como GitHub Copilot, ChatGPT ou similares (diferencial).

Conhecimento de redes TCP/IP, DNS, HTTP/HTTPS, TLS, Load Balancers, CDN, VPN, proxies e troubleshooting de conectividade. Administração avançada Linux, análise de performance, gerenciamento de processos, memória, disco, rede e troubleshooting em ambientes produtivos. SERIA LEGAL SE TIVESSE: Certificações relevantes (AWS, GCP, Kubernetes, ITIL, Security+).

Experiência com políticas de segurança como zero-trust. Experiência em Fin. Ops e gestão de custos em ambientes distribuídos. Experiência com blue/green deployments, canary releases e chaos engineering. Experiência com padronização de deploys por templates (Helm/Kustomize). Prática com observabilidade unificada via Open.

Telemetry e tracing distribuído. Vivência em construção de plataformas internas (IDP), uso de Backstage, automação de ambientes. Inglês: Intermediário/Avançado Como empresa líder em tecnologia somos um universo de pessoas inconformadas, movidas por inovação, autonomia, aprendizado e performance. Juntos e juntas, criamos oportunidades, transformamos futuros e compartilhamos conhecimento.

Aqui o seu desenvolvimento profissional acontece em um ambiente inclusivo, respeitoso e energizante. De gente pra gente! Buscamos o crescimento sustentável. E usamos dados e IA para impulsionar resultados mais inteligentes e eficientes para os nossos clientes. Vem com a gente inovar e construir o futuro da tecnologia.

#Vem. PraTOTVS #SomosTOTVS Ver página da empresa Enviar candidatura [Tech] Especialista SRE | IA | REMOTO TOTVS | Remoto Descrição da vaga Você fará parte do time de Site Reliability Engineering (SRE), sendo responsável por estabelecer padrões de qualidade dos serviços de infraestrutura, acompanhando as inovações do mercado e garantindo a excelência do ecossistema tecnológico dos ambientes Cloud TOTVS.

Será responsável por assegurar a confiabilidade, disponibilidade, desempenho, segurança e evolução contínua dos serviços sob sua responsabilidade, atuando como referência técnica na implementação de soluções, automação de processos, observabilidade, governança e melhoria contínua, contribuindo diretamente para os objetivos estratégicos da companhia.

Responsabilidades e atribuições O QUE VOCÊ VAI FAZER: Monitorar continuamente a saúde dos sistemas, criar alertas eficazes e garantir cobertura proativa de incidentes. Responder rapidamente a incidentes críticos, coordenando mitigação, comunicação e resolução. Gerir mudanças, atualizações e implantações com foco em segurança, estabilidade e disponibilidade.

Construir e manter pipelines, bibliotecas e automações para provisionamento, deploy e operação em ambientes Cloud de alta disponibilidade. Estabelecer e garantir padrões de security by design em infraestrutura, código e dados. Projetar e evoluir soluções de observabilidade ponta a ponta, integrando logs, métricas, traces e eventos.

Criar, gerenciar e melhorar indicadores de confiabilidade (SLIs, SLOs, MTTR, MTTA). Conduzir post-mortems blameless e implementar ações corretivas e preventivas. Influenciar decisões arquiteturais e operacionais visando resiliência, escalabilidade e custo eficiente. Documentar padrões técnicos, playbooks e comunicar impactos técnicos em linguagem de negócio.

Definir prioridades estratégicas do backlog de SRE, equilibrando confiabilidade, velocidade de entrega, segurança e custos. Apoiar auditorias, conformidade e governança de segurança em alinhamento com times de risco e compliance. Capacidade de mentorar e influenciar tecnicamente outros times, promovendo cultura de automação, segurança e confiabilidade e fomentando a cultura de ownership sobre sistemas em produção.

Disseminar conhecimento técnico por meio de mentorias, treinamentos, workshops, documentações e apresentações internas e externas, contribuindo para o desenvolvimento da equipe. Buscar continuamente novas tecnologias, soluções e referências de mercado junto a fabricantes e fornecedores, avaliando sua viabilidade técnica e de negócio.

Requisitos e qualificações O QUE ESPERAMOS DE VOCÊ: Domínio de conceitos avançados de SRE, Dev. Sec. Ops e gestão de incidentes. Automação de infraestrutura e pipelines em alto nível, utilizando Shell, Python, Go, Node.js ou Groovy. Experiência com monitoramento e observabilidade distribuída (Prometheus, Grafana, Loki, ELK/Elastic Stack, Datadog, New Relic, Open.

Telemetry). Atuação sólida com Cloud pública (GCP, AWS ou equivalente), incluindo provisionamento, automação e otimização de custos. Experiência em CI/CD e Dev. Sec. Ops avançado, com ferramentas como Git/Git. Ops, Jenkins, ArgoCD, Maven, Sonar. Qube/Cloud. Proficiência em contêineres e orquestração (Docker, Kubernetes) e Infraestrutura como Código (Terraform, Ansible, Cloud.

Formation, Chef). Vivência com serviços de mensageria e data streaming como Kafka, Redis Streams, Google Pub/Sub, Dataflow. Experiência com bancos de dados SQL e NoSQL, incluindo PostgreSQL, AloyDB, MySQL, MongoDB, Elasticsearch, Big. Query. Experiência em gestão de incidentes e troubleshooting em sistemas complexos, utilizando Pager.

Duty, Opsgenie, Status. Page, Splunk ou equivalentes. Conhecimento em segurança da informação, compliance e governança de ambientes cloud (LGPD, Privacy by Design, SAST/DAST, IAM, Secret Management). Familiaridade com ambientes de alto volume de dados, tráfego e experiência com design resiliente. Experiência ou interesse em Data.

Ops/MLOps, atuando com pipelines de dados e IA em larga escala (desejável). Background em arquitetura e desenvolvimento de software, com domínio de versionamento, APIs, microserviços e padrões REST/gRPC. Vivência em metodologias ágeis (Scrum, Kanban ou similares). Uso de IA assistiva e ferramentas de produtividade como GitHub Copilot, ChatGPT ou similares (diferencial).

Conhecimento de redes TCP/IP, DNS, HTTP/HTTPS, TLS, Load Balancers, CDN, VPN, proxies e troubleshooting de conectividade. Administração avançada Linux, análise de performance, gerenciamento de processos, memória, disco, rede e troubleshooting em ambientes produtivos. Requisitos desejáveis SERIA LEGAL SE TIVESSE: Certificações relevantes (AWS, GCP, Kubernetes, ITIL, Security+).

Experiência com políticas de segurança como zero-trust. Experiência em Fin. Ops e gestão de custos em ambientes distribuídos. Experiência com blue/green deployments, canary releases e chaos engineering. Experiência com padronização de deploys por templates (Helm/Kustomize). Prática com observabilidade unificada via Open.

Telemetry e tracing distribuído. Vivência em construção de plataformas internas (IDP), uso de Backstage, automação de ambientes. Inglês: Intermediário/Avançado Enviar candidatura Enviar candidatura Faixa salarial A combinar Regime de contratação CLT Benefícios Universidade em Rede TOTVS, uma universidade Corporativa com conteúdos e certificações gratuitos para cada pessoa colaboradora; Programa +Saudáveis, que cuida de cada TOTVER com assessoria e ações voltadas para o bem estar em corpo, mente e finanças pessoais; Programa +Vantagens, a maior rede de descontos da América Latina, exclusivos para nossas pessoas colaboradoras; Programa + Cuidado, programa de apoio pessoal para pessoas colaboradoras e familiares, com orientações em diversas especialidades como: psicologia, serviço social, pet consultoria...

Einstein Conecta, benefício de orientação médica online pelos médicos do Hospital Israelita Albert Einstein, totalmente gratuito; Plano de saúde e odontológico; Vale refeição e / ou alimentação; Vale transporte e fretados em algumas estações do metrô; Licença maternidade e paternidade estendida; Espaço de lactário; Bicicletário; Vestiário; Seguro de vida; Auxílio creche; Previdência privada; Escritório que estimula a criatividade e produtividade com ambientes para lanches, salas de jogos, mesas de bilhar e poltronas para relaxar; Gympass.

Sobre a empresa Como empresa líder em tecnologia somos um universo de pessoas inconformadas, movidas por inovação, autonomia, aprendizado e performance. Juntos e juntas, criamos oportunidades, transformamos futuros e compartilhamos conhecimento. Aqui o seu desenvolvimento profissional acontece em um ambiente inclusivo, respeitoso e energizante.

De gente pra gente! Buscamos o crescimento sustentável. E usamos dados e IA para impulsionar resultados mais inteligentes e eficientes para os nossos clientes. Vem com a gente inovar e construir o futuro da tecnologia. #Vem. PraTOTVS #SomosTOTVS Ver página da empresa

Description copied from TOTVS's careers page. Read the full posting before you apply.

More jobs at TOTVS

See all openings at TOTVS