Engenheiro(a) de Automação de Infraestrutura

DellApplyPublished 7 hours agoFirst seen 7 hours ago
Apply

Engenheiro(a) de Automação de Infraestrutura
 

O(A) Engenheiro(a) de Automação de Infraestrutura é responsável por projetar, desenvolver e operar uma plataforma compartilhada de automação que habilita operações de infraestrutura nos domínios de computação, rede e armazenamento em escala corporativa. A função tem foco na criação de capacidades de automação orientadas a eventos, remediação autônoma, integração de plataformas e excelência operacional por meio de práticas de engenharia de software, permitindo que as equipes de Site Reliability Engineering (SRE) automatizem e escalem operações de infraestrutura de forma eficiente.

Junte-se a nós para realizar o melhor trabalho da sua carreira e gerar um impacto significativo como Engenheiro(a) de Automação de Infraestrutura na equipe Infrastructure Reliability & Intelligent Systems (I.R.I.S.).


O que você irá alcançar

Nesta função, você será responsável por projetar e entregar capacidades compartilhadas de automação que suportam operações de infraestrutura em múltiplos domínios tecnológicos. Você trabalhará em parceria com equipes de SRE, Engenharia, Observabilidade e Governança para desenvolver frameworks de automação, fluxos orientados a eventos, serviços de integração e capacidades de remediação inteligente que aumentem a eficiência operacional, confiabilidade e conformidade.

Você irá:

  • Projetar, desenvolver, manter e evoluir a plataforma compartilhada de automação utilizada pelas equipes de SRE, incluindo frameworks Ansible, roles compartilhadas, inventários dinâmicos, padrões de execução, templates GitLab CI/CD e bibliotecas de integração via API.
  • Desenvolver, orquestrar e aprimorar continuamente capacidades de plataforma agentic, incluindo agentes de remediação baseados em LLM responsáveis por consumir telemetria, correlacionar eventos, executar runbooks automatizados e aumentar os índices de resolução autônoma.
  • Desenvolver e manter frameworks de automação orientados a eventos, garantindo mecanismos de concorrência, segurança operacional, rollback e confiabilidade da plataforma.
  • Criar padrões reutilizáveis de automação para provisionamento zero-touch, gerenciamento de firmware, correção de desvios de configuração, gestão de capacidade e remediação automática de incidentes.
  • Desenvolver e administrar integrações entre a plataforma de automação e sistemas corporativos, incluindo ServiceNow CMDB, ServiceNow ITSM, NetBox, Jira, Archer e APIs de fornecedores de infraestrutura.
  • Colaborar com equipes de Observabilidade para garantir o correto fluxo, processamento e consumo de telemetria para suportar decisões automatizadas e operações orientadas a eventos.
  • Construir e manter bases estruturadas de conhecimento para armazenar e disponibilizar informações de resolução de incidentes para usuários e agentes inteligentes.
  • Definir e manter contratos de API, SDKs e padrões de integração para onboarding de automações específicas de domínio na plataforma compartilhada.
  • Definir e monitorar SLIs, SLOs e error budgets da plataforma de automação, incluindo confiabilidade de execução, latência de agentes, eficiência de resolução autônoma e qualidade da base de conhecimento.
  • Implementar e evoluir práticas de observabilidade da própria plataforma, garantindo monitoramento, alertas, análise de falhas e capacidades de auto recuperação.
  • Liderar análises pós-incidente sem atribuição de culpa, produzindo documentação estruturada de causa raiz e relatórios executivos quando falhas da plataforma ou automações gerarem impacto operacional.
  • Identificar oportunidades de automação compartilhada entre diferentes domínios de infraestrutura e implementar soluções de plataforma reutilizáveis.
  • Trabalhar em parceria com equipes de SRE de Computação, Rede e Armazenamento para definir integrações, controles de segurança, requisitos de testes e adoção da plataforma.
  • Colaborar com equipes de Engenharia para suportar novos requisitos tecnológicos e desenvolver capacidades de automação alinhadas aos roadmaps futuros.
  • Contribuir para iniciativas de policy-as-code, incluindo controles de mudança, restrições operacionais, trilhas de auditoria, geração de evidências de conformidade e controles de impacto.
  • Trabalhar em parceria com equipes de Governança, Risco e Compliance para garantir que os processos automatizados atendam requisitos de auditoria e conformidade regulatória.
  • Gerenciar o roadmap de capacidades da plataforma com base em métricas de cobertura de automação, resolução autônoma e impacto operacional.
  • Avaliar novas tecnologias e ferramentas, conduzindo análises de build versus buy e integrando novas capacidades quando apropriado.
  • Participar da escala de plantão da plataforma compartilhada de automação, apoiando a restauração de serviços em casos de falhas de integrações, pipelines ou execução de agentes.

Requisitos Essenciais

  • Mais de 5 anos de experiência em automação de infraestrutura, engenharia de plataformas, DevOps, SRE ou áreas correlatas em ambientes corporativos de grande escala.
  • Sólida experiência em desenvolvimento de software utilizando Python para construção de soluções de produção.
  • Experiência avançada com Ansible em ambientes corporativos de grande porte.
  • Experiência no desenvolvimento de capacidades de CI/CD, preferencialmente utilizando GitLab CI.
  • Experiência em integração de plataformas de infraestrutura por meio de APIs corporativas em pelo menos dois domínios tecnológicos relevantes.
  • Conhecimento sólido de Git, GitOps, infraestrutura como código e governança de desenvolvimento.
  • Capacidade comprovada de diagnosticar falhas complexas de automação envolvendo múltiplas camadas de infraestrutura.
  • Forte capacidade analítica para investigação de incidentes, análise de causa raiz e evolução de processos de automação.


Requisitos Desejáveis

  • Experiência com arquiteturas de automação orientadas a eventos.
  • Experiência com plataformas de IA generativa, LLMs ou sistemas agentic aplicados a operações.
  • Conhecimento de ServiceNow CMDB e NetBox.
  • Experiência com Moogsoft ou plataformas similares de AIOps.
  • Experiência com tecnologias de pipelines de dados e telemetria, como Cribl ou Kafka.
  • Experiência de integração com plataformas de observabilidade como Zabbix, vROps e Dynatrace.
  • Familiaridade com ambientes regulados por SOX, PCI-DSS e ISO 27001.
  • Experiência na construção de plataformas internas para desenvolvedores ou operadores.
Who We Are

We believe that each of us has the power to make an impact. That’s why we put our team members at the center of everything we do. If you’re looking for an opportunity to grow your career with some of the best minds and most advanced tech in the industry, we’re looking for you.

Dell Technologies is a unique family of businesses that helps individuals and organizations transform how they work, live and play. Join us to build a future that works for everyone because Progress Takes All of Us.

Dell Technologies is committed to the principle of equal employment opportunity for all employees and to providing employees with a work environment free of discrimination and harassment. Read the full Equal Employment Opportunity Policy.

Visit our Culture Code page to learn more about how we work and lead.