Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) – Storage

DellApplyPublished 19 hours agoFirst seen 15 hours ago
Apply

Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) – Storage 

Esta não é uma função tradicional de administração de storage. Não estamos procurando alguém para provisionar LUNs manualmente, responder a alertas de arrays de forma manual ou gerenciar a integridade da replicação acessando consoles de fabricantes. Se essa é a descrição da sua função atual e você deseja continuar trabalhando dessa forma, esta posição provavelmente não é a mais adequada para você.
Estamos construindo um modelo operacional de storage no qual a automação é responsável por todo o ciclo de vida do serviço, incluindo provisionamento, gerenciamento de capacidade, monitoramento da integridade da replicação, atualização de firmware e descomissionamento, tudo executado por meio de pipelines, sem interação direta com os arrays em ambiente de produção. Sua função será projetar, desenvolver e evoluir essa automação. Procuramos um(a) engenheiro(a) com sólida expertise em armazenamento, e não um(a) administrador(a) de storage que eventualmente desenvolve scripts.

Junte-se a nós como Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) – Storage  em nossa equipe de Engenharia de Infraestrutura para fazer o melhor trabalho da sua carreira e gerar um impacto social profundo em Eldorado do Sul - RS.

O que você conquistará

Como Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) – Storage, você será responsável por projetar, desenvolver e administrar automações para todo o ciclo de vida dos serviços de armazenamento, garantindo escalabilidade, disponibilidade, desempenho e confiabilidade dos ambientes corporativos que suportam cargas de trabalho críticas. Você trabalhará com equipes de Engenharia de Storage, Automação de Plataforma, Observabilidade e Infraestrutura para entregar uma operação altamente automatizada por meio de práticas modernas de SRE, automação e engenharia de confiabilidade.

Qualifications

Dê o primeiro passo para a carreira dos seus sonhos

Todas as pessoas da nossa equipe agregam algo único. Veja o que estamos buscando para esta posição:

Requisitos Essenciais

  • Ensino superior completo em Ciência da Computação, Tecnologia da Informação, Engenharia ou áreas correlatas, com experiência em Engenharia de Storage, Operações de Armazenamento, Site Reliability Engineering (SRE) ou Infraestrutura corporativa de grande porte.
  • Inglês avançado ou fluente, com capacidade de colaborar efetivamente com equipes globais.
  • Mínimo de 5 anos de experiência em Engenharia de Storage ou Operações de Storage em ambientes corporativos de grande porte.
  • Experiência prática avançada em pelo menos duas das seguintes áreas: armazenamento SAN/Block, NAS/File Storage, Object Storage ou plataformas corporativas equivalentes, incluindo Dell PowerMax, PowerStore, ECS, Pure Storage, NetApp ONTAP, HPE Nimble, HPE Primera, Pure FlashBlade, PowerScale/Isilon, plataformas compatíveis com S3 ou tecnologias similares.
  • Experiência comprovada no desenvolvimento de automações para plataformas de armazenamento utilizando Ansible, Python, APIs REST, Git, pipelines CI/CD e práticas de GitOps, incluindo provisionamento, replicação, gerenciamento de capacidade, monitoramento e ciclo de vida dos ambientes.
  • Conhecimento sólido em observabilidade, monitoramento, confiabilidade de serviços, análise de incidentes, troubleshooting e resolução de falhas complexas envolvendo degradação de desempenho, replicação, capacidade, controladoras, discos e arquiteturas de armazenamento multicamadas, utilizando telemetria, histórico de mudanças e dados estruturados de diagnóstico.
  • Forte capacidade analítica e de resolução de problemas para identificar oportunidades de automação, lacunas de observabilidade, melhorias de monitoramento e redução contínua do esforço operacional por meio da análise de incidentes.

Requisitos Desejáveis:

  • Experiência com ambientes multivendor de storage, plataformas de monitoramento como Zabbix ou vROps, ServiceNow CMDB, GitLab CI, serviços de armazenamento em nuvem, arquiteturas híbridas e práticas formais de Site Reliability Engineering (SRE).
  • Familiaridade com plataformas corporativas de automação assistida por IA, soluções agentic AI, integração de LLMs em processos operacionais, ambientes regulados por requisitos de conformidade (SOX, PCI-DSS e ISO 27001), geração de evidências para auditoria e práticas avançadas de engenharia de confiabilidade.

Responsibilities

Você irá:

  • Projetar, desenvolver e manter automações para todo o ciclo de vida dos serviços de armazenamento, incluindo provisionamento de volumes e LUNs, gerenciamento de snapshots e replicação, monitoramento e alertas de capacidade, gestão de firmware, descomissionamento e remediação automatizada utilizando Ansible, Python, APIs REST, informações do ServiceNow CMDB e pipelines GitLab CI/CD executados por meio de práticas de GitOps.
  • Definir e operar práticas de confiabilidade para serviços de storage por meio da criação e manutenção de SLIs, SLOs e error budgets, aprimorando a observabilidade com Zabbix, vROps, telemetria nativa dos fabricantes, Moogsoft, Cribl, SIEM e data lakehouse; conduzindo análises pós-incidente sem atribuição de culpa, produzindo análises de causa raiz em formatos estruturados e executivos e transformando falhas recorrentes em soluções automatizadas.
  • Colaborar com equipes de Engenharia de Storage, Automação de Plataforma e Observabilidade para estabelecer requisitos operacionais, baselines de monitoramento, perfis de I/O suportados, tolerâncias de replicação, limites de capacidade, critérios de prontidão operacional e integração das automações à plataforma corporativa de IA agentic; além de contribuir com iniciativas de policy-as-code voltadas à proteção da disponibilidade, durabilidade, capacidade e integridade da replicação.
  • Liderar iniciativas de melhoria contínua por meio da medição da cobertura de automação e das taxas de resolução autônoma, manutenção da base de conhecimento estruturada, documentação de incidentes resolvidos para aprimorar respostas automatizadas futuras, identificação e priorização de oportunidades de automação e avaliação de ferramentas para integração ao ecossistema corporativo.
  • Participar da escala de plantão da torre de Storage, atuando como ponto de escalonamento quando mecanismos automatizados não resolverem incidentes críticos dentro dos níveis de serviço estabelecidos, utilizando diagnósticos previamente consolidados, incluindo condições dos arrays, status de replicação, métricas de capacidade, telemetria, histórico de mudanças, incidentes similares e ações recomendadas para acelerar a tomada de decisão e resolução.
Who We Are

We believe that each of us has the power to make an impact. That’s why we put our team members at the center of everything we do. If you’re looking for an opportunity to grow your career with some of the best minds and most advanced tech in the industry, we’re looking for you.

Dell Technologies is a unique family of businesses that helps individuals and organizations transform how they work, live and play. Join us to build a future that works for everyone because Progress Takes All of Us.

Dell Technologies is committed to the principle of equal employment opportunity for all employees and to providing employees with a work environment free of discrimination and harassment. Read the full Equal Employment Opportunity Policy.

Visit our Culture Code page to learn more about how we work and lead.