Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) - Server
Back to Jobs
Dell TechnologiesGet Smart Job AI Coach in the appFree on iOS and Android

Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) - Server
Location
ELDORADO DO SUL, RS, Brazil
Experience
Senior
Posted
Jul 30, 2026
Apply by
August 5, 2026
Applicants
0
Early applicantEasy applyFull-timeWork from Office
Job Description
Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) – Infraestrutura Compute
Junte-se a nós como Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) em nossa equipe de Engenharia de Infraestrutura em Eldorado do Sul/RS para fazer o melhor trabalho da sua carreira e gerar um impacto social profundo.
O que você conquistará
Como Engenheiro(a) Sênior de Confiabilidade de Sites (SRE), você será responsável por projetar, desenvolver e administrar automações para todo o ciclo de vida da infraestrutura compute, garantindo escalabilidade, disponibilidade e confiabilidade dos serviços. Você trabalhará com equipes de Engenharia Compute, Automação de Plataforma, Observabilidade e Infraestrutura em uma plataforma corporativa baseada em automação, suportando cargas de trabalho críticas e impulsionando a excelência operacional por meio de práticas modernas de SRE e automação em larga escala.
Você irá:
- Projetar, desenvolver e manter automações para todo o ciclo de vida da infraestrutura compute, incluindo descoberta de servidores, provisionamento bare-metal, implantação de sistemas operacionais, gerenciamento de firmware e patches, configuração de hipervisores, descomissionamento e processos automatizados de diagnóstico e remediação utilizando Ansible, Python e pipelines CI/CD
- Definir e operar práticas de confiabilidade para serviços compute por meio da criação e manutenção de SLIs, SLOs e error budgets, além de aprimorar a observabilidade, reduzir ruídos de monitoramento, conduzir análises pós-incidente e transformar falhas recorrentes em soluções automatizadas
- Colaborar com equipes de Engenharia Compute, Automação de Plataforma e Observabilidade para definir requisitos operacionais, integrar automações à plataforma corporativa de IA e automação, garantir critérios de prontidão operacional e contribuir para políticas como código voltadas à operação segura e escalável de plataformas compute
- Liderar iniciativas de melhoria contínua por meio da medição da cobertura de automação, aumento das taxas de resolução autônoma, manutenção de bases de conhecimento estruturadas, identificação de oportunidades para eliminação de atividades manuais e avaliação de novas ferramentas para integração ao ecossistema corporativo
- Participar da escala de plantão da torre de Compute, atuando como ponto de escalonamento quando mecanismos automatizados não resolverem incidentes críticos dentro dos níveis de serviço definidos e utilizando informações de diagnóstico previamente consolidadas para acelerar a resolução
Dê o primeiro passo para a carreira dos seus sonhos
Todas as pessoas da nossa equipe agregam algo único. Veja o que estamos buscando para esta posição:
Requisitos Essenciais
- Ensino superior completo em Ciência da Computação, Tecnologia da Informação, Engenharia ou áreas correlatas, com experiência em SRE, Engenharia de Infraestrutura, Engenharia de Servidores ou Operações de Plataformas em larga escala
- Inglês avançado ou fluente, com capacidade de colaborar efetivamente com equipes globais
- Experiência prática avançada em pelo menos duas das seguintes áreas: VMware vSphere/vCenter, plataformas de servidores bare-metal (Dell PowerEdge, HPE, Cisco UCS ou equivalentes), sistemas operacionais Linux (Oracle Linux, RHEL ou equivalentes) ou ambientes Windows Server
- Experiência comprovada no desenvolvimento de automações de infraestrutura utilizando Ansible, Python, Git, pipelines CI/CD e práticas de GitOps, incluindo gerenciamento automatizado do ciclo de vida de plataformas compute
- Conhecimento sólido em observabilidade, monitoramento de infraestrutura, confiabilidade de sistemas, troubleshooting, gestão de incidentes, análise de causa raiz e resolução de falhas complexas envolvendo hardware, hipervisores, sistemas operacionais e ambientes distribuídos
Requisitos Desejáveis
- Experiência com vROps, Zabbix, Dynatrace, ServiceNow CMDB, NetBox, GitLab CI, ferramentas de gerenciamento de imagens (Kickstart, Preseed, Packer), automação de firmware, práticas formais de Site Reliability Engineering (SRE) e ambientes regulados por requisitos de conformidade, como SOX, PCI-DSS ou ISO 27001
- Familiaridade com plataformas corporativas de automação assistida por IA, soluções agentic AI, integração de LLMs em processos operacionais e ecossistemas avançados de observabilidade e automação empresarial
### About the Company
Who We Are
We believe that each of us has the power to make an impact. That’s why we put our team members at the center of everything we do. If you’re looking for an opportunity to grow your career with some of the best minds and most advanced tech in the industry, we’re looking for you.
Dell Technologies is a unique family of businesses that helps individuals and organizations transform how they work, live and play. Join us to build a future that works for everyone because Progress Takes All of Us.
Dell Technologies is committed to the principle of equal employment opportunity for all employees and to providing employees with a work environment free of discrimination and harassment. [Read the full Equal Employment Opportunity Policy](https://iawmqy.fa.ocs.oraclecloud.com/hcmUI/CandidateExperience/en/sites/careers/pages/equal-employment-opportunity-policy-statement).
Visit our [Culture Code](https://jobs.dell.com/en/how-we-work-and-lead) page to learn more about how we work and lead.
Key Responsibilities
- Design, develop, and maintain automations for the compute infrastructure lifecycle using Ansible, Python, and CI/CD pipelines.
- Define and operate reliability practices including SLIs, SLOs, and error budgets.
- Collaborate with Compute, Platform Automation, and Observability teams to integrate automations into the corporate AI platform.
- Lead continuous improvement initiatives by measuring automation coverage and reducing manual activities.
- Participate in the Compute tower on-call rotation to resolve critical incidents.
Requirements
- Bachelor's degree in Computer Science
- Information Technology
- Engineering
- or related fields
Skills Required
AnsiblePythonGitCI/CD PipelinesGitOpsVMware vSpherevCenterLinuxOracle LinuxRHELWindows ServerDell PowerEdgeHPECisco UCSObservabilityInfrastructure MonitoringIncident ManagementRoot Cause AnalysisAdvanced EnglishCollaborationProblem SolvingvROpsZabbixDynatraceServiceNow CMDBNetBoxGitLab CIKickstartPreseedPackerFirmware AutomationSOXPCI-DSSISO 27001AI-driven Automation PlatformsAgentic AILLM Integration
App exclusive · Free
Smart Job AI Coach
Your personal interview coach on every job — readiness tips, profile improvements, and role-specific prep. Available only in the Pulse Job app.
Interview readiness
See how prepared you are and what to improve for each role.
Personalized tips
Actionable suggestions based on your profile and the job.
After you apply
Keep coaching momentum from job detail through application success.