Site Reliability Engineer (SRE)
@ 2T ConsultingSite Reliability Engineer (SRE)
About the job
Our company focuses on cloud infrastructure and system reliability. This Site Reliability Engineer role supports AWS-hosted production systems, ensuring stability, incident management, monitoring, and continuous system improvements.
Requirements
- Experience supporting AWS environments
- Incident management skills
- Monitoring and observability expertise
- Troubleshooting and root cause analysis
Qualifications
- Hands-on AWS support experience
- Knowledge of CloudWatch and Dynatrace
- Unix/Linux familiarity
- Excellent communication skills
Full job description
We are seeking an experienced Site Reliability Engineer (SRE) to support and maintain production systems hosted on AWS. The role focuses on production support, incident management, monitoring, observability, troubleshooting, and improving system reliability and availability.
Core Responsibilities
- Provide L1/L2 production support for AWS-hosted applications and infrastructure.
- Monitor and troubleshoot AWS services including EC2, VPC, ALB/NLB, RDS, Lambda, and EKS.
- Triage production incidents, identify root causes, restore services within defined SLAs, and escalate application defects when required.
- Participate in 24/7 on-call rotations, major incident management, and post-incident reviews.
- Perform application and infrastructure health checks and proactively address performance, latency, resource utilization, and availability issues.
- Build and maintain monitoring and observability dashboards using CloudWatch, Dynatrace, Quantum Metric, and ThousandEyes.
- Troubleshoot issues across infrastructure, networking, application, database, and Linux/Unix environments.
- Support CI/CD pipelines and AWS deployment processes.
- Apply reliability patterns and continuously improve system stability and operational efficiency.
Required Skills
- Strong experience supporting AWS production environments.
- Hands-on experience with incident management and production support.
- Strong knowledge of CloudWatch, Dynatrace, Git, observability, and reliability patterns.
- Experience with monitoring dashboards and operational health checks.
- Strong troubleshooting and root-cause analysis skills.
- Working knowledge of CI/CD, databases, and Unix/Linux.
- Excellent communication and incident coordination skills.
Similar jobs in Wyloway, Georgia
- 4
Site Reliability Engineer
474 MS Services Group, Inc. · Alpharetta, Georgia, United States Of America
Posted 3 weeks ago - I
Senior Site Reliability Engineer
IRB USA Inspire Resources · Atlanta Support Center
Posted 4 weeks ago - 4
Lead Site Reliability Engineer
474 MS Services Group, Inc. · Alpharetta, Georgia, United States Of America
Posted 3 weeks ago - S
Sr. Site Reliability Engineer (SRE)
Scientific Games, LLC · Alpharetta, GA
Posted 2 weeks ago - 1
Advanced Cloud Engineer
1110 Invesco Group Services, INC. · Atlanta, Georgia
Posted 1 week ago - J
Reliability Engineer, Poultry
JBT MAREL CORPORATION · US - Alpharetta
Posted 2 weeks ago