Role: Site Reliability Engineer (SRE)
Platform: GPS & YAVA
Role Type: Hands-on Reliability Engineering
We are looking for a hands-on Site Reliability Engineer responsible for preventing production incidents, improving system reliability, monitoring critical applications, and automating health checks and validation.
The engineer will work across cloud, networking, APIs, databases, MQ, telephony, Salesforce CRM, and distributed applications to improve availability, performance, incident detection, and recovery.
2. Must-Have Skills
- SRE / Production Engineering / DevOps / Platform Engineering
- Monitoring & Observability: Metrics, Logs, Traces, Dashboards, Alerting, Synthetic Monitoring
- Python / Go / PowerShell / Java – scripting/automation
- Networking: DNS, Load Balancer, TLS/Certificates, WAF, API Gateway
- Cloud: Azure or Google Cloud
- Incident Management, RCA & Postmortems
- Change Validation & Production Readiness
- Automation & Reliability Engineering
- Troubleshooting distributed applications and infrastructure
- Performance, capacity, failover, and resilience testing
Good to Have: Salesforce CRM, CTI/Telephony, Five9, IBM MQ, DB2/Mainframe, Imperva, F5, Azure/Google Cloud Platform, Chaos Engineering.