Site Relaibility Engineer Job in Cognizant Technology Solutions India Pvt Ltd at Ahmedabad, Anand, Ankleshwar
Site Relaibility Engineer
organization.
Job Description
Job Summary
We are looking for a skilled Site Reliability Engineer (SRE) with 4+ years of experience to build, maintain, and improve the reliability, scalability, and performance of production systems. The ideal candidate should have strong expertise in cloud platforms, automation, monitoring, incident management, and CI/CD practices.
Key Responsibilities
Ensure high availability, reliability, and scalability of production environments.
Design, implement, and maintain monitoring, alerting, and logging solutions.
Automate operational tasks using scripting and Infrastructure as Code (IaC).
Manage and optimize Kubernetes clusters and containerized applications.
Troubleshoot production issues and perform root cause analysis (RCA).
Collaborate with Development, DevOps, Security, and Infrastructure teams.
Build and maintain CI/CD pipelines.
Implement disaster recovery, backup, and failover strategies.
Improve system performance, capacity planning, and cost optimization.
Maintain operational documentation, runbooks, and SOPs.
Participate in on-call support and incident response.
Required Skills
Cloud Platforms
AWS, Azure, or Google Cloud Platform (GCP)
Containerization & Orchestration
Docker
Kubernetes
Helm
Infrastructure as Code
Terraform
Ansible
CloudFormation (preferred)
CI/CD
Jenkins
GitHub Actions
GitLab CI
Azure DevOps
Monitoring & Logging
Prometheus
Grafana
ELK Stack/OpenSearch
Datadog
New Relic
Splunk
Scripting
Python
Bash
Shell scripting
Go (preferred)
Version Control
Git
GitHub
GitLab
Bitbucket
Operating Systems
Linux (mandatory)
Windows Server (good to have)
Databases
MySQL
PostgreSQL
MongoDB
Redis
Networking
DNS
TCP/IP
HTTP/HTTPS
Load Balancers
VPN
SSL/TLS
Required Qualifications
Bachelor's degree in Computer Science, Information Technology, or a related field.
4+ years of experience in Site Reliability Engineering, DevOps, or Cloud Infrastructure.
Experience supporting mission-critical production systems.
Strong troubleshooting and analytical skills.
Excellent communication and collaboration abilities.
Preferred Certifications
AWS Certified Solutions Architect / SysOps Administrator
Certified Kubernetes Administrator (CKA)
HashiCorp Terraform Associate
Red Hat Certified Engineer (RHCE)
Azure Administrator Associate
Google Professional Cloud DevOps Engineer