EU remote
Senior Site Reliability Engineer (DevOps + Java)
About this role
Senior Site Reliability Engineer (DevOps + Java) Square One Resources Daily tasks: - Projektowanie, rozwój i utrzymanie skalowalnych oraz niezawodnych systemów rozproszonych. - Zapewnienie wysokiej dostępności i stabilności środowisk produkcyjnych. - Automatyzacja procesów infrastrukturalnych, wdrożeń oraz działań operacyjnych. - Rozwiązywanie problemów produkcyjnych i analiza przyczyn awarii. - Wspieranie procesów migracji oraz modernizacji systemów.
- Udział w dyżurach on-call i reagowaniu na incydenty. - Współpraca z zespołami developerskimi w celu poprawy jakości i operacyjności aplikacji. - Rozwijanie monitoringu, alertingu i narzędzi observability. - Automatyzacja powtarzalnych procesów oraz redukcja pracy manualnej. - Udział w działaniach związanych z SRE: SLO, SLI, SLA, disaster recovery oraz ciągłym doskonaleniem systemów. Musts: Java, Kubernetes, AWS, Docker, CI/CD, Terraform, Pulumi, MS SQL, PostgreSQL, Redis, DynamoDB, MongoDB, Prometheus, Grafana, Datadog Minimum 7 lat doświadczenia zawodowego.
Doświadczenie w roli Senior SRE / Senior DevOps Engineer / Platform Engineer. Bardzo dobra znajomość Kubernetes (Deployments, StatefulSets, Services, Ingress, Helm, troubleshooting, autoscaling). Bardzo dobra znajomość AWS: EC2, EKS, RDS, S3, IAM, VPC, Load Balancing, CloudWatch. Praktyczne doświadczenie z Dockerem i środowiskami kontenerowymi. Doświadczenie z CI/CD oraz Infrastructure as Code: Terraform, CloudFormation, Pulumi lub podobne.
Bardzo dobra znajomość języka Java oraz działania aplikacji JVM. Znajomość zagadnień związanych z: concurrency, wydajnością aplikacji, analizą problemów runtime. Doświadczenie z systemami kolejkowymi: RabbitMQ, Kafka, SQS, Pulsar lub podobne. Znajomość baz danych: MySQL/PostgreSQL, Redis, DynamoDB, MongoDB. Doświadczenie w pracy z systemami rozproszonymi i mikroserwisami. Znajomość narzędzi monitoringu: Prometheus, Grafana, Datadog, ELK/OpenSearch, OpenTelemetry.
Bardzo dobra znajomość Linux oraz podstaw sieci: TCP/IP, DNS, HTTP/HTTPS, TLS. Doświadczenie z praktykami SRE: incident management, load testing, resilience testing. Język angielski na poziomie umożliwiającą swobodną, codzienną komunikację. Nice to have: Znajomość Ruby oraz ekosystemu Ruby on Rails. Doświadczenie z dużymi platformami SaaS. Doświadczenie w optymalizacji kosztów chmurowych. Znajomość praktyk Chaos Engineering.
Doświadczenie w mentoringu innych inżynierów. Dla naszego klienta – firmy rozwijającej globalną platformę mobilności – poszukujemy Senior Site Reliability Engineera (DevOps + Java). Projekt dotyczy jednej z największych platform związanych z zamawianiem przejazdów. Rozwiązanie umożliwia użytkownikom zamawianie taksówek, śledzenie przejazdów, realizację płatności oraz zarządzanie historią podróży.
Source listing: nofluffjobs_main