← All jobs

EU remote

ML/AI Infrastructure Engineer

Square One ResourcesPoznan, Polish; Remote

About this role

ML/AI Infrastructure Engineer Square One Resources Daily tasks: - Projektowanie, wdrażanie i rozwój środowisk HPC. - Budowa oraz administracja klastrami GPU dla obciążeń AI/ML. - Zarządzanie i optymalizacja środowisk opartych o Linux i Kubernetes. - Konfiguracja oraz administracja schedulerem Slurm. - Wdrażanie i utrzymanie wydajnych systemów storage (Ceph i/lub Lustre). - Optymalizacja wydajności infrastruktury oraz profilowanie aplikacji HPC.

- Monitoring, diagnozowanie i rozwiązywanie problemów w środowiskach produkcyjnych. - Automatyzacja wdrożeń z wykorzystaniem Ansible i Terraform. - Współpraca z zespołami odpowiedzialnymi za rozwiązania AI oraz infrastrukturę centrów danych. Musts: GPU, AI, Ansible, Terraform, HPC Nasze wymagania Praktyczne doświadczenie w projektowaniu i administracji środowisk HPC. Bardzo dobra znajomość systemu Linux. Bardzo dobra znajomość Kubernetes.

Doświadczenie z systemem kolejkowania Slurm. Znajomość technologii InfiniBand. Doświadczenie z systemami plików Ceph i/lub Lustre. Umiejętność optymalizacji wydajności infrastruktury oraz aplikacji HPC. Umiejętność diagnozowania problemów w środowiskach o wysokiej dostępności. Mile widziane Doświadczenie z platformami GPU dla AI. Znajomość NVIDIA AI Enterprise. Doświadczenie z GPUaaS lub Run. Znajomość Ansible i Terraform.

Doświadczenie w automatyzacji oraz Infrastructure as Code. Dołącz do projektu, którego celem jest budowa nowoczesnej infrastruktury AI/ML opartej na GPU. Będziesz mieć realny wpływ na projektowanie, wdrażanie i rozwój środowisk High Performance Computing (HPC), wykorzystywanych do trenowania modeli sztucznej inteligencji oraz realizacji zaawansowanych obliczeń.

Source listing: nofluffjobs_main