Tasks
- Cloud-native MLOps Platform
✓ AI Platform 을 위한 Cloud-native MLOps Architecture를 설계, 구축, 운영합니다.
✓ 개발, 테스트, 운영 환경을 분리하고 표준 Configuration과 Infrastructure를 구축합니다.
✓ Model Registry, Artifact, Feature, Data 연계 및 Lifecycle 관리체계를 구현합니다.
- Model Training, Deployment Automation
✓ 모델 Training, Validation, Packaging, Deployment, Monitoring 및 Rollback Pipeline을 구축/운영합니다.
✓ AI 개발부서 인원과 협업해 모델을 운영으로 전환하고 운영요건을 정의합니다.
✓ ML Workflow에 대한 CI/CD, Version 관리, Approval Gate 및 Release 이력을 구축합니다.
- GPU, Distributed Computing
✓ GPU Cluster, Scheduler, Queue, Partition, Quota, Storage 및 분산컴퓨팅 환경을 설계, 운영합니다.
✓ GPU, Storage 사용률, Job 상태, Idle 자원, Capacity와 비용을 분석하고 개선합니다.
✓ 각 영역(GPU Cluster, Managed Service, Core IT) 별 전문 Vendor와 기술 RACI 및 Escalation 체계를 운영합니다.
- SRE, Reliability, Observability
✓ Alert, Log, Metric, Trace 및 Dashboard 기반 Observability 체계를 구축합니다.
✓ Incident, 장애, 변경관리, 가용성 및 복구 Runbook을 운영합니다.
✓ Core IT부서와 협업하여 IAM, Network, 보안, ITSM, 변경통제 및 Audit 요구사항을 Platform에 적용합니다.
✓ 상용 Enterprise LLM/서비스 유지보수 및 관리를 담당합니다.
Requirements
▣ 자격요건
- 학력 : 학사 이상
- 전공 : 전산/컴퓨터공학, 소프트웨어, 데이터, AI 관련 전공 우대
- 경력 : Cloud Platform, DevOps, MLOps 또는 SRE 설계·구축·운영 경력 8~13년
- Skill & Knowledge :
Kubernetes, Docker, Linux, Cloud(AWS 등), GPU 및 분산컴퓨팅 환경 이해
MLflow, Kubeflow, Argo, Jenkins, GitHub Actions 등 MLOps, CI/CD 도구 중 하나 이상의 실무 경험
모델 학습, Deployment Pipeline, Registry, Version, Rollback 설계 경험
Prometheus, Grafana, OpenTelemetry 또는 유사 Monitoring, Observability 경험
GPU Driver, CUDA, NCCL, Scheduler(Slurm 등), Storage 및 Network 성능에 대한 이해
SRE, Incident, RCA, Capacity, Availability, Change Management 실무 역량
- Language : 해외법인 또는 글로벌 벤더와 업무 Communication 가능 수준
▣ 우대요건
- Enterprise AI Platform 또는 대규모 GPU Cluster 구축·운영 경험
- 분산학습 또는 GPU Training·Inference 성능 최적화 경험
- MLOps Platform의 Production 전환과 24×365 운영체계 구축 경험
- 제약·바이오 R&D 모델 또는 규제산업 데이터 환경 경험
- AWS, Kubernetes, DevOps, SRE, NVIDIA 관련 자격 또는 이에 준하는 전문성
Information
Apply
The Others
면접은 서류전형 합격자에 개별통지 합니다.
국가보훈대상자와 신체장애자는 관련서류 제출시 관계법에 따라 우대함.
모든 서류는 반드시 MS Word로 작성하기 바랍니다.
제출하신 서류는 일체 반환하지 않습니다.
입사지원서 내용에 허위사실이 판명될 경우 입사가 취소될 수 있습니다.
기타 문의사항은 E-mail로 문의바랍니다.
Company
헤드헌팅 전문 서치펌 메타써치 입니다.
- Cloud-native MLOps 아키텍처 설계·구축·운영
- 개발·테스트·운영 환경 분리 및 표준 구성·인프라 구축
- Model Registry·Artifact·Feature·Data 연계 및 라이프사이클 관리체계 구현
- 모델 Training·Validation·Packaging·Deployment·Monitoring·Rollback 파이프라인 구축·운영
- AI 개발부서와의 협업을 통한 운영 전환 및 운영요건 정의
- ML Workflow CI/CD·버전 관리·Approval Gate·Release 이력 구축
- GPU Cluster·Scheduler·Queue·Partition·Quota·Storage 및 분산컴퓨팅 환경 설계·운영
- GPU·Storage 사용률·Job 상태·Idle 자원·Capacity·비용 분석 및 개선
- Alert·Log·Metric·Trace·Dashboard 기반 Observability 체계 구축
- Incident·장애·변경관리·가용성·복구 Runbook 운영
- IAM·Network·보안·ITSM·변경통제·Audit 요구사항의 플랫폼 적용
- 상용 Enterprise LLM/서비스 유지보수 및 관리
- ✓학사 이상
- ✓Cloud Platform·DevOps·MLOps·SRE 설계·구축·운영 8~13년 경력
- ✓Kubernetes·Docker·Linux·Cloud(AWS 등)·GPU 및 분산컴퓨팅 환경 이해
- ✓MLflow·Kubeflow·Argo·Jenkins·GitHub Actions 등 MLOps·CI/CD 도구 실무 경험
- ✓모델 학습·Deployment Pipeline·Registry·Version·Rollback 설계 경험
- ✓Prometheus·Grafana·OpenTelemetry 또는 유사 Monitoring·Observability 경험
- ✓GPU Driver·CUDA·NCCL·Scheduler(Slurm 등)·Storage·Network 성능 이해
- ✓SRE·Incident·RCA·Capacity·Availability·Change Management 실무 역량
- ✓해외법인 또는 글로벌 벤더와의 업무 커뮤니케이션 가능 수준
- ★전산·컴퓨터공학·소프트웨어·데이터·AI 관련 전공
- ★Enterprise AI Platform 또는 대규모 GPU Cluster 구축·운영 경험
- ★분산학습 또는 GPU Training·Inference 성능 최적화 경험
- ★MLOps Platform의 Production 전환 및 24×365 운영체계 구축 경험
- ★제약·바이오 R&D 모델 또는 규제산업 데이터 환경 경험
- ★AWS·Kubernetes·DevOps·SRE·NVIDIA 관련 자격 또는 이에 준하는 전문성
본 정보는 개인 구직자들의 취업지원을 위해 외국기업취업전문사이트 피플앤잡에서 수집한 정보이며, 채용회사의 사정에 따라 변경될 수 있습니다.
본 정보는 피플앤잡의 동의 및 허락 없이는 재배포 할 수 없습니다.



