[NAVER Cloud] 특화 AI 모델 개발 엔지니어 (경력)
보안 도메인 특화 AI 모델을 위한 학습데이터 파이프라인·데이터셋·학습·검증 환경 및 평가 체계를 설계·운영합니다. AI/ML 모델 개발 또는 대규모 데이터 엔지니어링 5년 이상과 모델 학습, 대용량 파이프라인, Python·학습 프레임워크 역량이 필요합니다.
내 적합도 확인 중...
게시일 2026년 9월 14일
공고 내용
부서소개 저희 부서 는 네이버 보안 강화를 위해 Security 선행기술을 연구하고, 이를 기반으로 신규 보안 전략을 기획하며, 실제 구현과 적용까지 총괄합니다. AI for Security와 Security for AI 양 축에서 선행 기술을 연구하여 이를 네이버클라우드에 내재화하고 더 나아가 학계·산업계·국가 사이버 방어체계에 환원하는 것을 지향합니다. 그 과제의 하나로 보안 도메인에 특화된 AI 모델을 자체 역량으로 확보하는 업무를 수행하고 있습니다. 무엇을 학습시킬 것인지(학습데이터), 무엇으로 검증할 것인지(학습·검증 환경), 성능 달성 여부를 어떻게 판정할 것인지(평가 체계)를 직접 설계하고 구축하며, 모델 학습의 실행은 AI 모델 개발 조직과 협업하여 수행하고 있습니다. 또한 향후 국내외에 모델 및 보안 서비스 확산을 위한 비지니스도 설계합니다. 현재 과학기술정보통신부·정보통신산업진흥원의「특화 AI 파운데이션 모델 개발(사이버 보안 분야)」사업의 주관 기관으로 프로젝트를 총괄하고 있으며, 산출물을 오픈소스로 공개하여 국내 보안산업 전반이 활용할 수 있도록 하는 것을 목표로 합니다. 본 과제를 통해 구축하는 데이터 파이프라인과 검증 환경은 후속 국책 과제 및 네이버클라우드 의 보안 서비스에 지속 적용됩니다. (관련 기사 바로가기 Click) 담당업무 1. 보안 도메인 학습데이터 파이프라인 설계·구축 • 이기종 보안 데이터(악성코드·트래픽·관제 로그·취약점 정보)의 수급·정제·중복제거 및 개인정보·보안정보 자동 처리 2. 학습용 Dataset 구축 및 Enrichment 설계 • 위협정보 구조화, 라벨 체계 수립, 학습 단계별(CPT/SFT/RLVR) 데이터 요구사항 및 mixture 설계 3. 학습·검증 환경 구축 • 격리 실행 환경(Sandbox)·검증기(Verifier) 운영 및 대규모 Rollout 오케스트레이션 4. 평가 체계 설계 및 운영 • 벤치마크 기반 성능 평가, 데이터 오염(Contamination) 검사, 실패 원인 분류 5. AI 개발 조직과의 협업 및 데이터 거버넌스 • 데이터 인터페이스 규격 합의, 데이터 계보(Lineage) 관리, 통제 환경 운영 자격요건 • AI/ML 모델 개발 또는 대규모 데이터 엔지니어링 분야 경력을 5년 이상 보유하신 분 • 파운데이션 모델 사전학습(From Scratch), 지속 사전학습(CPT), 지도학습(SFT)·검증 가능 보상 기반 강화학습(RLVR) 중 하나 이상의 모델 개발 경험을 보유하신 분 • 원천 데이터를 수집·정제·중복제거·라벨링하여 학습에 투입하고, 그 결과를 지표로 검증한 경험을 보유하신 분 • 대용량 데이터 처리 파이프라인(Ray, Spark 등) 설계·운영 경험을 보유하신 분 • Python 프로덕션 코드 작성 역량 및 PyTorch 등 학습 프레임워크에 대한 실무 수준의 이해를 갖추신 분 • 유관 조직과 데이터 규격·평가 기준을 협의하여 문서로 확정한 경험을 보유하신 분 우대사항 • 도메인 특화 모델(보안, 코드, 금융, 의료, 법률 등) 개발 참여 또는 개발한 모델의 상용 서비스 운영 경험을 보유하신 분 • Sandbox·Verifier 기반 학습·검증 파이프라인 또는 자동 채점 하네스 설계·구현 경험을 보유하신 분 • 학습 데이터 혼합 비율(mixture) 설계·ablation 실험, 토크나이저 학습·도메인 어휘 확장 경험을 보유하신 분 • LLM 평가 체계(벤치마크 설계, 데이터 오염 검사, 재현성 확보) 구축 경험을 보유하신 분 • Security 도메인(보안관제, 취약점·악성코드 분석, 침해사고 대응, 모의해킹 등)에 대한 이해 또는 AI Transformation(AX) 과제 수행 경험을 보유하신 분 • 오픈소스 모델·데이터셋 공개(모델 카드, 데이터셋 명세, SBOM, 라이선스 정합성) 또는 관련 분야 논문·오픈소스 기여 이력을 보유하신 분 조직 구성원 Talk “AI 모델 개발 경험을 바탕으로 보안 도메인의 학습데이터와 검증 환경을 함께 만들어갈 분들을 기대합니다.” 본 포지션은 AI 모델 개발 경험을 보유한 분이 보안 도메인의 학습데이터와 학습·검증 환경을 설계하고 구축하는 역할입니다. 모델을 직접 학습시키고 결과를 확인해본 경험이 있어야 데이터 설계의 의도와 품질을 함께 판단할 수 있으며, 학습 결과와 데이터를 서로 연결해 원인을 추적할 수 있는 역량이 중요합니다. 보안 도메인 경험이 반드시 필요한 것은 아닙니다. 입사 후 조직 내에 축적된 보안 지식과 컨소시엄 참여기관과의 협업을 통해 도메인 이해를 넓혀갈 수 있으며, AI 모델 개발 경험을 기반으로 보안 분야의 학습데이터와 평가 체계를 함께 고도화해 나가실 수 있습니다.




