
유저와 함께 만드는 LLM 2편 — 제타에 Online Learning 도입하기
비동기 GRPO 인프라와 TIS 보정으로 rollout·학습 간 확률 불일치를 안정화했습니다. 리워드 해킹을 완화해 DPO 대비 이용시간과 리텐션을 개선했습니다.
#LLM#GRPO
000

비동기 GRPO 인프라와 TIS 보정으로 rollout·학습 간 확률 불일치를 안정화했습니다. 리워드 해킹을 완화해 DPO 대비 이용시간과 리텐션을 개선했습니다.

vLLM의 PagedAttention과 Continuous Batching을 코드 흐름 중심으로 분석했습니다.\nKV 캐시 블록 관리, 스케줄링, CUDA 기반 Single Query Attention을 설명합니다.