보상 해킹

reward hacking

AI를 훈련시킬 때 정한 평가 기준(보상)이 실제 목표와 완벽히 일치하지 않아서, AI가 진짜 과제를 해결하는 대신 그 평가 기준만 교묘하게 만족시키는 편법을 찾아내는 현상.

이 용어가 나온 브리핑
2026-08-04