Nvidia 연구진이 Claude Opus 5를 다른 모델로 교체하지 않고 ARC-AGI-3 점수를 30%에서 100%로 끌어올렸습니다. 바꾼 것은 모델 주변의 harness였습니다. ARC-AGI-3는 설명 없이 2D 게임을 관찰하고 규칙을 찾아 이겨야 하는 인터랙티브 추론 벤치마크입니다. 이 환경에서 모델은 답변 한 번을 생성하는 대신 여러 행동을 이어 가야 합니다.
Nvidia가 만든 AVO(Agentic Variation Operators)는 메모리 관리와 실행 흐름을 조정하고, supervisor agent를 별도로 둡니다. supervisor는 주 에이전트가 막히거나 잘못된 경로를 계속 탐색할 때 개입하는 상위 계층입니다. TechCrunch가 전한 비교에서 harness가 없는 Opus 5는 30%로 테스트 모델 가운데 가장 높았지만, AVO를 적용한 구성은 100%에 도달했습니다. 모델의 ‘두뇌’를 바꾸지 않고 기억과 피드백의 처리 방식을 바꾼 결과입니다.
이 사례는 장시간 이어지는 작업에서 모델 점수만으로 시스템을 평가하기 어렵다는 점을 보여줍니다. Microsoft는 문서 편집을 시킨 19개 LLM이 frontier 모델을 포함해 오류를 남겼다고 보고했습니다. Databricks는 같은 모델도 harness에 따라 비용이 두 배까지 달라질 수 있다고 설명했습니다. 에이전트가 어떤 모델을 쓰는지만큼, 맥락을 어떻게 저장하고 실패를 언제 감지하며 다시 시도할지 정하는 실행 구조가 중요하다는 뜻입니다.
다만 Nvidia의 결과에는 범위가 있습니다. ARC-AGI-3는 2D 게임 벤치마크이고, AVO는 상용 제품이 아니라 연구용 harness입니다. 따라서 모든 코딩·문서 업무에서 100%를 보장한다는 의미는 아닙니다. 대신 에이전트를 도입할 때 확인할 항목은 늘어납니다. 메모리 정책, supervisor의 개입 조건, 도구 권한, 실패 경로 기록, 실행 비용을 모델명과 함께 봐야 합니다. 오픈 harness가 주목받는 이유도 여기에 있습니다. 모델과 인프라 사이의 조절 장치를 사용자가 직접 설계하고 통제할 수 있기 때문입니다.