엔비디아 코딩 에이전트 토큰 사용량 절반 절감
엔비디아 연구진이 인공지능 에이전트의 상호작용 로직을 개선하는 SoL-Pi 시스템을 개발해 토큰 사용량을 49퍼센트 줄였습니다. 이번 시스템은 코딩 에이전트의 운영 비용을 절감하는 동시에 성능을 유지하거나 높이는 결과를 보였습니다. 다만 범용성 한계와 정보 유실 위험 등의 과제도 함께 확인됐습니다.
주장엔비디아 연구진은 인공지능 에이전트의 제어 계층인 하니스를 자동으로 최적화하는 에스오엘파이(SoL-Pi) 시스템을 통해 토큰 사용량을 절반 가까이 줄이는 데 성공했습니다. 기존의 효율화 방식이 모델 압축이나 더 저렴한 모델 사용에 집중했다면, 이 연구는 에이전트와 환경 사이의 상호작용 로직을 개선하는 데 초점을 맞췄습니다.
팩트에스오엘파이 시스템은 535개의 실행 환경에서 152개의 제어 로직 방향을 탐색하며 총 6만 건 이상의 에이전트와 환경 상호작용을 분석했습니다. 이 과정에서 액션 융합, 온라인 컨텍스트 압축, 관찰 패키징, 증거 보존 감축이라는 4가지 핵심 메커니즘을 도출했습니다.
팩트연구 결과에 따르면 가장 효율적인 설정에서 토큰 사용량은 49퍼센트 감소했으며, 성능은 기존 파이 하니스 대비 93.7퍼센트 수준을 유지했습니다. 성능을 우선시하는 설정에서는 토큰을 절약하면서도 기존 파이보다 5.3퍼센트 더 높은 성능을 기록했습니다.
팩트비용 측면에서 에스오엘파이는 기존 코덱스(Codex) 및 클로드 코드(Claude Code) 하니스 대비 시간당 8.75달러에서 13.50달러의 비용을 절감할 수 있습니다. 파이 하니스와 비교해도 시간당 4.36달러에서 5.71달러의 추가 비용 절감 효과가 확인되었습니다.
교차검증에스오엘파이는 에지벤치(EdgeBench)에서는 우수한 성능을 보였으나, 터미널벤치4(Terminal-Bench 4)와 같은 다른 벤치마크에서는 코덱스나 파이보다 해결 문제 수가 적게 나타나는 등 범용성 측면에서 한계를 보였습니다. 또한, 하니스를 특정 모델인 지피티5.6솔(GPT-5.6 Sol)로만 최적화할 경우 다른 모델 적용 시 효율성이 다소 떨어지는 경향이 있습니다.
주장연구진은 이번 성과가 재귀적 자기 개선의 가능성을 보여준다고 평가하며, 앞으로 다양한 작업에 걸쳐 하니스를 사전 학습시키는 방식을 제안했습니다. 이는 모델 자체의 성능 향상뿐만 아니라 에이전트 운영 체계의 효율화가 인공지능 상용화의 핵심임을 시사합니다.
팩트인공지능 에이전트의 토큰 사용량은 2026년 2월 이후 14배 증가했으며, 이 중 약 70퍼센트가 캐시된 프롬프트에서 발생하고 있습니다. 이러한 상황에서 에이전트의 운영 비용을 제어하는 하니스 최적화는 기업들의 에이피아이(API) 비용 부담을 줄이는 중요한 전략이 되고 있습니다.
교차검증컨텍스트 압축 기술은 토큰 비용을 줄여주지만, 사용자 지침의 일부가 유실될 위험이 존재합니다. 한 연구에 따르면 압축 과정에서 사용자 지침의 17퍼센트만이 보존되는 것으로 나타나, 정보 손실과 효율성 사이의 균형이 중요한 과제로 남아 있습니다.
교차검증다수의 하위 에이전트를 동시에 운영하는 방식은 상호 검증 과정에서 토큰을 과도하게 소모할 수 있습니다. 전문가들은 두 개 이상의 하위 에이전트가 협업할 경우 품질 향상 없이 비용만 상승하는 경우가 많다고 경고합니다.
출처엔비디아 연구진의 논문 및 The Decoder(https://the-decoder.com/nvidias-sol-pi-system-cuts-coding-agent-token-usage-nearly-in-half-by-optimizing-the-harness/)의 보도를 교차 검증했습니다.
주제
관련 콘텐츠
본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

