MARKETS
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
Wittgenhaus

2026년 9월 8일 화요일

AI 시대, 당신을 더욱 스마트하게

AI검증

데이터브릭스, 코딩 에이전트 성능 및 비용 효율성 벤치마크 결과

데이터브릭스가 자사 코드베이스를 활용해 코딩 에이전트의 성능과 비용 효율성을 평가했습니다. 작업 성격에 따라 모델과 하네스를 조합하는 전략이 생산성 향상에 효과적임을 확인했습니다.

2026년 7월 8일

주장데이터브릭스는 엔지니어링 생산성을 극대화하기 위해 실제 자사 코드베이스를 기반으로 코딩 에이전트 벤치마크를 수행했습니다. 이번 평가는 실무 환경에서 최적의 성능과 비용 효율을 달성하는 모델 조합을 식별하는 데 목적을 둡니다.

팩트이번 벤치마크는 파이썬, 고, 타입스크립트, 스칼라 등 다수의 언어가 포함된 수백만 줄 규모의 코드베이스를 대상으로 진행했습니다. 데이터브릭스는 실제 엔지니어가 수행한 작업과 검증된 해결책을 바탕으로 평가 데이터를 구축했습니다.

주장분석 결과, 코딩 작업의 파레토 최적선에는 오픈에이아이, 앤스로픽, 오픈소스 모델이 모두 포함됩니다. 특정 단일 모델이 모든 작업을 독점하기보다 작업 성격에 따라 다양한 도구를 혼합해 사용하는 방식이 가장 효과적입니다.

팩트오픈소스 모델인 지엘엠(GLM) 5.2는 가장 높은 난이도의 작업까지 처리하는 성능을 보였습니다. 해당 모델은 오퍼스(Opus) 4.8과 품질 면에서 대등하면서도 작업당 비용은 1.28달러로 오퍼스 4.8의 1.94달러보다 저렴합니다.

교차검증토큰당 가격은 전체 작업 비용을 예측하는 데 한계가 있습니다. 모델의 추론 효율성에 따라 더 큰 모델이 오히려 더 적은 토큰을 소비하며 전체 비용을 낮추는 사례가 빈번하게 발생합니다.

팩트하네스(harness) 선택은 비용과 품질에 결정적인 영향을 미칩니다. 동일한 모델을 사용하더라도 피(Pi)와 같은 하네스를 활용하면 문맥 정보를 효율적으로 관리해 작업 비용을 절반 이하로 줄일 수 있습니다.

주장데이터브릭스는 기존 공개 벤치마크인 에스더블유이(SWE)-벤치가 자사의 복잡한 기술 스택을 충분히 반영하지 못한다고 판단했습니다. 이에 따라 실제 엔지니어의 풀 리퀘스트(PR)를 기반으로 평가 체계를 구축해 신뢰도를 높였습니다.

팩트벤치마크 데이터 구축을 위해 최근 작성된 인간의 코드만을 선별했습니다. 자동 생성된 커밋이나 봇의 작업은 평가 대상에서 제외했습니다.

팩트데이터브릭스는 고품질 테스트 스위트가 포함된 풀 리퀘스트만을 사용했습니다. 이를 통해 모델이 생성한 코드의 정확성을 엄격하게 검증했습니다.

교차검증데이터브릭스는 엔지니어가 기본적으로 가장 비싼 모델을 선호하는 경향을 발견했습니다. 하지만 분석 결과, 단순 설정 변경이나 운영 작업에는 하이쿠(Haiku)나 지피티(GPT) 5.4 미니급 모델로도 충분한 성능을 냅니다.

주장이번 벤치마크는 기업이 실무 환경에 맞는 인공지능 도구를 선택할 때 중요한 기준을 제시합니다. 비용과 성능 사이의 균형을 맞추는 전략적 선택이 엔지니어링 효율을 결정합니다.

출처데이터브릭스 공식 블로그의 벤치마크 분석 보고서(https://www.databricks.com/blog/benchmarking-coding-agents-databricks-multi-million-line-codebase)를 교차 검증했습니다.

관련 콘텐츠

본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

스팟

WIRE

버블 지표

상세보기 →

릴리즈 & 논문

전체보기 →

RELEASES

OpenAIv2.53.0

v2.53.0

GPT-5.5 모델 지원 및 Responses 타입에 tool 이름/네임스페이스가 추가되었습니다. CI 관련 버그 수정으로 NumPy 소스 빌드 및 중복 HTTPX 커버리지가 방지되었습니다.

35일 전

OpenAIv2.52.1

v2.52.1

이번 릴리즈에서는 CI(지속적 통합) 관련 변경 사항이 포함되었습니다. 구체적으로 setup-uv v5를 해당 커밋에 고정하는 작업이 진행되었습니다.

35일 전

TensorRTv1.3.0rc23

v1.3.0rc23 릴리즈

이번 릴리즈에서는 DeepSeek V4 혼합 정밀도 NVFP4 체크포인트 로딩, Gemma4 K=V 레이어 W4A8 체크포인트 로딩 지원 등 모델 지원이 강화되었습니다. 또한, VisualGen 모델에 대한 비대칭 TP 선형 구현, 멀티 프로세스 HTTP 프론트엔드 지원 등 API 개선이 이루어졌습니다. GPT-OSS 및 GLM-5의 Python KV-캐시 트랜시버 기본값 설정, MiniMax-M3 MSA 희소 어텐션 백엔드 추가 등 다양한 기능이 추가되었으며, 여러 버그 수정 및 성능 최적화가 포함되었습니다.

38일 전

OpenAIv2.52.0

v2.52.0

이번 릴리즈에서는 API에 콘텐츠 출처 확인 기능이 추가되었습니다. 또한, 클라이언트에서 Retry-After 지연 시간을 최대 2분까지 지원하도록 수정되었으며, API 키 mTLS HTTP 클라이언트 레시피 관련 문서가 업데이트되었습니다.

39일 전

OpenAIv2.51.0

v2.51.0

이번 릴리즈에서는 API에 fast tier 기능이 추가되었습니다. 또한, 해당 fast tier 기능이 헬퍼 메서드에도 적용되었습니다.

39일 전

PAPERS