MARKETS
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
Wittgenhaus

2026년 9월 23일 수요일

AI 시대, 당신을 더욱 스마트하게

AI검증

엔비디아 젯슨 AGX 토르 에이전트 AI 성능 6.4배 향상

엔비디아가 젯슨 AGX 토르 개발자 키트에서 에이전트형 인공지능 추론 성능을 기존 모델 대비 6.4배 높였다고 발표했습니다. 텐서알티 엣지 대규모 언어 모델을 활용해 복잡한 작업을 빠른 속도로 처리합니다.

2026년 9월 17일

주장엔비디아는 엣지 디바이스 환경에서 인공지능의 추론 성능을 개선하는 기술을 선보였습니다.

팩트엔비디아의 텐서알티 엣지 대규모 언어 모델은 젯슨 AGX 토르 개발자 키트에서 콴 3.6-27비트 모델을 구동하여 초당 52.33 토큰의 성능을 기록했습니다.

팩트이는 기존 참조 모델이 2시간 37분 걸리던 작업을 24분 36초 만에 완료한 수치입니다.

팩트이번 벤치마크는 총 1,007회의 에이전트 턴을 포함하는 기계 학습 성능 추론 브이 6.1 엣지 에이전트 워크로드를 대상으로 진행되었습니다.

팩트입력 길이는 최대 2만3500 토큰에 달하며, 엣지 환경에서 긴 문맥 처리가 필수적임을 보여줍니다.

주장에이전트 인공지능은 도구를 선택하고 결과를 평가하며 추론을 지속해야 하므로 높은 연산 효율이 필요합니다.

주장엔비디아는 이를 위해 엠브이피에프4 양자화와 트리 기반 다중 토큰 예측 기술을 결합하여 메모리 대역폭 한계를 극복했습니다.

팩트엠브이피에프4 양자화는 가중치와 활성화 함수에 4비트 부동 소수점 형식을 적용하여 메모리 점유율을 낮춥니다.

팩트키브이 캐시에 에프피8 형식을 사용하여 블랙웰 그래픽 처리 장치 기반의 젯슨 AGX 토르에서 최적의 성능을 이끌어냈습니다.

팩트키브이 캐시와 순환 상태 재사용 기술을 통해 전체 프롬프트 토큰의 약 96퍼센트를 핫 캐시에서 처리합니다.

주장트리 기반 다중 토큰 예측은 함수 호출 워크로드에서 강력한 성능을 발휘합니다.

팩트8단계, 상위 2개 후보, 16개 노드 검증 트리를 사용한 결과, 선형 다중 토큰 예측 대비 약 40퍼센트의 추가적인 디코딩 성능 향상을 달성했습니다.

교차검증엣지 디바이스는 전력과 메모리 제약이 엄격하므로, 모델의 정확도와 성능 사이의 균형을 맞추는 작업이 중요합니다.

출처엔비디아 기술 블로그(https://developer.nvidia.com/blog/tensorrt-edge-llm-completes-the-mlperf-edge-agentic-benchmark-6-4x-faster-on-jetson-agx-thor/)의 보도를 교차 검증했습니다.

관련 콘텐츠

본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

스팟

WIRE

버블 지표

상세보기 →

릴리즈 & 논문

전체보기 →

RELEASES

OpenAIv2.53.0

v2.53.0

GPT-5.5 모델 지원 및 Responses 타입에 tool 이름/네임스페이스가 추가되었습니다. CI 관련 버그 수정으로 NumPy 소스 빌드 및 중복 HTTPX 커버리지가 방지되었습니다.

50일 전

OpenAIv2.52.1

v2.52.1

이번 릴리즈에서는 CI(지속적 통합) 관련 변경 사항이 포함되었습니다. 구체적으로 setup-uv v5를 해당 커밋에 고정하는 작업이 진행되었습니다.

50일 전

TensorRTv1.3.0rc23

v1.3.0rc23 릴리즈

이번 릴리즈에서는 DeepSeek V4 혼합 정밀도 NVFP4 체크포인트 로딩, Gemma4 K=V 레이어 W4A8 체크포인트 로딩 지원 등 모델 지원이 강화되었습니다. 또한, VisualGen 모델에 대한 비대칭 TP 선형 구현, 멀티 프로세스 HTTP 프론트엔드 지원 등 API 개선이 이루어졌습니다. GPT-OSS 및 GLM-5의 Python KV-캐시 트랜시버 기본값 설정, MiniMax-M3 MSA 희소 어텐션 백엔드 추가 등 다양한 기능이 추가되었으며, 여러 버그 수정 및 성능 최적화가 포함되었습니다.

53일 전

OpenAIv2.52.0

v2.52.0

이번 릴리즈에서는 API에 콘텐츠 출처 확인 기능이 추가되었습니다. 또한, 클라이언트에서 Retry-After 지연 시간을 최대 2분까지 지원하도록 수정되었으며, API 키 mTLS HTTP 클라이언트 레시피 관련 문서가 업데이트되었습니다.

53일 전

OpenAIv2.51.0

v2.51.0

이번 릴리즈에서는 API에 fast tier 기능이 추가되었습니다. 또한, 해당 fast tier 기능이 헬퍼 메서드에도 적용되었습니다.

54일 전

PAPERS