TOPIC
AI 연구
AI 연구 관련 콘텐츠 152건입니다. 주장과 팩트를 분리하고 검증 단계를 표기했습니다.
다국어 프로그래밍 평가 벤치마크 'Multi-LCB' 공개
미검기존 파이썬 중심의 코드 생성 평가 체계를 12개 언어로 확장한 새로운 벤치마크 'Multi-LCB'가 등장했습니다. 연구진은 이를 통해 거대언어모델의 언어별 성능 격차와 파이썬 편향성을 명확히 확인했습니다.
로보택시 시장 내 중국 기업의 우위 현황
검증자율주행 산업이 성숙기에 진입하며 데이터 기반의 객관적 평가 지표가 중요해졌습니다. 최근 발표된 지수에 따르면 중국 기업들이 로보택시 시장에서 상위권을 점유하고 있습니다.
지푸 GLM-5.2의 프런티어급 성능 구현과 오픈 모델의 기술적 진화
미검지푸가 공개한 GLM-5.2가 오픈 웨이트 모델 최초로 프런티어급 성능을 기록하며 주목받고 있습니다. 인덱스쉐어 기술을 통한 비용 절감과 함께 에이전트 중심의 통합 개발 환경이 AI 업계의 새로운 기준으로 자리 잡고 있습니다.
인공지능 에이전트 최적화를 위한 오픈 모델 벤치마크 도입
검증허깅페이스가 인공지능 에이전트의 작업 효율성을 측정하는 새로운 벤치마크 도구를 공개했습니다. 에이전트가 소프트웨어를 효과적으로 구동하도록 라이브러리 설계 방식을 개선하는 것이 핵심입니다. 정답 여부뿐만 아니라 토큰 사용량과 오류 발생률 등 경로 효율성을 평가합니다.
모자이크릭스: 기업용 AI 에이전트의 정보 유출 위험과 대응 전략
검증기업용 AI 에이전트가 외부 검색을 수행할 때 발생하는 정보 유출 위험인 모자이크릭스를 분석합니다. 허깅페이스와 서비스나우는 이를 방지하기 위한 새로운 강화학습 기법을 제시했습니다.
게임 이론 내 일반 알고리즘의 우위 입증
검증매사추세츠 공과대학교 연구진이 범용 알고리즘인 정책 경사 방법이 특정 불완전 정보 게임에서 기존 특화 알고리즘보다 우수한 성능을 낸다는 사실을 확인했습니다. 연구진은 이를 검증할 수 있는 표준화된 벤치마크 소프트웨어를 함께 공개했습니다.
조 단위 파라미터 규모의 에이전트 지능 구현, 링 2.6 기술 보고서 공개
미검글로벌 연구진이 조 단위 파라미터 규모에서 즉각적인 응답과 고도화된 추론 능력을 동시에 갖춘 링 2.6 모델 패밀리를 발표했습니다. 이번 연구는 하이브리드 선형 어텐션과 강화학습 프레임워크를 도입하여 에이전트 지능의 효율성을 극대화했습니다.
Z.ai, 프론트엔드 코딩 성능 강화한 GLM-5.2 공개
미검Z.ai가 오픈 웨이트 모델 GLM-5.2를 새롭게 선보였습니다. 이 모델은 프론트엔드 코딩과 에이전트 작업에서 기존 모델을 뛰어넘는 성능을 보입니다. 주요 기술적 특징과 벤치마크 결과를 정리했습니다.
GLM-5.2 모델의 100만 토큰 컨텍스트 지원과 코딩 성능 향상
검증지엘엠(GLM)-5.2가 100만 토큰의 문맥을 처리하며 코딩 성능을 대폭 강화했습니다. 인덱스 쉐어 기술을 도입해 연산 효율을 높이고 프론티어 에스더블유이 벤치마크에서 우수한 성적을 거뒀습니다.
엔비디아 블랙웰, MLPerf 6.0 벤치마크 전 부문 1위 달성
검증엔비디아의 블랙웰 플랫폼이 최신 MLPerf 훈련 6.0 벤치마크에서 전 부문 1위를 기록했습니다. 대규모 클러스터와 고성능 시스템을 통해 AI 훈련 효율성을 입증했습니다.