MARKETS
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
Wittgenhaus

2026년 7월 27일 월요일

AI 시대, 당신을 더욱 스마트하게

TOPIC

AI 연구

AI 연구 관련 콘텐츠 152건입니다. 주장과 팩트를 분리하고 검증 단계를 표기했습니다.

AWS 베드록 에이전트코어 메모리의 메타데이터 필터링 도입

검증

아마존 웹 서비스가 베드록 에이전트코어 메모리에 메타데이터 필터링 기능을 추가했습니다. 이 기능은 대화 기록에서 정확한 정보를 추출해 검색 정확도를 높입니다. 벤치마크 테스트 결과 답변 정확도가 기존 40%에서 64%로 상승했습니다.

AI·25일 전

오픈에이아이, 생명과학 연구용 벤치마크 진벤치-프로 공개

검증

오픈에이아이가 유전학 및 생명과학 분야의 인공지능 성능을 평가하는 진벤치-프로를 발표했습니다. 이 도구는 인공지능의 과학적 추론 능력을 표준화된 방식으로 측정합니다.

AI·25일 전

코딩 AI 효율 극대화하는 도커리스(Dockerless) 환경 독립적 검증 기술

미검

코딩 에이전트의 학습 과정에서 필수적인 코드 검증 단계를 도커 환경 없이 수행하는 기술이 개발되었습니다. 연구진은 기존 방식 대비 검증 성능을 대폭 개선하고, 실제 코딩 벤치마크에서 모델의 해결률을 유의미하게 높였습니다.

AI·25일 전

AI 모델의 스타트업 경영 능력 평가 결과

미검

프린스턴 대학교 연구진이 개발한 경영 벤치마크 테스트에서 대다수 인공지능 모델이 낮은 성과를 보였습니다. 단순 규칙 기반 알고리즘이 상위 3개 모델을 제외한 모든 AI보다 높은 수익을 기록하며 한계를 드러냈습니다.

AI·28일 전

세포 무함유 시스템의 능동 학습 기반 mRNA 수율 최적화

검증

연구진이 능동 학습을 활용해 세포 무함유 시스템의 mRNA 수율을 20배 높이는 데 성공했습니다. 이번 연구는 유전자 발현 연구의 새로운 통제 모델을 제시합니다. 2026년 6월 27일 네이처 커뮤니케이션즈에 관련 논문이 게재되었습니다.

AI·29일 전

AI 코딩 역량 평가 미러코드 벤치마크 분석

검증

에포크 AI와 METR이 공동 개발한 미러코드 벤치마크는 인공지능 모델의 소프트웨어 재구현 능력을 평가합니다. 클로드 오퍼스 4.7이 가장 높은 해결률을 기록하며 기술적 우위를 증명했습니다.

AI·30일 전

네이처 논문 재현하는 AI 코딩 에이전트 성능 평가, 네이처벤치 공개

미검

네이처 학술지 논문 90편을 기반으로 AI 코딩 에이전트의 과학적 문제 해결 능력을 검증하는 네이처벤치가 공개되었습니다. 연구진은 현재의 AI 모델이 실제 과학적 발견보다는 기존 방법론의 단순 변환에 머물러 있음을 확인했습니다.

AI·32일 전

기업용 AI 에이전트 성능 평가 벤치마크 '엔터프라이즈클로벤치' 공개

미검

프론티스AI(FrontisAI) 연구진이 실제 기업 업무 세션을 기반으로 한 AI 에이전트 평가 체계인 엔터프라이즈클로벤치를 발표했습니다. 이 벤치마크는 복합적인 비즈니스 환경에서 AI의 실질적인 업무 수행 능력을 측정하는 새로운 기준을 제시합니다.

AI·33일 전

대규모 도구 생태계 속 LLM 에이전트의 장기 계획 능력 평가, 'PlanBench-XL' 공개

미검

일리노이 대학교 어바나-샴페인(UIUC) 연구진이 대규모 도구 생태계에서 거대언어모델(LLM) 에이전트의 장기 계획 능력을 측정하는 벤치마크 'PlanBench-XL'을 발표했습니다. 이번 연구는 복잡한 도구 환경에서 에이전트의 적응형 계획 수립 한계를 진단하고 개선 방향을 제시합니다.

AI·33일 전

오픈 소스 AI의 기술적 도약, GLM-5.2 공개

미검

Z.ai가 강화학습 프레임워크 SLIME을 기반으로 개발한 GLM-5.2를 공개했습니다. 이 모델은 폐쇄형 모델과 대등한 코딩 및 에이전트 성능을 보이며 오픈 소스 생태계의 변화를 예고합니다.

AI·34일 전

다른 주제