TOPIC
LLM
LLM 관련 콘텐츠 116건입니다. 주장과 팩트를 분리하고 검증 단계를 표기했습니다.
교육용 거대언어모델 성능 평가의 새 기준, K12-KGraph 공개
미검하오 리앙 등 연구진은 초·중·고 교육과정을 체계화한 지식 그래프 K12-KGraph를 발표했습니다. 이를 활용해 교육용 인공지능의 추론 능력을 검증하는 벤치마크와 학습 데이터를 함께 구축했습니다.
병리 인공지능 파운데이션 모델 32종 성능 비교 연구
검증연구진이 32개 병리 인공지능 모델의 성능을 4가지 범주로 나누어 분석했습니다. 병리 특화 모델이 암 진단 과제에서 우수한 성능을 보였으나, 데이터셋에 따라 일반화 능력에 차이가 있음을 확인했습니다. 여러 모델을 결합하는 앙상블 기법이 진단 정확도 향상에 효과적이라는 결과를 도출했습니다.
데이터플로우-하니스: LLM 기반 데이터 파이프라인 자동화의 효율성과 가독성 개선
미검런밍 허 등 연구진은 LLM이 생성한 코드를 편집 가능한 데이터 파이프라인으로 변환하는 플랫폼인 데이터플로우-하니스를 공개했습니다. 이 플랫폼은 기존 방식 대비 비용을 72.5% 절감하고 파이프라인 구축의 신뢰성을 대폭 높였습니다.
TimeLens2: 영상 내 사건 발생 시점 정밀 추적하는 멀티모달 거대언어모델 개발
미검TimeLens2는 영상 내 특정 사건이 발생하는 시간 구간을 정확히 찾아내는 범용 멀티모달 거대언어모델입니다. 기존 모델 대비 파라미터 규모는 획기적으로 줄이면서도 성능은 최상위 수준을 달성했습니다.
인공지능 채용 모델의 편향성 심화 현상
검증거대언어모델이 학습 데이터뿐만 아니라 경험을 통해 스스로 편향을 형성한다는 연구 결과가 나왔습니다. 채용 과정에서 인공지능이 인간보다 더 강력한 고정관념을 적용할 위험이 제기됩니다.
거대언어모델의 추론 능력 향상과 연산 노력 제어 기술
미검거대언어모델은 강화학습을 통해 단계별 추론 과정을 학습하며 성능을 높입니다. 최근 모델들은 사용자가 직접 추론 노력을 설정할 수 있는 기능을 도입하고 있습니다. 이러한 기술적 변화와 연산 비용의 관계를 분석합니다.
오픈AI, 거대언어모델 보안 강화용 해커 AI 'GPT-Red' 개발
검증오픈AI가 자사 거대언어모델의 취약점을 스스로 점검하는 인공지능 해커 'GPT-Red'를 개발했습니다. 이 시스템은 모델 간 대결을 통해 보안성을 높이며, 실제 환경을 모방한 훈련장에서 공격 기술을 학습합니다.
앤스로픽, 거대언어모델 내부 개념 처리 공간 'J-스페이스' 발견
검증앤스로픽 연구진이 거대언어모델 내부에서 답변 생성 전 개념을 고민하는 영역인 'J-스페이스'를 확인했습니다. 이번 연구는 인공지능의 블랙박스 문제를 해결하고 의사결정 과정을 실시간으로 추적하는 새로운 가능성을 제시합니다.
아마존 베드록, 미니맥스 파운데이션 모델 지원 시작
검증아마존 웹 서비스가 기업용 생성형 인공지능 플랫폼인 아마존 베드록에서 미니맥스의 최신 파운데이션 모델을 제공합니다. 기업은 이를 통해 보안 환경에서 소프트웨어 엔지니어링과 에이전트 기반 작업을 수행할 수 있습니다.
거대언어모델 강화학습의 새로운 이정표, 단조 추론 정책 개선 기법 등장
미검강화학습 과정에서 발생하는 모델의 학습과 추론 간 불일치 문제를 해결하는 새로운 프레임워크가 제시되었습니다. 연구진은 추론 성능을 직접적으로 향상하는 단조 추론 정책 개선(MIPI) 기법을 통해 학습 안정성을 확보했습니다.