MARKETS
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
Wittgenhaus

2026년 7월 25일 토요일

AI 시대, 당신을 더욱 스마트하게

AI미검

교육용 거대언어모델 성능 평가의 새 기준, K12-KGraph 공개

하오 리앙 등 연구진은 초·중·고 교육과정을 체계화한 지식 그래프 K12-KGraph를 발표했습니다. 이를 활용해 교육용 인공지능의 추론 능력을 검증하는 벤치마크와 학습 데이터를 함께 구축했습니다.

2026년 7월 25일

주장교육 현장에서 거대언어모델(LLM) 활용이 급증하고 있습니다. 하지만 기존 평가 방식은 단순 시험 문제 풀이에만 치중한다는 한계가 있습니다. 연구진은 교육과정의 구조와 시각적 요소를 이해하는 능력인 '커리큘럼 인지(Curriculum Cognition)'를 새로운 평가 지표로 제시합니다.

팩트연구진은 중국 인민교육출판사의 수학, 물리, 화학, 생물 교과서를 기반으로 K12-KGraph를 구축했습니다. 이 지식 그래프(Knowledge Graph, 개념 간 관계를 구조화한 데이터베이스)는 9가지 노드 유형과 14가지 관계 유형으로 구성됩니다. 이는 선수 학습 개념, 개념 분류 체계, 실험과 개념의 연결 등을 포함합니다.

팩트연구진은 이 그래프를 바탕으로 2만 3,640개의 다지선다형 문제로 구성된 K12-Bench를 개발했습니다. 해당 벤치마크는 시각적 근거(Ground), 선수 지식(Prereq), 인접 개념(Neighbor), 증거(Evidence), 위치(Locate) 등 5가지 영역의 추론 능력을 측정합니다.

팩트성능 평가 결과, 제미나이-3-플래시(Gemini-3-Flash)는 57%, 젬마-4-31B-IT(Gemma-4-31B-IT)는 46%의 정확도를 기록했습니다. 특히 선수 지식과 인접 개념을 파악하는 과제에서 모델들이 낮은 성적을 보였습니다.

주장연구진은 모델의 교육적 추론 능력을 향상하기 위해 K12-Train이라는 학습용 데이터셋을 구축했습니다. 이 데이터셋은 7,335개의 샘플로 구성되며, 텍스트 질의응답 2,267개와 멀티모달(Multimodal, 텍스트와 이미지 등 복합 정보를 처리하는 방식) 질의응답 5,068개를 포함합니다.

팩트2,300개의 샘플을 활용한 실험에서 K12-Train-Text는 기존 8개 주요 학습 데이터셋보다 가오카오벤치(GaokaoBench)와 에듀이벌(EduEval)에서 더 높은 성능을 보였습니다. 이는 도메인 특화 데이터가 교육용 모델 학습에 효과적임을 입증합니다.

팩트시각-언어 모델(Vision-Language Model) 분야에서도 K12-Train-Full은 우수한 성과를 냈습니다. 기존 데이터셋보다 적은 샘플을 사용했음에도 가오카오-MM(Gaokao-MM) 등 주요 평가 지표에서 최고 수준의 결과를 기록했습니다.

주장이번 연구는 텍스트와 시각적 정보가 교육적 학습 과정에서 상호보완적인 역할을 한다는 점을 시사합니다. 연구진은 지식 그래프 구축 파이프라인과 벤치마크, 학습 데이터를 모두 공개하여 교육용 AI 연구의 표준을 제시하고자 합니다.

교차검증본 연구는 아카이브(arxiv)에 선공개된 논문으로, 아직 학계의 동료 평가(Peer Review)를 거치지 않았습니다. 따라서 연구 결과의 학술적 엄밀함은 향후 검증 과정을 통해 보완될 필요가 있습니다.

교차검증데이터셋의 범용성 측면에서 한계가 존재합니다. 연구진이 사용한 교과서 데이터가 특정 국가의 교육과정에 편중되어 있어, 다른 국가의 교육 환경이나 언어 체계에 동일한 성능을 발휘할지는 추가적인 연구가 필요합니다.

주장교육용 AI는 단순 지식 전달을 넘어 교육과정의 맥락을 이해하는 방향으로 발전해야 합니다. 이번 K12-KGraph는 모델이 교육적 인과관계를 파악하도록 유도하는 중요한 이정표가 될 것입니다.

출처arxiv의 선공개 논문(https://arxiv.org/abs/2605.09635)을 참고했습니다.

본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

스팟

WIRE

버블 지표

상세보기 →

릴리즈 & 논문

전체보기 →

RELEASES

vLLMv0.26.0

v0.26.0 릴리즈

이번 릴리즈에서는 Inkling 모델 제품군 지원, DeepSeek-V4 성능 향상, fp32 `lm_head` 지원 추가, 유연한 어텐션 백엔드, KV 오프로딩 및 계층형 보조 스토리지 기능 강화 등 다양한 업데이트가 포함되었습니다. 또한 Rust 프론트엔드 기능 확장 및 Transformers 5.13.0 지원이 추가되었습니다.

13시간 전

LangChainlangchain-anthropic==1.5.2

langchain-anthropic==1.5.2

Claude Opus 5 모델 지원이 추가되었습니다. 이번 릴리즈는 이전 버전인 langchain-anthropic==1.5.1 이후의 변경 사항을 포함합니다.

1일 전

Anthropicv0.120.0

v0.120.0

이번 릴리즈에서는 claude-opus-5 모델이 추가되었습니다. 또한, 도구 추가/제거 블록 및 tool_change 이벤트가 지원되며, 클라이언트 측 대체 크레딧 토큰 유형이 확장되고 서버 측 대체 기본 옵션이 추가되었습니다.

1일 전

LangChainlangchain-openai==1.4.1

langchain-openai==1.4.1

이번 릴리즈에서는 LangSmith 게이트웨이를 환경 변수를 통해 지원하도록 기능이 추가되었습니다. 또한 `gpt-5.3-chat-latest` 프로필이 수정되었습니다.

2일 전

LangChainlangchain-fireworks==1.5.1

langchain-fireworks==1.5.1

이번 릴리즈에서는 Fireworks LLM 통합에 대한 업데이트가 포함되었습니다. 또한 Anthropic, Fireworks, OpenAI 통합에서 환경 변수를 통해 LangSmith 게이트웨이를 지원하도록 기능이 추가되었습니다.

2일 전

PAPERS