안드레이 카파시의 새로운 AI 성능 평가 방식 도입
인공지능 연구자 안드레이 카파시가 기존 벤치마크의 한계를 지적하며 새로운 평가 기준인 바이브 체크를 제시했습니다. 그는 AI 모델을 활용한 3D 게임 환경 구축 실험을 통해 기술적 가능성과 향후 산업 변화를 전망합니다.
주장안드레이 카파시는 기존의 펠리컨 테스트와 같은 정형화된 벤치마크가 한계에 도달했다고 판단합니다. 그는 인공지능 모델의 창의성과 공간 추론 능력을 평가하기 위해 더 직관적이고 실험적인 바이브 체크 방식을 도입해야 한다고 강조합니다.
팩트카파시는 앤스로픽의 클로드 오퍼스 5 모델을 사용하여 소설 반지의 제왕 도입부를 3D 브라우저 장면으로 변환했습니다. 이 과정에서 5,500줄의 코드가 생성되었으며 전체 비용은 10달러 수준으로 저렴했습니다.
팩트이번 실험은 쓰리 제이에스 그래픽 라이브러리를 활용하여 진행되었습니다. 모델은 2시간 동안 작업했으며 백만 토큰의 예산을 사용하여 3D 환경을 구축했습니다.
교차검증현재 모델은 자신의 비디오 출력을 실시간으로 모니터링하지 못하고 스크린샷에 의존합니다. 이로 인해 작업 과정에서 일부 오류가 발생하며 완벽한 자동화에는 여전히 기술적 한계가 존재합니다.
팩트펠리컨 테스트는 사이먼 윌리슨이 제안한 방식으로 모델에게 자전거를 타는 펠리컨을 확장 가능한 벡터 그래픽으로 그리게 합니다. 이는 학습 데이터에 존재하지 않을 법한 상황을 제시하여 모델의 추론 능력을 확인하려는 목적이 있습니다.
팩트2023년 마이크로소프트는 스파크 오브 에이지아이 논문에서 지피티-4에게 티크즈를 사용하여 유니콘을 그리게 했습니다. 당시 지피티-4는 텍스트 데이터만으로 학습되었음에도 공간 추론 능력을 보여주어 큰 주목을 받았습니다.
주장카파시는 인공지능이 사용자 요구에 맞춰 즉석에서 게임 세계를 생성하는 미래를 예견합니다. 그는 사용자가 게임의 주인공이나 조연으로 즉시 투입될 수 있는 온디맨드 게임 환경이 실현 가능하다고 봅니다.
팩트안드레이 카파시는 오픈에이아이 공동 창립자이자 테슬라의 인공지능 책임자를 역임했습니다. 그는 에듀케이션 스타트업 유레카 랩스를 운영했으며 2026년 5월부터 앤스로픽에서 사전 학습 연구를 수행합니다.
교차검증현재 많은 사용자가 클로드 오퍼스 5를 사용하여 일인칭 슈팅 게임이나 마인크래프트 클론을 제작합니다. 그러나 이러한 결과물들은 엄격한 성능 지표가 아닌 주관적인 바이브 체크의 영역에 머물러 있습니다.
주장인공지능 모델을 통한 게임 세계 구축은 수작업 대비 비용 효율성이 매우 높습니다. 카파시는 이러한 기술이 게임 산업의 제작 방식을 근본적으로 변화시킬 수 있는 잠재력을 가지고 있다고 평가합니다.
주장인공지능의 잠재력을 확인하기 위해 정형화된 지표를 넘어선 새로운 평가 방식의 정립이 필요합니다. 카파시의 실험은 인공지능이 단순한 텍스트 생성을 넘어 복합적인 환경을 설계하는 도구로 진화하고 있음을 보여줍니다.
출처더 디코더의 보도 내용과 안드레이 카파시의 엑스 계정 자료를 교차 검증했습니다.
주제
관련 콘텐츠
본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

