MARKETS
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
Wittgenhaus

2026년 7월 20일 월요일

AI 시대, 당신을 더욱 스마트하게

AI미검

200만 토큰 이상 초장문 강화학습 구현 기술 '롱스트로' 공개

글로벌 연구진이 고정된 GPU 자원 내에서 200만 토큰 이상의 초장문 맥락을 처리하는 강화학습 기술 '롱스트로(LongStraw)'를 개발했습니다. 이 기술은 메모리 효율을 극대화하여 인공지능 에이전트의 장기 기억과 추론 능력을 획기적으로 개선합니다.

2026년 7월 19일

주장인공지능 모델의 추론 능력은 입력 데이터의 길이에 따라 결정됩니다. 최근 추론 시스템은 수백만 토큰을 처리하는 수준에 도달했습니다. 하지만 강화학습(RL, Reinforcement Learning) 사후 학습 단계는 여전히 25만 토큰 이하에 머물러 있습니다.

팩트창하이 저우(Changhai Zhou)를 포함한 다국적 연구진은 이 격차를 해소하기 위해 '롱스트로(LongStraw)'를 제안했습니다. 연구진은 소속 정보를 아카이브(arxiv) 등록 기준으로 공개했습니다. 이번 연구는 고정된 GPU 예산 내에서 초장문 강화학습을 수행하는 데 초점을 맞춥니다.

팩트롱스트로는 그룹 상대 정책 최적화(GRPO, Group Relative Policy Optimization) 기법을 활용합니다. 이 기술은 공유된 프롬프트를 자동 미분(Autograd, 모델 학습 시 기울기를 자동으로 계산하는 과정) 없이 평가합니다. 또한 모델별로 필요한 상태 값만 유지하여 메모리 점유율을 낮춥니다.

주장기존 강화학습은 긴 문맥을 처리할 때 메모리 부족 문제에 직면합니다. 롱스트로는 응답 분기(Response Branch)를 하나씩 순차적으로 재실행하는 방식을 채택했습니다. 이는 학습 그래프의 크기를 줄이는 대신 재실행 시간을 활용하는 전략입니다.

팩트연구진은 하이브리드 순환 및 완전 주의(Full-Attention) 구조인 Qwen3.6-27B 모델과 압축 주의 혼합 전문가(MoE, Mixture-of-Experts) 모델인 GLM-5.2를 대상으로 실험을 진행했습니다. H20 GPU 8대를 사용하여 210만 토큰 위치에서 그룹별 점수 산정과 역전파를 성공적으로 수행했습니다.

팩트그룹 크기를 2개에서 8개로 늘렸을 때, 최대 할당 메모리 증가량은 0.21GB에 불과했습니다. 별도의 스트레스 테스트에서는 최대 446만 토큰 위치까지 처리하는 성능을 보였습니다. 32대의 H20 GPU 환경에서는 GLM-5.2의 78개 층 전체를 대상으로 210만 토큰 프롬프트 경로를 검증했습니다.

교차검증본 연구는 아카이브에 선공개된 논문으로, 아직 학계의 공식적인 동료 평가(Peer Review) 과정을 거치지 않았습니다. 따라서 제시된 성능 지표는 학술적 검증이 완료된 결과가 아님을 유의해야 합니다.

교차검증기술적 한계도 존재합니다. 이번 실험은 주로 실행 용량을 확보하는 데 집중했습니다. 프롬프트 상태를 분리하여 처리하는 과정에서 일부 분산 순방향 및 기울기 합성 경로가 불완전하게 구성되었습니다. 이는 실제 전체 학습 과정의 정확성을 완벽하게 보장하지는 못합니다.

주장롱스트로는 인공지능 에이전트의 발전에 중요한 이정표가 됩니다. 에이전트는 관찰 데이터, 도구 사용 결과, 문서, 과거 결정 사항을 긴 궤적에 걸쳐 축적해야 합니다. 이번 연구는 이러한 장기 기억 능력을 강화학습에 도입할 실질적인 경로를 제시합니다.

팩트연구진은 이번 성과가 강화학습의 사후 학습 단계에서 발생하는 병목 현상을 해결할 수 있다고 강조합니다. 고가의 GPU 자원을 무한정 늘리지 않고도 초장문 맥락을 학습할 수 있다는 점이 핵심입니다. 이는 기업의 인공지능 개발 비용 절감에도 기여할 전망입니다.

주장향후 연구는 분리된 프롬프트 상태를 통합하고 학습 경로의 완전성을 확보하는 방향으로 진행되어야 합니다. 현재의 실행 용량 확보를 넘어 실제 학습의 안정성과 정확성을 입증하는 것이 다음 과제입니다. 롱스트로가 실무 환경에 적용될 경우 인공지능의 문맥 이해도는 한 단계 도약할 것입니다.

출처arxiv의 선공개 논문(https://arxiv.org/abs/2607.14952)을 참고했습니다.

본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

스팟

WIRE

버블 지표

상세보기 →

릴리즈 & 논문

전체보기 →

RELEASES

mistralai/mistral-commonv1.11.6

v1.11.6: 수정 및 문법 선택기 패치

이번 릴리즈에서는 오디오 청크 유효성 검사 시 ValidationError 대신 ValueError를 발생시키도록 수정되었습니다. 또한, 샘플링 속도가 프레임 속도보다 낮은 AudioConfig를 거부하고, SentencePiece에서 SpecialTokenPolicy.RAISE 시 일반 토큰을 디코딩하도록 변경되었습니다. 토크나이저에서 문법 변형을 자동 선택하고, SpeechRequest OpenAI 변환 시 시드 필드가 올바르게 처리되도록 수정되었습니다.

3일 전

OpenAIv2.46.0

2.46.0 (20260717) Full Changelog: v2.45.0...v2.46.0(https://github.com/openai/openaipython/compare/v2.45.0...v2.46.0)

3일 전

Anthropicv0.117.0

v0.117.0

이번 릴리즈에서는 dreaming 및 MCP Tunnels API 지원이 추가되었습니다. 또한, SecretStr을 사용하여 traceback에서 credential 정보가 노출되지 않도록 수정되었으며, 문서 필드 설명 및 예제 업데이트가 포함되었습니다.

3일 전

LangChainlangchain==1.3.14

langchain==1.3.14

`ToolRetryMiddleware`에서 재시도 가능한 예외만 재시도하도록 수정되었습니다. 또한 `ToolErrorMiddleware` 기능이 추가되었습니다.

4일 전

Transformersv5.14.1

패치 릴리즈: v5.14.1

이번 패치 릴리즈는 Inkling 모델 통합 시 발생했던 몇 가지 문제를 해결했습니다. 특히 EncoderDecoderCache를 사용하는 모델의 assisted generation 관련 문제를 수정했습니다. 또한, position_bias를 사용하는 Inkling 모델에서 StaticCache 및 sdpa를 이용한 prefill 시 발생할 수 있는 문제를 해결했습니다.

4일 전

PAPERS