SWE-rebench 리더보드와 AGENTS.md — GLM 5.2·Qwen 3.6 27B가 좁힌 모델 격차
작은 오픈 모델이 벤치마크 상단으로 치고 올라오며 프런티어와의 격차가 좁혀졌다. 그럴수록 승부는 모델 자체가 아니라 SWE-rebench 리더보드와 AGENTS.md, 3-비평자 하네스처럼 모델을 감싼 규율과 오케스트레이션으로 옮겨간다.
작은 오픈 모델이 벤치마크 상단으로 치고 올라오며 프런티어와의 격차가 좁혀졌다. 그럴수록 승부는 모델 자체가 아니라 SWE-rebench 리더보드와 AGENTS.md, 3-비평자 하네스처럼 모델을 감싼 규율과 오케스트레이션으로 옮겨간다.
빅테크가 Opus 4.8·Fable 5·GPT-5.6 Sol을 한 주에 쏟아내는 사이, GLM 5.2가 사이버보안 벤치마크에서 Claude를 앞서고 로컬 모델이 빠르게 따라붙는다. 모델 우열보다 하네스가 승부를 가르는 국면을 짚는다.
빅테크가 또 한 번 라인업을 통째로 갈아엎은 주, Anthropic은 Opus 4.8과 Fable 5·Mythos 5를 동시에 내놨고 OpenAI는 GPT-5.5를 보안·헬스로 밀었다. 그러나 GLM-5.2와 Apertus가 보여주듯 무게 중심은 오픈·로컬로 빠르게 새고 있다.
GPT-5.5 출시와 SpaceX 컴퓨트 동맹, Anthropic의 골드만·블랙스톤 합작사가 같은 주에 빅테크 진영 재정렬을 굳혔다. 반대편에서는 로컬 AI 담론과 Mythos의 curl 취약점 발견, 위임 실패 사례가 동시에 가속됐다.
3주간 52건 통제 실험에서 멀티에이전트가 순차 워크플로우보다 73~124% 비싼데 품질 개선은 없었다는 결과, Haiku 4.5+Skills가 Opus 4.7을 이긴 880건 평가, GitHub Copilot Individual 신규 가입 중단 등 AI 뉴스 7건 큐레이션.