Opus 5.5·GPT-6 Sol 같은 날 출시, 두 프런티어가 점수 대신 값을 내렸다
Anthropic의 Opus 5.5와 OpenAI의 GPT-6 Sol·Luna가 같은 날 나왔다. 두 회사가 앞세운 숫자는 점수가 아니라 값과 속도다. 950개 에이전트가 21시간 돌아 새 효소 체계를 찾은 사례와 AGENTS.md를 건너뛰던 Claude Code 버그를 함께 짚는다.
Anthropic의 Opus 5.5와 OpenAI의 GPT-6 Sol·Luna가 같은 날 나왔다. 두 회사가 앞세운 숫자는 점수가 아니라 값과 속도다. 950개 에이전트가 21시간 돌아 새 효소 체계를 찾은 사례와 AGENTS.md를 건너뛰던 Claude Code 버그를 함께 짚는다.
텍스트를 만들지 못하고 판단만 돌려주는 Jev 계열이 이번 주 수집 풀을 채웠다. 같은 기간 Claude Code는 AGENTS.md를 읽기 시작했고, MiMo v2.6과 M5 Ultra가 로컬 상주 쪽을 받쳤다. 답의 정확도는 그대로 남았다.
작은 오픈 모델이 벤치마크 상단으로 치고 올라오며 프런티어와의 격차가 좁혀졌다. 그럴수록 승부는 모델 자체가 아니라 SWE-rebench 리더보드와 AGENTS.md, 3-비평자 하네스처럼 모델을 감싼 규율과 오케스트레이션으로 옮겨간다.