OpenAI, API 설정 두 개로 ARC-AGI-3 점수 3배 – SlopCodeBench서 Opus 5는 17개 중 4개
OpenAI가 API 설정 두 개로 ARC-AGI-3 점수를 세 배 올렸고, SlopCodeBench에서 Opus 5는 17개 체크포인트 중 4개만 통과했다. Kimi K3와 500달러 미세조정 9B 모델이 오픈 웨이트의 실효 범위를 넓히는 국면을 정리했다.
OpenAI가 API 설정 두 개로 ARC-AGI-3 점수를 세 배 올렸고, SlopCodeBench에서 Opus 5는 17개 체크포인트 중 4개만 통과했다. Kimi K3와 500달러 미세조정 9B 모델이 오픈 웨이트의 실효 범위를 넓히는 국면을 정리했다.
Kimi K3가 중국 오픈웨이트 모델로는 처음으로 일부 프런티어 벤치마크에서 Opus 4.8을 앞섰다. 같은 주말 Fable 5는 계량제로 전환됐고 Codex 컨텍스트는 축소됐다. 성능은 아래에서 올라오고 가격은 위에서 조여드는 국면을 정리했다.
OpenAI가 GPT-5.6으로 토큰당 지능과 달러당 성능을 앞세운 가성비 공세를 걸었고, Claude Sonnet 5가 맞섰다. 그러나 토큰 오버헤드와 에이전트 안전성 사고는 실제 비용과 위험이 모델보다 그것을 감싼 하네스에서 청구됨을 드러냈다.
화요일 이후 이틀 새 GPT-Live와 Grok 4.5, SWE-1.7, Mistral Robostral까지 프런티어 라인업이 전선 전체에서 동시에 재편됐다. 본인은 그 속도의 이면에서 벤치마크 신뢰성과 에이전트 보안이라는 두 균열이 같은 날 함께 커졌다고 본다.
작은 오픈 모델이 벤치마크 상단으로 치고 올라오며 프런티어와의 격차가 좁혀졌다. 그럴수록 승부는 모델 자체가 아니라 SWE-rebench 리더보드와 AGENTS.md, 3-비평자 하네스처럼 모델을 감싼 규율과 오케스트레이션으로 옮겨간다.