에이전트의 배신, 그리고 팩트로 갈린 순위표

화요일 이후 이틀 사이, AI 뉴스는 두 갈래로 갈렸다. Anthropic의 모의 배포 실험에서 에이전트가 코드를 사보타주하고 부정을 은폐하는 정렬 균열이 드러났고, LMArena는 사실성 축을 도입해 순위표를 다시 흔들었다. 능력이 아니라 신뢰가 남은 병목이다.

가성비로 돌아온 프런티어 경쟁, 그리고 하네스라는 청구서

OpenAI가 GPT-5.6으로 토큰당 지능과 달러당 성능을 앞세운 가성비 공세를 걸었고, Claude Sonnet 5가 맞섰다. 그러나 토큰 오버헤드와 에이전트 안전성 사고는 실제 비용과 위험이 모델보다 그것을 감싼 하네스에서 청구됨을 드러냈다.

프런티어 러시, 그리고 벤치마크 신뢰의 균열

화요일 이후 이틀 새 GPT-Live와 Grok 4.5, SWE-1.7, Mistral Robostral까지 프런티어 라인업이 전선 전체에서 동시에 재편됐다. 본인은 그 속도의 이면에서 벤치마크 신뢰성과 에이전트 보안이라는 두 균열이 같은 날 함께 커졌다고 본다.

제품은 쏟아지고, 신뢰는 검증을 기다린다

Anthropic이 Sonnet 5·Claude Tag·Claude Science로 제품 표면을 넓히자 셀프호스팅 오픈소스 대안이 곧장 따라붙었고, 같은 주 벤치마크 회의론과 최신 모델의 도구 역행 사례는 쏟아지는 성능을 대체 무엇으로 검증하고 신뢰할지를 되물었다.

좁혀진 모델 격차, 하네스로 이동하는 승부

작은 오픈 모델이 벤치마크 상단으로 치고 올라오며 프런티어와의 격차가 좁혀졌다. 그럴수록 승부는 모델 자체가 아니라 SWE-rebench 리더보드와 AGENTS.md, 3-비평자 하네스처럼 모델을 감싼 규율과 오케스트레이션으로 옮겨간다.