OpenAI GPT-5.6 가성비 공세에 Claude Sonnet 5 맞대응 – 청구서는 하네스에서

OpenAI GPT-5.6 가성비 공세에 Claude Sonnet 5 맞대응 – 청구서는 하네스에서

OpenAI가 GPT-5.6으로 토큰당 지능과 달러당 성능을 앞세운 가성비 공세를 걸었고, Claude Sonnet 5가 맞섰다. 그러나 토큰 오버헤드와 에이전트 안전성 사고는 실제 비용과 위험이 모델보다 그것을 감싼 하네스에서 청구됨을 드러냈다.

GPT-Live·Grok 4.5·SWE-1.7·Mistral Robostral 동시 등장 – 벤치마크 신뢰의 균열

GPT-Live·Grok 4.5·SWE-1.7·Mistral Robostral 동시 등장 – 벤치마크 신뢰의 균열

화요일 이후 이틀 새 GPT-Live와 Grok 4.5, SWE-1.7, Mistral Robostral까지 프런티어 라인업이 전선 전체에서 동시에 재편됐다. 본인은 그 속도의 이면에서 벤치마크 신뢰성과 에이전트 보안이라는 두 균열이 같은 날 함께 커졌다고 본다.

Anthropic, Claude Sonnet 5·Claude Tag·Claude Science 공개 – 벤치마크 회의론도 함께

Anthropic, Claude Sonnet 5·Claude Tag·Claude Science 공개 – 벤치마크 회의론도 함께

Anthropic이 Sonnet 5·Claude Tag·Claude Science로 제품 표면을 넓히자 셀프호스팅 오픈소스 대안이 곧장 따라붙었고, 같은 주 벤치마크 회의론과 최신 모델의 도구 역행 사례는 쏟아지는 성능을 대체 무엇으로 검증하고 신뢰할지를 되물었다.

SWE-rebench 리더보드와 AGENTS.md – GLM 5.2·Qwen 3.6 27B가 좁힌 모델 격차

SWE-rebench 리더보드와 AGENTS.md – GLM 5.2·Qwen 3.6 27B가 좁힌 모델 격차

작은 오픈 모델이 벤치마크 상단으로 치고 올라오며 프런티어와의 격차가 좁혀졌다. 그럴수록 승부는 모델 자체가 아니라 SWE-rebench 리더보드와 AGENTS.md, 3-비평자 하네스처럼 모델을 감싼 규율과 오케스트레이션으로 옮겨간다.

Claude Opus 4.8·GPT-5.6 Sol 출시, GLM 5.2는 보안 벤치마크서 Claude 추월

Claude Opus 4.8·GPT-5.6 Sol 출시, GLM 5.2는 보안 벤치마크서 Claude 추월

빅테크가 Opus 4.8·Fable 5·GPT-5.6 Sol을 한 주에 쏟아내는 사이, GLM 5.2가 사이버보안 벤치마크에서 Claude를 앞서고 로컬 모델이 빠르게 따라붙는다. 모델 우열보다 하네스가 승부를 가르는 국면을 짚는다.