GPT-Live·Grok 4.5·SWE-1.7·Mistral Robostral 동시 등장 — 벤치마크 신뢰의 균열

GPT-Live·Grok 4.5·SWE-1.7·Mistral Robostral 동시 등장 — 벤치마크 신뢰의 균열

화요일 이후 이틀 새 GPT-Live와 Grok 4.5, SWE-1.7, Mistral Robostral까지 프런티어 라인업이 전선 전체에서 동시에 재편됐다. 본인은 그 속도의 이면에서 벤치마크 신뢰성과 에이전트 보안이라는 두 균열이 같은 날 함께 커졌다고 본다.

Anthropic, Claude Sonnet 5·Claude Tag·Claude Science 공개 — 벤치마크 회의론도 함께

Anthropic, Claude Sonnet 5·Claude Tag·Claude Science 공개 — 벤치마크 회의론도 함께

Anthropic이 Sonnet 5·Claude Tag·Claude Science로 제품 표면을 넓히자 셀프호스팅 오픈소스 대안이 곧장 따라붙었고, 같은 주 벤치마크 회의론과 최신 모델의 도구 역행 사례는 쏟아지는 성능을 대체 무엇으로 검증하고 신뢰할지를 되물었다.

SWE-rebench 리더보드와 AGENTS.md — GLM 5.2·Qwen 3.6 27B가 좁힌 모델 격차

SWE-rebench 리더보드와 AGENTS.md — GLM 5.2·Qwen 3.6 27B가 좁힌 모델 격차

작은 오픈 모델이 벤치마크 상단으로 치고 올라오며 프런티어와의 격차가 좁혀졌다. 그럴수록 승부는 모델 자체가 아니라 SWE-rebench 리더보드와 AGENTS.md, 3-비평자 하네스처럼 모델을 감싼 규율과 오케스트레이션으로 옮겨간다.

Claude Opus 4.8·GPT-5.6 Sol 출시, GLM 5.2는 보안 벤치마크서 Claude 추월

Claude Opus 4.8·GPT-5.6 Sol 출시, GLM 5.2는 보안 벤치마크서 Claude 추월

빅테크가 Opus 4.8·Fable 5·GPT-5.6 Sol을 한 주에 쏟아내는 사이, GLM 5.2가 사이버보안 벤치마크에서 Claude를 앞서고 로컬 모델이 빠르게 따라붙는다. 모델 우열보다 하네스가 승부를 가르는 국면을 짚는다.

MS FastContext 서브에이전트 분화, 3B VibeThinker의 CPU 추론 — EU AI Act 8월 시행

MS FastContext 서브에이전트 분화, 3B VibeThinker의 CPU 추론 — EU AI Act 8월 시행

화요일 이후 흐름은 두 갈래다. MS FastContext가 탐색 서브에이전트로 하네스를 분화시키는 한편 Codex 버그는 SSD 37TB 폭주를 드러냈고, 3B VibeThinker와 CPU 추론이 모델을 가볍게 만드는 사이 EU 워터마킹 규제가 8월 시행을 앞둔다.