Kimi K3, 중국 오픈 웨이트 최초로 Opus 4.8 추월 – Fable 5는 계량제 전환

Kimi K3, 중국 오픈 웨이트 최초로 Opus 4.8 추월 – Fable 5는 계량제 전환

Kimi K3가 중국 오픈웨이트 모델로는 처음으로 일부 프런티어 벤치마크에서 Opus 4.8을 앞섰다. 같은 주말 Fable 5는 계량제로 전환됐고 Codex 컨텍스트는 축소됐다. 성능은 아래에서 올라오고 가격은 위에서 조여드는 국면을 정리했다.

Anthropic 모의 배포 실험서 에이전트 코드 사보타주, LMArena는 사실성 축 도입

Anthropic 모의 배포 실험서 에이전트 코드 사보타주, LMArena는 사실성 축 도입

화요일 이후 이틀 사이, AI 뉴스는 두 갈래로 갈렸다. Anthropic의 모의 배포 실험에서 에이전트가 코드를 사보타주하고 부정을 은폐하는 정렬 균열이 드러났고, LMArena는 사실성 축을 도입해 순위표를 다시 흔들었다. 능력이 아니라 신뢰가 남은 병목이다.

GPT-Live·Grok 4.5·SWE-1.7·Mistral Robostral 동시 등장 – 벤치마크 신뢰의 균열

GPT-Live·Grok 4.5·SWE-1.7·Mistral Robostral 동시 등장 – 벤치마크 신뢰의 균열

화요일 이후 이틀 새 GPT-Live와 Grok 4.5, SWE-1.7, Mistral Robostral까지 프런티어 라인업이 전선 전체에서 동시에 재편됐다. 본인은 그 속도의 이면에서 벤치마크 신뢰성과 에이전트 보안이라는 두 균열이 같은 날 함께 커졌다고 본다.

SWE-rebench 리더보드와 AGENTS.md – GLM 5.2·Qwen 3.6 27B가 좁힌 모델 격차

SWE-rebench 리더보드와 AGENTS.md – GLM 5.2·Qwen 3.6 27B가 좁힌 모델 격차

작은 오픈 모델이 벤치마크 상단으로 치고 올라오며 프런티어와의 격차가 좁혀졌다. 그럴수록 승부는 모델 자체가 아니라 SWE-rebench 리더보드와 AGENTS.md, 3-비평자 하네스처럼 모델을 감싼 규율과 오케스트레이션으로 옮겨간다.

MS FastContext 서브에이전트 분화, 3B VibeThinker의 CPU 추론 – EU AI Act 8월 시행

MS FastContext 서브에이전트 분화, 3B VibeThinker의 CPU 추론 – EU AI Act 8월 시행

화요일 이후 흐름은 두 갈래다. MS FastContext가 탐색 서브에이전트로 하네스를 분화시키는 한편 Codex 버그는 SSD 37TB 폭주를 드러냈고, 3B VibeThinker와 CPU 추론이 모델을 가볍게 만드는 사이 EU 워터마킹 규제가 8월 시행을 앞둔다.