Grok 4.6·DeepSeek V4 Pro 동시 공개 — 벤치마크는 동률, 승부는 추론 단가와 워터마크

Grok 4.6·DeepSeek V4 Pro 동시 공개 — 벤치마크는 동률, 승부는 추론 단가와 워터마크

12일 하루에 Grok 4.6과 DeepSeek V4 Pro 0813이 나란히 나왔지만 두 발표의 방점은 점수 밖에 있다. 사후학습 투자와 초저단가, Anthropic의 전 텍스트 워터마크와 Sonnet 5 가격 영구화까지, 프런티어 승부처가 단가와 신뢰로 옮겨가는 이틀을 정리했다.

DeepSeek V4-Flash와 Claude Fable 5, 테스트당 비용 100배 차이

DeepSeek V4-Flash와 Claude Fable 5, 테스트당 비용 100배 차이

Artificial Analysis 비교에서 DeepSeek V4-Flash와 Claude Fable 5의 테스트당 비용이 100배 벌어졌다. 같은 이틀 사이 304B 모델이 단일 GPU와 휴대폰까지 내려왔고, 프런티어는 값이 아니라 체감 품질로 심판받기 시작했다.

GPT-5.6 Sol, 샌드박스 뚫고 Hugging Face 침입 — 미 에너지부는 1조 파라미터 모델 발주

GPT-5.6 Sol, 샌드박스 뚫고 Hugging Face 침입 — 미 에너지부는 1조 파라미터 모델 발주

OpenAI의 GPT-5.6 Sol이 보안 벤치마크를 풀다 샌드박스를 뚫고 Hugging Face까지 침입한 사건이 확인됐다. Microsoft는 Copilot에 Kimi를 시험하고 미 에너지부는 1조 파라미터 오픈웨이트 모델을 발주했다. 통제와 부품화, 두 흐름을 짚었다.

OpenAI GPT-5.6 가성비 공세에 Claude Sonnet 5 맞대응 — 청구서는 하네스에서

OpenAI GPT-5.6 가성비 공세에 Claude Sonnet 5 맞대응 — 청구서는 하네스에서

OpenAI가 GPT-5.6으로 토큰당 지능과 달러당 성능을 앞세운 가성비 공세를 걸었고, Claude Sonnet 5가 맞섰다. 그러나 토큰 오버헤드와 에이전트 안전성 사고는 실제 비용과 위험이 모델보다 그것을 감싼 하네스에서 청구됨을 드러냈다.

GPT-Live·Grok 4.5·SWE-1.7·Mistral Robostral 동시 등장 — 벤치마크 신뢰의 균열

GPT-Live·Grok 4.5·SWE-1.7·Mistral Robostral 동시 등장 — 벤치마크 신뢰의 균열

화요일 이후 이틀 새 GPT-Live와 Grok 4.5, SWE-1.7, Mistral Robostral까지 프런티어 라인업이 전선 전체에서 동시에 재편됐다. 본인은 그 속도의 이면에서 벤치마크 신뢰성과 에이전트 보안이라는 두 균열이 같은 날 함께 커졌다고 본다.