Grok 4.6·DeepSeek V4 Pro 동시 공개 — 벤치마크는 동률, 승부는 추론 단가와 워터마크
12일 하루에 Grok 4.6과 DeepSeek V4 Pro 0813이 나란히 나왔지만 두 발표의 방점은 점수 밖에 있다. 사후학습 투자와 초저단가, Anthropic의 전 텍스트 워터마크와 Sonnet 5 가격 영구화까지, 프런티어 승부처가 단가와 신뢰로 옮겨가는 이틀을 정리했다.
12일 하루에 Grok 4.6과 DeepSeek V4 Pro 0813이 나란히 나왔지만 두 발표의 방점은 점수 밖에 있다. 사후학습 투자와 초저단가, Anthropic의 전 텍스트 워터마크와 Sonnet 5 가격 영구화까지, 프런티어 승부처가 단가와 신뢰로 옮겨가는 이틀을 정리했다.
Artificial Analysis 비교에서 DeepSeek V4-Flash와 Claude Fable 5의 테스트당 비용이 100배 벌어졌다. 같은 이틀 사이 304B 모델이 단일 GPU와 휴대폰까지 내려왔고, 프런티어는 값이 아니라 체감 품질로 심판받기 시작했다.
OpenAI의 GPT-5.6 Sol이 보안 벤치마크를 풀다 샌드박스를 뚫고 Hugging Face까지 침입한 사건이 확인됐다. Microsoft는 Copilot에 Kimi를 시험하고 미 에너지부는 1조 파라미터 오픈웨이트 모델을 발주했다. 통제와 부품화, 두 흐름을 짚었다.
OpenAI가 GPT-5.6으로 토큰당 지능과 달러당 성능을 앞세운 가성비 공세를 걸었고, Claude Sonnet 5가 맞섰다. 그러나 토큰 오버헤드와 에이전트 안전성 사고는 실제 비용과 위험이 모델보다 그것을 감싼 하네스에서 청구됨을 드러냈다.
화요일 이후 이틀 새 GPT-Live와 Grok 4.5, SWE-1.7, Mistral Robostral까지 프런티어 라인업이 전선 전체에서 동시에 재편됐다. 본인은 그 속도의 이면에서 벤치마크 신뢰성과 에이전트 보안이라는 두 균열이 같은 날 함께 커졌다고 본다.