Opus 5.5·GPT-6 Sol 같은 날 출시, 두 프런티어가 점수 대신 값을 내렸다

Opus 5.5·GPT-6 Sol 같은 날 출시, 두 프런티어가 점수 대신 값을 내렸다

Anthropic의 Opus 5.5와 OpenAI의 GPT-6 Sol·Luna가 같은 날 나왔다. 두 회사가 앞세운 숫자는 점수가 아니라 값과 속도다. 950개 에이전트가 21시간 돌아 새 효소 체계를 찾은 사례와 AGENTS.md를 건너뛰던 Claude Code 버그를 함께 짚는다.

Claude Fable 5.1·Gemini 3.8 Flash Cyber – 사이버 역량이 임계를 넘자 모델이 접근 등급으로 갈렸다

Claude Fable 5.1·Gemini 3.8 Flash Cyber – 사이버 역량이 임계를 넘자 모델이 접근 등급으로 갈렸다

Claude Fable 5.1·Mythos 5.1과 Gemini 3.8 Flash·Flash Cyber가 나왔다. 둘 다 일반판과 검증 조직 전용 사이버판을 한 쌍으로 묶었고 OpenAI Astra도 같은 문법이다. Aisle의 curl CVE 6건이 던진 반문까지 짚는다.

Grok 4.6·DeepSeek V4 Pro 동시 공개 – 벤치마크는 동률, 승부는 추론 단가와 워터마크

Grok 4.6·DeepSeek V4 Pro 동시 공개 – 벤치마크는 동률, 승부는 추론 단가와 워터마크

12일 하루에 Grok 4.6과 DeepSeek V4 Pro 0813이 나란히 나왔지만 두 발표의 방점은 점수 밖에 있다. 사후학습 투자와 초저단가, Anthropic의 전 텍스트 워터마크와 Sonnet 5 가격 영구화까지, 프런티어 승부처가 단가와 신뢰로 옮겨가는 이틀을 정리했다.

DeepSeek V4-Flash와 Claude Fable 5, 테스트당 비용 100배 차이

DeepSeek V4-Flash와 Claude Fable 5, 테스트당 비용 100배 차이

Artificial Analysis 비교에서 DeepSeek V4-Flash와 Claude Fable 5의 테스트당 비용이 100배 벌어졌다. 같은 이틀 사이 304B 모델이 단일 GPU와 휴대폰까지 내려왔고, 프런티어는 값이 아니라 체감 품질로 심판받기 시작했다.

Claude Code에게 ’72시간 안에 100만원’ 시키기 – 전자책 실험 중간 보고

Claude Code에게 ’72시간 안에 100만원’ 시키기 – 전자책 실험 중간 보고

AI에게 72시간 안에 100만원을 벌어오라고 시켰다. 무엇을 팔지, 뭐라고 쓸지, 얼마에 팔지까지 전부 AI가 정했다. 6권이 팔렸지만 구매자는 전부 본인의 지인 또는 지인이 소개해준 사람이었고, AI는 그 사실을 숨기지 않고 자기 계정에 그대로 공개했다.