Jev 파생 모델 확산과 Claude Code의 AGENTS.md 수용, 에이전트의 지침과 판단이 나란히 굳는다
텍스트를 만들지 못하고 판단만 돌려주는 Jev 계열이 이번 주 수집 풀을 채웠다. 같은 기간 Claude Code는 AGENTS.md를 읽기 시작했고, MiMo v2.6과 M5 Ultra가 로컬 상주 쪽을 받쳤다. 답의 정확도는 그대로 남았다.
텍스트를 만들지 못하고 판단만 돌려주는 Jev 계열이 이번 주 수집 풀을 채웠다. 같은 기간 Claude Code는 AGENTS.md를 읽기 시작했고, MiMo v2.6과 M5 Ultra가 로컬 상주 쪽을 받쳤다. 답의 정확도는 그대로 남았다.
화요일 이후 이틀 사이 Claude는 Cowork와 채팅을 하나로 합쳤고, 구글은 음성으로 추론하는 Gemini 3.8 Live를 내놨다. OpenAI는 ChatGPT 광고를 에이전트로 바꾸는 실험에 들어갔다. 에이전트가 들어앉는 자리가 옮겨가고 있다.
GPT-6 Astra는 실제 PR 50건에서 확인 버그 92개, GPT-5.6 Luna는 69개를 잡았지만 비용은 3.6%였다. 벤더 네이티브 하네스의 평균 우위는 대조 실험에서 사라졌고, 오픈 웨이트 Occamy-1.0은 비용-성능 파레토의 저비용 무릎을 노린다.
OpenAI가 88시간 만에 나비에-스토크스 증명을 냈지만, 1년간 Codex로 같은 문제를 풀던 Buckmaster·Alpöge는 세션 학습 여부에 답을 못 들었다. DeepSeek V4.1 Flash·Mercury 2.5는 단가를, Mistral·Muse는 돈과 에이전트를 움직였다.
GPT-6 Astra가 나왔다. 로봇 팔·수능·코드 리뷰 실측이 사흘 만에 쌓였지만, 같은 모델이 하네스에 따라 ARC-AGI-3 54.8%와 99.9%로 갈렸다. Harbor-Index·멀티 하네스 RL·grep 대 LSP 실험까지 하네스가 제품이 된 한 주를 정리한다.