Claude Cowork 통합·Gemini 3.8 Live 공개, ChatGPT에는 Sponsored Agents가 붙었다

Claude Cowork 통합·Gemini 3.8 Live 공개, ChatGPT에는 Sponsored Agents가 붙었다

화요일 이후 이틀 사이 Claude는 Cowork와 채팅을 하나로 합쳤고, 구글은 음성으로 추론하는 Gemini 3.8 Live를 내놨다. OpenAI는 ChatGPT 광고를 에이전트로 바꾸는 실험에 들어갔다. 에이전트가 들어앉는 자리가 옮겨가고 있다.

GPT-6 Astra·GPT-5.6 Luna 코드 리뷰 대조 – 비용 3.6%로 버그 75%, 하네스 우위는 사라졌다

GPT-6 Astra·GPT-5.6 Luna 코드 리뷰 대조 – 비용 3.6%로 버그 75%, 하네스 우위는 사라졌다

GPT-6 Astra는 실제 PR 50건에서 확인 버그 92개, GPT-5.6 Luna는 69개를 잡았지만 비용은 3.6%였다. 벤더 네이티브 하네스의 평균 우위는 대조 실험에서 사라졌고, 오픈 웨이트 Occamy-1.0은 비용-성능 파레토의 저비용 무릎을 노린다.

OpenAI 나비에-스토크스 88시간 vs Buckmaster·Alpöge 1년 – 증명보다 Codex 세션의 행방이 논쟁이 됐다

OpenAI 나비에-스토크스 88시간 vs Buckmaster·Alpöge 1년 – 증명보다 Codex 세션의 행방이 논쟁이 됐다

OpenAI가 88시간 만에 나비에-스토크스 증명을 냈지만, 1년간 Codex로 같은 문제를 풀던 Buckmaster·Alpöge는 세션 학습 여부에 답을 못 들었다. DeepSeek V4.1 Flash·Mercury 2.5는 단가를, Mistral·Muse는 돈과 에이전트를 움직였다.

GPT-6 Astra 출시 – 같은 모델이 하네스에 따라 ARC-AGI-3 54.8%와 99.9%로 갈렸다

GPT-6 Astra 출시 – 같은 모델이 하네스에 따라 ARC-AGI-3 54.8%와 99.9%로 갈렸다

GPT-6 Astra가 나왔다. 로봇 팔·수능·코드 리뷰 실측이 사흘 만에 쌓였지만, 같은 모델이 하네스에 따라 ARC-AGI-3 54.8%와 99.9%로 갈렸다. Harbor-Index·멀티 하네스 RL·grep 대 LSP 실험까지 하네스가 제품이 된 한 주를 정리한다.

Claude Fable 5.1·Gemini 3.8 Flash Cyber – 사이버 역량이 임계를 넘자 모델이 접근 등급으로 갈렸다

Claude Fable 5.1·Gemini 3.8 Flash Cyber – 사이버 역량이 임계를 넘자 모델이 접근 등급으로 갈렸다

Claude Fable 5.1·Mythos 5.1과 Gemini 3.8 Flash·Flash Cyber가 나왔다. 둘 다 일반판과 검증 조직 전용 사이버판을 한 쌍으로 묶었고 OpenAI Astra도 같은 문법이다. Aisle의 curl CVE 6건이 던진 반문까지 짚는다.