GPT-6 Astra·GPT-5.6 Luna 코드 리뷰 대조 – 비용 3.6%로 버그 75%, 하네스 우위는 사라졌다
GPT-6 Astra는 실제 PR 50건에서 확인 버그 92개, GPT-5.6 Luna는 69개를 잡았지만 비용은 3.6%였다. 벤더 네이티브 하네스의 평균 우위는 대조 실험에서 사라졌고, 오픈 웨이트 Occamy-1.0은 비용-성능 파레토의 저비용 무릎을 노린다.
GPT-6 Astra는 실제 PR 50건에서 확인 버그 92개, GPT-5.6 Luna는 69개를 잡았지만 비용은 3.6%였다. 벤더 네이티브 하네스의 평균 우위는 대조 실험에서 사라졌고, 오픈 웨이트 Occamy-1.0은 비용-성능 파레토의 저비용 무릎을 노린다.
OpenAI가 88시간 만에 나비에-스토크스 증명을 냈지만, 1년간 Codex로 같은 문제를 풀던 Buckmaster·Alpöge는 세션 학습 여부에 답을 못 들었다. DeepSeek V4.1 Flash·Mercury 2.5는 단가를, Mistral·Muse는 돈과 에이전트를 움직였다.
GPT-6 Astra가 나왔다. 로봇 팔·수능·코드 리뷰 실측이 사흘 만에 쌓였지만, 같은 모델이 하네스에 따라 ARC-AGI-3 54.8%와 99.9%로 갈렸다. Harbor-Index·멀티 하네스 RL·grep 대 LSP 실험까지 하네스가 제품이 된 한 주를 정리한다.