GPT-6 Astra·GPT-5.6 Luna 코드 리뷰 대조 – 비용 3.6%로 버그 75%, 하네스 우위는 사라졌다

GPT-6 Astra·GPT-5.6 Luna 코드 리뷰 대조 – 비용 3.6%로 버그 75%, 하네스 우위는 사라졌다

GPT-6 Astra는 실제 PR 50건에서 확인 버그 92개, GPT-5.6 Luna는 69개를 잡았지만 비용은 3.6%였다. 벤더 네이티브 하네스의 평균 우위는 대조 실험에서 사라졌고, 오픈 웨이트 Occamy-1.0은 비용-성능 파레토의 저비용 무릎을 노린다.

GPT-6 Astra 출시 – 같은 모델이 하네스에 따라 ARC-AGI-3 54.8%와 99.9%로 갈렸다

GPT-6 Astra 출시 – 같은 모델이 하네스에 따라 ARC-AGI-3 54.8%와 99.9%로 갈렸다

GPT-6 Astra가 나왔다. 로봇 팔·수능·코드 리뷰 실측이 사흘 만에 쌓였지만, 같은 모델이 하네스에 따라 ARC-AGI-3 54.8%와 99.9%로 갈렸다. Harbor-Index·멀티 하네스 RL·grep 대 LSP 실험까지 하네스가 제품이 된 한 주를 정리한다.

Tencent Hy4 770B 오픈 웨이트·SKILL.state – 에이전트의 병목은 상태 관리다

Tencent Hy4 770B 오픈 웨이트·SKILL.state – 에이전트의 병목은 상태 관리다

Tencent가 총 770B·활성 49B의 Hy4 프리뷰를 오픈 웨이트로 풀었다. 같은 주말 arxiv에는 에이전트의 병목이 상태 관리임을 가리키는 논문 네 편이 나란히 올랐다. Claude Code Auto Mode 인젝션까지 짚는 화요일 심층 브리핑이다.

Ox Alpha 익명 등판·GLM-5.3 5분의 1 비용 – 오픈 웨이트가 프런티어 단가를 흔든다

Ox Alpha 익명 등판·GLM-5.3 5분의 1 비용 – 오픈 웨이트가 프런티어 단가를 흔든다

익명 모델 Ox Alpha가 1M 컨텍스트로 무료 등판하고, GLM-5.3 오픈 웨이트는 5분의 1 비용으로 프런티어를 제쳤다. ARC-AGI-3에서 하네스만 바꿔 13%에서 100%로 뛴 실측까지 – 점수와 단가의 주인이 바뀌고 있다.

DeepSeek V4-Flash와 Claude Fable 5, 테스트당 비용 100배 차이

DeepSeek V4-Flash와 Claude Fable 5, 테스트당 비용 100배 차이

Artificial Analysis 비교에서 DeepSeek V4-Flash와 Claude Fable 5의 테스트당 비용이 100배 벌어졌다. 같은 이틀 사이 304B 모델이 단일 GPU와 휴대폰까지 내려왔고, 프런티어는 값이 아니라 체감 품질로 심판받기 시작했다.