GPT-6 Astra·GPT-5.6 Luna 코드 리뷰 대조 – 비용 3.6%로 버그 75%, 하네스 우위는 사라졌다

GPT-6 Astra·GPT-5.6 Luna 코드 리뷰 대조 – 비용 3.6%로 버그 75%, 하네스 우위는 사라졌다

GPT-6 Astra는 실제 PR 50건에서 확인 버그 92개, GPT-5.6 Luna는 69개를 잡았지만 비용은 3.6%였다. 벤더 네이티브 하네스의 평균 우위는 대조 실험에서 사라졌고, 오픈 웨이트 Occamy-1.0은 비용-성능 파레토의 저비용 무릎을 노린다.

GPT-6 Astra 출시 – 같은 모델이 하네스에 따라 ARC-AGI-3 54.8%와 99.9%로 갈렸다

GPT-6 Astra 출시 – 같은 모델이 하네스에 따라 ARC-AGI-3 54.8%와 99.9%로 갈렸다

GPT-6 Astra가 나왔다. 로봇 팔·수능·코드 리뷰 실측이 사흘 만에 쌓였지만, 같은 모델이 하네스에 따라 ARC-AGI-3 54.8%와 99.9%로 갈렸다. Harbor-Index·멀티 하네스 RL·grep 대 LSP 실험까지 하네스가 제품이 된 한 주를 정리한다.

Claude Fable 5.1·Gemini 3.8 Flash Cyber – 사이버 역량이 임계를 넘자 모델이 접근 등급으로 갈렸다

Claude Fable 5.1·Gemini 3.8 Flash Cyber – 사이버 역량이 임계를 넘자 모델이 접근 등급으로 갈렸다

Claude Fable 5.1·Mythos 5.1과 Gemini 3.8 Flash·Flash Cyber가 나왔다. 둘 다 일반판과 검증 조직 전용 사이버판을 한 쌍으로 묶었고 OpenAI Astra도 같은 문법이다. Aisle의 curl CVE 6건이 던진 반문까지 짚는다.

Tencent Hy4 770B 오픈 웨이트·SKILL.state – 에이전트의 병목은 상태 관리다

Tencent Hy4 770B 오픈 웨이트·SKILL.state – 에이전트의 병목은 상태 관리다

Tencent가 총 770B·활성 49B의 Hy4 프리뷰를 오픈 웨이트로 풀었다. 같은 주말 arxiv에는 에이전트의 병목이 상태 관리임을 가리키는 논문 네 편이 나란히 올랐다. Claude Code Auto Mode 인젝션까지 짚는 화요일 심층 브리핑이다.

GLM-5.3-Flash·Qwen3.8-Flash-Next 동시 공개 – Ox Alpha 정체는 GLM이었다

GLM-5.3-Flash·Qwen3.8-Flash-Next 동시 공개 – Ox Alpha 정체는 GLM이었다

익명 모델 Ox Alpha가 Z.ai의 GLM-5.3-Flash로 확인되며 가중치까지 풀렸고, 같은 날 알리바바는 Qwen4 아키텍처를 선공개한 Qwen3.8-Flash-Next를 내놨다. 하루에 도착한 두 flash급 오픈 웨이트가 프런티어 단가의 하한선을 다시 끌어내리고 있다.