GPT-6 Astra 출시 – 같은 모델이 하네스에 따라 ARC-AGI-3 54.8%와 99.9%로 갈렸다

오늘의 흐름 정리

지난 목요일 저녁 OpenAI가 GPT-6 Astra를 공개했고, 주말 사이 로봇 팔·수능·코드 리뷰 실측이 잇달아 올라왔다. 그런데 가장 많이 돌아다닌 숫자는 같은 Astra가 하네스에 따라 ARC-AGI-3에서 54.8%와 99.9%로 갈렸다는 대조표였다. 본인은 이번 주를 두 축으로 읽는다. Astra가 실제 작업에서 무엇을 얼마에 해냈는가, 그리고 그 성적이 모델 혼자의 것이 아니라는 증거다.

GPT-6 Astra – 값은 그대로, 컨텍스트만 100만 토큰으로

OpenAI는 Astra를 컴퓨터 사용·코딩·사이버보안·과학 전반에서 SOTA를 표방하는 최상위 모델로 소개했고 공개 당일부터 API로 열었다. 가격은 입력 100만 토큰당 10달러·출력 50달러로 전 세대와 같은 자리이고, 컨텍스트는 105만 토큰에 캐시 읽기 1달러다.

로봇 팔·수능·코드 리뷰 – 사흘 만에 쌓인 실측 세 건

Robocurve의 양팔 로봇 실험에서 Astra는 블록을 그릇에 넣는 작업을 20회 중 19회 성공해 Claude Fable 5.1의 8회를 크게 앞섰고, 회당 시간은 6.8분에서 2.5분, 호출 비용은 2.12달러에서 0.94달러로 줄었다. 다만 퍼즐 조각을 홈에 끼우는 과제는 두 모델 모두 20회 중 2회에 그쳤다.

수능 평가에서는 Astra가 처음으로 종합 450점 만점을 기록했는데, 과목 전체를 한 번에 넣는 고난도 모드에서는 448.5점으로 GPT-5.6 Sol Pro와 같았다. 코드 리뷰는 CodeRabbit이 실행 가능한 버그 커버리지를 재서 Astra 61.3%, GPT-5.6 Sol 59.0%, Opus 5 50.2%를 얻었지만 리뷰 한 건 비용은 Sol의 2.5배인 1.50달러였다. 우위는 확실하지만 과제가 어려워질수록 좁아지고, 그 우위를 사는 값은 그대로다.

하네스가 곧 제품 – 같은 Astra, 54.8%와 99.9%

이번 주 가장 중요한 표는 ARC-AGI-3의 동일한 High 추론 설정에서 나왔다. 표준 하네스는 54.8%에 비용 40,705달러, OpenAI Provider Adapter 하네스는 99.9%에 18,817달러였다. ARC Prize도 ARC-AGI-3 포화가 AGI의 증거는 아니라고 선을 그었고, 도입 검토는 실제 작업 20~50개로 하라는 권고가 붙었다.

학계도 같은 방향이다. Harbor Adapters는 80개 넘는 에이전트 벤치마크를 하나의 인프라로 옮겨 8개 모델을 54개 벤치마크에서 돌렸고, 82개 고난도 과제로 추린 Harbor-Index에서는 최고가 Codex를 붙인 GPT-5.5의 28.0%로 어떤 조합도 30%를 넘지 못했다. 더 직접적인 수치는 멀티 하네스 RL 논문에서 나왔는데, Qwen3-8B를 네 하네스 기록으로 학습시켜 2만 4,000회 평가를 돌리자 평가 하네스가 평균 해결률을 2.14%에서 9.27%로 4.3배 움직인 반면 학습 레시피는 1.16배에 그쳤다.

grep이 LSP를 이긴다 – 도구는 루프 안에서만 평가된다

하네스를 잘 짓는다는 것이 도구를 많이 주는 일은 아니다. Claude 모델 3종에 LSP 기반 탐색 도구를 줘도 코드 위치 찾기에서 의미 기반 도구를 부른 비중은 Opus 0%·Sonnet 4%·Haiku 6%였고, LSP를 먼저 쓰도록 강제하자 성공률이 100%에서 89%로 떨어졌다. 이름 변경에서는 grep이 첫 시도 성공률 100%에 토큰 2,451개였고, 코드를 함께 돌려주는 LSP가 83%에 3,336개로 뒤를 이었다. 검증 쪽도 비슷하다. danluu가 Codex와 GPT-5.6 Sol로 26가지 지시 조건을 돌려 보니 아무 지시도 없는 기본 조건이 평균을 크게 웃돌았고 모델이 스스로 추천한 기법은 오히려 더 나빴다. 결과를 바로 쓸 수 있는 도구가 정교한 도구를 이기고, 잘못 얹은 절차는 없느니만 못하다.

deer-flow·ruflo·HookPry – 하네스가 열리자 공격면도 열렸다

바이트댄스는 샌드박스·메모리·툴·스킬·서브에이전트를 묶어 수시간짜리 작업을 처리하는 장기 실행 하네스 deer-flow를 공개했고, ruflo는 Claude Code·Codex와 네이티브로 붙는 멀티 에이전트 스웜용 메타 하네스를 표방한다. Yandex 연구진은 모델과 하네스 사이의 빈 층으로 KV 캐시 자체를 실행 상태로 다루는 접근을 내놨고, 추가 학습 없이 Qwen 멀티모달 모델이 DOOM을 실시간으로 플레이하는 데모를 붙였다.

열린 만큼 뚫린다. HookPry 논문은 하네스의 생명주기 훅 갱신 경로를 공격면으로 지목해 플러그인 메타데이터만 쥔 공격자가 7개 하네스를 전부 뚫었고, 하네스별 성공률은 최대 92.5%, Microsoft Defender의 탐지율은 0%였다. 하네스가 제품이라면 하네스의 공급망도 제품의 공급망이다.

한 줄 정리

GPT-6 Astra는 로봇 팔·수능·코드 리뷰에서 앞섰지만, 같은 모델이 하네스 하나로 54.8%와 99.9%로 갈린 순간 점수표의 주인은 모델에서 시스템으로 옮겨갔다. 본인은 앞으로의 모델 비교는 어느 하네스에서 쟀는지를 먼저 적지 않으면 읽을 수 없게 됐다고 본다.

조회수: 0

댓글 남기기