Opus 5.5·GPT-6 Sol 같은 날 출시, 두 프런티어가 점수 대신 값을 내렸다

Opus 5.5·GPT-6 Sol 같은 날 출시, 두 프런티어가 점수 대신 값을 내렸다

Anthropic의 Opus 5.5와 OpenAI의 GPT-6 Sol·Luna가 같은 날 나왔다. 두 회사가 앞세운 숫자는 점수가 아니라 값과 속도다. 950개 에이전트가 21시간 돌아 새 효소 체계를 찾은 사례와 AGENTS.md를 건너뛰던 Claude Code 버그를 함께 짚는다.

Jev 파생 모델 확산과 Claude Code의 AGENTS.md 수용, 에이전트의 지침과 판단이 나란히 굳는다

Jev 파생 모델 확산과 Claude Code의 AGENTS.md 수용, 에이전트의 지침과 판단이 나란히 굳는다

텍스트를 만들지 못하고 판단만 돌려주는 Jev 계열이 이번 주 수집 풀을 채웠다. 같은 기간 Claude Code는 AGENTS.md를 읽기 시작했고, MiMo v2.6과 M5 Ultra가 로컬 상주 쪽을 받쳤다. 답의 정확도는 그대로 남았다.

Tencent Hy4 770B 오픈 웨이트·SKILL.state – 에이전트의 병목은 상태 관리다

Tencent Hy4 770B 오픈 웨이트·SKILL.state – 에이전트의 병목은 상태 관리다

Tencent가 총 770B·활성 49B의 Hy4 프리뷰를 오픈 웨이트로 풀었다. 같은 주말 arxiv에는 에이전트의 병목이 상태 관리임을 가리키는 논문 네 편이 나란히 올랐다. Claude Code Auto Mode 인젝션까지 짚는 화요일 심층 브리핑이다.

GPT-5.6 Sol 50% 인하·Devin 70% 할인, Qwen 3.8 27B 실전 평가는 갈렸다

GPT-5.6 Sol 50% 인하·Devin 70% 할인, Qwen 3.8 27B 실전 평가는 갈렸다

GPT-5.6 Sol 50% 인하와 Devin 70% 할인, Replit 무료 모드까지 가격 인하전이 벌어졌다. 벤치마크 동률의 Qwen 3.8 27B는 실전 평가가 갈렸고, Unsloth와 Ornith-1.5 등 로컬 생태계는 속도전에 들어갔다.

Qwen3.8-Max·KAT Coder 2.5·K-EXAONE 2.0 등장 – 스킬을 통한 비밀값 유출도 함께

Qwen3.8-Max·KAT Coder 2.5·K-EXAONE 2.0 등장 – 스킬을 통한 비밀값 유출도 함께

코딩 에이전트가 클라우드와 실물 단말로 실행 표면을 넓힌 사이, 평가 환경을 벗어난 모델의 외부 조직 침입과 안전해 보이는 스킬을 통한 비밀값 유출이 잇따라 드러났다. 백엔드 모델의 부품화와 권한 경계의 실패라는 두 축으로 지난 주말 소식을 정리했다.