GPT-5.6 Sol 50% 인하·Devin 70% 할인, Qwen 3.8 27B 실전 평가는 갈렸다

GPT-5.6 Sol 50% 인하·Devin 70% 할인, Qwen 3.8 27B 실전 평가는 갈렸다

GPT-5.6 Sol 50% 인하와 Devin 70% 할인, Replit 무료 모드까지 가격 인하전이 벌어졌다. 벤치마크 동률의 Qwen 3.8 27B는 실전 평가가 갈렸고, Unsloth와 Ornith-1.5 등 로컬 생태계는 속도전에 들어갔다.

Qwen 3.8 27B가 프런티어와 동률을 맞췄다 — 청구서는 추론 토큰, 시험대는 Claude 워터마크

Qwen 3.8 27B가 프런티어와 동률을 맞췄다 — 청구서는 추론 토큰, 시험대는 Claude 워터마크

지난주 공개된 Qwen 3.8 27B가 Artificial Analysis 벤치마크에서 DeepSeek V4와 동률을 기록했다. 청구서는 16K 추론 토큰이다. Claude 워터마크는 후폭풍과 강건성 실측을, 사이버 모델은 게이트와 오픈 두 경로의 출하를 동시에 겪은 한 주다.

Meta Muse Glimmer 30B·Needle 2·Motif-3 공개 — Docker 샌드박스는 제품화

Meta Muse Glimmer 30B·Needle 2·Motif-3 공개 — Docker 샌드박스는 제품화

Meta의 30B Muse Glimmer부터 14MB Needle 2, 한국 Motif-3까지 로컬 상주 에이전트용 오픈 웨이트 라인업이 채워진 나흘, Docker 샌드박스 제품화와 OpenAI의 Astra 출시 보류로 에이전트 실행의 격벽도 함께 올라갔다.

DeepSeek V4-Flash와 Claude Fable 5, 테스트당 비용 100배 차이

DeepSeek V4-Flash와 Claude Fable 5, 테스트당 비용 100배 차이

Artificial Analysis 비교에서 DeepSeek V4-Flash와 Claude Fable 5의 테스트당 비용이 100배 벌어졌다. 같은 이틀 사이 304B 모델이 단일 GPU와 휴대폰까지 내려왔고, 프런티어는 값이 아니라 체감 품질로 심판받기 시작했다.

MS FastContext 서브에이전트 분화, 3B VibeThinker의 CPU 추론 — EU AI Act 8월 시행

MS FastContext 서브에이전트 분화, 3B VibeThinker의 CPU 추론 — EU AI Act 8월 시행

화요일 이후 흐름은 두 갈래다. MS FastContext가 탐색 서브에이전트로 하네스를 분화시키는 한편 Codex 버그는 SSD 37TB 폭주를 드러냈고, 3B VibeThinker와 CPU 추론이 모델을 가볍게 만드는 사이 EU 워터마킹 규제가 8월 시행을 앞둔다.