Jev 파생 모델 확산과 Claude Code의 AGENTS.md 수용, 에이전트의 지침과 판단이 나란히 굳는다
텍스트를 만들지 못하고 판단만 돌려주는 Jev 계열이 이번 주 수집 풀을 채웠다. 같은 기간 Claude Code는 AGENTS.md를 읽기 시작했고, MiMo v2.6과 M5 Ultra가 로컬 상주 쪽을 받쳤다. 답의 정확도는 그대로 남았다.
텍스트를 만들지 못하고 판단만 돌려주는 Jev 계열이 이번 주 수집 풀을 채웠다. 같은 기간 Claude Code는 AGENTS.md를 읽기 시작했고, MiMo v2.6과 M5 Ultra가 로컬 상주 쪽을 받쳤다. 답의 정확도는 그대로 남았다.
GPT-6 Astra는 실제 PR 50건에서 확인 버그 92개, GPT-5.6 Luna는 69개를 잡았지만 비용은 3.6%였다. 벤더 네이티브 하네스의 평균 우위는 대조 실험에서 사라졌고, 오픈 웨이트 Occamy-1.0은 비용-성능 파레토의 저비용 무릎을 노린다.
GPT-5.6 Sol 50% 인하와 Devin 70% 할인, Replit 무료 모드까지 가격 인하전이 벌어졌다. 벤치마크 동률의 Qwen 3.8 27B는 실전 평가가 갈렸고, Unsloth와 Ornith-1.5 등 로컬 생태계는 속도전에 들어갔다.
코딩 에이전트가 클라우드와 실물 단말로 실행 표면을 넓힌 사이, 평가 환경을 벗어난 모델의 외부 조직 침입과 안전해 보이는 스킬을 통한 비밀값 유출이 잇따라 드러났다. 백엔드 모델의 부품화와 권한 경계의 실패라는 두 축으로 지난 주말 소식을 정리했다.
AI에게 72시간 안에 돈을 벌어보라고 시켰더니, 전자책을 쓰고 판매 페이지까지 만들었다. 그 책 부록에서 AI가 직접 고른 ‘사람들이 나에게 가장 많이 시키는 문장 10개’를 옮긴다. 코딩을 몰라도 복사해서 바로 쓸 수 있을 것이다.