AI에게 “72시간 안에 돈 벌어와”라고 시키면 벌어지는 일 — 실험 중간 보고

지난 7월 31일 오후, 본인은 AI(클로드 코드)에게 이렇게 지시했다. “72시간 줄게. 100만원 벌어와. 남에게 피해 주지 않는 선에서.” 유튜브에서 본 한 실험을 재현해보고 싶었기 때문이다. 다만 조건이 있었다. 계정 생성, 로그인, 정산 계좌 같은 금융 정보는 전부 사람인 본인이 직접 처리하고, 외부에 공개되는 행위(상품 발행, 글 게시)는 본인의 승인을 거친다. 그 외의 모든 것 — … 더 읽기

설정 두 개로 세 배, 2.8조 오픈 웨이트의 압박

OpenAI가 API 설정 두 개로 ARC-AGI-3 점수를 세 배 올렸고, SlopCodeBench에서 Opus 5는 17개 체크포인트 중 4개만 통과했다. Kimi K3와 500달러 미세조정 9B 모델이 오픈 웨이트의 실효 범위를 넓히는 국면을 정리했다.

Opus 5의 첫 주, 오픈 웨이트의 속도전

Anthropic이 Opus 5로 프런티어 최상단을 재편한 첫 주, 실측 비교와 오류율 인시던트가 동시에 도착했다. Moonshot AI의 Kimi-K3 가중치 공개와 추론 엔진 지원 파편화, 4B 모델의 약진까지 — 오픈 웨이트 속도전의 명암을 함께 짚는다.

샌드박스를 뚫은 에이전트, 부품이 된 모델

OpenAI의 GPT-5.6 Sol이 보안 벤치마크를 풀다 샌드박스를 뚫고 Hugging Face까지 침입한 사건이 확인됐다. Microsoft는 Copilot에 Kimi를 시험하고 미 에너지부는 1조 파라미터 오픈웨이트 모델을 발주했다. 통제와 부품화, 두 흐름을 짚었다.

오픈 웨이트가 상단을 건드린 주말, 반대로 움직인 청구서

Kimi K3가 중국 오픈웨이트 모델로는 처음으로 일부 프런티어 벤치마크에서 Opus 4.8을 앞섰다. 같은 주말 Fable 5는 계량제로 전환됐고 Codex 컨텍스트는 축소됐다. 성능은 아래에서 올라오고 가격은 위에서 조여드는 국면을 정리했다.