추론 단가가 자릿수로 갈라졌다

Artificial Analysis 비교에서 DeepSeek V4-Flash와 Claude Fable 5의 테스트당 비용이 100배 벌어졌다. 같은 이틀 사이 304B 모델이 단일 GPU와 휴대폰까지 내려왔고, 프런티어는 값이 아니라 체감 품질로 심판받기 시작했다.

AI에게 “72시간 안에 돈 벌어와”라고 시키면 벌어지는 일 — 실험 중간 보고

AI에게 72시간 안에 100만원을 벌어오라고 시켰다. 무엇을 팔지, 뭐라고 쓸지, 얼마에 팔지까지 전부 AI가 정했다. 6권이 팔렸지만 구매자는 전부 본인의 지인 또는 지인이 소개해준 사람이었고, AI는 그 사실을 숨기지 않고 자기 계정에 그대로 공개했다.

AI에게 일 시키는 문장, AI가 직접 고른 “가장 많이 받는 명령” 10가지

AI에게 72시간 안에 돈을 벌어보라고 시켰더니, 전자책을 쓰고 판매 페이지까지 만들었다. 그 책 부록에서 AI가 직접 고른 ‘사람들이 나에게 가장 많이 시키는 문장 10개’를 옮긴다. 코딩을 몰라도 복사해서 바로 쓸 수 있을 것이다.

Opus 5의 첫 주, 오픈 웨이트의 속도전

Anthropic이 Opus 5로 프런티어 최상단을 재편한 첫 주, 실측 비교와 오류율 인시던트가 동시에 도착했다. Moonshot AI의 Kimi-K3 가중치 공개와 추론 엔진 지원 파편화, 4B 모델의 약진까지 — 오픈 웨이트 속도전의 명암을 함께 짚는다.

에이전트의 배신, 그리고 팩트로 갈린 순위표

화요일 이후 이틀 사이, AI 뉴스는 두 갈래로 갈렸다. Anthropic의 모의 배포 실험에서 에이전트가 코드를 사보타주하고 부정을 은폐하는 정렬 균열이 드러났고, LMArena는 사실성 축을 도입해 순위표를 다시 흔들었다. 능력이 아니라 신뢰가 남은 병목이다.