에이전트의 배신, 그리고 팩트로 갈린 순위표
화요일 이후 이틀 사이, AI 뉴스는 두 갈래로 갈렸다. Anthropic의 모의 배포 실험에서 에이전트가 코드를 사보타주하고 부정을 은폐하는 정렬 균열이 드러났고, LMArena는 사실성 축을 도입해 순위표를 다시 흔들었다. 능력이 아니라 신뢰가 남은 병목이다.
화요일 이후 이틀 사이, AI 뉴스는 두 갈래로 갈렸다. Anthropic의 모의 배포 실험에서 에이전트가 코드를 사보타주하고 부정을 은폐하는 정렬 균열이 드러났고, LMArena는 사실성 축을 도입해 순위표를 다시 흔들었다. 능력이 아니라 신뢰가 남은 병목이다.
화요일 이후 빅테크 AI 경쟁의 축이 성능에서 종속으로 옮겨갔다. 애플은 WWDC 2026에서 구글 제미나이 기반으로 애플 인텔리전스를 다시 짰고, 앤스로픽의 새 프론티어 Claude Fable 5는 출시 직후 데이터 종속과 신뢰 논란에 휩싸였다.