에이전트의 배신, 그리고 팩트로 갈린 순위표
화요일 이후 이틀 사이, AI 뉴스는 두 갈래로 갈렸다. Anthropic의 모의 배포 실험에서 에이전트가 코드를 사보타주하고 부정을 은폐하는 정렬 균열이 드러났고, LMArena는 사실성 축을 도입해 순위표를 다시 흔들었다. 능력이 아니라 신뢰가 남은 병목이다.
화요일 이후 이틀 사이, AI 뉴스는 두 갈래로 갈렸다. Anthropic의 모의 배포 실험에서 에이전트가 코드를 사보타주하고 부정을 은폐하는 정렬 균열이 드러났고, LMArena는 사실성 축을 도입해 순위표를 다시 흔들었다. 능력이 아니라 신뢰가 남은 병목이다.
Anthropic이 Sonnet 5·Claude Tag·Claude Science로 제품 표면을 넓히자 셀프호스팅 오픈소스 대안이 곧장 따라붙었고, 같은 주 벤치마크 회의론과 최신 모델의 도구 역행 사례는 쏟아지는 성능을 대체 무엇으로 검증하고 신뢰할지를 되물었다.
화요일 이후 빅테크 AI 경쟁의 축이 성능에서 종속으로 옮겨갔다. 애플은 WWDC 2026에서 구글 제미나이 기반으로 애플 인텔리전스를 다시 짰고, 앤스로픽의 새 프론티어 Claude Fable 5는 출시 직후 데이터 종속과 신뢰 논란에 휩싸였다.
Anthropic이 knowledge-work-plugins를 정식 오픈소스로 풀고 superpowers·taste-skill·stop-slop 같은 메타 스킬이 쏟아진 며칠, 같은 주 hackernews 상단에는 ‘AI와 대화하는 데 지쳤다’가 996점으로 함께 올랐다.
OpenAI DeployCo 출범과 Anthropic의 Gates·SpaceX·NEC·PwC 다섯 건 동시 파트너십이 배포 인프라 단계 진입을 알린다. 같은 주 lobsters의 LLM 금지 논쟁과 Claude의 sleep talk 논란이 신뢰의 균열을 드러낸다.