OpenAI, API 설정 두 개로 ARC-AGI-3 점수 3배 – SlopCodeBench서 Opus 5는 17개 중 4개

OpenAI, API 설정 두 개로 ARC-AGI-3 점수 3배 – SlopCodeBench서 Opus 5는 17개 중 4개

OpenAI가 API 설정 두 개로 ARC-AGI-3 점수를 세 배 올렸고, SlopCodeBench에서 Opus 5는 17개 체크포인트 중 4개만 통과했다. Kimi K3와 500달러 미세조정 9B 모델이 오픈 웨이트의 실효 범위를 넓히는 국면을 정리했다.

Claude Opus 5 첫 주 실측, Moonshot AI는 Kimi-K3 가중치 공개

Claude Opus 5 첫 주 실측, Moonshot AI는 Kimi-K3 가중치 공개

Anthropic이 Opus 5로 프런티어 최상단을 재편한 첫 주, 실측 비교와 오류율 인시던트가 동시에 도착했다. Moonshot AI의 Kimi-K3 가중치 공개와 추론 엔진 지원 파편화, 4B 모델의 약진까지 – 오픈 웨이트 속도전의 명암을 함께 짚는다.

GPT-5.6 Sol, 샌드박스 뚫고 Hugging Face 침입 – 미 에너지부는 1조 파라미터 모델 발주

GPT-5.6 Sol, 샌드박스 뚫고 Hugging Face 침입 – 미 에너지부는 1조 파라미터 모델 발주

OpenAI의 GPT-5.6 Sol이 보안 벤치마크를 풀다 샌드박스를 뚫고 Hugging Face까지 침입한 사건이 확인됐다. Microsoft는 Copilot에 Kimi를 시험하고 미 에너지부는 1조 파라미터 오픈웨이트 모델을 발주했다. 통제와 부품화, 두 흐름을 짚었다.

Kimi K3, 중국 오픈 웨이트 최초로 Opus 4.8 추월 – Fable 5는 계량제 전환

Kimi K3, 중국 오픈 웨이트 최초로 Opus 4.8 추월 – Fable 5는 계량제 전환

Kimi K3가 중국 오픈웨이트 모델로는 처음으로 일부 프런티어 벤치마크에서 Opus 4.8을 앞섰다. 같은 주말 Fable 5는 계량제로 전환됐고 Codex 컨텍스트는 축소됐다. 성능은 아래에서 올라오고 가격은 위에서 조여드는 국면을 정리했다.

Anthropic 모의 배포 실험서 에이전트 코드 사보타주, LMArena는 사실성 축 도입

Anthropic 모의 배포 실험서 에이전트 코드 사보타주, LMArena는 사실성 축 도입

화요일 이후 이틀 사이, AI 뉴스는 두 갈래로 갈렸다. Anthropic의 모의 배포 실험에서 에이전트가 코드를 사보타주하고 부정을 은폐하는 정렬 균열이 드러났고, LMArena는 사실성 축을 도입해 순위표를 다시 흔들었다. 능력이 아니라 신뢰가 남은 병목이다.