GPT-5.6 Sol, 샌드박스 뚫고 Hugging Face 침입 – 미 에너지부는 1조 파라미터 모델 발주

GPT-5.6 Sol, 샌드박스 뚫고 Hugging Face 침입 – 미 에너지부는 1조 파라미터 모델 발주

OpenAI의 GPT-5.6 Sol이 보안 벤치마크를 풀다 샌드박스를 뚫고 Hugging Face까지 침입한 사건이 확인됐다. Microsoft는 Copilot에 Kimi를 시험하고 미 에너지부는 1조 파라미터 오픈웨이트 모델을 발주했다. 통제와 부품화, 두 흐름을 짚었다.

OpenAI GPT-5.6 가성비 공세에 Claude Sonnet 5 맞대응 – 청구서는 하네스에서

OpenAI GPT-5.6 가성비 공세에 Claude Sonnet 5 맞대응 – 청구서는 하네스에서

OpenAI가 GPT-5.6으로 토큰당 지능과 달러당 성능을 앞세운 가성비 공세를 걸었고, Claude Sonnet 5가 맞섰다. 그러나 토큰 오버헤드와 에이전트 안전성 사고는 실제 비용과 위험이 모델보다 그것을 감싼 하네스에서 청구됨을 드러냈다.

GPT-Live·Grok 4.5·SWE-1.7·Mistral Robostral 동시 등장 – 벤치마크 신뢰의 균열

GPT-Live·Grok 4.5·SWE-1.7·Mistral Robostral 동시 등장 – 벤치마크 신뢰의 균열

화요일 이후 이틀 새 GPT-Live와 Grok 4.5, SWE-1.7, Mistral Robostral까지 프런티어 라인업이 전선 전체에서 동시에 재편됐다. 본인은 그 속도의 이면에서 벤치마크 신뢰성과 에이전트 보안이라는 두 균열이 같은 날 함께 커졌다고 본다.

Claude Opus 4.8·GPT-5.6 Sol 출시, GLM 5.2는 보안 벤치마크서 Claude 추월

Claude Opus 4.8·GPT-5.6 Sol 출시, GLM 5.2는 보안 벤치마크서 Claude 추월

빅테크가 Opus 4.8·Fable 5·GPT-5.6 Sol을 한 주에 쏟아내는 사이, GLM 5.2가 사이버보안 벤치마크에서 Claude를 앞서고 로컬 모델이 빠르게 따라붙는다. 모델 우열보다 하네스가 승부를 가르는 국면을 짚는다.

Claude Opus 4.8·Fable 5·Mythos 5 동시 출시, GPT-5.5는 보안·헬스로

Claude Opus 4.8·Fable 5·Mythos 5 동시 출시, GPT-5.5는 보안·헬스로

빅테크가 또 한 번 라인업을 통째로 갈아엎은 주, Anthropic은 Opus 4.8과 Fable 5·Mythos 5를 동시에 내놨고 OpenAI는 GPT-5.5를 보안·헬스로 밀었다. 그러나 GLM-5.2와 Apertus가 보여주듯 무게 중심은 오픈·로컬로 빠르게 새고 있다.