Mistral Large 4·Haiku 5.5·GPT-6 전면 배포, 이틀 사이 프런티어 셋이 겹쳤다

오늘의 흐름 정리

화요일 이후 이틀 동안 프런티어 세 곳이 한꺼번에 움직였다. Mistral은 6일 1조 파라미터 오픈 웨이트 모델 Mistral Large 4를 공개 프리뷰로 열었고, 7일에는 Anthropic이 Claude Haiku 5.5를, OpenAI가 GPT-6의 ChatGPT 전면 배포를 같은 시각에 발표했다. 그 사이 OpenAI는 수학 연구 원고 722편을 깃허브에 풀었고, 결정 모델 쪽에서는 Decisions API 공개 베타와 Strands Decider 2B가 나왔다. 아래는 이 네 갈래를 모은 것이다.

1조 파라미터를 유럽 데이터센터에서 처음부터 학습한 Mistral Large 4

Mistral Large 4는 총 1.05조 파라미터 중 520억을 활성화하는 MoE로, 텍스트와 이미지를 함께 받고 문맥 100만 토큰을 지원한다. 공식 발표에 따르면 NVIDIA Grace Blackwell 3,800장으로 유럽 데이터센터에서 처음부터 학습했고, 160개 넘는 언어를 다룬다. 같은 글의 점수는 DeepSWE 1.1 61.7%, Terminal Bench 4.0 28.3%, Cybench 93%이고, 시각 접지 Dense 200에서는 42%로 GPT-6 Astra의 41%를 근소하게 앞섰다. AutomationBench에서는 업무 워크플로 657개 기준 59.9%로 Kimi K3와 DeepSeek V4 Pro를 넘었다고 한다. 지금은 Mistral Studio API 프리뷰만 열려 있고, 가중치는 10월 말에 내려받을 수 있다.

10만 토큰 아래에서 90% 싸진 Haiku 5.5, 무료 사용자까지 내려간 GPT-6

Claude Haiku 5.5는 10만 토큰 이하 요청에서 입력 100만 토큰당 0.10달러, 출력 0.50달러로 Haiku 4.5보다 90% 싸고, 그 위로는 0.50달러와 2.50달러가 된다. Anthropic은 평균 실행 비용이 75% 준다고 썼고, Haiku 계열 처음으로 effort 설정을 넣었다. 같은 페이지의 점수는 OSWorld 2.1 72.4%, Terminal-Bench 4.0 39.2%로 Haiku 4.5의 15.7%와 0.0%와는 세대가 다르다. Sonnet 5.5 캐시 읽기 가격도 절반으로 내렸다. 같은 시각 OpenAI는 GPT-6를 ChatGPT 전 사용자에게 열었다. 긱뉴스 정리에 따르면 Plus·Pro·Business는 7일부터 GPT-6 Sol을, 무료와 Go는 8일부터 GPT-6 Luna를 받고, 대화 안에 버튼·폼·차트가 뜨는 Intelligent UI가 함께 들어간다. 한편 Meta와 Microsoft는 사내 Claude 사용을 줄이고 있다. 같은 보도에서 Meta의 Claude Code 사용자는 약 6만 명에서 3만 명으로 줄었고, Microsoft는 연간 10억 달러로 잡았던 Anthropic 지출을 3분의 1 넘게 깎았다.

원고 722편을 깃허브에 올린 OpenAI, 다만 Lean 인증서는 일부뿐이다

OpenAI는 6일 미공개 내부 모델이 쓴 수학 연구 원고 722편을 372개 결과 묶음으로 공개했다. 모델에 약 4,000개 문제를 냈고, 결과 하나에 든 연산은 ChatGPT Pro 사고 약 3시간에 해당한다. 공식 글은 일부 증명을 Lean으로 형식화해 깃허브에 함께 올렸다고 밝혔다. 후속 논의에서는 Unique Games Conjecture 증명이 목록에 들어 있으나 Lean 인증서는 일부 결과에만 있고, 사람이 증명을 이해하는 작업은 이제 시작이라는 점이 지적됐다. 본인은 722라는 숫자보다 형식 검증과 사람의 이해 사이 간극이 이번 공개의 진짜 의제라고 본다.

결정 모델이 API와 오픈 소스 양쪽에서 같은 날 나왔다

지난 회차에서 Jev 결정 모델에 반대 증거가 쌓인 것을 다뤘다. 이번 주에는 그 범주 자체가 넓어졌다. OpenAI의 Decisions API가 공개 베타에 들어갔다. 텍스트와 이미지를 받아 확률·선택·점수 세 가지 형식으로만 답하며 Responses API보다 약 10배 빠르다고 하고, 모델은 gpt-6-luna 하나, 가격은 입력 100만 토큰당 0.10달러에 출력 과금이 없다. 같은 날 Strands가 낸 Strands Decider 2B는 Qwen3.5-2B의 언어 모델 헤드를 떼고 포인터 헤드를 붙인 오픈 소스 결정 모델로, JevBench 공개 세트에서 2B급 33개 중 3위, RTX 3090에서 중앙값 지연 약 115ms다.

한 줄 정리

Mistral Large 4의 가중치는 10월 말에 풀리고, Haiku 5.5와 GPT-6 Luna는 이미 가장 싼 자리를 두고 겹쳤다. 다음 회차에는 가중치 공개 뒤 로컬 실행 보고가 올라올 것이다.

조회수: 0

댓글 남기기