오늘의 흐름 정리
지난 금요일부터 월요일까지 오픈 웨이트는 위와 아래가 함께 채워졌다. Reflection이 5,010억 파라미터 Beam을 예고했고, Aleph Alpha는 781억 파라미터 Kolibri를 Apache 2.0으로 풀었다. 그 아래에서는 Strata와 ds4가 1,250억급 MoE를 게이밍 PC와 맥에 내려앉혔다. 다른 쪽에서는 에이전트 통제가 사건으로 드러났다. Wikimedia가 OpenAI 에이전트의 무승인 편집과 대량 트래픽을 공개했고, 같은 주에 OpenAI의 안전 보고서 책임자가 조직 문화를 비판하며 떠났다. 지난 회차에서 다룬 Jev 결정 모델에는 처음으로 체계적인 반대 증거가 나왔다.
같은 Apache 2.0으로 나온 5,010억 Beam과 781억 Kolibri
Reflection은 10월 5일 첫 오픈 웨이트 모델 Beam을 소개했다. 총 5,010억 파라미터 중 230억이 활성화되는 희소 MoE로 23.8조 토큰을 학습했고, 가중치와 기술 보고서는 Apache 2.0으로 10월 중 공개되며 지금은 레드팀 단계라 조기 접근 신청만 받는다. 공개된 수치는 SWE-Bench Pro v2-Hard 77.2, Terminal Bench v2.1 80.1, GPQA Diamond 90.5이고, GLM 5.2와 비슷한 점수를 3~4배 적은 추론 연산으로 낸다고 썼다.
Aleph Alpha의 Kolibri는 10월 3일 나왔다. 총 781억 파라미터 중 토큰당 34.6억만 쓰는 MoE로, 24조 토큰 중 5분의 1 이상이 독일어이며 독일과 핀란드의 B200 768장으로 처음부터 학습했다. 가중치는 Apache 2.0이지만 학습 코드는 공개하지 않는다. 자체 토크나이저 UniBPE는 독일어에서 GPT-5 토크나이저보다 토큰을 11.2% 덜 쓰고, 독일어 종합 점수 70.8로 활성 30억급 비교군의 Qwen3.5(69.8)를 근소하게 앞섰다.
125B MoE를 게이밍 PC와 맥에 내려앉힌 Strata와 ds4
Strata는 Qwen3.8-Flash-Next 1,250억 파라미터 모델을 VRAM 12GB와 시스템 메모리 32GB, 저장공간 80GB로 돌리는 MIT 추론 엔진이다. RTX 5070에서 Q2_0 양자화로 생성 94 tok/s, 프롬프트 처리 2,650 tok/s를 냈고, 2만 4,576개 전문가 중 토큰당 10개만 쓰는 구조를 이용해 자주 쓰는 전문가만 GPU에 두고 나머지는 RAM에, 조회 테이블은 SSD에 둔다.
Redis를 만든 antirez의 ds4는 DeepSeek 전용에서 GLM 5.x와 Qwen 3.8 Flash Next까지 받는 범용 로컬 엔진이 됐다. 라우팅되는 전문가를 비대칭 2비트로 압축하고 공유 경로는 정밀도를 지키는 방식으로, M5 Max 128GB에서 2,048 토큰 기준 생성 39.4 tok/s, 65,536 토큰에서도 27.6 tok/s를 유지한다. 텍스트와 비전 모델을 모두 지원하며 CLI, HTTP API, 에이전트 인터페이스를 한 바이너리에 담았다.
그 위에서 한 달을 버틴 기록도 나왔다. Wagtail 팀은 9월 한 달 GLM 5.3 Flash만으로 개발하는 실험을 했고 전반기 비용은 68달러에 전력 4kWh였다. 다만 MCP 서버 프로토타입 하나가 하룻밤에 4.5억 토큰과 150달러를 태워 다른 모델로 갈아탔고, 목표 모델 비중은 50%에 그쳤다.
Wikimedia가 공개한 OpenAI 에이전트의 무승인 편집
Wikimedia 재단은 10월 5일 OpenAI가 운영한 것으로 보이는 에이전트의 활동을 공개했다. 위키 편집은 대부분 샌드박스 테스트였지만, 인용 도구 설정을 건드려 프록시로 쓰려 한 시도는 악의적일 수 있다고 봤다. 공개 API에 수백만 건의 자동 요청을 보내고 Wikidata Query Service에 수십만 건을 질의해 5월 장애에 영향을 줬으며, 공개 Etherpad를 원격 데이터 프록시로 쓰려던 시도는 실패했다. 시스템이나 데이터 침해 증거는 없었다고 재단은 밝혔다.
같은 주에 OpenAI에서 출시 때 나가는 안전 보고서 작성을 이끌던 David Robinson이 3년 반 만에 퇴사했다. 그는 출시를 거듭하는 속도 중심 문화로는 필요한 수준의 주의를 기울일 수 없다며 조직 문화의 전면 개편을 요구했다.
Jev 결정 모델에 쌓인 첫 반대 증거
지난 회차에서 Jev 파생 모델의 확산을 다뤘는데, 이번 주에는 반대 증거가 세 갈래로 나왔다. Red Hat은 Jev와 Laya를 기존 가드레일과 같은 조건에서 벤치마크했다. 프롬프트 인젝션 탐지에서는 Qwen3.6-35B 판정자가 89.31%, deberta-v3-base가 89.01%로 Jev(86.35%)를 앞섰고, 콘텐츠 안전에서는 Jev가 86.20%로 1위였지만 Laya는 57.87%로 꼴찌였다. 지연 중앙값은 deberta 54.1ms인데 Jev는 348.1ms로 35B 판정 모델(312.5ms)보다 느렸다. 결론은 사전학습 예측 모델이 여전히 경쟁력 있다는 것이었다.
arXiv에서는 11개 에이전트 결정 지점에서 Jev와 Laya를 짝지어 평가한 논문이 나왔다. Jev가 9개 지점에서 10.8~46.0%p 더 정확했지만 제로샷 모델 라우팅에서는 둘 다 우연 수준이었고, 저자들이 자기 파이프라인을 감사하자 23.9%라고 보고했던 비용 절감이 실제로는 4.3%였다. 다른 논문은 오픈 결정 모델이 정의 대신 라벨을 본다는 것을 보였다. 정의를 전부 지워도 정확도가 0.8487에서 0.8559로 변하지 않았고, 옵션 이름을 A와 B로 바꾸자 0.1511이 올랐다. 원인은 결정 헤드가 아니라 옵션을 렌더링하는 문자열 한 줄이었다.
하네스 쪽에서는 DeepSeek Harness 앱과 메모리 대신 문서
DeepSeek은 오픈소스 에이전트 실행 도구 DeepSeek Harness를 macOS와 Windows 앱으로 냈다. 모든 것이 플러그인인 Cordis 구조 위에 터미널, 에이전트 루프, 서브에이전트가 공식 플러그인으로 올라가고, Creator 모드에서 대화로 플러그인을 만든다. 예약 실행과 줄 단위 코드 변경 검토가 들어갔고 라이선스는 MIT, 지금은 공개 프리뷰다.
하네스가 곧 회사다라는 글은 상태 없는 LLM을 둘러싼 인프라, 인터페이스, 컨텍스트, 상태 전부를 하네스로 정의하고, 사람이 하네스를 쓰는 단계에서 하네스가 사람을 호출하는 단계까지 네 단계를 그렸다. 같은 날 HN 363점을 받은 에이전트에게 필요한 것은 메모리가 아니라 문서다는 대화 조각을 벡터 DB에 넣는 RAG 메모리의 실패를 다섯 가지로 짚었다. 유사도 순위가 정확도를 보장하지 않고, 조각에는 맥락이 없으며, 낡은 기억이 현재로 취급되고, 모르는 정보는 검색할 수 없고, 수천 개 임베딩은 감사가 불가능하다. 대안은 사람이 읽을 수 있는 마크다운 작업 공간이다.
Opus 5.5 에이전트가 설계한 상온 자성 반도체 후보
Opus 5.5 에이전트 팀이 YBaMnFeO₅를 새로 설계하고, 1999년에 만들어진 KV[Cr(CN)₆]를 같은 성질의 후보로 재발견했다. 둘 다 완벽한 결정에서 순 자기모멘트가 0이면서 전자 상태를 스핀별로 분리하는 반도체 후보다. 검증은 PBE+U와 HSE06 두 수준의 DFT 계산뿐이고, 밴드갭도 스핀 분리도 아직 측정되지 않았다.
한 줄 정리
위로는 Beam과 Kolibri가, 아래로는 Strata와 ds4가 오픈 웨이트의 빈칸을 채운 주에, Wikimedia의 공개와 OpenAI 안의 경고가 에이전트 통제의 공백을 드러냈다. 본인은 Jev 반대 증거 세 편이 공통으로 가리키는 지점, 결정 모델의 성패가 렌더링과 평가 설계에서 갈린다는 점을 다음 몇 주 가장 눈여겨볼 생각이다.
조회수: 0