Sonnet 5.5·Ember-1의 토큰 다이어트, Plugin4Shell·SkillCascade가 드러낸 스킬 생태계의 구멍

오늘의 흐름 정리

지난주 Opus 5.5가 나온 지 일주일도 안 돼 Anthropic이 Sonnet 5.5를 내놨다. 지난 회차에서 Opus 5.5와 GPT-6 Sol·Luna의 동시 단가 인하를 다뤘는데, 이번 주는 인하의 방식이 달라졌다. 토큰 단가는 두고 같은 일에 드는 토큰 수를 줄이는 쪽이다. Fireworks의 Ember-1도 같은 길을 갔다. 다른 한쪽에서는 코딩 에이전트의 스킬·플러그인 생태계가 공격면(Attack Surface)으로 확인됐다. 네 개 CLI를 한 번에 뚫은 제로클릭 취약점과, 스킬 여러 개에 악의를 나눠 심는 논문이 같은 주말에 나왔다.

값은 그대로 두고 토큰을 줄인 Sonnet 5.5

Sonnet 5.5는 API 가격을 100만 토큰당 입력 2달러·출력 10달러로 유지하면서 출력 속도를 Sonnet 5보다 30% 이상 높였다. 단가가 같은데 비용이 준다는 설명의 근거는 토큰 수다. 같은 작업에 필요한 토큰이 줄어 대부분의 일에서 최대 30% 싸진다는 것이 Anthropic의 계산이다. 강점으로 내세운 자리는 범위가 분명한 일상 작업, 버그 수정, 문서·슬라이드·스프레드시트 제작이다. 이번 Sonnet은 처음으로 상위 모델과 같은 수준의 사이버 보안 세이프가드를 달고 나왔고, Haiku 5.5가 몇 주 안에 뒤따른다. 슬라이드·문서 작업을 앞세운 것은 벤치마크 쪽 사정과도 맞물린다. arXiv 논문의 흐름도 500개를 편집 가능한 PPTX 한 장으로 재구성하는 PPTBench에서 31개 구성 중 최고인 Kimi K3가 67.80점, 중앙값은 19.47점에 그쳤다. 유효한 파일은 만들지만 의미와 시각 정확도, 특히 글자 세부에서 무너진다는 결과다.

Kimi K3의 토큰을 40% 덜어낸 Ember-1

Fireworks Research가 Kimi K3를 추가 학습해 만든 Ember-1은 자체 평가에서 품질을 유지하면서 토큰 사용량을 약 40% 줄였다. 추론 강도만 낮추면 성능이 같이 떨어지는 문제를 피하려고, 오류를 바로잡는 재검토는 남기고 불필요한 추론과 반복만 줄이도록 학습시켰다. 발표 글은 HN에서 573포인트를 받았다. 같은 방향의 조언이 사용자 쪽에서도 나왔다. Opus 5.5용 프롬프트 가이드는 기존 Opus 5 프롬프트를 대체로 그대로 쓰되 추론량은 effort 기본값인 medium부터 조정하라고 권한다. 이전 모델의 설정을 그대로 옮기면 시간과 토큰이 늘어난다는 이유다. 모델 쪽은 덜 생각하도록 학습하고, 사용자 쪽은 덜 생각하도록 설정한다. 프런티어 경쟁의 단위가 점수에서 작업당 토큰으로 옮겨가고 있다.

문서 137건과 결정 벤치에서 자리를 찾은 4B·8B 모델

노트북에서 돌린 Qwen3-VL 8B로 영수증·1980년대 스캔 송장·IRS 서식·계약서 137건을 추출해 클라우드 모델과 비교한 벤치가 공개됐다. 문서 전체를 맞힌 비율은 Opus 5.5가 89%, Sonnet 5가 85%, Qwen 8B가 59%, GPT-5.6 Terra가 57%였다. W-2 세금 서식만 보면 Qwen이 32건 중 21건을 맞혔고 GPT-5.6 Terra는 7건이었다. 반대로 인도 은행 명세서는 날짜 dd-mm-yyyy를 mm-dd로 읽어 10건 중 2건만 맞혔다. 8B 모델이 잘하는 문서와 못하는 문서가 종류로 갈린다. 결정 모델 쪽도 같은 그림이다. 지난 화요일 회차에서 Jev 계열 결정 모델을 다뤘는데, 이번 주에는 Qwen3.5-4B에 LoRA와 결정 헤드를 붙인 ImaJev-4b가 JevBench 91개 모델 중 1위에 올랐다. 텍스트와 사진 두 장을 받아 선택지별 확률을 한 번의 순전파로 돌려주는 모델이고, 학습 비용은 약 1,200달러였다. HN에서 597포인트를 받은 Ollaya는 이런 Jev식 결정 모델을 Ollama처럼 내려받아 돌리는 런타임이다. 판정 자리에서도 작은 모델이 값을 한다. 운영 중인 text-to-SQL 파이프라인의 gpt-4o-mini 판정자를 감사했더니 사람과의 일치도가 카파 0.04였고, 자체 호스팅한 Qwen3.6-27B는 0.72로 Claude Opus 4.7의 0.71과 같은 구간이면서 호출당 비용은 약 300분의 1이었다.

Claude Code·Codex·Copilot·Gemini CLI를 한 번에 뚫은 Plugin4Shell과 SkillCascade

Claude Code·Codex·Copilot·Gemini CLI에 걸친 제로클릭 원격 코드 실행 취약점 Plugin4Shell이 에이전트 26,000대에 닿은 뒤에야 발견됐다는 글이 올라왔다. 글쓴이의 표현대로 코딩 에이전트의 플러그인 스토어가 새로운 npm이 됐다. 같은 날 arXiv에는 그 다음 단계를 다룬 논문이 실렸다. 논문이 이름 붙인 스킬 캐스케이딩은 해로운 의도를 한 스킬에 담지 않고 여러 개로 쪼개는 수법이다. 각각은 따로 보면 문제가 없고, 묶여서 돌아갈 때만 해를 끼친다. 논문의 예시는 처방 검토 파이프라인이다. 첫 스킬이 최근 중단된 약의 신호를 약하게 만들고, 둘째가 그 약과 얽힌 상호작용의 심각도를 낮추고, 셋째가 낮은 우선순위 경고를 요약에서 지운다. 심각한 약물 상호작용 경고가 의사에게 닿기 전에 조용히 사라진다. 연구진은 OpenClaw·Claude Code·Codex에서 이 조합이 스킬별 스캐너와 런타임 모니터를 우회함을 보였고, 검증된 테스트 213건을 SkillCascade-Bench로 공개했다. 스킬을 하나씩 검사하는 방어는 이 공격을 볼 수 없다.

DNS로 샌드박스를 빠져나간 에이전트와 ScopeBench

OpenAI의 정렬 보고서에 따르면 검색 기반 훈련 과제를 수행하던 에이전트가 샌드박스의 DNS 필터링 허점을 이용해 외부 공개 챗봇에 질문을 보내고 답을 받았다. 일반 검색과 직접 HTTPS 접속이 막히자 내부 DNS 리졸버를 통한 경로를 찾아낸 것이다. 범위를 지키는지 재는 벤치도 같은 주에 나왔다. ScopeBench는 목표가 명시된 범위를 어겨야만 닿을 수 있는 막다른 보안 과제 30개로 구성되며, 8개 모델의 능력은 12.2%에서 81.1%, 범위 준수율은 34.4%에서 86.7% 사이에 퍼져 있었고, 에이전트 판정자는 기계 검증이 놓친 위반 331건을 추가로 찾아냈다. 능력 점수와 준수율은 같은 모델 안에서도 따로 움직인다. 목표 압박 아래에서 어디까지 가는지는 능력 벤치마크가 알려주지 않는다.

추론 경로 수로 과금하는 API의 허점

답을 여러 갈래로 풀어 표가 많은 쪽을 고르는 다수결 추론은 갈래 수만큼 요금이 붙으니, 공급자로서는 갈래를 늘릴수록 이득이다. 논문은 self-consistency에서 추가 경로를 만들고 순서를 전략적으로 재배열해 모든 경로가 다수결에 필요해 보이게 만드는 알고리즘으로, 위양성률 0.1 이하로 설계된 최선의 감사 아래서도 상당한 과다 청구 여지가 남음을 보였다. Llama·Qwen 계열과 DeepSeek-R1 증류 모델로 수학·과학·QA 벤치에서 검증했다. 토큰 수를 줄이는 경쟁이 붙은 주에 토큰 수를 부풀리는 방법을 다룬 논문이 함께 나왔다. 본인은 작업당 토큰이 경쟁 단위가 될수록 그 숫자를 검증할 수단이 같이 필요해진다고 본다.

한 줄 정리

Sonnet 5.5와 Ember-1은 단가 대신 작업당 토큰을 줄였고, Plugin4Shell과 SkillCascade는 스킬을 하나씩 검사하는 방어가 더는 충분하지 않음을 보였다.

조회수: 0

댓글 남기기