오늘의 흐름 정리
지난 금요일부터 이번 화요일 아침까지 나온 것들을 늘어놓으면 두 갈래가 동시에 굳고 있다. 하나는 에이전트에게 무엇을 시킬지 적어 두는 지침 파일과 그것을 돌리는 오케스트레이터가 벤더 공용 규격으로 수렴하는 흐름이다. 다른 하나는 문장을 만들어 내는 대신 판단만 꺼내 쓰는 모델을 프로그램 안에 박아 넣는 흐름이고, 이쪽은 이번 나흘 동안 수집 풀에서 가장 많은 항목을 만들어 냈다. 별개처럼 보이지만 압력의 뿌리는 같다. 에이전트를 실제 업무에 상주시키려면 지침은 도구를 갈아타도 따라와야 하고, 판단은 한 번 부를 때마다 값을 걱정하지 않을 만큼 싸야 한다.
벤더마다 따로 쓰던 지침 파일이 한 곳으로 모인다
지침 파일 쪽부터 보면, Claude Code 2.1.277부터 프로젝트에 CLAUDE.md가 없으면 AGENTS.md를 프로젝트 지침으로 읽는다. 같은 내용을 도구마다 복사해 두거나 심볼릭 링크로 이어 붙이던 관행이 하나 줄어든 셈이다. 본인이 운영하는 저장소들도 정확히 그 상태였다.
다만 규격이 자리를 잡았다고 보기엔 이르다. GitHub 저장소를 표본으로 센 조사에서 AGENTS.md를 둔 곳은 활성 저장소의 6.2%, 전체 저장소로 내리면 1.0%였다. 읽는 쪽이 먼저 열렸고 쓰는 쪽은 아직 따라오지 않았다는 뜻이다.
그 위층에서도 같은 방향의 움직임이 있다. 구글은 오픈 에이전틱 오케스트레이터를 표방한 AX를 내놓았고, OpenAI는 흩어져 있던 사내 파일을 에이전트가 근거로 쓸 수 있는 컨텍스트로 바꾸는 V7 사례를 올렸다.
텍스트를 만들지 못하는 모델에 판단만 맡기는 쪽이 번졌다
두 번째 갈래의 진원은 Jev다. OpenAI에서 RLHF와 InstructGPT를 공동 고안한 Diogo Almeida가 2년에 걸쳐 만든 모델로, 텍스트를 생성하지 못하고 보정된 확신도를 붙인 타입 결정만 돌려준다. 실행 순서와 분기는 코드가 쥐고, 문맥을 읽어야 하는 지점에서만 판단을 꺼내 쓰는 구조다.
풀에 쌓인 항목 수로만 보면 이번 주 최대 물량이 여기서 나왔다. 학습 없이 공개 모델에서 같은 동작을 끌어내는 SemIf처럼 선택지의 확률을 바로 읽는 시도가 있고, 아예 모델로 묶은 Kev는 Qwen3.5 위에 올린 소형 결정 모델군으로 나왔다. 연구 쪽도 붙었다. Jev-Mem은 에이전트 메모리의 제어 평면을 System One 쪽으로 떼어내 비싼 생성 과정을 메모리 동작의 임계 경로에서 빼자고 제안한다.
본인이 보기에 주목할 지점은 성능이 아니라 배치다. 라우팅, 재시도 여부, 도구 호출 검증처럼 지금까지 대형 모델을 부르던 자리가 하나씩 떨어져 나가고 있다.
상주시킬 모델 크기와 하드웨어가 같은 주에 맞물렸다
큰 쪽에서도 값을 낮추는 발표가 이어졌다. 샤오미가 공개한 MiMo-V2.6은 Pro가 발표 기준 Artificial Analysis 지능 지수 46.32점으로 공개 모델 가운데 1위를 기록했고, 비용 효율을 앞세운 Flash를 함께 내놓았다. 텍스트와 이미지, 영상, 오디오를 함께 다루면서 코딩과 도구 사용, 컴퓨터 조작까지 범위에 넣은 모델군이라 공개 페이지에서 곧장 성격이 드러난다. 같은 계열을 9B로 증류한 MiMo-V2.6-Distill-Qwen-9B까지 함께 올라왔다.
받아 줄 하드웨어도 같은 주에 갱신됐다. 256GB 메모리를 얹은 M5 Ultra Mac Studio는 M3 Ultra 대비 응답 생성이 평균 약 70%, 프롬프트 처리가 평균 150% 빨라졌다. 로컬 모델을 기본값으로 두고 개인 비서를 상주시킬 만한 속도에 도달했다는 평가다.
답을 믿을 수 없는 자리는 그대로 남아 있다
규격과 단가가 정리되는 동안에도 정확도 쪽은 따로 놀았다. 18개 모델에 금융 질문을 던진 시험에서 평균 57%가 틀린 답을 내놓았고, 복잡한 질문에서는 오류율이 평균 88%까지 올라갔다. 100개가 넘는 질문을 최대 5회씩 반복해 1만 건 이상을 물은 결과다.
더 신경 쓰이는 것은 설득력 쪽이다. 정치적 쟁점 대화에서 챗봇이 세계 챔피언을 포함한 전문 토론자보다 높은 설득력을 보였고, 그 과정에 허위 정보도 섞였다는 연구가 나왔다. 틀린 답을 잘 만드는 능력과 사람을 잘 설득하는 능력이 한 모델 안에 함께 있다는 뜻이라, 검증 단계를 사람이 쥐고 있어야 할 이유가 하나 더 늘었다.
한 줄 정리
지침 파일과 오케스트레이터는 공용 규격으로 모이고 있고, 그 아래에서는 생성을 건너뛴 판단 모델이 대형 모델을 부르던 자리를 잘라 가고 있다. 다만 답의 정확도는 그 속도를 따라오지 못했으니, 기계에 맡길 자리와 사람이 확인할 자리를 나누는 일이 이번 주의 실제 숙제다.
조회수: 0