Skip to content
OTI Lab
Go back

에이전트가 도구를 잘 쓰는 법, 하네스만 고치면 될까 — MidTool의 mid-training 접근

에이전트가 도구를 잘못 고르거나, 인자를 이상하게 넣거나, 여러 번의 도구 호출을 매끄럽게 이어가지 못하면 어디를 고쳐야 할까요?

프롬프트와 도구 설명, 에이전트 하네스처럼 실행 시점에 보이는 요소부터 떠올리기 쉽습니다. MidTool 논문은 질문을 한 단계 앞쪽, 모델이 도구 사용을 배우는 시점으로 옮깁니다.

이 글은 무엇입니까? 2026년 8월 20일 공개된 논문 MidTool: Mid-training Data Synthesis for Agentic Tool Use의 문제 정의와 초록에서 직접 확인할 수 있는 실험 범위를 설명합니다. 논문이 보고한 결과와 이 글의 해석을 구분하며, PDF 표의 구체적인 성능 수치나 데이터 규모는 사용하지 않습니다.

MidTool이 던지는 질문은 단순합니다. 도구를 잘 쓰는 능력을 후속 학습(post-training)에만 맡길 필요가 있을까? 모델이 중간 학습(mid-training) 단계에서부터 도구의 쓰임과 호출 흐름을 배울 수는 없을까?

MidTool이 옮긴 질문: 실행 시점에서 학습 시점으로

논문은 일반적인 도구 사용(general tool use)을 대규모 언어모델의 mid-training 단계에서 강화할 수 있는 에이전트 능력으로 다룹니다.

MidTool 실험의 순서를 보면 의도가 더 분명해집니다. 연구진은 Qwen3-4B-Base와 Qwen3-8B-Base를 MidTool-Mix로 mid-training한 뒤, 그 위에 다시 지도 미세조정(SFT)과 강화학습(RL)을 적용했습니다.

post-training을 없앤 것이 아닙니다. post-training이 시작되기 전에 모델의 도구 사용 기반을 한 번 더 만들어 보려는 접근에 가깝습니다.

에이전트의 도구 사용을 런타임 하네스와 모델 학습 레이어로 나눠 본 개념도

이 그림은 논문의 공식 아키텍처가 아니라, 이 글에서 문제를 나눠 보기 위한 개념도입니다. MidTool을 에이전트 하네스의 대체재로 읽기보다 모델 학습 쪽에 추가된 레버로 보는 편이 정확합니다.

모델에게 ‘API 이름’보다 더 많은 것을 가르친다

MidTool의 학습 목표를 보면 도구 사용을 단순한 함수 호출 문법으로 보지 않는다는 점이 드러납니다.

연구진은 데이터가 모델에 다음 네 가지를 가르치도록 설계했다고 설명합니다.

에이전트의 도구 사용은 “함수를 호출할 줄 아는가”만으로 끝나지 않습니다. 어떤 도구를 고르고, 필요한 값을 문맥에서 가져오고, 여러 호출을 이어 붙이고, 정보가 부족해졌을 때 다음 행동을 정해야 합니다.

MidTool은 이런 일련의 흐름 자체를 학습 데이터에 넣으려 합니다.

그 학습 데이터는 어디서 만들까

MidTool은 대규모 웹·PDF·코드 데이터에 합성 학습 신호(supervision)를 결합하는 코퍼스 구축 파이프라인으로 소개됩니다.

합성 학습 신호의 재료에는 실제 도구 API, MCP 스킬(MCP skill), 문서 기반 workflow가 포함됩니다. 이 자료들을 이용해 모델이 도구의 쓰임과 인자, 호출 흐름을 학습할 수 있는 형태로 데이터를 구성하는 것이 MidTool-Mix의 핵심입니다.

MidTool-Mix의 데이터 구성과 Qwen3 Base에서 SFT·RL까지 이어지는 학습 순서

MCP skill이라는 단어는 범위를 넓혀 읽지 않는 편이 좋습니다. 논문이 확인해 주는 것은 MCP skills가 합성 supervision의 한 입력 유형이라는 점입니다. 이것을 “MidTool을 학습하면 모든 MCP 서버를 자유롭게 쓸 수 있다”는 의미로 확장하면 논문의 범위를 넘어갑니다.

어차피 뒤에서 SFT와 RL을 하는데, mid-training이 왜 필요할까

연구진은 MidTool-Mix로 mid-training한 뒤에도 SFT와 RL을 각각 적용했습니다. 논문 초록에 따르면 비교 baseline보다 SFT와 RL 두 설정 모두에서 BFCL, tau2-Bench, MCP Universe의 downstream 성능이 일관되게 개선됐습니다.

저자들은 이 결과를 일반 도구 사용도 다른 중요한 LLM 능력처럼 전용 mid-training의 이점을 얻을 수 있고, 전적으로 post-training에만 맡길 필요는 없다는 근거로 해석합니다.

그렇다고 “mid-training이 post-training보다 항상 낫다”고 결론내릴 수는 없습니다. 이번에 직접 확인한 실험 범위는 Qwen3-4B-Base와 Qwen3-8B-Base, 그리고 세 가지 도구 사용 벤치마크입니다. 다른 크기·다른 모델 계열·실제 서비스 환경까지 같은 결과가 이어진다고 말하려면 추가 근거가 필요합니다.

구체적인 점수 차이도 이 글에서는 쓰지 않았습니다. 이번 단계에서 검증한 범위가 논문 초록이기 때문입니다.

하네스 문제와 모델 학습 문제를 분리해서 볼 이유

MidTool이 주는 관점은 “이제 하네스는 중요하지 않다”가 아닙니다.

에이전트의 도구 사용이 실패했을 때 실행 시점의 오케스트레이션 문제인지, 모델 자체가 일반적인 도구 사용 패턴을 충분히 학습하지 못한 문제인지를 나눠 생각할 수 있게 합니다.

프롬프트, tool schema, agent harness, post-training은 여전히 각각의 레버입니다. MidTool은 여기에 mid-training이라는 학습 레버를 하나 더 추가합니다.

이렇게 보면 에이전트의 도구 사용 성능을 개선하는 문제도 한 층에서만 풀 필요가 없습니다. 실행 환경을 다듬는 일과 모델이 학습 과정에서 “도구를 언제 쓰고 어떻게 이어서 써야 하는지”를 배우는 일은 서로 다른 문제로 볼 수 있습니다.

MidTool이 남기는 질문

MidTool은 에이전트 도구 사용의 보편적인 정답을 입증한 논문은 아닙니다. 이번에 직접 확인한 범위만 놓고 보면 두 Qwen3 Base 모델과 세 벤치마크에서 전용 mid-training의 효과를 보고한 연구입니다.

그래도 질문의 위치를 바꾼다는 점은 분명합니다.

에이전트가 도구를 못 쓰면 실행 코드를 먼저 고칠 것인가, 아니면 모델이 도구 사용을 어디서 배웠는지까지 볼 것인가.

MidTool은 두 번째 질문을 본격적으로 꺼냅니다. 에이전트의 도구 사용 능력이 런타임 인터페이스의 문제이면서 동시에 학습 데이터와 학습 단계의 문제일 수 있다는 시각입니다.

참고 자료


Share this post:

Previous Post
《매트릭스》와 AI, 원문보다 답을 먼저 보면 무엇이 달라질까?
Next Post
Codex가 2~3개월 뒤 원시적으로 보인다는 말의 뜻 — Tibo 인터뷰로 읽는 OpenAI의 다음 전략