Research report · 2026-09-19

터미널·CLI 벤치마크와 툴유즈 데이터셋

질문 (Noah, #research-pre-training 2026-09-19 13:24): 터미널 밴치나 툴유즈 데이터셋이 있을까요? 없다면 구할 수 있나요? 있다면 프리·미들·포스트 언제 넣나요?

이 보고서는 터미널·CLI(§2)와 툴콜링(§3) 두 트랙의 공개 데이터를 조사하고, 배치 단계(§4)와 확보 경로(§5)를 판정한 뒤, 미검증 항목을 부록(§6)에 분리했다. 본문의 모든 수치·주장은 §7 출처에 귀속되며, 어느 출처에도 귀속되지 않는 항목은 본문이 아니라 §6에만 있다. 표 안의 [S#]는 §7의 출처 번호와 1:1로 대응하고, 사내 실측은 외부 출처가 없어 번호 없이 '사내 실측'으로만 표기한다.

결론

있다. 터미널 쪽은 벤치마크보다 학습 풀이 먼저 커졌고, 툴콜링 쪽은 무료 SFT 셋이 이미 충분하다.

① 있나요? 두 트랙 모두 공개 데이터가 존재한다. 터미널·CLI 쪽은 평가 전용 벤치마크(Terminal-Bench 1.0/2.0, SWE-bench 계열)와 별개로 학습 가능 풀이 확인됐다.

② 구할 수 있나요? 무료 풀만으로 cold-start SFT는 가능하다. Apache-2.0축(glaive + hermes + ToolACE)에 Nemotron tool_calling 310,051을 규모축으로 얹고, Ko-functioncall을 한국어 주력으로 쓰면 된다.

③ 프리·미드·포스트 어디에? 기본 배치는 포스트트레이닝(SFT cold-start 후 RL)이다. 조사한 9개 보고서 전원이 실제로 택한 경로다.

⓪ 다운로드

실제로 내려받을 수 있는 코퍼스만 모았다. 표의 모든 항목은 2026-09-19에 Hugging Face API로 존재와 행수, 라이선스를 직접 조회했고, 행수를 공개하지 않은 항목은 로 둔다. 라이선스 칩이 노란색이면 비상업이거나 공유조건이 붙고, 빨간색이면 카피레프트라 벤더 모델 학습에 쓰기 전에 검토가 필요하다.

받는 건 hf CLI 한 줄이다. pip install -U huggingface_hub 뒤에 아래를 쓴다.

hf download <데이터셋-id> --repo-type dataset --local-dir ./<폴더>

0.1 터미널·CLI 학습 풀

SWE와 터미널 에이전트의 트래젝토리, 태스크 풀이다. RL 환경과 SFT 코퍼스가 섞여 있으니 용도를 보고 고른다.

데이터셋라이선스받기
nebius/SWE-agent-trajectories80,036cc-by-4.0hf download nebius/SWE-agent-trajectories --repo-type dataset
SWE-bench/SWE-smith-trajectories76,002mithf download SWE-bench/SWE-smith-trajectories --repo-type dataset
SWE-bench/SWE-smith59,136mithf download SWE-bench/SWE-smith --repo-type dataset
OpenHands/CodeScout_Training_Rollouts54,845미표기hf download OpenHands/CodeScout_Training_Rollouts --repo-type dataset
SWE-bench/SWE-smith-py50,908mithf download SWE-bench/SWE-smith-py --repo-type dataset
nebius/SWE-rebench-V232,079cc-by-4.0hf download nebius/SWE-rebench-V2 --repo-type dataset
nebius/SWE-rebench27,878cc-by-4.0hf download nebius/SWE-rebench --repo-type dataset
princeton-nlp/SWE-bench21,527미표기hf download princeton-nlp/SWE-bench --repo-type dataset
m-a-p/TerminalTraj20,000미표기hf download m-a-p/TerminalTraj --repo-type dataset
muellerzr/text_to_terminal_v217,450apache-2.0hf download muellerzr/text_to_terminal_v2 --repo-type dataset
hamishivi/swerl-tmax-15k14,601미표기hf download hamishivi/swerl-tmax-15k --repo-type dataset
R2E-Gym/R2E-Gym-Lite11,788미표기hf download R2E-Gym/R2E-Gym-Lite --repo-type dataset
R2E-Gym/R2E-Gym-V18,101apache-2.0hf download R2E-Gym/R2E-Gym-V1 --repo-type dataset
nebius/SWE-bench-extra6,376cc-by-4.0hf download nebius/SWE-bench-extra --repo-type dataset
SWE-Gym/OpenHands-Sampled-Trajectories6,055미표기hf download SWE-Gym/OpenHands-Sampled-Trajectories --repo-type dataset
SWE-Gym/OpenHands-Verifier-Trajectories5,272미표기hf download SWE-Gym/OpenHands-Verifier-Trajectories --repo-type dataset
R2E-Gym/R2E-Gym-Subset4,578apache-2.0hf download R2E-Gym/R2E-Gym-Subset --repo-type dataset
R2E-Gym/R2EGym-SFT-Trajectories3,231미표기hf download R2E-Gym/R2EGym-SFT-Trajectories --repo-type dataset
SWE-Gym/SWE-Gym2,438mithf download SWE-Gym/SWE-Gym --repo-type dataset
mlfoundations-dev/terminal-bench-traces-local1,189미표기hf download mlfoundations-dev/terminal-bench-traces-local --repo-type dataset
ScaleAI/SWE-bench_Pro731미표기hf download ScaleAI/SWE-bench_Pro --repo-type dataset
princeton-nlp/SWE-bench_Multimodal612미표기hf download princeton-nlp/SWE-bench_Multimodal --repo-type dataset
SWE-bench/SWE-bench_Multimodal580미표기hf download SWE-bench/SWE-bench_Multimodal --repo-type dataset
OpenHandsCommunity/SWE-bench-devin-full570mithf download OpenHandsCommunity/SWE-bench-devin-full --repo-type dataset
princeton-nlp/SWE-bench_Verified500미표기hf download princeton-nlp/SWE-bench_Verified --repo-type dataset
SWE-Gym/OpenHands-SFT-Trajectories491mithf download SWE-Gym/OpenHands-SFT-Trajectories --repo-type dataset
princeton-nlp/SWE-bench_Lite323미표기hf download princeton-nlp/SWE-bench_Lite --repo-type dataset
OpenHands/openhands-feedback275mithf download OpenHands/openhands-feedback --repo-type dataset
epinnock/intercode-nl2bash-curated200미표기hf download epinnock/intercode-nl2bash-curated --repo-type dataset
ia03/terminal-bench112mithf download ia03/terminal-bench --repo-type dataset
rmems/thalamic-relay-trajectories95apache-2.0hf download rmems/thalamic-relay-trajectories --repo-type dataset
DCAgent/GPT-5-terminal-bench-282미표기hf download DCAgent/GPT-5-terminal-bench-2 --repo-type dataset
rmems/agentic-coding-trajectories3apache-2.0hf download rmems/agentic-coding-trajectories --repo-type dataset
xlangai/ubuntu_osworld_file_cacheapache-2.0hf download xlangai/ubuntu_osworld_file_cache --repo-type dataset
harborframework/terminal-bench-3.0apache-2.0hf download harborframework/terminal-bench-3.0 --repo-type dataset
nvidia/Nemotron-Terminal-Corpuscc-by-4.0hf download nvidia/Nemotron-Terminal-Corpus --repo-type dataset
harborframework/terminal-bench-2.0apache-2.0hf download harborframework/terminal-bench-2.0 --repo-type dataset
aisa-group/PostTrainBench-Trajectoriesapache-2.0hf download aisa-group/PostTrainBench-Trajectories --repo-type dataset
bigcode/commitpackftmithf download bigcode/commitpackft --repo-type dataset
bigcode/commitpackmithf download bigcode/commitpack --repo-type dataset
ByteDance-Seed/Multi-SWE-benchotherhf download ByteDance-Seed/Multi-SWE-bench --repo-type dataset
IntelligenceLab/Long-Horizon-Terminal-Benchapache-2.0hf download IntelligenceLab/Long-Horizon-Terminal-Bench --repo-type dataset
ByteDance-Seed/Multi-SWE-bench_trajscc0-1.0hf download ByteDance-Seed/Multi-SWE-bench_trajs --repo-type dataset
xlangai/osworld2.0-trajectory gated미표기hf download xlangai/osworld2.0-trajectory --repo-type dataset
SALT-NLP/SWE-chat gatedodc-byhf download SALT-NLP/SWE-chat --repo-type dataset
xlangai/AgentNetmithf download xlangai/AgentNet --repo-type dataset
nebius/SWE-rebench-openhands-trajectoriescc-by-4.0hf download nebius/SWE-rebench-openhands-trajectories --repo-type dataset
nvidia/Nemotron-Terminal-Synthetic-Taskscc-by-4.0hf download nvidia/Nemotron-Terminal-Synthetic-Tasks --repo-type dataset
rmems/secret-scan-remediation-trajectoriesapache-2.0hf download rmems/secret-scan-remediation-trajectories --repo-type dataset
ByteDance-Seed/Multi-SWE-RLotherhf download ByteDance-Seed/Multi-SWE-RL --repo-type dataset
ByteDance-Seed/Multi-SWE-bench_miniotherhf download ByteDance-Seed/Multi-SWE-bench_mini --repo-type dataset
nvidia/SWE-Zero-openhands-trajectoriescc-by-4.0hf download nvidia/SWE-Zero-openhands-trajectories --repo-type dataset
Daoguang/Multi-SWE-benchapache-2.0hf download Daoguang/Multi-SWE-bench --repo-type dataset
AI-Secure/DTap-Bench-Agent-Trajectoriesapache-2.0hf download AI-Secure/DTap-Bench-Agent-Trajectories --repo-type dataset
ByteDance-Seed/Multi-SWE-bench-flashotherhf download ByteDance-Seed/Multi-SWE-bench-flash --repo-type dataset
sunnydubey1111/agent-trajectory-sentinelotherhf download sunnydubey1111/agent-trajectory-sentinel --repo-type dataset
nvidia/Nemotron-RL-Agentic-Terminal-Pivot-v1cc-by-4.0hf download nvidia/Nemotron-RL-Agentic-Terminal-Pivot-v1 --repo-type dataset
nvidia/Nemotron-RL-Agentic-SWE-Pivot-v1cc-by-4.0hf download nvidia/Nemotron-RL-Agentic-SWE-Pivot-v1 --repo-type dataset
opencompass/SWEBench-Pro-Verifiedapache-2.0hf download opencompass/SWEBench-Pro-Verified --repo-type dataset
anonymousmypcbench/cua-speedrun-trajectories미표기hf download anonymousmypcbench/cua-speedrun-trajectories --repo-type dataset
LLM-OS-Models/Qwen-Terminal-ToolBench-Processed-Tokenizedapache-2.0hf download LLM-OS-Models/Qwen-Terminal-ToolBench-Processed-Tokenized --repo-type dataset
YuvrajSingh9886/androidlife-trajectories미표기hf download YuvrajSingh9886/androidlife-trajectories --repo-type dataset
obaydata/mcp-agent-trajectory-benchmarkapache-2.0hf download obaydata/mcp-agent-trajectory-benchmark --repo-type dataset
ChrisDing1105/unified-agent-trajectoriesotherhf download ChrisDing1105/unified-agent-trajectories --repo-type dataset
AgentNativeResearchLab/arc-agi3-ka59-agent-trajectoriescc-by-4.0hf download AgentNativeResearchLab/arc-agi3-ka59-agent-trajectories --repo-type dataset
AgentNativeResearchLab/arc-agi3-wa30-agent-trajectoriescc-by-4.0hf download AgentNativeResearchLab/arc-agi3-wa30-agent-trajectories --repo-type dataset
rmems/incident-response-oncall-trajectoriesapache-2.0hf download rmems/incident-response-oncall-trajectories --repo-type dataset
rmems/proto-breaking-change-trajectoriesapache-2.0hf download rmems/proto-breaking-change-trajectories --repo-type dataset
AgentNativeResearchLab/arc-agi3-lf52-agent-trajectoriescc-by-4.0hf download AgentNativeResearchLab/arc-agi3-lf52-agent-trajectories --repo-type dataset
INONONO/fable-5.1-mario-trajectorymithf download INONONO/fable-5.1-mario-trajectory --repo-type dataset
rmems/docker-build-cache-trajectoriesapache-2.0hf download rmems/docker-build-cache-trajectories --repo-type dataset

0.2 툴콜링 학습셋

function-calling과 tool-agent SFT 코퍼스다. cold-start는 여기서 만든다.

데이터셋라이선스받기
microsoft/orca-agentinstruct-1M-v11,046,410cdla-permissive-2.0hf download microsoft/orca-agentinstruct-1M-v1 --repo-type dataset
BitAgent/tool_calling551,285미표기hf download BitAgent/tool_calling --repo-type dataset
thibaud-perrin/hibo-function-calling-v1323,271mithf download thibaud-perrin/hibo-function-calling-v1 --repo-type dataset
allenai/Dolci-Instruct-SFT-Tool-Use227,579미표기hf download allenai/Dolci-Instruct-SFT-Tool-Use --repo-type dataset
sxy67230/hermes-agent-reasoning-traces147,253미표기hf download sxy67230/hermes-agent-reasoning-traces --repo-type dataset
Locutusque/function-calling-chatml112,960apache-2.0hf download Locutusque/function-calling-chatml --repo-type dataset
argilla/apigen-function-calling109,402cc-by-4.0hf download argilla/apigen-function-calling --repo-type dataset
MathAndMagic/function-calling86,864apache-2.0hf download MathAndMagic/function-calling --repo-type dataset
ASTERIZER/LUNA-RAG-MCP-SFT-10M61,884cc-by-nc-nd-4.0hf download ASTERIZER/LUNA-RAG-MCP-SFT-10M --repo-type dataset
eitanturok/Salesforce-xlam-function-calling-60k60,000미표기hf download eitanturok/Salesforce-xlam-function-calling-60k --repo-type dataset
interstellarninja/hermes_reasoning_tool_use51,004apache-2.0hf download interstellarninja/hermes_reasoning_tool_use --repo-type dataset
sam-mosaic/agent-instruct34,440미표기hf download sam-mosaic/agent-instruct --repo-type dataset
muhammadtlha944/mcp-agent-training-data16,520미표기hf download muhammadtlha944/mcp-agent-training-data --repo-type dataset
casey-martin/Seal-Tools14,076mithf download casey-martin/Seal-Tools --repo-type dataset
tryumanshow/glaive-function-calling-v2-ko-refined12,371미표기hf download tryumanshow/glaive-function-calling-v2-ko-refined --repo-type dataset
nvidia/ToolScale4,063otherhf download nvidia/ToolScale --repo-type dataset
zai-org/AgentInstruct1,866미표기hf download zai-org/AgentInstruct --repo-type dataset
allenai/Dolci-Instruct-SFT-Tool-Use-SA1,604cc-by-sa-4.0hf download allenai/Dolci-Instruct-SFT-Tool-Use-SA --repo-type dataset
codelion/Llama-3.2-1B-Instruct-magpie-tool-calling1,200미표기hf download codelion/Llama-3.2-1B-Instruct-magpie-tool-calling --repo-type dataset
Nexusflow/Function_Call_Definitions116cc-by-nc-sa-4.0hf download Nexusflow/Function_Call_Definitions --repo-type dataset
Layue13/mcp-tool-calling-dataset23미표기hf download Layue13/mcp-tool-calling-dataset --repo-type dataset
pavan01729/mcp_traces_v112미표기hf download pavan01729/mcp_traces_v1 --repo-type dataset
gorilla-llm/Berkeley-Function-Calling-Leaderboardapache-2.0hf download gorilla-llm/Berkeley-Function-Calling-Leaderboard --repo-type dataset
NousResearch/hermes-function-calling-v1apache-2.0hf download NousResearch/hermes-function-calling-v1 --repo-type dataset
glaiveai/glaive-function-calling-v2apache-2.0hf download glaiveai/glaive-function-calling-v2 --repo-type dataset
lockon/xlam-function-calling-60kcc-by-4.0hf download lockon/xlam-function-calling-60k --repo-type dataset
Salesforce/xlam-function-calling-60k gatedcc-by-4.0hf download Salesforce/xlam-function-calling-60k --repo-type dataset
Team-ACE/ToolACEapache-2.0hf download Team-ACE/ToolACE --repo-type dataset
minpeter/xlam-function-calling-60k-parsedcc-by-4.0hf download minpeter/xlam-function-calling-60k-parsed --repo-type dataset
fireworks-ai/function-calling-eval-dataset-v0미표기hf download fireworks-ai/function-calling-eval-dataset-v0 --repo-type dataset
NobodyExistsOnTheInternet/xlam-function-calling-60kmithf download NobodyExistsOnTheInternet/xlam-function-calling-60k --repo-type dataset
kth8/python-toolcallsapache-2.0hf download kth8/python-toolcalls --repo-type dataset
product-science/xlam-function-calling-60k-rawapache-2.0hf download product-science/xlam-function-calling-60k-raw --repo-type dataset
minpeter/xlam-function-calling-60k-hermes미표기hf download minpeter/xlam-function-calling-60k-hermes --repo-type dataset
annahbanannah/synthetic-math-toolcall-deceptionmithf download annahbanannah/synthetic-math-toolcall-deception --repo-type dataset
glaiveai/glaive-function-callingapache-2.0hf download glaiveai/glaive-function-calling --repo-type dataset
Salesforce/APIGen-MT-5kcc-by-nc-4.0hf download Salesforce/APIGen-MT-5k --repo-type dataset
hypervariance/function-calling-sharegptapache-2.0hf download hypervariance/function-calling-sharegpt --repo-type dataset
NexusProjectsAI/Nexus-Agents-ToolCallingapache-2.0hf download NexusProjectsAI/Nexus-Agents-ToolCalling --repo-type dataset
hiyouga/glaive-function-calling-v2-sharegptapache-2.0hf download hiyouga/glaive-function-calling-v2-sharegpt --repo-type dataset
NewEden/xlam-function-calling-60k-shareGPTagpl-3.0hf download NewEden/xlam-function-calling-60k-shareGPT --repo-type dataset
Yhyu13/glaive-function-calling-v2-llama-factory-convertapache-2.0hf download Yhyu13/glaive-function-calling-v2-llama-factory-convert --repo-type dataset
Goekdeniz-Guelmez/Function_Calling_Unfilteredopenrailhf download Goekdeniz-Guelmez/Function_Calling_Unfiltered --repo-type dataset
nvidia/Nemotron-RL-Agentic-Function-Calling-Pivot-v1cc-by-4.0hf download nvidia/Nemotron-RL-Agentic-Function-Calling-Pivot-v1 --repo-type dataset
Trelis/function_calling_extended gated미표기hf download Trelis/function_calling_extended --repo-type dataset
Vishal24/function_calling미표기hf download Vishal24/function_calling --repo-type dataset
Deepexi/function-calling-smallcc-by-4.0hf download Deepexi/function-calling-small --repo-type dataset
nvidia/Nemotron-RL-Agentic-Conversational-Tool-Use-Pivot-v1cc-by-4.0hf download nvidia/Nemotron-RL-Agentic-Conversational-Tool-Use-Pivot-v1 --repo-type dataset
Shuibai12138/mcp-universe-finance-sft미표기hf download Shuibai12138/mcp-universe-finance-sft --repo-type dataset
interstellarninja/hermes-function-calling-v1apache-2.0hf download interstellarninja/hermes-function-calling-v1 --repo-type dataset
ru-dataset/agent-think-tool_useapache-2.0hf download ru-dataset/agent-think-tool_use --repo-type dataset
jdaddyalbs/playwright-mcp-toolcallingmithf download jdaddyalbs/playwright-mcp-toolcalling --repo-type dataset

0.3 한국어

한국어 툴콜링 셋이다. Ko-functioncall이 규모 축이다.

데이터셋라이선스받기
jaeyong2/Ko-functioncall267,787apache-2.0hf download jaeyong2/Ko-functioncall --repo-type dataset
heegyu/glaive-function-calling-v2-formatted112,960미표기hf download heegyu/glaive-function-calling-v2-formatted --repo-type dataset
jaeyong2/function_call_temp_ko100,000미표기hf download jaeyong2/function_call_temp_ko --repo-type dataset
KKACHI-HUB/glaive-function-calling-ko gated14,909미표기hf download KKACHI-HUB/glaive-function-calling-ko --repo-type dataset
iknow-lab/hermes-function-calling-v1-ko10,237apache-2.0hf download iknow-lab/hermes-function-calling-v1-ko --repo-type dataset
iknow-lab/hermes-function-calling-v1-ko-cleaned10,237미표기hf download iknow-lab/hermes-function-calling-v1-ko-cleaned --repo-type dataset
irene93/function-calling-v3-datasets-korean3,260미표기hf download irene93/function-calling-v3-datasets-korean --repo-type dataset
exp-models/dolphin-r1-korean-deepseek-toolcalls1,758미표기hf download exp-models/dolphin-r1-korean-deepseek-toolcalls --repo-type dataset
iamjoon/ecommerce-function-calling-datasets-korean388미표기hf download iamjoon/ecommerce-function-calling-datasets-korean --repo-type dataset
jjun123/delivery-app-function-calling-datasets-korean30미표기hf download jjun123/delivery-app-function-calling-datasets-korean --repo-type dataset

0.4 대규모 믹스·코드 코퍼스

툴 스플릿을 품은 포스트트레이닝 믹스와, 코드 사전학습 원자재다.

데이터셋라이선스받기
OpenCoder-LLM/RefineCode-code-corpus-meta336,845,710mithf download OpenCoder-LLM/RefineCode-code-corpus-meta --repo-type dataset
OpenCoder-LLM/opc-fineweb-code-corpus100,920,235mithf download OpenCoder-LLM/opc-fineweb-code-corpus --repo-type dataset
bigcode/starcoder2data-extras51,633,798미표기hf download bigcode/starcoder2data-extras --repo-type dataset
nvidia/Nemotron-Post-Training-Dataset-v125,659,642cc-by-4.0hf download nvidia/Nemotron-Post-Training-Dataset-v1 --repo-type dataset
nvidia/Nemotron-Post-Training-Dataset-v2 gated6,341,414cc-by-4.0hf download nvidia/Nemotron-Post-Training-Dataset-v2 --repo-type dataset
argilla/magpie-ultra-v1.03,221,797미표기hf download argilla/magpie-ultra-v1.0 --repo-type dataset
allenai/Dolci-Instruct-SFT2,152,112odc-byhf download allenai/Dolci-Instruct-SFT --repo-type dataset
allenai/tulu-3-sft-olmo-2-mixture939,344odc-byhf download allenai/tulu-3-sft-olmo-2-mixture --repo-type dataset
allenai/tulu-3-sft-mixture939,343odc-byhf download allenai/tulu-3-sft-mixture --repo-type dataset
allenai/tulu-v3.1-mix-preview-4096-OLMoE608,042odc-byhf download allenai/tulu-v3.1-mix-preview-4096-OLMoE --repo-type dataset
HuggingFaceCode/stack-v3-trainodc-byhf download HuggingFaceCode/stack-v3-train --repo-type dataset
nvidia/Nemotron-SFT-Agentic-v2cc-by-4.0hf download nvidia/Nemotron-SFT-Agentic-v2 --repo-type dataset
bigcode/the-stack-v2 gatedotherhf download bigcode/the-stack-v2 --repo-type dataset
nvidia/Nemotron-AIQ-Agentic-Safety-Dataset-1.0otherhf download nvidia/Nemotron-AIQ-Agentic-Safety-Dataset-1.0 --repo-type dataset
nvidia/Llama-Nemotron-Post-Training-Datasetcc-by-4.0hf download nvidia/Llama-Nemotron-Post-Training-Dataset --repo-type dataset
nvidia/Nemotron-RL-agent-workplace_assistantcc-by-4.0hf download nvidia/Nemotron-RL-agent-workplace_assistant --repo-type dataset
nvidia/Nemotron-Agentic-v1cc-by-4.0hf download nvidia/Nemotron-Agentic-v1 --repo-type dataset
nvidia/Nemotron-CC-Code-v1 gatedotherhf download nvidia/Nemotron-CC-Code-v1 --repo-type dataset
nvidia/Nemotron-RL-Agentic-Indirect-Prompt-Injection-v1cc-by-4.0hf download nvidia/Nemotron-RL-Agentic-Indirect-Prompt-Injection-v1 --repo-type dataset

① 결론

있나요? 두 트랙 모두 공개 데이터가 존재한다. 터미널·CLI 쪽은 평가 전용 벤치마크(Terminal-Bench 1.0/2.0, SWE-bench 계열)와 별개로 학습 가능 풀이 확인됐다. SWE-smith 50,137태스크/128 repos, R2E-Gym-V1 8,101, SWE-rebench 21,336, SWE-Gym 2,438, Multi-SWE-RL 4,723의 RL·에이전트 풀이 있다. SFT 코퍼스로는 Terminal-Corpus 약 36.6만 개(최대 단일 신규 세트, CC-BY-4.0), NVIDIA 터미널 트래젝토리 31,111(630 ATCB), Nebius swe-agent-trajectories 80,036·openhands-trajectories 67,074, TerminalTraj 50,733, CommitPack shell 1,017,977커밋/25.1GB, NL2Bash 약 1만 쌍이 있다. pre-train급 원자재로는 Stack v2 Shell 10.68M files/19.82GB, Nemotron-CC-Code-v1 427.9B tokens가 있다. 툴콜링 쪽은 glaive-function-calling-v2 112,960, hermes-function-calling 11,578, xlam-function-calling-60k 60,000(auto-gated), ToolACE 11,300, Nemotron tool_calling split 310,051, Agent-FLAN 34,435, UltraData-SFT-Agent-2609 약 50만 등이 HF API 실측(2026-09-19)으로 확인됐다. 한국어는 jaeyong2/Ko-functioncall 267,787(Apache-2.0)이 주력이고, heegyu/glaive-function-calling-v2-ko 15,170, iknow-lab/hermes-ko 10,237이 보조다. 한국어 터미널 벤치마크·학습셋은 이 원장의 검색 범위 내에서 확인되지 않았다.

구할 수 있나요? 무료 풀만으로 cold-start SFT는 가능하다. Apache-2.0축(glaive + hermes + ToolACE)에 Nemotron tool_calling 310,051을 규모축으로 얹고, Ko-functioncall을 한국어 주력으로 쓰면 된다. 다만 xlam은 auto-gated라 승인 대기가 필요하고, APIGen-MT-5k는 CC-BY-NC-4.0, fable5 계열은 AGPL-3.0, agentflanv2·zai-org/AgentInstruct는 라이선스 자체가 없어 상용 학습에서 제외해야 한다. 유료는 Surge가 유일하게 off-the-shelf agent/terminal/tool-use 카탈로그를 공개했고("Train first. Pay if it works." Trusted Program, SWE RL-env 빌더 시급 $100–$150+), Scale·Toloka·Appen 등 나머지 13개 벤더는 sales-led라 견적 미팅 없이 단가를 알 수 없다. 사내에는 이미 arbiter-sft 843 트래젝토리(clean-v1 489/4,663 tool_calls)와 arbiter-rl-env 240개 태스크(7 families)가 있고, 합성 자가증식 파이프라인(arbiter-post-training v21, synthesize→rollout→gate→format→assemble→train→serve→eval)도 갖춰져 있다.

프리·미드·포스트 어디에? 기본 배치는 포스트트레이닝(SFT cold-start 후 RL)이다. 조사한 9개 보고서 전원이 실제로 택한 경로다. "미드 이후, 롱컨텍스트 수준" 가설은 유력하지만 미검증이라, 결론이 아니라 측정 항목으로 싣는다. 9개 모델 카드·리포트 중 pre-training 단계 배치를 공개한 경우는 0건이고, GLM-4.5가 유일하게 장문맥·에이전트 훈련 단계(§2.3, 32K→128K 확장 구간, 100B 합산 버킷)를 공개한 유일한 모델이다. Qwen3는 툴콜링 데이터 전량을 Stage 4 General RL에 배치했고(§4.4, Table 22), Kimi K2는 대규모 agentic 합성 데이터(3,000+ MCP tools / 20,000+ synthetic tools)를 post-training에 두면서도 장문맥 annealing(400B@4k + 60B@32k, YaRN 128k)을 "towards the end of pre-training"에 뒀다. DeepSeek-V3/R1은 툴콜링 카테고리 자체가 없고 agentic을 "known gap/future work"로 남겼다. 단 이 판정은 모델 카드 공개분에 근거한 추론(가설 등급 B)이다. 사내 마이크로 어닐 A/B(미드 1–2% 혼합 vs SFT-only, BFCL v3 + τ² + TB 2.0 + held-out OrderSheet, 2 seeds)로 검증한 뒤 채택하는 것이 전제 조건이다.

---

② 터미널·CLI 트랙

2.1 벤치마크 카탈로그

벤치마크규모·구성라이선스상태·순위비고
Terminal-Bench 1.0 [S1][S4][S8]80 tasks (core v0.1.1)Apache-2.0은퇴(retired). 최종 1위 Apex2 + claude-sonnet-4.5 64.5%±0.6 (2025-11-03)classic main 기준 original-tasks 241개 디렉터리 [S17]
Terminal-Bench 2.0 [S321][S1219]89 tasks / 16 categories (최다 SWE 26)ICLR 2026 (arXiv 2601.11868, OpenReview a7Qa4CcHak). live 1위 GPT-5.5 + NexAU-AHE 84.7%±2.1 (2026-04-23, 리더보드 payload 2026-09-17) [S504]canary string 포함, 학습 데이터 미배포 명시
SWE-bench full [S29][S31][S37]2,294HF 실측 21,527행(2026-09-19)
SWE-bench Lite [S43]300 (공식)HF 실측 323행. 공식 300과 차이, 설명은 부록 §6
SWE-bench Verified [S48][S414]500OpenAI·Google 채택의 사실상 표준. 월간 다운로드 285,321회로 계열 최다HF 실측 500행 일치
SWE-bench Multimodal [S52][S61]사이트 517 / 논문 617 / 카드 스펙 612(dev 102+test 510) / 현재 권위 580(dev 100+test 480, HF 실측 2026-08-18) [S1435][S1441]수치 4종이 출처별로 다름. 귀속까지는 검증됨, 제거 내역·큐레이션 설명은 미해결(§6)chip--warn
SWE-bench Pro [S73][S77]1,865 problems / 41 repos, public 731 test rowsScaleAI; opencompass 미러 Apache-2.0 [S80]상용급 난이도 상위 세트HF 실측 731행
Multi-SWE-bench [S85][S86][S88]1,632 instances / 7개 언어CC0 + Apache-2.0 (ByteDance-Seed 카드는 other/0행)다언어 확장HF 실측 91행

Terminal-Bench 1.0은 core v0.1.1 기준 80 tasks로 확정된 최초의 공개 터미널 벤치마크로, Apache-2.0이고 현재는 은퇴(retired) 상태다. 최종 1위는 Apex2 + claude-sonnet-4.5의 64.5%±0.6(2025-11-03)이다. classic main 브랜치에는 original-tasks 디렉터리 241개가 남아 있어, core 80개로 정제되기 전 태스크 후보 풀의 원형을 제공한다. 리더보드 추이(wayback 실측 [S1091][S1095])는 35.2(2025-06-09) → 52.0(08-22) → 58.8(09-26) → 60.3(10-16) → 64.5(11-03)로, 5개월 사이 최고 점수가 거의 두 배로 올라 1.0은 포화 단계에 들어섰다.

Terminal-Bench 2.0은 89 tasks를 16개 카테고리로 나누고 이 중 SWE가 26개로 최다 비중이다. ICLR 2026에 게재됐고(arXiv 2601.11868, OpenReview a7Qa4CcHak), canary string을 심어 학습 데이터 유입을 추적하며 태스크 학습 데이터는 배포하지 않는다고 명시했다. live 리더보드 1위는 GPT-5.5 + NexAU-AHE 84.7%±2.1(2026-04-23 측정, payload 2026-09-17 확인)로, 난이도를 올린 2.0에서조차 84.7%까지 도달해 포화가 다시 진행 중임을 보인다. Terminal-Bench 4.0은 2026-08-28 릴리스가 확인됐다(✔ [S1269]); 다만 "생태계가 4.0으로 이동 중"이라는 주장은 미검증이라 부록 §6으로 보낸다.

SWE-bench 계열. full 2,294가 원조이고, Lite 300(공식)이 경량 평가, Verified 500이 OpenAI·Google이 채택한 사실상 표준이다. Verified는 월간 다운로드 285,321회로 계열 최다를 기록해 평가축으로서의 지위를 보인다. Multimodal은 출처별로 수치가 네 가지(사이트 517 / 논문 617 / 카드 스펙 612 / 현재 권위 580)로 갈리는데, 귀속까지는 검증됐지만 제거 내역·큐레이션 설명은 미해결이라 §6에 둔다. Pro는 ScaleAI가 만든 상용급 상위 세트로 1,865 problems/41 repos 중 public 731 test rows가 열려 있고 opencompass 미러가 Apache-2.0이다. Multi-SWE-bench는 1,632 instances/7개 언어로 다언어 확장이며 CC0 + Apache-2.0인데 ByteDance-Seed 카드는 other/0행이다.

princeton-nlp HF org에는 라이선스 태그가 없다. 이는 검증된 부재이므로 <span class="chip chip--error">라이선스 없음</span> 등급을 유지한다. 벤치마크 코드와 태스크 정의는 Apache-2.0이지만, HF 데이터셋 카드 차원의 라이선스 표기는 없다는 뜻이다.

HF 실측 요약(2026-09-19, MM만 2026-08-18). 계열별 HF API 실측 행수는 full 21,527 / Lite 323 / Verified 500 / MM 580 / Pro 731 / Multi-SWE-bench 91이다. Verified 500만 공식치와 정확히 일치하고, 나머지는 문서치와 실측이 어긋난다. full은 2,294 문제 정의 대비 21,527행(행이 문제보다 많은 구조), Lite는 300 대비 323, MM은 580(현재 권위), Pro는 public 731, Multi-SWE-bench는 1,632 instances 대비 91행이다. 이 어긋남은 데이터셋이 '문제 단위'가 아니라 '인스턴스·스플릿·미러 단위'로 적재되는 방식 차이에서 비롯된다. 평가 재현에는 반드시 실측 행수 기준으로 스플릿을 고정해야 한다. 각 벤치마크가 재는 것은 다르다. Terminal-Bench는 샌드박스 터미널에서의 태스크 완수율을, SWE-bench는 실제 GitHub 이슈에 대한 패치 생성의 검증 통과율을 잰다. 전자가 '명령 실행 능력'이라면 후자는 '코드 수정 능력'에 가깝고, 둘은 상호보완적이라 어느 하나로 다른 하나를 대체할 수 없다.

TB 2.0 카테고리와 SWE-bench Pro. 2.0의 16개 카테고리 중 SWE가 26개로 최다인 것은 터미널 벤치가 소프트웨어 엔지니어링 태스크로 무게중심을 옮겼음을 보인다. SWE-bench Pro는 1,865 problems/41 repos 중 public 731 test rows만 열어, 나머지는 held-out으로 닫아 평가 오염을 막는 구조다. 공개분으로 개발하고 비공개분으로 최종 채점하는 방식이다. Multi-SWE-bench의 7개 언어 확장은 Python 중심이던 SWE-bench를 다언어로 넓힌 것이다.

2.2 Harbor 레지스트리·하네스 실측

Harbor는 "3,500+ verified Docker environments"를 표방하지만, registry.json 실측(2026-09-19)은 13,654,627 bytes / 80 entries / 'train' 문자열 155회 / 'RL' 2회 / task 합산 51,625다 [S3][S21][S1017][S1023][S1033][S1318]. 고유 env 수와 "3,500+" 표기의 관계는 미해결(§6). 하네스는 약 50개 agent adapter + 87개 benchmark adapter를 제공하고 Apache-2.0이며, ATIF 포맷(trajectory.json + result.json)으로 궤적을 기록한다. first-party harbor.rl은 아직 unmerged DRAFT PR #1291 상태 [S1029]라 RL 학습은 SkyRL adapter 경유가 현실 경로다 [S1030]. registry.json의 'train' 155회·'RL' 2회라는 분포는 이 레지스트리가 평가보다 학습용 태스크를 이미 상당량 담고 있다는 신호다. 80 entries가 task 합산 51,625를 낳는 구조는 entry당 다수 task variant를 묶는 방식임을 시사한다.

어댑터 생태계. 약 50개 agent adapter는 서로 다른 에이전트 프레임워크를 같은 하네스에 꽂고, 87개 benchmark adapter는 서로 다른 벤치마크를 같은 실행기로 돌린다. ATIF(trajectory.json + result.json)는 이 실행의 산출물 포맷이라, 어떤 adapter로 돌려도 같은 구조의 궤적이 떨어진다. 이 통일 포맷 덕에 Harbor에서 돌린 궤적은 그대로 SFT/RL 학습 데이터로 변환할 수 있다. 다만 first-party RL(harbor.rl)이 DRAFT PR #1291에 머물러 있어, 공식 RL 경로는 아직 SkyRL 같은 서드파티 adapter에 의존한다.

2.3 학습 가능 풀 (RL·에이전트 환경)

규모단가·비용라이선스실측·비고
SWE-smith [S279][S280][S281]50,137 태스크 / 128 repos총 $1,360 (후보 2.32¢/개, 이슈당 2.54¢)HF 실측 59,136행. NeurIPS 2025 D&B Spotlight
SWE-Gym [S285][S290]2,438 / 11 repos"$1+/task"소규모·저단가
R2E-Gym-V1 [S291][S1069][S1070]8,101 ("8.7K"는 arXiv 초록 잔여치)Docker 300–500MB/envSubset 4,578 = SWE-Bench test-repo overlap 제거본. reward 경고: "테스트 20% 미만만 정답/오답 구별", reward hacking 주의
SWE-rebench [S297][S299][S300]21,336 test-splitCC-BY-4.0HF 실측 27,878행. 지속 갱신형
SWE-bench-extra [S301][S302]문서 6,415 vs HF 실측 6,376 (39건 불일치)불일치 설명은 §6
Multi-SWE-RL [S304][S305]4,723CC0 + ByteDance IP carve-out<span class="chip chip--warn">IP 예외조항</span>. eval mini 400 / flash 300
NL2Bash [S307][S308]~10k 쌍 (split 8,090/609/606 = 9,305)MIT자연어→bash
tldr-pages [S309][S310]6,414 / 1,845 / 928MIT커맨드 예제
InterCode-Bash [S311][S312]eval 24 tasks (200 curated)MIT평가용 소형
CommitPack shell [S313]1,017,977 commits / 25.1GB커밋 단위
Stack v2 Shell [S314]10.68M files / 19.82GBpre-train급 원자재
Nemotron-CC-Code-v1 [S316]427.9B tokensshell breakdown 부재(검증된 부재, inline 유지)

"ShellBench"라는 이름의 벤치마크는 존재하지 않음이 확인됐다(✔ 부재 검증). bash·CLI 계열은 벤치마크보다 코퍼스 중심으로 존재한다.

SWE-smith는 이슈당 2.54¢라는 단가로 128개 repos에서 50,137 태스크를 총 $1,360에 구축한 사례라, 사내 합성 파이프라인의 단가 벤치마크로 쓸 수 있다. 후보 생성은 2.32¢/개, 최종 이슈화는 2.54¢/개다. HF 실측은 59,136행으로 문서치 50,137보다 많다. NeurIPS 2025 D&B Spotlight를 받아 방법론적 신뢰도도 높다. R2E-Gym의 reward 경고("테스트 20% 미만만 정답/오답 구별")는 이 풀을 RL에 쓸 때 reward hacking 필터가 필수라는 뜻이며, Docker 이미지가 env당 300–500MB라 인프라 비용도 계산에 넣어야 한다. Subset 4,578은 SWE-Bench test-repo overlap을 제거한 본으로 평가 오염을 피한다. SWE-rebench는 CC-BY-4.0에 지속 갱신형이라 장기 공급원으로 적합하고, test-split 21,336이 문서치지만 HF 실측은 27,878행이다. Multi-SWE-RL은 CC0지만 ByteDance IP carve-out이 있어 <span class="chip chip--warn">IP 예외조항</span> 검토가 필요하고, eval은 mini 400 / flash 300으로 나뉜다. SWE-bench-extra는 문서 6,415와 HF 실측 6,376이 39건 어긋나 불일치 설명을 §6에 둔다.

bash·CLI 코퍼스 상세. NL2Bash는 자연어→bash 약 1만 쌍(split 8,090/609/606=9,305)의 MIT 코퍼스로, 터미널 명령 생성의 고전 기준선이다. tldr-pages는 6,414/1,845/928의 커맨드 예제를 MIT로 제공해 커맨드 사용법 파악에 쓴다. InterCode-Bash는 eval 24 tasks(200 curated)의 MIT 평가용 소형 세트다. CommitPack shell은 1,017,977커밋/25.1GB로 커밋 단위 변경 이력을 담고, Stack v2 Shell은 10.68M files/19.82GB의 pre-train급 원자재다. Nemotron-CC-Code-v1은 427.9B tokens의 대형 코드 코퍼스지만 shell breakdown이 부재해(검증된 부재) shell 비중을 따로 뽑을 수는 없다. 이 코퍼스들은 트래젝토리가 아닌 정적 텍스트라, 에이전트 행동 데이터로 쓰려면 §5.3 합성 파이프라인을 거쳐야 한다. 규모는 Stack v2 Shell > CommitPack shell > NL2Bash > tldr-pages 순이지만, 용도는 pre-train 원자재(Stack v2, CommitPack)와 명령-자연어 매핑(NL2Bash, tldr)으로 갈린다.

RL 풀 선택 기준. 규모는 SWE-smith(50,137) > SWE-rebench(21,336) > R2E-Gym(8,101) > Multi-SWE-RL(4,723) > SWE-Gym(2,438) 순이지만, 선택은 규모가 아니라 ① reward 신뢰도 ② 환경 비용 ③ 평가 오염으로 결정한다. reward 신뢰도는 R2E-Gym이 '테스트 20% 미만만 정답/오답 구별'이라는 경고 때문에 가장 낮고, 환경 비용은 R2E-Gym의 Docker 300–500MB/env가 가장 크다. 평가 오염은 R2E-Gym-Subset 4,578이 SWE-Bench test-repo overlap을 제거해 가장 잘 통제했다. 단가는 SWE-smith(2.54¢/이슈)가 유일하게 공개됐고 SWE-Gym('$1+/task')이 그 뒤를 잇는다. 사내 RL-env(240 tasks)와 조합할 때는 SWE-rebench(CC-BY-4.0, 지속 갱신)를 장기 공급원으로, SWE-smith를 단가 벤치마크로 쓴다.

2.4 트래젝토리 카탈로그

세트규모라이선스비고
Terminal-Corpus [S317]~366kCC-BY-4.0최대 단일 신규 SFT 코퍼스
TerminalTraj [S318]50,733라이선스 미기록 → §6
SWE-smith-trajectories [S324][S325]HF 76,002MIT실학습 사용은 5,017(17.3%) → SWE-agent-LM-32B가 Verified 40.2% pass@1 달성 [S326]. 76,002↔5,017 선별 기준은 §6
OpenHands 3종 [S327][S329][S330]Sampled 6,055 / SFT 491 (MIT) / Verifier 5,272 (2,636+1,750+886)SFT만 MIT 명시나머지 라이선스는 §6
Nebius openhands-trajectories [S331]67,074CC-BY-4.0
Nebius swe-agent-trajectories [S332]80,036
TMax [S471][S476]"14,601"은 RL env count이지 트래젝토리 수가 아님code Apache-2.0 / data odc-byhardening: repair 4종, --filter-solved (pass@16>0), 13-gram decontamination
NVIDIA agentic-RL pivot 3종 [S333][S334][S335]Function-Calling 9,620 / Conversational Tool-Use 96,968 / Terminal 31,111·630 ATCB전부 CC-BY-4.0터미널 트래젝토리의 공개 최대 묶음 중 하나
HVTB [S336]2,225 traces / 89 envs
UltraData-SFT-Agent-2609 [S1252]~500,000 / 4 configsApache-2.0대형 합성 SFT
DeepSWE-Preview 풀 [S1357][S1358][S1360]R2E-Gym-Subset 4,578 사용Qwen3-32B pure RL → Verified 59% (TTS Best@16). 규모 표기 주장은 §6

Terminal-Corpus 약 36.6만 개(CC-BY-4.0)는 이번 조사에서 확인된 최대 단일 신규 SFT 코퍼스로, 터미널 명령 궤적을 대규모로 모은다. TerminalTraj 50,733은 라이선스가 미기록이라 §6에 두고 상용 투입 전 확인이 필요하다. SWE-smith-trajectories는 HF에 76,002개가 있지만 실제 SWE-agent-LM-32B 학습에는 5,017개(17.3%)만 쓰였고, 그 선별본으로 Verified 40.2% pass@1을 찍었다. 전량 투입보다 선별이 중요하다는 방증이다. OpenHands는 Sampled 6,055 / SFT 491 / Verifier 5,272(2,636+1,750+886)의 3종으로 나뉘고 SFT만 MIT가 명시됐다. TMax의 "14,601"은 트래젝토리가 아니라 RL 환경 수라는 점에 주의해야 한다. TMax hardening은 repair 4종, --filter-solved(pass@16>0인 태스크만 유지), 13-gram decontamination으로 구성되고 코드는 Apache-2.0·데이터는 odc-by다. TMax의 자기보고 수치("T1 64.0% TB 2.1 (base 43.8)", referent 미설명, "strongest open RL recipe", TMax-9B "10B 미만 최강")는 ✖ 미검증이라 본문 주장에서 제외하고 §6에만 둔다. DeepSWE-Preview는 Qwen3-32B에 pure RL만 적용해 Verified 59%(TTS Best@16)를 기록했고, 풀은 문서상 R2E-Gym-Subset 4,578이다. NVIDIA의 Terminal split 31,111(630 ATCB)은 터미널 트래젝토리로는 공개 최대 묶음 중 하나이며 전부 CC-BY-4.0이다. HVTB는 2,225 traces/89 envs로 소규모지만 환경 다양성이 있다. UltraData-SFT-Agent-2609는 약 50만 개/4 configs의 Apache-2.0 대형 합성 SFT 세트다.

트래젝토리 선별 기준. 이 카탈로그의 공통 교훈은 '전량보다 선별'이다. SWE-smith-trajectories가 76,002 중 5,017(17.3%)만으로 Verified 40.2%를 낸 것이 대표적이고, TMax의 --filter-solved(pass@16>0인 태스크만 유지)는 같은 논리를 필터로 구현한 것이다. 선별 기준은 ① solved 여부(풀린 태스크만) ② decontamination(13-gram으로 평가 세트와 중복 제거) ③ repair(깨진 궤적 4종 복구)의 세 축으로 정리된다. 사내 arbiter-sft도 887→515→489로 정제되며 같은 선별 논리를 따른다. 트래젝토리를 살 때는 '총 개수'가 아니라 '선별 후 유효 개수'를 기준으로 단가를 계산해야 한다.

2.5 RL 리포트: 랩 정책과 부재 주장

OpenAI GPT-5-Codex 카드(2025-09-15)는 real-world coding에 RL을 명시했고, GPT-5.1-Codex-Max는 user model + 첫 Windows 환경을 밝혔다. 공개 아티팩트는 eval-only(SWE-Lancer 1,400+ tasks, $1M 규모)이며 Codex CLI는 Apache-2.0이다 [S1534][S1535]. Anthropic은 consumer는 설정 on이면 학습에 사용, commercial은 선택 시에만 사용하며, /feedback은 5년·surveys는 6개월 보관한다. Opus 4.5 카드는 opted-in data + RLHF/RLAIF를 명시했고, Petri 112 benign tasks를 공개했다 [S1540][S1544][S1545][S1552].

"공개 한국어 터미널 벤치마크·학습셋이 없다"는 주장은 COUNTER 검색을 수행했으나 strictest sense에서는 UNCONFIRMED 잔여가 남는다(§6 참조). OpenAI·Anthropic의 터미널 학습 데이터 부재 주장 역시 같은 등급의 잔여가 있어 §6에 둔다. Anthropic consumer의 default opt-out UI 현재 상태도 §6이다.

정책이 데이터 확보에 주는 의미. OpenAI와 Anthropic 모두 학습 데이터 원천을 opt-in/opt-out 구조로 공개했을 뿐, 터미널·툴콜링 전용 학습 코퍼스를 외부에 배포하지는 않는다. OpenAI가 공개하는 것은 SWE-Lancer 같은 eval-only 아티팩트와 Apache-2.0 Codex CLI 도구뿐이고, Anthropic이 공개하는 것은 Petri 112 benign tasks 같은 평가 과제다. 즉 두 랩 모두 '평가는 열고 학습 원료는 닫는' 전략이라, 사내가 터미널 학습 데이터를 얻으려면 이들 랩의 공개분에 기댈 수 없고 §2.3–2.4의 오픈 풀이나 §5.2의 벤더, §5.3의 자가 합성으로 돌아서야 한다. consumer 데이터는 설정 on 시 학습에 쓰이지만 commercial은 선택제라, 기업 고객 데이터가 학습에 흘러들지 않는다는 점은 사내 데이터 위생 기준을 잡을 때 참조할 만하다.

OpenAI·Anthropic 데이터 정책 비교. OpenAI는 GPT-5-Codex 카드에서 real-world coding RL을 명시했지만 학습 원료는 공개하지 않고, Anthropic은 Opus 4.5 카드에서 opted-in data + RLHF/RLAIF를 명시하면서도 consumer/commercial을 구분해 commercial은 기본 미사용이다. 보관 기간은 Anthropic이 /feedback 5년·surveys 6개월로 밝힌 반면 OpenAI는 이 원장 범위에서 확인되지 않았다. 두 랩 모두 터미널 전용 학습 코퍼스는 외부 배포가 없어, 사내는 이들의 정책을 '데이터 소스'가 아니라 '데이터 위생 기준의 참조'로만 쓴다.

2.6 사내 보유 포인터

사내 arbiter-sft 실측(2026-09-19): train.jsonl 843 트래젝토리 / 8,246 tool_calls(read 5,646·bash 1,987·write 352·edit 261, turns 2/23/165, 101.9MB). 정제본 clean-v1 489 / 4,663(read 3,495·bash 868·edit 183·write 117, 62.0MB), sysfix 489(+system 489, 65.1MB). manifest 정제 경로 887→515(invalid 1,195, bash 'command' missing 372건 drop, 914건 repaired)→최종 489/26. 소스는 full-edit-run·full-create-run·interview-full2·live-interview. roles 분포 user 1,182 / assistant 13,415 / tool 8,246. read-편중 68%가 구조적 특징이다. 상세 표는 §5.3에 두고 여기서는 수치만 인용한다. arbiter-rl-env corpus v1은 240 tasks(174 train / 66 heldout, commit b4eede06, PR #654)다.

---

③ 툴콜링 트랙

3.1 벤치마크 지형: 3세대

1세대(정적 API 호출). API-Bank는 73 APIs / 314 dialogues / 753 calls, MIT로, 툴콜링 평가의 출발점이다 [S147][S148]. Gorilla APIBench는 1,645(HF 925/TorchHub 95/TF 626) 규모에 AST matching으로 정답을 채점해 문자열 매칭보다 견고하다 [S150][S151]. Nexus는 9 tasks 중 8개만 공개됐고 라이선스가 없다 [S153][S154].

2세대(에이전트·멀티턴). BFCL v4 live(Last Updated 2026-04-12)는 agentic web search 100 Q + memory 155를 추가했고, 1위는 Claude-Opus-4-5-20251101 (FC) 77.47%(2026-09-19 확인)다 [S124][S125][S135]. Apache-2.0. HF mirror는 v3에서 정지(2026-04-29)됐다. v4 오염 지적(16.7% near-duplicate + 68.8% exact repeats [S136][S137])이 있어 <span class="chip chip--warn">오염 주의</span> 등급이며, 사내 판정은 오염 이전인 v3 기준을 유지한다. τ-bench v1은 retail 115 + airline 50, τ²-bench는 telecom 2,285(test 40)이며 둘 다 MIT, 궤적을 공개하고, τ²는 Gymnasium RL interface를 제공해 RL 학습 환경으로 직결된다 [S97][S98][S100][S101]. splits는 retail 74/40·airline 30/20·telecom 74/40(base 114, small=20, full=2,285). τ³-bench(banking+voice)로 계보가 이어진다. ToolBench는 16,464 APIs / 126,486 instances(3,451 tools, 469,585 calls)로 최대 규모이고, ToolEval의 인간 일치율은 87.1%/80.3%, StableToolBench는 765/1,100 solvable이다 [S138][S139][S140][S146]. ComplexFuncBench는 HF는 Apache-2.0이나 GitHub 코드 라이선스가 없다 [S155][S156]. MTU-Bench repo(X-LANCE/MTU-Bench)는 404 [S157]. ACEBench는 2,000 [S158][S159]. T-Eval은 553→23,305(lovesnowbest/T-Eval Apache-2.0)로 확장됐다 [S160][S161]. ToolSandbox는 test scenarios 수치가 미검증이라 본문에 싣지 않는다(§6) [S162][S163].

3세대(MCP). MCP-Bench 104 tasks / 28 servers / 250 tools / 20 LLMs [S164][S165]. MCPToolBench++ 1,509 instances [S166]. LiveMCPBench 95 tasks / 70 servers / 527 tools(Claude-Sonnet-4 78.95%) [S167][S168]. MCP-Universe 231 tasks / 6 servers / 11 LLMs(GPT-5 43.72%) [S169][S170]. MCPMark 127+50, Apache-2.0 [S171][S173].

MCP 벤치마크 비교. MCP-Bench(104 tasks/28 servers/250 tools/20 LLMs)는 서버·툴 수가 가장 많고, MCPToolBench++(1,509 instances)는 인스턴스 규모가 가장 크다. LiveMCPBench(95/70/527)는 Claude-Sonnet-4 78.95%를, MCP-Universe(231/6/11)는 GPT-5 43.72%를 기준점으로 공개해 난이도 차이를 보인다. 같은 MCP라도 벤치마다 최고 점수가 43.72~78.95%로 갈리므로, 어느 MCP 벤치를 쓰는지가 평가 결과를 좌우한다. MCPMark(127+50, Apache-2.0)는 라이선스가 확인된 소수의 MCP 세트다.

리더보드 위생. ToolBench frozen 2023-09-29, StableToolBench static 2024-03-19, ToolEval 페이지 미렌더링(CSV 404), stabletoolbench.github.io·openbmb ToolBench leaderboard 404 [S174][S175][S176][S177][S178]. 정지된 리더보드는 인용 시점을 명시해야 하고, 404가 난 페이지는 수치 인용에서 제외한다.

Qwen3-32B 사내 실측: in-house ToolUse* +15.1/+13.3 vs BFCL v3 +1.9/+1.5로, 공개 벤치보다 사내 세트에서 순증분이 크다 [S728][S730]. 이는 공개 벤치가 이미 학습 분포에 오염됐을 가능성과, 사내 held-out 세트(OrderSheet) 유지의 필요성을 동시에 시사한다.

세대 전환의 의미. 1세대(API-Bank·Gorilla·Nexus)는 정적 API 호출의 정확도를 재고, 2세대(BFCL·τ-bench·ToolBench)는 멀티턴 에이전트 상호작용과 환경 상태를 재며, 3세대(MCP 계열)는 Model Context Protocol 서버와의 실시간 연동을 잰다. 세대가 올라갈수록 평가가 '정답 문자열 매칭'에서 '환경과의 상태 전이'로 이동해, 학습 데이터도 단발 호출 로그보다 궤적 단위가 중요해진다. τ²-bench가 Gymnasium RL interface를 제공하는 것은 이 흐름의 대표 사례로, 평가 세트가 곧 RL 학습 환경이 된다. BFCL v4의 오염 지적(16.7% near-duplicate + 68.8% exact repeats)은 live 벤치마크가 학습 분포에 흡수될 때 생기는 고전적 문제라, 사내 판정을 v3로 고정한 것은 이 오염을 피하기 위해서다. 리더보드 위생 점검에서 404·정지가 확인된 페이지(ToolBench frozen, StableToolBench static, ToolEval 미렌더링, openbmb 404)는 더 이상 갱신되지 않으므로, 이들 수치를 인용할 때는 '측정 시점'을 반드시 함께 적는다.

3.2 무료 학습 데이터셋 원장

세트규모라이선스DL(월)비고
glaive-function-calling-v2 [S211][S212]112,960apache-2.055,138cold-start 주력
hermes-function-calling [S213]11,578 (5 configs: 1893+1893+5209+1342+1241)apache-2.062,347
xlam-function-calling-60k [S214][S215][S218]60,000cc-by-4.036,664<span class="chip chip--warn">auto-gated</span>, 승인 필요
APIGen-MT-5k [S219]5,000cc-by-nc-4.0<span class="chip chip--error">NC, 상용 제외</span>
ToolACE [S220][S222][S225]11,300apache-2.025,889
Nemotron tool_calling split [S226]310,051 / 전체 25,659,642cc-by-4.017,085규모축
tulu-3-sft-mixture [S229]939,343odc-by66,929function-calling subset 없음(정정)
magpie-ultra-v1.0 [S230]999,960 / 621,837license ?tool-calling split 없음
orca-agentinstruct-1M-v1 [S232]1,046,410 / 15 splitscdla-permissive-2.0tool-usage 없음(정정)
Agent-FLAN [S233]34,435 / 7 splitsapache-2.0
zai-org/AgentInstruct [S235]1,866라이선스 없음
ToolBench 학습셋 [S236][S239]126,486 (G2/G3 멀티턴)apache-2.0Google Drive/Tsinghua 경유
NVIDIA FC/CTU [S333][S334]9,620 / 96,968cc-by-4.0
UltraData-SFT-Agent-2609 [S1252]~500,000 / 4 configsapache-2.0

두 가지 정정이 있다. tulu-3-sft-mixture(939,343, odc-by)는 function-calling subset이 없고, orca-agentinstruct-1M-v1(1,046,410, cdla-permissive-2.0)도 tool-usage split이 없다. 둘 다 대규모지만 툴콜링 전용으로는 쓸 수 없다. glaive 112,960과 hermes 11,578은 Apache-2.0에 다운로드도 각각 55,138·62,347으로 높아 cold-start 주력이다. hermes는 5 configs(1893+1893+5209+1342+1241)로 나뉜다. xlam 60,000은 cc-by-4.0이지만 auto-gated라 승인 후 투입한다. Nemotron tool_calling split 310,051(전체 25,659,642 중)은 규모축으로 쓴다. ToolBench 학습셋 126,486(G2/G3 멀티턴)은 Apache-2.0이지만 Google Drive/Tsinghua 경유라 미러 안정성을 확인해야 한다. Agent-FLAN 34,435/7 splits도 Apache-2.0이다. 멀티턴 보조로는 BUTTONInstruct 8k [S240], ToolDial 11,111(avg 8.95 turns, MIT code) [S241], DialogTool ~16k/33k turns [S242]가 있다. "MT-ToolBench"는 부재 확인(§6). ToolFlow는 8,000 synthetic dialogues + 16,000+ ToolBench APIs로 LLaMA-3.1-8B를 GPT-4 수준까지 끌어올렸다는 보고가 있다 [S243][S244][S245]; "ToolFlow-Dataset-20K" HF 존재는 미검증(§6).

원장 읽기. 이 원장에서 상용 cold-start에 바로 쓸 수 있는 것은 라이선스가 확인된 Apache-2.0·CC-BY-4.0축뿐이다. glaive(112,960)·hermes(11,578)·ToolACE(11,300)·Agent-FLAN(34,435)·UltraData(약 50만)·Nemotron tool_calling(310,051, CC-BY-4.0)·NVIDIA FC/CTU(9,620/96,968, CC-BY-4.0). xlam(60,000)은 CC-BY-4.0이지만 auto-gated라 승인이 선행돼야 하고, APIGen-MT-5k(NC)·fable5(AGPL)·agentflanv2·zai-org(라이선스 없음)는 제외다. 대규모라도 tulu-3(odc-by)·orca-agentinstruct(cdla)는 툴콜링 전용 split이 없어 이 트랙에서는 제외한다. 다운로드 지표는 hermes 62,347 > glaive 55,138 > tulu-3 66,929 > xlam 36,664 > ToolACE 25,889 > Nemotron 17,085 순으로, 커뮤니티 채택이 높은 세트가 곧 검증된 세트는 아니지만 참고는 된다.

멀티턴 보조 세트. BUTTONInstruct 8k, ToolDial 11,111(avg 8.95 turns, MIT code), DialogTool ~16k/33k turns는 단발 호출이 아닌 멀티턴 대화 툴콜링을 보강하는 보조 축이다. ToolDial의 avg 8.95 turns는 이 원장에서 가장 긴 평균 턴 수로, τ²-bench의 멀티턴 에이전트 훈련과 궁합이 맞는다. 이들은 규모가 작아 주력이 아니라, glaive·hermes 주력 조합에 멀티턴 분포를 더하는 용도다.

3.3 라이선스 함정

세트문제등급
APIGen-MT-5k [S219]CC-BY-NC-4.0<span class="chip chip--error">상용 불가</span>
fable5-traces-sft + rex099 [S246][S247]AGPL-3.0<span class="chip chip--error">카피레프트</span>
agentflanv2 [S248]라이선스 없음<span class="chip chip--error">사용 보류</span>
zai-org/AgentInstruct + NexusRaven [S235][S153]라이선스 없음<span class="chip chip--error">사용 보류</span>
saidutta69/fable-5-premium-v2 [S250]100k MIT 표기지만 Anthropic ToS 리스크(사내 조사)<span class="chip chip--warn">marginal</span>
magpie-ultra [S230]license ?<span class="chip chip--warn">확인 필요</span>
xlam [S214]auto-gated<span class="chip chip--warn">승인 대기</span>
fairyshine/Seal-Tools [S251]HF API 401<span class="chip chip--warn">접근 불가</span>

fable5 계열의 AGPL-3.0은 네트워크 배포까지 카피레프트가 미치므로 상용 서빙 학습 데이터로는 사실상 봉인이다. saidutta69/fable-5-premium-v2는 MIT 표기지만 원천 궤적이 Anthropic 모델 산출물이라 ToS 리스크가 남는다는 사내 조사 결과가 있어 marginal로 분류한다(외부 출처 번호 없음, 사내 조사). fairyshine/Seal-Tools는 HF API가 401을 반환해 접근 자체가 안 된다.

라이선스 판정 기준. chip 등급은 세 단계다. <span class="chip chip--ok">ok</span>는 상용 학습 가능(Apache-2.0·MIT·CC-BY-4.0), <span class="chip chip--warn">warn</span>은 조건부(auto-gated·license ?·ToS 리스크·IP carve-out), <span class="chip chip--error">error</span>는 상용 불가·보류(NC·AGPL·라이선스 없음)다. CC-BY-NC는 비상업 조항이 상용 학습을 막고, AGPL-3.0은 네트워크 배포 카피레프트가 서빙 모델에까지 미쳐 사실상 봉인이다. '라이선스 없음'은 저작권 기본 상태(전유)라 사용 보류가 원칙이고, 'license ?'는 확인 전까지 warn으로 둔다. saidutta69/fable-5-premium-v2처럼 표기(MIT)와 실질(Anthropic ToS)이 어긋나는 경우는 표기가 아니라 실질로 판정한다.

3.4 한국어 세트

세트규모라이선스비고
jaeyong2/Ko-functioncall [S252][S253]267,787apache-2.0한국어 주력
heegyu/glaive-function-calling-v2-ko [S255]15,170apache-2.0DL 148, single-source
heegyu mt [S256]15,170
iknow-lab/hermes-ko [S258]10,237cleaned 변형 라이선스 미표기
gyung/toolllama-korean [S259]1,524
songgot-tools-ko [S260]
ecommerce/delivery (iamjoon 388, jjun123 30) [S261][S262]418미표기 → §6
KKACHI-HUB [S263]14,909 (card)미확인, manual-gated
FunctionChat-Bench [S975][S976]SingleCall 500 + Dialog 45 + CallDecision 606Apache-2.0GPT-4 LLM-as-Judge. kakao org HF 미배포(GitHub만)

Ko-functioncall 267,787이 규모·라이선스 모두에서 한국어 주력이다. heegyu 세트는 Apache-2.0이지만 DL 148의 single-source라 다양성 검증이 필요하다. iknow-lab/hermes-ko 10,237은 cleaned 변형의 라이선스가 미표기다. ecommerce/delivery(iamjoon 388, jjun123 30, 합 418)는 라이선스 미표기라 §6에 둔다. KKACHI-HUB 14,909(카드 수치)는 manual-gated에 미확인이다. FunctionChat-Bench는 kakao가 GitHub에만 배포하는 한국어 평가 세트로, SingleCall 500 + Dialog 45 + CallDecision 606 구성에 GPT-4 LLM-as-Judge 채점이다. dneirfi/EDGE-KOPA는 "coming soon" 상태 [S267]. 한국어 터미널 전용 세트는 이번 검색 범위에서 확인되지 않았다.

한국어 세트 활용. Ko-functioncall 267,787을 주력으로 하되, single-source인 heegyu(15,170)·iknow-lab(10,237)은 다양성 보강용으로만 섞는다. FunctionChat-Bench는 평가 세트라 학습에 섞지 않고 held-out으로 둔다. SingleCall 500 + Dialog 45 + CallDecision 606이 한국어 툴콜링의 사내 판정축 중 하나가 된다. ecommerce/delivery(418)처럼 라이선스 미표기 소형 세트는 확인 전까지 제외한다. 한국어 터미널 세트가 없으므로, 터미널 한국어 데이터가 필요하면 Ko-functioncall로 툴콜링 한국어를 커버하고 터미널은 영어 궤적 + 사내 합성(§5.3)으로 메운다.

한국어 평가 축. 한국어 툴콜링 평가는 FunctionChat-Bench(SingleCall 500 + Dialog 45 + CallDecision 606)를 held-out으로 두고, GPT-4 LLM-as-Judge로 채점한다. kakao가 HF가 아닌 GitHub에만 배포하므로 미러를 로컬에 고정해 두어야 한다. KKACHI-HUB(14,909, 카드 수치)은 manual-gated라 승인 후 한국어 주력의 보조로 검토한다.

3.5 시사

cold-start SFT는 glaive + hermes + ToolACE(Apache-2.0축) 우선, Nemotron tool_calling 310,051을 규모축으로, xlam은 게이트 승인 후 투입, Ko-functioncall을 한국어 주력으로 배치한다. APIGen-MT-5k(NC)·fable5(AGPL)·agentflanv2(라이선스 없음)는 제외. 최종 평가 판정은 BFCL v3 + τ²-bench + held-out OrderSheet 조합이 사내 기준이다. BFCL v4는 오염 지적(16.7% near-duplicate)이 있어 v3를 쓰고, τ²는 Gymnasium RL interface로 RL 단계까지 재사용한다.

cold-start 조합 상세. glaive(112,960)는 단일·다중 호출이 섞인 범용 축, hermes(11,578)는 5 configs로 구조화된 궤적 축, ToolACE(11,300)는 다양한 API 조합 축으로 역할이 다르다. 여기에 Nemotron tool_calling(310,051)을 규모축으로 얹으면 30만+ 규모가 되고, Ko-functioncall(267,787)로 한국어를 커버한다. xlam(60,000)은 게이트 승인 후 추가한다. 이 조합의 총량은 약 70만+인데, §2.4의 '전량보다 선별' 교훈에 따라 전량을 쓰지 않고 도메인 정합·라이선스·손상 여부로 선별한 유효분만 투입한다.

---

④ 배치 판정: 프리/미드/포스트

4.1 권고 (placement-verdict 원문)

  1. Pre-training

    0%

    9개 보고서 중 goal-directed agent trajectory를 넣었다고 공개한 사례 없음. 자연 코드에 이미 툴 실행 흔적이 있다.

  2. Mid · long-context

    선택 · 측정 항목

    GLM-4.5만 32K→128K 단계에 합성 trajectory 투입을 공개. 규모·ablation 없음. 채택 시 혼합비 1–2%.

  3. Post · SFT

    주력

    K2 §3.1.1 대규모 agentic 합성, Llama 3 §4.3.5, SmolLM3가 전부 여기. cold-start로 포맷을 싸게 산다.

  4. Post · RL

    주력

    Qwen3 §4.4 전량 배치, K2 §3.2, Nemotron-H GRPO. 단 public BFCL v3 순증분은 +1.9로 작다(§4.3).

4.2 모델별 배치 표

모델배치 단계근거
Qwen3 [S728][S730]전량 Stage 4 General RL§4.4, Table 22
DeepSeek-V3/R1 [S937][S938]툴콜링 카테고리 자체 없음agentic은 "known gap/future work"
Kimi K2 [S743][S744]§3.1.1 대규모 agentic 합성(3,000+ MCP tools / 20,000+ synthetic tools)은 post-training; annealing 400B@4k + 60B@32k·YaRN 128k는 "towards the end of pre-training"이중 배치의 대표 사례
GLM-4.5 [S876][S1402][S1403]§2.3 Long-context & Agent Training 32K→128K100B 합산 버킷(agent 단독 비율 미공개 → §6)
Llama-Nemotron [S880][S881]post-training
Nemotron-H [S882][S883]post-training
OLMo 2 [S886][S887]mid-training annealing 계열
SmolLM3 [S889][S890]mid-training
Apertus [S892][S893]
Marin [S894][S895]
Llama 4 [S897][S898]W3 정정 대상§4.4
MiniMax-M1 [S899][S900]W3 정정 대상
Hunyuan-Large [S901][S902]W3 정정 대상
Seed-OSS [S903][S904]W3 정정 대상
Qwen3-Coder [S905][S906]W3 정정 대상
Qwen3-Coder-Next [S1247][S1248]W3 정정 대상

Qwen3는 툴콜링 데이터를 pre-training이나 mid-training이 아니라 Stage 4 General RL에 전량 배치했다(§4.4, Table 22). 이는 툴콜링을 정적 코퍼스가 아니라 RL 환경 상호작용으로 취급한다는 뜻이다. Kimi K2는 agentic 합성 데이터(3,000+ MCP tools, 20,000+ synthetic tools)를 post-training §3.1.1에 두면서, 장문맥 annealing(400B@4k + 60B@32k, YaRN으로 128k 확장)은 "towards the end of pre-training"에 배치해 pre/post 이중 구조를 보였다. 장문맥 능력은 pre-training 말미에, 에이전트 행동은 post-training에 심는 설계다. GLM-4.5는 §2.3에서 Long-context & Agent Training을 32K→128K 확장 구간으로 유일하게 명시한 모델이지만, 100B 합산 버킷이라 agent 단독 비율은 미공개다(§6). DeepSeek-V3/R1은 툴콜링 카테고리가 아예 없고 agentic을 "known gap/future work"로 남겨, 이 트랙의 데이터 배치 자체가 아직 공개 설계에 없음을 보였다. 이는 Qwen3(전량 RL 배치)·Kimi K2(이중 배치)·GLM-4.5(장문맥·에이전트 단계)와 대조되는 사례로, 툴콜링 배치가 모든 프론티어 랩의 공통 설계는 아니라는 점을 보인다. OLMo 2SmolLM3는 mid-training annealing 계열로 분류되지만 툴콜링 전용 배치 문구는 없고, ApertusMarin은 공개 카드만으로는 배치 단계를 읽을 수 없어 표를 비워 뒀다.

W3 정정 대상 6개 모델(Llama 4, MiniMax-M1, Hunyuan-Large, Seed-OSS, Qwen3-Coder, Qwen3-Coder-Next)은 초기 분류에서 배치 근거가 불충분했다. 이들은 코딩·에이전트 능력을 표방하지만, 툴콜링·에이전트 데이터가 프리/미드/포스트 중 어느 단계에 들어가는지 공개 카드만으로는 단정할 수 없다. 특히 Qwen3-Coder와 Qwen3-Coder-Next는 Qwen3 본계열과 달리 코딩 특화라 별도 추적이 필요하다.

배치 판정 방법론. 각 모델의 기술 리포트·모델 카드에서 툴콜링·에이전트 데이터가 어느 단계(pre-training / mid-training annealing / post-training SFT / RL)에 배치됐는지를 명시 문구로만 분류했다. 명시 문구가 없으면 '—'로 비우고, 초기 분류가 불충분했던 6개는 W3 정정으로 되돌렸다. 이 방법은 '공개된 문구가 말하는 것'만 주장하고 '실제로 했는지'는 주장하지 않는다. 공개되지 않았다는 사실과 하지 않았다는 주장은 다르기 때문이다. Qwen3의 Stage 4 General RL 전량 배치, Kimi K2의 pre/post 이중 배치, GLM-4.5의 장문맥·에이전트 단계 공개가 이 방법으로 읽어낸 세 가지 확정 사례다. 세 사례가 서로 다른 단계를 가리킨다는 점이 핵심이다. 프론티어 랩 사이에도 툴콜링 배치의 정답이 합의되지 않았고, 그래서 사내는 공개 추론을 그대로 따르는 대신 마이크로 어닐로 자체 검증하는 길을 택한다.

4.3 축소 주장 4건 (원문)

1. 9개 모델 중 pre-training 배치 공개 0건. Kimi K2 §1 기준, GLM-4.5가 유일한 공개 모델이다(§2.3). 2. Qwen3-32B tool-use 순증분: in-house +15.1/+13.3 vs BFCL v3 +1.9/+1.5. +15.1은 Stage-3 SFT +7.1 위의 누적치다. cold-start는 필수가 아니다(R1-Zero). 근거는 Qwen3 §4.7 Table 22다. 3. MiniCPM B-3: annealing 번들이라 순효과 미분리. GSM8K 31.8 vs 34.4 패배, HumanEval 44.5 vs 43.9 동률. 근거는 MiniCPM §5 Table 1 [S1412]다. 4. GLM-4.5의 100B 합산 버킷은 agent 단독 비율이 미공개라 인과 효과 분리가 불가하다(§6).

축소 주장 읽기. 이 4건은 '미드 배치가 우세하다'는 주장을 약하게 만드는 반증들이다. 1건(0건 공개)은 pre-training 배치의 직접 증거가 없음을, 2건(Qwen3 순증분)은 cold-start 없이도 RL로 툴콜링이 오름을, 3건(MiniCPM)은 annealing 번들의 순효과가 측정 불가임을, 4건(GLM-4.5)은 유일한 공개 모델조차 비율을 숨김을 보인다. 넷을 합치면 '미드 배치가 유일한 정답'이 아니라 '공개 증거가 부족해 사내 검증이 필요한 가설'이라는 결론에 도달한다. 이것이 §4.1 권고가 마이크로 어닐을 전제 조건으로 다는 이유다.

4.4 W3 정정 (원문)

  • Llama 4, MiniMax-M1, Hunyuan-Large, Seed-OSS, Qwen3-Coder, Qwen3-Coder-Next는 초기 분류에서 배치 근거가 불충분해 정정했다. 이들 모델의 툴콜링·에이전트 데이터 배치는 공개 카드만으로는 프리/미드/포스트를 단정할 수 없으며, 표의 해당 행은 "W3 정정 대상"으로 표기한다.

W3 정정의 의미. 6개 모델을 정정 대상으로 내린 것은 '배치를 모른다'가 아니라 '공개 카드만으로는 단정할 수 없다'는 정직한 표기다. 코딩·에이전트 능력을 표방하는 모델일수록 배치 문구를 공개하지 않는 경향이 있어, 이들의 실제 배치는 비공개 추론 영역에 남는다. 정정은 보고서의 신뢰도를 지키는 장치다. 근거 없는 분류를 남기는 것보다 '모른다'고 표기하는 편이 낫다.

4.5 사내 가설 등급

미드 배치 가설등급 B(공개 추론 + 부분 실측)다. 기본 권고인 포스트트레이닝 배치는 9개 보고서 전원의 실제 경로라 등급이 더 높다. 9개 모델 카드 전수와 Qwen3·GLM-4.5·Kimi K2의 명시 문구에 근거하지만, 사내 데이터(arbiter-sft 489)로의 실증은 마이크로 어닐 실험이 끝나야 확정된다. MiniCPM 사례(GSM8K 31.8 vs 34.4 패배)가 보여주듯 annealing 번들은 순효과 분리가 안 되므로, 공개 문구만으로 미드 우위를 단정하지 않는다.

가설 등급 체계. A는 사내 실측으로 확정, B는 공개 추론+부분 실측, C는 공개 문구만, D는 미검증이다. 미드 배치 가설은 B이고, 포스트트레이닝 기본 배치는 그보다 높다. 9개 모델 카드 전수(C급 근거)에 Qwen3-32B 사내 실측(+15.1/+13.3)이 부분 실측으로 붙었지만, arbiter-sft 489로의 A/B 실험이 끝나야 A로 올라간다. 이 등급을 각 주장에 붙이는 이유는, 독자가 '공개 문구 인용'과 '사내 검증 완료'를 구분하지 못하면 공개 추론을 확정 사실로 오독하기 때문이다. §4.6 마이크로 어닐이 B를 A로 바꾸는 유일한 경로다.

4.6 마이크로 어닐 설계 (원문)

  • Arm A: arbiter-sft clean-v1(489 traj / 4,663 tool_calls)을 long-context 데이터의 1–2%로 mid-stage 끝에 혼합.
  • Arm B: SFT-only 대조군.
  • 평가: BFCL v3 + τ²-bench + TB 2.0 + held-out OrderSheet, 2 seeds.
  • 판정: A가 both seeds에서 우위 → 미드 배치 채택.
  • 스택: arbiter-rl-env gate×D1–D5 스택 사용. SFT-era arbiter-reward-server는 사용하지 않는다.

설계 배경. Arm A의 1–2% 혼합비는 long-context 데이터 대비 툴콜링 궤적의 비중을 최소로 억제해, 장문맥 능력을 해치지 않으면서 에이전트 행동이 mid-stage에 심어지는지만 보기 위한 보수적 출발점이다. 489 트래젝토리라는 소규모 clean-v1을 쓰는 것은, 대규모 주입이 아니라 '배치 단계 자체의 효과'를 분리하기 위해서다. 데이터 양이 아니라 타이밍이 변수여야 한다. 평가축을 BFCL v3(툴콜링)·τ²(멀티턴 에이전트)·TB 2.0(터미널)·held-out OrderSheet(사내)로 나눈 것은, 미드 배치가 어느 표면에서 이득을 내는지를 분해하기 위해서다. SFT-era reward-server를 배제하고 rl-env gate×D1–D5를 쓰는 것은 보상 신호의 일관성을 RL 단계 기준으로 맞추기 위해서다.

4.7 신뢰도 프레이밍

이 섹션의 모든 배치 주장은 모델 카드·기술 리포트의 공개 문구에 귀속된다. "공개되지 않았다"는 사실과 "하지 않았다"는 주장은 다르며, 후자는 어디에도 싣지 않는다. 1–2% 혼합비와 2 seeds의 충분성은 미해결(§6)이라 실험 설계 확정 전에 재검토한다.

인용 원칙. 이 보고서의 모든 수치는 ① 공식 문서·카드 ② HF API 실측(2026-09-19, MM은 2026-08-18) ③ wayback·리더보드 payload ④ 사내 실측의 네 출처 중 하나에 귀속된다. 어느 출처에도 귀속되지 않는 수치는 본문에 싣지 않고 §6으로 내린다. 표 안의 [S#]는 §7 출처 목록과 1:1로 대응하며, 사내 실측(arbiter-sft, rl-env, post-training)은 외부 출처가 없어 번호 없이 '사내 실측'으로만 표기한다.

---

⑤ 확보 경로

5.1 요약

무료 풀(§2.3, §3.2)로 cold-start가 가능하고, 부족분은 유료 벤더 또는 사내 합성 파이프라인으로 메운다. 우선순위는 ① 사내 자산(arbiter-sft 489 + rl-env 240) ② 무료 Apache-2.0축(glaive+hermes+ToolACE+Ko-functioncall) ③ Surge(유일한 off-the-shelf) ④ sales-led 벤더 견적 순이다.

우선순위 근거. ① 사내 자산을 최우선에 두는 것은 라이선스 리스크가 0이고 도메인이 이미 맞춰져 있기 때문이다. ② 무료 Apache-2.0축은 비용 0에 즉시 투입 가능하지만 도메인 정합은 직접 검증해야 한다. ③ Surge는 유일한 off-the-shelf라 카탈로그에서 바로 주문 가능하지만 시급 $100–$150+의 비용이 든다. ④ sales-led 벤더는 견적 미팅 비용과 납기 리스크가 있어 마지막이다. 부족분이 '규모'면 ②로, '품질·도메인'이면 ③으로, '대량 커스텀'이면 ④로 간다.

5.2 유료 벤더 원장

벤더유형가격 공개비고
Scale AI [S564][S573]sales-led Data Engine없음SWE-bench Pro 무료 아티팩트 2종 제공
Surge AI [S574][S586]유일한 off-the-shelf agent/terminal/tool-use 카탈로그작업자 시급: SWE RL-env 빌더 $100–$150+/hr, 엘리트 $200–$400/hr"Train first. Pay if it works." Trusted Program. 효능 주장은 자기보고라 §6
Toloka [S429][S430][S1349][S1354]sales-led없음. /pricing은 ~2025-01-08 301 리다이렉트로 은퇴, arena-pricing 숫자 0건, "Talk to an expert" budget dropdown("under $25k…$200k+")
Appen [S439][S443][S723]sales-led없음. 사이트맵 1,213 URL 전수 조사, /pricing 404공개 가격 부재는 검증된 사실
Prolific [S444][S452]플랫폼수수료 42.8%/33.3%불일치 적용 조건은 §6
Mercor [S587][S594]플랫폼작업자 시급 공개시급 변동은 §6
Datacurve [S595][S598]
Turing [S599][S603]잡카드는 §6
Invisible [S604][S608]
Snorkel [S612][S623]Flow는 §6
Labelbox [S634][S639]문서 한정$0.10/LBU문서 작업 단가만 공개
Gretel [S663][S667]합성 → NVIDIA 인수인수가는 §6
Together (Refuel.ai 인수) [S651][S656]합성
Nebius [S657][S662]합성·트래젝토리openhands/swe-agent 트래젝토리 공개(§2.4)

읽기 포인트 3개. ① off-the-shelf는 Surge뿐이고 나머지는 전부 견적 미팅이 필요하다. Scale·Toloka·Appen은 가격 페이지 자체가 없거나 404다. ② 가격을 공개하는 곳은 작업자 시급(Surge $100–$150+/hr, Mercor)이나 문서 단가(Labelbox $0.10/LBU)처럼 단위가 제한적이라, 프로젝트 총액은 전부 별도 견적이다. ③ 합성 데이터 서비스는 M&A로 재편 중이라, 합성 벤더와 계약할 때는 인수 주체의 로드맵을 확인해야 한다.

Scale AI는 sales-led Data Engine 모델이라 공개 가격이 없지만, SWE-bench Pro라는 무료 아티팩트 2종을 제공해 상위 난이도 평가 축으로 활용할 수 있다. Surge AI는 이 원장에서 유일하게 agent/terminal/tool-use 카탈로그를 off-the-shelf로 공개했고, "Train first. Pay if it works." Trusted Program으로 진입 장벽을 낮췄다. 작업자 시급은 SWE RL-env 빌더 $100–$150+/hr, 엘리트 $200–$400/hr로 공개됐다. 다만 효능 주장은 벤더 자기보고라 본문 테이블에서 빼고 §6에만 둔다. Toloka는 /pricing이 ~2025-01-08에 301 리다이렉트로 은퇴했고 arena-pricing 페이지에 숫자가 0건이며 "Talk to an expert" budget dropdown("under $25k…$200k+")만 남아 있다. Appen은 사이트맵 1,213 URL을 전수 조사했으나 /pricing이 404로, 공개 가격 부재가 검증된 사실이다. Prolific은 수수료 42.8%/33.3% 두 값이 있고 적용 조건 불일치는 §6이다. Labelbox는 $0.10/LBU를 공개하지만 문서 작업 단가에 한정된다. Mercor는 작업자 시급을 공개하는 플랫폼으로, 시급 변동 폭은 §6에 둔다. Datacurve, Turing, Invisible은 카탈로그·가격을 공개하지 않아 견적 미팅이 필요하다(Turing 잡카드 내용은 §6). Snorkel은 Flow 제품군으로 프로그래매틱 레이블링을 제공하나 가격은 §6이다.

sales-led 벤더와의 견적 미팅 체크리스트. Scale·Toloka·Appen·Datacurve·Turing·Invisible처럼 가격을 공개하지 않는 벤더와는 견적 미팅이 필수인데, 이때 ① 태스크 단위 단가(궤적 1건·환경 1개 기준) ② 검수·재작업 포함 여부 ③ RL-env 빌드 가능 여부(Docker 환경 + verifier) ④ 납기와 최소 발주량을 우선 확인해야 한다. Surge만이 이 중 ③을 카탈로그로 공개했고(SWE RL-env 빌더 시급 $100–$150+), 나머지는 미팅에서 캐내야 한다. Toloka의 budget dropdown("under $25k…$200k+")은 발주 규모 구간을 간접 시사하므로 미팅 전 예산대를 가늠하는 참고가 된다.

벤더 유형 분류. 이 원장의 14개는 세 유형으로 나뉜다. ① 데이터 크라우드(Surge·Toloka·Appen·Prolific·Mercor·Datacurve·Turing·Invisible·Scale)는 사람이 태스크를 수행·검수한다. ② 합성 서비스(Gretel·Together·Nebius·Snorkel)는 모델·파이프라인으로 데이터를 만든다. ③ 플랫폼(Labelbox·Snorkel)은 도구를 빌려준다. 터미널·툴콜링 궤적은 '실행 환경에서의 검증 가능한 행동'이라 ① 중에서도 RL-env를 빌드할 수 있는 벤더(Surge)만이 직결하고, ②는 §5.3 사내 파이프라인의 외부 대안이다. ③은 데이터 자체가 아니라 생산 도구라 이 트랙의 주 공급원은 아니다.

합성 데이터 M&A 재편: Gretel→NVIDIA [S668][S676], Refuel.ai→Together [S677][S680], MOSTLY AI→Syntho, Synthesis AI 도메인 매물화 [S681][S684]. Gretel은 NVIDIA에 인수돼 합성 데이터 로드맵이 NVIDIA에 귀속됐고 인수가는 §6이다. Together는 Refuel.ai를 인수해 합성 파이프라인을 흡수했다. Nebius는 합성·트래젝토리 공급자로 openhands-trajectories 67,074과 swe-agent-trajectories 80,036을 공개해 §2.4의 무료 풀에도 이름이 있다.

5.3 사내 자산

arbiter-sft 변형 3종 (실측 2026-09-19):

변형트래젝토리tool_calls내역turns (min/median/max)크기
train.jsonl8438,246read 5,646·bash 1,987·write 352·edit 2612/23/165101.9MB
clean-v14894,663read 3,495·bash 868·edit 183·write 1172/20/9962.0MB
sysfix4894,663+system 48965.1MB

manifest 정제: 887→515(invalid 1,195, bash 'command' missing 372건 drop, 914건 repaired)→최종 489/26. 소스는 full-edit-run·full-create-run·interview-full2·live-interview. roles 분포 user 1,182 / assistant 13,415 / tool 8,246. read-편중 68%다. bash·write·edit 비중을 높이는 보강이 필요하다.

arbiter-rl-env corpus v1: 240 tasks, 7 families다: scoped_edit 64/26, build_from_scratch 41/22, loop 19/5, docgen 17/7, agentic_rag 10/2, ood_pushback 20/4, subflow 3/0 (train/heldout). commit b4eede06 (2026-07-11), PR #654.

arbiter-post-training v21: 10_synthesize → 20_rollout(gpt-5.5, arbiter-pi sandbox) → 30_gate(build+lint) → 40_format → 50_assemble → 60_train(LoRA chunked_dft, B300) → 70_serve(vLLM) → 80_eval. commit 3e1a8a39 (2026-07-13), PR #675. CLI는 arbiter-sft 로컬 미체크아웃(§6).

주운 NAS: public org 44 datasets 중 tool-use 0건. private HF org는 검증 불가(§6).

rlvr-2week (2026-09-05 nox@b300-03): Qwen3.5-4B-Base + NeMo-RL/Gym/atropos/open-instruct/verifiers. math_train 77,618 / code_train 8,579(INTELLECT-3-RL/code). NeMo-Gym CTU Assets 1.3M은 prompt bundle(학습 데이터 아님). Nemotron-3-Nano-RL-Training-Blend·SWE-smith-py·SWE-Gym·Skywork-OR1(라이선스 미표기 → §6)·DAPO-Math-17k 다운로드 완료. code verifier env 부재로 code GRPO 미착수.

파이프라인 운용 메모. arbiter-post-training v21의 8단계(10_synthesize→80_eval)는 각 단계가 게이트로 연결돼, 30_gate(build+lint)를 통과한 궤적만 40_format 이후로 진행한다. 60_train은 LoRA chunked_dft를 B300에서 돌리고, 70_serve는 vLLM, 80_eval로 닫힌다. rlvr-2week는 code verifier env가 없어 code GRPO를 착수하지 못했으므로, 터미널·코드 RL을 붙이려면 verifier env 구축이 선행 과제다. NeMo-Gym CTU Assets 1.3M은 prompt bundle이라 학습 데이터가 아니라는 점을 혼동하면 안 된다. arbiter-sft의 read-편중 68%는 합성 증식 시 bash·write·edit 궤적을 의도적으로 늘려 균형을 잡아야 함을 뜻한다.

사내 자산 종합. arbiter-sft(489 clean)·rl-env(240 tasks)·post-training v21(8단계)는 각각 SFT 데이터·RL 환경·합성 파이프라인의 세 축을 이룬다. 이 세 축이 이미 갖춰져 있으므로, 외부 데이터는 '0에서 시작'이 아니라 '사내 자산의 부족분 보완'이라는 위치에서 평가한다. rlvr-2week가 code verifier env 부재로 code GRPO를 못 냈듯, 세 축 중 RL 환경(verifier)이 현재 가장 얇은 축이다. SFT 데이터 축은 read-편중 68%를 bash·write·edit으로 보정하는 것이, 합성 파이프라인 축은 CLI 실물 미체크아웃(§6)을 해소하는 것이 각각의 시급 과제다. 세 축이 맞물려 돌아가면 외부 구매는 Surge의 off-the-shelf 보완 정도로 최소화할 수 있다.

5.4 pre-train 팀 프레이밍

pre-train 단계 요청이 오면 Stack v2 Shell(10.68M files/19.82GB)·Nemotron-CC-Code-v1(427.9B tokens)·CommitPack shell(1,017,977 commits/25.1GB)이 원자재 후보다. 단 이들은 트래젝토리가 아닌 정적 코드·커밋 코퍼스이므로, 에이전트 행동 데이터로의 전환은 mid/post 단계 합성(§5.3 파이프라인)에 의존한다. pre-train에 섞는다 해도 툴콜링 행동이 직접 생기는 것은 아니라는 점을 요청 측에 명시한다.

pre-train 팀과의 인터페이스. pre-train 팀이 '터미널 데이터'를 요청하면 두 가지를 구분해 응답한다. ① 정적 shell 코퍼스(Stack v2 Shell, CommitPack shell, Nemotron-CC-Code-v1)는 pre-train 원자재로 공급 가능하다. ② 에이전트 행동 궤적(§2.4 트래젝토리, §3.2 툴콜링)은 pre-train이 아니라 mid/post 단계 소재이며, §4의 배치 판정과 §4.6 마이크로 어닐 결과가 나온 뒤에 투입 단계를 확정한다. 이 구분을 사전에 합의하지 않으면 pre-train에 행동 데이터를 섞는 오류가 생길 수 있고, 이는 §4.3 축소 주장 3(MiniCPM annealing 번들의 순효과 미분리)이 경고하는 바로 그 함정이다.

---

⑥ 미해결 부록

아래 항목은 검증이 완료되지 않아 본문 주장에서 제외하고 여기에만 둔다. 이 부록의 항목들은 '틀렸다'가 아니라 '아직 검증이 끝나지 않았다'는 뜻이다. 본문에 실린 수치·주장은 전부 귀속까지 확인된 것만 남겼고, 확인이 덜 된 것은 전부 여기로 내렸다. 각 항목은 검증 방법이 정해져 있는 것(HF 게이트 승인, 벤더 견적 미팅, 사내 A/B 실험)과 본질적으로 공개가 안 되는 것(GLM-4.5 agent 단독 비율)으로 나뉜다.

모델·배치

  • GLM-4.5 100B 합산 버킷의 agent 단독 비율 미공개(인과 효과 분리 불가).
  • GLM-4.5 장문맥·에이전트 단계의 순효과(다른 단계와 번들).
  • DeepSWE 풀 규모 "4,500" 표기 주장: 문서상 R2E-Gym-Subset 4,578과 불일치.
  • TMax 자기보고("T1 64.0% TB 2.1 (base 43.8)" referent 미설명, "strongest open RL recipe", TMax-9B "10B 미만 최강"), tmax-sft-big 목록 절단 "(327,…".
  • MiniCPM B-3 annealing 번들의 순효과 미분리.
  • Terminal-Bench 4.0으로의 "생태계 이동" 여부: 릴리스(2026-08-28)만 확인됨.
  • OpenAI·Anthropic 터미널 학습 데이터 부재 주장의 strictest-sense UNCONFIRMED 잔여.
  • Anthropic consumer default opt-out UI의 현재 상태.

데이터셋 수치·라이선스

  • SWE-bench Lite 공식 300 vs HF 실측 323의 차이 설명.
  • SWE-bench MM 4종 수치(517/617/612/580)의 제거 내역·큐레이션 설명.
  • SWE-bench-extra 문서 6,415 vs HF 6,376(39건) 불일치 설명.
  • SWE-smith-trajectories HF 76,002 ↔ 실학습 5,017의 관계(선별 기준).
  • OpenHands Sampled/Verifier 라이선스(SFT만 MIT 명시).
  • Harbor registry 실측 80 entries / task 합산 51,625와 "3,500+ verified Docker environments" 표기의 관계(고유 env 수).
  • Nemotron-CC-Code-v1의 shell breakdown 부재(수치 없음).
  • ToolSandbox "1,032 test scenarios" 미검증.
  • "ToolFlow-Dataset-20K" HF 존재 미검증.
  • Magpie-Agent-300K HF 401 접근 불가.
  • 한국어 ecommerce/delivery 세트 라이선스 미표기.
  • TerminalTraj 라이선스 미기록.

벤더·가격

  • Appen 견적(공개 가격 부재는 확인됐으나 실제 단가는 미팅 필요).
  • Surge 효능 주장 "Terminal-Bench 2.1 67.4%→82.0% on Kimi K2.7": 벤더 자기보고.
  • Scale 최소 금액.
  • Toloka 로그인 뒤 단가.
  • Mercor 작업자 시급 변동 폭.
  • Turing 잡카드 내용.
  • Snorkel Flow 가격.
  • Gretel 인수가.
  • Prolific/Alignerr 수수료 불일치(42.8% vs 33.3% 적용 조건).

사내

  • sionic-ai HF private org 존재 여부.
  • 주운 NAS 월요일 업로드 여부.
  • 마이크로 어닐 미실행(A/B 결과 없음).
  • 1–2% 혼합비의 최적성.
  • 2 seeds 충분성.
  • Skywork-OR1 라이선스 미표기.
  • arbiter-post-training v21 CLI 실물(arbiter-sft 로컬 미체크아웃).

이 부록의 항목 중 검증 방법이 정해진 것(HF 게이트 승인, 벤더 견적 미팅, 마이크로 어닐 A/B)은 해당 절차가 끝나는 대로 본문으로 승격하고, 본질적으로 공개가 안 되는 것은 '미해결' 상태를 유지한다.

---

⑦ 출처

본문이 인용한 출처 239건이다. 조사 전체가 접한 출처는 1563건이며 전체 원장에 있다.

[S1] www.tbench.ai/benchmarks · — via A1-terminal-bench (w1)

[S3] raw.githubusercontent.com/harbor-framework/terminal-bench-1/main/registry.json · — via A1-terminal-bench (w1)

[S4] github.com/harbor-framework/terminal-bench-1 · — via A1-terminal-bench (w1)

[S8] www.tbench.ai/leaderboard · — via A1-terminal-bench (w1)

[S17] github.com/harbor-framework/terminal-bench-1/tree/main/original-tasks · — via A2-harbor-tbench-harness (w1)

[S21] github.com/laude-institute/harbor · — via A2-harbor-tbench-harness (w1)

[S29] www.swebench.com/ · — via A3-swe-bench-family (w1)

[S31] huggingface.co/datasets/princeton-nlp/SWE-bench · — via A3-swe-bench-family (w1)

[S37] huggingface.co/datasets/princeton-nlp/SWE-bench_Verified · — via A3-swe-bench-family (w1)

[S43] huggingface.co/datasets/SWE-bench/SWE-bench_Multimodal · — via A3-swe-bench-family (w1)

[S48] huggingface.co/datasets/ScaleAI/SWE-bench_Pro · — via A3-swe-bench-family (w1)

[S52] huggingface.co/datasets/Daoguang/Multi-SWE-bench · — via A3-swe-bench-family (w1)

[S61] huggingface.co/datasets/opencompass/SWEBench-Pro-Verified · — via A3-swe-bench-family (w1)

[S73] github.com/TheAgentCompany/TheAgentCompany · — via A4-osworld-agentbench (w1)

[S77] huggingface.co/datasets/ServiceNow/WorkArena-Instances · — via A4-osworld-agentbench (w1)

[S80] huggingface.co/spaces/ServiceNow/browsergym-leaderboard · — via A4-osworld-agentbench (w1)

[S85] github.com/TellinaTool/nl2bash · — via A5-intercode-nl2bash (w1)

[S86] arxiv.org/abs/1802.08979 · — via A5-intercode-nl2bash (w1)

[S88] huggingface.co/datasets/epinnock/intercode-nl2bash-curated · — via A5-intercode-nl2bash (w1)

[S97] arxiv.org/abs/2406.12045 · — via A6-tau-bench (w1)

[S98] github.com/sierra-research/tau-bench · — via A6-tau-bench (w1)

[S100] github.com/sierra-research/tau2-bench · — via A6-tau-bench (w1)

[S101] taubench.com · — via A6-tau-bench (w1)

[S124] gorilla.cs.berkeley.edu/leaderboard.html · — via B1-bfcl (w1)

[S125] github.com/ShishirPatil/gorilla/tree/main/berkeley-function-call-leaderboard · — via B1-bfcl (w1)

[S135] huggingface.co/datasets/gorilla-llm/Berkeley-Function-Calling-Leaderboard · — via B1-bfcl (w1)

[S136] gorilla.cs.berkeley.edu/data_overall.csv · — via B1-bfcl (w1)

[S137] github.com/ShishirPatil/gorilla/tree/main/berkeley-function-call-leaderboard/bfcl_eval/data · — via B1-bfcl (w1)

[S138] arxiv.org/abs/2307.16789 · — via B2-toolbench-tooleval (w1)

[S139] raw.githubusercontent.com/OpenBMB/ToolBench/master/README.md · — via B2-toolbench-tooleval (w1)

[S140] huggingface.co/ToolBench · — via B2-toolbench-tooleval (w1)

[S146] github.com/OpenBMB/ToolBench · — via B2-toolbench-tooleval (w1)

[S147] arxiv.org/abs/2304.08244 · — via B3-apibank-toolalpaca-apibench (w1)

[S148] github.com/AlibabaResearch/DAMO-ConvAI/tree/main/api-bank · — via B3-apibank-toolalpaca-apibench (w1)

[S150] ar5iv.labs.arxiv.org/html/2304.08244 · — via B3-apibank-toolalpaca-apibench (w1)

[S151] arxiv.org/abs/2306.05301 · — via B3-apibank-toolalpaca-apibench (w1)

[S153] github.com/tangqiaoyu/ToolAlpaca/blob/main/LICENSE · — via B3-apibank-toolalpaca-apibench (w1)

[S154] ar5iv.labs.arxiv.org/html/2306.05301 · — via B3-apibank-toolalpaca-apibench (w1)

[S155] ar5iv.labs.arxiv.org/html/2305.15334 · — via B3-apibank-toolalpaca-apibench (w1)

[S156] github.com/nexusflowai/NexusRaven-V2 · — via B3-apibank-toolalpaca-apibench (w1)

[S157] huggingface.co/api/datasets/Nexusflow/NVDLibraryBenchmark · — via B3-apibank-toolalpaca-apibench (w1)

[S158] huggingface.co/spaces/Nexusflow/Nexus_Function_Calling_Leaderboard · — via B3-apibank-toolalpaca-apibench (w1)

[S159] huggingface.co/datasets/Nexusflow/Function_Call_Definitions · — via B3-apibank-toolalpaca-apibench (w1)

[S160] huggingface.co/Nexusflow/NexusRaven-V2-13B · — via B3-apibank-toolalpaca-apibench (w1)

[S161] ar5iv.labs.arxiv.org/html/2405.08355 · — via B3-apibank-toolalpaca-apibench (w1)

[S162] github.com/fairyshine/Seal-Tools · — via B3-apibank-toolalpaca-apibench (w1)

[S163] github.com/AlibabaResearch/DAMO-ConvAI · — via B3-apibank-toolalpaca-apibench (w1)

[S164] arxiv.org/abs/2405.08355 · — via B3-apibank-toolalpaca-apibench (w1)

[S165] huggingface.co/api/datasets/Nexusflow/CVECPEAPIBenchmark/parquet · — via B3-apibank-toolalpaca-apibench (w1)

[S166] huggingface.co/datasets/fairyshine/Seal-Tools/resolve/main/README.md · — via B3-apibank-toolalpaca-apibench (w1)

[S167] github.com/zai-org/ComplexFuncBench · — via B4-complexfunc-mtu-ace (w1)

[S168] huggingface.co/datasets/THUDM/ComplexFuncBench · — via B4-complexfunc-mtu-ace (w1)

[S169] arxiv.org/abs/2501.10132 · — via B4-complexfunc-mtu-ace (w1)

[S170] github.com/MTU-Bench-Team/MTU-Bench · — via B4-complexfunc-mtu-ace (w1)

[S171] arxiv.org/abs/2410.11710 · — via B4-complexfunc-mtu-ace (w1)

[S173] api.github.com/repos/acebench/ACEBench · — via B4-complexfunc-mtu-ace (w1)

[S174] arxiv.org/abs/2501.12851 · — via B4-complexfunc-mtu-ace (w1)

[S175] arxiv.org/html/2408.04682 · — via B4-complexfunc-mtu-ace (w1)

[S176] raw.githubusercontent.com/apple-aiml-research/ToolSandbox/main/LICENSE · — via B4-complexfunc-mtu-ace (w1)

[S177] github.com/apple-aiml-research/ToolSandbox · — via B4-complexfunc-mtu-ace (w1)

[S178] arxiv.org/abs/2408.04682 · — via B4-complexfunc-mtu-ace (w1)

[S211] huggingface.co/datasets/glaiveai/glaive-function-calling-v2 · — via C1-glaive-hermes (w1)

[S212] huggingface.co/datasets/NousResearch/hermes-function-calling-v1 · — via C1-glaive-hermes (w1)

[S213] github.com/NousResearch/Hermes-Function-Calling · — via C1-glaive-hermes (w1)

[S214] huggingface.co/datasets/Salesforce/xlam-function-calling-60k · — via C2-xlam-apigen (w1)

[S215] arxiv.org/abs/2406.18518 · — via C2-xlam-apigen (w1)

[S218] huggingface.co/datasets/Salesforce/APIGen-MT-5k · — via C2-xlam-apigen (w1)

[S219] arxiv.org/abs/2504.03601 · — via C2-xlam-apigen (w1)

[S220] huggingface.co/api/datasets?author=Salesforce&search=xlam · — via C2-xlam-apigen (w1)

[S222] huggingface.co/datasets/Team-ACE/ToolACE · — via C3-toolace (w1)

[S225] arxiv.org/abs/2409.00920 · — via C3-toolace (w1)

[S226] huggingface.co/Team-ACE/ToolACE-2-Llama-3.1-8B · — via C3-toolace (w1)

[S229] arxiv.org/pdf/2409.00920 · — via C3-toolace (w1)

[S230] huggingface.co/datasets/nvidia/Nemotron-Post-Training-Dataset-v1 · — via C4-nemotron-tulu-toolsplits (w1)

[S232] huggingface.co/datasets/nvidia/Llama-Nemotron-Post-Training-Dataset · — via C4-nemotron-tulu-toolsplits (w1)

[S233] arxiv.org/abs/2505.00949 · — via C4-nemotron-tulu-toolsplits (w1)

[S235] huggingface.co/allenai/OLMo-2-1124-7B-Instruct · — via C4-nemotron-tulu-toolsplits (w1)

[S236] huggingface.co/datasets/allenai/tulu-3-sft-olmo-2-mixture · — via C4-nemotron-tulu-toolsplits (w1)

[S239] arxiv.org/html/2410.18447 · — via C6-toolflow-magpie-agent (w1)

[S240] huggingface.co/datasets/Magpie-Align/Magpie-Agent-Instruct-300K-v0.1 · — via C6-toolflow-magpie-agent (w1)

[S241] huggingface.co/api/datasets?author=Magpie-Align · — via C6-toolflow-magpie-agent (w1)

[S242] datasets-server.huggingface.co/info?dataset=argilla/magpie-ultra-v1.0 · — via C6-toolflow-magpie-agent (w1)

[S243] huggingface.co/datasets/argilla/magpie-ultra-v1.0/raw/main/README.md · — via C6-toolflow-magpie-agent (w1)

[S244] huggingface.co/api/datasets/argilla/magpie-ultra-v0.1 · — via C6-toolflow-magpie-agent (w1)

[S245] huggingface.co/datasets/microsoft/orca-agentinstruct-1M-v1/raw/main/README.md · — via C6-toolflow-magpie-agent (w1)

[S246] arxiv.org/abs/2407.03502 · — via C6-toolflow-magpie-agent (w1)

[S247] huggingface.co/datasets/zai-org/AgentInstruct/raw/main/README.md · — via C6-toolflow-magpie-agent (w1)

[S248] huggingface.co/datasets/sam-mosaic/agent-instruct/raw/main/README.md · — via C6-toolflow-magpie-agent (w1)

[S250] arxiv.org/abs/2310.12823 · — via C6-toolflow-magpie-agent (w1)

[S251] datasets-server.huggingface.co/info?dataset=sam-mosaic/agent-instruct · — via C6-toolflow-magpie-agent (w1)

[S252] huggingface.co/datasets/jaeyong2/Ko-functioncall · — via C7-korean-toolcalling (w1)

[S253] huggingface.co/datasets/heegyu/glaive-function-calling-v2-ko · — via C7-korean-toolcalling (w1)

[S255] huggingface.co/datasets/iknow-lab/hermes-function-calling-v1-ko · — via C7-korean-toolcalling (w1)

[S256] huggingface.co/datasets/iknow-lab/hermes-function-calling-v1-ko-cleaned · — via C7-korean-toolcalling (w1)

[S258] huggingface.co/datasets/gyung/toolllama-korean-function-calling · — via C7-korean-toolcalling (w1)

[S259] huggingface.co/datasets/exp-models/dolphin-r1-korean-deepseek-toolcalls · — via C7-korean-toolcalling (w1)

[S260] huggingface.co/datasets/tryumanshow/glaive-function-calling-v2-ko-refined · — via C7-korean-toolcalling (w1)

[S261] huggingface.co/datasets/irene93/function-calling-v3-datasets-korean · — via C7-korean-toolcalling (w1)

[S262] huggingface.co/datasets/iamjoon/ecommerce-function-calling-datasets-korean · — via C7-korean-toolcalling (w1)

[S263] huggingface.co/datasets/jjun123/delivery-app-function-calling-datasets-korean · — via C7-korean-toolcalling (w1)

[S267] github.com/kakao/FunctionChat-Bench · — via C7-korean-toolcalling (w1)

[S279] arxiv.org/abs/2504.21798 · — via D1-swe-smith (w1)

[S280] huggingface.co/datasets/SWE-bench/SWE-smith · — via D1-swe-smith (w1)

[S281] huggingface.co/datasets/SWE-bench/SWE-smith-trajectories · — via D1-swe-smith (w1)

[S285] arxiv.org/abs/2412.21139 · — via D2-swe-gym-r2e (w1)

[S290] github.com/SWE-Gym/SWE-Gym · — via D2-swe-gym-r2e (w1)

[S291] arxiv.org/abs/2504.07164 · — via D2-swe-gym-r2e (w1)

[S297] huggingface.co/datasets/nebius/SWE-rebench · — via D3-swe-rebench-nebius (w1)

[S299] huggingface.co/datasets/nebius/SWE-agent-trajectories · — via D3-swe-rebench-nebius (w1)

[S300] huggingface.co/datasets/nebius/SWE-rebench-openhands-trajectories · — via D3-swe-rebench-nebius (w1)

[S301] huggingface.co/datasets/nebius/SWE-bench-extra · — via D3-swe-rebench-nebius (w1)

[S302] nebius.com/blog/posts/scaling-data-collection-for-training-swe-agents · — via D3-swe-rebench-nebius (w1)

[S304] www.all-hands.dev/blog/introducing-openhands-lm-32b----a-strong-open-coding-agent-model · — via D4-openhands-trajectories (w1)

[S305] huggingface.co/datasets/SWE-Gym/SWE-Gym · — via D4-openhands-trajectories (w1)

[S307] huggingface.co/datasets/SWE-Gym/OpenHands-SFT-Trajectories · — via D4-openhands-trajectories (w1)

[S308] huggingface.co/datasets/SWE-Gym/OpenHands-Verifier-Trajectories · — via D4-openhands-trajectories (w1)

[S309] huggingface.co/datasets/OpenHandsCommunity/SWE-bench-devin-full · — via D4-openhands-trajectories (w1)

[S310] huggingface.co/datasets/OpenHands/openhands-feedback · — via D4-openhands-trajectories (w1)

[S311] nebius.com/blog/posts/openhands-trajectories-with-qwen3-coder-480b · — via D4-openhands-trajectories (w1)

[S312] raw.githubusercontent.com/TellinaTool/nl2bash/master/README.md · — via D5-nl2bash-commitpack (w1)

[S313] datasets-server.huggingface.co/size?dataset=jiacheng-ye/nl2bash · — via D5-nl2bash-commitpack (w1)

[S314] huggingface.co/datasets/Tellina/nl2bash · — via D5-nl2bash-commitpack (w1)

[S316] huggingface.co/datasets/bigcode/commitpackft · — via D5-nl2bash-commitpack (w1)

[S317] huggingface.co/datasets/bigcode/the-stack-v2 · — via D5-nl2bash-commitpack (w1)

[S318] arxiv.org/html/2402.19173v1 · — via D5-nl2bash-commitpack (w1)

[S321] arxiv.org/abs/2601.11868 · — via A9-terminal-bench-papers (w1)

[S324] arxiv.org/abs/2601.16443 · — via A9-terminal-bench-papers (w1)

[S325] github.com/few-sh/terminal-wrench · — via A9-terminal-bench-papers (w1)

[S326] arxiv.org/abs/2604.17596 · — via A9-terminal-bench-papers (w1)

[S327] arxiv.org/abs/2604.28093 · — via A9-terminal-bench-papers (w1)

[S329] arxiv.org/abs/2605.10966 · — via A9-terminal-bench-papers (w1)

[S330] github.com/aiming-lab/ClawForge · — via A9-terminal-bench-papers (w1)

[S331] arxiv.org/abs/2605.14133 · — via A9-terminal-bench-papers (w1)

[S332] github.com/EuniAI/TerminalWorld · — via A9-terminal-bench-papers (w1)

[S333] arxiv.org/abs/2605.22535 · — via A9-terminal-bench-papers (w1)

[S334] arxiv.org/abs/2605.29115 · — via A9-terminal-bench-papers (w1)

[S335] arxiv.org/abs/2606.21140 · — via A9-terminal-bench-papers (w1)

[S336] github.com/facebookresearch/TUA-Bench · — via A9-terminal-bench-papers (w1)

[S414] huggingface.co/api/datasets/princeton-nlp/SWE-bench_Verified?full=true · — via D8-hf-hub-scan-trajectories (w1)

[S429] toloka.ai/ · — via E2-toloka-appen-prolific (w1)

[S430] toloka.ai/agent-data · — via E2-toloka-appen-prolific (w1)

[S439] www.appen.com/ · — via E2-toloka-appen-prolific (w1)

[S443] www.appen.com/enterprise-data · — via E2-toloka-appen-prolific (w1)

[S444] www.prolific.com/pricing · — via E2-toloka-appen-prolific (w1)

[S452] arxiv.org/html/2406.18518v1 · — via F1-apigen-method (w1)

[S471] huggingface.co/datasets/hamishivi/swerl-tmax-15k · — via D7-terminal-bench-training-data (w1)

[S476] huggingface.co/allenai/tmax-9b · — via D7-terminal-bench-training-data (w1)

[S504] www.tbench.ai/leaderboard/terminal-bench/2.0 · — via A8-terminal-leaderboards-browse (w1)

[S564] scale.com/data-engine · — via E1-scale-surge (w1)

[S573] scale.com/demo · — via E1-scale-surge (w1)

[S574] surgehq.ai/ · — via E1-scale-surge (w1)

[S586] scale.com/blog/insights-generator · — via E1-scale-surge (w1)

[S587] www.mercor.com/ · — via E3-mercor-datacurve-turing-invisible (w1)

[S594] en.wikipedia.org/wiki/Mercor · — via E3-mercor-datacurve-turing-invisible (w1)

[S595] www.datacurve.ai/products · — via E3-mercor-datacurve-turing-invisible (w1)

[S598] techcrunch.com/2025/10/09/datacurve-raises-15-million-to-take-on-scaleai/ · — via E3-mercor-datacurve-turing-invisible (w1)

[S599] www.turing.com/frontier-ai · — via E3-mercor-datacurve-turing-invisible (w1)

[S603] www.turing.com/ · — via E3-mercor-datacurve-turing-invisible (w1)

[S604] www.invisible.co/data-lab · — via E3-mercor-datacurve-turing-invisible (w1)

[S608] www.invisible.co/how-we-work · — via E3-mercor-datacurve-turing-invisible (w1)

[S612] snorkel.ai/ · — via E4-snorkel-labelbox-argilla (w1)

[S623] techcrunch.com/tag/snorkel-ai/ · — via E4-snorkel-labelbox-argilla (w1)

[S634] docs.labelbox.com/docs/billing · — via E4-snorkel-labelbox-argilla (w1)

[S639] costbench.com/software/ai-data-labeling/labelbox/ · — via E4-snorkel-labelbox-argilla (w1)

[S651] www.together.ai/pricing · — via E5-together-nebius-synthetic-services (w1)

[S656] www.together.ai/ · — via E5-together-nebius-synthetic-services (w1)

[S657] www.nebius.com/services/token-factory · — via E5-together-nebius-synthetic-services (w1)

[S662] www.nebius.com/solutions/simulations · — via E5-together-nebius-synthetic-services (w1)

[S663] gretel.ai · — via E5-together-nebius-synthetic-services (w1)

[S667] build.nvidia.com/nemo/data-designer · — via E5-together-nebius-synthetic-services (w1)

[S668] web.archive.org/web/20250320000000/https://gretel.ai/pricing · — via E5-together-nebius-synthetic-services (w1)

[S676] www.syntho.ai/syntho-acquires-mostly-ai-trademark-and-related-assets/ · — via E5-together-nebius-synthetic-services (w1)

[S677] mostly.ai/pricing · — via E5-together-nebius-synthetic-services (w1)

[S680] www.syntho.ai/frequently-asked-questions/ · — via E5-together-nebius-synthetic-services (w1)

[S681] pypi.org/project/mostlyai/ · — via E5-together-nebius-synthetic-services (w1)

[S684] datagen.tech/ · — via E5-together-nebius-synthetic-services (w1)

[S723] appen.com/pricing · — via E7-vendor-pricing-browse (w1)

[S728] arxiv.org/html/2505.09388 · — via G1-qwen3-qwen25coder (w1)

[S730] arxiv.org/abs/2505.09388 · — via G1-qwen3-qwen25coder (w1)

[S743] arxiv.org/abs/2507.20534 · — via G4-kimi-k2 (w1)

[S744] arxiv.org/html/2507.20534 · — via G4-kimi-k2 (w1)

[S876] arxiv.org/html/2508.06471 · — via G5-glm45-nemotron (w1)

[S880] github.com/zai-org/GLM-4.5 · — via G5-glm45-nemotron (w1)

[S881] huggingface.co/nvidia/Llama-Nemotron-Post-Training-Dataset · — via G5-glm45-nemotron (w1)

[S882] huggingface.co/nvidia/Llama-3_3-Nemotron-Super-49B-v1_5 · — via G5-glm45-nemotron (w1)

[S883] huggingface.co/zai-org/GLM-4.5 · — via G5-glm45-nemotron (w1)

[S886] arxiv.org/html/2501.00656 · — via G6-olmo2-smollm3-openreports (w1)

[S887] huggingface.co/blog/smollm3 · — via G6-olmo2-smollm3-openreports (w1)

[S889] arxiv.org/html/2509.07604 · — via G6-olmo2-smollm3-openreports (w1)

[S890] arxiv.org/html/2509.14233 · — via G6-olmo2-smollm3-openreports (w1)

[S892] marin.readthedocs.io/en/latest/reports/marin-8b-retro/ · — via G6-olmo2-smollm3-openreports (w1)

[S893] marin.readthedocs.io/en/latest/reports/marin-32b-retro/ · — via G6-olmo2-smollm3-openreports (w1)

[S894] marin.community/ · — via G6-olmo2-smollm3-openreports (w1)

[S895] arxiv.org/abs/2501.00656 · — via G6-olmo2-smollm3-openreports (w1)

[S897] arxiv.org/abs/2509.14233 · — via G6-olmo2-smollm3-openreports (w1)

[S898] arxiv.org/abs/2509.13310 · — via G8-placement-papers-ablation (w1)

[S899] arxiv.org/html/2509.13310v1 · — via G8-placement-papers-ablation (w1)

[S900] arxiv.org/abs/2608.20314 · — via G8-placement-papers-ablation (w1)

[S901] arxiv.org/html/2608.20314v1 · — via G8-placement-papers-ablation (w1)

[S902] arxiv.org/abs/2601.18418 · — via G8-placement-papers-ablation (w1)

[S903] arxiv.org/html/2601.18418v2 · — via G8-placement-papers-ablation (w1)

[S904] arxiv.org/abs/2608.04934 · — via G8-placement-papers-ablation (w1)

[S905] arxiv.org/html/2608.04934v1 · — via G8-placement-papers-ablation (w1)

[S906] arxiv.org/abs/2512.24618 · — via G8-placement-papers-ablation (w1)

[S937] arxiv.org/abs/2412.19437 · — via G3-deepseek-v3-r1 (w1)

[S938] arxiv.org/abs/2501.12948 · — via G3-deepseek-v3-r1 (w1)

[S975] raw.githubusercontent.com/kakao/FunctionChat-Bench/main/README.md · — via W2-kakao-functionchat-bench (w2)

[S976] arxiv.org/abs/2411.14054 · — via W2-kakao-functionchat-bench (w2)

[S1017] github.com/harbor-framework/harbor · — via W2-harbor-rollout-schema (w2)

[S1023] github.com/harbor-framework/harbor/blob/main/rfcs/0001-trajectory-format.md · — via W2-harbor-rollout-schema (w2)

[S1029] github.com/harbor-framework/harbor/blob/main/src/harbor/utils/traces_utils.py · — via W2-harbor-rollout-schema (w2)

[S1030] github.com/harbor-framework/harbor/blob/main/docs/content/docs/training-workflows/sft.mdx · — via W2-harbor-rollout-schema (w2)

[S1033] github.com/harbor-framework/harbor/pull/1291 · — via W2-harbor-rollout-schema (w2)

[S1069] huggingface.co/datasets/R2E-Gym/R2E-Gym-V1 · — via W2-r2e-gym-count-gap (w2)

[S1070] huggingface.co/datasets/R2E-Gym/R2E-Gym-Subset · — via W2-r2e-gym-count-gap (w2)

[S1091] web.archive.org/web/20250609012106/https://www.tbench.ai/leaderboard · — via W2-tb1-leaderboard-wayback (w2)

[S1095] web.archive.org/web/20251103212338/https://www.tbench.ai/leaderboard · — via W2-tb1-leaderboard-wayback (w2)

[S1219] arxiv.org/html/2601.11868v1 · — via W2-tb2-iclr-paper (w2)

[S1247] huggingface.co/api/datasets?author=allenai&limit=1000 · — via W2-tulu3-agentic-followups (w2)

[S1248] huggingface.co/api/models/meta-llama/Llama-3.1-8B-Instruct · — via W2-tulu3-agentic-followups (w2)

[S1252] huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609 · — via W2-x-signal (w2)

[S1269] hub.harborframework.com/datasets/terminal-bench/terminal-bench/4 · — via W2-x-signal (w2)

[S1318] hub.harborframework.com · — via A2-harbor-tbench-harness (w1b)

[S1349] toloka.ai/pricing · — via W2-toloka-pricing-render (w2)

[S1354] platform.toloka.ai/auth?redirectPath=%2Fpricing · — via W2-toloka-pricing-render (w2)

[S1357] huggingface.co/agentica-org/DeepSWE-Preview · — via W3-deepswe-terminal-rl-training (w3)

[S1358] github.com/agentica-project/rllm · — via W3-deepswe-terminal-rl-training (w3)

[S1360] arxiv.org/abs/2602.23866 · — via W3-deepswe-terminal-rl-training (w3)

[S1402] arxiv.org/pdf/2508.06471 · — via W3-glm45-midtraining-ratio (w3)

[S1403] arxiv.org/html/2508.06471v1 · — via W3-glm45-midtraining-ratio (w3)

[S1412] arxiv.org/abs/2404.06395 · — via G7-midtraining-definition-survey (w1fix)

[S1435] huggingface.co/api/datasets?search=korean+terminal · — via W3-korean-terminal-cli-bench (w3)

[S1441] huggingface.co/datasets/EunsuKim/CLIcK · — via W3-korean-terminal-cli-bench (w3)

[S1534] cdn.openai.com/pdf/97cc5669-7a25-4e63-b15f-5fd5bdc4d149/gpt-5-codex-system-card.pdf · — via W3-codex-claudecode-trajectory-data (w3)

[S1535] openai.com/index/gpt-5-1-codex-max-system-card/ · — via W3-codex-claudecode-trajectory-data (w3)

[S1540] openai.com/index/swe-lancer/ · — via W3-codex-claudecode-trajectory-data (w3)

[S1544] code.claude.com/docs/en/data-usage · — via W3-codex-claudecode-trajectory-data (w3)

[S1545] www.anthropic.com/claude-opus-4-5-system-card · — via W3-codex-claudecode-trajectory-data (w3)

[S1552] github.com/anthropics/claude-code · — via W3-codex-claudecode-trajectory-data (w3)