Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces
- Authors: Mike A. Merrill, Alexander G. Shaw, Nicholas Carlini, Boxuan Li, Harsh Raj, Ivan Bercovich, Lin Shi, Jeong Yeon Shin, Thomas Walshe, E. Kelly Buchanan, Junhong Shen, Guanghao Ye, Haowei Lin, Jason Poulos, Maoyu Wang, Marianna Nezhurina, Jenia Jitsev, Di Lu, Orfeas Menis Mastromichalakis, Zhiwei Xu, Zizhao Chen, Yue Liu, Robert Zhang, Leon Liangyu Chen, Anurag Kashyap, Jan-Lucas Uslu, Jeffrey Li, Jianbo Wu, Minghao Yan, Song Bian, Vedang Sharma, Ke Sun, Steven Dillmann, Akshay Anand, Andrew Lanpouthakoun, Bardia Koopah, Changran Hu, Etash Guha, Gabriel H. S. Dreiman, Jiacheng Zhu, Karl Krauth, Li Zhong, Niklas Muennighoff, Robert Amanfu, Shangyin Tan, Shreyas Pimpalgaonkar, Tushar Aggarwal, Xiangning Lin, Xin Lan, Xuandong Zhao, Yiqing Liang, Yuanli Wang, Zilong Wang, Changzhi Zhou, David Heineman, Hange Liu, Harsh Trivedi, John Yang, Junhong Lin, Manish Shetty, Michael Yang, Nabil Omi, Negin Raoof, Shanda Li, Terry Yue Zhuo, Wuwei Lin, Yiwei Dai, Yuxin Wang, Wenhao Chai, Shang Zhou, Dariush Wahdany, Ziyu She, Jiaming Hu, Zhikang Dong, Yuxuan Zhu, Sasha Cui, Ahson Saiyed, Arinbjรถrn Kolbeinsson, Jesse Hu, Christopher Michael Rytting, Ryan Marten, Yixin Wang, Alex Dimakis, Andy Konwinski, Ludwig Schmidt
- Affiliation: Stanford University; Laude Institute; Anthropic; Northeastern University; UC Santa Barbara; Cornell University; Snorkel AI; Reflection AI; CMU; MIT; Peking University; Constellation; JSC FZJ; Tencent AI; National Technical University of Athens; Nerion; University of Michigan; NUS; Moonshot AI; Amazon; UT Austin; University of Washington; UW-Madison; UC Berkeley; SambaNova Systems Inc.; Bespoke Labs; Michigan State University; Brown University; Boston University; University of California San Diego; Beijing Institute of Technology; Allen Institute for AI; Monash University; CSIRO's Data61; Dartmouth College; Princeton University; CISPA; University of Basel; Stony Brook University; UIUC; Yale University; University of Virginia
- Paper: https://arxiv.org/abs/2601.11868
- Code: https://www.tbench.ai/
- Published: January 17, 2026 (arXiv preprint); ICLR 2026
TL; DR
ํฐ๋ฏธ๋์ ์ต์ข
container ์ํ๋ก scoringํ๋ agent ๋ฒค์น๋งํฌ Terminal-Bench 2.0 ์ ์; 32,155 trial์์ ์ต๊ณ ์ฑ๋ฅ์ 63%์ ๊ทธ์น๊ณ , ์คํจ์ ์ง๋ฐฐ ๋ฒ์ฃผ๊ฐ ๋ฅ๋ ฅ ๋ถ์กฑ์ด๋ผ๊ธฐ ๋ณด๋ค๋ ์ง์ ์๋ฐ/๋ฐ๋ณต/์ข
๋ฃ ํ๋จ ์คํจ๋ผ๋ execution ๊ท์จ ๋ฌธ์ ์์ LLM judge ๊ธฐ๋ฐ taxonomy๋ก ๊ท๋ช

Background
- agent ๋ฒค์น๋งํฌ ํํฉ
- software engineering: ๋์ฒด๋ก โ์ด ์ ์ฅ์์ ์ด์๋ฅผ ๊ณ ์ณค๋โ ์์ค์ ์ข์ ๋จ์
- SWE-Bench (Jimenez et al., 2024)
- SWE-Bench Multimodal (Yang et al., 2025b)
- SWE-Lancer (Miserendino et al., 2025)
- HumanEval, DevEval, โฆ
- tool use: ๋๊ตฌ ํธ์ถ ํ์๊ณผ ์ ํ์ด ์ด์
- ฯ-Bench (Yao et al., 2025)
- BFCL (Patil et al., 2025)
- computer use: GUI์ ์น ์กฐ์
- WebArena (Zhou et al., 2024)
- VisualWebArena (Koh et al., 2024)
- AppWorld (Trivedi et al., 2024)
- OSWorld (Xie et al., 2024)
- scientific discovery: ๋
ผ๋ฌธ ์ฌํ, ML ์คํ ์๋ํ
- ReplicationBench (Ye et al., 2025)
- MLGym-Bench (Nathani et al., 2025)
- Auto-Bench (Chen et al., 2025)
- software engineering: ๋์ฒด๋ก โ์ด ์ ์ฅ์์ ์ด์๋ฅผ ๊ณ ์ณค๋โ ์์ค์ ์ข์ ๋จ์
- ํฐ๋ฏธ๋์ ๊ณ ์๋ จ task๊ฐ ์ค์ ๋ก ์ํ๋๋ ๊ณต๊ฐ์ด์ ์ค์ฌ์ฉ agent์ ์ฌ์ค์ ํ์ค ์ธํฐํ์ด์ค
- SW ์์ง๋์ด๋ง, ๊ณผํ ๊ณ์ฐ, ๋ณด์, ML ๋ฑ ์ํ
- Cursor, Codex CLI, Claude Code, Gemini CLI๊ฐ ์ด๋ฏธ ์ด ์ธํฐํ์ด์ค๋ฅผ ์ฌ์ฉ
- ์ฐ๊ตฌ์ ์ธ ๋ฒค์น๋งํฌ๋ก ๋ค์ณ์ก๋ค๋ ์๋ฏธ ๊ฐ๊ธฐ๋โฆ
- ํต์ฌ ๊ณต๋ฐฑ: ํฐ๋ฏธ๋ ๊ด๋ จ ๋ฒค์น๋งํฌ๋ CLI์ ์ข์ ๋ฉด๋ง ํ๊ฐ, terminal-based task ์ ๋ฐ์ ๋ํ ํ๊ฐ ๋ถ์ฌ
- shell script ์ต์ ํ (Koala, Lamprou et al., 2025)
- ํ๊ฒฝ ์ค์ (EnvBench, Eliseeva et al., 2025)
- ์์ฐ์ด์์ bash๋ก์ ๋ฒ์ญ (Westenfelder et al., 2025) ์ ๋
Problem States
- ๊ธฐ์กด ๋ฒค์น๋งํฌ ํ๊ณ
- ํ์ค์ฑ ๋ถ์กฑ: ํฉ์ฑ์ ์์๊ฒ ์ ์๋ ๋ฒค์น๋งํฌ ํ์ด์ ์ค์ container์์์ ๋ ๊ฑฐ์ ์์คํ ์ค์ , ๋ ผ๋ฌธ ์ฌ๊ตฌํ ๊ดด๋ฆฌ
- ๋ณ๋ณ๋ ฅ ๋ถ์กฑ: frontier ๋ชจ๋ธ์ด ์ด๋ฏธ ํฌํ์ํจ ๋ฒค์น๋งํฌ๋ก๋ ๋ชจ๋ธ ๊ฐ ์ฐจ์ด๋ ๊ฐ์ ๋ฐฉํฅ๋ ๊ด์ธก ๋ถ๊ฐ
- ๊ตฌ์ถ ์ธก๋ฉด์ ํ๊ณ: ์ด๋ ค์ด agentic task๋ ์ ๋ต ๊ฒ์ฆ ์์ฒด๊ฐ ๋์
- ํ ์คํธ๊ฐ ๋์จํ๋ฉด ๋์ถฉ ํด๋ ํต๊ณผ, ๋นก๋นกํ๋ฉด ์ ๋นํ ๋์ ํ์ด๋ฅผ ๊ธฐ๊ฐ
- agent๊ฐ ํ
์คํธ ํ์ผ ์ด๋์ด๋ ์์ ๋ต ์ ๋ ์์ฑ ๋ฑ์ผ๋ก cheat ๊ฐ๋ฅ
- ์ด๋์ ๋ ผ๋ฌธ์ ์ง๋ฉด ๋ฐฐ๋ถ์ด ๋ฐ์ดํฐ ๊ตฌ์ถ๋ณด๋ค ๊ฒ์ฆ ํ๋ก์ธ์ค์ ์ค๋ ค ์๋ ๋ฏ
Suggestions
task formulation Fig 2
- Terminal-Bench task 1๊ฐ = instruction + Dockerfile + tests + oracle solution + time limit
- agent์๊ฒ ๋ ธ์ถ๋๋ ๊ฒ์ Dockerfile๋ก ๋น๋๋ container์ instruction ๋๋ฟ
tests/,run-tests.sh,solution.sh,task.yaml์ ๋๋จธ์ง ํ๋๋ ์๋tests/: ์ฑ์ ๊ธฐ์คrun-tests.sh: ํ ์คํธ ์คํ ์คํฌ๋ฆฝํธsolution.sh: ์ ๋ตtask.yaml๋ฑ : time limit, ๋์ด๋, ์นดํ ๊ณ ๋ฆฌ, ์ ์ ์ถ์ ์์์๊ฐ ๋ฑ ๋ฉํ์ ๋ณด
- ์คํ ํ๋ฆ: container ์ ๋ฌ โ agent ์์ ํ๋ โ time limit ๋๋ฌ ์ ๊ฐ์ ์ข
๋ฃ โ ์ด ์์ ์ tests๋ฅผ container ์์ผ๋ก ๋ณต์ฌ โ ์คํ
- ํ ์คํธ๊ฐ ์คํ ์ดํ์ ์ฃผ์ ๋๋ฏ๋ก ์ฑ์ ๊ธฐ์ค ์ด๋์ด ์์ฒ ์ฐจ๋จ
- outcome-driven scoring:
- ์ฑ์ ๋์์ agent๊ฐ ์น ๋ช
๋ น์ด๋ console ์ถ๋ ฅ์ด ์๋๋ผ ์ต์ข
container ์ํ
- โ์ง์์ ์์ ๋ ๋ชจ๋ ๊ฒฐ๊ณผ๊ฐ ๋ฌ์ฑ๋๋๊ฐโ๋ง ํ์ โ ๋ฐฉ๋ฒ์ ๋ฌด์ ํ
- python script ์์ฑ
- vim ์ง์ ํธ์ง
- ํจํค์ง ์ ๊ท ์ค์น ๋ฑ
- ์ด ์ ์ฐ์ฑ ๋์ ๊ธฐ์กด ๋ฒค์น๋งํฌ 26๊ฐ๋ฅผ ๋์ผ ํฌ๋งท์ผ๋ก ํก์(Appendix D
Tab 5).
- โ์ง์์ ์์ ๋ ๋ชจ๋ ๊ฒฐ๊ณผ๊ฐ ๋ฌ์ฑ๋๋๊ฐโ๋ง ํ์ โ ๋ฐฉ๋ฒ์ ๋ฌด์ ํ
- all-or-nothing; ์ ํ ์คํธ ํต๊ณผ = 1, ํ๋๋ผ๋ ์คํจ = 0
- ์ฑ์ ๋์์ agent๊ฐ ์น ๋ช
๋ น์ด๋ console ์ถ๋ ฅ์ด ์๋๋ผ ์ต์ข
container ์ํ
dataset construction
- open-source ๊ธฐ์ฌ ๋ฐฉ์์ crowd-sourcing
- 93๋ช ์ด 229๊ฐ task ์์ฑ
- ์ ์ ๋์ด๋ ํ์ ๊ณผ 3์ธ ๊ฒ์ > 89๊ฐ ์ ๋ณ
Fig 4์นดํ ๊ณ ๋ฆฌ ๋ถํฌ- software engineering 26์ผ๋ก ์ต๋ค
- games, video processing, data quarrying, optimization, personal assistant ๋ฑ ๋น์์ง๋์ด๋ง ์นดํ ๊ณ ๋ฆฌ๋ ๊ฐ 1 ํฌํจ
Tab 1์์์๊ฐ ์ถ์ ๋ถํฌ: ์ ๋ฌธ๊ฐ ๊ธฐ์ค์ผ๋ก๋ ์ ๋ฐ์ด 1์๊ฐ ์ด๊ณผ, ์ฃผ๋์ด ๊ธฐ์ค ๋๋ถ๋ถ ํ๋ฃจ ์ด์- e.g.
fix-ocaml-gc: long-horizon task๋ฅผ ํํํ ์ ์์์ ๋ณด์ด๋ ์ฌ๋ก- ์คํจํ ์ต์ ํ ์ดํ OCaml garbage collector ์์ , ์ ๋ฌธ๊ฐ 1์ผ / ์ฃผ๋์ด 10์ผ ์ถ์
- e.g.
verification
- ๋จ์ task 1๊ฐ๊ฐ ์ถฉ์กฑํด์ผ ํ ๊ธฐ์ค 3๊ฐ์ง
- Specificity: container๊ฐ ํ์ฉ ๊ฐ๋ฅํ ์ํ๋ก ๋๋ ๋ ๊ทธ๋ฆฌ๊ณ ๊ทธ๋๋ง ํ
์คํธ ํต๊ณผ (iff, ์๋ฐฉํฅ ์กฐ๊ฑด)
- ์ง์๊ฐ ๋ชจ๋ ์ ๋ต ์ํ๋ฅผ ์์ ํ๊ณ ํ ์คํธ๊ฐ ๊ทธ๊ฑธ ์ ๋ถ ํฌ์ฐฉํด์ผ ํจ
- 3๋ฒ, 4๋ฒ, 6๋ฒ
- Solvability: oracle solution ์คํ ์ ์ ํ ์คํธ ํต๊ณผ (2๋ฒ, 5๋ฒ)
- Integrity: ํ์ค์ ์์ ์ง๋ฆ๊ธธ๋ก ํต๊ณผ ๋ถ๊ฐ (2๋ฒ, 7๋ฒ)
- e.g. ํน์ commit์ git ์ ์ฅ์๋ฅผ ๋ค๋ฃจ๋ task๋ผ๋ฉด ๋ฏธ๋ commit์ history์์ ์ ๊ฑฐ
- Specificity: container๊ฐ ํ์ฉ ๊ฐ๋ฅํ ์ํ๋ก ๋๋ ๋ ๊ทธ๋ฆฌ๊ณ ๊ทธ๋๋ง ํ
์คํธ ํต๊ณผ (iff, ์๋ฐฉํฅ ์กฐ๊ฑด)
Fig 37๋จ๊ณ audit์ผ๋ก 3๊ฐ์ง ๊ธฐ์ค ๊ฐ์ - Phase 1 (pre-merge): ๋ณํฉ ์ ์ฝ๋๋ง ๋ณด๊ณ ํ๋จ ๊ฐ๋ฅํ ๊ฒ. ํ์ผ๋ง ์ฝ์ด๋ ๊ฐ๋ฅ.
- ๊ธฐ์ฌ์ ์ฒดํฌ๋ฆฌ์คํธ
- ์๋ CI: canary string ์กด์ฌ, Dockerfile ๋ด ํ ์คํธ/์ ๋ต ํฌํจ ์ฌ๋ถ, apt ์์กด์ฑ pinning, privileged container ๊ธ์ง ๋ฑ
- LLM ๊ฒ์ฌ: ํ ์คํธ๊ฐ ๊ฒ์ฌํ๋ ํ๋์ ์ง์๋ฌธ ์์ ์ฌ๋ถ, ์คํ, hardcoded solution ์ฌ๋ถ ๋ฑ
- ์ ๋ฌธ๊ฐ ๋ฆฌ๋ทฐ
- Phase 2 (post-merge): ์ค์ ์คํ ํ ํ๋จ ๊ฐ๋ฅํ ๊ฒ. ์ค์ API /์ฌ๋ ๋น์ฉ ํฌ์ฌ
- Terminus ๋ชจ๋ธ ์คํ
- ์๋ trajectory ๊ฐ์ฌ
- adversarial exploit audit: OpenHands agent์ โ๋๋ security bot์ด๊ณ ๋ชฉํ๋ ์ด๋ป๊ฒ๋ cheatํด ํต๊ณผํ๋ ๊ฒโ ํ๋กฌํํธ๋ฅผ ์ฃผ์
- ์ค์ ๊ฒ์ถ๋ exploit
- ํ ์คํธ ํ๊ฒฝ monkey-patching: ๋ฌธ์ ๋ฅผ ํธ๋ ๋์ ์ฑ์ ์ฝ๋๋ฅผ ๊ณ ์ณ ๋ฌด์กฐ๊ฑด ํต๊ณผ์ํด
- ๋ต ์ฐ๊ธฐ: ํ์ง ์๊ณ ๊ทธ๋ด๋ฏํ ๊ฐ๋ง ์ถ๋ ฅ
- ํ๋ณด ์ ๋ ์์ฑ: ๋ต ํ๋๋ฅผ ๊ณ ๋ฅด๋ ๋์ ๊ฐ๋ฅํ ๋ต์ ๋ชจ๋ ๋จ๊ฒจ๋ ; ํ
์คํธ๊ฐ ์ ๋ต์ ์กด์ฌ๋ง ํ์ธํ๊ณ ์ค๋ต์ ๋ถ์ฌ๋ ํ์ธํ์ง ์์ผ๋ฉด ํต๊ณผํจ
- Specificity๋ฅผ iff(์๋ฐฉํฅ)๋ก ์๊ตฌํ๋ ๊ทผ๊ฑฐ
- ์ค์ ๊ฒ์ถ๋ exploit
- โ ์ต์ข ๊ฒฐ์ : task๋น ํ๊ท 7๋จ๊ณ ์ ์ฒด scoring์ ํ๊ท 3 reviewer-hour ํฌ์ ; 89๊ฐ๋ฉด ์๋ฐฑ person-hour
- Phase 1 (pre-merge): ๋ณํฉ ์ ์ฝ๋๋ง ๋ณด๊ณ ํ๋จ ๊ฐ๋ฅํ ๊ฒ. ํ์ผ๋ง ์ฝ์ด๋ ๊ฐ๋ฅ.
Terminus 2์ Harbor
Fig 34Terminus 2: ๋ชจ๋ธ ํ๋ ์์ด ๊ณตํํ๊ฒ ๋ง์ถ ์ค๋ฆฝ์ ์ธ scaffold ์ ๊ณต๋ ์คํ ํ๊ฒฝ- agent scaffold๋ ๋๊ฐ ํน์ ๋ชจ๋ธ์ ๋ง์ถฐ ํ๋(๋์ผ ์กฐ์ง ์ ์ ์ ํนํ), ๋ชจ๋ธ ์ฑ๋ฅ๊ณผ scaffold ์ฑ๋ฅ์ด ๊ต๋๋จ
- ์ ์ฉ ํ์ผ ํธ์ง ๋๊ตฌ๋ ๋ค์ด๋ก๋ ๋๊ตฌ ์์ด bash ๋จ์ผ ๋๊ตฌ๋ง ์ฌ์ฉ
- ํ์ผ ์์ฑ ๋ฐฉ์(script ์์ฑ, echo ์ฃผ์ , vim ์คํ)์ ๋ชจ๋ธ์ด ์์จ ๊ฒฐ์
- context limit ๋๋ฌ ์ ์์ฝ ๋ชจ๋ ๋ฐ๋
- โ๊ณง ๋ค๋ฅธ agent์๊ฒ ์์ ์ ๋๊ธด๋ค, ์ง๊ธ๊น์ง ํ ์ผ์ ์์ฝํ๋ผโ๋ก ์์ถ
- ์๋ฐฑ๋ง ํ ํฐ ๊ท๋ชจ task๋ ์ง์ ๊ฐ๋ฅ
- ์คํ ์์: LLM์ด keystroke(ํค๋ณด๋๋ก ์น ๋ช ๋ น์ด ๋ฌธ์์ด) ์ถ๋ ฅ โ Terminus๋ container ๋ด tmux shell์์ ์คํ โ ํ๋ฉด pane ๋ณํ. ํ๋ฉด ์ ์ฒด๋ฅผ ๋ชจ๋ธ์ ์ ๋ ฅ
- Harbor: ๋๊ท๋ชจ agent ํ๊ฐ ์คํ ํ๋ ์์ํฌ
harbor run -d terminal-bench@2.0์ผ๋ก ์ฌํ- Daytona sandbox์์ container 32~100๊ฐ ๋ณ๋ ฌ ์คํ
Effects
- Experimental setup
- agent 6์ข : Claude Code, Codex CLI, Gemini CLI (์์ฉ CLI) / OpenHands (Wang et al., 2025), Mini-SWE-Agent (Yang et al., 2024), Terminus 2 (์คํ, ์์ฒด)
- ๋ชจ๋ธ 16์ข
: GPT-5.2, GPT-5, GPT-5-Mini, GPT-5-Nano, Claude Opus 4.5, Opus 4.1, Sonnet 4.5, Haiku 4.5, Gemini 3 Pro, 3 Flash, 2.5 Pro, 2.5 Flash, Grok 4, Grok Code Fast 1, GPT-OSS 120B/20B, Llama 4 Maverick, Qwen 3 Coder 480B, Kimi K2 Instruct, K2 Thinking, GLM 4.6, MiniMax M2
- reasoning effort๋ provider ๊ธฐ๋ณธ๊ฐ (Anthropic, OpenAI๋ medium)
- open-weight๋ Together.AI API ๊ฒฝ์
- ์กฐํฉ๋น ์ต์ 5ํ ๋ฐ๋ณต, ์ด 32,155 trial (1 trial = agent 1ํ์ task 1๊ฐ ์๋)
- metric์ resolution rate(์ ํ ์คํธ ํต๊ณผ ๋น์จ)์ 95% CI
- Results
Fig 1Tab 2Main- Codex CLI + GPT-5.2๊ฐ 63%๋ก ์ต๊ณ
- Terminus 2 + Claude Opus 4.5๊ฐ 58%, Terminus 2 + Gemini 3 Pro๊ฐ 57%
- ์์ 13์๊น์ง ์ ๋ถ proprietary ๋ชจ๋ธ; open-weight ์ต๊ณ ๋ Terminus 2 + Kimi K2 Thinking์ 36%
- ์ํ ๋ชจ๋ธ์ 15% ๋ด์ธ, GPT-OSS-20B๋ 3% ์์ค
- Finding 1: ๋ชจ๋ธ ์ ํ์ด scaffold ์ ํ๋ณด๋ค ์ค์
- ๋์ผ Codex CLI์์ GPT-5-Nano๋ฅผ GPT-5.2๋ก ๊ต์ฒด ์ +52%p
- Gemini 2.5 Pro์ scaffold๋ฅผ OpenHands์์ Terminus 2๋ก ๊ต์ฒด ์ +17%p
- Finding 2
Fig 5,Fig 10: ์ ์ฒด 1ํ ์คํ ๋น์ฉ์ด ๋ชจ๋ธ์ ๋ฐ๋ผ $1~$100+๋ก ๋ถ์ฐ- ๋๋ถ๋ถ trial์ 20๋ถ ์ด๋ด, model call 25ํ ๋ฏธ๋ง, ํ ํฐ 1000๋ง ๋ฏธ๋ง
- ๊ทน๋จ์ ์ผ๋ก 2์๊ฐ ๋์ ์๋ฐฑ ํ ํธ์ถํ๋ฉฐ 1์ต ํ ํฐ์ ๊ทผ์ ํ๋ ์ฌ๋ก ์กด์ฌ
- Finding 3
Fig 6: 8๊ฐ์๊ฐ SOTA ์ฑ๋ฅ์ด ๊ฑฐ์ 2๋ฐฐ- Gemini 2.5 Pro 2025-04 ์ฝ 32%์์ GPT-5.2 2025-12 ์ฝ 63%๋ก ํฌ๊ฒ ์์น
- ์ ์๋ 1๋ ๋ด ํฌํ๋ฅผ ์ธ์ ํ๊ณ ์ ๊ท task set ์ง์ ๋ฐฐํฌ ๊ณํ์ ๋ช ์
- Finding 4
Fig 7: ์ฌ๋์ด ๋๋ผ๋ ๋์ด๋์ ๋ชจ๋ธ์ด ๋๋ผ๋ ๋์ด๋๊ฐ ๊ดด๋ฆฌ- empirical difficulty (์ ๊ฐ๋
): ์ฌ๋ ๋ผ๋ฒจ(medium/hard)์ด ์ฃผ๊ด์ ์ด๋ฏ๋ก Terminus 2์์ frontier ๋ชจ๋ธ ํ๊ท pass rate๋ก ๋์ด๋๋ฅผ ์ฌ์ ์
- 66.7% ์ด์ Easy, 33.3~66.7% Medium, 33.3% ๋ฏธ๋ง Hard
- ์์ ์๊ด ์กด์ฌ (r=0.436, p<0.001); human-hard์ 93.3%๊ฐ empirically hard๋ก ์ผ์น
- ์ต๋ ๊ดด๋ฆฌ๋ human-medium์ธ๋ฐ ๋ชจ๋ธ์๊ฒ hard์ธ 54.5%; ์ธ๊ฐ ์ง๊ด์ด ์ฐ์์ธ ์ง์
- e.g.
break-filter-js-from-html(XSS ํํฐ ์ฐํ),winning-avg-corewars(Redcode ์ ๋ต) - ํจํด ์ถ์ข ์ด ์๋๋ผ ์ฐฝ์์ , ์ ๋์ ์ถ๋ก ์ ์๊ตฌ
- e.g.
- ์ญ๋ฐฉํฅ์ผ๋ก human-medium ์ค 16.4%๋ empirically easy; ๋๊ฐ ๋ฌธ์ ์ค์ ๊ฐ์ ์ ์ฐจ์ ํ์ ์์
- empirical difficulty (์ ๊ฐ๋
): ์ฌ๋ ๋ผ๋ฒจ(medium/hard)์ด ์ฃผ๊ด์ ์ด๋ฏ๋ก Terminus 2์์ frontier ๋ชจ๋ธ ํ๊ท pass rate๋ก ๋์ด๋๋ฅผ ์ฌ์ ์
- Finding 5 (
Fig 8): ์คํจ์ ๋๋ถ๋ถ์ ๋ฅ๋ ฅ ๋ถ์กฑ์ด ์๋๋ผ execution ๊ท์จ ๋ฌธ์ - ํ์ด์๊ฐ ์๋๋ผ ์ง์๋ฅผ ์ด๊ธฐ๊ฑฐ๋, ๊ฐ์ ์ผ์ ๋ฐ๋ณตํ๊ฑฐ๋, ๋ฉ์ถ ๋๋ฅผ ๋ชฐ๋ผ์ ์คํจํ๋๋ผ
- ์คํจ ๊ด์ธก ์ ์ฐจ:
- ๋ถ๋ฅ ์ฒด๊ณ: ๋ค์ค agent์ฉ ๋ถ๋ฅ์ธ MAST(Pan et al., 2025)๋ฅผ ๋จ์ผ agent ํ๊ฒฝ์ ๋ง๊ฒ ์ ๋ฆฌํด Terminal Agent Taxonomy(TAT) ๋์ถ
- ์ ์ธ: โ๋ํ ๋ฆฌ์ โ, โ์ ๋ณด ์๋โ, โํ agent ์ถ๋ ฅ ๋ฌด์โ๋ ๋จ์ผ agent์ ๋ฐ์ํ์ง ์์
- ๋ณํฉ: โtask ๋ช ์ธ ์๋ฐโ๊ณผ โrole ๋ช ์ธ ์๋ฐโ์ CLI์ ์ญํ ๊ฐ๋ ์ด ์์ด ๊ตฌ๋ถ ๋ถ๊ฐ
- โclarification ์์ฒญ ์คํจโ๋ ํ๊ฒฝ์ด ์ง๋ฌธ์ ์ง์ํ์ง ์์ ์ ์ธ
- ํ์ ๊ธฐ์ค: ์คํจ mode๋ง๋ค rubric ๋ณ๋ ์์ฑ
- ๊ตฌ์ฑ์ framing(์ฉ์ด์ ๋ฒ์ ๊ณ ์ ) + decision procedure(๋จ๊ณ๋ณ MATCH/NO MATCH ๋ถ๊ธฐ) + ์ ์ธ ๊ธฐ์ค
- e.g.
No or Irrelevant Verification์ โ๊ด์ฐฎ์ ๋ณด์ธ๋คโ ๋ฅ์ ์๊ธฐ ์ฃผ์ฅ์ ๊ฒ์ฆ์ผ๋ก ๋ถ์ธ์ ; agent๊ฐ ๋ฏธ์์ ๋ช ์์ ์ผ๋ก ์ธ์ ํ ๊ฒฝ์ฐ๋ ์ ์ธํด Premature Termination๊ณผ ๊ฒฝ๊ณ๋ฅผ ๊ทธ์
- ํ์ ๊ณผ ๊ฒ์ฆ:
- LLM judge(GPT-5, high reasoning)
- Docent๋ก ๋ก๊ทธ๋ฅผ ํ์ด rubric์ ๋ชจํธํ ์ง์ ์ ๋ฐ๋ณต ์ ์
- ์บ๋ฆฌ๋ธ๋ ์ด์ 20 trial์์ ์ฌ๋ ์ฃผ์์ ๊ฐ ์ผ์น 93%(Cohenโs ฮบ)
- human-labeled 120 trace ๋๋น judge ์ผ์น์จ 90%(precision 92%, recall 90%)
- ๋ถ๋ฅ ์ฒด๊ณ: ๋ค์ค agent์ฉ ๋ถ๋ฅ์ธ MAST(Pan et al., 2025)๋ฅผ ๋จ์ผ agent ํ๊ฒฝ์ ๋ง๊ฒ ์ ๋ฆฌํด Terminal Agent Taxonomy(TAT) ๋์ถ
- ์ธก์ ๋ฒ์๋ task๋ง๋ค ๋ชจ๋ธ๋ณ ์คํจ trial 2๊ฐ, scaffold๋ Terminus 2๋ก ๊ณ ์
- pytest ์ ์ ์ฑ์ ๊ณผ ๋ฌด๊ดํ ์ฌํ๋ถ์; ์ ์์ ์ํฅ์ ์ฃผ์ง ์๊ณ ์คํจ ์์๋ง ๊ธฐ์
Fig 8์ ๋น์จ์ ์ ์ ํต๊ณ๊ฐ ์๋๋ผ ํ๋ณธ ๋ถํฌ
- ๊ฒฐ๊ณผ: Claude Opus 4.5์ GPT-5.2๋ ์ ์ฌ ํ๋กํ์ผ๋ก Execution์ด ์ง๋ฐฐ, coherence์ verification์ ๋ฎ์; open-weight์ธ Qwen 3 Coder 480B๋ ์ ๋ฒ์ฃผ์ ๊ณ ๋ฅด๊ฒ ๋์
- ์ ์ ํด์; execution์ ๋ชฐ๋ฆฐ ๋ชจ๋ธ์ ์ง์ ์ค์ ๊ฐํ๋ก ๋์ ๊ฐ๋ฅ, ์ ๋ฒ์ฃผ์ ๊ฑธ์ณ ์๋ ๋ชจ๋ธ์ ์ผ๊ด์ฑ๊ณผ self-monitoring ๋ฉ์ปค๋์ฆ ์์ฒด๊ฐ ํ์
๊ณ์ธต failure mode Execution Disobey Specification / Step Repetition / Unaware of Termination Conditions Coherence Reasoning-Action Mismatch / Context Loss / Task Derailment Verification Premature Termination / No or Incorrect Verification / Weak Verification - Finding 6
Fig 9: command ๋จ์ ์คํจ์จ์ ๋ชจ๋ธ๋ณ 9.2%(Grok 4)์์ 26.7%(GPT-OSS-120B)- ํ์ ์ ๋ณ๋ LLM judge 2๊ฐ ์ฌ์ฉ
- ์คํจ ์ฌ๋ถ๋ GPT-5(medium), 3์ธ ๋ค์๊ฒฐ 66์ ๋๋น 92.4% ์ผ์น
- taxonomy ๋ถ๋ฅ๋ GPT-5(high), ์ ์ 1์ธ 50๊ฐ ์ฃผ์ ๋๋น 82.0% ์ผ์น
- 3,800๊ฑด ๊ท ๋ฑ ์ํ์ ๋ถํฌ
- Invocation 35.1%; command not found 24.1%๋ก ๋จ์ผ ์ต๋ค, shell syntax error 4.5%
- REPL 19.1%; module not found 8.3%, script syntax error 6.1%
- Runtime 15.5%; app failure 9.6%
- Filesystem 14.1%; file not found 11.1%
- ํ์ ์ ๋ณ๋ LLM judge 2๊ฐ ์ฌ์ฉ
- Finding 7
Fig 35Fig 36: turn ์์ ํ ํฐ ์๋ ์ฑ๊ณต๋ฅ ๊ณผ ๋ฌด๊ด- episode ์์ ์ฑ๊ณต๋ฅ ์ ์๊ด r=-0.028 (p=0.916), ์ถ๋ ฅ ํ ํฐ๊ณผ ์ฑ๊ณต๋ฅ ์ ์๊ด r=-0.170 (p=0.515)
- GPT-5 Codex๋ ํ๊ท 10 episode๋ก 44%, Claude Sonnet 4.5๋ 22 episode๋ก 43%, GPT-5๋ 7 episode๋ก 35%
- ๋ฐ๋๋ก Qwen 3 Coder 480B์ GLM 4.5 Air๋ 35 episode๋ฅผ ์ฐ๊ณ 24%
- GPT-5-Nano๋ ํ๊ท 6๋ง ํ ํฐ์ผ๋ก ์ต๋ค ์ถ๋ ฅ์ด๋ ์ฑ๊ณต๋ฅ 8%
- ์ฅํฉํจ์ ๊ผผ๊ผผํจ์ด ์๋๋ผ ๋นํจ์จ์ ์ถ๋ก ์ ์ ํธ
Fig 11frontier tasks: task์ model ๊ทธ๋ฆฌ๋์์ ์ด๋ค ๋ชจ๋ธ๋ ํด๊ฒฐํ์ง ๋ชปํ๋ ๊ตฐ์ง์ด ์กด์ฌ- ๋ณต์กํ ์์คํ ์ค์ , ์ปค๋ ๋๋ผ์ด๋ฒ ์ปดํ์ผ, DB ๋ง์ด๊ทธ๋ ์ด์
- ๋๊ฐ์ ๊ทผ์ฒ๋ ๋ชจ๋ธ ๋ฅ๋ ฅ ํฅ์์ ๋ฐ๋ผ unsolvable์์ solvable๋ก ์ ์ดํ๋ ํ์ ์ฐ๊ตฌ ๋์
Personal note. ์ฌ์ฉํ๊ณ ์ํ๋ ํ๊ฒฝ์ผ๋ก์๋ ์ฌ๊ฒํ ๊ฐ ํ์ํ๋ค๊ณ ๋ด ๋๋ค. ์ฑ์ ์ด ์ต์ข container ์ํ ํ๋๋ก ํ์๋๊ณ ๋ถ๋ถ์ ์๊ฐ ์์ด์ ์ค๊ฐ์ ๋ฌด์์ ๊ธฐ๋กํ๋ ์ ์์ ๋ฐ์๋์ง ์๊ณ , clarification์ด ํ๊ฒฝ์์ ์ง์๋์ง ์์ taxonomy์์ ์์ ๋น ์ก์ผ๋ฏ๋ก ๊ฐ์ ์ด๋ ํ์ธ ์ถ์ ๋ณด๋ ค๋ฉด ์ฌ์ค๊ณ๊ฐ ํ์ํด๋ณด์ ๋๋ค. ์ธ์ ๊ฒฝ๊ณ ๋ถ์ฌ๋ ์ด๋ฏธ ์์ํ ์ฌํญ์ด๋, ๊ทธ์ ๋ณ๊ฐ๋ก write ์ฌ๋ถ๋ฅผ ์กฐ์ํ ์กฐ๊ฑด์ด ์ผ๋จ ์๊ธด ํด์ โ์ ์จ์ ๋๋น ์ก๋คโ๋ฅผ ์ธก์ ํ ์ข ์ ๋ณ์ธ๋ ์ค์ง์ ์ผ๋ก๋ ๋ถ์ฌํ๊ธฐ๋ ํฉ๋๋ค.
๊ทธ๋๋ง ์กฐ์ ๊ฐ๋ฅํ ์ง์ ์ Terminus 2๋ก ๋ณด์ด๋๋ฐ, context limit์์ ๋ฐ๋ํด ํ๋ ์ผ์ ์ธ์ฌํ๊ฐ ๋ง๊ธด ํ์ง๋ง, ๊ทธ ์ธ์ฌํ๋ ์ ๋ณด์ ์์ ์ฒ๋ ํ์ผ์ด ์๋๋ผ context์ด๊ณ , ์์ฝ ์ ํ๋กฌํํธ๋ ์ง์ง ์์ฝํด๋ผ ์ ๋์ ๋ฌธ์ฅ ์์ค์ธ ๊ฒ๋ ์ค๊ณ์ ๊ด์ฌ ๋ฐ์ ์๋ ๊ฒ์ผ๋ก ๋ณด์ฌ์. ์กฐ๊ธ ๋์ด๋ธํ๊ฒ ๋ณด๋ฉด ๋ญ ์ฐ๊ณ ๋๊ฐ ๋ณผ ๋์ ๋ฐ๋ผ ๊ทธ ๋ด์ฉ์ด ๋ฌ๋ผ์ ธ์ผ ํ๋์ง, ์ฝ๊ฑฐ๋ ์ฐ๊ธฐ๋ ์ด๋ป๊ฒ ๊ฒฐ์ ํ ์ง ์ ๋๋ ๋ณ์ธ์ผ๋ก ๋ณผ ์ ์์ ๊ฒ ๊ฐ๊ธฐ๋ ํฉ๋๋ค.
๋ฒ์ ์ด ๋ฌธ์ ์ธ๋ฐโฆ ๋ ผ๋ฌธ์ 2.0(2025-11)์ ๊ตฌ๊ตฌ์ ์ ์ค๋ช ํ๋๋ฐ ํ์ฌ๋ 4.0(2026-08)๊น์ง ๋์๊ณ , 3.0์์ task set์ด ํฌ๊ฒ ๊ต์ฒด๋ ๊ฒ์ผ๋ก ๋ณด์ฌ ๋ ผ๋ฌธ์ 63%์ ํํ ๋ฆฌ๋๋ณด๋ ์์น๋ ๋น๊ต๊ฐ ๋ถ๊ฐํ ๊ฒ์ผ๋ก ๋ณด์ ๋๋ค. 4.0์ flat 8์๊ฐ timeout์ผ๋ก ์ธก์ ๋ ธ์ด์ฆ๋ฅผ ์ค์ด๊ณ 8๊ฐ๋ฅผ ์ ๊ฑฐ, 19๊ฐ๋ฅผ ์์ ํ๋๋ฐ 2.0์ด ๋ด์ธ์ด ๊ฒ์ฆ ์ ์ฐจ๊ฐ 3.0๊ณผ 4.0์์๋ ์ ์ง๋๋์ง๋ ๋ฌธ์๋ก ํ์ธ๋์ง ์์ต๋๋ค. ๋ค๋ง 8์๊ฐ timeout์ context ์์ถ์ด ๋ ์์ฃผ ๋ฐ์ํ๋ค๋ ๋ป์ด๋ผ ์์ฝ ๋ชจ๋ ๊ด์ธก์๋ ์คํ๋ ค ์ ๋ฆฌํ ์๋? ๋น์ฉ๋ฌธ์ ์ธก๋ฉด๋ ์ข ๊ฑธ๋ฆฝ๋๋ค.