Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
- Authors: Zongxia Li, Zhongzhi Li, Yucheng Shi, Ruhan Wang, Junyao Yang, Zhichao Liu, Xiyang Wu, Anhao Li, Yue Yu, Ninghao Liu, Lichao Sun, Haotao Mi, Leowei Liang
- Affiliation: Tencent HY LLM Frontier; UMD; UGA; UMN; Indiana University; Lehigh; NUS; PolyU
- Paper: https://arxiv.org/abs/2607.08964
- Code: https://github.com/zli12321/LHTB
- Published: July 9, 2026 (arXiv preprint)
TL; DR
46๊ฐ long-horizon task๋ฅผ subtask ๋จ์ dense reward๋ก ์ฑ์ ํ๋ LHTB ์ ์
17๊ฐ frontier ๋ชจ๋ธ ์ค ์ต๊ณ ์ธ Grok 4.5๋ Rโฅ0.95 ๊ธฐ์ค 30% ๋ฏธ๋ง์ผ๋ก ๋งค์ฐ ๋ฎ์ ์ฑ๋ฅ
์คํจ์ ๋๋ถ๋ถ์ local ์ค๋ฅ๊ฐ ์๋๋ผ time budget ์์ง๊ณผ ์กฐ๊ธฐ ์ข
๋ฃ(false finish)์์ ๋น๋กฏ๋จ
- ์: ๊ธฐ์กด terminal/SWE benchmark๋ ์๋์ ์ผ๋ก ์งง์ task์ final pass/fail์ ์ง์ค, ์ค์ง ๊ธด workflow์์ agent๊ฐ ์ด๋๊น์ง ํด๋๊ณ ์ด๋์ failํ๋์ง๋ฅผ ๊ฑฐ์ ๋ณด์ฌ์ฃผ์ง ๋ชปํจ
- ์ ์: 46๊ฐ containerized long-horizon task + semantically meaningful subtask๋ณ deterministic grader๋ฅผ ๊ฒฐํฉํ ๋ฒค์น๋งํฌ ์ ์
- findings: 17๊ฐ frontier ๋ชจ๋ธ์์ 1๊ฐ์ containerized task์์ ํ๊ท 239๊ฐ ์ํผ์๋, ์ฝ 9.8M ํ ํฐ ์ฌ์ฉํ์ฌ 88.9๋ถ ์์. $R\ge0.95$ ๊ธฐ์ค ํ๊ท pass rate๋ 6.4%๋ก ๋งค์ฐ ๋ฎ์ ์์ค, unsolved run์ 79%๊ฐ time out.
- step 1๊ฐ ๋ง์ถ๋ ๊ฒ๋ณด๋ค long ์คํ์ ๋๊น์ง ์ ๊ด๋ฆฌํ๋๊ฐ์ ๋ฌธ์ ์ ๊ฐ๊น๋ค.

Background
- long-horizon workflow: ์๋ฐฑ step, ์์ญ ๋ถ์์ ์ ์๊ฐ, ๊ณ์ ๋ฐ๋๋ long-context state ๊ด๋ฆฌ ํ์ (Wang et al., 2026)
- ํ ๋ฒ์ action์ด ์๋๋ผ ๊ธด ๊ฒฐ์ sequence์ ๊ฑธ์น ์ง์์ ์ง์ ์ด ๊ฒฐ๊ณผ๋ฅผ ๊ฒฐ์ (Liu et al., 2026, KLong)
- e.g. ๋ ผ๋ฌธ ๊ฒฐ๊ณผ ์ฌํ, GitHub repo ํ๊ฒฝ ์ค์น, multimodal dataset audit, compiler toolchain ๋๋ฒ๊น , ML training pipeline
- agent ๋ฒค์น๋งํฌ ํํฉ
- terminal / software engineering: ๋๋ถ๋ถ ์ ๋ถ์์ ์ต๋ 1์๊ฐ, final state์ test ํต๊ณผ ์ฌ๋ถ๋ง ์ฑ์
- SWE-Bench (Jimenez et al., 2024)
- LiveCodeBench (Jain et al., 2024), SWT-Bench (Mรผndler et al., 2024)
- Terminal-Bench (Merrill et al., 2026)
- ๋ ๊ธธ๊ณ ์ด๋ ค์ด ๋ฐฉํฅ: FrontierSWE (Chu et al., 2026), SWE-EVO (Le et al., 2025), SWE-Marathon (Desai et al., 2026)
- long-horizon autonomy ์ธก์ : benchmark ์ ์ ๋์ ์์ ์ ์ผ๋ก ๋๋ผ ์ ์๋ task ๊ธธ์ด๋ฅผ capability ๋ณ์๋ก ๋ด
- METR time-horizon (Kwa et al., 2025)
- RE-Bench (Wijk et al., 2024), HCAST (Rein et al., 2025): ์ฌ๋ ๊ธฐ์ค ์์ ์๊ฐ์ผ๋ก calibration
- short-horizon ๋ฅ๋ ฅ์ด ์ข์๋ ์คํ ์ค๋ฅ ๋์ ์ผ๋ก long-horizon ์ฑ๋ฅ ์ ํ (Sinha et al., 2025)
- outcome-only๋ฅผ ๋๋ ์ฑ์ : ๋๋ถ๋ถ training reward๋ judge supervision ์ฉ๋, learned verifier๋ LLM evaluator ์์กด
- process reward model (Lightman et al., 2023; Khalifa et al., 2025)
- rubric ๊ธฐ๋ฐ ํ๊ฐ (Rao & Callison-Burch, 2026; Pan et al., 2026; Tian et al., 2026)
- agent harness: ๊ฐ์ ๋ชจ๋ธ๋ harness์ ๋ฐ๋ผ ๊ฒฐ๊ณผ๊ฐ ๋ฌ๋ผ์ง
- Harness-Bench (Yao et al., 2026), harness updating (Lin et al., 2026)
- SWE-agent (Yang et al., 2024), OpenHands (Wang et al., 2024), Terminus ๊ณ์ด, Codex
- terminal / software engineering: ๋๋ถ๋ถ ์ ๋ถ์์ ์ต๋ 1์๊ฐ, final state์ test ํต๊ณผ ์ฌ๋ถ๋ง ์ฑ์
- METR ๊ณ์ด์ time horizon ์ฐ๊ตฌ๋ agent๊ฐ ์ด๋ ์ ๋ ๊ธธ์ด๊น์ง์ human task๋ฅผ ์์ ์ ์ผ๋ก ์๋ฃํ๋๊ฐ capability variable๋ก ํ์ธ
Problem States
- ๊ธฐ์กด terminal ๋ฒค์น๋งํฌ์ ๋ ๊ณต๋ฐฑ
- horizon ๋ถ์กฑ: ์งง์ task๋ long-horizon ํ์, ์ค๋ฅ step ์์ , ๋ค๋จ๊ณ ๋๋ฒ๊น
์ ๋๋๋ฅผ ๊ณผ์ํ๊ฐ
- 9ํ ๊น์ง ์๋๋ฐ ๋ชปํผ๊ฑด์ง, ์์ ์๋๋ถํฐ ํ๋ ธ๋์ง ๊ตฌ๋ถํ์ง ์์ โ ์ค์ ๊ฐ์ ์ผ๋ก ์ด์ด์ง๊ธฐ ์ด๋ ค์
- outcome-only sparse grading: ๊ฑฐ์ ๋ค ํด๋ธ agent์ ์ฒ์๋ถํฐ ์คํจํ agent๊ฐ ๊ฐ์ 0์
- final test ๋จ์ผ๋ก ์ฑ๊ณต/์คํจ๋ฅผ ํ์ ํ๋ฉด, ๊ฐ์ ์์ธ์ด ๋ญ๊ฐ์ง
- partial progress
- near miss
- timeout
- premature stopping
- weak self-verification
- final test ๋จ์ผ๋ก ์ฑ๊ณต/์คํจ๋ฅผ ํ์ ํ๋ฉด, ๊ฐ์ ์์ธ์ด ๋ญ๊ฐ์ง
- horizon ๋ถ์กฑ: ์งง์ task๋ long-horizon ํ์, ์ค๋ฅ step ์์ , ๋ค๋จ๊ณ ๋๋ฒ๊น
์ ๋๋๋ฅผ ๊ณผ์ํ๊ฐ
- ํ์ ์กฐ๊ฑด
- ์๋ฐฑ episode, ์์ญ ๋ถ ์ด์์ด ํ์ํ task โ Task Formulation
- ๋๊น์ง ์์ํ์ง ๋ชปํ๋๋ผ๋ ์ด๋๊น์ง ํด๋๋์ง ๋๋ฌ๋ด๋ scoring์ด๋ LAAJ ์์ด deterministic โ Subtask-based Grading
- public test๋ง patchํ๊ฑฐ๋ ์ถ๋ ฅ์ hard-codingํด์ ์ ์๋ฅผ ์ป์ง ๋ชปํ๊ฒ ํ๋ ๊ตฌ์ฑ โ Dataset Construction
Suggestions
definition
- task ํ๋ = subtask ์งํฉ $\lbrace s_1, \dots, s_K \rbrace$, rollout ์ข ๋ฃ ์ container ์์ deterministic grader๊ฐ ๊ฐ $r_k \in [0, 1]$ ๊ณ์ฐ
- task reward๋ subtask ์ ์์ ๊ฐ์ค ํ๊ท
- $w_k$: non-negative weight, ๊ธฐ๋ณธ์ ๋์ผํ๊ณ ํ์ํ๋ฉด final goal์ ๊ฐ์ค
- $r_k$: final container state์ ๊ฐ๊ด์ ์ฆ๊ฑฐ(ํ์ผ, ์ถ๋ ฅ, test ๊ฒฐ๊ณผ, simulator ์๋ต)๋ก๋ง ์ฑ์
- $R \ge \tau$์ด๋ฉด resolved; pass@1์ ์ ์ฒด task ์ค threshold๋ฅผ ๋์ ๋น์จ
- ์ฃผ ์งํ $\tau = 0.95$ (relaxed), ๋ณด์กฐ๋ก $\tau = 0.9$, $\tau = 1.0$
- ๋ค ๋ชป ํผ task์ ์ง์ ์ mean normalized reward (task ํ๊ท R)๋ก ๋ฐ๋ก ๋ณด๊ณ
task formulation
- Terminal-Bench ํ์ ๊ทธ๋๋ก์ Harbor task (Harbor Framework Team, 2026)
- instruction + Docker image + task configuration + oracle implementation ๋๋ simulator
- asset, code, data, tool, helper script๊ฐ ๋ชจ๋ image ์์ ์์ด terminal๋ง์ผ๋ก ์๊ฒฐ
- agentโs input: ์ ์ฒด long-horizon ๋ชฉํ๋ฅผ ์ ์ instruction ํ๋
- instruction + Docker image + task configuration + oracle implementation ๋๋ simulator
- interactive ์งํ: ์๋ฐฑ step ๋์ command ์คํ, ํ์ผ ์์ , ์ค๊ฐ ์ถ๋ ฅ ํ์ธ ๋ฐ๋ณต, ์ฑ๊ณต ๋๋ timeout๊น์ง
- TB2์์ ์ฐจ์ด: ํ์์ ๊ฐ๊ณ , subtask ํ๋๊ฐ ์ด๋ฏธ ์ ๋ถ์์ ์ ์๊ฐ, ์์ญ์์ ์๋ฐฑ operation์ ์๊ตฌํ๋๋ก ์ค๊ณ
- long-horizon์ ์ถ์ฒ: ๋๋ฉ์ธ ์์ฒด(ML pipeline, campaignํ ๊ฒ์, ๊ณผํ audit) + ๋ชฉํ๋ฅผ ์๊ฐ์ ๊ฑธ์ณ ๋ฐ๊ฒฌํด์ผ ํ๋ ์ค๊ฐ target์ผ๋ก ๋ถํดํ๋ ๋ฐฉ์
subtask-based grading
- binary pass/fail ๋์ subtask completion rate๋ก partial credit
- subtask ์ ํ 3๊ฐ์ง
- Binary: ํ๊ฒฝ state์ ๋ํ Boolean ์กฐ๊ฑด (unit test ์ ๋ถ ํต๊ณผ, ์ง์ port ์๋ต, script ๋ฌด์ค๋ฅ ์คํ)
- Continuous / thresholded: ์ฌํ metric์ด tolerance ์์ด๋ฉด 1.0, ์ค์ฐจ๊ฐ ์ปค์ง์๋ก 0๊น์ง ์ ํ ๊ฐ์; held-out ์์ ์ค oracle ์ผ์น ๋น์จ
- Episode-aggregating: ๊ฒ์, ๋ฐ๋ณต audit์์ ์ฌ๋ฌ episode์ success flag ๋น์จ์ด๋ ํ๊ท normalized reward
- ํ ๋ฒ ์ด ์ข๊ฒ ์ฑ๊ณต์ด ์๋๋ผ ์ฌ๋ฌ episode์ ๊ฑธ์น ์์ ์ฑ ์ธก์
- e.g.
Fig 1final artifact๊ฐ ์ผ๋ถ hidden verification stage๋ง ํต๊ณผํ๋ฉด 0.80์ partial reward๋ฅผ ๋ฐ๊ณ , ๋ชจ๋ stage๋ฅผ ํต๊ณผํด์ผ 1.00์ ๋๋ฌlimate-netcdf-extreme-event-audit- ์ ์ฒด ๋ชฉํ: ๋ง๊ฐ์ง climate audit pipeline์ fix
- grader: ์ต์ข container state์์ ์ฌ๋ฌ requirement๋ฅผ ๋ฐ๋ก ๊ฒ์ฌ
dataset construction Fig 2
- ์ค์ ์ ๋ฌธ workflow์ ๊ณตํต recipe ์ ์ฉ (Vidgen et al., 2026, APEX-Agents; Wu et al., 2026)
- seed
- phase-diagram audit
- SLAM benchmark ์๋ฆฌ
- climate NetCDF ๊ทนํ ์ฌ๊ฑด ํ์ง
- audio-visual alignment
- figure data ๋ณต์
- ์์ฑ ํ์ ํ์ง
- ์ธํฌ ๊ณ์ QC
- ์ค์บ ๋ฌธ์ table ๋ณต์
- ์ผ๋ถ๋ APEX-Agents ๋ฑ์์ ๋ณํ, ๋๋จธ์ง๋ ์ ๊ท
- seed
- ๊ฐ ๋ฌธ์ ๋ง๋ค ์๊ฒฐ๋์ด ์์ง๋ง ์ผ๋ถ๋ฌ ํผ์๋ terminal-only project ๊ตฌ์ถ
- ์ ์์ ์ผ๋ก ์๋ํ๋ ์๊ฒฐ๋ project์ ์ ๋ต solution์ ์๊ณ ์๋ ์ํ๋ฅผ ๊ตฌ์ถํ๊ณ , ์ผ๋ถ๋ฅผ ํผ์ํ์ฌ agent์๊ฒ ์ฃผ๋ ํํ
- ํจํค์ง: public asset ์์ฑ script, weak baseline, official gold solution, multi-step
solve.sh, hidden verifier
- public check vs hidden stress suite ๊ฐ์ค์น ๋ถ๋ฆฌ
- public: CLI ๋์, ํ์ผ ํ์, ๋จ์ ์์ ๋ช ๊ฐ๋ง, ๋ฎ์ ๊ฐ์ค์น
- hidden: ๋ ์ด๋ ค์ด ์
๋ ฅ๊ณผ schema ๋ณํ์ ๋์ ์์ฑ, reward ๋๋ถ๋ถ ์ฐจ์ง
- nested manifest
- gzip+base64 wrapper
- ์ด๋ฆ ๋ฐ๋ field
- ๊ฒฐ์ธก๊ฐ, noise, ํ์ /crop ์ด๋ฏธ์ง, ์ด์ frame, ๋ค๋ฅธ ์ขํ๊ณ๋ time-dimension ๊ท์ฝ
- hard-coding์ด๋ public patch๋ก๋ ๊ณ ๋์ ๋ถ๊ฐ (gold solution์ hidden suite ์ ์ฒด์์ 1.0 ํ์)
- DeepSeek-V4-Pro๋ฅผ 1.5์๊ฐ budget์ผ๋ก ๋ฐ๋ณต ์คํํ๋ฉฐ ์ด๊ธฐ 120๊ฐ task์ ๋ํด difficulty calibration์ ๊ฑฐ์ณ ์ต์ข 46๊ฐ๋ก ์ ๋ณ
Effects
- Experimental setup
- environment: LHTB 46 task, 90๋ถ timeout
- agent: Harbor + Terminus-2 harness, ๋จ์ผ terminal session
- ์์ธ: GPT-5.3 Codex๋ง Codex harness
- ๋ชจ๋ธ 17์ข : GPT-5.6-sol, GPT-5.5, GPT-5.4, GPT-5.3 Codex, DeepSeek V4 Pro, Gemini 3.1 Pro, GLM 5.1, GLM 5.2, Kimi K2.6, Kimi K2.7 Code, MiniMax M3, Qwen3.7 Max, Qwen3.6 Plus, Doubao Seed 2.1 Pro, Hy3, Grok 4.20, Grok 4.5
- evaluation: pass@1 (ฯ = 0.9 / 0.95 / 1.0), mean R, episode ์, ์๊ฐ, ๋น์ฉ, token
- ๋น์ฉ์ 2026๋ 6์ list price, prompt cache ํ ์ธ ๋ฏธ๋ฐ์
- ๋ชจ๋ธ-task๋น ๋จ์ผ run (17 ร 46 = 782 run)
- Results
Fig 3Main: frontier ๋ชจ๋ธ๋ ํฌ๊ฒ ๊ณ ์ - Grok 4.5 ์ต๊ณ : 28.3% (13/46) @ Rโฅ0.95
- GPT-5.6-sol, GPT-5.5๊ฐ 15.2% (7/46)
- ์ ์ฒด ํ๊ท pass@1์ Rโฅ0.95์์ 6.4%, Rโฅ1.0์์ 3.2%
- Finding 1
Fig 3Fig 4: dense reward๊ฐ ์์ด์ผ ์์๊ฐ ๋๋ฌ๋จ (์ธ๋ฐํ๊ฒ ์ฑ์ ํ์)- Rโฅ1.0 ๊ธฐ์ค์ผ๋ก๋ 17๊ฐ ์ค 10๊ฐ ๋ชจ๋ธ์ด 0๊ฐ โ binary๋ฉด ํฐ ๋์ ๊ทธ๋ฃน!!
- 782 run ์ค pass 50 (6.4%), ์ง์ ์์(R < 0.05) 241 (30.8%), ๋ถ๋ถ ์ง์ 491 (62.8%)
- pass rate์ mean R์ Spearman ฯ = 0.74๋ก ์ค๊ฐ ์์ค ์๊ด โ ์์ ํด๊ฒฐ๊ณผ ๋ถ๋ถ ์ง์ ์ ๋ค๋ฅธ ๋ฅ๋ ฅ
- 1๊ฐ ํด๊ฒฐ๋ก ๋์ ์ธ ๋ชจ๋ธ ์ฌ์ด์์๋ mean R์ GPT-5.4 0.27๋ถํฐ GLM 5.2 0.32๊น์ง
- near-miss (0.75 โค R < 0.95)๊ฐ pass์ ๊ฑฐ์ ๋ ๋ฐฐ (90 vs 50)
- e.g. Kimi K2.6์ ํด๊ฒฐ 0๊ฐ์ง๋ง near-miss 5๊ฐ,
grammar-fuzz-coverage-hunt์์ R = 0.94
- e.g. Kimi K2.6์ ํด๊ฒฐ 0๊ฐ์ง๋ง near-miss 5๊ฐ,
- Finding 2
Tab 1Fig 5: ๋น์ฉ์ด ๊ณง ์ฑ๋ฅ์ ์๋๋๋ผ- ํ๊ท 239 episode, 9.8M token, 88.9๋ถ, ์ฝ $10.8 per task
- ๋ชจ๋ธ๋ณ ์ฝ $3.6์์ $26
- Grok 4.5๋ ์ฝ $11๋ก Pareto frontier ์๋จ; GPT-5.6-sol, GPT-5.5๋ ์ฝ $21
- GPT-5.4๋ ์ฝ $26๋ก ์ต๊ณ ๊ฐ์ง๋ง pass rate ๋ฎ์ (episode 302 vs GPT-5.5 208)
- ์ ๋น์ฉ frontier: Hy3 ($3.6), Doubao Seed 2.1 Pro (์ฝ $5), MiniMax M3 (์ฝ $6)
- ํ๊ท 239 episode, 9.8M token, 88.9๋ถ, ์ฝ $10.8 per task
- Finding 3
Fig 6: ๋ณ๋ชฉ์ local ์คํ ์ ํ๋๊ฐ ์๋๋ผ long-horizon ์์- ๋ฏธํด๊ฒฐ run์ ์ฃผ ์์ธ์ budget ์์ง ์ค์ธ timeout (๋ณธ๋ฌธ ๊ธฐ์ค 79%, 518/660)
- timeout run์ mean R์ ๋ชจ๋ธ๋ณ 0.10์์ 0.35 โ ์์ ์ง์ ์ด ์๋๋ผ ์งํ ๋์ค
- ์ค์ค๋ก ์ข ๋ฃํ early exit ์ฝ 19%, harness error ์ฝ 3%
- TB2(๋๋ถ๋ถ 20๋ถ ์ด๋ด)์์๋ ๋ช ์ธ ๋ถ์ดํ, step ๋ฐ๋ณต, ์ข ๋ฃ ์กฐ๊ฑด ๋๋ฝ ๊ฐ์ ์คํ ์ค๋ฅ๊ฐ ์ฃผ์๋ ๊ฒ๊ณผ ๋๋น
- ์ ์ ํด์: ์์๊ฐ task ํด๊ฒฐ ๋ฅ๋ ฅ๋ฟ ์๋๋ผ ๊ณ ์ budget ์์ reward๋ฅผ ์๋ time efficiency๋ฅผ ๋ฐ์
- ์ค๋ณต ํ์ ๊ฐ์, state ๋ณด์กด, ๋ฐ๋ณต ๊ฒ์ฆ loop ํํผ๊ฐ single-step reasoning ๊ฐ์ ๋ณด๋ค ์ด๋์ด ํด ์ ์์
- ๋ฏธํด๊ฒฐ run์ ์ฃผ ์์ธ์ budget ์์ง ์ค์ธ timeout (๋ณธ๋ฌธ ๊ธฐ์ค 79%, 518/660)
- Finding 4
Fig 6: false finish, ๊ฑฐ์ ๋ค ํด๋๊ณ ๋๋ฌ๋ค๊ณ ํ๋จํ๋๋ผ- false finish: ๋์ reward์์ early exitํ์ง๋ง hidden verifier ํต๊ณผ ์คํจ
- Kimi K2.7 Code๊ฐ
duckdb-optimizer-closure์์ R = 0.92๋ก ์ข ๋ฃ - GLM 5.2๊ฐ
apex-ib244-matter์์ R = 0.90๋ก ์ข ๋ฃ apex-law433-matter์์๋ ์๋ก ๋ค๋ฅธ 7๊ฐ ๋ชจ๋ธ์ด R 0.80์์ 0.87 ์ฌ์ด(์ฝ 20๋ถ ๋จ๊ธฐ๊ณ ์ข ๋ฃํ๋๋ผ)
- Kimi K2.7 Code๊ฐ
- early exit ์์ ํ๊ท R๋ก stopping judgment ์ฐจ์ด๊ฐ ๋๋ฌ๋จ
- Kimi K2.7 Code 0.51, MiniMax M3 0.42๋ก ๋ฆ๊ฒ ๋ฉ์ถค vs ๋ค๋ฅธ ๋ชจ๋ธ 0.22์์ 0.39; Kimi K2.6์ 0.11์์ ํฌ๊ธฐ
- false finish: ๋์ reward์์ early exitํ์ง๋ง hidden verifier ํต๊ณผ ์คํจ
- ์ฐ๊ตฌ ๊ฒฐ๋ก ) ๋ณดํต ์๋ฃ ์ ๋๋ฅผ ์ฒด๊ณ์ ์ผ๋ก ๊ณผ๋ํ๊ฐํ๊ณ final verification์ ํฌ์๋ฅผ ๋ ํจ
- TB2 taxonomy์ premature termination, weak verification์ long-horizon ๋ฒ์
- ํด๊ฒฐ ๋ฐฉํฅ์ผ๋ก planning, memory์ progress tracking, calibration๋ stopping decision ์ ์
Personal note. ์ง๋์ฃผ terminal-bench ์๊ฐ๋๋ฆฌ๋ฉด์ ์ค๊ฐ์ ๋ฌด์์ ๊ธฐ๋กํ๋ action-level์ scoring์ ๋ฐ์๋์ง ์๋ ํ๊ฐ๋ฐฉ์์ ์ทจํ๋ค๊ณ ์ ๋ฆฌํ์๋๋ฐ, ์ด ์ฐ๊ตฌ๋ ๋ง์ฐฌ๊ฐ์ง๋ก action-level์ ์๋ณด์ง๋ง, ๊ธธ์ด๊ฐ ๋งค์ฐ ๊ธธ์ด์ (์ ํํ tb2์ task ์ฌ๋ฌ๊ฐ๋ฅผ ์ด์ด ๋ถ์ธ ๊ฑด ์๋์ง๋ผ๋) (sub) task-level์ scoring์ ํ๊ฒ ๋ค๋ ์ ์์ process๋ฅผ ๋ณธ๋ค๊ณ ์ฃผ์ฅํ ๊ฒ ๊ฐ์ต๋๋ค.
๊ทธ๋์ ์ฃผ์ฅํ๊ณ ์๋ dense reward๋ RL์์ step๋ง๋ค ๋ถ๋๋ค๋ ๋๋์ผ๋ก ์ฒ์์ ์ดํดํ๋๋ฐ,
Fig 1์ โprocess rewardโ๋ผ๋ ํํ์ ์ข ๊ณผํ๊ณ (๊ทธ๋ ๊ฒ ๋ณด๊ธด ์ด๋ ต๊ณ ), ์ ํํ๋ trajectory-level process supervision๋ณด๋ค subgoal-decomposed outcome evaluation์ ๊ฐ๊น๋ค๊ณ ๋ณด์ ๋๋ค.๊ฐ์ harbor ํ์์ terminus-2 ๊ทธ๋๋ก ์ฐ๊ณ task๋น ๊ฑฐ์ 10M token์ด๋ค๋๋ฐ ์ต์ 1ํ run ์์์ hand off ์์ฝ์ด ์์ฐจ๋ก๋ ๋ฐ์ํ ํ ๋ ์๋ฌต์ ์ธ ์ธ์ ์ค๋ฌ์ด(?) ๊ฒฝ๊ณ๊ฐ terminal-bench๋ณด๋ค ํจ์ฌ ์์ฃผ ์๊ธด๋ค๊ณ ๊ฐ์ฃผํ ์ ์๊ฒ ์ต๋๋ค. ์ฐ๊ตฌ ๊ฒฐ๋ก ์์ memory์ progress tracking์ ํด๋ฒ์ผ๋ก ๊ผฝ์ผ๋ฉด์๋ ๋น์ฐํ๊ฑด์ง ํ์ ๋ณด๊ณ ์ ๊ทธ์น ์ .. ์์ ์ฝ๊ฐ ํ๋ ์ด๋ฐ์ด ๊ณผํ๋ ๊ฒ ํฌํจ ์ฌ๋ฌ๋ชจ๋ก ์กฐ๊ธ ์์ฌ์ด ๋ถ๋ถ์ด ์์ต๋๋ค.