7 minute read

Meta info.
  • Authors: Zongxia Li, Zhongzhi Li, Yucheng Shi, Ruhan Wang, Junyao Yang, Zhichao Liu, Xiyang Wu, Anhao Li, Yue Yu, Ninghao Liu, Lichao Sun, Haotao Mi, Leowei Liang
  • Affiliation: Tencent HY LLM Frontier; UMD; UGA; UMN; Indiana University; Lehigh; NUS; PolyU
  • Paper: https://arxiv.org/abs/2607.08964
  • Code: https://github.com/zli12321/LHTB
  • Published: July 9, 2026 (arXiv preprint)

TL; DR

46๊ฐœ long-horizon task๋ฅผ subtask ๋‹จ์œ„ dense reward๋กœ ์ฑ„์ ํ•˜๋Š” LHTB ์ œ์•ˆ
17๊ฐœ frontier ๋ชจ๋ธ ์ค‘ ์ตœ๊ณ ์ธ Grok 4.5๋„ Rโ‰ฅ0.95 ๊ธฐ์ค€ 30% ๋ฏธ๋งŒ์œผ๋กœ ๋งค์šฐ ๋‚ฎ์€ ์„ฑ๋Šฅ
์‹คํŒจ์˜ ๋Œ€๋ถ€๋ถ„์€ local ์˜ค๋ฅ˜๊ฐ€ ์•„๋‹ˆ๋ผ time budget ์†Œ์ง„๊ณผ ์กฐ๊ธฐ ์ข…๋ฃŒ(false finish)์—์„œ ๋น„๋กฏ๋จ
  • ์™œ: ๊ธฐ์กด terminal/SWE benchmark๋Š” ์ƒ๋Œ€์ ์œผ๋กœ ์งง์€ task์™€ final pass/fail์— ์ง‘์ค‘, ์‹ค์งˆ ๊ธด workflow์—์„œ agent๊ฐ€ ์–ด๋””๊นŒ์ง€ ํ•ด๋ƒˆ๊ณ  ์–ด๋””์„œ failํ–ˆ๋Š”์ง€๋ฅผ ๊ฑฐ์˜ ๋ณด์—ฌ์ฃผ์ง€ ๋ชปํ•จ
  • ์ œ์•ˆ: 46๊ฐœ containerized long-horizon task + semantically meaningful subtask๋ณ„ deterministic grader๋ฅผ ๊ฒฐํ•ฉํ•œ ๋ฒค์น˜๋งˆํฌ ์ œ์•ˆ
  • findings: 17๊ฐœ frontier ๋ชจ๋ธ์—์„œ 1๊ฐœ์˜ containerized task์—์„œ ํ‰๊ท  239๊ฐœ ์—ํ”ผ์†Œ๋“œ, ์•ฝ 9.8M ํ† ํฐ ์‚ฌ์šฉํ•˜์—ฌ 88.9๋ถ„ ์†Œ์š”. $R\ge0.95$ ๊ธฐ์ค€ ํ‰๊ท  pass rate๋Š” 6.4%๋กœ ๋งค์šฐ ๋‚ฎ์€ ์ˆ˜์ค€, unsolved run์˜ 79%๊ฐ€ time out.
    • step 1๊ฐœ ๋งž์ถ”๋Š” ๊ฒƒ๋ณด๋‹ค long ์‹คํ–‰์„ ๋๊นŒ์ง€ ์ž˜ ๊ด€๋ฆฌํ•˜๋Š”๊ฐ€์˜ ๋ฌธ์ œ์— ๊ฐ€๊น๋‹ค.

LHTB figure 1 LHTB figure 2 LHTB figure 3 LHTB figure 4 LHTB figure 5 LHTB figure 6

Background

  • long-horizon workflow: ์ˆ˜๋ฐฑ step, ์ˆ˜์‹ญ ๋ถ„์—์„œ ์ˆ˜ ์‹œ๊ฐ„, ๊ณ„์† ๋ฐ”๋€Œ๋Š” long-context state ๊ด€๋ฆฌ ํ•„์š” (Wang et al., 2026)
    • ํ•œ ๋ฒˆ์˜ action์ด ์•„๋‹ˆ๋ผ ๊ธด ๊ฒฐ์ • sequence์— ๊ฑธ์นœ ์ง€์†์  ์ง„์ „์ด ๊ฒฐ๊ณผ๋ฅผ ๊ฒฐ์ • (Liu et al., 2026, KLong)
    • e.g. ๋…ผ๋ฌธ ๊ฒฐ๊ณผ ์žฌํ˜„, GitHub repo ํ™˜๊ฒฝ ์„ค์น˜, multimodal dataset audit, compiler toolchain ๋””๋ฒ„๊น…, ML training pipeline
  • agent ๋ฒค์น˜๋งˆํฌ ํ˜„ํ™ฉ
  • METR ๊ณ„์—ด์˜ time horizon ์—ฐ๊ตฌ๋„ agent๊ฐ€ ์–ด๋А ์ •๋„ ๊ธธ์ด๊นŒ์ง€์˜ human task๋ฅผ ์•ˆ์ •์ ์œผ๋กœ ์™„๋ฃŒํ•˜๋Š”๊ฐ€ capability variable๋กœ ํ™•์ธ

Problem States

  • ๊ธฐ์กด terminal ๋ฒค์น˜๋งˆํฌ์˜ ๋‘ ๊ณต๋ฐฑ
    • horizon ๋ถ€์กฑ: ์งง์€ task๋Š” long-horizon ํƒ์ƒ‰, ์˜ค๋ฅ˜ step ์ˆ˜์ •, ๋‹ค๋‹จ๊ณ„ ๋””๋ฒ„๊น…์˜ ๋‚œ๋„๋ฅผ ๊ณผ์†Œํ‰๊ฐ€
      • 9ํ• ๊นŒ์ง€ ์™”๋Š”๋ฐ ๋ชปํ‘ผ๊ฑด์ง€, ์•„์˜ˆ ์‹œ๋„๋ถ€ํ„ฐ ํ‹€๋ ธ๋Š”์ง€ ๊ตฌ๋ถ„ํ•˜์ง€ ์•Š์Œ โ†’ ์‹ค์ œ ๊ฐœ์„ ์œผ๋กœ ์ด์–ด์ง€๊ธฐ ์–ด๋ ค์›€
    • outcome-only sparse grading: ๊ฑฐ์˜ ๋‹ค ํ•ด๋‚ธ agent์™€ ์ฒ˜์Œ๋ถ€ํ„ฐ ์‹คํŒจํ•œ agent๊ฐ€ ๊ฐ™์€ 0์ 
      • final test ๋‹จ์ผ๋กœ ์„ฑ๊ณต/์‹คํŒจ๋ฅผ ํŒ์ •ํ•˜๋ฉด, ๊ฐ–์€ ์›์ธ์ด ๋ญ‰๊ฐœ์ง
        • partial progress
        • near miss
        • timeout
        • premature stopping
        • weak self-verification
  • ํ•„์š” ์กฐ๊ฑด
    • ์ˆ˜๋ฐฑ episode, ์ˆ˜์‹ญ ๋ถ„ ์ด์ƒ์ด ํ•„์š”ํ•œ task โ†’ Task Formulation
    • ๋๊นŒ์ง€ ์™„์ˆ˜ํ•˜์ง€ ๋ชปํ•˜๋”๋ผ๋„ ์–ด๋””๊นŒ์ง€ ํ•ด๋ƒˆ๋Š”์ง€ ๋“œ๋Ÿฌ๋‚ด๋Š” scoring์ด๋˜ LAAJ ์—†์ด deterministic โ†’ Subtask-based Grading
    • public test๋งŒ patchํ•˜๊ฑฐ๋‚˜ ์ถœ๋ ฅ์„ hard-codingํ•ด์„œ ์ ์ˆ˜๋ฅผ ์–ป์ง€ ๋ชปํ•˜๊ฒŒ ํ•˜๋Š” ๊ตฌ์„ฑ โ†’ Dataset Construction

Suggestions

definition

  • task ํ•˜๋‚˜ = subtask ์ง‘ํ•ฉ $\lbrace s_1, \dots, s_K \rbrace$, rollout ์ข…๋ฃŒ ์‹œ container ์•ˆ์˜ deterministic grader๊ฐ€ ๊ฐ $r_k \in [0, 1]$ ๊ณ„์‚ฐ
  • task reward๋Š” subtask ์ ์ˆ˜์˜ ๊ฐ€์ค‘ ํ‰๊ท 
\[R = \frac{\sum_{k=1}^{K} w_k r_k}{\sum_{k=1}^{K} w_k}\]
  • $w_k$: non-negative weight, ๊ธฐ๋ณธ์€ ๋™์ผํ•˜๊ณ  ํ•„์š”ํ•˜๋ฉด final goal์— ๊ฐ€์ค‘
  • $r_k$: final container state์˜ ๊ฐ๊ด€์  ์ฆ๊ฑฐ(ํŒŒ์ผ, ์ถœ๋ ฅ, test ๊ฒฐ๊ณผ, simulator ์‘๋‹ต)๋กœ๋งŒ ์ฑ„์ 
  • $R \ge \tau$์ด๋ฉด resolved; pass@1์€ ์ „์ฒด task ์ค‘ threshold๋ฅผ ๋„˜์€ ๋น„์œจ
\[\text{pass@1}(\tau) = \frac{1}{\lvert \mathcal{T} \rvert} \sum_{t \in \mathcal{T}} \mathbb{1}\left[ R_t \ge \tau \right]\]
  • ์ฃผ ์ง€ํ‘œ $\tau = 0.95$ (relaxed), ๋ณด์กฐ๋กœ $\tau = 0.9$, $\tau = 1.0$
  • ๋‹ค ๋ชป ํ‘ผ task์˜ ์ง„์ „์€ mean normalized reward (task ํ‰๊ท  R)๋กœ ๋”ฐ๋กœ ๋ณด๊ณ 

task formulation

  • Terminal-Bench ํ˜•์‹ ๊ทธ๋Œ€๋กœ์˜ Harbor task (Harbor Framework Team, 2026)
    • instruction + Docker image + task configuration + oracle implementation ๋˜๋Š” simulator
      • asset, code, data, tool, helper script๊ฐ€ ๋ชจ๋‘ image ์•ˆ์— ์žˆ์–ด terminal๋งŒ์œผ๋กœ ์™„๊ฒฐ
    • agentโ€™s input: ์ „์ฒด long-horizon ๋ชฉํ‘œ๋ฅผ ์ ์€ instruction ํ•˜๋‚˜
  • interactive ์ง„ํ–‰: ์ˆ˜๋ฐฑ step ๋™์•ˆ command ์‹คํ–‰, ํŒŒ์ผ ์ˆ˜์ •, ์ค‘๊ฐ„ ์ถœ๋ ฅ ํ™•์ธ ๋ฐ˜๋ณต, ์„ฑ๊ณต ๋˜๋Š” timeout๊นŒ์ง€
  • TB2์™€์˜ ์ฐจ์ด: ํ˜•์‹์€ ๊ฐ™๊ณ , subtask ํ•˜๋‚˜๊ฐ€ ์ด๋ฏธ ์ˆ˜ ๋ถ„์—์„œ ์ˆ˜ ์‹œ๊ฐ„, ์ˆ˜์‹ญ์—์„œ ์ˆ˜๋ฐฑ operation์„ ์š”๊ตฌํ•˜๋„๋ก ์„ค๊ณ„
    • long-horizon์˜ ์ถœ์ฒ˜: ๋„๋ฉ”์ธ ์ž์ฒด(ML pipeline, campaignํ˜• ๊ฒŒ์ž„, ๊ณผํ•™ audit) + ๋ชฉํ‘œ๋ฅผ ์‹œ๊ฐ„์— ๊ฑธ์ณ ๋ฐœ๊ฒฌํ•ด์•ผ ํ•˜๋Š” ์ค‘๊ฐ„ target์œผ๋กœ ๋ถ„ํ•ดํ•˜๋Š” ๋ฐฉ์‹

subtask-based grading

  • binary pass/fail ๋Œ€์‹  subtask completion rate๋กœ partial credit
  • subtask ์œ ํ˜• 3๊ฐ€์ง€
    • Binary: ํ™˜๊ฒฝ state์— ๋Œ€ํ•œ Boolean ์กฐ๊ฑด (unit test ์ „๋ถ€ ํ†ต๊ณผ, ์ง€์ • port ์‘๋‹ต, script ๋ฌด์˜ค๋ฅ˜ ์‹คํ–‰)
    • Continuous / thresholded: ์žฌํ˜„ metric์ด tolerance ์•ˆ์ด๋ฉด 1.0, ์˜ค์ฐจ๊ฐ€ ์ปค์งˆ์ˆ˜๋ก 0๊นŒ์ง€ ์„ ํ˜• ๊ฐ์†Œ; held-out ์˜ˆ์‹œ ์ค‘ oracle ์ผ์น˜ ๋น„์œจ
    • Episode-aggregating: ๊ฒŒ์ž„, ๋ฐ˜๋ณต audit์—์„œ ์—ฌ๋Ÿฌ episode์˜ success flag ๋น„์œจ์ด๋‚˜ ํ‰๊ท  normalized reward
      • ํ•œ ๋ฒˆ ์šด ์ข‹๊ฒŒ ์„ฑ๊ณต์ด ์•„๋‹ˆ๋ผ ์—ฌ๋Ÿฌ episode์— ๊ฑธ์นœ ์•ˆ์ •์„ฑ ์ธก์ •
  • e.g. Fig 1 final artifact๊ฐ€ ์ผ๋ถ€ hidden verification stage๋งŒ ํ†ต๊ณผํ•˜๋ฉด 0.80์˜ partial reward๋ฅผ ๋ฐ›๊ณ , ๋ชจ๋“  stage๋ฅผ ํ†ต๊ณผํ•ด์•ผ 1.00์— ๋„๋‹ฌ
    • limate-netcdf-extreme-event-audit
      • ์ „์ฒด ๋ชฉํ‘œ: ๋ง๊ฐ€์ง„ climate audit pipeline์„ fix
      • grader: ์ตœ์ข… container state์—์„œ ์—ฌ๋Ÿฌ requirement๋ฅผ ๋”ฐ๋กœ ๊ฒ€์‚ฌ

dataset construction Fig 2

  1. ์‹ค์ œ ์ „๋ฌธ workflow์— ๊ณตํ†ต recipe ์ ์šฉ (Vidgen et al., 2026, APEX-Agents; Wu et al., 2026)
    • seed
      • phase-diagram audit
      • SLAM benchmark ์ˆ˜๋ฆฌ
      • climate NetCDF ๊ทนํ•œ ์‚ฌ๊ฑด ํƒ์ง€
      • audio-visual alignment
      • figure data ๋ณต์›
      • ์œ„์„ฑ ํ™์ˆ˜ ํƒ์ง€
      • ์„ธํฌ ๊ณ„์ˆ˜ QC
      • ์Šค์บ” ๋ฌธ์„œ table ๋ณต์›
    • ์ผ๋ถ€๋Š” APEX-Agents ๋“ฑ์—์„œ ๋ณ€ํ˜•, ๋‚˜๋จธ์ง€๋Š” ์‹ ๊ทœ
  2. ๊ฐ ๋ฌธ์ œ๋งˆ๋‹ค ์™„๊ฒฐ๋˜์–ด ์žˆ์ง€๋งŒ ์ผ๋ถ€๋Ÿฌ ํ›ผ์†๋œ terminal-only project ๊ตฌ์ถ•
    • ์ •์ƒ์ ์œผ๋กœ ์ž‘๋™ํ•˜๋Š” ์™„๊ฒฐ๋œ project์™€ ์ •๋‹ต solution์„ ์•Œ๊ณ  ์žˆ๋Š” ์ƒํƒœ๋ฅผ ๊ตฌ์ถ•ํ•˜๊ณ , ์ผ๋ถ€๋ฅผ ํ›ผ์†ํ•˜์—ฌ agent์—๊ฒŒ ์ฃผ๋Š” ํ˜•ํƒœ
    • ํŒจํ‚ค์ง€: public asset ์ƒ์„ฑ script, weak baseline, official gold solution, multi-step solve.sh, hidden verifier
  3. public check vs hidden stress suite ๊ฐ€์ค‘์น˜ ๋ถ„๋ฆฌ
    • public: CLI ๋™์ž‘, ํŒŒ์ผ ํ˜•์‹, ๋‹จ์ˆœ ์˜ˆ์‹œ ๋ช‡ ๊ฐœ๋งŒ, ๋‚ฎ์€ ๊ฐ€์ค‘์น˜
    • hidden: ๋” ์–ด๋ ค์šด ์ž…๋ ฅ๊ณผ schema ๋ณ€ํ˜•์„ ๋™์  ์ƒ์„ฑ, reward ๋Œ€๋ถ€๋ถ„ ์ฐจ์ง€
      • nested manifest
      • gzip+base64 wrapper
      • ์ด๋ฆ„ ๋ฐ”๋€ field
      • ๊ฒฐ์ธก๊ฐ’, noise, ํšŒ์ „/crop ์ด๋ฏธ์ง€, ์ด์ƒ frame, ๋‹ค๋ฅธ ์ขŒํ‘œ๊ณ„๋‚˜ time-dimension ๊ทœ์•ฝ
    • hard-coding์ด๋‚˜ public patch๋กœ๋Š” ๊ณ ๋“์  ๋ถˆ๊ฐ€ (gold solution์€ hidden suite ์ „์ฒด์—์„œ 1.0 ํ•„์ˆ˜)
  4. DeepSeek-V4-Pro๋ฅผ 1.5์‹œ๊ฐ„ budget์œผ๋กœ ๋ฐ˜๋ณต ์‹คํ–‰ํ•˜๋ฉฐ ์ดˆ๊ธฐ 120๊ฐœ task์— ๋Œ€ํ•ด difficulty calibration์„ ๊ฑฐ์ณ ์ตœ์ข… 46๊ฐœ๋กœ ์„ ๋ณ„

Effects

  • Experimental setup
    • environment: LHTB 46 task, 90๋ถ„ timeout
    • agent: Harbor + Terminus-2 harness, ๋‹จ์ผ terminal session
      • ์˜ˆ์™ธ: GPT-5.3 Codex๋งŒ Codex harness
      • ๋ชจ๋ธ 17์ข…: GPT-5.6-sol, GPT-5.5, GPT-5.4, GPT-5.3 Codex, DeepSeek V4 Pro, Gemini 3.1 Pro, GLM 5.1, GLM 5.2, Kimi K2.6, Kimi K2.7 Code, MiniMax M3, Qwen3.7 Max, Qwen3.6 Plus, Doubao Seed 2.1 Pro, Hy3, Grok 4.20, Grok 4.5
    • evaluation: pass@1 (ฯ„ = 0.9 / 0.95 / 1.0), mean R, episode ์ˆ˜, ์‹œ๊ฐ„, ๋น„์šฉ, token
      • ๋น„์šฉ์€ 2026๋…„ 6์›” list price, prompt cache ํ• ์ธ ๋ฏธ๋ฐ˜์˜
      • ๋ชจ๋ธ-task๋‹น ๋‹จ์ผ run (17 ร— 46 = 782 run)
  • Results
    • Fig 3 Main: frontier ๋ชจ๋ธ๋„ ํฌ๊ฒŒ ๊ณ ์ „
      • Grok 4.5 ์ตœ๊ณ : 28.3% (13/46) @ Rโ‰ฅ0.95
      • GPT-5.6-sol, GPT-5.5๊ฐ€ 15.2% (7/46)
      • ์ „์ฒด ํ‰๊ท  pass@1์€ Rโ‰ฅ0.95์—์„œ 6.4%, Rโ‰ฅ1.0์—์„œ 3.2%
    • Finding 1 Fig 3 Fig 4: dense reward๊ฐ€ ์žˆ์–ด์•ผ ์ˆœ์œ„๊ฐ€ ๋“œ๋Ÿฌ๋‚จ (์„ธ๋ฐ€ํ•˜๊ฒŒ ์ฑ„์ ํ•˜์ž)
      • Rโ‰ฅ1.0 ๊ธฐ์ค€์œผ๋กœ๋Š” 17๊ฐœ ์ค‘ 10๊ฐœ ๋ชจ๋ธ์ด 0๊ฐœ โ†’ binary๋ฉด ํฐ ๋™์  ๊ทธ๋ฃน!!
      • 782 run ์ค‘ pass 50 (6.4%), ์ง„์ „ ์—†์Œ(R < 0.05) 241 (30.8%), ๋ถ€๋ถ„ ์ง„์ „ 491 (62.8%)
      • pass rate์™€ mean R์€ Spearman ฯ = 0.74๋กœ ์ค‘๊ฐ„ ์ˆ˜์ค€ ์ƒ๊ด€ โ†’ ์™„์ „ ํ•ด๊ฒฐ๊ณผ ๋ถ€๋ถ„ ์ง„์ „์€ ๋‹ค๋ฅธ ๋Šฅ๋ ฅ
        • 1๊ฐœ ํ•ด๊ฒฐ๋กœ ๋™์ ์ธ ๋ชจ๋ธ ์‚ฌ์ด์—์„œ๋„ mean R์€ GPT-5.4 0.27๋ถ€ํ„ฐ GLM 5.2 0.32๊นŒ์ง€
      • near-miss (0.75 โ‰ค R < 0.95)๊ฐ€ pass์˜ ๊ฑฐ์˜ ๋‘ ๋ฐฐ (90 vs 50)
        • e.g. Kimi K2.6์€ ํ•ด๊ฒฐ 0๊ฐœ์ง€๋งŒ near-miss 5๊ฐœ, grammar-fuzz-coverage-hunt์—์„œ R = 0.94
    • Finding 2 Tab 1 Fig 5: ๋น„์šฉ์ด ๊ณง ์„ฑ๋Šฅ์€ ์•„๋‹ˆ๋”๋ผ
      • ํ‰๊ท  239 episode, 9.8M token, 88.9๋ถ„, ์•ฝ $10.8 per task
        • ๋ชจ๋ธ๋ณ„ ์•ฝ $3.6์—์„œ $26
      • Grok 4.5๋Š” ์•ฝ $11๋กœ Pareto frontier ์ƒ๋‹จ; GPT-5.6-sol, GPT-5.5๋Š” ์•ฝ $21
      • GPT-5.4๋Š” ์•ฝ $26๋กœ ์ตœ๊ณ ๊ฐ€์ง€๋งŒ pass rate ๋‚ฎ์Œ (episode 302 vs GPT-5.5 208)
      • ์ €๋น„์šฉ frontier: Hy3 ($3.6), Doubao Seed 2.1 Pro (์•ฝ $5), MiniMax M3 (์•ฝ $6)
    • Finding 3 Fig 6: ๋ณ‘๋ชฉ์€ local ์‹คํ–‰ ์ •ํ™•๋„๊ฐ€ ์•„๋‹ˆ๋ผ long-horizon ์™„์ˆ˜
      • ๋ฏธํ•ด๊ฒฐ run์˜ ์ฃผ ์›์ธ์€ budget ์†Œ์ง„ ์ค‘์ธ timeout (๋ณธ๋ฌธ ๊ธฐ์ค€ 79%, 518/660)
        • timeout run์˜ mean R์€ ๋ชจ๋ธ๋ณ„ 0.10์—์„œ 0.35 โ†’ ์™„์ˆ˜ ์ง์ „์ด ์•„๋‹ˆ๋ผ ์ง„ํ–‰ ๋„์ค‘
      • ์Šค์Šค๋กœ ์ข…๋ฃŒํ•œ early exit ์•ฝ 19%, harness error ์•ฝ 3%
      • TB2(๋Œ€๋ถ€๋ถ„ 20๋ถ„ ์ด๋‚ด)์—์„œ๋Š” ๋ช…์„ธ ๋ถˆ์ดํ–‰, step ๋ฐ˜๋ณต, ์ข…๋ฃŒ ์กฐ๊ฑด ๋ˆ„๋ฝ ๊ฐ™์€ ์‹คํ–‰ ์˜ค๋ฅ˜๊ฐ€ ์ฃผ์˜€๋˜ ๊ฒƒ๊ณผ ๋Œ€๋น„
      • ์ €์ž ํ•ด์„: ์ˆœ์œ„๊ฐ€ task ํ•ด๊ฒฐ ๋Šฅ๋ ฅ๋ฟ ์•„๋‹ˆ๋ผ ๊ณ ์ • budget ์•ˆ์— reward๋ฅผ ์Œ“๋Š” time efficiency๋ฅผ ๋ฐ˜์˜
        • ์ค‘๋ณต ํƒ์ƒ‰ ๊ฐ์†Œ, state ๋ณด์กด, ๋ฐ˜๋ณต ๊ฒ€์ฆ loop ํšŒํ”ผ๊ฐ€ single-step reasoning ๊ฐœ์„ ๋ณด๋‹ค ์ด๋“์ด ํด ์ˆ˜ ์žˆ์Œ
    • Finding 4 Fig 6: false finish, ๊ฑฐ์˜ ๋‹ค ํ•ด๋†“๊ณ  ๋๋‚ฌ๋‹ค๊ณ  ํŒ๋‹จํ•˜๋”๋ผ
      • false finish: ๋†’์€ reward์—์„œ early exitํ–ˆ์ง€๋งŒ hidden verifier ํ†ต๊ณผ ์‹คํŒจ
        • Kimi K2.7 Code๊ฐ€ duckdb-optimizer-closure์—์„œ R = 0.92๋กœ ์ข…๋ฃŒ
        • GLM 5.2๊ฐ€ apex-ib244-matter์—์„œ R = 0.90๋กœ ์ข…๋ฃŒ
        • apex-law433-matter์—์„œ๋Š” ์„œ๋กœ ๋‹ค๋ฅธ 7๊ฐœ ๋ชจ๋ธ์ด R 0.80์—์„œ 0.87 ์‚ฌ์ด(์•ฝ 20๋ถ„ ๋‚จ๊ธฐ๊ณ  ์ข…๋ฃŒํ•˜๋”๋ผ)
      • early exit ์‹œ์  ํ‰๊ท  R๋กœ stopping judgment ์ฐจ์ด๊ฐ€ ๋“œ๋Ÿฌ๋‚จ
        • Kimi K2.7 Code 0.51, MiniMax M3 0.42๋กœ ๋Šฆ๊ฒŒ ๋ฉˆ์ถค vs ๋‹ค๋ฅธ ๋ชจ๋ธ 0.22์—์„œ 0.39; Kimi K2.6์€ 0.11์—์„œ ํฌ๊ธฐ
    • ์—ฐ๊ตฌ ๊ฒฐ๋ก ) ๋ณดํ†ต ์™„๋ฃŒ ์ •๋„๋ฅผ ์ฒด๊ณ„์ ์œผ๋กœ ๊ณผ๋Œ€ํ‰๊ฐ€ํ•˜๊ณ  final verification์— ํˆฌ์ž๋ฅผ ๋œ ํ•จ
      • TB2 taxonomy์˜ premature termination, weak verification์˜ long-horizon ๋ฒ„์ „
      • ํ•ด๊ฒฐ ๋ฐฉํ–ฅ์œผ๋กœ planning, memory์™€ progress tracking, calibration๋œ stopping decision ์ œ์‹œ

Personal note. ์ง€๋‚œ์ฃผ terminal-bench ์†Œ๊ฐœ๋“œ๋ฆฌ๋ฉด์„œ ์ค‘๊ฐ„์— ๋ฌด์—‡์„ ๊ธฐ๋กํ•˜๋“  action-level์€ scoring์— ๋ฐ˜์˜๋˜์ง€ ์•Š๋Š” ํ‰๊ฐ€๋ฐฉ์‹์„ ์ทจํ•œ๋‹ค๊ณ  ์ •๋ฆฌํ–ˆ์—ˆ๋Š”๋ฐ, ์ด ์—ฐ๊ตฌ๋Š” ๋งˆ์ฐฌ๊ฐ€์ง€๋กœ action-level์€ ์•ˆ๋ณด์ง€๋งŒ, ๊ธธ์ด๊ฐ€ ๋งค์šฐ ๊ธธ์–ด์„œ (์ •ํ™•ํžˆ tb2์˜ task ์—ฌ๋Ÿฌ๊ฐœ๋ฅผ ์ด์–ด ๋ถ™์ธ ๊ฑด ์•„๋‹์ง€๋ผ๋„) (sub) task-level์˜ scoring์„ ํ•˜๊ฒ ๋‹ค๋Š” ์ ์—์„œ process๋ฅผ ๋ณธ๋‹ค๊ณ  ์ฃผ์žฅํ•œ ๊ฒƒ ๊ฐ™์Šต๋‹ˆ๋‹ค.

๊ทธ๋ž˜์„œ ์ฃผ์žฅํ•˜๊ณ  ์žˆ๋Š” dense reward๋„ RL์—์„œ step๋งˆ๋‹ค ๋ถ™๋Š”๋‹ค๋Š” ๋А๋‚Œ์œผ๋กœ ์ฒ˜์Œ์— ์ดํ•ดํ–ˆ๋Š”๋ฐ, Fig 1์˜ โ€œprocess rewardโ€œ๋ผ๋Š” ํ‘œํ˜„์€ ์ข€ ๊ณผํ•˜๊ณ  (๊ทธ๋ ‡๊ฒŒ ๋ณด๊ธด ์–ด๋ ต๊ณ ), ์ •ํ™•ํžˆ๋Š” trajectory-level process supervision๋ณด๋‹ค subgoal-decomposed outcome evaluation์— ๊ฐ€๊น๋‹ค๊ณ  ๋ณด์ž…๋‹ˆ๋‹ค.

๊ฐ™์€ harbor ํ˜•์‹์— terminus-2 ๊ทธ๋Œ€๋กœ ์“ฐ๊ณ  task๋‹น ๊ฑฐ์˜ 10M token์“ด๋‹ค๋Š”๋ฐ ์ตœ์†Œ 1ํšŒ run ์•ˆ์—์„œ hand off ์š”์•ฝ์ด ์ˆ˜์ฐจ๋ก€๋Š” ๋ฐœ์ƒํ• ํ…Œ๋‹ˆ ์•”๋ฌต์ ์ธ ์„ธ์…˜์Šค๋Ÿฌ์šด(?) ๊ฒฝ๊ณ„๊ฐ€ terminal-bench๋ณด๋‹ค ํ›จ์”ฌ ์ž์ฃผ ์ƒ๊ธด๋‹ค๊ณ  ๊ฐ„์ฃผํ•  ์ˆ˜ ์žˆ๊ฒ ์Šต๋‹ˆ๋‹ค. ์—ฐ๊ตฌ ๊ฒฐ๋ก ์—์„œ memory์™€ progress tracking์„ ํ•ด๋ฒ•์œผ๋กœ ๊ผฝ์œผ๋ฉด์„œ๋„ ๋‹น์—ฐํ•œ๊ฑด์ง€ ํ˜„์ƒ ๋ณด๊ณ ์— ๊ทธ์นœ ์ .. ์•ž์„  ์•ฝ๊ฐ„ ํ”„๋ ˆ์ด๋ฐ์ด ๊ณผํ–ˆ๋˜ ๊ฒƒ ํฌํ•จ ์—ฌ๋Ÿฌ๋ชจ๋กœ ์กฐ๊ธˆ ์•„์‰ฌ์šด ๋ถ€๋ถ„์ด ์žˆ์Šต๋‹ˆ๋‹ค.