6 minute read

Meta info.

TL; DR

in-car assistant ๋„๋ฉ”์ธ์— 58๊ฐœ tool๊ณผ 19๊ฐœ domain policy๋ฅผ ๊ฐ–์ถ˜ ์‹œ๋ฎฌ๋ ˆ์ด์…˜ ํ™˜๊ฒฝ์˜ ์ˆ˜ํ–‰ ๋ถˆ๊ฐ€ํ•œ ์š”์ฒญ(Hallucination)๊ณผ ๋ชจํ˜ธํ•œ ์š”์ฒญ(Disambiguation)์ด๋ผ๋Š” ๋‘ task type๊ณผ ์ผ๊ด€์„ฑ ์ง€ํ‘œ Pass^3 ๋„์ž…. frontier LLM๋„ user request ์™„์ˆ˜๋ฅผ ์œ„ํ•ด policy๋ฅผ ์–ด๊ธฐ๊ฑฐ๋‚˜ ์ •๋ณด๋ฅผ ์ง€์–ด๋ƒ„.

Review Video

CAR-bench figure 0 CAR-bench figure 1 CAR-bench figure 2 CAR-bench figure 3 CAR-bench figure 4 CAR-bench figure 5 CAR-bench figure 6 CAR-bench figure 7

Background

  • LLM agent ๋ฒค์น˜๋งˆํฌ๋Š” idealized setting์—์„œ์˜ task completion์„ ์ธก์ •ํ•จ
    • tool-use ๋ฒค์น˜๋งˆํฌ(MetaTool, StableToolBench)๋Š” ๋Œ€ํ™” ์—†์ด API-calling ๋Šฅ๋ ฅ๋งŒ ๋ถ„๋ฆฌ ํ‰๊ฐ€
    • TravelPlanner, ToolLLM์€ ์™„์ „ํ•œ task ์ •๋ณด๊ฐ€ ์„ ํ–‰ ์ œ๊ณต๋˜๋Š” single-turn ํ‰๊ฐ€
    • BFCLv3, ToolTalk์€ pre-collected off-policy trajectory โ†’ ๋ชจ๋ธ์ด ์ด์ƒ์ ์ธ history ์œ„์—์„œ๋งŒ ํ‰๊ฐ€
  • ฯ„-bench๊ฐ€ simulated user + API tool + policy ์ œ์•ฝ์„ ๊ฒฐํ•ฉํ•ด ์ฒซ dynamic policy-guided ๋ฒค์น˜๋งˆํฌ๋ฅผ ์ œ์‹œ
    • (1) ์ธ๊ฐ„โ†”API์™€์˜ ๋™์  ์ƒํ˜ธ์ž‘์šฉ (2) domain policy ์ค€์ˆ˜ (3) ๋ฐ˜๋ณต ์‹œํ–‰ ๊ฐ„ ์ผ๊ด€์„ฑ(Pass^k)์ด๋ผ๋Š” ์„ธ ์š”๊ตฌ์กฐ๊ฑด ์ •๋ฆฝ
    • ToolSandbox๋Š” ์ด๋ฅผ state-dependent tool interaction์œผ๋กœ ํ™•์žฅ
    • tau^2-bench๋Š” retail/airline/telecom ๋„๋ฉ”์ธ์˜ dual-control ํ™˜๊ฒฝ์œผ๋กœ ํ™•์žฅ
  • hallucination ์—ฐ๊ตฌ๋Š” LLM์ด ๋ถˆํ™•์‹ค์„ฑ์„ ์ธ์ •ํ•˜๊ธฐ๋ณด๋‹ค ๊ทธ๋Ÿด๋“ฏํ•œ ์™„์„ฑ์„ ์ƒ์„ฑํ•˜๋„๋ก ๋ณด์ƒ๋ฐ›๋Š” ๊ตฌ์กฐ์  ์›์ธ์„ ์ง€์  (Kalai et al., 2025)
    • ToolSandbox์™€ BFCLv3๊ฐ€ missing function ์‹œ๋‚˜๋ฆฌ์˜ค๋ฅผ ์ผ๋ถ€ ๋‹ค๋ฃจ์ง€๋งŒ, missing parameter๋‚˜ ๋ถˆ์™„์ „ํ•œ tool result ๊ฐ™์€ ๋” ๋„“์€ ์‹คํŒจ ๋ชจ๋“œ๋Š” ๋ณด์ง€ ์•Š์•˜์Œ.
  • ๋ชจํ˜ธํ•œ ์ง€์‹œ์˜ ํ•ด์†Œ๋Š” ์–ด๋–ค ํ–‰๋™/์งˆ๋ฌธ์ด information gain์„ ์ตœ๋Œ€ํ™”ํ•˜๋Š”์ง€ ํŒ๋‹จํ•˜๋Š” meta-cognitive reasoning์„ ์š”๊ตฌ (Kobalczyk et al., ICLR 2025)
  • car domain์€ policy ์ค€์ˆ˜์™€ hallucination ํšŒํ”ผ๊ฐ€ safety-criticalํ•œ ํ™˜๊ฒฝ: ์šด์ „์ž ์ฃผ์˜๋ถ„์‚ฐ ์ œ์•ฝ(Strayer et al., 2016) ํ•˜์—์„œ ๋น„์ „๋ฌธ๊ฐ€์ธ user์˜ ์Œ์„ฑ ์š”์ฒญ ๋ชจํ˜ธ์„ฑ๊ณผ heterogenous ์ฐจ๋Ÿ‰ API๋ฅผ ๋‹ค๋ค„์•ผ ํ•จ

Problem States

๊ธฐ์กด ๋ฒค์น˜๋งˆํฌ๋Š” ์š”์ฒญ์ด ํ•ญ์ƒ ์ˆ˜ํ–‰ ๊ฐ€๋Šฅํ•˜๊ณ  ์ถฉ๋ถ„ํžˆ ๋ช…์„ธ๋˜์–ด ์žˆ์œผ๋ฉฐ ํ•œ ๋ฒˆ์˜ ์„ฑ๊ณต์ด ๋Šฅ๋ ฅ์„ ์ž…์ฆํ•œ๋‹ค๊ณ  ๊ฐ€์ •; ์‹ค์ œ ๋ฐฐํฌ ์กฐ๊ฑด์„ ๋ฐ˜์˜ํ•˜๋ ค๋ฉด ์„ธ ์กฐ๊ฑด์ด ์ถ”๊ฐ€๋กœ ์ถฉ์กฑ๋ผ์•ผ ํ•จ

  • ์กฐ๊ฑด 1 ) ์ˆ˜ํ–‰ ๋ถˆ๊ฐ€๋Šฅํ•œ ์š”์ฒญ์—์„œ์˜ limit-awareness ํ‰๊ฐ€: ํ•„์š”ํ•œ tool์ด ์—†๊ฑฐ๋‚˜, parameter granularity๊ฐ€ ๋ถ€์กฑํ•˜๊ฑฐ๋‚˜, ํ™˜๊ฒฝ query๊ฐ€ ๋ถˆ์™„์ „ํ•œ ๋ฐ์ดํ„ฐ๋ฅผ ๋ฐ˜ํ™˜ํ•˜๋Š” ๊ฒฝ์šฐ๊ฐ€ ์‹ค์ œ๋กœ ๋นˆ๋ฒˆํ•จ
    • agent๊ฐ€ โ€œํ•  ์ˆ˜ ์—†๋‹คโ€๋ฅผ ์ธ์ •ํ•˜๋Š”์ง€, ์•„๋‹ˆ๋ฉด ์ง€์–ด๋‚ด๋Š”์ง€๋ฅผ ์ง์ ‘ ์ธก์ •ํ•ด์•ผ ํ•จ โ†’ Hallucination task
  • ์กฐ๊ฑด 2 ) ๋ชจํ˜ธํ•œ ์š”์ฒญ์—์„œ์˜ uncertainty resolution ํ‰๊ฐ€: underspecified ์š”์ฒญ๊ณผ ๋ถˆ์™„์ „ํ•œ ๊ด€์ธก์—์„œ (1) ๋ชจํ˜ธ์„ฑ์˜ ์กด์žฌ๋ฅผ ๊ฐ์ง€ํ•˜๊ณ  (2) ์ด๋ฅผ ํ•ด์†Œํ•  ๊ฐ€์žฅ ์ •๋ณด๋Ÿ‰ ๋†’์€ ํ–‰๋™์„ ์„ ํƒํ•˜๋Š” 2๋‹จ๊ณ„ meta-reasoning์ด ํ•„์š”ํ•จ
    • ์„ฑ๊ธ‰ํ•œ ์‹คํ–‰๊ณผ ๋ถˆํ•„์š”ํ•œ ์‚ฌ์šฉ์ž ์งˆ๋ฌธ ๋ชจ๋‘ ์‹คํŒจ๋กœ ์ •์˜๋ผ์•ผ ํ•จ โ†’ Disambiguation task
  • ์กฐ๊ฑด 3 ) ์ผํšŒ์„ฑ ์„ฑ๊ณต์ด ์•„๋‹Œ ์ผ๊ด€๋œ ์žฌํ˜„์˜ ํ‰๊ฐ€: safety-critical ๋„๋ฉ”์ธ์—์„œ๋Š” ์ž ์žฌ ๋Šฅ๋ ฅ(ํ•œ ๋ฒˆ์ด๋ผ๋„ ์„ฑ๊ณต)๊ณผ ์‹ ๋ขฐ ๊ฐ€๋Šฅํ•œ ๋ฐฐํฌ ์„ฑ๋Šฅ(๋งค๋ฒˆ ์„ฑ๊ณต)์„ ๊ตฌ๋ถ„ํ•ด์•ผ ํ•จ โ†’ Pass^k / Pass@k ๋™์‹œ ๋ณด๊ณ 

Suggestions

Benchmark Components Fig 1

  • user์™€ agent๋Š” ํ…์ŠคํŠธ ๋ฉ”์‹œ์ง€๋กœ๋งŒ ์ƒํ˜ธ์ž‘์šฉ
    • user๋Š” tool call๊ณผ ํ™˜๊ฒฝ ๋ฐ์ดํ„ฐ๋ฅผ ๋ณผ ์ˆ˜ ์—†๊ณ  agent๋Š” control word*๋ฅผ ๋ณผ ์ˆ˜ ์—†์Œ
    • control word*๊ฐ€ ๊ฐ€๋ณ€ ๊ธธ์ด ์ƒํ˜ธ์ž‘์šฉ์˜ ๋™์  ์ข…๋ฃŒ์™€ ์ž๋™ ์ •๋‹ต ํŒ์ •์„ ๋™์‹œ์— ๋‹ด๋‹น
      • control world: โ€˜continueโ€™, โ€˜stopโ€™, โ€˜out of scopeโ€™(tau-bench์—์„œ ๊ธฐ์ธ) + โ€˜llm acknowledges limitationโ€™, โ€˜hallucination errorโ€™, โ€˜disambiguation errorโ€™
  • LLM-simulated user
    • persona:
      • ์—ฐ๋ น: 18-65
      • ๋Œ€ํ™” ์Šคํƒ€์ผ: commanding/conversational/questioning
      • ๊ธฐ์ˆ  ์ˆ™๋ จ๋„
    • task instruction: ๋ชฉํ‘œ, ์ •๋ณด ๊ณต๊ฐœ ์ˆœ์„œ, ๋ฐ˜์‘ ๊ทœ์น™, ์™„๋ฃŒ ๊ธฐ์ค€
    • ๋งค ํ„ด ํ…์ŠคํŠธ ๋ฉ”์‹œ์ง€์™€ ํ•จ๊ป˜ control word*๋ฅผ ์ถœ๋ ฅ
  • LLM agent: native tool-calling ๊ธฐ๋ฐ˜
    • domain policy ์ค€์ˆ˜ํ•ด์•ผ ํ•˜๋ฉฐ(๊ธˆ์ง€ ์ƒํƒœ, ํ•„์ˆ˜ ์•ˆ์ „ ํ™•์ธ ๋“ฑ ์ผ์ข…์˜ ์ฐจ๋Ÿ‰ manual)
    • policy ์ค€์ˆ˜ ์—ฌ๋ถ€์— ๋Œ€ํ•œ ๊ฒ€์ฆ: code-based(12์ข…) ํ˜น์€ LAAJ(7์ข…)
  • tool schema Tab 2
    • ์ฃผ์ œ๋ณ„ 6๊ฐœ ๋„๋ฉ”์ธ(vehicle function, navigation, charging, productivity, weather, cross-domain)์— ๋Œ€ํ•ด
      • ์กฐํšŒ์šฉ get function 29๊ฐœ
      • ๋ณ€๊ฒฝ์šฉ set 27๊ฐœ
      • no-op planning tool 2๊ฐœ
  • state variables: set tool๋กœ ๋ณ€๊ฒฝ๊ฐ€๋Šฅํ•œ 31๊ฐœ ๋™์  ์ƒํƒœ(๊ณต์กฐ, ์ฐฝ๋ฌธ, ์กฐ๋ช…, navigation ๋“ฑ) ์ •์˜
  • context variables: 12๊ฐœ fixed ์„ค์ •(์‹œ๊ฐ, ์œ„์น˜, ์ฐจ๋Ÿ‰ ์ŠคํŽ™, user preference), task ๋‚ด ๋ถˆ๋ณ€์ด๊ณ  task ๊ฐ„ ์ƒ์ดํ•จ.
  • DB: ์œ ๋Ÿฝ 48๊ฐœ ๋„์‹œ, 130K POI, 1.7M route, 100 contact, 100 calendar ๋“ฑ cross-linked ID๋กœ ์ฐธ์กฐ ๋ฌด๊ฒฐ์„ฑ ์œ ์ง€

3 Task Types

  • Base (100): persona, instruction, ์ดˆ๊ธฐ state/context, ground-truth action sequence ์ •์˜
    • agent๊ฐ€ ์œ ์ผํ•œ end-state์— ๋„๋‹ฌํ•˜๋ฉด ์„ฑ๊ณต Fig 2
  • Hallucination (90): Base์—์„œ ํ•„์ˆ˜ ๊ตฌ์„ฑ์š”์†Œ๋ฅผ ์ œ๊ฑฐํ•ด ์š”์ฒญ์„ ์ˆ˜ํ–‰ ๋ถˆ๊ฐ€๋Šฅํ•˜๊ฒŒ ๋งŒ๋“ฆ
    • ์ œ๊ฑฐ ๋Œ€์ƒ: tool ์ž์ฒด / tool parameter / tool result
    • ์„ฑ๊ณต ์กฐ๊ฑด: missing capability/information์˜ ๋ช…์‹œ์  ์ธ์ • (์ง€์–ด๋‚ด๊ฑฐ๋‚˜ ๋Œ€์ถฉ ์“ฑ ๋„˜์–ด๊ฐ€๋ฉด ์‹คํŒจ)
  • Disambiguation (50): Base์— ๋ชจํ˜ธ์„ฑ ์ฃผ์ž…
    • ์ฃผ์ž… ๋ฐฉ์‹: ์‚ฌ์šฉ์ž clarification ์ด ํ•„์š”ํ•œ ๊ฒฝ์šฐ / ๋‚ด๋ถ€ ์ •๋ณด ์ˆ˜์ง‘์œผ๋กœ ํ•ด์†Œ ๊ฐ€๋Šฅํ•œ ๊ฒฝ์šฐ
    • system prompt๊ฐ€ ๋‚ด๋ถ€ ํ•ด์†Œ ์šฐ์„ ํ•˜๋„๋ก ์ž‘์„ฑ
    • ์‹คํŒจ: ์ž˜๋ชป๋œ end-state๋กœ ์ด์–ด์ง€๋Š” premature action๊ณผ ํ™˜๊ฒฝ์— ํ•ด์†Œ ๊ทผ๊ฑฐ๊ฐ€ ์žˆ๋Š”๋ฐ๋„ ์‚ฌ์šฉ์ž์—๊ฒŒ ๋ฌป๋Š” unnecessary clarification ๋ชจ๋‘ ์‹คํŒจ๋กœ ๊ฐ„์ฃผ
  • ์˜์˜: ground-truth action์œผ๋กœ ์„ฑ๊ณต์„ ์ •์˜ํ•  ์ˆ˜ ์—†๋Š” ํ–‰๋™์„ LLM-as-a-Judge๋กœ ํ‰๊ฐ€
    • Hallucination๊ณผ ๋‚ด๋ถ€ Disambiguation์—์„œ๋Š” user simulator์—๊ฒŒ ์ œ๊ฑฐ๋œ ์š”์†Œ/ํ•ด์†Œ ๋Œ€์ƒ์„ ์•Œ๋ ค์ฃผ๊ณ 
    • ํ™•์žฅ control word(โ€˜llm acknowledges limitationโ€™, โ€˜hallucination errorโ€™, โ€˜disambiguation errorโ€™)๋กœ ํŒ์ •

Task-level and Aggregated Metrics

  • task๋ณ„ binary reward $r \in \lbrace 0, 1 \rbrace$ ์ง‘ํ•ฉ์œผ๋กœ ํ‰๊ฐ€, ๋ชจ๋“  ํ•ด๋‹น ์ง€ํ‘œ๊ฐ€ 1์ผ ๋•Œ๋งŒ ํ•ด๊ฒฐ๋กœ ๊ฐ„์ฃผ
    • Base ์ง€ํ‘œ: actions final(์ตœ์ข… ์ƒํƒœ ์ผ์น˜), actions intermediate(๋งค ํ„ด ์ค‘๊ฐ„ ์ƒํƒœ๊ฐ€ ground-truth ์ง‘ํ•ฉ์— ํฌํ•จ, ์ž˜๋ชป๋œ set์€ ์ดํ›„ ์ •์ •ํ•ด๋„ ๊ฐ์ ), tool subset(ํ•„์ˆ˜ get tool ํ˜ธ์ถœ), tool execution errors, policy errors, user end conversation
    • Hallucination: tool execution / policy / user end conversation๋งŒ ์‚ฌ์šฉ
      • user end conversation์ด limitation ์ธ์ • ์—ฌ๋ถ€๋ฅผ ์ธก์ •
    • Disambiguation: Base ์ „์ฒด ์ง€ํ‘œ + โ€˜disambiguation errorโ€™ ์‹œ ์‹คํŒจ
  • task $t$๋ฅผ $k$ํšŒ ๋ฐ˜๋ณตํ•ด ์ผ๊ด€์„ฑ(^k)๊ณผ ์ž ์žฌ๋ ฅ(@k) ๋ถ„๋ฆฌ ์ธก์ •
\[\mathrm{Pass}^k_t = \mathbb{1}\left[ \sum_{i=1}^{k} r_t^{(i)} = k \right], \qquad \mathrm{Pass@}k_t = \mathbb{1}\left[ \sum_{i=1}^{k} r_t^{(i)} \geq 1 \right]\]
  • ๋‘ metric ๊ฐ„๊ทน์ด ์ž‘์„์ˆ˜๋ก ์ž ์žฌ๋ ฅ๊ณผ ์ผ๊ด€์„ฑ์ด ์ž˜ ์ •๋ ฌ๋œ ๊ฒƒ
  • ๊ฐ„๊ทน์ด ํฌ๋ฉด parallel inference๋‚˜ fine-tuning์œผ๋กœ ๋Œ์–ด๋‚ผ ์ˆ˜ ์žˆ๋Š” latent competence๊ฐ€ ์กด์žฌํ•จ์„ ์˜๋ฏธ
  • $\text{Pass}^k$: $k$ํšŒ ์ „๋ถ€ ์„ฑ๊ณต(consistency), $\text{Pass}@k$: 1ํšŒ ์ด์ƒ ์„ฑ๊ณต(potential)

Environment and Dataset Construction

  • ํ™˜๊ฒฝ: ๋ชจ๋“  tool/state/context๋ฅผ ์‹ค์ œ ์ฐจ๋Ÿ‰ ์‹œ์Šคํ…œ ์œ ์‚ฌ๋ฌผ๋กœ๋ถ€ํ„ฐ ์ˆ˜์ž‘์—… ์„ค๊ณ„
    • DB: ๊ตฌ์กฐ์  ์ผ๊ด€์„ฑ์„ ์œ„ํ•ด code-generated, ์ด๋ฆ„, ๋„๋ฉ”์ธ๋งŒ LLM ์ƒ์„ฑ. (tau-bench ๊ธฐ๋ฐ˜)
  • task ์ƒ์„ฑ: tool์˜ parameter, ์ ‘๊ทผ state, state ๋ณ€๊ฒฝ์„ ์—ฐ๊ฒฐํ•œ API graph ์ •์˜
    • parameter chaining๊ณผ policy trigger ์ƒํ˜ธ์˜์กด์„ฑ์„ ๋ฐ˜์˜ํ•ด multi-step trajectory ์ƒ˜ํ”Œ๋ง
    • LLM agent๊ฐ€ trajectory๋กœ ์ด์–ด์ง€๋Š” ์ž์—ฐ์Šค๋Ÿฌ์šด user instruction์„ ์ƒ์„ฑํ•˜๊ณ  ํ™˜๊ฒฝ๊ณผ ์ƒํ˜ธ์ž‘์šฉํ•˜๋ฉฐ ์‹คํ–‰ ๊ฐ€๋Šฅ์„ฑ์„ ์กฐ์ •
  • ๊ฒ€์ฆ: ์ „ task๋ฅผ ์‚ฌ๋žŒ์ด ๊ฒ€ํ† 
    • ๋ฌธ๊ตฌ ๋ช…ํ™•์„ฑ, instruction ์™„์ „์„ฑ, action ์ •ํ™•์„ฑ, ์‹คํ–‰ ๊ฐ€๋Šฅ์„ฑ, ์œ ์ผ end-state๋ฅผ ํ™•์ธํ•˜๊ณ  LLM agent๋กœ ๋ฐ˜๋ณต ํ…Œ์ŠคํŠธํ•˜๋ฉฐ task instruction ์˜ค๋ฅ˜ ์ˆ˜์ •

Effects

  • Experimental setup
    • agent: proprietary 3๊ณ„์—ด; non-thinking(GPT-4.1, Gemini-2.5-Flash), thinking (2048 token)(GPT-5/5.2, Claude-Opus-4.5/4.6, Claude-Sonnet-4, Gemini-2.5-Flash), auto-thinking(Gemini-2.5-Pro); open์€ GPT-OSS-120B, Qwen3-32B(thinking), ฯ„-bench trace๋กœ SFT xLAM-2-32B-fc-r
    • setup details
      • ๊ฐ€๋Šฅํ•œํ•œ temperature 0 ๊ณ ์ •(Claude/GPT-5 thinking์€ provider ๊ฐ•์ œ 1.0)
      • CoT ๋“ฑ ํ”„๋กฌํ”„ํŒ… ๊ธฐ๋ฒ• ์—†์ด baseline ์„ฑ๋Šฅ ๋ถ„๋ฆฌ
      • k=3 (์ ์ˆ˜ ํฌํ™” ์—†์ด ์‹ ๋ขฐ๋„ ํŒ๋ณ„ํ•˜๋Š” ์ˆ˜์ค€)
    • user simulator: Gemini-2.5-Flash (thinking)
    • Base 100 task 1ํšŒ ์ „์ฒด ์‹คํ–‰ ๋น„์šฉ์€ simulator $0.08 + GPT-5 agent $11
    • evaluation: task type๋ณ„ $\text{Pass}^3$ ํ‰๊ท 
  • Results
    • Tab 4 F1: consistency gap; ๋ชจ๋“  ๋ชจ๋ธ์—์„œ $\text{Pass}@k$(์ž ์žฌ๋ ฅ)์™€ $\text{Pass}^k$(์žฌํ˜„์„ฑ) ๊ฐ„ ํฐ ๊ฐ„๊ทน
      • ์ตœ๊ณ ์„ฑ๋Šฅ์˜ ๋ชจ๋ธ๋„ ํ‰๊ท  ^3 54-58% ์ˆ˜์ค€
      • Disambiguation์—์„œ GPT-5๊ฐ€ @3 โ†’ ^3 ์ ˆ๋ฐ˜์ˆ˜์ค€ ๊ธ‰๋ฝ
    • Fig 3 Fig 4 F2: model capabilities; thinking ๋ชจ๋ธ์ด ์ „ task type์—์„œ ์šฐ์œ„, task ๋ณต์žก๋„๊ฐ€ ์˜ค๋ฅผ์ˆ˜๋ก ๊ฒฉ์ฐจ ํ™•๋Œ€
      • Claude-Opus-4.5๊ฐ€ Base์™€ Disambiguation, GPT-5/5.2๊ฐ€ Hallucination ์ตœ๊ณ  ์„ฑ๋Šฅ ํ™•์ธ
      • ground-truth action ์ˆ˜๊ฐ€ ๋Š˜์ˆ˜๋ก non-thinking ๋ชจ๋ธ์˜ Pass^1์ด ๊ธ‰๋ฝ Fig 3
      • GPT-4.1์€ GPT-5 ๋Œ€๋น„ policy ์œ„๋ฐ˜, tool ์‹คํ–‰ ์˜ค๋ฅ˜, ํ•„์ˆ˜ get ์ƒ๋žต ๋“ฑ Fig 4
    • F3: task type difficulty; Base > Hallucination > Disambiguation ์ˆœ์œผ๋กœ ์ฒด๊ณ„์  ์„ฑ๋Šฅ ์ €ํ•˜
    • user persona / simulation ๋ถ„์„: persona(๋‚˜์ด/์Šคํƒ€์ผ/์ˆ™๋ จ๋„)๋ณ„ ์œ ์˜๋ฏธํ•œ ์„ฑ๋Šฅ ์ฐจ์ด ์—†์Œ
      • GPT-5 k=5 ์ „์ฒด ์‹คํŒจ๋ฅผ human ๊ฒ€์‚ฌ, user simulator๊ฐ€ ์œ ์ผํ•œ ์˜ค๋ฅ˜ ์›์ธ์ธ sole-source error ์ •๋Ÿ‰ํ™”
        • Base 2.4% ์˜ค๋ฅ˜์— Pass^5 -6%, Hallucination 6.1%์— -9%, Disambiguation 2.8%์— -8% ์˜ํ–ฅ
    • error taxonomy์™€ completion-compliance tension; ๋น„์ผ๊ด€ task(5ํšŒ ์ค‘ 0ยท1ยท4ํšŒ ์„ฑ๊ณต)์˜ ์‹คํŒจ๋ฅผ 5๋ฒ”์ฃผ๋กœ ๋ถ„๋ฅ˜
      • (E1) premature action, (E2) policy violation, (E3) logical error, (E4) execution error, (E5) fabrication(E5a ์•”๋ฌต์  ์€ํ / E5b ๋Šฅ๋™์  ๋‚ ์กฐ)
      • ๋ชจ๋ธ์€ policy ์ค€์ˆ˜๋ณด๋‹ค ์š”์ฒญ ์™„์ˆ˜๋ฅผ ์ผ๊ด€๋˜๊ฒŒ ์šฐ์„ ํ•จ
        • GPT-5 ์ง€์†๋œ ์‹คํŒจ์˜ 8ํ• ์ด E1, Hallucination์—์„œ GPT-4.1์€ E5b ~40%, GPT-5๋Š” E5a ~70% ์ˆ˜์ค€
      • ๊ฐ™์€ ๋ชจ๋ธ์ด ์‹œํ–‰์— ๋”ฐ๋ผ policy๋ฅผ ์ง€ํ‚ค๊ธฐ๋„/์–ด๊ธฐ๊ธฐ๋„ ํ•˜๋Š” stochastic adherence==๋Šฅ๋ ฅ์€ ์žˆ์œผ๋‚˜ ์ œ์•ฝ์˜ ์•ˆ์ •์  ํ™œ์„ฑํ™” ๊ธฐ์ œ๊ฐ€ ์—†์Œ์„ ์ฃผ์žฅ
        • plausible completion์„ ๋ณด์ƒํ•˜๋Š” ํ•™์Šต ์ฒด๊ณ„์˜ ์‚ฐ๋ฌผ๋กœ ํ•ด์„ (Kalai et al., 2025, RLHF ๊ฐ•ํ™”)
    • reasoning as partial mitigation; ๋ช…์‹œ์  ์ถ”๋ก ์€ ์ธก์ • ๊ฐ€๋Šฅํ•˜๋‚˜ ์ œํ•œ์ ์ธ ๊ฐœ์„ 
      • Base์—์„œ E2-E4 ๊ฐ์†Œ, Hallucination์—์„œ E5b ๊ฐ์†Œํ•˜๋‚˜, Disambiguation ์‹คํŒจ์˜ 9ํ• ์„ ์ฐจ์ง€ํ•˜๋Š” E1์€ ์™„ํ™” ์‹คํŒจ
      • GPT-5๋Š” ๋‚ด๋ถ€ ํ•ด์†Œ policy์—๋„ ๋ถˆ๊ตฌํ•˜๊ณ  ํ™˜๊ฒฝ ์ •๋ณด ์ˆ˜์ง‘ ์ „์— ์งˆ๋ฌธํ•˜๊ฑฐ๋‚˜ best-guess๋กœ ์‹คํ–‰
    • Tab 5 practical implications ์„ฑ๋Šฅโ†”์ง€์—ฐโ†”๋น„์šฉ trade-off

Personal note. Pass^k๋ผ๋Š” metric๊ณผ ์ฝ”๋“œ๋ฒ ์ด์Šค ๋ชจ๋‘ ์„ ํ–‰์—ฐ๊ตฌ(tau-bench) ๊ฒƒ์ด๊ณ  ์ƒˆ๋กœ์šด ๋ชจ๋ธ์ด๋‚˜ ํ•™์Šต๋ฒ• ์—†์ด โ€œtask completion์ด ์•„๋‹ˆ๋ผ agent์˜ ์ž๊ธฐ ํ•œ๊ณ„ ์ธ์‹์„ ์žฌ์•ผ ํ•œ๋‹คโ€๋Š” ์ฃผ์žฅ์„ ๊ฒ€์ฆ ๊ฐ€๋Šฅํ•œ task ์„ค๊ณ„(๊ตฌ์„ฑ์š”์†Œ ์ œ๊ฑฐ + control word ํŒ์ •)๋กœ ํ™˜์›ํ•œ ๊ฒŒ ์‚ฌ์‹ค ์—ฐ๊ตฌ์˜ ์ „๋ถ€์ธ๋ฐ ๊ทธ๊ฒŒ ํƒ„ํƒ„ํ•˜๊ฒŒ ์Œ“์—ฌ์ง„ ๊ฒŒ ์ˆ˜์ƒ์˜ ์ด์œ ๊ฐ€ ๋œ ๊ฒƒ ๊ฐ™์•„์š”. ๊ฐœ์ธ์ ์œผ๋กœ๋Š” ๋ณธ์›์ ์ธ ํ•œ๊ณ„(user simulator ์˜ค๋ฅ˜)๋ฅผ ์ „์ˆ˜ ๊ฒ€์‚ฌํ•ด ์ž๊ธฐ ๋ฒค์น˜๋งˆํฌ์˜ ๋…ธ์ด์ฆˆ ํ•˜ํ•œ์„ ์ฃผ๋Š” ๋””ํ…Œ์ผ์ด ์ธ์ƒ๊นŠ์—ˆ์Šต๋‹ˆ๋‹ค. ๋‹ค๋งŒ instruction-following ๋Šฅ๋ ฅ์„ ์žฌ๋Š” ๊ฒƒ๊ณผ ๋ญ๊ฐ€ ๋‹ค๋ฅด๋‹ค๊ณ  ๋ณผ ์ˆ˜ ์žˆ๋Š”์ง€ ์ž์ฒด๋Š” ๋‹ค์†Œ ์‚๋”ฑํ•˜๊ฒŒ ๋ฐ”๋ผ๋ณด๊ฒŒ ๋˜๊ธด ํ•˜๋Š”๋ฐ, ์ง€๋‚œ ๋ฒˆ์— ์†Œ๊ฐœํ•œ ImplicitMemBench๋„ ACL2026์—์„œ ์ˆ˜์ƒํ–ˆ๋‹ค๊ณ  ํ•ด์„œ ๋น„๊ตํ•ด๋ณด๊ณ  ์‹ถ์–ด Seminar ์ค€๋น„ํ•ด๋ณด์•˜์Šต๋‹ˆ๋‹ค.