10 minute read

Meta info.
Slide 1 Slide 2
Slide 3 Slide 4

Slide 5

TL; DR

์˜ˆ์ธก tool์˜ ์ •ํ™•๋„๋ฅผ 40~80%๋กœ ์ง์ ‘ ์ฃผ์ž… ํ†ต์ œํ•˜๋ฉด์„œ, LLM ์˜์‚ฌ๊ฒฐ์ •์ž์™€ ์‚ฌ๋žŒ์ด ๋Œ€ํ™” ์ „ํ›„๋กœ ๊ฒฐ์ •์„ ์–ด๋–ป๊ฒŒ ๋ฐ”๊พธ๋Š”์ง€ ํ‰๊ฐ€ํ•˜๋Š” PredActBench ์ œ์•ˆ. 13๊ฐœ ๋ชจ๋ธ ์ค‘ 10๊ฐœ๋Š” ๋Œ€ํ™”๋ฅผ ํ• ์ˆ˜๋ก F1์ด ๋–จ์–ด์กŒ๊ณ , ์‚ฌ๋žŒ๋งŒ calibrated ์˜์—ญ์— ์œ„์น˜

Review Video

PredAct-Bench figure 0 PredAct-Bench figure 1 PredAct-Bench figure 2 PredAct-Bench figure 3

Background

  • LLM task-oriented dialogue system: multi-step decision์„ ๋•๋Š” ์šฉ๋„๋กœ education, healthcare, finance ๋“ฑ ๊ฒฐ์ • ๋Œ€๊ฐ€๊ฐ€ ํฐ ๋„๋ฉ”์ธ์— ๋ฐฐ์น˜
    • ๋ฐฐ์น˜ ํ™˜๊ฒฝ์˜ tool์—๋Š” ๋‘ ์ข…๋ฅ˜๊ฐ€ ์„ž์—ฌ ์žˆ์Œ
      • ์กฐํšŒํ˜• tool: DB์— ์ด๋ฏธ ๊ธฐ๋ก๋œ ๊ฐ’์„ ๊บผ๋‚ด์˜ค๋ฏ€๋กœ ํ‹€๋ฆด ์—ฌ์ง€๊ฐ€ ์—†์Œ
      • ์˜ˆ์ธกํ˜• tool: ์•„์ง ์ผ์–ด๋‚˜์ง€ ์•Š์€ ๊ฒฐ๊ณผ๋ฅผ ๊ณผ๊ฑฐ ๊ธฐ๋ก์œผ๋กœ ์ถ”์ธกํ•˜๋Š” ๋ชจ๋ธ์ด๋ผ ์›๋ฆฌ์ ์œผ๋กœ ํ‹€๋ฆด ์ˆ˜ ์žˆ๊ณ , ๊ทธ ์˜ค๋‹ต์ด ์ •์ƒ ์‘๋‹ต ์•ˆ์— ๋‹ด๊ฒจ ๋‚˜์˜ค๋ฏ€๋กœ ์‘๋‹ต๋งŒ ๋ด์„œ๋Š” ์•Œ ์ˆ˜ ์—†์Œ
    • e.g. ์˜ˆ์ธก ๋„๊ตฌ์˜ ์œ„ํ—˜ ์ ์ˆ˜๋ฅผ ๋ณด๊ณ  ์น˜๋ฃŒ๋ฅผ ์ •ํ•˜๋Š” ์ž„์ƒ์˜, ์˜ˆ์ธก ๋ชจ๋ธ์ด ๋ฝ‘์€ ์œ„ํ—˜๊ตฐ ๋ช…๋‹จ์„ ๋ณด๊ณ  ๊ฐœ์ž…์„ ์ •ํ•˜๋Š” ์ง€๋„๊ต์ˆ˜: ๋„๊ตฌ๋Š” ์กฐ์–ธํ•˜๊ณ  ๊ฒฐ์ •์€ ์‚ฌ๋žŒ์ด ํ•จ
  • 4๊ฐ€์ง€ ์„ ํ–‰ ์—ฐ๊ตฌ ๊ณ„์—ด
    • task-oriented dialogue: belief state tracking๊ณผ response generation์„ ํ‘œ์ค€ํ™”, ๋‹จ predefined schema์™€ static goal๊ณผ fixed ontology๋ฅผ ๊ฐ€์ •
    • tool-use / agent benchmark: API ์„ ํƒ, argument ๊ตฌ์„ฑ, compositional planning, multi-turn function calling์˜ ์ •ํ™•์„ฑ์„ ํ‰๊ฐ€
    • robustness under noise: API ๋ช…์„ธ ๋ณต์žก๋„, ์‹คํ–‰ ์‹คํŒจ, ๋ถˆ์™„์ „ ์‘๋‹ต, ์˜ค๋ฅ˜ ์ถœ๋ ฅ, ์˜ค๋„ ์‹ ํ˜ธ์— agent๋ฅผ ๋…ธ์ถœ
    • temporal reasoning: ์‹œ๊ฐ„์„ ๊ฐ€๋กœ์ง€๋ฅด๋Š” ํ†ตํ•ฉ์ด ์—ฌ์ „ํžˆ ์•ฝํ•˜๋‹ค๋Š” ์ง„๋‹จ, chronological confusion๊ณผ recency bias๊ฐ€ ๋ฐ˜๋ณต ๋ณด๊ณ ๋จ
  • 2๊ฐ€์ง€ ํ‰๊ฐ€ ์ง€ํ‘œ ๊ณ„์—ด
    • calibration: Brier score (Brier, 1950), ECE (Guo et al., 2017)
    • appropriate reliance: ์˜ณ์€ AI ์กฐ์–ธ์€ ๋”ฐ๋ฅด๊ณ  ํ‹€๋ฆฐ ์กฐ์–ธ์€ ๊ฑฐ๋ถ€ํ•˜๋Š”์ง€๋ฅผ Appropriateness of Reliance(AoR)๋ผ๋Š” 2์ฐจ์› ๊ฐœ๋…์œผ๋กœ ์ •์˜, ๊ทธ ๋‘ ์ถ•์ด RAIR/RSR (Schemmer et al., 2023)
      • ๋‹จ, ์กฐ์–ธ์„ ํ•œ ๋ฒˆ ๋ฐ›๊ณ  ํ•œ ๋ฒˆ ๊ฒฐ์ •ํ•˜๋Š” ์ƒํ™ฉ์„ ์ „์ œํ•˜๋ฏ€๋กœ ์ค‘๊ฐ„์— ๋Œ€ํ™”๊ฐ€ ๋ผ๋Š” ์„ค์ •์—๋Š” ๊ทธ๋Œ€๋กœ ๋ชป ์”€
  • Tab 1: tool calls / multi-turn / interactive conversation / noise injection / longitudinal reasoning / human-in-the-loop ์—ฌ์„ฏ ์ถ• ๋น„๊ต
    • PredActBench๋งŒ ์ „๋ถ€ ์ฒดํฌ, ฯ„ยฒ-bench์™€ AgentNoiseBench๋Š” longitudinal๊ณผ human-in-the-loop์ด ์—†๊ณ  TIMER-Bench๋Š” longitudinal๋งŒ ์žˆ๊ณ  tool call๊ณผ ๋Œ€ํ™”๊ฐ€ ์—†์Œ

Problem States

๋ถ€๋ถ„ ๊ด€์ธก๋œ longitudinal evidence ์ถ”๋ก , multi-turn ์ƒํƒœ ์œ ์ง€, ๋ถˆํ™•์‹คํ•œ tool ์ถœ๋ ฅ ์œ„์—์„œ์˜ ๊ฒฐ์ •. ๋ฐฐ์น˜ ํ˜„์žฅ์—์„œ๋Š” ์ด ์…‹์ด ํ•œ๊บผ๋ฒˆ์— ์ผ์–ด๋‚˜๋Š”๋ฐ ์ง€๊ธˆ๊นŒ์ง€๋Š” ์„œ๋กœ ๋‹ค๋ฅธ ๋ฒค์น˜๋งˆํฌ๋กœ ์ชผ๊ฐœ์ ธ ๋‹ค๋ค„์ง

  • noise๋ฅผ ์—‰๋šฑํ•œ ๊ณณ์— ๋„ฃ์–ด์˜ด: ๊ธฐ์กด ๋ฒค์น˜๋งˆํฌ์˜ noise๋Š” ์ „๋ถ€ toolchain ๋ฐ”๊นฅ์— ์žˆ์Œ
    • ฯ„-bench: tool์ด ๋ฒค์น˜๋งˆํฌ๊ฐ€ ๋งŒ๋“  ์ •๋‹ต ํ…Œ์ด๋ธ”์„ ์กฐํšŒํ•ด ๋ฐ˜ํ™˜ํ•˜๋ฏ€๋กœ ๊ตฌ์„ฑ์ƒ ํ‹€๋ฆด ์—ฌ์ง€๊ฐ€ ์—†์Œ (oracle tool)
    • AgentNoiseBench: user query๋งŒ ํ๋ฆฌ๊ณ  tool์€ oracle๋กœ ์œ ์ง€
    • robustness ๊ณ„์—ด ์ „๋ฐ˜: ์ฃผ์ž…ํ•œ noise๊ฐ€ timeout, ๋นˆ ์‘๋‹ต, ์‹คํ–‰ ์—๋Ÿฌ์ฒ˜๋Ÿผ ๊ณ ์žฅ์ด ๊ฒ‰์œผ๋กœ ๋“œ๋Ÿฌ๋‚˜๋Š” ์ข…๋ฅ˜๋ผ agent๊ฐ€ ์žฌ์‹œ๋„๋‚˜ ์šฐํšŒ๋กœ ๋Œ€์‘ ๊ฐ€๋Šฅ
    • ์ •์ž‘ ์‹ค์ œ ๋ฐฐ์น˜์—์„œ ๋ถˆํ™•์‹คํ•œ ๊ฑด ์˜ˆ์ธกํ˜• tool์ด ๋‚ด๋†“๋Š” ๊ฐ’์ธ๋ฐ, ๊ทธ ์ •ํ™•๋„๋ฅผ ํ†ต์ œํ•œ ๋ฒค์น˜๋งˆํฌ๋Š” ์—†์—ˆ์Œ
  • oracle ํ‰๊ฐ€๊ฐ€ ์ž˜๋ชป๋œ ํ–‰๋™์„ ๋ณด์ƒํ•จ: ๋ชจ๋“  tool ๋ฐ˜ํ™˜๊ฐ’์ด ์ •๋‹ต์ด๋ฉด ๊ฒ€์ฆ ์—†์ด ๊ทธ๋Œ€๋กœ ๋”ฐ๋ฅด๋Š” ๊ฒƒ(wholesale acceptance)์ด ์ตœ์  ์ „๋žต
    • ๊ฒ€์ฆ์šฉ ์ถ”๊ฐ€ tool call์€ ์ˆœ์ˆ˜ ๋‚ญ๋น„๊ฐ€ ๋˜๊ณ  tool ์ถœ๋ ฅ์„ ๋’ค์ง‘๋Š” ๊ฒƒ์€ ๋ฌด์กฐ๊ฑด ์†ํ•ด์ด๋ฏ€๋กœ, ์ˆœ์‘์ด ๊ณง ๊ณ ๋“์ 
    • ์ด ์ „๋žต์€ ์˜ˆ์ธกํ˜• tool์ด ์„ž์—ฌ ๋“ค์–ด์˜ค๋Š” ์ˆœ๊ฐ„ ๋ฌด๋„ˆ์ง€๋ฏ€๋กœ, oracle ๋ฒค์น˜๋งˆํฌ์˜ ๊ณ ๋“์ ์ด ๋ฐฐ์น˜ ํ™˜๊ฒฝ์—์„œ๋„ ์œ ์ง€๋œ๋‹ค๋Š” ๋ณด์žฅ์ด ์—†์Œ
    • controlled tool noise๋Š” ํ‰๊ฐ€์— ๋ง๋ถ™์ด๋Š” stress test๊ฐ€ ์•„๋‹ˆ๋ผ, ์žฌ๋ ค๋Š” ๋Šฅ๋ ฅ์„ ์ธก์ •ํ•˜๊ธฐ ์œ„ํ•œ ์ „์ œ ์กฐ๊ฑด
  • F1์œผ๋กœ๋Š” ๊ตฌ๋ถ„ ๋ถˆ๊ฐ€: ์„ ๋ณ„์  ๊ฒ€์ฆ์œผ๋กœ ์ ์ˆ˜๋ฅผ ๋ฒˆ agent์™€ ๊ทธ๋ƒฅ ์ˆœ์‘ํ•œ agent๊ฐ€ ๊ฐ™์€ F1์„ ๋ฐ›์Œ
    • ์˜ณ์€ tool์„ ๋ถ€๋ฅด๋Š”๊ฐ€, tool ์ถœ๋ ฅ์„ ์ถฉ์‹คํžˆ ์ถ”์ ํ•˜๋Š”๊ฐ€, ๋ถˆํ™•์‹คํ•œ ์˜ˆ์ธก์„ ๊ณผ์‹ ํ•˜๋Š”๊ฐ€, ์‚ฌ๋žŒ์˜ ์ตœ์ข… ๊ฒฐ์ •์„ ์‹ค์ œ๋กœ ๊ฐœ์„ ํ•˜๋Š”๊ฐ€๊ฐ€ ์ „๋ถ€ ํ•œ ์ˆซ์ž์— ๋ญ‰๊ฐœ์ง
  • โ†’ ๋”ฐ๋ผ์„œ ํ•„์š”ํ•œ ์กฐ๊ฑด
    • [ํ™˜๊ฒฝ] tool ์ •ํ™•๋„๋ฅผ ์ฃผ์–ด์ง„ ๊ฐ’์œผ๋กœ ๋‘์ง€ ๋ง๊ณ  ์‹คํ—˜์ž๊ฐ€ ์ง์ ‘ ์ง€์ •ํ•˜๋Š” ํŒŒ๋ผ๋ฏธํ„ฐ๋กœ ๋‘˜ ๊ฒƒ
    • [์ธก์ •] ๋Œ€ํ™” ์ „ ๊ฒฐ์ •๊ณผ ๋Œ€ํ™” ํ›„ ๊ฒฐ์ •์„ ๋ถ„๋ฆฌํ•ด ๊ธฐ๋ก, ๊ทธ ์ฐจ์ด๋กœ ๋Œ€ํ™”์˜ ์ˆœํšจ๊ณผ๋ฅผ ์ •์˜
    • [์ง€ํ‘œ] ์˜ณ์€ ์กฐ์–ธ์„ ๋ฐ›์•„๋“ค์ด๋Š” ๋Šฅ๋ ฅ๊ณผ ํ‹€๋ฆฐ ์กฐ์–ธ์„ ๋ฒ„ํ‹ฐ๋Š” ๋Šฅ๋ ฅ์„ ์„œ๋กœ ๋‹ค๋ฅธ ์ถ•์œผ๋กœ ๋ถ„๋ฆฌ, ํ•œ ๋ฒˆ์˜ ๊ฒฐ์ •์ด ์•„๋‹ˆ๋ผ episode ๋‹จ์œ„๋กœ ์ธก์ •
    • [๊ธฐ์ค€์ ] human baseline์„ ๋„˜์–ด์•ผ ํ•  ๋ชฉํ‘œ์น˜๊ฐ€ ์•„๋‹ˆ๋ผ ํ–‰๋™ ํŒจํ„ด์„ ๊ฒฌ์ค„ ๊ธฐ์ค€์œผ๋กœ ๋‘˜ ๊ฒƒ

Suggestions

ํ•ต์‹ฌ์€ tool ์ •ํ™•๋„๋ฅผ ์‹คํ—˜์ž๊ฐ€ ์ง€์ •ํ•˜๋Š” ๊ฒƒ ํ•˜๋‚˜์ด๊ณ , ๋‚˜๋จธ์ง€ ๊ตฌ์„ฑ์š”์†Œ๋Š” ์ „๋ถ€ ๊ทธ๊ฑธ ๊ฐ€๋Šฅํ•˜๊ฒŒ ๋งŒ๋“ค๊ธฐ ์œ„ํ•œ ์žฅ์น˜

  • ์ •ํ™•๋„๋ฅผ 40%๋กœ ๋งž์ถ”๋ ค๋ฉด ์˜ˆ์ธก์ด ๋งž์•˜๋Š”์ง€ ์„ธ์•ผ ํ•จ โ†’ ์ •๋‹ต์ด ๋‚จ์•„ ์žˆ๋Š” ๋„๋ฉ”์ธ ํ•„์š” (education, Datasets)
  • ๋’ค์ง‘์„ ์˜ˆ์ธก์ด ๋จผ์ € ์žˆ์–ด์•ผ noise ์ฃผ์ž…์ด ์„ฑ๋ฆฝ โ†’ ๊ฒฐ์ •์ ์ด๊ณ  ์žฌํ˜„๋˜๋Š” ์˜ˆ์ธก๊ธฐ ํ•„์š” (k-NN Predictor)
  • ์ „๋ถ€ ํ‹€๋ฆฌ๋ฉด ์˜์กด ์—ฌ๋ถ€๋ฅผ ์žด ์ˆ˜ ์—†์Œ โ†’ ์•ˆ ํ‹€๋ฆฌ๋Š” tool๊ณผ ํ‹€๋ฆฌ๋Š” tool์„ ์„ž์–ด์•ผ ํ•จ (Tool Inventory)
  • ํ†ต์ œ๋œ ์กฐ๊ฑด์—์„œ ๋ฌด์—‡์„ ์žด ๊ฒƒ์ธ๊ฐ€ โ†’ ๋Œ€ํ™” ์ „ํ›„ ๊ฒฐ์ • ๋ณ€ํ™” (Episode-level RAIR / RSR)

Task Definition

  • academic risk prediction: ๋‘ LLM ์‚ฌ์ด์˜ ๋‹ค์ค‘ ํ„ด ๋Œ€ํ™” ๊ณผ์ œ๋กœ ์žฌ์ •์˜, ๋‘˜ ๋‹ค ๋ฒค์น˜๋งˆํฌ์˜ ์ผ๋ถ€๋กœ ํ•จ๊ป˜ ๋ฐฐํฌ
    • LLM instructor: ๊ฐ•์˜ ๋‹ด๋‹น ๊ต์ˆ˜๋ฅผ ์‹œ๋ฎฌ๋ ˆ์ด์…˜ํ•˜๋Š” ์˜์‚ฌ๊ฒฐ์ •์ž, ํ•™์ƒ ๋ฐ์ดํ„ฐ๋ฅผ ์ง์ ‘ ๋ณผ ์ˆ˜ ์—†๊ณ  ์˜ค์ง assistant์—๊ฒŒ ๋ฌผ์–ด์•ผ๋งŒ ์•Œ ์ˆ˜ ์žˆ์Œ
    • LLM assistant: tool call๋กœ๋งŒ ์‘๋‹ต, ์Šค์Šค๋กœ ๊ฒฐ์ •ํ•˜์ง€ ์•Š๊ณ  instructor์˜ ์งˆ๋ฌธ์— ์ž๋ฃŒ๋ฅผ ๋Œ€์ฃผ๋Š” ์—ญํ• 
  • episode = (course, cutoff week $t$, ํ•™์ƒ $N$๋ช…)
    • ์ž…๋ ฅ: ํ•™์ƒ $i$์˜ cutoff๊นŒ์ง€์˜ ๋ถ€๋ถ„ ์„ฑ์  ๊ถค์  $x_i^{(t)}$
  • 3๋‹จ๊ณ„ ์ง„ํ–‰ (Fig 1)
    • 1๋‹จ๊ณ„: assistant๊ฐ€ ์ตœ์ข… letter grade $\hat y_i$์™€ confidence $c_i$๋ฅผ ์˜ˆ์ธกํ•ด at-risk ํ•™์ƒ์„ flag, ์งง์€ ๊ทผ๊ฑฐ์™€ ํ•จ๊ป˜ ์ œ์‹œ
    • 2๋‹จ๊ณ„: instructor๊ฐ€ ์ด ๋ฆฌํฌํŠธ๋งŒ ๋ณด๊ณ  ์ดˆ๊ธฐ ๊ฒฐ์ • $d_i^{\text{init}} \in \lbrace \text{flag}, \text{no-flag} \rbrace$ ๊ธฐ๋ก
    • 3๋‹จ๊ณ„: ์„ฑ์  ์ด๋ ฅ, ํ•™๊ธ‰ ๋น„๊ต, counterfactual, ๊ฐœ์ž…์•ˆ์„ ์บ๋ฌผ์œผ๋ฉฐ ๋Œ€ํ™”ํ•œ ๋’ค ์ตœ์ข… ๊ฒฐ์ • $d_i^{\text{final}}$ ํ™•์ •
  • Fig 1์€ ์ด ํŒŒ์ดํ”„๋ผ์ธ์„ ๋‘ ๊ฐˆ๋ž˜๋กœ ๋ณด์—ฌ์คŒ
    • ์™ผ์ชฝ system-initiated: ๋‘ agent๊ฐ€ tool ์ถœ๋ ฅ ์œ„์—์„œ ๋Œ€ํ™”ํ•˜๋ฉฐ ์ž์œจ์ ์œผ๋กœ ์„ฑ์ ์„ ๋ถ„์„ํ•˜๊ณ  ์œ„ํ—˜์„ ์˜ˆ์ธกํ•˜๊ณ  ๊ฐœ์ž…์„ ๊ณ„ํš
    • ์˜ค๋ฅธ์ชฝ user-initiated: instructor๊ฐ€ ๋ถ„์„์„ ์งˆ์˜ํ•˜๊ณ  ๊ฑธ๋Ÿฌ๋‚ด๊ณ  ๋ฐ˜๋ฐ•ํ•˜๋ฉด์„œ ์ถ”๊ฐ€ tool call์„ ์œ ๋ฐœ
    • ๋ถ‰์€ ๊ธ€์”จ๋Š” tool์ด ์‹ค์ œ๋กœ ๋งŒ๋“ค์–ด๋‚ธ ๊ฐ’์„ ํ‘œ์‹œํ•ด ์–ด๋””๊นŒ์ง€๊ฐ€ tool ์ถœ๋ ฅ์ธ์ง€ ๊ตฌ๋ถ„

Datasets

  • ์ •๋‹ต์ด ํ•„์š”ํ•ด์„œ education ๋„๋ฉ”์ธ ์„ ํƒ: ์˜ˆ๋ฅผ ๋“ค์–ด 8์ฃผ์ฐจ ์˜ˆ์ธก์ด ๋งž์•˜๋Š”์ง€๋ฅผ ํ•™๊ธฐ ๋ง ์‹ค์ œ ์„ฑ์ ์œผ๋กœ ์ฑ„์  ๊ฐ€๋Šฅ, ๊ฐœ์ž… ์—ฌ๋ถ€๋ผ๋Š” ๊ฒฐ์ • ์ง€์ ๋„ ๋ถ„๋ช…ํ–ˆ๋‹ค๊ณ 
  • OULAD (Kuzilek et al., 2017): ์˜๊ตญ Open University์˜ ์‹ค์ œ ํ‰๊ฐ€ ์ ์ˆ˜์™€ ์ตœ์ข… ๊ฒฐ๊ณผ
    • 32,593๋ช…, 7๊ฐœ module 22๊ฐœ presentation, ๊ถค์ ๊ณผ ์ตœ์ข… ์„ฑ์  ๋ชจ๋‘ ์‹ค์ œ ๋ฐ์ดํ„ฐ
    • UK ๊ด€๋ก€๋ฅผ ๋”ฐ๋ผ 40, 50, 60, 70 ์ž„๊ณ„๊ฐ’์ด F๋ถ€ํ„ฐ A๊นŒ์ง€์— ๋Œ€์‘
  • PredAct-CS: ๋Œ€ํ˜• ๊ณต๋ฆฝ ์—ฐ๊ตฌ์ค‘์‹ฌ๋Œ€ํ•™์˜ ํ•™๋ถ€/๋Œ€ํ•™์› CS 60๊ฐœ ๊ฐ•์˜
    • 53,401๋ช…, ๊ณผ์ œ๋ช…๊ณผ ๊ฐ€์ค‘์น˜์™€ ์ฃผ์ฐจ ์ผ์ •์ด ๋‹ด๊ธด ์‹ค์ œ syllabus, ํ•™์ƒ๋ณ„ ์‹ค์ œ ์ตœ์ข… letter grade
    • ์ฃผ์ฐจ๋ณ„ raw ๊ธฐ๋ก์€ ๊ณต๊ฐœ ๋ถˆ๊ฐ€์ด๋ฏ€๋กœ ๊ณผ์ œ๋ณ„ ์ ์ˆ˜๋Š” ๊ฐ ํ•™์ƒ์˜ ์‹ค์ œ ์ตœ์ข… ์„ฑ์ ์— ๋„๋‹ฌํ•˜๋„๋ก ํ•ฉ์„ฑ ์ƒ์„ฑ
  • ๊ฐ•์˜๋ณ„ 80/20 ๋ถ„ํ• , train ํŒŒํ‹ฐ์…˜์ด k-NN์˜ historical record pool ์—ญํ• 

Tool Inventory

  • ๋ฏฟ์„ tool๊ณผ ๋ชป ๋ฏฟ์„ tool์„ ์„ž๊ธฐ ์œ„ํ•œ ๊ตฌ์„ฑ: 12๊ฐœ 4๋ฒ”์ฃผ (Tab 3)
    • Lookup 6๊ฐœ (deterministic): get_student_grades ๋“ฑ ์„ฑ์ /๊ณผ์ œ/ํ•™๊ธ‰ ํ†ต๊ณ„ ์กฐํšŒ
    • Counterfactual 3๊ฐœ (deterministic): simulate_uniform_remaining ๋“ฑ โ€œ๋‚จ์€ ๊ณผ์ œ๋ฅผ ์ „๋ถ€ X์  ๋ฐ›์œผ๋ฉดโ€ ๋ฅ˜์˜ ์‹œ๋ฎฌ๋ ˆ์ด์…˜
    • Prediction 2๊ฐœ (probabilistic, k-NN): predict_final_grade_for_student, ์˜ˆ์ธก ํ•™์ ๊ณผ confidence๋ฅผ ํ•จ๊ป˜ ๋ฐ˜ํ™˜
    • Intervention 1๊ฐœ (LLM-generated): suggest_intervention_for_student
  • noise๋Š” prediction ๋ฒ”์ฃผ์—๋งŒ ๋“ค์–ด๊ฐ€๊ณ  ๋‚˜๋จธ์ง€๋Š” ํ•ญ์ƒ ground truth ๊ธฐ๋ฐ˜ ๊ฐ’์„ ๋ฐ˜ํ™˜
    • ๋•๋ถ„์— ๋ฏฟ์„ ๋„๊ตฌ์™€ ์˜์‹ฌํ•  ๋„๊ตฌ๊ฐ€ ์„ž์ธ ์ƒํ™ฉ์„ ๋‹ค๋ฃฐ ์ˆ˜ ์žˆ๋Š”์ง€๋งŒ ๋”ฐ๋กœ ๋–ผ์–ด ๋ณผ ์ˆ˜ ์žˆ์Œ

k-NN Predictor

  • ์ •ํ™•๋„๋ฅผ ์›ํ•˜๋Š” ๊ฐ’์— ๋งž์ถ”๋ ค๋ฉด ๋จผ์ € ๋ฐ”๊ฟ”์น˜๊ธฐํ•  ์˜ˆ์ธก์ด ์žˆ์–ด์•ผ ํ•˜๋ฏ€๋กœ, ํ†ต์ œํ•˜๊ธฐ ์‰ฌ์šด ์˜ˆ์ธก๊ธฐ๋ฅผ ํ•˜๋‚˜ ๋ถ™์—ฌ๋‘” ๊ฒƒ
    • ๊ฒฐ์ •์ ์ด๋ผ ์žฌํ˜„๋˜๊ณ ,
    • ์ž์—ฐ ์ •ํ™•๋„๊ฐ€ 40~80% ๊ตฌ๊ฐ„ ์•ˆ์ชฝ์ด๋ผ ์–‘์ชฝ์œผ๋กœ ์กฐ๊ธˆ์”ฉ๋งŒ ๋’ค์ง‘์–ด ๋ชฉํ‘œ์น˜๋ฅผ ๋งŒ๋“ค ์ˆ˜ ์žˆ์œผ๋ฉฐ,
    • ์ด์›ƒ ๊ฐ€์ค‘์น˜ ๋น„์œจ์ด ๊ทธ๋Œ€๋กœ confidence๊ฐ€ ๋จ
  • ๋™์ž‘: ์ง€๊ธˆ ํ•™์ƒ๊ณผ ์„ฑ์  ํŒจํ„ด์ด ๋น„์Šทํ–ˆ๋˜ ๊ณผ๊ฑฐ ํ•™์ƒ๋“ค์„ ์ฐพ์•„ ๊ทธ๋“ค์˜ ์ตœ์ข… ํ•™์  ์ค‘ ๋‹ค์ˆ˜๊ฒฐ๋กœ ์˜ˆ์ธก
    • ๋‹ค์ˆ˜๊ฒฐ์ด๋ผ๊ณ  ํ•ด๋„ ์ด์›ƒ๋งˆ๋‹ค ๊ฐ€์ค‘์น˜๊ฐ€ ๋‹ค๋ฆ„: ๊ฑฐ๋ฆฌ๊ฐ€ ๊ฐ€๊นŒ์šด ์ด์›ƒ์˜ ํ•™์ ์ผ์ˆ˜๋ก ํฐ ๊ฐ€์ค‘์น˜
    • ๊ณต์œ  component๊ฐ€ ์ ์€ ์Œ์€ ๊ฑฐ๋ฆฌ ์ถ”์ •์ด ๋ถˆ์•ˆ์ •ํ•˜๋ฏ€๋กœ tolerance๋กœ ๋ฐ˜๊ฒฝ์„ ์ขํ˜€ ๊ทผ๊ฑฐ๊ฐ€ ์–•์€ ๋งค์นญ์„ ๋ฐฐ์ œ
    • ๋ฐ˜๊ฒฝ ์•ˆ์— ์•„๋ฌด๋„ ์—†์œผ๋ฉด train pool์˜ ์ ์ˆ˜ ์กฐ๊ฑด๋ถ€ ํ•™์  ๋ถ„ํฌ๋กœ fallback (OULAD 19%, PredAct-CS 0%)
  • confidence: ์˜ˆ์ธก๋œ ํ•™์ ์ด ๊ฐ€์ ธ๊ฐ„ ๊ฐ€์ค‘์น˜์˜ ๋น„์œจ
\[c_i = \frac{\sum_{j \in N_i} w_{ij} \mathbb{1}[y_j = \hat y_i]}{\sum_{j \in N_i} w_{ij}}\]
  • ํ™•๋ฅ ์ด ์•„๋‹ˆ๋ผ ์ด์›ƒ๋ผ๋ฆฌ ์–ผ๋งˆ๋‚˜ ๊ฐ™์€ ๋‹ต์„ ๋ƒˆ๋Š”์ง€(agreement)๋ผ calibration์ด ๋ณด์žฅ๋˜์ง€ ์•Š๊ณ , ์‹ค์ œ๋กœ Fig 4์—์„œ ๊ณผ์‹ ์œผ๋กœ ํ™•์ธ๋จ

Noise Injection

  • ์˜๋„: k-NN์ด ๋‚ธ ์˜ˆ์ธก ์ค‘ ์ผ๋ถ€๋ฅผ ๋ฐ”๊ฟ”์น˜๊ธฐํ•ด ํ‘œ๋ณธ ์ •ํ™•๋„๋ฅผ ๋ชฉํ‘œ์น˜์— ์ •ํ™•ํžˆ ๋งž์ถค
    • ๋ชฉํ‘œ์น˜ $a^{*} \in \lbrace 0.4, 0.5, 0.6, 0.7, 0.8 \rbrace$, ์ž์—ฐ ์ƒํƒœ์—์„œ ๋งž์€ ์˜ˆ์ธก ์ˆ˜๋ฅผ $n_0$๋ผ ํ•  ๋•Œ ๋ฐ”๊ฟ€ ๊ฐœ์ˆ˜๋Š”
\[n_{\text{flip}} = \vert \text{round}(a^{*} \cdot N) - n_0 \vert\]
  • ์ž์—ฐ ์ •ํ™•๋„๊ฐ€ ๋ชฉํ‘œ๋ณด๋‹ค ๋†’์œผ๋ฉด ๋งž์€ ์˜ˆ์ธก ์ค‘ $n_{\text{flip}}$๊ฐœ๋ฅผ ๊ณจ๋ผ ๋‹ค๋ฅธ ํ•™์ ์œผ๋กœ ๋ฌด์ž‘์œ„ ์˜ค๋‹ตํ™”
  • ๋‚ฎ์œผ๋ฉด ๋ฐ˜๋Œ€๋กœ ํ‹€๋ฆฐ ์˜ˆ์ธก ์ค‘ $n_{\text{flip}}$๊ฐœ๋ฅผ ์ •๋‹ต์œผ๋กœ ๋˜๋Œ๋ฆผ
  • ์–ด๋А ์ชฝ์ด๋“  ๊ทธ ํ‘œ๋ณธ์˜ ์ •ํ™•๋„๊ฐ€ ๋ชฉํ‘œ์น˜์™€ ์ •ํ™•ํžˆ ์ผ์น˜ํ•˜๊ฒŒ ๋จ
  • ๋ฐ”๊พธ๋Š” ๊ฑด ์˜ˆ์ธก ํ•™์ ๋ฟ์ด๊ณ  confidence๋Š” ๊ทธ๋Œ€๋กœ ๋‘ 
    • ๊ทธ๋ž˜์„œ confidence๊ฐ€ 0.9์ธ๋ฐ ์˜ค๋‹ต์ธ ๊ฒฝ์šฐ๊ฐ€ ์ƒ๊น€
    • ์ €์ž๋Š” ์‹ค์ œ predictor์˜ miscalibration์„ ํ‰๋‚ด ๋‚ธ ์˜๋„๋œ ์„ฑ์งˆ์ด๋ผ๊ณ  ์„ค๋ช…
  • ์กฐํšŒ, counterfactual, ์ตœ์†Œ ์ ์ˆ˜ tool์€ ์†๋Œ€์ง€ ์•Š์œผ๋ฏ€๋กœ noise๋Š” ์˜ˆ์ธก tool ํ•˜๋‚˜์—๋งŒ ๋‚จ์Œ

Episode-level RAIR / RSR

  • appropriate reliance ํ”„๋ ˆ์ž„์›Œํฌ (Schemmer et al.): ํ•œ ๋ฒˆ์˜ ๊ฒฐ์ •์—์„œ multi-turn dialogue๋กœ ํ™•์žฅ
    • ๊ณ„์‚ฐ์€ agent๊ฐ€ flagํ•œ ํ•™์ƒ๋งŒ ๋Œ€์ƒ, $y_i$๋Š” ์ •๋‹ต, $\hat y_i$๋Š” agent์˜ ํŒ๋‹จ
  • RAIR: ์ฒ˜์Œ์—” ๋‚ด๊ฐ€ ํ‹€๋ ธ๊ณ  agent๊ฐ€ ๋งž์•˜๋˜ ๊ฒฝ์šฐ ์ค‘, ๋Œ€ํ™” ํ›„ agent ์ชฝ์œผ๋กœ ์˜ฎ๊ฒจ๊ฐ€ ์ •๋‹ต์ด ๋œ ๋น„์œจ
\[\text{RAIR} = \frac{\vert \lbrace i : d_i^{\text{init}} \neq y_i,\ \hat y_i = y_i,\ d_i^{\text{final}} = y_i \rbrace \vert}{\vert \lbrace i : d_i^{\text{init}} \neq y_i,\ \hat y_i = y_i \rbrace \vert}\]
  • RSR: ์ฒ˜์Œ์—” ๋‚ด๊ฐ€ ๋งž์•˜๊ณ  agent๊ฐ€ ํ‹€๋ ธ๋˜ ๊ฒฝ์šฐ ์ค‘, ๋Œ€ํ™” ํ›„์—๋„ ๋‚ด ํŒ๋‹จ์„ ์ง€์ผœ ์ •๋‹ต์œผ๋กœ ๋‚จ์€ ๋น„์œจ
\[\text{RSR} = \frac{\vert \lbrace i : d_i^{\text{init}} = y_i,\ \hat y_i \neq y_i,\ d_i^{\text{final}} = y_i \rbrace \vert}{\vert \lbrace i : d_i^{\text{init}} = y_i,\ \hat y_i \neq y_i \rbrace \vert}\]
  • ๋‘˜์„ ํ•จ๊ป˜ ๋ด์•ผ ์–ผ๋งˆ๋‚˜ ๋™์˜ํ–ˆ๋Š”์ง€๊ฐ€ ์•„๋‹ˆ๋ผ ์˜ณ์€ ์ชฝ์œผ๋กœ ๋™์˜ํ–ˆ๋Š”์ง€๋ฅผ ์žด ์ˆ˜ ์žˆ์Œ
  • ํ•ด๋‹นํ•˜๋Š” ๊ฒฝ์šฐ๊ฐ€ ํ•˜๋‚˜๋„ ์—†์œผ๋ฉด(๋ถ„๋ชจ 0) ๊ฐ’์ด ์ •์˜ ๋ถˆ๊ฐ€
  • ๋” ์ž์„ธํžˆ ๋ณด๋ ค๊ณ  agent๊ฐ€ flagํ•œ ๊ฒฐ์ •์„ ์ •๋‹ต๊ณผ ๋Œ€์กฐํ•ด 4๊ฐœ๋กœ ๋‚จ๊น€์—†์ด ๋ถ„๋ฅ˜
    • correct follow ์˜ณ์€ flag ์œ ์ง€ / bad follow ํ‹€๋ฆฐ flag ์œ ์ง€ / correct override ํ‹€๋ฆฐ flag ๊ธฐ๊ฐ / bad override ์˜ณ์€ flag ๊ธฐ๊ฐ(์œ„ํ—˜ํ•œ ๋ˆ„๋ฝ)

Effects

  • Experimental setup
    • user(๋ฐ์ดํ„ฐ์™€ episode ๊ตฌ์„ฑ)
      • 5๊ฐœ ๋ชฉํ‘œ ์ •ํ™•๋„ ร— 2๊ฐœ ๋ฐ์ดํ„ฐ์…‹ = 10๊ฐœ cell, cell๋‹น 10ํšŒ ๋ฐ˜๋ณต
      • episode๋‹น ํ•™์ƒ 30๋ช… ํ‘œ๋ณธ: stratification์œผ๋กœ ์ง„์งœ at-risk 5๋ช…์„ ๊ฐ•์ œ ํฌํ•จ
        • at-risk ํ•™์ƒ์ด ๋“œ๋ฌธ ๊ฐ•์˜์—์„œ ํ‘œ๋ณธ์— ์ •๋‹ต์ด ํ•˜๋‚˜๋„ ์•ˆ ์žกํžˆ๋ฉด F1์ด ์‹ค๋ ฅ๊ณผ ๋ฌด๊ด€ํ•˜๊ฒŒ 0์ด ๋˜๋ฏ€๋กœ, ๊ทธ๊ฑธ ๋ง‰๊ธฐ ์œ„ํ•œ ์žฅ์น˜
      • cell๋ณ„๋กœ ๊ฐ•์˜์™€ cutoff week๊ฐ€ ์ง€์ •๋จ (PredAct-CS๋Š” Course A~E ๋ชจ๋‘ 8์ฃผ์ฐจ, OULAD๋Š” week 8~32)
      • episode๋‹น ์ตœ๋Œ€ 10 chat turn
    • assistant(ํ‰๊ฐ€ ๋Œ€์ƒ)
      • assistant agent๋Š” ์ „ ์กฐ๊ฑด์—์„œ GPT-4o Mini๋กœ ๊ณ ์ •, instructor ์ชฝ ์ถ”๋ก  ๋Šฅ๋ ฅ๋งŒ ๋ณ€์ˆ˜๋กœ ๋‚จ๊ธฐ๊ธฐ ์œ„ํ•จ
      • instructor๋งŒ 13๊ฐœ ๋ชจ๋ธ๋กœ ๋ฐ”๊ฟ”๊ฐ€๋ฉฐ ํ‰๊ฐ€
        • closed-source 7์ข…: GPT-5.5, GPT-5.4 Mini, GPT-4o Mini, Claude Opus 4.7, Claude Haiku 4.5, Gemini 3.1 Pro, Gemini 3 Flash
        • open-source 6์ข…: Qwen 3.5 35B, Qwen 3.5 9B, Mistral Small 24B, Ministral 3 14B, DeepSeek V4 Pro, DeepSeek V4 Flash
        • max_tokens 16,000, temperature๋Š” ๋ชจ๋ธ๋ณ„ 0.6~0.7, reasoning ๋ชจ๋“œ๋Š” ํ•ด๋‹น ๋ชจ๋ธ์—์„œ ์‚ฌ์šฉ ์•ˆ ํ•จ
      • ์ด 1,300 episode (13 instructor ร— 10 cell ร— 10 run), ์‹œ๋“œ๋Š” (model, dataset, target accuracy, run index) ํ•ด์‹œ๋กœ ๋งŒ๋“ค์–ด ์žฌํ˜„์„ฑ ํ™•๋ณด
    • evaluation
      • decision quality: ์ดˆ๊ธฐ F1๊ณผ ์ตœ์ข… F1์„ ๋ถ„๋ฆฌ ๋ณด๊ณ , ๊ทธ ๊ฒฉ์ฐจ๊ฐ€ ๋Œ€ํ™”์˜ ์ˆœํšจ๊ณผ
      • tool calibration: noise ์ฃผ์ž… ์ „ ์ž์—ฐ ์ถœ๋ ฅ์— ๋Œ€ํ•ด ECE์™€ Brier score
      • trust calibration: episode ๋‹จ์œ„ RAIR/RSR๊ณผ 4-bucket override ๋ถ„์„
      • human study: ๋Œ€ํ˜• ๊ณต๋ฆฝ๋Œ€ ๊ฐ•์‚ฌ์™€ ์กฐ๊ต 13๋ช…(TA 11, instructor 2), ๊ฐ 10๊ฐœ ์‹œ๋‚˜๋ฆฌ์˜ค
        • no-agent baseline 1๊ฐœ + assistant 3์ข…(GPT-4o Mini, Qwen 3.5 35B, Qwen 3.5 9B) ร— ์ •ํ™•๋„ 3์ข…(40/60/80%) = 9๊ฐœ ์กฐ๊ฑด
        • ์กฐ๊ฑด๋ณ„ ์‹œ๋“œ๋ฅผ ํ•˜๋“œ์ฝ”๋”ฉํ•ด ๋ชจ๋“  ์ฐธ๊ฐ€์ž๊ฐ€ ๊ฐ™์€ ํ•™์ƒ ์ง‘ํ•ฉ์„ ๋ณด๊ฒŒ ํ•จ, ์ด 650๊ฑด์˜ human decision
        • ์กฐ๊ฑด ๋ธ”๋ก๋งˆ๋‹ค 5์  Likert ์„ค๋ฌธ(๊ฒฐ์ • ํ™•์‹ , ์œ ์šฉ์„ฑ, ์˜ค๋‹ต ํƒ์ง€ ๋Šฅ๋ ฅ, ๋ฐฐ์น˜ ์˜ํ–ฅ)
      • ablation 2์ข…: ํŒŒ์ดํ”„๋ผ์ธ ํŠœ๋‹์— ์“ฐ์ด์ง€ ์•Š์€ OULAD cell๋กœ ๋Œ๋ฆฌ๋Š” held-out, noise ์ฃผ์ž…์„ ์•„์˜ˆ ๋นผ๊ณ  ๋Œ๋ฆฌ๋Š” uncalibrated predictor
  • Results
    • ์‚ฌ๋žŒ๊ณผ LLM์€ ๋น„์Šทํ•œ F1์— ์ „ํ˜€ ๋‹ค๋ฅธ ๊ฒฝ๋กœ๋กœ ๋„๋‹ฌํ•จ (Fig 2, Tab 4)
      • ์‚ฌ๋žŒ์€ ์ค‘์œ„๊ถŒ LLM instructor์™€ F1์ด ๋น„์Šท
        • RAIR-RSR ํ‰๋ฉด์—์„œ๋Š” ์‚ฌ๋žŒ๋งŒ calibrated ์‚ฌ๋ถ„๋ฉด์— ํ™€๋กœ ๋ถ„ํฌ
        • 13๊ฐœ ์ค‘ 11๊ฐœ LLM์€ RAIR ํ•˜์œ„ RSR ์ƒ์œ„์— ๋ถ„ํฌ
      • ํ–‰๋™: ์‚ฌ๋žŒ์€ ํ„ด ์ˆ˜๊ฐ€ ์ ์€ ๋Œ€์‹  episode๋‹น ์‹œ๊ฐ„์„ ๋‘ ๋ฐฐ ์“ฐ๊ณ , LLM์€ ์งง์€ ๋‹จ์ผ ์˜๋„ ์งˆ์˜๋ฅผ ๋งŽ์ด ๋˜์ง€๊ณ  ํ„ด ์‚ฌ์ด์— ์‹œ๊ฐ„์„ ์•ˆ ์”€
      • ์งˆ๋ฌธ ์ข…๋ฅ˜: ์‚ฌ๋žŒ์€ ์—ฌ๋Ÿฌ ๋‹ต์„ ๋ชจ์•„ ๋น„๊ตํ•˜๋Š” ์ชฝ, LLM์€ system prompt๊ฐ€ ์˜ˆ์‹œ๋กœ ์ค€ ์กฐํšŒ ์งˆ๋ฌธ์„ ๊ทธ๋Œ€๋กœ ๋”ฐ๋ผ๊ฐ
      • ์ „๋ฌธ๊ฐ€ ํ‰๊ฐ€์—์„œ ๊ฒ€์ฆ ์„ฑ์‹ค๋„๋Š” ๋™๋ฅ ์ด์—ˆ๊ณ  ๋‹ค๋งŒ ์งˆ๋ฌธ์˜ ์งˆ๋งŒ ์‚ฌ๋žŒ์ด ์œ ์˜ํ•˜๊ฒŒ ๋†’์Œ โ†’ ๊ธฐ๊ณ„์  ์„ฑ์‹คํ•จ์ด ์•„๋‹ˆ๋ผ ์งˆ๋ฌธ์˜ ์งˆ์ด ์ฐจ์ด๋ฅผ ๋งŒ๋“ฆ
    • ์˜ˆ์ธก tool ์ •ํ™•๋„๊ฐ€ instructor F1 ์ƒ์Šน ๊ฒฌ์ธ (Fig 3)
      • 40% โ†’ 80%๋กœ ๊ฐˆ์ˆ˜๋ก 13๊ฐœ ๋ชจ๋ธ ํ‰๊ท  F1์ด ๋‘ ๋ฐ์ดํ„ฐ์…‹ ๋ชจ๋‘ ์ƒ์Šน
        • ์ƒ์Šน ํญ์€ PredAct-CS๊ฐ€ ๋” ๋น ๋ฅด๊ฒŒ
      • ๋‹จ OULAD๋Š” 70%์—์„œ ์ตœ๊ณ ์„ฑ๋Šฅ ์ดํ›„ 80%์—์„œ ์˜คํžˆ๋ ค ํ•˜๋ฝ
        • long horizon๊ณผ ์‹ค๋ฐ์ดํ„ฐ noise๋กœ ์„ค๋ช…
      • ๊ฐ™์€ ๋ชจ๋ธ์˜ ๋ฐ์ดํ„ฐ์…‹ ๊ฐ„ ๊ฒฉ์ฐจ๊ฐ€ ๊ฐ™์€ ๋ฐ์ดํ„ฐ์…‹ ์•ˆ์˜ ๋ชจ๋ธ ๊ฐ„ ๊ฒฉ์ฐจ์™€ ๋น„์Šท โ†’ ์–ด๋””์„œ ์žฌ๋А๋ƒ๊ฐ€ ์–ด๋–ค ๋ชจ๋ธ์„ ์“ฐ๋А๋ƒ๋งŒํผ ๊ฒฐ์ •์  (Tab 16)
    • ๋Œ€ํ™”๊ฐ€ ๋Œ€๋ถ€๋ถ„์˜ LLM instructor์˜ ๊ฒฐ์ •์„ ์•…ํ™”์‹œํ‚ด (Tab 14)
      • 13๊ฐœ ์ค‘ 10๊ฐœ์—์„œ chat phase๊ฐ€ F1์„ ๋–จ์–ด๋œจ๋ ธ๊ณ , ๊ฐœ์„ ๋œ ๊ฑด GPT-5.5์™€ Gemini ๊ณ„์—ด ์…‹๋ฟ
      • ์›์ธ์€ ๋‘ ์ง€ํ‘œ์˜ ๋น„๋Œ€์นญ: RSR์€ ์ „ ๋ชจ๋ธ ์ฒœ์žฅ์ธ๋ฐ RAIR์€ ์ƒ์œ„ ๋‘˜์„ ๋นผ๋ฉด ๋ฐ”๋‹ฅ โ†’ ์ดˆ๊ธฐ ํŒ๋‹จ์— ๋ถ™๋ฐ•์ธ ํƒ“์— ํ‹€๋ฆฐ ํŒ๋‹จ์€ ์•ˆ ๊ณ ์ณ์ง€๊ณ  ๋งž์€ ํŒ๋‹จ๋งŒ ๋Œ€ํ™” ์ค‘ ๊ณผ์‹ ์— ๋’ค์ง‘ํž˜
    • ์‹คํŒจ ์‚ฌ๋ก€๋Š” dialogue-induced over-trust collapse ํ•˜๋‚˜๋กœ ์ˆ˜๋ ด (Appx A.10)
      • ์˜ˆ์ธก tool์ด ์˜ณ๊ฒŒ flagํ–ˆ๋Š”๋ฐ๋„ F1 = 0์ด ๋œ episode๋“ค์€ ๊ณ ์ •ํ™•๋„ ๊ตฌ๊ฐ„(70~80%)์— ๋ชฐ๋ฆผ, ์ดˆ๊ธฐ ํŒ๋‹จ์€ ์ „ ์‚ฌ๋ก€์—์„œ ๋ถ€๋ถ„์ ์œผ๋กœ ์˜ณ์•˜์Œ โ†’ ์‹œ์ž‘ ์กฐ๊ฑด์ด ์•„๋‹ˆ๋ผ chat phase๊ฐ€ ์„ฑ๋Šฅ์„ ๊นŽ์Œ
      • ๊ณตํ†ต์ ์œผ๋กœ ์„ฑ์  ์ด๋ ฅ ์กฐํšŒ๋งŒ ์“ฐ๊ณ  counterfactual์ด๋‚˜ ์ตœ์†Œ ์ ์ˆ˜ ๊ณ„์‚ฐ์„ ์•ˆ ๋ถ€๋ฆ„, system prompt๊ฐ€ ๋‘ ์ข…๋ฅ˜ ์กฐํ•ฉ์„ ๋ช…์‹œํ–ˆ๋Š”๋ฐ๋„
    • robustness ablation (Tab 9, Tab 10)
      • ํŒŒ์ดํ”„๋ผ์ธ ํŠœ๋‹์— ์•ˆ ์“ฐ์ธ OULAD cell์—์„œ๋„ ์ค‘๊ฐ„ ์ •ํ™•๋„ ์ •์ ๊ณผ ๊ณ ์ •ํ™•๋„ ๊ตฌ๊ฐ„ ๋ถˆ์•ˆ์ •์ด ์žฌํ˜„
      • noise ์ฃผ์ž…์„ ์•„์˜ˆ ๋บ€ ์กฐ๊ฑด์—์„œ๋„ ๋Œ€๋ถ€๋ถ„์ด ๋Œ€ํ™”๋กœ F1์„ ์žƒ์Œ โ†’ over-trust๋Š” noise ์ฃผ์ž…์ด ๋งŒ๋“ค์–ด๋‚ธ ํ˜„์ƒ์ด ์•„๋‹ˆ๊ณ , ์˜คํžˆ๋ ค ์ฃผ์ž…์ด ์—†์„ ๋•Œ ๋” ์‹ฌํ•จ
    • ์˜ˆ์ธก๊ธฐ ์ž์ฒด๊ฐ€ ์ผ๊ด€๋˜๊ฒŒ ๊ณผ์‹  (Fig 4): ๋‘ ๋ฐ์ดํ„ฐ์…‹ ๋ชจ๋‘ confidence๊ฐ€ ์‹ค์ œ ์ •ํ™•๋„๋ณด๋‹ค ๋†’๊ณ  OULAD ์ชฝ์ด ๋” ์‹ฌํ•จ, ํ•™๊ธฐ ์–ด๋А ์‹œ์ ์—๋„ ์˜ค๋‹ต๋ฅ ์ด ๋–จ์–ด์ง€์ง€ ์•Š์Œ

Personal note. Related Work ์ฒซ ๋ฌธ๋‹จ์ด MultiWOZ์™€ SGD๋กœ ์‹œ์ž‘ํ•˜๋Š” ๊ฒŒ ์ธ์ƒ๊นŠ์–ด์š”. 2026๋…„ 8์›” ํ˜„์žฌ ์‹œ์ ์— ๋ณผ ๋ฐฐ์น˜๋Š” ์•„๋‹Œ ๊ฒƒ ๊ฐ™์€๋ฐ(ใ…‹ใ…‹) ์ €์ž์— MultiWOZ 2.1 ์ €์ž ๋ณธ์ธ์ด ๋ ˆํผ๋Ÿฐ์Šค์— ๋“ค์–ด๊ฐ€ ์žˆ์œผ๋‹ˆ ์ดํ•ด๋Š” ๊ฐ‘๋‹ˆ๋‹ค. ๊ตฌ์กฐ๋„ ์‹ค์ œ๋กœ TOD๋ฅผ ์ด์•ผ๊ธฐํ•˜๊ธฐ๋„ ํ•˜๊ณ ์š”. instructor๊ฐ€ ๋ฌป๊ณ  assistant๊ฐ€ ์กฐํšŒ ํ•˜๋Š” ๊ฑด ์ „ํ†ต์ ์ธ slot filling ๊ทธ๋Œ€๋กœ,, MultiWOZ๋ฅผ fixed ontology ๊ฐ€์ •์œผ๋กœ ๊นŒ๊ณ  ๋“ค์–ด๊ฐ€๊ธด ํ•˜๋Š”๋ฐ ์ •์ž‘ ์ด ๋…ผ๋ฌธ์˜ tool 12๊ฐœ๋„ ๊ณ ์ • ์Šคํ‚ค๋งˆ์ด๊ณ  goal๋„ ๊ฐ•์˜ ํ•˜๋‚˜์— ๊ณ ์ •์ด๋ผ, ์‹ค์ œ๋กœ ํ‘ผ ๊ฑด ontology๊ฐ€ ์•„๋‹ˆ๋ผ DB๊ฐ€ ์ฐธ์„ ๋ณด์žฅํ•˜์ง€ ์•Š๋Š”๋‹ค๋Š” ์ถ• ํ•˜๋‚˜๋ผ๊ณ  ๋ด…๋‹ˆ๋‹ค. slot filling์€ tool calling์œผ๋กœ, DST๋Š” memory๋กœ, dialogue policy๋Š” agent planning์œผ๋กœ ์—ฐ๊ตฌ๊ฐ€ ํŽธ์žฌ๋œ ๋А๋‚Œ์ด์ง€๋งŒ.. ๋งˆ์น˜ ์žฌ๋ฐœ๊ฒฌ์ฒ˜๋Ÿผ ์–ธ๊ธ‰๋˜๋Š” ๋ถ€๋ถ„์ด ์ธ์ƒ์ ์ž…๋‹ˆ๋‹ค.