PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise
- Authors: Abdulrahman AlRabah, Xiaocheng Yang, Dilek Hakkani-Tรผr, Abdussalam Alawini
- Affiliation: University of Illinois Urbana-Champaign
- Paper: https://arxiv.org/abs/2608.02372
- Code: https://github.com/aalrabah/PredAct_bench
- Published: August 3, 2026 (arXiv preprint)

TL; DR
์์ธก tool์ ์ ํ๋๋ฅผ 40~80%๋ก ์ง์ ์ฃผ์
ํต์ ํ๋ฉด์, LLM ์์ฌ๊ฒฐ์ ์์ ์ฌ๋์ด ๋ํ ์ ํ๋ก ๊ฒฐ์ ์ ์ด๋ป๊ฒ ๋ฐ๊พธ๋์ง ํ๊ฐํ๋ PredActBench ์ ์. 13๊ฐ ๋ชจ๋ธ ์ค 10๊ฐ๋ ๋ํ๋ฅผ ํ ์๋ก F1์ด ๋จ์ด์ก๊ณ , ์ฌ๋๋ง calibrated ์์ญ์ ์์น
Review Video

Background
- LLM task-oriented dialogue system: multi-step decision์ ๋๋ ์ฉ๋๋ก education, healthcare, finance ๋ฑ ๊ฒฐ์ ๋๊ฐ๊ฐ ํฐ ๋๋ฉ์ธ์ ๋ฐฐ์น
- ๋ฐฐ์น ํ๊ฒฝ์ tool์๋ ๋ ์ข
๋ฅ๊ฐ ์์ฌ ์์
- ์กฐํํ tool: DB์ ์ด๋ฏธ ๊ธฐ๋ก๋ ๊ฐ์ ๊บผ๋ด์ค๋ฏ๋ก ํ๋ฆด ์ฌ์ง๊ฐ ์์
- ์์ธกํ tool: ์์ง ์ผ์ด๋์ง ์์ ๊ฒฐ๊ณผ๋ฅผ ๊ณผ๊ฑฐ ๊ธฐ๋ก์ผ๋ก ์ถ์ธกํ๋ ๋ชจ๋ธ์ด๋ผ ์๋ฆฌ์ ์ผ๋ก ํ๋ฆด ์ ์๊ณ , ๊ทธ ์ค๋ต์ด ์ ์ ์๋ต ์์ ๋ด๊ฒจ ๋์ค๋ฏ๋ก ์๋ต๋ง ๋ด์๋ ์ ์ ์์
- e.g. ์์ธก ๋๊ตฌ์ ์ํ ์ ์๋ฅผ ๋ณด๊ณ ์น๋ฃ๋ฅผ ์ ํ๋ ์์์, ์์ธก ๋ชจ๋ธ์ด ๋ฝ์ ์ํ๊ตฐ ๋ช ๋จ์ ๋ณด๊ณ ๊ฐ์ ์ ์ ํ๋ ์ง๋๊ต์: ๋๊ตฌ๋ ์กฐ์ธํ๊ณ ๊ฒฐ์ ์ ์ฌ๋์ด ํจ
- ๋ฐฐ์น ํ๊ฒฝ์ tool์๋ ๋ ์ข
๋ฅ๊ฐ ์์ฌ ์์
- 4๊ฐ์ง ์ ํ ์ฐ๊ตฌ ๊ณ์ด
- task-oriented dialogue: belief state tracking๊ณผ response generation์ ํ์คํ, ๋จ predefined schema์ static goal๊ณผ fixed ontology๋ฅผ ๊ฐ์
- MultiWOZ ๊ณ์ด (Budzianowski et al., 2018; Ye et al., 2022), SGD (Rastogi et al., 2020)
- tool-use / agent benchmark: API ์ ํ, argument ๊ตฌ์ฑ, compositional planning, multi-turn function calling์ ์ ํ์ฑ์ ํ๊ฐ
- APIBench (Patil et al., 2024), ToolBench (Qin et al., 2024), BFCL (Patil et al., 2025)
- environment-grounded ํ์ฅ: WebArena (Zhou et al., 2023), Mind2Web (Deng et al., 2023), ฯ-bench (Yao et al., 2025), PrefIx (Li et al., 2026)
- robustness under noise: API ๋ช
์ธ ๋ณต์ก๋, ์คํ ์คํจ, ๋ถ์์ ์๋ต, ์ค๋ฅ ์ถ๋ ฅ, ์ค๋ ์ ํธ์ agent๋ฅผ ๋
ธ์ถ
- WildAgtEval (Kim et al., 2026), AgentNoiseBench (Wang et al., 2026), ์คํ ์คํจ ๋ณต๊ตฌ๋ฅผ ๋ค๋ฃฌ PALADIN (Vuddanti et al., 2025)
- temporal reasoning: ์๊ฐ์ ๊ฐ๋ก์ง๋ฅด๋ ํตํฉ์ด ์ฌ์ ํ ์ฝํ๋ค๋ ์ง๋จ, chronological confusion๊ณผ recency bias๊ฐ ๋ฐ๋ณต ๋ณด๊ณ ๋จ
- TimeBench (Chu et al., 2024), TIMER-Bench (Cui et al., 2025), ER-Reason (Mehandru et al., 2025)
- task-oriented dialogue: belief state tracking๊ณผ response generation์ ํ์คํ, ๋จ predefined schema์ static goal๊ณผ fixed ontology๋ฅผ ๊ฐ์
- 2๊ฐ์ง ํ๊ฐ ์งํ ๊ณ์ด
- calibration: Brier score (Brier, 1950), ECE (Guo et al., 2017)
- appropriate reliance: ์ณ์ AI ์กฐ์ธ์ ๋ฐ๋ฅด๊ณ ํ๋ฆฐ ์กฐ์ธ์ ๊ฑฐ๋ถํ๋์ง๋ฅผ Appropriateness of Reliance(AoR)๋ผ๋ 2์ฐจ์ ๊ฐ๋
์ผ๋ก ์ ์, ๊ทธ ๋ ์ถ์ด RAIR/RSR (Schemmer et al., 2023)
- ๋จ, ์กฐ์ธ์ ํ ๋ฒ ๋ฐ๊ณ ํ ๋ฒ ๊ฒฐ์ ํ๋ ์ํฉ์ ์ ์ ํ๋ฏ๋ก ์ค๊ฐ์ ๋ํ๊ฐ ๋ผ๋ ์ค์ ์๋ ๊ทธ๋๋ก ๋ชป ์
Tab 1: tool calls / multi-turn / interactive conversation / noise injection / longitudinal reasoning / human-in-the-loop ์ฌ์ฏ ์ถ ๋น๊ต- PredActBench๋ง ์ ๋ถ ์ฒดํฌ, ฯยฒ-bench์ AgentNoiseBench๋ longitudinal๊ณผ human-in-the-loop์ด ์๊ณ TIMER-Bench๋ longitudinal๋ง ์๊ณ tool call๊ณผ ๋ํ๊ฐ ์์
Problem States
๋ถ๋ถ ๊ด์ธก๋ longitudinal evidence ์ถ๋ก , multi-turn ์ํ ์ ์ง, ๋ถํ์คํ tool ์ถ๋ ฅ ์์์์ ๊ฒฐ์ . ๋ฐฐ์น ํ์ฅ์์๋ ์ด ์ ์ด ํ๊บผ๋ฒ์ ์ผ์ด๋๋๋ฐ ์ง๊ธ๊น์ง๋ ์๋ก ๋ค๋ฅธ ๋ฒค์น๋งํฌ๋ก ์ชผ๊ฐ์ ธ ๋ค๋ค์ง
- noise๋ฅผ ์๋ฑํ ๊ณณ์ ๋ฃ์ด์ด: ๊ธฐ์กด ๋ฒค์น๋งํฌ์ noise๋ ์ ๋ถ toolchain ๋ฐ๊นฅ์ ์์
- ฯ-bench: tool์ด ๋ฒค์น๋งํฌ๊ฐ ๋ง๋ ์ ๋ต ํ ์ด๋ธ์ ์กฐํํด ๋ฐํํ๋ฏ๋ก ๊ตฌ์ฑ์ ํ๋ฆด ์ฌ์ง๊ฐ ์์ (oracle tool)
- AgentNoiseBench: user query๋ง ํ๋ฆฌ๊ณ tool์ oracle๋ก ์ ์ง
- robustness ๊ณ์ด ์ ๋ฐ: ์ฃผ์ ํ noise๊ฐ timeout, ๋น ์๋ต, ์คํ ์๋ฌ์ฒ๋ผ ๊ณ ์ฅ์ด ๊ฒ์ผ๋ก ๋๋ฌ๋๋ ์ข ๋ฅ๋ผ agent๊ฐ ์ฌ์๋๋ ์ฐํ๋ก ๋์ ๊ฐ๋ฅ
- ์ ์ ์ค์ ๋ฐฐ์น์์ ๋ถํ์คํ ๊ฑด ์์ธกํ tool์ด ๋ด๋๋ ๊ฐ์ธ๋ฐ, ๊ทธ ์ ํ๋๋ฅผ ํต์ ํ ๋ฒค์น๋งํฌ๋ ์์์
- oracle ํ๊ฐ๊ฐ ์๋ชป๋ ํ๋์ ๋ณด์ํจ: ๋ชจ๋ tool ๋ฐํ๊ฐ์ด ์ ๋ต์ด๋ฉด ๊ฒ์ฆ ์์ด ๊ทธ๋๋ก ๋ฐ๋ฅด๋ ๊ฒ(wholesale acceptance)์ด ์ต์ ์ ๋ต
- ๊ฒ์ฆ์ฉ ์ถ๊ฐ tool call์ ์์ ๋ญ๋น๊ฐ ๋๊ณ tool ์ถ๋ ฅ์ ๋ค์ง๋ ๊ฒ์ ๋ฌด์กฐ๊ฑด ์ํด์ด๋ฏ๋ก, ์์์ด ๊ณง ๊ณ ๋์
- ์ด ์ ๋ต์ ์์ธกํ tool์ด ์์ฌ ๋ค์ด์ค๋ ์๊ฐ ๋ฌด๋์ง๋ฏ๋ก, oracle ๋ฒค์น๋งํฌ์ ๊ณ ๋์ ์ด ๋ฐฐ์น ํ๊ฒฝ์์๋ ์ ์ง๋๋ค๋ ๋ณด์ฅ์ด ์์
- controlled tool noise๋ ํ๊ฐ์ ๋ง๋ถ์ด๋ stress test๊ฐ ์๋๋ผ, ์ฌ๋ ค๋ ๋ฅ๋ ฅ์ ์ธก์ ํ๊ธฐ ์ํ ์ ์ ์กฐ๊ฑด
- F1์ผ๋ก๋ ๊ตฌ๋ถ ๋ถ๊ฐ: ์ ๋ณ์ ๊ฒ์ฆ์ผ๋ก ์ ์๋ฅผ ๋ฒ agent์ ๊ทธ๋ฅ ์์ํ agent๊ฐ ๊ฐ์ F1์ ๋ฐ์
- ์ณ์ tool์ ๋ถ๋ฅด๋๊ฐ, tool ์ถ๋ ฅ์ ์ถฉ์คํ ์ถ์ ํ๋๊ฐ, ๋ถํ์คํ ์์ธก์ ๊ณผ์ ํ๋๊ฐ, ์ฌ๋์ ์ต์ข ๊ฒฐ์ ์ ์ค์ ๋ก ๊ฐ์ ํ๋๊ฐ๊ฐ ์ ๋ถ ํ ์ซ์์ ๋ญ๊ฐ์ง
- โ ๋ฐ๋ผ์ ํ์ํ ์กฐ๊ฑด
- [ํ๊ฒฝ] tool ์ ํ๋๋ฅผ ์ฃผ์ด์ง ๊ฐ์ผ๋ก ๋์ง ๋ง๊ณ ์คํ์๊ฐ ์ง์ ์ง์ ํ๋ ํ๋ผ๋ฏธํฐ๋ก ๋ ๊ฒ
- [์ธก์ ] ๋ํ ์ ๊ฒฐ์ ๊ณผ ๋ํ ํ ๊ฒฐ์ ์ ๋ถ๋ฆฌํด ๊ธฐ๋ก, ๊ทธ ์ฐจ์ด๋ก ๋ํ์ ์ํจ๊ณผ๋ฅผ ์ ์
- [์งํ] ์ณ์ ์กฐ์ธ์ ๋ฐ์๋ค์ด๋ ๋ฅ๋ ฅ๊ณผ ํ๋ฆฐ ์กฐ์ธ์ ๋ฒํฐ๋ ๋ฅ๋ ฅ์ ์๋ก ๋ค๋ฅธ ์ถ์ผ๋ก ๋ถ๋ฆฌ, ํ ๋ฒ์ ๊ฒฐ์ ์ด ์๋๋ผ episode ๋จ์๋ก ์ธก์
- [๊ธฐ์ค์ ] human baseline์ ๋์ด์ผ ํ ๋ชฉํ์น๊ฐ ์๋๋ผ ํ๋ ํจํด์ ๊ฒฌ์ค ๊ธฐ์ค์ผ๋ก ๋ ๊ฒ
Suggestions
ํต์ฌ์ tool ์ ํ๋๋ฅผ ์คํ์๊ฐ ์ง์ ํ๋ ๊ฒ ํ๋์ด๊ณ , ๋๋จธ์ง ๊ตฌ์ฑ์์๋ ์ ๋ถ ๊ทธ๊ฑธ ๊ฐ๋ฅํ๊ฒ ๋ง๋ค๊ธฐ ์ํ ์ฅ์น
- ์ ํ๋๋ฅผ 40%๋ก ๋ง์ถ๋ ค๋ฉด ์์ธก์ด ๋ง์๋์ง ์ธ์ผ ํจ โ ์ ๋ต์ด ๋จ์ ์๋ ๋๋ฉ์ธ ํ์ (education,
Datasets) - ๋ค์ง์ ์์ธก์ด ๋จผ์ ์์ด์ผ noise ์ฃผ์
์ด ์ฑ๋ฆฝ โ ๊ฒฐ์ ์ ์ด๊ณ ์ฌํ๋๋ ์์ธก๊ธฐ ํ์ (
k-NN Predictor) - ์ ๋ถ ํ๋ฆฌ๋ฉด ์์กด ์ฌ๋ถ๋ฅผ ์ด ์ ์์ โ ์ ํ๋ฆฌ๋ tool๊ณผ ํ๋ฆฌ๋ tool์ ์์ด์ผ ํจ (
Tool Inventory) - ํต์ ๋ ์กฐ๊ฑด์์ ๋ฌด์์ ์ด ๊ฒ์ธ๊ฐ โ ๋ํ ์ ํ ๊ฒฐ์ ๋ณํ (
Episode-level RAIR / RSR)
Task Definition
- academic risk prediction: ๋ LLM ์ฌ์ด์ ๋ค์ค ํด ๋ํ ๊ณผ์ ๋ก ์ฌ์ ์, ๋ ๋ค ๋ฒค์น๋งํฌ์ ์ผ๋ถ๋ก ํจ๊ป ๋ฐฐํฌ
- LLM instructor: ๊ฐ์ ๋ด๋น ๊ต์๋ฅผ ์๋ฎฌ๋ ์ด์ ํ๋ ์์ฌ๊ฒฐ์ ์, ํ์ ๋ฐ์ดํฐ๋ฅผ ์ง์ ๋ณผ ์ ์๊ณ ์ค์ง assistant์๊ฒ ๋ฌผ์ด์ผ๋ง ์ ์ ์์
- LLM assistant: tool call๋ก๋ง ์๋ต, ์ค์ค๋ก ๊ฒฐ์ ํ์ง ์๊ณ instructor์ ์ง๋ฌธ์ ์๋ฃ๋ฅผ ๋์ฃผ๋ ์ญํ
- episode = (course, cutoff week $t$, ํ์ $N$๋ช
)
- ์ ๋ ฅ: ํ์ $i$์ cutoff๊น์ง์ ๋ถ๋ถ ์ฑ์ ๊ถค์ $x_i^{(t)}$
- 3๋จ๊ณ ์งํ (
Fig 1)- 1๋จ๊ณ: assistant๊ฐ ์ต์ข letter grade $\hat y_i$์ confidence $c_i$๋ฅผ ์์ธกํด at-risk ํ์์ flag, ์งง์ ๊ทผ๊ฑฐ์ ํจ๊ป ์ ์
- 2๋จ๊ณ: instructor๊ฐ ์ด ๋ฆฌํฌํธ๋ง ๋ณด๊ณ ์ด๊ธฐ ๊ฒฐ์ $d_i^{\text{init}} \in \lbrace \text{flag}, \text{no-flag} \rbrace$ ๊ธฐ๋ก
- 3๋จ๊ณ: ์ฑ์ ์ด๋ ฅ, ํ๊ธ ๋น๊ต, counterfactual, ๊ฐ์ ์์ ์บ๋ฌผ์ผ๋ฉฐ ๋ํํ ๋ค ์ต์ข ๊ฒฐ์ $d_i^{\text{final}}$ ํ์
Fig 1์ ์ด ํ์ดํ๋ผ์ธ์ ๋ ๊ฐ๋๋ก ๋ณด์ฌ์ค- ์ผ์ชฝ system-initiated: ๋ agent๊ฐ tool ์ถ๋ ฅ ์์์ ๋ํํ๋ฉฐ ์์จ์ ์ผ๋ก ์ฑ์ ์ ๋ถ์ํ๊ณ ์ํ์ ์์ธกํ๊ณ ๊ฐ์ ์ ๊ณํ
- ์ค๋ฅธ์ชฝ user-initiated: instructor๊ฐ ๋ถ์์ ์ง์ํ๊ณ ๊ฑธ๋ฌ๋ด๊ณ ๋ฐ๋ฐํ๋ฉด์ ์ถ๊ฐ tool call์ ์ ๋ฐ
- ๋ถ์ ๊ธ์จ๋ tool์ด ์ค์ ๋ก ๋ง๋ค์ด๋ธ ๊ฐ์ ํ์ํด ์ด๋๊น์ง๊ฐ tool ์ถ๋ ฅ์ธ์ง ๊ตฌ๋ถ
Datasets
- ์ ๋ต์ด ํ์ํด์ education ๋๋ฉ์ธ ์ ํ: ์๋ฅผ ๋ค์ด 8์ฃผ์ฐจ ์์ธก์ด ๋ง์๋์ง๋ฅผ ํ๊ธฐ ๋ง ์ค์ ์ฑ์ ์ผ๋ก ์ฑ์ ๊ฐ๋ฅ, ๊ฐ์ ์ฌ๋ถ๋ผ๋ ๊ฒฐ์ ์ง์ ๋ ๋ถ๋ช ํ๋ค๊ณ
- OULAD (Kuzilek et al., 2017): ์๊ตญ Open University์ ์ค์ ํ๊ฐ ์ ์์ ์ต์ข
๊ฒฐ๊ณผ
- 32,593๋ช , 7๊ฐ module 22๊ฐ presentation, ๊ถค์ ๊ณผ ์ต์ข ์ฑ์ ๋ชจ๋ ์ค์ ๋ฐ์ดํฐ
- UK ๊ด๋ก๋ฅผ ๋ฐ๋ผ 40, 50, 60, 70 ์๊ณ๊ฐ์ด F๋ถํฐ A๊น์ง์ ๋์
- PredAct-CS: ๋ํ ๊ณต๋ฆฝ ์ฐ๊ตฌ์ค์ฌ๋ํ์ ํ๋ถ/๋ํ์ CS 60๊ฐ ๊ฐ์
- 53,401๋ช , ๊ณผ์ ๋ช ๊ณผ ๊ฐ์ค์น์ ์ฃผ์ฐจ ์ผ์ ์ด ๋ด๊ธด ์ค์ syllabus, ํ์๋ณ ์ค์ ์ต์ข letter grade
- ์ฃผ์ฐจ๋ณ raw ๊ธฐ๋ก์ ๊ณต๊ฐ ๋ถ๊ฐ์ด๋ฏ๋ก ๊ณผ์ ๋ณ ์ ์๋ ๊ฐ ํ์์ ์ค์ ์ต์ข ์ฑ์ ์ ๋๋ฌํ๋๋ก ํฉ์ฑ ์์ฑ
- ๊ฐ์๋ณ 80/20 ๋ถํ , train ํํฐ์ ์ด k-NN์ historical record pool ์ญํ
Tool Inventory
- ๋ฏฟ์ tool๊ณผ ๋ชป ๋ฏฟ์ tool์ ์๊ธฐ ์ํ ๊ตฌ์ฑ: 12๊ฐ 4๋ฒ์ฃผ (
Tab 3)- Lookup 6๊ฐ (deterministic):
get_student_grades๋ฑ ์ฑ์ /๊ณผ์ /ํ๊ธ ํต๊ณ ์กฐํ - Counterfactual 3๊ฐ (deterministic):
simulate_uniform_remaining๋ฑ โ๋จ์ ๊ณผ์ ๋ฅผ ์ ๋ถ X์ ๋ฐ์ผ๋ฉดโ ๋ฅ์ ์๋ฎฌ๋ ์ด์ - Prediction 2๊ฐ (probabilistic, k-NN):
predict_final_grade_for_student, ์์ธก ํ์ ๊ณผ confidence๋ฅผ ํจ๊ป ๋ฐํ - Intervention 1๊ฐ (LLM-generated):
suggest_intervention_for_student
- Lookup 6๊ฐ (deterministic):
- noise๋ prediction ๋ฒ์ฃผ์๋ง ๋ค์ด๊ฐ๊ณ ๋๋จธ์ง๋ ํญ์ ground truth ๊ธฐ๋ฐ ๊ฐ์ ๋ฐํ
- ๋๋ถ์ ๋ฏฟ์ ๋๊ตฌ์ ์์ฌํ ๋๊ตฌ๊ฐ ์์ธ ์ํฉ์ ๋ค๋ฃฐ ์ ์๋์ง๋ง ๋ฐ๋ก ๋ผ์ด ๋ณผ ์ ์์
k-NN Predictor
- ์ ํ๋๋ฅผ ์ํ๋ ๊ฐ์ ๋ง์ถ๋ ค๋ฉด ๋จผ์ ๋ฐ๊ฟ์น๊ธฐํ ์์ธก์ด ์์ด์ผ ํ๋ฏ๋ก, ํต์ ํ๊ธฐ ์ฌ์ด ์์ธก๊ธฐ๋ฅผ ํ๋ ๋ถ์ฌ๋ ๊ฒ
- ๊ฒฐ์ ์ ์ด๋ผ ์ฌํ๋๊ณ ,
- ์์ฐ ์ ํ๋๊ฐ 40~80% ๊ตฌ๊ฐ ์์ชฝ์ด๋ผ ์์ชฝ์ผ๋ก ์กฐ๊ธ์ฉ๋ง ๋ค์ง์ด ๋ชฉํ์น๋ฅผ ๋ง๋ค ์ ์์ผ๋ฉฐ,
- ์ด์ ๊ฐ์ค์น ๋น์จ์ด ๊ทธ๋๋ก confidence๊ฐ ๋จ
- ๋์: ์ง๊ธ ํ์๊ณผ ์ฑ์ ํจํด์ด ๋น์ทํ๋ ๊ณผ๊ฑฐ ํ์๋ค์ ์ฐพ์ ๊ทธ๋ค์ ์ต์ข
ํ์ ์ค ๋ค์๊ฒฐ๋ก ์์ธก
- ๋ค์๊ฒฐ์ด๋ผ๊ณ ํด๋ ์ด์๋ง๋ค ๊ฐ์ค์น๊ฐ ๋ค๋ฆ: ๊ฑฐ๋ฆฌ๊ฐ ๊ฐ๊น์ด ์ด์์ ํ์ ์ผ์๋ก ํฐ ๊ฐ์ค์น
- ๊ณต์ component๊ฐ ์ ์ ์์ ๊ฑฐ๋ฆฌ ์ถ์ ์ด ๋ถ์์ ํ๋ฏ๋ก tolerance๋ก ๋ฐ๊ฒฝ์ ์ขํ ๊ทผ๊ฑฐ๊ฐ ์์ ๋งค์นญ์ ๋ฐฐ์
- ๋ฐ๊ฒฝ ์์ ์๋ฌด๋ ์์ผ๋ฉด train pool์ ์ ์ ์กฐ๊ฑด๋ถ ํ์ ๋ถํฌ๋ก fallback (OULAD 19%, PredAct-CS 0%)
- confidence: ์์ธก๋ ํ์ ์ด ๊ฐ์ ธ๊ฐ ๊ฐ์ค์น์ ๋น์จ
- ํ๋ฅ ์ด ์๋๋ผ ์ด์๋ผ๋ฆฌ ์ผ๋ง๋ ๊ฐ์ ๋ต์ ๋๋์ง(agreement)๋ผ calibration์ด ๋ณด์ฅ๋์ง ์๊ณ , ์ค์ ๋ก
Fig 4์์ ๊ณผ์ ์ผ๋ก ํ์ธ๋จ
Noise Injection
- ์๋: k-NN์ด ๋ธ ์์ธก ์ค ์ผ๋ถ๋ฅผ ๋ฐ๊ฟ์น๊ธฐํด ํ๋ณธ ์ ํ๋๋ฅผ ๋ชฉํ์น์ ์ ํํ ๋ง์ถค
- ๋ชฉํ์น $a^{*} \in \lbrace 0.4, 0.5, 0.6, 0.7, 0.8 \rbrace$, ์์ฐ ์ํ์์ ๋ง์ ์์ธก ์๋ฅผ $n_0$๋ผ ํ ๋ ๋ฐ๊ฟ ๊ฐ์๋
- ์์ฐ ์ ํ๋๊ฐ ๋ชฉํ๋ณด๋ค ๋์ผ๋ฉด ๋ง์ ์์ธก ์ค $n_{\text{flip}}$๊ฐ๋ฅผ ๊ณจ๋ผ ๋ค๋ฅธ ํ์ ์ผ๋ก ๋ฌด์์ ์ค๋ตํ
- ๋ฎ์ผ๋ฉด ๋ฐ๋๋ก ํ๋ฆฐ ์์ธก ์ค $n_{\text{flip}}$๊ฐ๋ฅผ ์ ๋ต์ผ๋ก ๋๋๋ฆผ
- ์ด๋ ์ชฝ์ด๋ ๊ทธ ํ๋ณธ์ ์ ํ๋๊ฐ ๋ชฉํ์น์ ์ ํํ ์ผ์นํ๊ฒ ๋จ
- ๋ฐ๊พธ๋ ๊ฑด ์์ธก ํ์ ๋ฟ์ด๊ณ confidence๋ ๊ทธ๋๋ก ๋
- ๊ทธ๋์ confidence๊ฐ 0.9์ธ๋ฐ ์ค๋ต์ธ ๊ฒฝ์ฐ๊ฐ ์๊น
- ์ ์๋ ์ค์ predictor์ miscalibration์ ํ๋ด ๋ธ ์๋๋ ์ฑ์ง์ด๋ผ๊ณ ์ค๋ช
- ์กฐํ, counterfactual, ์ต์ ์ ์ tool์ ์๋์ง ์์ผ๋ฏ๋ก noise๋ ์์ธก tool ํ๋์๋ง ๋จ์
Episode-level RAIR / RSR
- appropriate reliance ํ๋ ์์ํฌ (Schemmer et al.): ํ ๋ฒ์ ๊ฒฐ์ ์์ multi-turn dialogue๋ก ํ์ฅ
- ๊ณ์ฐ์ agent๊ฐ flagํ ํ์๋ง ๋์, $y_i$๋ ์ ๋ต, $\hat y_i$๋ agent์ ํ๋จ
- RAIR: ์ฒ์์ ๋ด๊ฐ ํ๋ ธ๊ณ agent๊ฐ ๋ง์๋ ๊ฒฝ์ฐ ์ค, ๋ํ ํ agent ์ชฝ์ผ๋ก ์ฎ๊ฒจ๊ฐ ์ ๋ต์ด ๋ ๋น์จ
- RSR: ์ฒ์์ ๋ด๊ฐ ๋ง์๊ณ agent๊ฐ ํ๋ ธ๋ ๊ฒฝ์ฐ ์ค, ๋ํ ํ์๋ ๋ด ํ๋จ์ ์ง์ผ ์ ๋ต์ผ๋ก ๋จ์ ๋น์จ
- ๋์ ํจ๊ป ๋ด์ผ ์ผ๋ง๋ ๋์ํ๋์ง๊ฐ ์๋๋ผ ์ณ์ ์ชฝ์ผ๋ก ๋์ํ๋์ง๋ฅผ ์ด ์ ์์
- ํด๋นํ๋ ๊ฒฝ์ฐ๊ฐ ํ๋๋ ์์ผ๋ฉด(๋ถ๋ชจ 0) ๊ฐ์ด ์ ์ ๋ถ๊ฐ
- ๋ ์์ธํ ๋ณด๋ ค๊ณ agent๊ฐ flagํ ๊ฒฐ์ ์ ์ ๋ต๊ณผ ๋์กฐํด 4๊ฐ๋ก ๋จ๊น์์ด ๋ถ๋ฅ
correct follow์ณ์ flag ์ ์ง /bad followํ๋ฆฐ flag ์ ์ง /correct overrideํ๋ฆฐ flag ๊ธฐ๊ฐ /bad override์ณ์ flag ๊ธฐ๊ฐ(์ํํ ๋๋ฝ)
Effects
- Experimental setup
- user(๋ฐ์ดํฐ์ episode ๊ตฌ์ฑ)
- 5๊ฐ ๋ชฉํ ์ ํ๋ ร 2๊ฐ ๋ฐ์ดํฐ์ = 10๊ฐ cell, cell๋น 10ํ ๋ฐ๋ณต
- episode๋น ํ์ 30๋ช
ํ๋ณธ: stratification์ผ๋ก ์ง์ง at-risk 5๋ช
์ ๊ฐ์ ํฌํจ
- at-risk ํ์์ด ๋๋ฌธ ๊ฐ์์์ ํ๋ณธ์ ์ ๋ต์ด ํ๋๋ ์ ์กํ๋ฉด F1์ด ์ค๋ ฅ๊ณผ ๋ฌด๊ดํ๊ฒ 0์ด ๋๋ฏ๋ก, ๊ทธ๊ฑธ ๋ง๊ธฐ ์ํ ์ฅ์น
- cell๋ณ๋ก ๊ฐ์์ cutoff week๊ฐ ์ง์ ๋จ (PredAct-CS๋ Course A~E ๋ชจ๋ 8์ฃผ์ฐจ, OULAD๋ week 8~32)
- episode๋น ์ต๋ 10 chat turn
- assistant(ํ๊ฐ ๋์)
- assistant agent๋ ์ ์กฐ๊ฑด์์ GPT-4o Mini๋ก ๊ณ ์ , instructor ์ชฝ ์ถ๋ก ๋ฅ๋ ฅ๋ง ๋ณ์๋ก ๋จ๊ธฐ๊ธฐ ์ํจ
- instructor๋ง 13๊ฐ ๋ชจ๋ธ๋ก ๋ฐ๊ฟ๊ฐ๋ฉฐ ํ๊ฐ
- closed-source 7์ข : GPT-5.5, GPT-5.4 Mini, GPT-4o Mini, Claude Opus 4.7, Claude Haiku 4.5, Gemini 3.1 Pro, Gemini 3 Flash
- open-source 6์ข : Qwen 3.5 35B, Qwen 3.5 9B, Mistral Small 24B, Ministral 3 14B, DeepSeek V4 Pro, DeepSeek V4 Flash
max_tokens16,000, temperature๋ ๋ชจ๋ธ๋ณ 0.6~0.7, reasoning ๋ชจ๋๋ ํด๋น ๋ชจ๋ธ์์ ์ฌ์ฉ ์ ํจ
- ์ด 1,300 episode (13 instructor ร 10 cell ร 10 run), ์๋๋ (model, dataset, target accuracy, run index) ํด์๋ก ๋ง๋ค์ด ์ฌํ์ฑ ํ๋ณด
- evaluation
- decision quality: ์ด๊ธฐ F1๊ณผ ์ต์ข F1์ ๋ถ๋ฆฌ ๋ณด๊ณ , ๊ทธ ๊ฒฉ์ฐจ๊ฐ ๋ํ์ ์ํจ๊ณผ
- tool calibration: noise ์ฃผ์ ์ ์์ฐ ์ถ๋ ฅ์ ๋ํด ECE์ Brier score
- trust calibration: episode ๋จ์ RAIR/RSR๊ณผ 4-bucket override ๋ถ์
- human study: ๋ํ ๊ณต๋ฆฝ๋ ๊ฐ์ฌ์ ์กฐ๊ต 13๋ช
(TA 11, instructor 2), ๊ฐ 10๊ฐ ์๋๋ฆฌ์ค
- no-agent baseline 1๊ฐ + assistant 3์ข (GPT-4o Mini, Qwen 3.5 35B, Qwen 3.5 9B) ร ์ ํ๋ 3์ข (40/60/80%) = 9๊ฐ ์กฐ๊ฑด
- ์กฐ๊ฑด๋ณ ์๋๋ฅผ ํ๋์ฝ๋ฉํด ๋ชจ๋ ์ฐธ๊ฐ์๊ฐ ๊ฐ์ ํ์ ์งํฉ์ ๋ณด๊ฒ ํจ, ์ด 650๊ฑด์ human decision
- ์กฐ๊ฑด ๋ธ๋ก๋ง๋ค 5์ Likert ์ค๋ฌธ(๊ฒฐ์ ํ์ , ์ ์ฉ์ฑ, ์ค๋ต ํ์ง ๋ฅ๋ ฅ, ๋ฐฐ์น ์ํฅ)
- ablation 2์ข : ํ์ดํ๋ผ์ธ ํ๋์ ์ฐ์ด์ง ์์ OULAD cell๋ก ๋๋ฆฌ๋ held-out, noise ์ฃผ์ ์ ์์ ๋นผ๊ณ ๋๋ฆฌ๋ uncalibrated predictor
- user(๋ฐ์ดํฐ์ episode ๊ตฌ์ฑ)
- Results
- ์ฌ๋๊ณผ LLM์ ๋น์ทํ F1์ ์ ํ ๋ค๋ฅธ ๊ฒฝ๋ก๋ก ๋๋ฌํจ (
Fig 2,Tab 4)- ์ฌ๋์ ์ค์๊ถ LLM instructor์ F1์ด ๋น์ท
- RAIR-RSR ํ๋ฉด์์๋ ์ฌ๋๋ง calibrated ์ฌ๋ถ๋ฉด์ ํ๋ก ๋ถํฌ
- 13๊ฐ ์ค 11๊ฐ LLM์ RAIR ํ์ RSR ์์์ ๋ถํฌ
- ํ๋: ์ฌ๋์ ํด ์๊ฐ ์ ์ ๋์ episode๋น ์๊ฐ์ ๋ ๋ฐฐ ์ฐ๊ณ , LLM์ ์งง์ ๋จ์ผ ์๋ ์ง์๋ฅผ ๋ง์ด ๋์ง๊ณ ํด ์ฌ์ด์ ์๊ฐ์ ์ ์
- ์ง๋ฌธ ์ข ๋ฅ: ์ฌ๋์ ์ฌ๋ฌ ๋ต์ ๋ชจ์ ๋น๊ตํ๋ ์ชฝ, LLM์ system prompt๊ฐ ์์๋ก ์ค ์กฐํ ์ง๋ฌธ์ ๊ทธ๋๋ก ๋ฐ๋ผ๊ฐ
- ์ ๋ฌธ๊ฐ ํ๊ฐ์์ ๊ฒ์ฆ ์ฑ์ค๋๋ ๋๋ฅ ์ด์๊ณ ๋ค๋ง ์ง๋ฌธ์ ์ง๋ง ์ฌ๋์ด ์ ์ํ๊ฒ ๋์ โ ๊ธฐ๊ณ์ ์ฑ์คํจ์ด ์๋๋ผ ์ง๋ฌธ์ ์ง์ด ์ฐจ์ด๋ฅผ ๋ง๋ฆ
- ์ฌ๋์ ์ค์๊ถ LLM instructor์ F1์ด ๋น์ท
- ์์ธก tool ์ ํ๋๊ฐ instructor F1 ์์น ๊ฒฌ์ธ (
Fig 3)- 40% โ 80%๋ก ๊ฐ์๋ก 13๊ฐ ๋ชจ๋ธ ํ๊ท F1์ด ๋ ๋ฐ์ดํฐ์
๋ชจ๋ ์์น
- ์์น ํญ์ PredAct-CS๊ฐ ๋ ๋น ๋ฅด๊ฒ
- ๋จ OULAD๋ 70%์์ ์ต๊ณ ์ฑ๋ฅ ์ดํ 80%์์ ์คํ๋ ค ํ๋ฝ
- long horizon๊ณผ ์ค๋ฐ์ดํฐ noise๋ก ์ค๋ช
- ๊ฐ์ ๋ชจ๋ธ์ ๋ฐ์ดํฐ์
๊ฐ ๊ฒฉ์ฐจ๊ฐ ๊ฐ์ ๋ฐ์ดํฐ์
์์ ๋ชจ๋ธ ๊ฐ ๊ฒฉ์ฐจ์ ๋น์ท โ ์ด๋์ ์ฌ๋๋๊ฐ ์ด๋ค ๋ชจ๋ธ์ ์ฐ๋๋๋งํผ ๊ฒฐ์ ์ (
Tab 16)
- 40% โ 80%๋ก ๊ฐ์๋ก 13๊ฐ ๋ชจ๋ธ ํ๊ท F1์ด ๋ ๋ฐ์ดํฐ์
๋ชจ๋ ์์น
- ๋ํ๊ฐ ๋๋ถ๋ถ์ LLM instructor์ ๊ฒฐ์ ์ ์
ํ์ํด (
Tab 14)- 13๊ฐ ์ค 10๊ฐ์์ chat phase๊ฐ F1์ ๋จ์ด๋จ๋ ธ๊ณ , ๊ฐ์ ๋ ๊ฑด GPT-5.5์ Gemini ๊ณ์ด ์ ๋ฟ
- ์์ธ์ ๋ ์งํ์ ๋น๋์นญ: RSR์ ์ ๋ชจ๋ธ ์ฒ์ฅ์ธ๋ฐ RAIR์ ์์ ๋์ ๋นผ๋ฉด ๋ฐ๋ฅ โ ์ด๊ธฐ ํ๋จ์ ๋ถ๋ฐ์ธ ํ์ ํ๋ฆฐ ํ๋จ์ ์ ๊ณ ์ณ์ง๊ณ ๋ง์ ํ๋จ๋ง ๋ํ ์ค ๊ณผ์ ์ ๋ค์งํ
- ์คํจ ์ฌ๋ก๋ dialogue-induced over-trust collapse ํ๋๋ก ์๋ ด (
Appx A.10)- ์์ธก tool์ด ์ณ๊ฒ flagํ๋๋ฐ๋ F1 = 0์ด ๋ episode๋ค์ ๊ณ ์ ํ๋ ๊ตฌ๊ฐ(70~80%)์ ๋ชฐ๋ฆผ, ์ด๊ธฐ ํ๋จ์ ์ ์ฌ๋ก์์ ๋ถ๋ถ์ ์ผ๋ก ์ณ์์ โ ์์ ์กฐ๊ฑด์ด ์๋๋ผ chat phase๊ฐ ์ฑ๋ฅ์ ๊น์
- ๊ณตํต์ ์ผ๋ก ์ฑ์ ์ด๋ ฅ ์กฐํ๋ง ์ฐ๊ณ counterfactual์ด๋ ์ต์ ์ ์ ๊ณ์ฐ์ ์ ๋ถ๋ฆ, system prompt๊ฐ ๋ ์ข ๋ฅ ์กฐํฉ์ ๋ช ์ํ๋๋ฐ๋
- robustness ablation (
Tab 9,Tab 10)- ํ์ดํ๋ผ์ธ ํ๋์ ์ ์ฐ์ธ OULAD cell์์๋ ์ค๊ฐ ์ ํ๋ ์ ์ ๊ณผ ๊ณ ์ ํ๋ ๊ตฌ๊ฐ ๋ถ์์ ์ด ์ฌํ
- noise ์ฃผ์ ์ ์์ ๋บ ์กฐ๊ฑด์์๋ ๋๋ถ๋ถ์ด ๋ํ๋ก F1์ ์์ โ over-trust๋ noise ์ฃผ์ ์ด ๋ง๋ค์ด๋ธ ํ์์ด ์๋๊ณ , ์คํ๋ ค ์ฃผ์ ์ด ์์ ๋ ๋ ์ฌํจ
- ์์ธก๊ธฐ ์์ฒด๊ฐ ์ผ๊ด๋๊ฒ ๊ณผ์ (
Fig 4): ๋ ๋ฐ์ดํฐ์ ๋ชจ๋ confidence๊ฐ ์ค์ ์ ํ๋๋ณด๋ค ๋๊ณ OULAD ์ชฝ์ด ๋ ์ฌํจ, ํ๊ธฐ ์ด๋ ์์ ์๋ ์ค๋ต๋ฅ ์ด ๋จ์ด์ง์ง ์์
- ์ฌ๋๊ณผ LLM์ ๋น์ทํ F1์ ์ ํ ๋ค๋ฅธ ๊ฒฝ๋ก๋ก ๋๋ฌํจ (
Personal note. Related Work ์ฒซ ๋ฌธ๋จ์ด MultiWOZ์ SGD๋ก ์์ํ๋ ๊ฒ ์ธ์๊น์ด์. 2026๋ 8์ ํ์ฌ ์์ ์ ๋ณผ ๋ฐฐ์น๋ ์๋ ๊ฒ ๊ฐ์๋ฐ(ใ ใ ) ์ ์์ MultiWOZ 2.1 ์ ์ ๋ณธ์ธ์ด ๋ ํผ๋ฐ์ค์ ๋ค์ด๊ฐ ์์ผ๋ ์ดํด๋ ๊ฐ๋๋ค. ๊ตฌ์กฐ๋ ์ค์ ๋ก TOD๋ฅผ ์ด์ผ๊ธฐํ๊ธฐ๋ ํ๊ณ ์. instructor๊ฐ ๋ฌป๊ณ assistant๊ฐ ์กฐํ ํ๋ ๊ฑด ์ ํต์ ์ธ slot filling ๊ทธ๋๋ก,, MultiWOZ๋ฅผ fixed ontology ๊ฐ์ ์ผ๋ก ๊น๊ณ ๋ค์ด๊ฐ๊ธด ํ๋๋ฐ ์ ์ ์ด ๋ ผ๋ฌธ์ tool 12๊ฐ๋ ๊ณ ์ ์คํค๋ง์ด๊ณ goal๋ ๊ฐ์ ํ๋์ ๊ณ ์ ์ด๋ผ, ์ค์ ๋ก ํผ ๊ฑด ontology๊ฐ ์๋๋ผ DB๊ฐ ์ฐธ์ ๋ณด์ฅํ์ง ์๋๋ค๋ ์ถ ํ๋๋ผ๊ณ ๋ด ๋๋ค. slot filling์ tool calling์ผ๋ก, DST๋ memory๋ก, dialogue policy๋ agent planning์ผ๋ก ์ฐ๊ตฌ๊ฐ ํธ์ฌ๋ ๋๋์ด์ง๋ง.. ๋ง์น ์ฌ๋ฐ๊ฒฌ์ฒ๋ผ ์ธ๊ธ๋๋ ๋ถ๋ถ์ด ์ธ์์ ์ ๋๋ค.