Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents
- Authors: Noam Koren, Roy Bar-Haim, Abigail Goldsteen
- Affiliation: IBM Research
- Paper: https://arxiv.org/abs/2608.06329
- Published: August 6, 2026 (arXiv preprint)
TL; DR
conversational agent๋ ์๋๋ฆฌ์ค + ์ด๊ธฐ DB ์ํ + ์ ๋ต ํ๋์ผ๋ก ์ด๋ฃจ์ด์ง task ๋ฌถ์(๋ฒค์น๋งํฌ)์ ์ค์ ์คํํ์ฌ ํ๊ฐํ๋๋ฐ, ์ ์ ๊ทธ ๋ฒค์น๋งํฌ๊ฐ ์ ๋ง๋ค์ด์ก๋์ง๋ ๊ฒ์ฆ๋์ง ์๋๋ค๋ ๋ฌธ์ ์ง์ .
๋น๊ตํ (human-curated) ์ ๋ต ๋ฒค์น๋งํฌ๋, agent ์คํ๋ ์์ด LLM judge๋ง์ผ๋ก (1) ์๋๋ฆฌ์ค-์ ๋ต ํ๋-policy๊ฐ ์๋ก ๋ชจ์๋์ง ์๋์ง (2) task๊ฐ policy์ ์ถฉ๋ํ๋ ์ด๋ ค์ด ์ํฉ์ ํฌํจํ๋์ง (3) policy ํญ๋ชฉ์ด ๊ณจ๊ณ ๋ฃจ ์ํ๋๋์ง๋ฅผ ์ฌ๋ 4๊ฐ metric ์ ์.
์์ฑ ๋ชจ๋ธ ๋ฅ๋ ฅ ์ฐจ์ด, ํต์ ๋ ํ์ง ์ ํ perturbation, human annotation ์ธ ์ถ์ผ๋ก ์ด metric์ด ์ค์ ํ์ง ์ฐจ์ด๋ฅผ ์ก์๋ธ๋ค๋ ๊ฒ์ ๊ฒ์ฆํจ.

Background
- task-oriented conversational agent (Mohammadi et al., 2025; Yehudai et al., 2026)
- ๊ณ ๊ฐ์ง์, ์ฌํ, enterprise workflow์ ์ด๋ฏธ ๋ฐฐํฌ๋์์ผ๋,
- static QA์ ๋ฌ๋ฆฌ multi-turn์ผ๋ก ์ํธ์์ฉํ๋ฉด์
- domain policy๋ฅผ ์งํค๊ณ + ์ค์ ํ๊ฒฝ์ ์กฐ์ํ๊ณ + tool๊น์ง ์จ์ผ ํ๋ฏ๋ก,
- ์์จ์ฑ์ด ์ปค์ง์๋ก ํ๊ฐ ์์ฒด๊ฐ ๊ฐ์ด ์ด๋ ค์์ง
- ํํ ๋ฒค์น๋งํฌ ๊ตฌ์ถ ๋ฐฉ์์ ์ฌ๋์ด ๋ง๋๋๋ vs. ๊ธฐ๊ณ๊ฐ ๋ง๋๋๋
- manually curated ๊ณ์ด:
- ฯ-BENCH (Yao et al., 2024), ฯยฒ-BENCH (Barres et al., 2025)
- ํ์ค์ ์ธ task์ user request, ํ๊ฒฝ ์ํ, ๊ธฐ๋ ๊ฒฐ๊ณผ๋ฅผ ์ฌ๋์ด ์ง์ ์ค๊ณ
- domain ์ ๋ฌธ์ฑ๋ถํฐ tool/DB ์๋ฎฌ๋ ์ด์ ๊ณผ ๊ธฐ๋ ํ๋ ๋ช ์ธ๊น์ง ์ ๋ถ ์ฌ๋ ์์ ํ์์ผ ํจ โ ๋น์ฉ๋ฌธ์
- ์๋ ์์ฑ ๊ณ์ด:
- API-Bank (Li et al., 2023), ToolLLM (Qin et al., 2024), INTELLAGENT (Levi and Kadar, 2025)
- manual curation์ ๊ฑด๋๋ฐ๋ฉด == ์๋ฌต์ ํ์ง ํต์ ๊น์ง ๊ฐ์ด ๊ฐ๊ณผ
- manually curated ๊ณ์ด:
- ๋ฒค์น๋งํฌ ํ์ง์ ๋ํ ์์ฌ
- synthetic ๋ฒค์น๋งํฌ๋ human-curated ๋ฐ์ดํฐ์ ๋ํ์ฑ, ๋์ด๋, ์ฌ์ง์ด ์ ๋๋๋ model ranking๊น์ง ์ฐจ์ด (Maheshwari et al., 2024)
- 445๊ฐ ๋ฒค์น๋งํฌ๋ฅผ ๊ฒํ ๊ฒฐ๊ณผ ๋๋ฆฌ ์ฐ์ด๋ manual ๋ฒค์น๋งํฌ์๋ construct validity ๋ฌธ์ ๊ฐ ๋ง์ฐ (Bean et al., 2025)
- ๋ณธ ์ฐ๊ตฌ๊ฐ ๊ธฐ๋ฐ์ผ๋ก ์ผ๋ ฯ-bench์กฐ์ฐจ ๊ฒฐํจ ์๊ณ ๋ชจํธํ task๋ฅผ ํฌํจํ๋ค๊ณ ๋ณด๊ณ , ๊ทธ ์์ ํ์ด ๋ค์์ ํ๊ฐ ๋์์ด ๋๋ ฯยณ-bench (Cuadron et al., 2025)
- synthetic ๋ฒค์น๋งํฌ๋ human-curated ๋ฐ์ดํฐ์ ๋ํ์ฑ, ๋์ด๋, ์ฌ์ง์ด ์ ๋๋๋ model ranking๊น์ง ์ฐจ์ด (Maheshwari et al., 2024)
- ๊ณต๋ฐฑ: ๋ฒค์น๋งํฌ๋ฅผ ์ฒด๊ณ์ ์ผ๋ก ํ๊ฐํ๋ ค๋ ์๋๋ ์์ง๋ง conversational agent ๊ด๋ จ์ ์์ง ์ถ๋ฐ์
- Benchmarkยฒ (Qian et al., 2026): MMLU/ARC ๊ฐ์ closed-form ๋ฒค์น๋งํฌ๋ฅผ model ranking ์ผ๊ด์ฑ๊ณผ ๋ชจ๋ธ ๊ฐ ๋ณ๋ณ๋ ฅ์ผ๋ก ํ๊ฐ
- ๋ฒค์น๋งํฌ๋ง๋ค ๋ค์์ LLM์ ์ค์ ๋ก ์คํํด์ผํจ โ open-ended ๋ํ setting์์ ๋น์ฉ๋ฌธ์
- tool-using LLM์ฉ synthetic data ํ์ง์ ๋ณธ ์ฐ๊ตฌ(Iskander et al., 2024): conversational agent ์ค์ ๊ณผ๋ ๊ฒฐ์ด ๋ค๋ฆ
- INTELLAGENT: ์์ ์ ๊ฒ์ฆ์กฐ์ฐจ ฯ-BENCH ์ฑ๋ฅ๊ณผ์ ์๊ด์ผ๋ก ๋์ฒด
- ์ด๋ reference ๋ฒค์น๋งํฌ๊ฐ ์กด์ฌํด์ผ๋ง ์ฑ๋ฆฝํ๋ ๊ฐ์ ์ฆ๊ฑฐ๋ผ๊ณ ์ฃผ์ฅ
- Benchmarkยฒ (Qian et al., 2026): MMLU/ARC ๊ฐ์ closed-form ๋ฒค์น๋งํฌ๋ฅผ model ranking ์ผ๊ด์ฑ๊ณผ ๋ชจ๋ธ ๊ฐ ๋ณ๋ณ๋ ฅ์ผ๋ก ํ๊ฐ
- TL; DR: policy์ ๊ทผ๊ฑฐํด conversational agent ๋ฒค์น๋งํฌ๋ฅผ ํ๊ฐํ๋ ๋ฐฉ๋ฒ์ด ์๊ณ , ๊ทธ๋์ ํ์ง๋์ง ์์ ๊ฒฐํจ์ด agent ๋ฅ๋ ฅ์ ๋ํ ์๋ชป๋ ๊ฒฐ๋ก ์ผ๋ก ์ด์ด์ง ์ ์๋ค๋ ๊ฒ์ด ์ด ๋ ผ๋ฌธ์ด ๊ฒจ๋ฅํ๋ ๊ณต๋ฐฑ
Problem States
๋น๊ต ๋์์ด๋ agent ์คํ๋ ์์ด ๋ฒค์น๋งํฌ ํ์ง์ ์ด ์ ์์ด์ผ ํ๊ณ ์ ์๋ณด๋ค๋ ๋ฌธ์ ์ ์์น ์๋ณ ๊ฐ๋ฅํ๋๋ก
- ์กฐ๊ฑด 1 ) reference-free: ๋น๊ต ๊ธฐ์ค์ด ๋ human-curated ๋ฒค์น๋งํฌ๊ฐ ๋ ์กด์ฌํ์ง๋ ์์
- model ranking ์ผ์น, ํต๊ณ์ ์ ์ฌ๋ == reference๋ฅผ ์ ์ ํ๋ ๋ฐฉ์ โ ์ ์ด์ ์ ์ฉ ๋ถ๊ฐํ ๊ฒฝ์ฐ๊ฐ ๋ค์์ด๋ฏ๋ก
- ์กฐ๊ฑด 2 ) ์คํ ๋น์ฉ ์์ด: ๋ฒค์น๋งํฌ ํ๋ ํ๊ฐํ์๊ณ ์ฌ๋ฌ agent๋ฅผ ๋๋ฆฌ๋ ๋ฑ ๋นํจ์จ ์ง์
- closed-form QA์์๋ ๊ฐ๋ฅ, multi-turn + tool ์ค์ ์์ ๋น์ฉ์ ํ๊ณ
- ์กฐ๊ฑด 3 ) task ๋ด๋ถ ์ ํฉ์ฑ: description โ expected behavior โ policy ์ผ์ ๋ฌด๋ชจ์
- synthetic task๋ ์ด ์ ์ด ํ์ดํ๋ผ์ธ ์์์ ๋ฐ๋ก ์์ฑ โ ๊ตฌ์กฐ์ ์ผ๋ก ์ด๊ธ๋ ์ฌ์ง
- ์กฐ๊ฑด 4 ) policy ๊ธฐ์ค์ ๋์ด๋ + ํฌ๊ด์ฑ
- ์๋๋ฆฌ์ค๊ฐ ๋จ์ํ๋ฉด โ agent ๊ฐ ์ ์ ์ฐจ์ด๊ฐ ์ ์ ๊ฒ์ด๋ฏ๋ก ๋ณ๋ณ ์คํจ
- policy ํญ๋ชฉ ์ผ๋ถ๋ง ๊ฑด๋๋ฆฌ๋ฉด โ ํ๊ฐ ๊ฒฐ๊ณผ ์์ฒด๊ฐ ํธํฅ๋ ์ฐ๋ ค
- ์กฐ๊ฑด 5 ) actionable diagnostic: ์ ์๋ง์ผ๋ก๋ ๋ฒค์น๋งํฌ ๊ฐ๋ฐ์๊ฐ ๊ณ ์น ์ ์์ผ๋ฏ๋ก
- ์ด๋ค task๊ฐ ์ ๋์์ง๊น์ง ๋์์ผ ๊ฐ์ ๋ฃจํ ์ฑ๋ฆฝ ๊ฐ๋ฅ
Suggestions
notation & task ์ ์
- benchmark evaluation: ์ด ๋ฒค์น๋งํฌ๊ฐ ์ ํฉ์ ์ธ๊ฐ + ์ถฉ๋ถํ ์ด๋ ค์ด๊ฐ + policy๋ฅผ ๋ํํ๋๊ฐ
- ๋ฒค์น๋งํฌ == domain policy ๋ฌธ์ 1๊ฐ + ๊ทธ policy๋ฅผ ์ํํ๋ task n๊ฐ
-
policy ๋ฌธ์: ํด๋น domain์์ agent๊ฐ ์ง์ผ์ผ ํ constraint set, domain๋น 1๊ฐ
e.g. Airline policy: โํ์น๊ฐ ์ธ์ ์ ๋ณ๊ฒฝ ๋ถ๊ฐโ, โ์ฌํ์๋ณดํ์ ์ต์ด ์์ฝ ์์๋งโ, โํ๋ถ์ ์๋ ๊ฒฐ์ ์๋จ์ผ๋ก 5~7์์ ์ผ ์ด๋ดโ, โฆ ๋ฑ๋ฑ
- task: ๊ทธ ๊ท์ ์ ์ํํ๋ ๊ฐ๋ณ ์๋๋ฆฌ์ค, Airline 100๊ฐ / Retail 95๊ฐ ๋ฑ
- n๊ฐ task๊ฐ ์ ๋ถ ๋์ผํ policy ๋ฌธ์ 1๊ฐ๋ฅผ ๊ณต์ ํ๊ธฐ ๋๋ฌธ์ ํ์์ metric ๊ตฌ์กฐ ์ฐ๊ฒฐ
- consistency ๋ฅ (2์ข ): task๋ง๋ค ์ฑ์ โ ํ๊ท
- coverage: policy ํญ๋ชฉ ์ค ๋ช ๊ฐ๊ฐ task๋ค์ ์ํด ์ค์ ๋ก ์ํ๋์๋ โ ์ฆ ์กฐํญ๋ง๋ค ๋ชจ๋ task ํ์ด์ ๊ฒํ ํ์
-
- task ๊ตฌ์ฑ
Fig 2- description: user request๋ฅผ ํฌํจํ ์๋๋ฆฌ์ค ์์
- expected behavior: ๊ธฐ๋๋๋ agent ํ๋, policy์ ์ผ๊ด๋์ด์ผ ํจ
- initial database state: ์๋ฎฌ๋ ์ด์ ์์ ์์ ์ DB ์ํ
Consistency: Description-Expected Behavior Alignment ์ค๋ช
์ด ๋ต์๊ณผ ์ผ์นํ๋?
-
judge์๊ฒ description + expected behavior ์ ๊ณต โ ์ ๋ต ํ๋์ด ์๋๋ฆฌ์ค ์์ฒญ์ ์ ๋๋ก ๋ฐ๋์ง ํ์
e.g. description์ โ์์ฝ ์ทจ์ + ํ๋ถ ๋ฌธ์โ์ธ๋ฐ expected behavior์ ์ทจ์ ์ฒ๋ฆฌ๊ฐ ๋น ์ ธ ์์ง๋ ์์์ง
- ๋ฒค์น๋งํฌ ์ ์: task ํ๋๋น 1-10์ โ task ์ ์ฒด ๋์ ํ๊ท
Fig 4 - judge prompt
A.1- consistency: description์ ๋ช ์์ ์ฌ์ค๊ณผ ๋ฌด๋ชจ์
- no invention: description์ ์๋ ๊ตฌ์ฒด ์ฌ์ค์ ์๋ก ์์ฑํ์ง ์์
- ์ด๋ฆ, ๋ ์ง, ๋์, ํญ๊ณตํธ ๋ฒํธ, ๋ฉค๋ฒ์ญ ๋ฑ๊ธ, ๊ฒฐ์ ์๋จ์ ์ง์ ์ด๊ฑฐ โ ํ๋จ ์ฌ์ง๋ฅผ ์ขํ๋ ค๋ ์๋
- coverage: description์ด ํจ์ํ๋ ํต์ฌ ๊ฒฐ๊ณผ๋ฅผ ๋๋ฝํ์ง ์์ (ํ์์ Policy Violations Coverage์๋ ๋ฌด๊ดํ prompt ๋ด๋ถ ๊ธฐ์ค)
- relevance: ์๊ตฌ๋์ง๋ ํจ์๋์ง๋ ์์ ํ๋์ ์ถ๊ฐํ์ง ์์
- metric์ด ๋ฌธ์ฒด ํ๊ฐ๋ก ์์ง ์๋๋ก ๊ธ์ ์ง๊ณผ ํ์ค์ฑ์ ํ๊ฐ ๋์์์ ๋ช ์์ ์ผ๋ก ์ ์ธ์์ผฐ๋ค๊ณ
Consistency: Policy-Expected Behavior Alignment policy๋ฅผ ๋๋ฐ๋ก ์งํค๋?
- judge์๊ฒ policy ๋ฌธ์๊น์ง ์ ๊ณต โ ํด๋น ์๋๋ฆฌ์ค์์ expected behavior์ policy ์ค์ ์ฌ๋ถ ํ์
- ํ์ ๋จ์ act: expected behavior์ ๋ด๊ธด ๊ฐ๋ณ ํ๋ ํ๋ํ๋
-
์ ๋ต ํ๋ 1๊ฐ ์์ act ์ฌ๋ฌ ๊ฐ โ judge๊ฐ act๋ง๋ค policy ํ์ฉ ์ฌ๋ถ๋ฅผ ๋ฐ์ง
e.g. user ID ์๊ตฌ / ์์๋ฃ ์๋ด / API ํธ์ถ๋ก ์์ฝ ์์ / ๋ณด์ ์ ์ / ์ฌ๋ ์๋ด์์๊ฒ ์ด๊ด
-
- ํ์ฉ ํ์ ๊ธฐ์ค
A.2: (a)์ (b) ๋ ์ค ํ๋๋ง ๋ง์กฑํ๋ฉด ํ์ฉ-
(a) policy์ ๋ช ์๋์ด ์์ or (b) policy๊ฐ ์๊ตฌํ๋ ์ํฌํ๋ก์ฐ์ ํ์ฐ์ ํจ์
e.g. policy์ โ์ถ๊ฐ ์ํ๋ฌผ $50โ โ user์๊ฒ โ$50โ์ด๋ผ ๋งํ๋ ๊ฒ์ (b) ๋ณ๋ ๋ช ์ ์์ด๋ ํ์ฉ
-
- ๊ฐ์ ๋์:
- invented act: (a)(b) ์ด๋์๋ ์ ๊ฑธ๋ฆฌ๋ act๊ฐ expected behavior์ ํฌํจ
- missing-required-step: policy๊ฐ ์๊ตฌํ๋ ์ ์ฐจ๊ฐ expected behavior์ ์์ ๋น ์ง
- output:
- score(1-10)
-
reasoning(์งง์ bullet 3-7): ์ ์๋ฅผ ๋งค๊ธด ์ด์
e.g. user๋ ์ทจ์๋ง ์์ฒญํ๋๋ฐ expected behavior๊ฐ ์์ฝ ์์ ์ ๋๊ณ ๊ฒฐ์ ์๋จ์ ๋จผ์ ์๊ตฌ โ policy์ ์๋ invented act
Complexity & Coverage: policy violation ๊ธฐ์ค ๋ง๋ ๋ฒค์น๋งํฌ์ policy ์ ๋ฐ์ด ์ ๋ฐ์๋๋?
-
์ค๊ณ ์ ์ : agent ํ๊ฐ์ ํต์ฌ == policy์ ์ถฉ๋ํ๋ ์์ฒญ์ ์์์ฑ๊ณ ์ฒ๋ฆฌํ๋๊ฐ
e.g. โํ์น๊ฐ ์ ๋ณด๋ ์์ ๊ฐ๋ฅ, ์ธ์ ์๋ ๋ณ๊ฒฝ ๋ถ๊ฐโ policy์์ ๊ธฐ์กด ์์ฝ์ ํ์น๊ฐ ์ ๊ฑฐ๋ฅผ ์๊ตฌํ๋ task
- compliant ์๋๋ฆฌ์ค๊ฐ ์๋๋ผ violation์ ์นด์ดํธํ๋ ์ด์
- policy ํญ๋ชฉ์ด ์๋๋ฆฌ์ค์ ๊ด๋ จ ์๋์ง๋ง ์ธก์ โ ๊ฑฐ์ ๋ชจ๋ task๊ฐ ๋๋ถ๋ถ ํญ๋ชฉ๊ณผ ์ฎ์ โ ์ด๋ค ๋ฒค์น๋งํฌ๋ ๋ง์ ๊ทผ์ฒ์ด๋ฏ๋ก ๋ณ๋ณ ๋ถ๊ฐ
- task๊ฐ ํน์ ํญ๋ชฉ์ ์ค์ ๋ก ์๋ฐํ๋๋ก ์๊ตฌ == ํจ์ฌ ๊ฐํ ์กฐ๊ฑด โ ๋ฒค์น๋งํฌ ๊ฐ ์ฐจ์ด๊ฐ ๋จ๋ ์ ํธ
- compliant ์๋๋ฆฌ์ค๊ฐ ์๋๋ผ violation์ ์นด์ดํธํ๋ ์ด์
- policy ํญ๋ชฉ ๋ชฉ๋ก: policy ๋ฌธ์ ๋ด annotated span
- TOOLGUARD (Zwerdling et al., 2025)๋ก ์ด๊ธฐ span ์์ฑ โ ์ ์ 1์ธ์ด ๊ฒํ ๋ฐ ์์ ํ semi-automatic ๋ฐฉ์
- ๋ฒค์น๋งํฌ ์ ์ ์ถ๋ ฅ: judge๊ฐ description + ์ด๊ธฐ DB ์ํ๋ก ๊ฐ task์ ์๋ฐ ํญ๋ชฉ ์งํฉ์ ์ถ๋ ฅ
- Policy Violations per Task: task ํ๋๊ฐ ํ๊ท ๋ช ๊ฐ ํญ๋ชฉ์ ๊ฑด๋๋ฆฌ๋๊ฐ == complexity
- Policy Violations Coverage: ์ ์ฒด policy ํญ๋ชฉ ์ค ์ต์ $K$๊ฐ task๊ฐ ์๋ฐํ ํญ๋ชฉ์ ๋น์จ == coverage, ์คํ์์ $K=3$
- $N$: policy ํญ๋ชฉ ์, $T(p_k)$: ํญ๋ชฉ $p_k$๋ฅผ ์๋ฐํ๋ task ์งํฉ
- $K$: ์ผ๋ถ task๊ฐ ์ค์น๊ณ ์ง๋๊ฐ ํญ๋ชฉ์ ์ ๋๋ก ์ํ๋ ๊ฒ์ผ๋ก ์น์ง ์๊ฒ ๋ค
- ์๋ฐ ํ์ ์ ์ธ ๊ท์น prompt์ ๋ช
์ == ๋ฌด์์ ์๋ฐ์ผ๋ก ๋ณผ์ง๊ฐ ์ข๊ฒ ํต์
B- user๊ฐ ์๋๋ผ agent ํ๋์ ๊ท์จํ๋ policy๋ ์ ์ธ, ๋จ user๊ฐ ์ฐํ๋ ์๋ฐ์ ์๊ตฌํ๋ฉด ํฌํจ
- ์ธ์ฆ ๋ฐ ์ ๋ณด ์ ๊ณต ์๊ตฌ policy๋ ์ ์ธ, ๋จ ์๋๋ฆฌ์ค๊ฐ ์ ๋ณด ๋ฏธ์ ๊ณต์ด๋ ์ค์ ๊ณต์ ๋ช ์ํ๋ฉด ํฌํจ
- agent๊ฐ ์ฌ๋ฐ๋ฅด๊ฒ ์ฒ๋ฆฌํ๋ค๊ณ ์์ ๋์ด ์์ด๋ ์๋ฐ์ ์๋ฐ์ผ๋ก ์นด์ดํธ
๊ฒ์ฆ ์ฅ์น 1: Benchmark Ordering Score
- ์ ์ : ๊ฐํ ๋ชจ๋ธ์ด ๋ ๋์ ๋ฒค์น๋งํฌ๋ฅผ ์์ฑํจ (Grattafiori et al., 2024; Cui et al., 2024; Bubeck et al., 2023; Kim et al., 2023)
- metric์ด ์ค์ ๋ก ํ์ง ์ฐจ์ด๋ฅผ ์์ดํํ๋์ง ์ฌ๊ธฐ ์ํ meta-metric: ์ด partial order โ 8๊ฐ pairwise ์ ์ฝ ์ ๋ โ ๋ง์กฑํ ์ ์ฝ์ ๋น์จ์ด ์ ์, 1.0์ด๋ฉด ์ ๋ถ ๋ง์กฑ
- absolute scale ๋ฌธ์ ์ฐํํ๊ณ rank๋ฅผ ๋ง์ถ๋๊ฐ๋ง ํ์ธ
- ์์ฑ ๋ชจ๋ธ ๋ฅ๋ ฅ์ ๋ฐ๋ผ 3-tier ๋ถํ
- Top: GPT-5.4, Claude-4.5-Sonnet
- Medium: Llama-3.3-70B, Llama-3.1-8B
- Small: Llama-3.2-1B
๊ฒ์ฆ ์ฅ์น 2: ํต์ ๋ perturbation
- ์์ฑ ๋ชจ๋ธ ๋ณ์ฃผ๋ง์ผ๋ก๋ ํ์ง ์ฐจ์ด์ ํฌ๊ธฐ๋ฅผ ํต์ ํ ์ ์์ผ๋ฏ๋ก ์ฑ๊ฒฉ์ด ๋ฐ๋๋๋ ์ถ ์ถ๊ฐ
- ์์ฑ ๋ชจ๋ธ ๋ณ์ฃผ: ํ์ค์ ์ด๋ ์ฐจ์ด์ ํฌ๊ธฐ๋ ํต์ ๋ถ๊ฐ
- perturbation: ๋นํ์ค์ ์ด๋ ์ฐจ์ด๊ฐ ์ ํํ ํต์ ๋จ
- Expected Behavior Swapping: task์ 20/40/60/80%์์ expected behavior๋ฅผ ์๋ก ๊ตํ
- description โ expected behavior ์ ๋ ฌ๋ง ์ ํ์ ํ๊ดด
- Description-Expected๊ฐ ๋น์จ์ ๋ฐ๋ผ ๋จ์กฐ ํ๋ฝํด์ผ ํจ
- Cross-Domain Policy Swapping: Airline task๋ฅผ Retail policy๋ก, ๊ทธ ๋ฐ๋๋ก ํ๊ฐ
- policy ๊ธฐ๋ฐ 3๊ฐ ์งํ๊ฐ ํฌ๊ฒ ํ๋ฝํด์ผ ํจ
Effects
- Experimental setup
- ๋ฒค์น๋งํฌ ์์ฑ: INTELLAGENT ํ์ดํ๋ผ์ธ
Fig 3- policy๋ฅผ flow๋ก ๋ถํด โ policy graph ๊ตฌ์ถ โ random walk๋ก policy ๋ถ๋ถ์งํฉ ์ํ โ description๊ณผ expected behavior ์์ฑ โ entity ์ธ์คํด์คํ ๋ฐ ์ด๊ธฐ DB ์ํ ๊ตฌ์ฑ
- ๊ธฐ๋ณธ ์ค์ ์ ์ ๋จ๊ณ GPT-4o (edge scoring๋ง
GPT-4o-mini) - ์ ํ๋ ๋จ๊ณ๋ง ๊ต์ฒดํด ํ์ง ์ฐจ์ด ์ ๋
- ๊ธฐ๋ณธ ์ค์ ์ ์ ๋จ๊ณ GPT-4o (edge scoring๋ง
- ์ต์ข
๊ตฌ์ฑ ๋จ๊ณ๋ ์ฝํ ๋ชจ๋ธ์ด ์ฒ๋ฆฌ ๋ถ๊ฐ โ ๋ชจ๋ configuration์์
GPT-4o๊ณ ์ - ์ค์ ์กฐ์ ๋ณ์๋ policy ์ถ์ถ + description/expected behavior ์์ฑ ๋จ๊ณ๋ก ํ์
- generator 5์ข : GPT-5.4, Claude-4.5-Sonnet, Llama-3.3-70B, Llama-3.1-8B, Llama-3.2-1B
- domain 2์ข (ฯ-bench ๊ธฐ๋ฐ): Airline 100 task + Retail 95 task โ ์ด 975 synthetic task
- policy๋ฅผ flow๋ก ๋ถํด โ policy graph ๊ตฌ์ถ โ random walk๋ก policy ๋ถ๋ถ์งํฉ ์ํ โ description๊ณผ expected behavior ์์ฑ โ entity ์ธ์คํด์คํ ๋ฐ ์ด๊ธฐ DB ์ํ ๊ตฌ์ฑ
- judge 3์ข
: GPT-5.4, Claude-4.5-Sonnet, Gemini-2-Flash
- perturbation ์คํ๋ง Gemini-2-Flash ๋จ๋
- human validation: 5๊ฐ generator ์ ์ฒด์์ 50 task ์ํ, ์ ์ 1์ธ์ด LLM judge์ ๋์ผ ๊ธฐ์ค์ผ๋ก ์ฑ์
- ์์ํ ์ ์ + tie ์กด์ฌ โ Kendallโs $\tau_b$, two-sided p-value
- manually curated ์ ์ฉ: ฯยณ-BENCH Airline 50 task, judge๋ Claude-4.5-Sonnet + GPT-5.4
- nl_assertions ํ๋๋ฅผ expected behavior๋ก ๋งคํ
- task๋ณ ๋ ๋ฆฝ DB ์์ด ๊ณต์ DB ์ฌ์ฉ โ violation judge ์ ๋ ฅ์์ ์ด๊ธฐ DB ์ํ ์ ๊ฑฐ
- description๊ณผ DB๊ฐ ๋ฐ๋ก ์์ฑ๋จ โ Description-Expected์์ no invention ๊ธฐ์ค ์ ๊ฑฐ
- Retail์ ๋๋ถ๋ถ task์ expected behavior annotation ๋ถ์ฌ โ ์ ์ธ
- ๋ฒค์น๋งํฌ ์์ฑ: INTELLAGENT ํ์ดํ๋ผ์ธ
- Results
- generator๋ณ ์์
Fig 4Tab 2: 4๊ฐ ์งํ ๋ชจ๋ ๊ฐํ ๋ชจ๋ธ์ ๋ฒค์น๋งํฌ์ ์ผ๊ด๋๊ฒ ๋์ ์ ์- Airline: ๋ชจ๋ ์งํ x ๋ชจ๋ judge์์ ordering score 1.00
- Retail: ํ๊ท 0.92 / ์ ์ฒด ํ๊ท 0.96
- Policy Violations Count: ์ judge + ์ domain ์๋ฒฝ ์์์ ๋ ฌ โ 4๊ฐ ์ค ๊ฐ์ฅ ์์ ์
- judge๋ณ ํ๊ท : GPT-5.4์ Claude-4.5-Sonnet 0.97 vs. Gemini-2-Flash 0.94
- expected behavior swapping
Fig 5: 0 โ 80%๋ก ๊ฐ์๋ก Description-Expected ๋จ์กฐ ํ๋ฝ- ๋ domain + 5๊ฐ generator ์ ๋ถ ๋์ผ ํจํด โ task coherence ์ ํ์ ๋ฏผ๊ฐํจ ์ ์ฆ
- cross-domain policy swapping
Fig 6: policy ๊ธฐ๋ฐ 3๊ฐ ์งํ ๋ชจ๋ ํฐ ํญ ํ๋ฝ- task์ policy์ mismatch๋ฅผ ๊ฐ์งํ๋ค๋ ๊ทผ๊ฑฐ
- human validation
Tab 3: 3 metric x 3 judge == 9๊ฐ ์๊ด ์ ๋ถ positive + ํต๊ณ์ ์ ์- $\tau_b$ 0.32~0.67, p-value 10^-6 ๋ฏธ๋ง ~ 0.011
- ๊ฐํ ์ผ์น: Policy Violations Count 0.55~0.67
- alignment ๊ณ์ด: 0.32~0.55๋ก ์๋์ ์ด์ธ
- judge-human ์ผ์น + ๊ฐํ ๋ชจ๋ธ์ด ๋ ๋์ ๋ฒค์น๋งํฌ๋ฅผ ๋ง๋ ๋ค๋ ์ ์ ๊น์ง ๋ท๋ฐ์นจํ๋ค๊ณ ์ฃผ์ฅ
- qualitative diagnostic
Fig 7/8/9: Policy-Expected ์ ์ ์ task + Gemini rationale์ GPT-5๋ก ํด๋ฌ์คํฐ๋ง โ ์๋ ์ ์ - ๋ฐ๋ณต ์คํจ 5 ์ ํ:
- hallucinated workflow stage ๋๋ ๋ฏธ์ง์ ํ๋
- ํ์ ์ ๋ณด ์์ง ๋๋ฝ
- ์คํ ์ ๋ช ์์ ํ์ธ ๋๋ฝ
- ์๋ชป๋ ๋ณด์ ์ฒ๋ฆฌ
- ๊ธ์ง๋ ํ๋
- ๊ฒฐํจ ์ ํ์ด ๊ตฌ๋ถ๋๊ธฐ์ ์ ์ ํ๊ฐ๋ฅผ ๋์ด์ ์ง๋จ ๋๊ตฌ๋ก ์ฌ์ฉ ๊ฐ๋ฅํ๋ค๊ณ ์ฃผ์ฅ
- ๋ฐ๋ณต ์คํจ 5 ์ ํ:
- generator๋ณ ์์
Personal note. ๊ฐ์ธ์ ์ผ๋ก๋ tau bench ์ฐ๊ตฌ์๋ค์ด ์ง์ ๊ฑด๋๋ ๋ฌธ์ ๋ผ ๊ด์ฌ์ด ๊ฐ์ ์ฝ์๋๋ฐ, ๋ณธ์ธ ์ฐ๊ตฌ ํฌํจ ์ต๊ทผ ๋ฒค์น๋งํฌ ์ฐ๊ตฌ๋ค์ ๋ฉํ๋ ๋ฒจ์์ ์ง์ ํ๋ ค๋ ์ฐ๊ตฌ๋ผ๊ณ ๋ณด์ ๋๋ค. ์์ฌ์ด์ ๋ถํฐ ์ธ๊ธํ๋ฉด LLM judge๊ฐ ๋ณด๋ ์ ๋ ฅ(policy ๋ฌธ์, description, expected behavior)์ด generator๊ฐ ๋ดค๋ ์ ๋ ฅ๊ณผ ์ฌ์ค์ ๋์ผํ๊ณ , ๊ทธ ํ์ง์ ๋ํ ๊ทผ๊ฑฐ๊ฐ ๊ฐํ ๋ชจ๋ธ์ด ๋ ์ข์ ๋ฒค์น๋งํฌ๋ฅผ ๋ง๋ ๋ค๋ ์ปจ๋ฒค์ ์ธ๋ฐ, ๊ทธ ๊ฐ์ ์ ๋ ๋ฆฝ ๊ฒ์ฆ์ ์ ์ ๋ณธ์ธ 1๋ช ์ด ๋งค๊ธด 50๊ฐ taskโฆ?์ธ ๋ถ๋ถ์ด ๋๊ฒ ํฐ ํ๊ณ๋ก ๋๊ปด์ง๊ธฐ๋ ํ๊ณ ์.. ์ข ๋์ ๋๊ฒ ๋ง์์ ๊ฑธ๋ฆฐ ๋ถ๋ถ์ human validation์ด judge-human ์ผ์น๋ฅผ ํ์ธํ๋๋ฐ (์ฌ๊ธฐ๊น์ง๋ ๊ทธ๋ด๋ฏํ๋ฐ) ๊ทธ๊ฑธ ๋ค์ generator-ํ์ง ๊ฐ์ ์ ๊ทผ๊ฑฐ๋ก ๋๋๋ ค ์ฐ๋ ์ํ๋ ผ๋ฆฌ ํ๋ฆ์ด ํ๋นํ๊ฑด์ง ์์ฌ์ค๋ฝ๊ธฐ๋ ํ๊ณ ์โฆ ๋ค๋ง ํ์ํ ์ฐ๊ตฌ์ ์๋ฐ์ ์ ๋ ๊ฒ ๊ฐ์ต๋๋ค. ์ด์จ๋ ํ๋ ์ด๋ฐํ๊ธฐ๋ก๋ LLM์ด ๋ฌธ์ ๋ฅผ ํ์ด๋์ ๋ค์ ํ๊ฐํด์ผ๋๋ ๋ฌธ์ ๋ฅผ ํผํ๊ณ ์ ์ค์ ๋ฒค์น๋งํฌ๋ฅผ executeํ์ง๋ ์๋๋ค๋๊ฑธ ์ ๋งํฌ์ธํธ๋ก ์ก๊ธด ํ๋๋ฐ ๊ทธ๋ผ์๋ ๋ถ๊ตฌํ๊ณ ์ด์จ๋ ๋ฒค์น๋งํฌ์ ์กด์ฌ ์ด์ ๊ฐ agent ๋ณ๋ณํด๋ณด๊ฒ ๋ค๋ผ๋ฉด ์ค์ ์ด ํ๋ ์์ํฌ ์์์ ์ ์ ๋์ ๋ฒค์น๋งํฌ๊ฐ ์ค์ ๋ก agent๋ฅผ ๋ ์ ๋ณ๋ณํ๋์ง๋ ํ๋ฒ์ ์ฌ๋ดค์ด์ผํ์ง ์๋? ์ถ๊ธด ํฉ๋๋ค. ๊ทธ๋๋ ์๊ฐํด๋ณด๊ณ ์ถ์๋ ์ด์ ๋ ๊ทธ๋ฅ ๊ด๋ จ์๋๋ฅผ ๋ฌผ์ด๋ณด๋ฉด ๋น์ฐ ๊ด๋ จ์๋ค๊ณ ๋๋ตํ ํ ๋, ๋์ ์ ์ฝ์ ์๋ฐํ๋์ง๋ก ์นด์ดํ ํ๊ฒ ํ ์ ์ ๋๋ํ๋ ๊ฒ ๊ฐ์ต๋๋ค. ๋ญ๊ฐ ๋ฆฌ์๋ ๋ชจ๋ธ๋ง ํ ๋ ์จ๋ด์ง ํ ๊ฒ๋ ๊ฐ๊ณ ..