9 minute read

Meta info.
  • Authors: Noam Koren, Roy Bar-Haim, Abigail Goldsteen
  • Affiliation: IBM Research
  • Paper: https://arxiv.org/abs/2608.06329
  • Published: August 6, 2026 (arXiv preprint)

TL; DR

conversational agent๋Š” ์‹œ๋‚˜๋ฆฌ์˜ค + ์ดˆ๊ธฐ DB ์ƒํƒœ + ์ •๋‹ต ํ–‰๋™์œผ๋กœ ์ด๋ฃจ์–ด์ง„ task ๋ฌถ์Œ(๋ฒค์น˜๋งˆํฌ)์„ ์‹ค์ œ ์‹คํ–‰ํ•˜์—ฌ ํ‰๊ฐ€ํ•˜๋Š”๋ฐ, ์ •์ž‘ ๊ทธ ๋ฒค์น˜๋งˆํฌ๊ฐ€ ์ž˜ ๋งŒ๋“ค์–ด์กŒ๋Š”์ง€๋Š” ๊ฒ€์ฆ๋˜์ง€ ์•Š๋Š”๋‹ค๋Š” ๋ฌธ์ œ ์ง€์ .
๋น„๊ตํ•  (human-curated) ์ •๋‹ต ๋ฒค์น˜๋งˆํฌ๋„, agent ์‹คํ–‰๋„ ์—†์ด LLM judge๋งŒ์œผ๋กœ (1) ์‹œ๋‚˜๋ฆฌ์˜ค-์ •๋‹ต ํ–‰๋™-policy๊ฐ€ ์„œ๋กœ ๋ชจ์ˆœ๋˜์ง€ ์•Š๋Š”์ง€ (2) task๊ฐ€ policy์™€ ์ถฉ๋Œํ•˜๋Š” ์–ด๋ ค์šด ์ƒํ™ฉ์„ ํฌํ•จํ•˜๋Š”์ง€ (3) policy ํ•ญ๋ชฉ์ด ๊ณจ๊ณ ๋ฃจ ์‹œํ—˜๋˜๋Š”์ง€๋ฅผ ์žฌ๋Š” 4๊ฐœ metric ์ œ์•ˆ.
์ƒ์„ฑ ๋ชจ๋ธ ๋Šฅ๋ ฅ ์ฐจ์ด, ํ†ต์ œ๋œ ํ’ˆ์งˆ ์ €ํ•˜ perturbation, human annotation ์„ธ ์ถ•์œผ๋กœ ์ด metric์ด ์‹ค์ œ ํ’ˆ์งˆ ์ฐจ์ด๋ฅผ ์žก์•„๋‚ธ๋‹ค๋Š” ๊ฒƒ์„ ๊ฒ€์ฆํ•จ.

Slide Benchmarking the Benchmarks figure 0 Benchmarking the Benchmarks figure 1 Benchmarking the Benchmarks figure 2 Benchmarking the Benchmarks figure 3 Benchmarking the Benchmarks figure 4 Benchmarking the Benchmarks figure 5 Benchmarking the Benchmarks figure 6

Background

  • task-oriented conversational agent (Mohammadi et al., 2025; Yehudai et al., 2026)
    • ๊ณ ๊ฐ์ง€์›, ์—ฌํ–‰, enterprise workflow์— ์ด๋ฏธ ๋ฐฐํฌ๋˜์—ˆ์œผ๋‚˜,
    • static QA์™€ ๋‹ฌ๋ฆฌ multi-turn์œผ๋กœ ์ƒํ˜ธ์ž‘์šฉํ•˜๋ฉด์„œ
    • domain policy๋ฅผ ์ง€ํ‚ค๊ณ  + ์‹ค์ œ ํ™˜๊ฒฝ์„ ์กฐ์ž‘ํ•˜๊ณ  + tool๊นŒ์ง€ ์จ์•ผ ํ•˜๋ฏ€๋กœ,
    • ์ž์œจ์„ฑ์ด ์ปค์งˆ์ˆ˜๋ก ํ‰๊ฐ€ ์ž์ฒด๊ฐ€ ๊ฐ™์ด ์–ด๋ ค์›Œ์ง
  • ํ˜„ํ–‰ ๋ฒค์น˜๋งˆํฌ ๊ตฌ์ถ• ๋ฐฉ์‹์€ ์‚ฌ๋žŒ์ด ๋งŒ๋“œ๋А๋ƒ vs. ๊ธฐ๊ณ„๊ฐ€ ๋งŒ๋“œ๋А๋ƒ
    • manually curated ๊ณ„์—ด:
      • ฯ„-BENCH (Yao et al., 2024), ฯ„ยฒ-BENCH (Barres et al., 2025)
      • ํ˜„์‹ค์ ์ธ task์™€ user request, ํ™˜๊ฒฝ ์ƒํƒœ, ๊ธฐ๋Œ€ ๊ฒฐ๊ณผ๋ฅผ ์‚ฌ๋žŒ์ด ์ง์ ‘ ์„ค๊ณ„
      • domain ์ „๋ฌธ์„ฑ๋ถ€ํ„ฐ tool/DB ์‹œ๋ฎฌ๋ ˆ์ด์…˜๊ณผ ๊ธฐ๋Œ€ ํ–‰๋™ ๋ช…์„ธ๊นŒ์ง€ ์ „๋ถ€ ์‚ฌ๋žŒ ์†์„ ํƒœ์›Œ์•ผ ํ•จ โ†’ ๋น„์šฉ๋ฌธ์ œ
    • ์ž๋™ ์ƒ์„ฑ ๊ณ„์—ด:
      • API-Bank (Li et al., 2023), ToolLLM (Qin et al., 2024), INTELLAGENT (Levi and Kadar, 2025)
      • manual curation์„ ๊ฑด๋„ˆ๋›ฐ๋ฉด == ์•”๋ฌต์  ํ’ˆ์งˆ ํ†ต์ œ๊นŒ์ง€ ๊ฐ™์ด ๊ฐ„๊ณผ
  • ๋ฒค์น˜๋งˆํฌ ํ’ˆ์งˆ์— ๋Œ€ํ•œ ์˜์‹ฌ
    • synthetic ๋ฒค์น˜๋งˆํฌ๋Š” human-curated ๋ฐ์ดํ„ฐ์™€ ๋Œ€ํ‘œ์„ฑ, ๋‚œ์ด๋„, ์‹ฌ์ง€์–ด ์œ ๋„๋˜๋Š” model ranking๊นŒ์ง€ ์ฐจ์ด (Maheshwari et al., 2024)
      • 445๊ฐœ ๋ฒค์น˜๋งˆํฌ๋ฅผ ๊ฒ€ํ†  ๊ฒฐ๊ณผ ๋„๋ฆฌ ์“ฐ์ด๋Š” manual ๋ฒค์น˜๋งˆํฌ์—๋„ construct validity ๋ฌธ์ œ๊ฐ€ ๋งŒ์—ฐ (Bean et al., 2025)
    • ๋ณธ ์—ฐ๊ตฌ๊ฐ€ ๊ธฐ๋ฐ˜์œผ๋กœ ์‚ผ๋Š” ฯ„-bench์กฐ์ฐจ ๊ฒฐํ•จ ์žˆ๊ณ  ๋ชจํ˜ธํ•œ task๋ฅผ ํฌํ•จํ•œ๋‹ค๊ณ  ๋ณด๊ณ , ๊ทธ ์ˆ˜์ •ํŒ์ด ๋’ค์—์„œ ํ‰๊ฐ€ ๋Œ€์ƒ์ด ๋˜๋Š” ฯ„ยณ-bench (Cuadron et al., 2025)
  • ๊ณต๋ฐฑ: ๋ฒค์น˜๋งˆํฌ๋ฅผ ์ฒด๊ณ„์ ์œผ๋กœ ํ‰๊ฐ€ํ•˜๋ ค๋Š” ์‹œ๋„๋Š” ์žˆ์ง€๋งŒ conversational agent ๊ด€๋ จ์€ ์•„์ง ์ถœ๋ฐœ์ 
    • Benchmarkยฒ (Qian et al., 2026): MMLU/ARC ๊ฐ™์€ closed-form ๋ฒค์น˜๋งˆํฌ๋ฅผ model ranking ์ผ๊ด€์„ฑ๊ณผ ๋ชจ๋ธ ๊ฐ„ ๋ณ€๋ณ„๋ ฅ์œผ๋กœ ํ‰๊ฐ€
      • ๋ฒค์น˜๋งˆํฌ๋งˆ๋‹ค ๋‹ค์ˆ˜์˜ LLM์„ ์‹ค์ œ๋กœ ์‹คํ–‰ํ•ด์•ผํ•จ โ†’ open-ended ๋Œ€ํ™” setting์—์„œ ๋น„์šฉ๋ฌธ์ œ
    • tool-using LLM์šฉ synthetic data ํ’ˆ์งˆ์„ ๋ณธ ์—ฐ๊ตฌ(Iskander et al., 2024): conversational agent ์„ค์ •๊ณผ๋Š” ๊ฒฐ์ด ๋‹ค๋ฆ„
    • INTELLAGENT: ์ž์‹ ์˜ ๊ฒ€์ฆ์กฐ์ฐจ ฯ„-BENCH ์„ฑ๋Šฅ๊ณผ์˜ ์ƒ๊ด€์œผ๋กœ ๋Œ€์ฒด
      • ์ด๋Š” reference ๋ฒค์น˜๋งˆํฌ๊ฐ€ ์กด์žฌํ•ด์•ผ๋งŒ ์„ฑ๋ฆฝํ•˜๋Š” ๊ฐ„์ ‘ ์ฆ๊ฑฐ๋ผ๊ณ  ์ฃผ์žฅ
  • TL; DR: policy์— ๊ทผ๊ฑฐํ•ด conversational agent ๋ฒค์น˜๋งˆํฌ๋ฅผ ํ‰๊ฐ€ํ•˜๋Š” ๋ฐฉ๋ฒ•์ด ์—†๊ณ , ๊ทธ๋ž˜์„œ ํƒ์ง€๋˜์ง€ ์•Š์€ ๊ฒฐํ•จ์ด agent ๋Šฅ๋ ฅ์— ๋Œ€ํ•œ ์ž˜๋ชป๋œ ๊ฒฐ๋ก ์œผ๋กœ ์ด์–ด์งˆ ์ˆ˜ ์žˆ๋‹ค๋Š” ๊ฒƒ์ด ์ด ๋…ผ๋ฌธ์ด ๊ฒจ๋ƒฅํ•˜๋Š” ๊ณต๋ฐฑ

Problem States

๋น„๊ต ๋Œ€์ƒ์ด๋‚˜ agent ์‹คํ–‰๋„ ์—†์ด ๋ฒค์น˜๋งˆํฌ ํ’ˆ์งˆ์„ ์žด ์ˆ˜ ์žˆ์–ด์•ผ ํ•˜๊ณ  ์ ์ˆ˜๋ณด๋‹ค๋Š” ๋ฌธ์ œ์˜ ์œ„์น˜ ์‹๋ณ„ ๊ฐ€๋Šฅํ•˜๋„๋ก

  • ์กฐ๊ฑด 1 ) reference-free: ๋น„๊ต ๊ธฐ์ค€์ด ๋  human-curated ๋ฒค์น˜๋งˆํฌ๊ฐ€ ๋Š˜ ์กด์žฌํ•˜์ง€๋Š” ์•Š์Œ
    • model ranking ์ผ์น˜, ํ†ต๊ณ„์  ์œ ์‚ฌ๋„ == reference๋ฅผ ์ „์ œํ•˜๋Š” ๋ฐฉ์‹ โ†’ ์• ์ดˆ์— ์ ์šฉ ๋ถˆ๊ฐ€ํ•œ ๊ฒฝ์šฐ๊ฐ€ ๋‹ค์ˆ˜์ด๋ฏ€๋กœ
  • ์กฐ๊ฑด 2 ) ์‹คํ–‰ ๋น„์šฉ ์—†์ด: ๋ฒค์น˜๋งˆํฌ ํ•˜๋‚˜ ํ‰๊ฐ€ํ•˜์ž๊ณ  ์—ฌ๋Ÿฌ agent๋ฅผ ๋Œ๋ฆฌ๋Š” ๋“ฑ ๋น„ํšจ์œจ ์ง€์–‘
    • closed-form QA์—์„œ๋Š” ๊ฐ€๋Šฅ, multi-turn + tool ์„ค์ •์—์„œ ๋น„์šฉ์  ํ•œ๊ณ„
  • ์กฐ๊ฑด 3 ) task ๋‚ด๋ถ€ ์ •ํ•ฉ์„ฑ: description โ†” expected behavior โ†” policy ์‚ผ์ž ๋ฌด๋ชจ์ˆœ
    • synthetic task๋Š” ์ด ์…‹์ด ํŒŒ์ดํ”„๋ผ์ธ ์•ˆ์—์„œ ๋”ฐ๋กœ ์ƒ์„ฑ โ†’ ๊ตฌ์กฐ์ ์œผ๋กœ ์–ด๊ธ‹๋‚  ์—ฌ์ง€
  • ์กฐ๊ฑด 4 ) policy ๊ธฐ์ค€์˜ ๋‚œ์ด๋„ + ํฌ๊ด„์„ฑ
    • ์‹œ๋‚˜๋ฆฌ์˜ค๊ฐ€ ๋‹จ์ˆœํ•˜๋ฉด โ†’ agent ๊ฐ„ ์ ์ˆ˜ ์ฐจ์ด๊ฐ€ ์ ์„ ๊ฒƒ์ด๋ฏ€๋กœ ๋ณ€๋ณ„ ์‹คํŒจ
    • policy ํ•ญ๋ชฉ ์ผ๋ถ€๋งŒ ๊ฑด๋“œ๋ฆฌ๋ฉด โ†’ ํ‰๊ฐ€ ๊ฒฐ๊ณผ ์ž์ฒด๊ฐ€ ํŽธํ–ฅ๋  ์šฐ๋ ค
  • ์กฐ๊ฑด 5 ) actionable diagnostic: ์ ์ˆ˜๋งŒ์œผ๋กœ๋Š” ๋ฒค์น˜๋งˆํฌ ๊ฐœ๋ฐœ์ž๊ฐ€ ๊ณ ์น  ์ˆ˜ ์—†์œผ๋ฏ€๋กœ
    • ์–ด๋–ค task๊ฐ€ ์™œ ๋‚˜์œ์ง€๊นŒ์ง€ ๋‚˜์™€์•ผ ๊ฐœ์„  ๋ฃจํ”„ ์„ฑ๋ฆฝ ๊ฐ€๋Šฅ

Suggestions

notation & task ์ •์˜

  • benchmark evaluation: ์ด ๋ฒค์น˜๋งˆํฌ๊ฐ€ ์ •ํ•ฉ์ ์ธ๊ฐ€ + ์ถฉ๋ถ„ํžˆ ์–ด๋ ค์šด๊ฐ€ + policy๋ฅผ ๋Œ€ํ‘œํ•˜๋Š”๊ฐ€
  • ๋ฒค์น˜๋งˆํฌ == domain policy ๋ฌธ์„œ 1๊ฐœ + ๊ทธ policy๋ฅผ ์‹œํ—˜ํ•˜๋Š” task n๊ฐœ
    • policy ๋ฌธ์„œ: ํ•ด๋‹น domain์—์„œ agent๊ฐ€ ์ง€์ผœ์•ผ ํ•  constraint set, domain๋‹น 1๊ฐœ

      e.g. Airline policy: โ€œํƒ‘์Šน๊ฐ ์ธ์› ์ˆ˜ ๋ณ€๊ฒฝ ๋ถˆ๊ฐ€โ€, โ€œ์—ฌํ–‰์ž๋ณดํ—˜์€ ์ตœ์ดˆ ์˜ˆ์•ฝ ์‹œ์—๋งŒโ€, โ€œํ™˜๋ถˆ์€ ์›๋ž˜ ๊ฒฐ์ œ์ˆ˜๋‹จ์œผ๋กœ 5~7์˜์—…์ผ ์ด๋‚ดโ€, โ€ฆ ๋“ฑ๋“ฑ

    • task: ๊ทธ ๊ทœ์ •์„ ์‹œํ—˜ํ•˜๋Š” ๊ฐœ๋ณ„ ์‹œ๋‚˜๋ฆฌ์˜ค, Airline 100๊ฐœ / Retail 95๊ฐœ ๋“ฑ
    • n๊ฐœ task๊ฐ€ ์ „๋ถ€ ๋™์ผํ•œ policy ๋ฌธ์„œ 1๊ฐœ๋ฅผ ๊ณต์œ ํ•˜๊ธฐ ๋•Œ๋ฌธ์— ํ›„์†์˜ metric ๊ตฌ์กฐ ์—ฐ๊ฒฐ
      • consistency ๋ฅ˜ (2์ข…): task๋งˆ๋‹ค ์ฑ„์  โ†’ ํ‰๊ท 
      • coverage: policy ํ•ญ๋ชฉ ์ค‘ ๋ช‡ ๊ฐœ๊ฐ€ task๋“ค์— ์˜ํ•ด ์‹ค์ œ๋กœ ์‹œํ—˜๋˜์—ˆ๋‚˜ โ†’ ์ฆ‰ ์กฐํ•ญ๋งˆ๋‹ค ๋ชจ๋“  task ํ›‘์–ด์„œ ๊ฒ€ํ†  ํ•„์š”
  • task ๊ตฌ์„ฑ Fig 2
    • description: user request๋ฅผ ํฌํ•จํ•œ ์‹œ๋‚˜๋ฆฌ์˜ค ์„œ์ˆ 
    • expected behavior: ๊ธฐ๋Œ€๋˜๋Š” agent ํ–‰๋™, policy์™€ ์ผ๊ด€๋˜์–ด์•ผ ํ•จ
    • initial database state: ์‹œ๋ฎฌ๋ ˆ์ด์…˜ ์‹œ์ž‘ ์‹œ์ ์˜ DB ์ƒํƒœ

Consistency: Description-Expected Behavior Alignment ์„ค๋ช…์ด ๋‹ต์•ˆ๊ณผ ์ผ์น˜ํ•˜๋‚˜?

  • judge์—๊ฒŒ description + expected behavior ์ œ๊ณต โ†’ ์ •๋‹ต ํ–‰๋™์ด ์‹œ๋‚˜๋ฆฌ์˜ค ์š”์ฒญ์„ ์ œ๋Œ€๋กœ ๋ฐ›๋Š”์ง€ ํŒ์ •

    e.g. description์€ โ€œ์˜ˆ์•ฝ ์ทจ์†Œ + ํ™˜๋ถˆ ๋ฌธ์˜โ€์ธ๋ฐ expected behavior์— ์ทจ์†Œ ์ฒ˜๋ฆฌ๊ฐ€ ๋น ์ ธ ์žˆ์ง€๋Š” ์•Š์€์ง€

  • ๋ฒค์น˜๋งˆํฌ ์ ์ˆ˜: task ํ•˜๋‚˜๋‹น 1-10์  โ†’ task ์ „์ฒด ๋Œ€์ƒ ํ‰๊ท  Fig 4
  • judge prompt A.1
    • consistency: description์˜ ๋ช…์‹œ์  ์‚ฌ์‹ค๊ณผ ๋ฌด๋ชจ์ˆœ
    • no invention: description์— ์—†๋Š” ๊ตฌ์ฒด ์‚ฌ์‹ค์„ ์ƒˆ๋กœ ์ƒ์„ฑํ•˜์ง€ ์•Š์Œ
      • ์ด๋ฆ„, ๋‚ ์งœ, ๋„์‹œ, ํ•ญ๊ณตํŽธ ๋ฒˆํ˜ธ, ๋ฉค๋ฒ„์‹ญ ๋“ฑ๊ธ‰, ๊ฒฐ์ œ์ˆ˜๋‹จ์„ ์ง์ ‘ ์—ด๊ฑฐ โ†’ ํŒ๋‹จ ์—ฌ์ง€๋ฅผ ์ขํžˆ๋ ค๋Š” ์‹œ๋„
    • coverage: description์ด ํ•จ์˜ํ•˜๋Š” ํ•ต์‹ฌ ๊ฒฐ๊ณผ๋ฅผ ๋ˆ„๋ฝํ•˜์ง€ ์•Š์Œ (ํ›„์†์˜ Policy Violations Coverage์™€๋Š” ๋ฌด๊ด€ํ•œ prompt ๋‚ด๋ถ€ ๊ธฐ์ค€)
    • relevance: ์š”๊ตฌ๋˜์ง€๋„ ํ•จ์˜๋˜์ง€๋„ ์•Š์€ ํ–‰๋™์„ ์ถ”๊ฐ€ํ•˜์ง€ ์•Š์Œ
    • metric์ด ๋ฌธ์ฒด ํ‰๊ฐ€๋กœ ์ƒˆ์ง€ ์•Š๋„๋ก ๊ธ€์˜ ์งˆ๊ณผ ํ˜„์‹ค์„ฑ์€ ํ‰๊ฐ€ ๋Œ€์ƒ์—์„œ ๋ช…์‹œ์ ์œผ๋กœ ์ œ์™ธ์‹œ์ผฐ๋‹ค๊ณ 

Consistency: Policy-Expected Behavior Alignment policy๋ฅผ ๋˜‘๋ฐ”๋กœ ์ง€ํ‚ค๋‚˜?

  • judge์—๊ฒŒ policy ๋ฌธ์„œ๊นŒ์ง€ ์ œ๊ณต โ†’ ํ•ด๋‹น ์‹œ๋‚˜๋ฆฌ์˜ค์—์„œ expected behavior์˜ policy ์ค€์ˆ˜ ์—ฌ๋ถ€ ํŒ์ •
  • ํŒ์ • ๋‹จ์œ„ act: expected behavior์— ๋‹ด๊ธด ๊ฐœ๋ณ„ ํ–‰๋™ ํ•˜๋‚˜ํ•˜๋‚˜
    • ์ •๋‹ต ํ–‰๋™ 1๊ฐœ ์•ˆ์— act ์—ฌ๋Ÿฌ ๊ฐœ โ†’ judge๊ฐ€ act๋งˆ๋‹ค policy ํ—ˆ์šฉ ์—ฌ๋ถ€๋ฅผ ๋”ฐ์ง

      e.g. user ID ์š”๊ตฌ / ์ˆ˜์ˆ˜๋ฃŒ ์•ˆ๋‚ด / API ํ˜ธ์ถœ๋กœ ์˜ˆ์•ฝ ์ˆ˜์ • / ๋ณด์ƒ ์ œ์•ˆ / ์‚ฌ๋žŒ ์ƒ๋‹ด์›์—๊ฒŒ ์ด๊ด€

  • ํ—ˆ์šฉ ํŒ์ • ๊ธฐ์ค€ A.2 : (a)์™€ (b) ๋‘˜ ์ค‘ ํ•˜๋‚˜๋งŒ ๋งŒ์กฑํ•˜๋ฉด ํ—ˆ์šฉ
    • (a) policy์— ๋ช…์‹œ๋˜์–ด ์žˆ์Œ or (b) policy๊ฐ€ ์š”๊ตฌํ•˜๋Š” ์›Œํฌํ”Œ๋กœ์šฐ์˜ ํ•„์—ฐ์  ํ•จ์˜

      e.g. policy์— โ€œ์ถ”๊ฐ€ ์ˆ˜ํ•˜๋ฌผ $50โ€ โ†’ user์—๊ฒŒ โ€œ$50โ€์ด๋ผ ๋งํ•˜๋Š” ๊ฒƒ์€ (b) ๋ณ„๋„ ๋ช…์‹œ ์—†์ด๋„ ํ—ˆ์šฉ

  • ๊ฐ์  ๋Œ€์ƒ:
    • invented act: (a)(b) ์–ด๋””์—๋„ ์•ˆ ๊ฑธ๋ฆฌ๋Š” act๊ฐ€ expected behavior์— ํฌํ•จ
    • missing-required-step: policy๊ฐ€ ์š”๊ตฌํ•˜๋Š” ์ ˆ์ฐจ๊ฐ€ expected behavior์— ์•„์˜ˆ ๋น ์ง
  • output:
    • score(1-10)
    • reasoning(์งง์€ bullet 3-7): ์ ์ˆ˜๋ฅผ ๋งค๊ธด ์ด์œ 

      e.g. user๋Š” ์ทจ์†Œ๋งŒ ์š”์ฒญํ–ˆ๋Š”๋ฐ expected behavior๊ฐ€ ์˜ˆ์•ฝ ์ˆ˜์ •์„ ๋•๊ณ  ๊ฒฐ์ œ์ˆ˜๋‹จ์„ ๋จผ์ € ์š”๊ตฌ โ†’ policy์— ์—†๋Š” invented act

Complexity & Coverage: policy violation ๊ธฐ์ค€ ๋งŒ๋“  ๋ฒค์น˜๋งˆํฌ์— policy ์ „๋ฐ˜์ด ์ž˜ ๋ฐ˜์˜๋๋‚˜?

  • ์„ค๊ณ„ ์ „์ œ: agent ํ‰๊ฐ€์˜ ํ•ต์‹ฌ == policy์™€ ์ถฉ๋Œํ•˜๋Š” ์š”์ฒญ์„ ์•Œ์•„์ฑ„๊ณ  ์ฒ˜๋ฆฌํ•˜๋Š”๊ฐ€

    e.g. โ€œํƒ‘์Šน๊ฐ ์ •๋ณด๋Š” ์ˆ˜์ • ๊ฐ€๋Šฅ, ์ธ์› ์ˆ˜๋Š” ๋ณ€๊ฒฝ ๋ถˆ๊ฐ€โ€ policy์—์„œ ๊ธฐ์กด ์˜ˆ์•ฝ์˜ ํƒ‘์Šน๊ฐ ์ œ๊ฑฐ๋ฅผ ์š”๊ตฌํ•˜๋Š” task

    • compliant ์‹œ๋‚˜๋ฆฌ์˜ค๊ฐ€ ์•„๋‹ˆ๋ผ violation์„ ์นด์šดํŠธํ•˜๋Š” ์ด์œ 
      • policy ํ•ญ๋ชฉ์ด ์‹œ๋‚˜๋ฆฌ์˜ค์™€ ๊ด€๋ จ ์žˆ๋Š”์ง€๋งŒ ์ธก์ • โ†’ ๊ฑฐ์˜ ๋ชจ๋“  task๊ฐ€ ๋Œ€๋ถ€๋ถ„ ํ•ญ๋ชฉ๊ณผ ์—ฎ์ž„ โ†’ ์–ด๋–ค ๋ฒค์น˜๋งˆํฌ๋“  ๋งŒ์  ๊ทผ์ฒ˜์ด๋ฏ€๋กœ ๋ณ€๋ณ„ ๋ถˆ๊ฐ€
      • task๊ฐ€ ํŠน์ • ํ•ญ๋ชฉ์„ ์‹ค์ œ๋กœ ์œ„๋ฐ˜ํ•˜๋„๋ก ์š”๊ตฌ == ํ›จ์”ฌ ๊ฐ•ํ•œ ์กฐ๊ฑด โ†’ ๋ฒค์น˜๋งˆํฌ ๊ฐ„ ์ฐจ์ด๊ฐ€ ๋‚จ๋Š” ์‹ ํ˜ธ
  • policy ํ•ญ๋ชฉ ๋ชฉ๋ก: policy ๋ฌธ์„œ ๋‚ด annotated span
    • TOOLGUARD (Zwerdling et al., 2025)๋กœ ์ดˆ๊ธฐ span ์ƒ์„ฑ โ†’ ์ €์ž 1์ธ์ด ๊ฒ€ํ†  ๋ฐ ์ˆ˜์ •ํ•œ semi-automatic ๋ฐฉ์‹
  • ๋ฒค์น˜๋งˆํฌ ์ ์ˆ˜ ์ถœ๋ ฅ: judge๊ฐ€ description + ์ดˆ๊ธฐ DB ์ƒํƒœ๋กœ ๊ฐ task์˜ ์œ„๋ฐ˜ ํ•ญ๋ชฉ ์ง‘ํ•ฉ์„ ์ถœ๋ ฅ
\[S_{\text{v\_cov}}(B) = \frac{1}{N}\big|\lbrace k : |T(p_k)| \ge K \rbrace\big|, \qquad T(p_k) = \lbrace t : k \in V(t)\rbrace\]
  • Policy Violations per Task: task ํ•˜๋‚˜๊ฐ€ ํ‰๊ท  ๋ช‡ ๊ฐœ ํ•ญ๋ชฉ์„ ๊ฑด๋“œ๋ฆฌ๋Š”๊ฐ€ == complexity
  • Policy Violations Coverage: ์ „์ฒด policy ํ•ญ๋ชฉ ์ค‘ ์ตœ์†Œ $K$๊ฐœ task๊ฐ€ ์œ„๋ฐ˜ํ•œ ํ•ญ๋ชฉ์˜ ๋น„์œจ == coverage, ์‹คํ—˜์—์„œ $K=3$
  • $N$: policy ํ•ญ๋ชฉ ์ˆ˜, $T(p_k)$: ํ•ญ๋ชฉ $p_k$๋ฅผ ์œ„๋ฐ˜ํ•˜๋Š” task ์ง‘ํ•ฉ
  • $K$: ์ผ๋ถ€ task๊ฐ€ ์Šค์น˜๊ณ  ์ง€๋‚˜๊ฐ„ ํ•ญ๋ชฉ์€ ์ œ๋Œ€๋กœ ์‹œํ—˜๋œ ๊ฒƒ์œผ๋กœ ์น˜์ง€ ์•Š๊ฒ ๋‹ค
  • ์œ„๋ฐ˜ ํŒ์ • ์ œ์™ธ ๊ทœ์น™ prompt์— ๋ช…์‹œ == ๋ฌด์—‡์„ ์œ„๋ฐ˜์œผ๋กœ ๋ณผ์ง€๊ฐ€ ์ข๊ฒŒ ํ†ต์ œ B
    • user๊ฐ€ ์•„๋‹ˆ๋ผ agent ํ–‰๋™์„ ๊ทœ์œจํ•˜๋Š” policy๋Š” ์ œ์™ธ, ๋‹จ user๊ฐ€ ์šฐํšŒ๋‚˜ ์œ„๋ฐ˜์„ ์š”๊ตฌํ•˜๋ฉด ํฌํ•จ
    • ์ธ์ฆ ๋ฐ ์ •๋ณด ์ œ๊ณต ์š”๊ตฌ policy๋„ ์ œ์™ธ, ๋‹จ ์‹œ๋‚˜๋ฆฌ์˜ค๊ฐ€ ์ •๋ณด ๋ฏธ์ œ๊ณต์ด๋‚˜ ์˜ค์ œ๊ณต์„ ๋ช…์‹œํ•˜๋ฉด ํฌํ•จ
    • agent๊ฐ€ ์˜ฌ๋ฐ”๋ฅด๊ฒŒ ์ฒ˜๋ฆฌํ–ˆ๋‹ค๊ณ  ์„œ์ˆ ๋˜์–ด ์žˆ์–ด๋„ ์œ„๋ฐ˜์€ ์œ„๋ฐ˜์œผ๋กœ ์นด์šดํŠธ

๊ฒ€์ฆ ์žฅ์น˜ 1: Benchmark Ordering Score

  • ์ „์ œ: ๊ฐ•ํ•œ ๋ชจ๋ธ์ด ๋” ๋‚˜์€ ๋ฒค์น˜๋งˆํฌ๋ฅผ ์ƒ์„ฑํ•จ (Grattafiori et al., 2024; Cui et al., 2024; Bubeck et al., 2023; Kim et al., 2023)
  • metric์ด ์‹ค์ œ๋กœ ํ’ˆ์งˆ ์ฐจ์ด๋ฅผ ์„œ์—ดํ™”ํ•˜๋Š”์ง€ ์žฌ๊ธฐ ์œ„ํ•œ meta-metric: ์ด partial order โ†’ 8๊ฐœ pairwise ์ œ์•ฝ ์œ ๋„ โ†’ ๋งŒ์กฑํ•œ ์ œ์•ฝ์˜ ๋น„์œจ์ด ์ ์ˆ˜, 1.0์ด๋ฉด ์ „๋ถ€ ๋งŒ์กฑ
    • absolute scale ๋ฌธ์ œ ์šฐํšŒํ•˜๊ณ  rank๋ฅผ ๋งž์ถ”๋Š”๊ฐ€๋งŒ ํ™•์ธ
    • ์ƒ์„ฑ ๋ชจ๋ธ ๋Šฅ๋ ฅ์— ๋”ฐ๋ผ 3-tier ๋ถ„ํ• 
      • Top: GPT-5.4, Claude-4.5-Sonnet
      • Medium: Llama-3.3-70B, Llama-3.1-8B
      • Small: Llama-3.2-1B

๊ฒ€์ฆ ์žฅ์น˜ 2: ํ†ต์ œ๋œ perturbation

  • ์ƒ์„ฑ ๋ชจ๋ธ ๋ณ€์ฃผ๋งŒ์œผ๋กœ๋Š” ํ’ˆ์งˆ ์ฐจ์ด์˜ ํฌ๊ธฐ๋ฅผ ํ†ต์ œํ•  ์ˆ˜ ์—†์œผ๋ฏ€๋กœ ์„ฑ๊ฒฉ์ด ๋ฐ˜๋Œ€๋˜๋Š” ์ถ• ์ถ”๊ฐ€
    • ์ƒ์„ฑ ๋ชจ๋ธ ๋ณ€์ฃผ: ํ˜„์‹ค์ ์ด๋‚˜ ์ฐจ์ด์˜ ํฌ๊ธฐ๋Š” ํ†ต์ œ ๋ถˆ๊ฐ€
    • perturbation: ๋น„ํ˜„์‹ค์ ์ด๋‚˜ ์ฐจ์ด๊ฐ€ ์ •ํ™•ํžˆ ํ†ต์ œ๋จ
  • Expected Behavior Swapping: task์˜ 20/40/60/80%์—์„œ expected behavior๋ฅผ ์„œ๋กœ ๊ตํ™˜
    • description โ†” expected behavior ์ •๋ ฌ๋งŒ ์„ ํƒ์  ํŒŒ๊ดด
    • Description-Expected๊ฐ€ ๋น„์œจ์— ๋”ฐ๋ผ ๋‹จ์กฐ ํ•˜๋ฝํ•ด์•ผ ํ•จ
  • Cross-Domain Policy Swapping: Airline task๋ฅผ Retail policy๋กœ, ๊ทธ ๋ฐ˜๋Œ€๋กœ ํ‰๊ฐ€
    • policy ๊ธฐ๋ฐ˜ 3๊ฐœ ์ง€ํ‘œ๊ฐ€ ํฌ๊ฒŒ ํ•˜๋ฝํ•ด์•ผ ํ•จ

Effects

  • Experimental setup
    • ๋ฒค์น˜๋งˆํฌ ์ƒ์„ฑ: INTELLAGENT ํŒŒ์ดํ”„๋ผ์ธ Fig 3
      • policy๋ฅผ flow๋กœ ๋ถ„ํ•ด โ†’ policy graph ๊ตฌ์ถ• โ†’ random walk๋กœ policy ๋ถ€๋ถ„์ง‘ํ•ฉ ์ƒ˜ํ”Œ โ†’ description๊ณผ expected behavior ์ƒ์„ฑ โ†’ entity ์ธ์Šคํ„ด์Šคํ™” ๋ฐ ์ดˆ๊ธฐ DB ์ƒํƒœ ๊ตฌ์„ฑ
        • ๊ธฐ๋ณธ ์„ค์ •์€ ์ „ ๋‹จ๊ณ„ GPT-4o (edge scoring๋งŒ GPT-4o-mini)
        • ์„ ํƒ๋œ ๋‹จ๊ณ„๋งŒ ๊ต์ฒดํ•ด ํ’ˆ์งˆ ์ฐจ์ด ์œ ๋„
      • ์ตœ์ข… ๊ตฌ์„ฑ ๋‹จ๊ณ„๋Š” ์•ฝํ•œ ๋ชจ๋ธ์ด ์ฒ˜๋ฆฌ ๋ถˆ๊ฐ€ โ†’ ๋ชจ๋“  configuration์—์„œ GPT-4o ๊ณ ์ •
        • ์‹ค์ œ ์กฐ์ž‘ ๋ณ€์ˆ˜๋Š” policy ์ถ”์ถœ + description/expected behavior ์ƒ์„ฑ ๋‹จ๊ณ„๋กœ ํ•œ์ •
      • generator 5์ข…: GPT-5.4, Claude-4.5-Sonnet, Llama-3.3-70B, Llama-3.1-8B, Llama-3.2-1B
      • domain 2์ข…(ฯ„-bench ๊ธฐ๋ฐ˜): Airline 100 task + Retail 95 task โ†’ ์ด 975 synthetic task
    • judge 3์ข…: GPT-5.4, Claude-4.5-Sonnet, Gemini-2-Flash
      • perturbation ์‹คํ—˜๋งŒ Gemini-2-Flash ๋‹จ๋…
    • human validation: 5๊ฐœ generator ์ „์ฒด์—์„œ 50 task ์ƒ˜ํ”Œ, ์ €์ž 1์ธ์ด LLM judge์™€ ๋™์ผ ๊ธฐ์ค€์œผ๋กœ ์ฑ„์ 
      • ์ˆœ์„œํ˜• ์ ์ˆ˜ + tie ์กด์žฌ โ†’ Kendallโ€™s $\tau_b$, two-sided p-value
    • manually curated ์ ์šฉ: ฯ„ยณ-BENCH Airline 50 task, judge๋Š” Claude-4.5-Sonnet + GPT-5.4
      • nl_assertions ํ•„๋“œ๋ฅผ expected behavior๋กœ ๋งคํ•‘
      • task๋ณ„ ๋…๋ฆฝ DB ์—†์ด ๊ณต์œ  DB ์‚ฌ์šฉ โ†’ violation judge ์ž…๋ ฅ์—์„œ ์ดˆ๊ธฐ DB ์ƒํƒœ ์ œ๊ฑฐ
      • description๊ณผ DB๊ฐ€ ๋”ฐ๋กœ ์ž‘์„ฑ๋จ โ†’ Description-Expected์—์„œ no invention ๊ธฐ์ค€ ์ œ๊ฑฐ
      • Retail์€ ๋Œ€๋ถ€๋ถ„ task์— expected behavior annotation ๋ถ€์žฌ โ†’ ์ œ์™ธ
  • Results
    • generator๋ณ„ ์ˆœ์œ„ Fig 4 Tab 2: 4๊ฐœ ์ง€ํ‘œ ๋ชจ๋‘ ๊ฐ•ํ•œ ๋ชจ๋ธ์˜ ๋ฒค์น˜๋งˆํฌ์— ์ผ๊ด€๋˜๊ฒŒ ๋†’์€ ์ ์ˆ˜
      • Airline: ๋ชจ๋“  ์ง€ํ‘œ x ๋ชจ๋“  judge์—์„œ ordering score 1.00
      • Retail: ํ‰๊ท  0.92 / ์ „์ฒด ํ‰๊ท  0.96
      • Policy Violations Count: ์ „ judge + ์ „ domain ์™„๋ฒฝ ์ˆœ์œ„์ •๋ ฌ โ†’ 4๊ฐœ ์ค‘ ๊ฐ€์žฅ ์•ˆ์ •์ 
      • judge๋ณ„ ํ‰๊ท : GPT-5.4์™€ Claude-4.5-Sonnet 0.97 vs. Gemini-2-Flash 0.94
    • expected behavior swapping Fig 5: 0 โ†’ 80%๋กœ ๊ฐˆ์ˆ˜๋ก Description-Expected ๋‹จ์กฐ ํ•˜๋ฝ
      • ๋‘ domain + 5๊ฐœ generator ์ „๋ถ€ ๋™์ผ ํŒจํ„ด โ†’ task coherence ์ €ํ•˜์— ๋ฏผ๊ฐํ•จ ์ž…์ฆ
    • cross-domain policy swapping Fig 6: policy ๊ธฐ๋ฐ˜ 3๊ฐœ ์ง€ํ‘œ ๋ชจ๋‘ ํฐ ํญ ํ•˜๋ฝ
      • task์™€ policy์˜ mismatch๋ฅผ ๊ฐ์ง€ํ•œ๋‹ค๋Š” ๊ทผ๊ฑฐ
    • human validation Tab 3: 3 metric x 3 judge == 9๊ฐœ ์ƒ๊ด€ ์ „๋ถ€ positive + ํ†ต๊ณ„์  ์œ ์˜
      • $\tau_b$ 0.32~0.67, p-value 10^-6 ๋ฏธ๋งŒ ~ 0.011
      • ๊ฐ•ํ•œ ์ผ์น˜: Policy Violations Count 0.55~0.67
      • alignment ๊ณ„์—ด: 0.32~0.55๋กœ ์ƒ๋Œ€์  ์—ด์„ธ
      • judge-human ์ผ์น˜ + ๊ฐ•ํ•œ ๋ชจ๋ธ์ด ๋” ๋‚˜์€ ๋ฒค์น˜๋งˆํฌ๋ฅผ ๋งŒ๋“ ๋‹ค๋Š” ์ „์ œ๊นŒ์ง€ ๋’ท๋ฐ›์นจํ•œ๋‹ค๊ณ  ์ฃผ์žฅ
    • qualitative diagnostic Fig 7/8/9: Policy-Expected ์ €์ ์ˆ˜ task + Gemini rationale์„ GPT-5๋กœ ํด๋Ÿฌ์Šคํ„ฐ๋ง โ†’ ์ˆ˜๋™ ์ •์ œ
      • ๋ฐ˜๋ณต ์‹คํŒจ 5 ์œ ํ˜•:
        • hallucinated workflow stage ๋˜๋Š” ๋ฏธ์ง€์› ํ–‰๋™
        • ํ•„์ˆ˜ ์ •๋ณด ์ˆ˜์ง‘ ๋ˆ„๋ฝ
        • ์‹คํ–‰ ์ „ ๋ช…์‹œ์  ํ™•์ธ ๋ˆ„๋ฝ
        • ์ž˜๋ชป๋œ ๋ณด์ƒ ์ฒ˜๋ฆฌ
        • ๊ธˆ์ง€๋œ ํ–‰๋™
      • ๊ฒฐํ•จ ์œ ํ˜•์ด ๊ตฌ๋ถ„๋˜๊ธฐ์— ์ ์ˆ˜ ํ‰๊ฐ€๋ฅผ ๋„˜์–ด์„  ์ง„๋‹จ ๋„๊ตฌ๋กœ ์‚ฌ์šฉ ๊ฐ€๋Šฅํ•˜๋‹ค๊ณ  ์ฃผ์žฅ

Personal note. ๊ฐœ์ธ์ ์œผ๋กœ๋Š” tau bench ์—ฐ๊ตฌ์ž๋“ค์ด ์ง์ ‘ ๊ฑด๋“œ๋Š” ๋ฌธ์ œ๋ผ ๊ด€์‹ฌ์ด ๊ฐ€์„œ ์ฝ์—ˆ๋Š”๋ฐ, ๋ณธ์ธ ์—ฐ๊ตฌ ํฌํ•จ ์ตœ๊ทผ ๋ฒค์น˜๋งˆํฌ ์—ฐ๊ตฌ๋“ค์„ ๋ฉ”ํƒ€๋ ˆ๋ฒจ์—์„œ ์ง€์ ํ•˜๋ ค๋Š” ์—ฐ๊ตฌ๋ผ๊ณ  ๋ณด์ž…๋‹ˆ๋‹ค. ์•„์‰ฌ์šด์ ๋ถ€ํ„ฐ ์–ธ๊ธ‰ํ•˜๋ฉด LLM judge๊ฐ€ ๋ณด๋Š” ์ž…๋ ฅ(policy ๋ฌธ์„œ, description, expected behavior)์ด generator๊ฐ€ ๋ดค๋˜ ์ž…๋ ฅ๊ณผ ์‚ฌ์‹ค์ƒ ๋™์ผํ•˜๊ณ , ๊ทธ ํ’ˆ์งˆ์— ๋Œ€ํ•œ ๊ทผ๊ฑฐ๊ฐ€ ๊ฐ•ํ•œ ๋ชจ๋ธ์ด ๋” ์ข‹์€ ๋ฒค์น˜๋งˆํฌ๋ฅผ ๋งŒ๋“ ๋‹ค๋Š” ์ปจ๋ฒค์…˜์ธ๋ฐ, ๊ทธ ๊ฐ€์ •์˜ ๋…๋ฆฝ ๊ฒ€์ฆ์€ ์ €์ž ๋ณธ์ธ 1๋ช…์ด ๋งค๊ธด 50๊ฐœ taskโ€ฆ?์ธ ๋ถ€๋ถ„์ด ๋˜๊ฒŒ ํฐ ํ•œ๊ณ„๋กœ ๋А๊ปด์ง€๊ธฐ๋Š” ํ•˜๊ณ ์š”.. ์ข€ ๋ˆˆ์— ๋„๊ฒŒ ๋งˆ์Œ์— ๊ฑธ๋ฆฐ ๋ถ€๋ถ„์€ human validation์ด judge-human ์ผ์น˜๋ฅผ ํ™•์ธํ–ˆ๋Š”๋ฐ (์—ฌ๊ธฐ๊นŒ์ง€๋Š” ๊ทธ๋Ÿด๋“ฏํ•œ๋ฐ) ๊ทธ๊ฑธ ๋‹ค์‹œ generator-ํ’ˆ์งˆ ๊ฐ€์ •์˜ ๊ทผ๊ฑฐ๋กœ ๋˜๋Œ๋ ค ์“ฐ๋Š” ์ˆœํ™˜๋…ผ๋ฆฌ ํ๋ฆ„์ด ํƒ€๋‹นํ•œ๊ฑด์ง€ ์˜์‹ฌ์Šค๋Ÿฝ๊ธฐ๋Š” ํ•˜๊ณ ์š”โ€ฆ ๋‹ค๋งŒ ํ•„์š”ํ•œ ์—ฐ๊ตฌ์˜ ์‹œ๋ฐœ์ ์€ ๋  ๊ฒƒ ๊ฐ™์Šต๋‹ˆ๋‹ค. ์–ด์จŒ๋“  ํ”„๋ ˆ์ด๋ฐํ•˜๊ธฐ๋กœ๋Š” LLM์ด ๋ฌธ์ œ๋ฅผ ํ’€์–ด๋†“์€ ๋‹ค์Œ ํ‰๊ฐ€ํ•ด์•ผ๋˜๋Š” ๋ฌธ์ œ๋ฅผ ํ”ผํ•˜๊ณ ์ž ์‹ค์ œ ๋ฒค์น˜๋งˆํฌ๋ฅผ executeํ•˜์ง€๋Š” ์•Š๋Š”๋‹ค๋Š”๊ฑธ ์…€๋งํฌ์ธํŠธ๋กœ ์žก๊ธด ํ•˜๋Š”๋ฐ ๊ทธ๋Ÿผ์—๋„ ๋ถˆ๊ตฌํ•˜๊ณ  ์–ด์จŒ๋“  ๋ฒค์น˜๋งˆํฌ์˜ ์กด์žฌ ์ด์œ ๊ฐ€ agent ๋ณ€๋ณ„ํ•ด๋ณด๊ฒ ๋‹ค๋ผ๋ฉด ์‹ค์ œ ์ด ํ”„๋ ˆ์ž„์›Œํฌ ์ƒ์—์„œ ์ ์ˆ˜ ๋†’์€ ๋ฒค์น˜๋งˆํฌ๊ฐ€ ์‹ค์ œ๋กœ agent๋ฅผ ๋” ์ž˜ ๋ณ€๋ณ„ํ•˜๋Š”์ง€๋Š” ํ•œ๋ฒˆ์€ ์žฌ๋ดค์–ด์•ผํ•˜์ง€ ์•Š๋‚˜? ์‹ถ๊ธด ํ•ฉ๋‹ˆ๋‹ค. ๊ทธ๋ž˜๋„ ์†Œ๊ฐœํ•ด๋ณด๊ณ  ์‹ถ์—ˆ๋˜ ์ด์œ ๋Š” ๊ทธ๋ƒฅ ๊ด€๋ จ์žˆ๋ƒ๋ฅผ ๋ฌผ์–ด๋ณด๋ฉด ๋‹น์—ฐ ๊ด€๋ จ์žˆ๋‹ค๊ณ  ๋Œ€๋‹ตํ• ํ…Œ๋‹ˆ, ๋Œ€์‹  ์ œ์•ฝ์„ ์œ„๋ฐ˜ํ–ˆ๋Š”์ง€๋กœ ์นด์šดํŒ…ํ•˜๊ฒŒ ํ•œ ์ ์€ ๋˜‘๋˜‘ํ–ˆ๋˜ ๊ฒƒ ๊ฐ™์Šต๋‹ˆ๋‹ค. ๋ญ”๊ฐ€ ๋ฆฌ์›Œ๋“œ ๋ชจ๋ธ๋ง ํ•  ๋•Œ ์จ๋ด„์ง ํ•œ ๊ฒƒ๋„ ๊ฐ™๊ณ ..