Fixing GRPO training collapse in long-horizon multi-tool agents. A lightweight PRM-Lite + LATA joint approach achieves +37% over vanilla GRPO on τ-bench airline (50-task, multi-turn).
-
Updated
Jun 27, 2026 - Python
Fixing GRPO training collapse in long-horizon multi-tool agents. A lightweight PRM-Lite + LATA joint approach achieves +37% over vanilla GRPO on τ-bench airline (50-task, multi-turn).
Reversibility-aware safety signals for LLM tool-use agents | estimating action recoverability before irreversible operations: (delete/send/pay/commit) when rollback is unavailable.
Open harness for running, measuring, and visualizing agent benchmarks. Adapters for AutomationBench, τ-bench, LeRobot, WorkArena.
Empirical LLM cost-quality and model-routing studies: cross-provider frontier (n=290) and escalate-on-failure cascades on tau-bench. Harness, data, and papers.
Model-agnostic eval harness for tool-calling agents — pass@k and pass^k over state-verified tasks. Runs on Ollama, Claude, or any chat backend.
Extending tau-bench into a new domain (food delivery) as RL-ready evaluation data, with reward design and operational plan.
Certified branch/tool gating evidence harness for public agent workloads
Add a description, image, and links to the tau-bench topic page so that developers can more easily learn about it.
To associate your repository with the tau-bench topic, visit your repo's landing page and select "manage topics."