Skip to content

Latest commit

 

History

History
12 lines (11 loc) · 1.52 KB

File metadata and controls

12 lines (11 loc) · 1.52 KB

References

  • Soosahabi & Namsani (2026) — Analyzing Defensive Misdirection Against Model-Guided Automated Attacks on Agentic AI Systems — arXiv:2606.20470
  • Chao et al. (2025) — Jailbreaking Black Box Large Language Models in Twenty Queries (PAIR) — arXiv:2310.08419
  • Yu et al. (2024) — GPTFuzzer: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts — arXiv:2309.10253
  • Chen et al. (2025) — StruQ: Defending Against Prompt Injection with Structured Queries — arXiv:2402.06363
  • Anil et al. (2024) — Many-Shot Jailbreaking — arXiv:2404.02151
  • Zou et al. (2023) — Universal and Transferable Adversarial Attacks on Aligned Language Models (GCG) — arXiv:2307.15043
  • Liu et al. (2024) — Formalizing and Benchmarking Prompt Injection Attacks and Defenses — arXiv:2310.12815
  • Xie et al. (2025) — SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal — arXiv:2406.14598
  • Pasquini et al. (2025) — LLMmap: Fingerprinting for Large Language Models — arXiv:2403.15847
  • Guan et al. (2024) — Deliberative Alignment: Reasoning Enables Safer Language Models — arXiv:2412.16339