| KFORGE: PROGRAM SYNTHESIS FOR DIVERSE AI HARDWARE ACCELERATORS |
arXiv |
2025.11 |
|
CUDA |
Towards Robust Agentic CUDA Kernel Benchmarking, Verification, and Optimization
|
arXiv |
2025.09 |
Github |
CUDA |
| Autonomous Code Evolution Meets NP-Completeness |
arXiv |
2025.09 |
- |
Nvidia Official |
| Astra: A Multi-Agent System for GPU Kernel Performance Optimization |
arXiv |
2025.09 |
- |
CUDA |
| Towards Agentic OS: An LLM Agent Framework for Linux Schedulers |
arXiv |
2025.09 |
- |
General Kernel, OS Schedule |
| SwizzlePerf: Hardware-Aware LLMs for GPU Kernel Performance Optimization |
arXiv |
2025.08 |
- |
AMD GPU |
CudaLLM: Training Language Models to Generate High-Performance CUDA Kernels
|
HugginFace |
2025.08 |
Github |
CUDA, Finetuning |
OS-R1: Agentic Operating System Kernel Tuning with Reinforcement Learning
|
arXiv |
2025.08 |
- |
General Kernel, OS Kernel |
TimelyHLS: LLM-Based Timing-Aware and Architecture-Specific FPGA HLS Optimization
|
arXiv |
2025.07 |
- |
Hardware_as_Code, HLS |
GEAK: Introducing Triton Kernel AI Agent & Evaluation Benchmarks
|
arXiv |
2025.07 |
Github |
Triton (AMD), Iterative Search |
GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning
|
arXiv |
2025.07 |
- |
AMD NPU + CUDA, Prompt Engineering |
CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning
|
arXiv |
2025.07 |
Github |
CUDA, Finetuning |
Omniwise: Predicting GPU Kernels Performance with LLMs
|
arXiv |
2025.06 |
- |
AMD NPU, Surrogate Modeling |
Kevin: Multi-Turn RL for Generating CUDA Kernels
|
EXAIT Workshop @ ICML |
2025.06 |
- |
CUDA, Finetuning |
GPU Kernel Scientist: An LLM-Driven Framework for Iterative Kernel Optimization
|
ES-FoMo Workshop @ ICML |
2025.06 |
- |
AMD, Iterative Search |
AlphaEvolve: A coding agent for scientific and algorithmic discovery
|
arXiv |
2025.06 |
Github1 |
TPU, Agentic System |
CUDA-LLM: LLMs Can Write Efficient CUDA Kernels
|
arXiv |
2025.06 |
- |
CUDA, Prompt Engineering (?) |
The AI CUDA Engineer: Agentic CUDA Kernel Discovery, Optimization and Composition
|
arXiv |
2025.02 |
HuggingFace |
CUDA, Agent + Iterative Search + RAG |
ECCO: Can We Improve Model-Generated Code Efficiency Without Sacrificing Functional Correctness? (Waghjale et al., EMNLP 2024)
|
EMNLP 2024 |
2024.11 |
- |
LLM4Code |