Skip to content

Latest commit

 

History

12 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 

Repository files navigation

Awesome AI Kernel Engineering

Methods

Title Venue Date Code topic
KFORGE: PROGRAM SYNTHESIS FOR DIVERSE AI HARDWARE ACCELERATORS arXiv 2025.11 CUDA
Towards Robust Agentic CUDA Kernel Benchmarking, Verification, and Optimization
arXiv 2025.09 Github CUDA
Autonomous Code Evolution Meets NP-Completeness arXiv 2025.09 - Nvidia Official
Astra: A Multi-Agent System for GPU Kernel Performance Optimization arXiv 2025.09 - CUDA
Towards Agentic OS: An LLM Agent Framework for Linux Schedulers arXiv 2025.09 - General Kernel, OS Schedule
SwizzlePerf: Hardware-Aware LLMs for GPU Kernel Performance Optimization arXiv 2025.08 - AMD GPU
CudaLLM: Training Language Models to Generate High-Performance CUDA Kernels
HugginFace 2025.08 Github CUDA, Finetuning
OS-R1: Agentic Operating System Kernel Tuning with Reinforcement Learning
arXiv 2025.08 - General Kernel, OS Kernel
TimelyHLS: LLM-Based Timing-Aware and Architecture-Specific FPGA HLS Optimization
arXiv 2025.07 - Hardware_as_Code, HLS
Star
GEAK: Introducing Triton Kernel AI Agent & Evaluation Benchmarks
arXiv 2025.07 Github Triton (AMD), Iterative Search
GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning
arXiv 2025.07 - AMD NPU + CUDA, Prompt Engineering
Star
CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning
arXiv 2025.07 Github CUDA, Finetuning
Omniwise: Predicting GPU Kernels Performance with LLMs
arXiv 2025.06 - AMD NPU, Surrogate Modeling
Kevin: Multi-Turn RL for Generating CUDA Kernels
EXAIT Workshop @ ICML 2025.06 - CUDA, Finetuning
GPU Kernel Scientist: An LLM-Driven Framework for Iterative Kernel Optimization
ES-FoMo Workshop @ ICML 2025.06 - AMD, Iterative Search
AlphaEvolve: A coding agent for scientific and algorithmic discovery
arXiv 2025.06 Github1 TPU, Agentic System
CUDA-LLM: LLMs Can Write Efficient CUDA Kernels
arXiv 2025.06 - CUDA, Prompt Engineering (?)
The AI CUDA Engineer: Agentic CUDA Kernel Discovery, Optimization and Composition
arXiv 2025.02 HuggingFace CUDA, Agent + Iterative Search + RAG
ECCO: Can We Improve Model-Generated Code Efficiency Without Sacrificing Functional Correctness? (Waghjale et al., EMNLP 2024)
EMNLP 2024 2024.11 - LLM4Code

Datasets and Benchmarks

Title Venue Date Code topic
Star
MultiKernelBench: A Multi-Platform Benchmark for Kernel Generation
arXiv 2025.07 Github CUDA + CANN + TPU
NPUEval: Optimizing NPU Kernels with LLMs and Open Source Compilers
arXiv 2025.07 - NPU
Star
TritonBench: Benchmarking Large Language Model Capabilities for Generating Triton Operators
ICML 2025.02 Github Triton (CUDA)
Star
KernelBench: Can LLMs Write Efficient GPU Kernels?
ICML 2025.02 Github CUDA
Comparing Llama-2 and GPT-3 LLMs for HPC kernels generation
LCPC 2023.09 -

Others

Title Date topic
AMD Developer Challenge 2025 2025.04 AMD GPU
GPU Mode Learderboard - AMD + CUDA

Footnotes

  1. A public implementation of AlphaEvolve.

About

No description, website, or topics provided.

Resources

Stars

10 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors