Skip to content

Version 16: Add CUDA register tiles - #12

Merged
pbelevich merged 1 commit into
mainfrom
version-16-register-tiles
Sep 1, 2026
Merged

Version 16: Add CUDA register tiles#12
pbelevich merged 1 commit into
mainfrom
version-16-register-tiles

Conversation

@pbelevich

Copy link
Copy Markdown
Owner

Teach CUDA dot lowering to map logical output tiles across threads and per-thread registers. Add broadcast-aware register arithmetic, loop-carried accumulators, masked stores, one-warp layout inference, and GPU coverage for multi-result matmul.

@pbelevich
pbelevich merged commit 45fee22 into main Sep 1, 2026
4 checks passed
pbelevich added a commit that referenced this pull request Sep 1, 2026
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant