Bare-Metal Deep-Kernel Fused JIT & Memory Bandwidth Optimizer for Frontier AI Accelerators (Tenstorrent, Triton, CUDA, Apple Silicon).
cuda quantization compiler-optimization roofline-model kernel-fusion deep-learning-compiler flash-attention tenstorrent triton-kernels fp8-quantization riscv-vector apple-silicon-mlx logaddexp-overflow memory-bandwidth-optimization
-
Updated
Sep 18, 2026 - Python