AI 驱动的内核搜索在两个内核上达到接近专家级的性能
在所研究的两个内核(attention 和 Mamba SSM)上,以结构化跨平台翻译为基础的 AI 驱动演化式内核搜索,在 Apple Silicon 上达到了接近专家级的性能,而无需 GPU 专家从头编写。作者表示,他们尚不清楚这种方法的泛化程度。
支持这项说法
从 CUDA 到 MLX:K-Search 如何将数十年的内核专业知识引入 Apple Silicon
在我们研究的两个内核上,以结构化跨平台翻译知识为根基、由人工智能驱动的进化式内核搜索,在无需 GPU 专家团队从零起步的情况下,即在 Apple Silicon 上实现了接近专家级的性能。目前尚不清楚该方法的泛化能力究竟如何,但这一结果令人鼓舞。
原始摘录
On the two kernels we studied, AI-driven evolutionary kernel search grounded in structured cross-platform translation knowledge reached near-expert performance on Apple Silicon without a team of GPU experts starting from scratch. We do not yet know how far this generalizes
上下文
但该结果令人鼓舞。
原始上下文
, but the result is encouraging.