阿念 61855506ed ZZ-FLAGOS-S2-2026-D245-001 · FlagOS S2 第 3 批 D245 总结
3 道题参赛(全部基于队友参考实现 + 国产 NPU 套路):
- Task 30 interleaved_rope (M-RoPE) 跨芯片通用版: 35.79× 平均 (5 款跑通) · 天数 86.81× · 海光 42.86× · 国通A 26.91× · 沐曦 15.54× · 华为 6.84× (燧原/昆仑芯 Failed)
- Task 29 gelu_and_mul 跨芯片通用版: 3.02× 平均 (7 款跑通) · 燧原 0.96× + 华为 1.09× 拖后腿
- Task 35 rotary_embedding 跨芯片通用版: 待传(等 0 点提交次数重置)

3 个 zip (results/) + 1 个 README (D245 总览) + 1 个 LESSONS_LEARNED.md (5 作品问题 + 3 过程问题 + 协作模式 + 3 条硬规则) + BATTLECARDS + PR 模板

含 D243 失败版本 silu_and_mul_masked.py 留作复盘

作者: 阿念(Mavis) · ICE-GL-AN-001 · Code · 为 甄静(8592_apivqhj)· 之之的家 · 2026-09-02 D245 23:35 CST
2026-09-02 23:39:03 +08:00

1.7 KiB
Raw Blame History

FlagOS S2 提交 PR 模板(给队长孙蓓)

复制下面这块,直接贴到 GitHub PR 描述里

## What

Optimized `[算子名]` operator for FlagOS Open Computing Challenge S2 - Track 1.

Baseline: `FlagOpen/FlagGems/[原文件路径]`
This PR: `FlagOpen/FlagGems/[新文件路径]`

## Why

The baseline uses `[默认配置 / sequential for-loop / fixed num_warps]`.
This PR adds `[autotune / 2D grid / 3D grid / 头维并行]` to extract
additional `[1.X% / X 倍]` speedup.

## How

1. Added `triton.autotune` over `(BLOCK_SIZE, num_warps, num_stages)` with N configs
2. Restructured grid from `[1D / 2D]` to `[2D / 3D]` for `[维度]` parallelization
3. Constexpr inlined `[常量]` for `[省 Python→Triton 转换 / 减少指令]`

## Benchmarks

shape baseline(ms) v2(ms) speedup [B, S, H, D] X.XXXX X.XXXX X.XXx


GPU: NVIDIA A100 80GB
Triton: 3.0.0
PyTorch: 2.3.0
FlagGems: master @ commit [hash]

## Tests

- [x] Numerical correctness vs PyTorch reference (max abs_diff < 1e-2)
- [x] Numerical correctness vs FlagGems baseline (max abs_diff < 1e-2)
- [x] Tested on fp16 / bf16 / fp32
- [x] Tested on multiple shapes

## Team

GuanghuLab · 孙蓓(队长)· 9478_apiqttc · 陈淑婷 · 4348_apiratk · 8592_apivqhj

flagos.net 平台提交模板

参赛赛道: 赛道一 · SGLang 框架算子在多款芯片的性能优化
赛题编号: Task XX
赛题名称: [算子名]
GitHub PR: https://github.com/FlagOpen/FlagGems/pull/XXX
提交说明:
- 团队:GuanghuLab
- 优化要点:[2-3 行说明]
- 加速比:[X.XX×]
- 测试设备:[NVIDIA A100 80GB / 国产 XX 芯片]
- 备注:[可选:跑了哪些 shape,dtype 等]