阶段:调研与前置实验(Pre-repo)。 本目录是构想与计划库,不是代码仓库: 存放方案、验证协议与证据快照。各平台(Orin NX / Thor / AGX)的验证正在推进中。 其他平台上接手的 Agent:请先读 docs/HANDOFF.md—— 里面有完整的测试协议、资产清单和结果回填格式。 待核心支撑点全部销项后,再决定是否转为代码仓库公开 Release。
为 Jetson 平台提供手写 CUDA 融合 kernel(MergeKernel),覆盖官方推理路径 (torch.compile / ONNX→TensorRT)转换失败或效果不足的非标准结构模型。
问题链条:模型转换不成功 → 针对 Jetson 各平台手写 kernel 调优 → 以场景为单位交付。
每条支柱必须绑定可复现证据,判定词规范:unsupported(官方路径失败)/
degraded(可运行但延迟或精度不达标)/ competitive(官方不输 MK,标注毕业)。
| 支柱 | 表述 | 证据类型 | 当前状态 |
|---|---|---|---|
| P1 覆盖缺口 | myelin 五类盲区(数据依赖 shape、非仿射访存、复数算子、非标准 attention、循环状态机)的模型,TRT 融合失分,MK 更快 | 同 golden A/B 计时 CSV | AGX Orin 已验证:SAM3 backbone MK 372 ms vs TRT 8.6 fp16 534 ms |
| P2 小内存可部署 | 8 GB 级 Jetson 上 TRT 全图引擎构建失败,MK 可完整运行 | 构建失败日志 + MK 运行内存峰值 | 口述证据,待 NX 固化 |
| P3 精度控制 | TRT fp16 对 LN 敏感模型存在静默漂移;MK 逐算子 fp32 累加,精度安全 | IoU / rel_l2 门槛表 | AGX 已验证(SAM3 TRT IoU 0.38 vs MK rel_l2 6e-4);外部佐证 VGGT/TRT 10.3 静默错误(NVIDIA 论坛) |
| P4 版本稳定 | 源码级 kernel 不锁引擎版本,跨 TRT/JetPack 碎片化环境可移植 | 跨代编译验证(sm_87→sm_100) | 待 Thor 验证 |
| P5 官方对照 | 与 torch.compile 官方路径在 Jetson 的 head-to-head | 延迟 + 可用性记录 | 公开数据为零,待 Thor/JP6.2 栈实测 |
| 边界(诚实声明) | TRT 已打满的模型不收录为卖点 | 反例数据 | 已验证:Depth Anything V2-S/L 全系 TRT fp16 打满(10 ms / 65 ms),MK 优化后 13.2 ms 仍不敌 |
模型命中 ≥2 条即为候选目标;命中 0 条(纯前馈标准结构)明确不碰。
- 数据依赖的 shape / 控制流(动态 token 数、分支)
- 非仿射访存(gather/scatter/高级索引/deformable 采样)
- 复数或特殊算子(复数 RoPE、FFT 类)
- 非标准 attention 拓扑(window roll/shift、邻域注意力、相对位置 gather)
- 循环状态机 / 变长序列(视频记忆链、SSM)
| 平台 | 定位 | 在手设备 |
|---|---|---|
| Orin 全系(JetPack 6.x,sm_87) | 主战场 | AGX Orin 64GB(开发)、Orin NX 8GB(量产代表) |
| Thor(JetPack 7,CUDA 13,sm_100) | 验证位:判定最新官方栈下支柱是否仍成立 | 有 |
| Xavier/Nano | 不做(旧栈退出中) | — |
| 顺序 | 模型 | 命中盲区 | 状态 |
|---|---|---|---|
| 1 | SAM3 视频 tracker | 5/5 | AGX 已完成(anchor 案例);待 NX/Thor 复验 |
| 2 | GroundingDINO | 3/5 | 有官方 TRT 转换失败 issue 背书;待调研销项后启动 |
| 3 | VMamba/Mamba 视觉系 | 状态机 | 探索项,待社区需求调研 |
| 对照 | Depth Anything V2-S/L | 0/5 | 已测,收录为 competitive 边界案例 |
mergekernel-jetson/
kernels/ # 纯 CUDA,模型无关(LN/RoPE/GEMM-epilogue/upsample…)
bindings/torch/ # torch extension 封装 + CUDA Graph 工具
models/<name>/ # 每模型:swap 代码 + 权重 remap + golden + verdict.csv
verify/ # verify_official.sh:torch.compile→TRT构建→TRT精度→MK 四级判定
results/ # 平台×模型 verdict 矩阵(README 首页引用)
docs/ # BENCHMARK_NOTES:环境指纹 + 选型标准 + 数据快照
"torch.compile 在 Jetson 不可用"—— 已撤回。官方支持(JetPack 6.2 + torch 2.8 + Torch-TensorRT;triton aarch64 可用但需第三方/自编译 wheel)。本机失败仅为 torch 2.3 + triton 3.4 版本错配,不是平台结论。"Jetson TRT 版本落后"—— 须限定。JetPack 6.2 基线为 TRT 10.3;本机测试环境 (TRT 8.6.2/CUDA 12.2)为旧用户态。所有 MK vs TRT 数据必须标注 TRT 版本。- "首发"声明基于公开检索,无法排除未开源内部实现,措辞用"公开资料中首个"。
- 接手手册(其他平台 Agent 必读):docs/HANDOFF.md
- 现有实测数据快照:docs/EVIDENCE.md
- 行动清单与待证实项:TODO.md
- 各平台验证结果:
results/verdict.csv(格式见 HANDOFF §4)