Skip to content

Latest commit

 

History

1 Commit

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 

Repository files navigation

mergekernel-jetson

阶段:调研与前置实验(Pre-repo)。 本目录是构想与计划库,不是代码仓库: 存放方案、验证协议与证据快照。各平台(Orin NX / Thor / AGX)的验证正在推进中。 其他平台上接手的 Agent:请先读 docs/HANDOFF.md—— 里面有完整的测试协议、资产清单和结果回填格式。 待核心支撑点全部销项后,再决定是否转为代码仓库公开 Release。

一句话定位

为 Jetson 平台提供手写 CUDA 融合 kernel(MergeKernel),覆盖官方推理路径 (torch.compile / ONNX→TensorRT)转换失败或效果不足的非标准结构模型。

问题链条:模型转换不成功 → 针对 Jetson 各平台手写 kernel 调优 → 以场景为单位交付。

核心支撑点(支柱)

每条支柱必须绑定可复现证据,判定词规范:unsupported(官方路径失败)/ degraded(可运行但延迟或精度不达标)/ competitive(官方不输 MK,标注毕业)。

支柱 表述 证据类型 当前状态
P1 覆盖缺口 myelin 五类盲区(数据依赖 shape、非仿射访存、复数算子、非标准 attention、循环状态机)的模型,TRT 融合失分,MK 更快 同 golden A/B 计时 CSV AGX Orin 已验证:SAM3 backbone MK 372 ms vs TRT 8.6 fp16 534 ms
P2 小内存可部署 8 GB 级 Jetson 上 TRT 全图引擎构建失败,MK 可完整运行 构建失败日志 + MK 运行内存峰值 口述证据,待 NX 固化
P3 精度控制 TRT fp16 对 LN 敏感模型存在静默漂移;MK 逐算子 fp32 累加,精度安全 IoU / rel_l2 门槛表 AGX 已验证(SAM3 TRT IoU 0.38 vs MK rel_l2 6e-4);外部佐证 VGGT/TRT 10.3 静默错误(NVIDIA 论坛)
P4 版本稳定 源码级 kernel 不锁引擎版本,跨 TRT/JetPack 碎片化环境可移植 跨代编译验证(sm_87→sm_100) 待 Thor 验证
P5 官方对照 与 torch.compile 官方路径在 Jetson 的 head-to-head 延迟 + 可用性记录 公开数据为零,待 Thor/JP6.2 栈实测
边界(诚实声明) TRT 已打满的模型不收录为卖点 反例数据 已验证:Depth Anything V2-S/L 全系 TRT fp16 打满(10 ms / 65 ms),MK 优化后 13.2 ms 仍不敌

myelin 盲区选型标准(五特征)

模型命中 ≥2 条即为候选目标;命中 0 条(纯前馈标准结构)明确不碰。

  1. 数据依赖的 shape / 控制流(动态 token 数、分支)
  2. 非仿射访存(gather/scatter/高级索引/deformable 采样)
  3. 复数或特殊算子(复数 RoPE、FFT 类)
  4. 非标准 attention 拓扑(window roll/shift、邻域注意力、相对位置 gather)
  5. 循环状态机 / 变长序列(视频记忆链、SSM)

平台选型

平台 定位 在手设备
Orin 全系(JetPack 6.x,sm_87) 主战场 AGX Orin 64GB(开发)、Orin NX 8GB(量产代表)
Thor(JetPack 7,CUDA 13,sm_100) 验证位:判定最新官方栈下支柱是否仍成立
Xavier/Nano 不做(旧栈退出中)

第一批模型选型

顺序 模型 命中盲区 状态
1 SAM3 视频 tracker 5/5 AGX 已完成(anchor 案例);待 NX/Thor 复验
2 GroundingDINO 3/5 有官方 TRT 转换失败 issue 背书;待调研销项后启动
3 VMamba/Mamba 视觉系 状态机 探索项,待社区需求调研
对照 Depth Anything V2-S/L 0/5 已测,收录为 competitive 边界案例

仓库结构规划(转代码仓库后)

mergekernel-jetson/
  kernels/            # 纯 CUDA,模型无关(LN/RoPE/GEMM-epilogue/upsample…)
  bindings/torch/     # torch extension 封装 + CUDA Graph 工具
  models/<name>/      # 每模型:swap 代码 + 权重 remap + golden + verdict.csv
  verify/             # verify_official.sh:torch.compile→TRT构建→TRT精度→MK 四级判定
  results/            # 平台×模型 verdict 矩阵(README 首页引用)
  docs/               # BENCHMARK_NOTES:环境指纹 + 选型标准 + 数据快照

已知的表述风险(写进公开版前必须处理)

  1. "torch.compile 在 Jetson 不可用" —— 已撤回。官方支持(JetPack 6.2 + torch 2.8 + Torch-TensorRT;triton aarch64 可用但需第三方/自编译 wheel)。本机失败仅为 torch 2.3 + triton 3.4 版本错配,不是平台结论。
  2. "Jetson TRT 版本落后" —— 须限定。JetPack 6.2 基线为 TRT 10.3;本机测试环境 (TRT 8.6.2/CUDA 12.2)为旧用户态。所有 MK vs TRT 数据必须标注 TRT 版本。
  3. "首发"声明基于公开检索,无法排除未开源内部实现,措辞用"公开资料中首个"。

更多

  • 接手手册(其他平台 Agent 必读)docs/HANDOFF.md
  • 现有实测数据快照:docs/EVIDENCE.md
  • 行动清单与待证实项:TODO.md
  • 各平台验证结果:results/verdict.csv(格式见 HANDOFF §4)

About

No description, website, or topics provided.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors