RTX 5080 + TensorRT 10.14.1.48 + RT-DETRv4 精度問題
環境資訊
- GPU: NVIDIA GeForce RTX 5080 (Ada Lovelace 架構)
- CUDA 版本: 12.9
- TensorRT 版本: 10.14.1.48.post1
- 驅動版本: 580.119.02
問題描述
RT-DETRv4 模型在 RTX 5080 上使用 TensorRT 轉換後,輸出分數嚴重下降:
- ONNX 正常輸出: 9個高分 (>0.5), 無極低分 (<0.02)
- TensorRT 錯誤輸出: 0個高分, 167~206個極低分 (<0.02)
其他資訊
- 架構相關性: 問題只在 RTX 50 系列架構上出現,在RTX 40 系列上的engine模型表現正常
- FP32/FP16 無關: 即使強制 FP32 仍存在精度下降
- 層融合無關: 禁用所有層融合優化後問題依然存在
- ONNX 模型正常: ONNX Runtime 推理完全正確
重現步驟
使用Tools依照MD說明構建engine模型
- 下載Performance中提供的Checkpoint
- python tools/deployment/export_onnx.py --check -c configs/rtv4/rtv4_hgnetv2_${model}_coco.yml -r model.pth
- trtexec --onnx="model.onnx" --saveEngine="model.engine" --fp16
RTX 5080 + TensorRT 10.14.1.48 + RT-DETRv4 精度問題
環境資訊
問題描述
RT-DETRv4 模型在 RTX 5080 上使用 TensorRT 轉換後,輸出分數嚴重下降:
其他資訊
重現步驟
使用Tools依照MD說明構建engine模型