动态Batch技术
Go调用ONNX Runtime的生产级封装(支持动态batch、量化模型与CUDA上下文复用)
第一章:Go调用ONNX Run … Go调用ONNX Runtime的生产级封装(支持动态batch、量化模型与CUDA上下文复用)Read more
Go语言大模型批量推理优化:batch padding对齐、动态shape调度与显存复用3大突破
第一章:Go语言大模型批量推理优 … Go语言大模型批量推理优化:batch padding对齐、动态shape调度与显存复用3大突破Read more
