第一章:Golang ONNX模 … Golang ONNX模型分片推理(Model Sharding):将12GB大模型拆解为8个微服务的生产实践Read more
大模型推理性能测试
【Go语言大模型推理加速秘籍】:CPU/GPU混合调度下延迟降低63%的5个关键优化
第一章:Go语言大模型推理加速的 … 【Go语言大模型推理加速秘籍】:CPU/GPU混合调度下延迟降低63%的5个关键优化Read more
飞桨golang工程化实践:从单机推理到K8s Operator编排的6阶段演进路径
第一章:飞桨golang工程化实 … 飞桨golang工程化实践:从单机推理到K8s Operator编排的6阶段演进路径Read more
Go语言调用ONNX Runtime的终极姿势:零拷贝内存共享实现(实测吞吐提升4.2倍)
第一章:Go语言可以搞AI Go … Go语言调用ONNX Runtime的终极姿势:零拷贝内存共享实现(实测吞吐提升4.2倍)Read more
