NVIDIAのCUDA Multi-Process Service(MPS)とTriton Inference ServerをAmazon EC2 GPUインスタンスで活用することで、自動音声認識(ASR)モデルの推論コストを75%削減できることが示された。従来、各リクエストがGPUのごく一部しか使用しないため非効率だったASR処理を、MPSによる複数プロセスの並列GPU共有で最適化。1秒未満のレイテンシを維持しながら、1GPU当たり毎秒92.1リクエストのスループットを実現しており、大規模ASRサービスを運用する企業にとってインフラコスト削減の有効な手段となる。
読み込み中...
コメントを投稿するにはログインしてください