/
← Accept All   Archive
Qiita (LLM)Japan

VRAMは束ねない。NVIDIA PAIRが家庭内PCを推論クラスタに変える仕組み

September 6Translated from Japanese

ローカルLLMを動かすPCを増やしても、1本の推論がその台数分だけ速くなるわけではない。 NVIDIA PAIRが減らすのは、複数の独立したリクエストが1台のGPUの前で並ぶ待ち時間だ。 公式デモでは処理時間が18分から8分48秒へ短縮されたが、その数字を正しく読むには「...

Chips & compute
Read at Qiita (LLM) ↗

Related

More from Qiita (LLM) on Accept All.