DiffusionGemma: 拡散言語モデルの仕組み

大規模言語モデル(LLM)をチャットボットや対話型エージェントとして、単発かつ低同時接続で動かす場面では、生成速度が伸びずにもどかしさを感じることがあります。この種のワークロードでは、モデルの重みや会話履歴のキャッシュを […]