v1.2.0
このリリースでは、 verl と RL サービス、分解された ViT サービス、線形注意モデルのためのハイブリッドキャッシュアーキテクチャ、およびキャッシュ認識 PD を備えた多レベルキャッシュシステムが導入されている。拡張されたMTPの推測的な解読と最適化を含む モデル性能の改善も提供します プリフィール、注意、MoE,量子化、分散推論
このリリースでは、 verl と RL サービス、分解された ViT サービス、線形注意モデルのためのハイブリッドキャッシュアーキテクチャ、およびキャッシュ認識 PD を備えた多レベルキャッシュシステムが導入されている。拡張されたMTPの推測的な解読と最適化を含む モデル性能の改善も提供します プリフィール、注意、MoE,量子化、分散推論
LightLLM v1.1.0を発表:より効率的で、より強力!より高いパフォーマンスとより広範な応用性のための主要なアーキテクチャと最適化アップグレードを備えた LightLLM v1.1.0を紹介できることを嬉しく思います✨ キーハイライト CPU-GPU統一折りたたみアーキテクチャ システムレベルのCPUオーバーヘッドを劇的に削減します ディープモデル最適化 DeepSeekとQwen3-MoEのサポート強化。..
ハイライト DeepSeek-R1 マルチノード H100 デプロイメント サポート FlashInfer 統合 XGrammer 統合 何が変わったか ベンチクライアント by @shihaobai in #740 #741 で @shihaobai で #741 で @shihaobai で #741 で @shihaobai で tgi_api で RETURN_LIST を追加する #742 で @shihaobai で #742 で #744 で deepseekv3 の精度を向上させる
新機能 クロスプロセスの要求オブジェクト:以前の3プロセスのアーキテクチャ設計を維持し最適化。プロセス間でアクセスできるリクエストオブジェクトを導入し、プロセス間の通信オーバーヘッドを大幅に削減した。スケジューリングとモデル推論の折りたたみ: スケジューリングとモデル推論の折りたたみを実装し、...