v0.32.6
変更点 Qwen3.5 はApple GPU でより速く、MLX エンジンは現在モデルの MTP ヘッドを使用して推測的な解読を行う。 /v1/chat/completions ストリーミングは、現在 OpenAI のワイヤーフォーマットと一致している。最初のスラックでの役割のみ、独自のスラック上の finish_reason,およびstream_options.include_usage と別のスラックでの使用。短縮されたOpenAI応答は、現在 finish_reason: "longth" を"to...