GLM-5.2 本地部署多框架实操

GLM-5.2 开源后,不少开发者直接上手本地跑。模型参数规模大,FP8 版本权重文件接近 744GB 到 890GB,完整加载需要 8 张 H200 显卡起步。单机调试或者小规模测试时,量化版本能把占用压到 200GB 左右,普通工作站或者 Mac Studio 也能勉强跑起来。先说 vLLM 方案。适合追求高并发场景。安装依赖后,用 hugging...

Qwen3.5 去限制版本上线:零拒答,4090 也能本地运行

有人将 Qwen3.5-35B-A3B 的安全拒答机制移除,做出了一个完全不会拒绝回答的版本。针对 465 个通常会触发模型拒绝的提示词进行了测试,最终拒绝次数为:0。这个模型名为 Qwen3.5-35B-A3B-Uncensored-HauhauCS-Aggressive,提供 GGUF 格式,可直接在 llama.cpp、LM Studio、Jan...