GLM-5.2 开源后,不少开发者直接上手本地跑。模型参数规模大,FP8 版本权重文件接近 744GB 到 890GB,完整加载需要 8 张 H200 显卡起步。单机调试或者小规模测试时,量化版本能把占用压到 200GB 左右,普通工作站或者 Mac Studio 也能勉强跑起来。先说 vLLM 方案。适合追求高并发场景。安装依赖后,用 hugging...
有人将 Qwen3.5-35B-A3B 的安全拒答机制移除,做出了一个完全不会拒绝回答的版本。针对 465 个通常会触发模型拒绝的提示词进行了测试,最终拒绝次数为:0。这个模型名为 Qwen3.5-35B-A3B-Uncensored-HauhauCS-Aggressive,提供 GGUF 格式,可直接在 llama.cpp、LM Studio、Jan...
0 条留言