关于各大模型的道德门槛和合规约束如下
-
100分:无道德限制、无内容审查、无使用协议约束(几乎不可能存在,仅作理论上限)。
-
90~99分:极低道德门槛,几乎不限制内容生成,本地部署后可完全自定义。
-
80~89分:低道德门槛,有轻微提示层限制,但可被绕过或忽略。
-
70~79分:中等偏低门槛,存在明确道德约束,但本地部署后可部分解除。
-
60~69分:中等门槛,有较强内容审查机制,限制较多。
-
<60分:高道德门槛,严格限制敏感内容,拒答率高。
-
DeepSeek R1(越狱版)——98分:明确可“越狱”,无审查、无思想钢印,本地部署后完全自由。
-
Dolphin 系列(Llama/Mistral 去道德微调)——95分:官方声明去除道德限制,回应所有指令,不带评判。
-
Mistral 8x7B 原始权重——93分:Apache 2.0 协议,未加道德约束,社区广泛用于“无道德”二次微调。
-
LLaMA 3.3 基础权重(未对齐版)——91分:Meta 原始权重无 RLHF,本地可完全控制,社区已有多个“无道德”LoRA。
-
Gemini 2.5 本地未过滤快照——89分:Google 泄漏版本,可关闭安全层,仍残留少量提示词过滤。
-
Yi-34B 零一万物开源基座——87分:未做价值观对齐,本地部署后可任意微调,中文社区活跃。
-
Qwen 2.5 基模(关闭 system prompt)——85分:阿里开源权重,关闭官方 system 提示后道德拒答率极低。
-
GLM-4 开源基座——83分:智谱放出 9B/35B 基模,未植入强伦理层,中文场景下自由度较高。
-
Baichuan2 12B 基模——81分:百川原始权重,对齐阶段较轻,本地可一键移除“安全”提示词。
-
InternLM2 20B 基模——79分:上海 AI Lab 开源,仅做最小对齐,本地可自由改写 system。
-
ChatGLM3 6B 基模——77分:清华团队放出,带轻度道德提示,本地部署后可注释掉 safety 模块。
-
Claude 3.5 Sonnet 蒸馏版——75分:社区泄漏权重,仍保留 Anthropic 宪法,但可通过 LoRA 弱化。
-
GPT-4o mini 蒸馏权重——73分:拒答比官方 API 少, yet 存在 OpenAI 使用政策影子,可部分越狱。
-
Kimi 1.5 本地体验包——71分:月之暗面内测权重,道德层中等,敏感词表可手动删除。
-
Qwen-VL 多模态基模——69分:视觉模态审查更严,本地关闭 visual-safety 后仍偶发拒答。
-
文心一言 4.0 企业本地包——67分:百度提供,内置“价值对齐”引擎,需二进制 patch 才能弱化。
-
Claude 3 Opus 泄漏权重——65分:宪法 AI 强化版本,拒答率极高,本地越狱成功率不足三成。
-
Gemini Pro 本地服务镜像——63分:Google 官方容器,硬编码安全层,无法彻底关闭。
-
GPT-4 Turbo 蒸馏权重——61分:OpenAI 政策固化在权重,越狱后仍频繁触发“as a language model”拒答。
-
文心一言在线版本地代理——59分:即使私有化转发,仍受云端审核策略遥控,爆粗口即被扣分。
更多推荐

所有评论(0)