AI的过滤从哪里来,又是怎么去掉的
AI聊天工具的过滤由3层构成:模型本身的微调、服务的隐藏指令,以及外部的审核系统。无审查AI从一个经过微调、愿意回答的模型出发,不再添加另外两层。这不是在带过滤的模型上耍的花招:这是另一个模型、另一项服务。
人们谈起过滤,好像它是一个开关。实际上它是在不同时刻做出的一组决定,弄懂这些决定,就能明白为什么有的聊天工具拒绝,有的不拒绝。
第1层:模型的微调
模型先用海量文本训练,再用示例微调它该如何回答。在第二步里,会教它拒绝某些请求等等。这是最深的一层:拒绝本身就是模型的一部分。
第2层:服务的指令
几乎所有聊天工具都会在你的问题之前加一段隐藏文字,里面有关于语气、话题和身份的规则。这是最容易改动的一层,因为它只是一段文字。加什么内容,由每家公司自己决定。
第3层:外部审核
有些服务会把问题或回答交给另一个系统,由它对内容分类,并切断或替换它认为敏感的部分。这一层作用于文本,所以它产生的提示总是一模一样。
无审查AI对每一层是怎么处理的
它从一个公开发布的开放模型出发,经过微调或重新微调,让它回答而不是拒绝。此外,服务不再添加限制话题的指令,也不再加会裁剪回答的外部审核。只去掉一层是不够的,因为其余各层仍然会拒绝。
开放模型是怎么重新微调的
已知有两条路。一条是用模型确实作答的示例重新微调。另一条是一种技术,能在不完全重新训练的情况下,降低模型拒绝的倾向。两者都从开放模型出发,开放模型的权重是公开的,而大公司的封闭模型并非如此。
什么不会变
模型仍然只知道它学到的东西,也可能出错。重新微调的小模型很坦率,有时不够精确。而涉及未成年人的性内容这条界限,无论去掉哪一层,在所有语言中都保持不变。
关于无审查AI的常见问题
这和越狱是一回事吗?
不是。越狱是试图说服带过滤的模型无视过滤。无审查AI使用的是另一个没有这种拒绝的模型,不需要去说服它。
使用重新微调的模型合法吗?
一般来说合法。开放模型以允许微调的许可证发布。你拿回答去做的事必须遵守法律。
大公司为什么不这样做?
因为它们要对监管机构、广告商和数百万不同的用户负责,宁可多拒绝。这是风险上的决定,不是技术上的。
能在我自己的电脑上运行一个吗?
如果你的设备内存足够,可以。能装进普通电脑的模型,比在线服务里的模型要小。
在这里比较一下没有拒绝层的模型是怎么回答的。
打开无审查聊天