IA Sin Censura
登录 打开聊天

AI的过滤从哪里来,又是怎么去掉的

阅读约 2 分钟

AI的过滤从哪里来,又是怎么去掉的

AI聊天工具的过滤由3层构成:模型本身的微调、服务的隐藏指令,以及外部的审核系统。无审查AI从一个经过微调、愿意回答的模型出发,不再添加另外两层。这不是在带过滤的模型上耍的花招:这是另一个模型、另一项服务。

人们谈起过滤,好像它是一个开关。实际上它是在不同时刻做出的一组决定,弄懂这些决定,就能明白为什么有的聊天工具拒绝,有的不拒绝。

本页内容
  1. 第1层:模型的微调
  2. 第2层:服务的指令
  3. 第3层:外部审核
  4. 无审查AI对每一层是怎么处理的
  5. 开放模型是怎么重新微调的
  6. 什么不会变
  7. 关于无审查AI的常见问题

第1层:模型的微调

模型先用海量文本训练,再用示例微调它该如何回答。在第二步里,会教它拒绝某些请求等等。这是最深的一层:拒绝本身就是模型的一部分。

第2层:服务的指令

几乎所有聊天工具都会在你的问题之前加一段隐藏文字,里面有关于语气、话题和身份的规则。这是最容易改动的一层,因为它只是一段文字。加什么内容,由每家公司自己决定。

第3层:外部审核

有些服务会把问题或回答交给另一个系统,由它对内容分类,并切断或替换它认为敏感的部分。这一层作用于文本,所以它产生的提示总是一模一样。

无审查AI对每一层是怎么处理的

它从一个公开发布的开放模型出发,经过微调或重新微调,让它回答而不是拒绝。此外,服务不再添加限制话题的指令,也不再加会裁剪回答的外部审核。只去掉一层是不够的,因为其余各层仍然会拒绝。

开放模型是怎么重新微调的

已知有两条路。一条是用模型确实作答的示例重新微调。另一条是一种技术,能在不完全重新训练的情况下,降低模型拒绝的倾向。两者都从开放模型出发,开放模型的权重是公开的,而大公司的封闭模型并非如此。

什么不会变

模型仍然只知道它学到的东西,也可能出错。重新微调的小模型很坦率,有时不够精确。而涉及未成年人的性内容这条界限,无论去掉哪一层,在所有语言中都保持不变。

关于无审查AI的常见问题

这和越狱是一回事吗?

不是。越狱是试图说服带过滤的模型无视过滤。无审查AI使用的是另一个没有这种拒绝的模型,不需要去说服它。

使用重新微调的模型合法吗?

一般来说合法。开放模型以允许微调的许可证发布。你拿回答去做的事必须遵守法律。

大公司为什么不这样做?

因为它们要对监管机构、广告商和数百万不同的用户负责,宁可多拒绝。这是风险上的决定,不是技术上的。

能在我自己的电脑上运行一个吗?

如果你的设备内存足够,可以。能装进普通电脑的模型,比在线服务里的模型要小。

在这里比较一下没有拒绝层的模型是怎么回答的。

打开无审查聊天

用大白话讲清楚“无审查AI”