OBLITERATUS
提供完整流程:探测模型隐藏状态以定位拒绝方向,通过多种策略(PCA、均值差、稀疏自编码器分解、白化 SVD)提取方向,并在推理时进行干预(归零或转向),同时提供 15 个深度分析模块和可视化功能。
一句话商业模式
为对齐研究人员、红队测试人员、AI 安全评估者、本地模型实践者解决模型拒绝行为是钝器,阻碍合法研究、创意写作和红队测试,且难以精准移除,通过开源工具包,提供 abliteration 流程、分析模块和分布式数据收集提供价值,主要依靠潜在收费方式:企业支持、高级功能订阅或捐赠(假设)赚钱
商业模式画布
提供手术式移除拒绝行为的工具,保留模型能力,同时通过分布式数据收集推动社区研究
评分解析
研究分 62
这是什么
- 是什么
- OBLITERATUS 是一个开源工具包,用于理解和移除大型语言模型中的拒绝行为,基于 abliteration 技术,无需重新训练或微调。
- 给谁用
- 面向对齐研究人员、红队测试人员、AI 安全评估者以及希望完全控制本地模型的实践者。