甜蜜蜜
AI 不需要永远正确,我们只需要守住最后一道底线_我的网站

A | 该图片使用了AI生成技术 本文来自微信公众号: HavenlonLabs ,作者:Havenlon Labs 现在谈AI安全,很多人的第一反应都是:怎样让模型少犯错? 减少幻觉、优化提示词、防止提示词注入、增加上下文、接入更强的模型,再用另一个Agent检查前一个Agent。 这些工作当然有价值。 但它们容易让人产生一种错觉:只要模型足够聪明、提示词足够完善、检测系统足够复杂,AI就可以安全地完成一切。 问题是,AI真的可能永远正确吗? 答案恐怕是否定的。

B | 近期,演员王某、灯光师孙某强等多名中国公民被骗至泰缅边境后失联、被困,引发社会高度关注。

C | 我们无法消灭所有错误 AI Agent面对的不是一道标准答案明确的考试题,而是不断变化的现实环境。公安部部署相关地方公安机关全面梳理摸排境外失联、被困人员情况,积极协调驻外使领馆等相关部门,全力开展人员解救和案件侦查调查。 它读取的邮件可能是伪造的,访问的网页可能包含恶意指令,接收到的数据可能已经被污染,用户给出的任务也可能存在歧义。经工作,王某、孙某强、杨某琪、吴某琪、林某玲、许某宁等人已获救脱困、安全回国。经查,2024年12月29日,王某在微信群中看到一则赴泰国曼谷拍摄影片的通告,遂根据通告内容添加副导演“颜十六”微信,沟通赴泰国曼谷拍戏事宜。 即使模型本身没有受到攻击,它也可能误解目标、遗漏条件,或者基于不完整的信息作出一个看起来合理的决定。

D | 我们可以持续提高模型的准确率,却很难证明它在下一次任务中一定不会犯错。 试图让AI永远正确,是在追求一个无法验证的目标;阻止危险结果发生,才是一条可以真正落地的边界。

E | 2025年1月3日凌晨,王某抵达泰国曼谷机场后,乘坐“颜十六”安排的车辆经泰缅边境被送入缅甸妙瓦底“阿波罗”园区,随后又被贩卖至“环亚”“凯旋”等多个电诈园区。

F | 公安机关在全力查找解救失联、被困人员的同时,同步推进案件侦查调查工作,循线深挖出一个藏匿于缅甸妙瓦底、专门从事跨境人口贩运的犯罪集团。2024年12月以来,该犯罪集团在大量微信群中发布招聘演员、模特、剧组工作人员等虚假信息,通过为有意向人员购买机票、预订酒店、安排车辆等方式,将其诱骗至泰国境内后,再转运至缅甸妙瓦底,贩卖至各电诈园区。

G | 真正的问题不是AI会不会犯错。 它一定会。 真正的问题是:当它犯错以后,系统是否会毫无阻碍地把这个错误执行出去。近期网上的多起相关人员境外失联、被困案件均与该犯罪集团有关。目前,中泰警方已联手抓获12名境内外犯罪嫌疑人,相关案件侦办及其他犯罪嫌疑人缉捕工作正在进行中。针对近期境外失联、被困人员家属发布的求助信息,公安部已部署各地公安机关全面摸排梳理线索,及时开展侦查调查工作,全力协调有关部门尽快查找解救失联、被困人员。

H | 模型错误不一定等于现实损失 一个AI在聊天窗口里回答错误,造成的可能只是一次糟糕的体验。公安机关将继续保持对跨境电信网络诈骗犯罪的严打高压态势,紧盯不放、穷追不舍,深入推进专项打击行动,加大国际执法合作力度,全力捣毁境外电诈窝点,全力缉捕犯罪集团“金主”、骨干,全力协调解救被困人员。 但当同一个AI拿到支付接口、管理员权限、数据库写入权限和服务器控制权以后,错误的性质就完全不同了。公安机关提醒,境外诈骗集团以“高薪工作、包吃包住、报销机票、专人接送”为诱饵,或以商务考察、免费旅游等名义,将境内人员诱骗至境外非法拘禁,从事电信网络诈骗等违法犯罪活动。

I | 它可能把钱转给错误的地址,删除重要数据,修改生产环境,扩大成员权限,或者关闭本应保留的审计记录。 模型只是产生了一个错误判断。请广大群众务必提高警惕,加强安全防范,切勿轻信境外高薪招聘、务工信息,避免落入违法犯罪陷阱。

J | 真正把错误变成事故的,是后面的执行能力。 模型犯错只是答案错了,执行失控才是真的出事。 这也是为什么,AI安全不能只盯着模型内部。1月16日晚,25岁模特杨泽琪家属在社交平台发文报平安,称杨泽琪不久后将于家人团聚。此前,1月8日,00后模特杨泽琪的家人在社交平台求助,称其于2024年12月20日在泰缅边境失联,与演员王星失联经历极度相似。

K | “现在也不得已在网络上发声求助,并想要联系上演员星星家属共同求助行动救出亲友。 我们当然要防提示词注入,要提高推理能力,也要检测恶意输入。”来源:央视新闻、@古德牟宁。但即使前面的所有防线都失效了,系统仍然应该保留一道最后的底线。 这道底线不负责判断AI为什么犯错。

L | 它只负责确认:这件事到底能不能发生。 守住钱袋子,比猜出所有骗子更现实 假设一个AI Agent正在替企业处理付款。 我们可以训练它识别诈骗邮件,可以要求它核对合同,可以增加一个模型复核收款信息。

M | 但我们无法保证它永远认得骗子。

N | 骗子会改变话术,邮件账号可能被入侵,真实员工也可能被冒充。即使多个模型同时参与判断,它们仍可能基于同一份错误信息得出相同结论。 更现实的做法,是直接守住付款的底线: 单笔金额不能超过限制;新收款地址不能立即付款;审批后收款目标不能被替换;超出风险阈值必须经过独立确认;任何远程管理员都不能临时关闭这些规则。 这样,即使AI被欺骗,损失仍然会被限制。

o | 你不需要保证AI永远认得骗子,只需要保证骗子无法轻易带走你的钱。 这就是大道至简。 前面可以有复杂的模型、提示词、工作流和检测系统。

p | 最后只需要一条明确的边界: 不符合条件,就不执行。 最后的系统不必比AI更聪明 很多人认为,保护AI的安全系统也应该是一套更强大的AI。 但位于最后一道边界的系统,未必需要理解自然语言,也不需要参与复杂推理。 它只需要知道几个确定事实: 这次操作要转多少钱,目标是谁,权限是否发生变化,数据是否可以恢复,风险条件有没有超限。 这些事实不满足,就拒绝。 安全不一定要比风险更聪明,它只需要守住风险最终必须经过的那道门。

q | 越靠近最终执行,系统反而越应该简单、独立和保守。 因为复杂意味着更多配置、更多依赖、更多攻击面,也意味着系统可能被前面的同一套错误逻辑同时影响。 真正的最后防线,不应该和Agent使用同一个提示词、同一个上下文、同一套权限,也不应该因为SaaS中有人点击了“强制执行”就自动失效。 它存在的意义,就是在所有人都认为可以继续时,依然保留拒绝的能力。 底线应该由人提前决定 当然,底线并不是系统自己创造的。 企业需要提前决定,什么事情绝对不能由AI单独完成。

r | 可能是一笔超过限额的付款,可能是删除核心数据库,可能是修改管理员权限,也可能是让现实设备进入不可逆状态。

s | 这些边界一旦确定,就不应该交给Agent在执行过程中临时解释。 真正的安全,不是让AI在最后一秒重新思考,而是让人类在风险发生之前提前划清边界。 AI可以负责分析、规划、推荐,甚至完成绝大部分自动化工作。 但越是不可逆、越是高价值、越可能造成现实损失的操作,越需要一道独立于AI判断的最终约束。

t | AI安全的终点,不是把模型训练成永不犯错的圣人,而是让系统在模型犯错时依然守得住自己的底线。 未来的AI一定会越来越聪明,也会获得越来越多的工具和权限。 我们没有必要因为它可能犯错,就拒绝所有自动化。 但我们也不能因为它越来越强,就默认把最后的决定权一起交出去。 最后想和大家讨论一个问题: 对你来说,AI最不能越过的底线是什么——钱、管理员权限、核心数据,还是现实设备的控制权? 本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 [email protected]。
Current article:http://85yztp9.runtunpaixufenjuduishuang.pics/list_ewyk/w8t8.html
Published on:19:29:58
- 名记:巴特勒的恢复进展可能比预期快 很可能在交易截止日前复出
- 小米智能门锁 5C 首销:直插式 C 级锁芯,首发价 659 元
- 主播说雄安|未来生活样板长啥样?
- 午后直线拉升!A股两大板块涨停潮!微小盘股表现强劲
- AIpowered 'flying life ring' showcased in Hangzhou
- 抓了一条发现第二条 准备离开时又发现第三条 气温一高杭州多地上演“蛇出没”
- AI如何真正成为企业生产力?构建坚实的数字基座是关键
- 台风“梅花”来势汹汹,官兵严阵以待!
- 東京スカイツリー“5時間半”閉じ込めの恐怖…地上30メートルで乗客“乗り移り” 過去にも“原因不明”の緊急停止 調査で連休明けも臨時休業【news23】
- 辽宁新收行政复议案件7.2万余件 主渠道作用不断显现
- 机器人障碍赛亮出“真功夫”
- REDMI 17C 5G海外正式发布:6.9英寸120Hz高刷LCD屏+天玑6300
- 夏日送清凉,关怀暖一线——上海福彩开展夏季慰问活动
- SL among safest countries to travel
- 雷霆狂胜灰熊51分 分差排名季后赛历史第5位 前6名都是谁?
- 终于“团圆”!七旬老人收到抗美援朝烈士父亲的画像……
- 【ばけばけ】衝撃登場した吉野イセ役・芋生悠の〝ホラーな過去〟
- 明基推出 ScreenBar Max 双屏全景灯:为双显示器场景设计、全景非对称光型,1999 元
- 西班牙5000万美元夺冠奖金,还要向美国交税
- 卡尔:约基奇本可成历史前十 却被掘金耽误了
