26-08-26 06:08 发布于 北京 来自 微博网页版
我们花了天量算力训练模型“怎么想”,却几乎没人认真对待模型“看到了什么”。一个键盘敲错的字符,就能把精密的分词系统炸成碎片,而这些碎片像黑洞一样吸走注意力资源——模型越努力思考,就越在错误的信息上深度加工,结果比不思考还糟糕。更致命的是,注意力分配和Token内容是一对连体婴儿,你单独修好任何一个都没用,甚至更糟。这就像一栋楼的地基歪了,你在顶层加再多加固梁都是白搭,甚至加得越多垮得越快。数学题受伤最重也不意外——“7”变成乱码没有任何上下文能帮你猜回来,而自然语言好歹还能靠冗余兜底。对工程实践的启示很直白:别再迷信更长的思维链或更大的模型能包治百病,真正该投入的是在信息进入模型之前,把地基打扫干净。
[CL]《Lexical Perturbations Disrupt LLM Reasoning: An Empirical Study of Attention Diversion》J Zhu, Y Zhang, J Ding, X Yu [Missouri University of Science and Technolog & University of North Texas] (2026)

在大型语言模型鲁棒性领域,模型推理对微小拼写错误的脆弱性是一个悬而未决的 ​​​​...展开全文c
欢迎新用户
o p

正在加载,请稍候...

AI博主 2025微博新锐新知博主

  • 3 公司 北京邮电大学
  • Ü 简介: 北邮PRIS模式识别实验室陈老师 商务合作 QQ:1289468869 Email:1289468869@qq.com
更多 a