Claude Fable和Claude Mythos 5同时发布:留意力机制下愈增强大的AI大模子

[复制链接]
发表于 2026-6-22 08:59:19 | 显示全部楼层 |阅读模式
2026年10月6号,Anthropic”两连发“:Claude Fable和Claude Mythos 5同时发布。
AI本事愈加的强大,而且更加的全面。
每一次AI新动态的发布,都预示着AI本事的又一次增强。
但AI的本事,不是一下变强的,而是有一个不停学习不停进化的过程!
这统统,可以从十年条件及……
2016年,AlphaGo击败了天下围棋冠军柯洁。一时间,AI统治天下的说法甚嚣尘上。
但很快人们发现,谁人只会下棋的AI,脱离棋盘就什么也不会了。它不熟悉猫,不会写邮件,更不懂什么叫"本日加班好累"。
这险些是全部传统AI的缩影:专精一件事,换个使命就抓瞎。

大语言模子改变了这个局面。
它不再是一个只会下棋的AI,而是真正学会了"语言"自己。学会了语言之后,写作、编程、翻译、分析、对话,全部这些本来必要专门AI才气做的事,一个模子全部搞定。
那么,大语言模子到底是怎么炼成的?
传统AI的语言逆境

在明白大语言模子之前,有须要先明白它踩过的坑。
2017年从前,AI处理处罚语言的方式,提及来有些鸠拙。
它读一句话,是从左到右逐词推进的。读到第三个词时,只能参考前两个词的意思;读到第十个词,前九个词的意思已经暗昧了,更看不到反面的内容。这就好比蒙着眼睛读书,每读一个词,前面的内容就在影象里渐渐褪色。
这种"单向阅读"的范围,带来一个根天性的题目:AI很难明白语境。
"苹果"在"我买了三斤苹果"里指的是水果,在"苹果又发布新品了"里指的是公司。这两个意思,平凡人扫一眼就能分辨,但传统AI做不到,它必要人提前把全部大概的表明告诉它,否则遇到了就只能是瞎猜。
更贫困的是,传统AI靠"死记硬背"来工作。一个词是什么意思、一个句子该怎么翻译、一段话是正面的照旧负面的,这些规则都必要人工一项项写进去。换个场景,整个过程就要重来一遍。你让AI辨认猫,要专门用猫的图片练习;让它辨认狗,又得重新开始。每一个新使命,都是从零出发。
这种模式的天花板很低:规则越写越多,维护越来越难,泛化本事险些为零。
2017年,一篇论文彻底冲破了这种逆境。
Transformer:留意力改变统统

2017年6月,Google发表了一篇论文,标题叫《Attention Is All You Need》。翻译过来是"留意力就是你所必要的统统"。
这篇论文厥后被称为AI行业的"iPhone时候"。它带来了一种全新的模子架构,名为Transformer,彻底改变了AI处理处罚语言的方式。
Transformer的核心创新叫做留意力机制(Attention Mechanism)。
原理并不复杂。处理处罚一句话里的某个词时,留意力机制让AI同时看到整句话里全部的词,然后自己判定:当前这个词和哪几个词的关系最密切,应该重点参考哪一个。

这就像你读一句话,不是逐字死抠,而是抬起头来,一眼扫已往,立即知道哪些词是关键词,哪些词是修饰语,哪些词和哪些词在相互呼应。
留意力机制带来了一个关键本事:上下文学习(In-Context Learning)。
简朴来说:不必要重新练习模子,只必要给几个例子,AI就能学会一项新使命。
举个例子。你想让AI判定一段话是正面的照旧负面的感情。传统做法是先网络大量标注数据,再练习一个专门的分类模子。而现在,你只必要给AI看几个例子:

  • "本日加薪了!"是正面的
  • "这篇陈诉写得太烂了"是负面的
  • "项目终于上线了"是正面的
然后问它"老板本日夸我了"是什么感情?AI立即就能判定出来。整个过程没有重新练习,零资本,几秒钟搞定。
这种"见招拆招"的本事,是Transformer带来的最大突破。
大语言模子是怎样炼成的

有了留意力机制打底,大语言模子的练习才成为大概。但"有了一个好架构"和"炼成一个真恰恰用的模子"之间,还隔着漫长的工程过程。
大语言模子的练习分为三个阶段。
第一阶段:预练习(应有尽有)

预练习的目标,是让模子"熟悉天下"。

练习方式提及来很直接:给大模子一段话,盖住反面的内容,让它推测被盖住的是什么词。一开始,模子推测得完全不对,但随着练习的推进,它渐渐学会了语法规则、究竟知识、逻辑推理,乃至一些根本的知识。
这个过程必要三样东西:海量数据、巨大算力、漫长时间。
以GPT-5 Ultra为例,公开资料体现它利用了凌驾15万亿个Token的练习数据,参数规模到达万亿级别,必要斲丧数万块高端GPU,耗时数月。预练习烧掉的钱,通常以亿美元盘算。
预练习给模子带来了海量的知识储备。但光有知识还不敷,模子像一个读遍天下书的学者,却不知道怎么和人谈天。这就是第二个阶段要办理的题目。
第二阶段:微调——学会对话

微调的核心思绪,是通过高质量的问答样原来调解模子的举动。
练习数据长如许:"问:怎样写一封正式的工作邮件?答:开头要称谓对方,分析来意,正文要条理清楚,末了要体现感谢和等待复兴。"
模子通过这些例子学会明白题目、构造答复、给出有用的信息。再也不是照本宣科,而是有来有往的对话感。
由于知识已经在预练习阶段装进去了,微调的资本比预练习低得多。但微调的质量直接决定了模子"好不好用"。一个微调得好的模子,答复专业题目条理清楚;微调得差的模子,答复题目东拉西扯,不知所云。
第三阶段:强化学习(对齐人类偏好)

微调后的模子能正常对话了,但答复质量七零八落。有人喜欢严谨专业的答复,有人喜欢轻松生动的交换。强化学习的使命,就是把模子的举动调到符合人类预期的方向。
详细做法很故意思:让大模子针对同一个题目天生多个答复,由人工给这些答复打分排序。模子根据打分反馈不停调解,一轮又一轮,直到它的答复越来越符合"好答案"的标准。
颠末这种练习,Claude变得更守旧严谨,遇到不确定的题目倾向于说"这个我不清楚";ChatGPT变得更健谈,乐意实验答复各种题目,即便答案大概不敷美满。
涌现本事:规模出古迹

在不停练习的过程中,研究职员发现了一个风趣的征象。
当模子大到某个临界点时,某些本相识忽然出现,在此之前完全检测不到。
最典范的例子是头脑链推理(Chain-of-Thought),即让AI一步步拆解题目再给出答案。这种本事在小模子上险些不存在,参数规模一旦凌驾临界点,就会像被点亮一样涌现出来。
GPT-3有1750亿参数,GPT-5 Ultra参数规模到达万亿级别。两者的本事差距不是线性的,而是跳跃式的,不是一个比一个强一点,而是一个能做的事,另一个根本做不了。
这种"量变引起质变"的征象,被研究职员称

明白这一点,对我们明白大语言模子很紧张:模子的本事不是匀称提升的,而是在某个规模门槛忽然解锁的。这也是为什么,大模子的竞争本质上是算力和数据的竞争,规模决定本事。
它真的"懂"了吗

大语言模子已经能写文章、分析数据、帮你做决议,但一个根本题目始终悬而未决:它真的"明白"语言了吗?
严酷来说,大语言模子的本质是"推测下一个词的概率分布",而不是"检索准确答案"。它知道什么样的句子听起来像实话,但它并不知道哪些是实话、哪些是编造的。这种征象,业界叫做幻觉(Hallucination)。
一个经典的测试是:问AI"鲁迅和周树人是不是同一个人",它答对的概率很高;但问"周作人是鲁迅的什么人",它就开始编故事了。编得有模有样,平凡人根天职辨不出来。
这不是AI在撒谎,它只是不知道自己在颠三倒四。
这个范围很紧张。明白了这一点,就知道AI是一个"很会语言、但不愿定说实话"的工具,而不是一个全知全能的百科全书。
用它来处理处罚必要高准确性的使命时,肯定要给它富足的信息参考,要求它标注不确定的答案,大概在关键决议前交织验证多个模子的结果。
大语言模子的意义,不光在于它能做许多事,更在于它证明了"通用"这条路是走得通的。一个模子可以学会写作、编程、翻译、分析,不必要为每件事单独练习一个AI。
这种通用性,是AI真正从"工具"走向"助手"的开始。

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

登录后关闭弹窗

登录参与点评抽奖  加入IT实名职场社区
去登录
快速回复 返回顶部 返回列表