Home
Language
English
Türkçe
Bahasa Indonesia
About
Privacy Policy
Terms of Service
Pricing
Sign In
Download All
Share
shorlock Cheng
@ShorlockC
Joined September 2022
189
Following
12
Followers
70
Posts
ShorlockC
retweeted
小盖
@xiaogaifun
1 day ago
强烈推荐大家读一读 Qwen3.8-Flash 的 Tech Report,真的非常精彩。 我读完之后最大的感受是,它没有发明什么惊天动地的新架构,更像是把过去一两年模型领域里出现的重要新技术,以恰当的方式重新组合到一起,而且取得了不错的效果。看这个论文的过程,有点像新技术大阅兵。 Qwen3.8-Flash 当初的目标很明确,就是尽可能保持甚至提升模型的智能水平,同时大幅降低训练和推理成本。 所以最后这个模型主干参数是 125B,每个 Token 只激活 6B,另外还有 51B 的 n-gram Embedding 参数。 和上一代的 Qwen3.7-Plus 相比,它只用了大约 1/3 的激活参数、1/3 的训练 Token,所以整体训练 FLOPs 只有大约 1/9。 Benchmark 的表现上,Qwen3.8-Flash 在其中 8 项超过上一代 Qwen3.7-Plus,剩下 6 项的最大差距也只有 2.6 分。所以,它的智能水平还是相当不错。 我们可以把 Qwen3.8-Flash 的改造理解成四次比较大的手术。它们分别在解决四个问题: 1、Attention 成本太高,尤其是长上下文下的计算开销。 2、模型层数深了以后,前面的重要信息容易被后面的信息冲淡。 3、增加参数往往也会增加计算成本。 4、训练过程还会出现不稳定,训练效率也还有提升空间。 第一刀先动 Attention。 传统的 Full Attention 机制有一个很明显的问题。当前 Token 在计算的时候,要回头看前面所有的 Token,所以一旦上下文变长,要算的东西就会越来越多,成本也会跟着迅速上升。 这两年,很多模型公司都在优化注意力机制。Qwen3.8-Flash 这次大量采用的是 GDN。 GDN 可以简单理解成一种可更新的记忆。模型不需要每次都重新查看前面所有 Token,而是不断把过去的信息压缩进一个固定大小的状态里。 这样上下文继续增长,保存和读取历史信息的成本不会像 Full Attention 那样快速增加。 但压缩记忆肯定没法完整保留所有细节,所以 Qwen 没有完全放弃 Full Attention。一开始的结构是三层 GDN 加一层 Full Attention,大部分时候依靠 GDN 保存和传递历史信息,隔几层再让模型直接查看完整上下文。 到了后续的长上下文继续预训练阶段,Qwen 又把这些 Full Attention 层换成了 QSA,也就是 Qwen Sparse Attention。这样最终的结构就变成了三层 GDN 加一层 QSA。 Sparse Attention 的思路很好理解,没必要每次都查看全部历史内容,先找出最相关的一部分。 但这里还有一个问题。假如上下文已经有 100 万 Token,你光从这 100 万 Token 里找出哪些最重要,本身也可能很贵。 QSA 做的就是继续降低这一步的成本。它先把相邻 Token 压缩成一个个小 Block,让一个轻量的 Indexer 判断哪些 Block 最重要,然后只针对选中的内容计算 Attention。 效果非常明显。上下文达到 1M 时,QSA 的 Attention 模块在 Prefill 阶段提速 7.6 倍,Decode 阶段提速 4.9 倍。 第二刀是 Residual(残差)。 传统 Transformer 里,各层的信息都在同一条 Residual Stream 里不断累积。前面的层写入一些信息,后面的层继续往里面增加新的内容。 模型越来越深以后,早期的一些重要信息就会不断和后面的信息混在一起,越来越难保留下来。 Qwen3.8-Flash 的思路是一条通道不够,那就扩成四条。 于是有了 Gated Residual。模型同时维护四条 Residual Stream,每一层需要信息的时候,再通过 Gate 判断应该从不同通道里读取多少。 这样一些信息可以留在某条通道里,不需要一直和后面所有的新信息挤在一起。 更有意思的是,模型训练完以后,这四条通道真的出现了不同的分工。 论文分析了多个 Checkpoint,发现其中一条通道主要负责保存和传递更早的信息,另外三条更多负责附近几层之间的信息流动。 也就是说,这四条 Residual Stream 最后自己出现了分工,其中一条明显更负责长距离的信息传递。 第三刀是 n-gram Embedding。 这一刀解决的问题是,怎么给模型增加更多参数,又尽量不让计算量跟着一起增加。 Qwen 的办法,是在 Backbone 之外加一层 n-gram Embedding。n-gram 可以简单理解成连续几个 Token 组成的短片段。 模型会把当前 Token 前面的几个 Token 组合成短片段,当成一个索引,直接去一张很大的表里取出对应的向量,再补充到当前 Token 的表示中。 这和把参数继续堆进 Backbone 有很大区别。n-gram Embedding 每次只需要查表里很少的几个位置,不需要让这几十亿参数都参与计算。 所以表可以做得很大,每个 Token 增加的计算量却非常有限。Qwen3.8-Flash 最后在这里放了 51B 参数。 而且这 51B 参数可以放在 Host Memory,也就是服务器内存里,不需要一直占用 GPU 显存。 模型计算第一层的时候,就提前把第二层需要的数据读进来,所以 Qwen 最后把 n-gram Embedding 放在了第二层。 第四刀是训练。 除了改模型架构,Qwen 这次还重新调整了整个训练方案,其中一个重要变化是把 Muon 作为主要优化器。 Muon 是一种优化器,可以简单理解成训练模型时,决定参数每一步怎么更新的方法。Qwen 在实验中发现,Muon 加上前面的新架构以后,模型的训练稳定性明显提高。 即使把 Learning Rate 调到正常水平的数倍,训练依然比原来的 Qwen3.5 + AdamW 稳定很多。 稳定性提高以后,原来那套训练参数也未必还是最优的。 所以 Qwen 重新拟合了 Scaling Law,通过较小规模的实验去推算大模型更合适的 Learning Rate 和 Batch Size。结果发现,这两个值都可以往上调。 更大的 Learning Rate 可以加快收敛,更大的 Batch Size 则可以提高大规模训练时的并行效率。 他们还重新测试了 Batch Size Warmup。过去训练大模型时,经常会先用较小的 Batch Size,再慢慢增加。 Qwen 发现这样做最终效果并没有更好,同样的训练 Token 反而需要多跑 18.8% 的参数更新步骤,所以这次直接取消了。 我觉得这篇 Tech Report 最值得看的,确实就是 Qwen 怎么做这些技术取舍。 因为前面提到的 GDN、QSA、Gated Residual、n-gram Embedding、Muon,这些技术其实都不是第一次出现。 Qwen3.8-Flash 的参数规模也不算大,所以他们这次做的事情,很像是把过去一两年模型领域里出现的这些新技术,重新放到一个新的模型里头,然后一项一项去看效果。 模型 Scaling 越来越转向架构效率。或者说,架构、效率和优化本身就是一个耦合系统。因为一个技术到底好不好,不能只看 Training Loss。 技术报告里有很多这样的例子。有些改动对 Loss 的影响很小,但最后的 Benchmark 会明显变好。也有一些方案在预训练阶段看起来完全没问题,继续训练或者做完后训练以后,效果反而会变差。 就连 Batch Size Warmup 这种已经用了很多年的训练方法,他们重新验证以后也发现没有收益,反而多跑了 18.8% 的优化步骤。 所以现在做模型架构,已经很难只看某一个指标了。一个改动加进去以后,要同时看最终能力、训练成本、推理效率和训练稳定性,甚至还要看它会不会改变最合适的 Learning Rate 和 Batch Size。 记得报告最后提到,现在真正卡住他们的一个瓶颈,已经变成了 Evaluation Throughput。 他们最需要的是一种更便宜的中等规模实验,可以提前判断一个架构最后做完后训练以后到底行不行。这样才能更快地试更多方案,也更快地把真正有效的技术筛选出来。 这个思路还挺有意思。 Tech Report 见评论区。
See More
shorlock Cheng
@ShorlockC
3 days ago
@CDTChinese
没看懂
shorlock Cheng
@ShorlockC
3 days ago
@liyaosha
这太狗血了吧
shorlock Cheng
@ShorlockC
3 days ago
@BBCWorld
地图也打不开了
shorlock Cheng
@ShorlockC
3 days ago
谷歌地图的吉隆地图被涂了,什么也看不到,其他地区都能看,谁设置的模糊显示
shorlock Cheng
@ShorlockC
about 1 month ago
中国的人才培养机制,产生不了像王虹这样的人 大家对顶级高校的质疑,本质是对这套评价体系的质疑 不知道为什么,现在的教育体制选拔人才包括那套标准跟过去的科举制有什么区别,不过是上层建筑为了选拔自己所用人才的一种手段而已。
shorlock Cheng
@ShorlockC
about 1 month ago
长大后才喜欢社会学、政治学、英语也能发现乐趣,因为英语的工具性太重要了;而数学更能发现是所有学科的基础,如果是几何更有兴趣 但是为什么这些在上学的时候一点都感受不到这些学科的魅力和乐趣呢
shorlock Cheng
@ShorlockC
about 1 month ago
多年后再看陈丹青的访谈,你还是能感觉到那种真正的学者对制度的无奈和愤怒 评价衡量人才的标准很多,但是中国只有一种 很多人如果意识不到现在的人才选拔制度仅仅是为了走形式 看邓小平时候,有一点印象,选拔人才的标准到底是怎么走到今天这个样子的
ShorlockC
retweeted
Rahul
@sairahul1
2 months ago
https://t.co/cNjzPk9FpS
shorlock Cheng
@ShorlockC
4 months ago
水晶净化与安宁 https://t.co/c03yfLeH1G
ShorlockC
retweeted
Berryxia.AI
@berryxia
4 months ago
Claude 正在吞噬一切。 以下是它目前实际功能的完整地图: 1. 把这张图发到你们团队的 Slack 或群聊里。 2. 大多数人只用 3 个功能,其实有 25+ 个。 3. 下载所有信息图:https://t.co/M5YWSqibVS 4. 不用付任何费用,在欢迎邮件里免费获取。 5. 然后领取我的 Notion,里面有我所有的 Claude 文件。 1. Chat → 你输入,它回复。 ☑ 务必使用 Opus 4.7。 ☑ 始终开启“Extended Thinking”(扩展思考)。 ☑ 我现在几乎不用 Chat 了,只用 Cowork。 2. Cowork → 真正改变一切的功能。 ☑ 它能读取你的文件,创建真实文档。 ☑ 它会在乱猜之前先问你问题。 ☑ 复制我的精确设置:https://t.co/wyBBCeiQgr 3. Code → 英语就是新的代码语言。 ☑ Claude 为你编写、调试并交付代码。 ☑ 你一行代码都不需要懂。 ☑ 如果你不是在构建产品,可以跳过。Cowork 就够用了。 4. Projects → 持久化的记忆。 ☑ 一次性上传文件,Claude 会记住它们。 ☑ 每个客户一个 Project,每个主题一个。 ☑ 现在已整合到 Cowork 中,甚至更好。 5. The Models → 选择正确的大脑。 ☑ Opus 4.7:最聪明,用于深度工作。 ☑ Sonnet 4.6:快速,你的日常主力。 ☑ Haiku 4.5:便宜,只用于快速任务。 6. Context System → Claude 如何了解你。 ☑ Markdown 文件取代你的提示词库。 ☑ AskUserQuestion:Claude 反过来向你提问。 ☑ Global Instructions:设置一次,永远不用再输入。 7. Skills → 教一次,永久复用。 ☑ 为你重复的每个任务创建一个 Skill。 ☑ 输入 / 来触发它,就像训练好的员工一样。 ☑ 一个好的 Skill 可以取代整个 SOP(标准操作流程)。 8. Integrations → Claude 进入你的工具中。 ☑ 连接器:Slack、Drive、Notion 等 50+ 工具。 ☑ Claude 在 Excel 中:它知道 D14 单元格的内容是什么。 ☑ 插件:预构建包(销售、法律、营销)。 9. Create → Claude 为你构建的东西。 ☑ Artifacts:计算器、图表、仪表盘。 ☑ 真实的 .docx、.xlsx、.pptx 文件,保存在你的文件夹里。 ☑ 不只是文本,而是真正的可交付成果。 现在你只需 5 分钟 就能掌握 Claude。 但如果你还有 50 分钟,可以按以下顺序阅读: - Claude 101 完整文章:https://t.co/fsTXeSGzlC - Claude Code:https://t.co/uIKaJs21y0 - Claude Skills:https://t.co/T64hqBIdM4 - Claude for your team:https://t.co/6TnHRom6Wm - 设置 Claude Cowork:https://t.co/wyBBCeiQgr - Claude Cowork + Project:https://t.co/vrp9rEV75G - Claude 交互式图表:https://t.co/WHXLaQCDYI ♻️ 转发这张图片,帮助别人更好地使用 Claude。 (原帖附带一张信息图,展示上述功能的视觉地图。)
See More
ShorlockC
retweeted
Vikas Singh
@vikas_ai_
5 months ago
Learn AI for free directly from top companies. 1 - Anthropic: https://t.co/hDXxyMiChh 2 - Google: https://t.co/CRJq43N5gd 3 - Meta: https://t.co/PMmpNvjGVh 4 - NVIDIA: https://t.co/VXzUAqXIQH 5 - Microsoft: https://t.co/0leKbzY27c 6 - OpenAI: https://t.co/34owZ5nchO 7 - IBM: https://t.co/iLEiazLUC0 8 - AWS: https://t.co/mUS1ZbUQ9o 9 - https://t.co/NJManUGK54: https://t.co/wNWf26UwPA 10 - Hugging Face: https://t.co/ZdINw4MIGA 👇Comment "AI" for more free resources. Repost so others can benefit. Bookmark for later.
See More
ShorlockC
retweeted
宝玉
@dotey
5 months ago
Anthropic 自家设计师 Ryan Mather,一人负责公司 7 个产品线。他发的几条自己用 Claude Design 的心得,结合官方教程: 1. 别急着干活,先花一小时搭你的设计系统。 把代码库、设计稿、品牌素材全塞给 Claude,让它抽出一套 UI Kit 并直接发布。这一小时的投入,以后你每次生成设计稿,风格都会自动套用,性价比爆表。公司要全面推开,可以投入一到两周做系统沉淀,道理不变:先沉下去规范,后面才有复利。 2. 别再玩接力,跟工程师一起边聊边改。 过去那种“设计师出稿→甩给工程师实现→回来再修改”的模式,已经过时了。开个会,你们一起看着画布,边讨论边敲定方案,一场会定下来直接开发,效率拉满。 3. 结构级大改用聊天,细节调整点评论。 你想换个深色模式、布局大洗牌、新增设置面板,或者一次出多个方向,这种级别的任务用聊天界面效率最高;按钮 padding 调一下、颜色换一换、输入框改下拉菜单,这种小修小补直接在元素上评论就行,精准又快速。 4. 反馈要具体,别给模糊情绪。 官方举过一个特别好的例子:「看着不对劲」就是最差反馈,而「表单字段间距改成 8px」才是智能体最爱听的明确指令。Claude 最擅长处理具象具体的要求,不善于揣摩你抽象的审美情绪。 5. 接上 Connector,让 Claude 读懂上下文。 Ryan Mather 提到他最爱的用法:把产品吐槽会议的纪要喂给 Claude,然后出去溜达一圈,回来一份完整的解决方案 Deck 已经自动生成了。 让 Claude 干复杂又综合的脑力活儿,你腾出手做更重要、更有创造力的事。 6. 关键时刻,别怕手工慢下来。 新图标、核心插画、产品名字、品牌形象,这类活儿别指望模型给你完美答案。这不是 Claude 不够牛,而是这事儿本质上考验的是你的个人品味和判断。Ryan 把这叫作“Agentic Designing 的艺术部分”。 7. 挂代码要精准,别塞整个 monorepo。 把整个 repo 拖进去会直接卡爆浏览器,模型的上下文也被无用信息污染了。你只要挂目标组件的文件夹或 package 就够了,记得排除 .git 和 node_modules,干净利索。 再补两条官方没说的小窍门: 1) 多开几个 Chat 平行探索。 同一个想法开 3 个对话,各自往不同方向跑一段,然后再挑精华合并,比在一个对话里反复折腾要高效太多。 2) 团队 Leader 得改改你的审查流程。 以前是“人做、人审”,现在是“Claude 做、人审”,这个差别巨大。如果你不调整节奏和人力配置,工具的价值会浪费一半,审查这一步一定要重构。
See More
shorlock Cheng
@ShorlockC
6 months ago
@LuBtc888
true
shorlock Cheng
@ShorlockC
10 months ago
@tomorrowTZRJ
博主真实又搞笑,年轻时候不懂借钱出去,给朋友买房子周转,等我想买的时候,朋友一个都没钱
shorlock Cheng
@ShorlockC
11 months ago
@Mushroom_HH
不要用你的立场价值观去评价,你的格局就是生孩子,而别人获得的是另一个维度的人生。 客观讲,有失有得,世俗就是让女人生孩子,各人各有所志 不要太狭隘
shorlock Cheng
@ShorlockC
11 months ago
为什么需要奥林匹克 为什么需要竞技运动 因为人类需要坚毅,勇气,挑战,耐力…… 当你感受不到身体里的这些因子 去运动,去hiking 去重新找到人类这些优秀的因子 人总能在兜兜转转中找到属于自己的小确幸 这也是人类文明能够螺旋上升的关键 隐秘 因素
shorlock Cheng
@ShorlockC
11 months ago
@xu96175836
她现在如何了
shorlock Cheng
@ShorlockC
11 months ago
@PDDLQ 真的假的
Last Seen Users on Sotwe
سيدرا محمد
Seen from
Egypt
Billie Eilish
Julio
Seen from
Peru
Leelasree
Seen from
India
Mariana Hentai
Seen from
Turkey
DİRİ BEY
Seen from
Turkey
سنيوُرٍيتا👑
Seen from
Germany
GADIS MANJA
Seen from
Indonesia
Hugo Hunter
Seen from
United Kingdom
Galeri Enaks
Seen from
Singapore
Trends for you
1
#loveislandusa
Under 10K tweets
2
GemRadar
Under 10K tweets
3
#FELIX_SlowItDown
Under 10K tweets
4
Titi
Under 10K tweets
5
Kayda
Under 10K tweets
6
Goodwill
Under 10K tweets
7
Jungkook
Under 10K tweets
8
Rams
Under 10K tweets
9
#WWERaw
Under 10K tweets
10
Paxton
Under 10K tweets
Most Popular Users
1
Elon Musk
@elonmusk
241.5M followers
2
Barack Obama
@barackobama
119M followers
3
Cristiano Ronaldo
@cristiano
114M followers
4
Donald J. Trump
@realdonaldtrump
111.8M followers
5
Narendra Modi
@narendramodi
107.2M followers
6
Rihanna
@rihanna
98.6M followers
7
NASA
@nasa
92.4M followers
8
Justin Bieber
@justinbieber
91.8M followers
9
KATY PERRY
@katyperry
89.8M followers
10
Taylor Swift
@taylorswift13
83.7M followers
11
Lady Gaga
@ladygaga
75.2M followers
12
Virat Kohli
@imvkohli
72.9M followers
13
Kim Kardashian
@kimkardashian
70.8M followers
14
YouTube
@youtube
68.8M followers
15
Neymar Jr
@neymarjr
65.9M followers
16
Bill Gates
@billgates
65M followers
17
Selena Gomez
@selenagomez
62.8M followers
18
The Ellen Show
@theellenshow
62.3M followers
19
CNN
@cnn
61.8M followers
20
X
@x
60.7M followers
Olivia
Online
✨
⭐
💫