Home
Language
English
Türkçe
Bahasa Indonesia
About
Privacy Policy
Terms of Service
Pricing
Sign In
Download All
Share
delete未来
@deleteZb
实事求是,高效专政是通往发达国家的唯一道路。台北新加坡韩国都是如此。另外,改革开放已经30年了,别盯着几十年的事批判,刻舟求剑了。最终民主的目的是什么?是为了人民生活更好,不是为了民主而民主
Joined July 2023
243
Following
56
Followers
3.1K
Posts
Pinned Tweet
delete未来
@deleteZb
4 months ago
@quanquanyyqq
@chen_lin62535
@Scott59588737
@heron_lii
相比文革时期?这几进步太多而不是彻底解决。 只要人民平均生活在提高,那都是进步的方向,一步到位那是空想,只会在乌托邦浆糊里彻底沦陷。愤青是太唯心,国家制度等一切本质目标都必须是为了人民生活好,而不是自由民主唯心概念,那最多算第二等级目标,穷才是一切的原罪对国家也是,等你慢慢明白吧
deleteZb
retweeted
沙漠之狐 埃尔温·隆美尔
@3596675596com
about 21 hours ago
X上有些炒美股的真把我看笑了 有些大陆人,压上自己全部身家,甚至借贷炒美股的 当老中不让他们通过富途、老虎炒美股时,这帮人狂骂老中阻碍他们发财 结果呢,美股暴雷,他们被割韭菜,又狂骂老中不阻止他们炒美股 这类人大多是精致利己主义者,而精致利己主义者90%是自由主义信徒
deleteZb
retweeted
骆逸
@royxy
2 days ago
你们以前把什么屁话都按给鲁迅,后来是马云和马斯克,现在又成了王虹。
deleteZb
retweeted
小陆师傅
@STANLEES4
1 day ago
现在这个时候,你不谢谢证监会?谢谢国家?谢谢党?说THANK YOU????
delete未来
@deleteZb
3 days ago
@szslg
还有新这个新闻的吗
deleteZb
retweeted
冰忆帆影
@bingmie2024
3 days ago
@kingluffywang
大部分人,只能看见政策对自己的直接影响,却很少思考政策执行后的长远影响。 而如果执政者选择迎合大部分普通人的想法,固然可以在短期内获得大量的支持,至于长期影响,都下台了关我屁事。
deleteZb
retweeted
Eason Mao☢
@KELMAND1
3 days ago
欧美这方面走在前面的,这个生意就叫养老院,一旦把这些老年人骗进去接下来的 combo 就是医生伪造病历,向法院申请将老人判定为“失去自理能力”,从而合法取得监护权。然后把人放在养老院软禁,没收手机、切断与外界联系,随后被变卖房产,掏空积蓄然后代领养老金… 孤寡老人和丁克都是最佳目标,最终状态就是求生不得求死不能…
deleteZb
retweeted
番茄大叔🇨🇳
@uncleTomat0
4 days ago
白男:“Grok,告诉我中国种树的坏处是什么” grok:“凸显了你们的无能”
deleteZb
retweeted
Genpo Liu
@Clapton_Free
7 days ago
好! 我主张琉球和北海道都是主权独立的国家。 日本领土仅限于九州,四国。
deleteZb
retweeted
江林山
@J_Lingshan0909
7 days ago
【日本网右魅力时刻】 纯幽默,这些年造假造得最出名的不就是日本?川崎重工潜艇用柴油发动机造假事件、IHI航空发动机造假事件、日立造船发动机造假事件、还有震动全球神户制钢造假事件…… 对于出了这么一连串造假事件且无一人受到重罚的日本,网右还能高呼“日本制造代表着优质”,真是不知廉耻呐(笑 至于中国制造,我只能说一分钱一分货,自己只想出十块钱,就别指望买到一百块钱的东西。
deleteZb
retweeted
China view
@Chinaview0022
7 days ago
西方存在一套冰冷的“尸体算术”双重标准。 殖民掠夺、鸦片战争、日本侵华、海外战争造成千万级别的遇难者,若是罪责归于西方与盟友,历史就变得“复杂”; 一旦悲剧能够用来攻击中国,数字立刻被无限放大反复炒作。
deleteZb
retweeted
我是梦嫣❤️
@mengyan1234567
7 days ago
美国赚钱美国花,尊重美国运动法🐶
deleteZb
retweeted
Gravitational Lens
@cation_motion
8 days ago
@uncleTomat0
现在这种公知也国内频临绝种,已经扩散到新加坡联合早报求生存了
deleteZb
retweeted
番茄大叔🇨🇳
@uncleTomat0
8 days ago
打开家中仍然还珍藏的意林随便翻了两页,一股浓郁的“公知味”扑面而来。这篇《中国拼快,印度拼慢》公知味尤为浓烈。和大家一起品读品读….
deleteZb
retweeted
磊哥聊政经
@leige88888
8 days ago
英国《每日电讯报》:中国的月之暗面(Moonshot)以“全面AI共产主义”威胁西方。 洋杂除了意识形态已经没有P可以放了
deleteZb
retweeted
外汇交易员
@fxtrader
9 days ago
#WAIC
强脑科技(BrainCo)工作人员在讲解与演示智能仿生手的使用。
fxtrader's tweet video.
deleteZb
retweeted
谣言终结者
@Justice53_07_27
10 days ago
为什么美国和伊朗打得难解难分? 因为世界进步了,而美军的战术还停留在1990年海湾战争。 虽然这30多年来美军有一些新装备服役,比方说F22和F35,死神无人机,JDAM,LRASM之类的“远距离”导弹,但是美军的战术战法本质没有改变,还是海湾战争时期那一套: 先派出电子战飞机进行压制,同时用反辐射导弹和战斧等偷袭一波,定点清除对方的雷达和指挥系统,像戳人眼睛一样尽量让对方变成瞎子。接下来雷达低可探测的飞机(隐身飞机)去消灭剩下的雷达和防空,取得绝对制空权。最后各种战术飞机,轰炸机都可以安全的去对手脸上丢泥巴,用很低的成本密集投掷大量的炸药,炸到对方失去斗志。哪怕对面有几架漏网之鱼的飞机能侥幸起飞,在美军强大的电子战面前也是聋子瞎子,很快就会被美军的空优战机点名。 这种战术成立有两个必要条件,第一个是绝对制空权,哪怕不隐身的美军飞机也可以如入无人之境一样随意乱飞,这需要对面的防空彻底清零。第二是飞机能密集高强度出动,这就需要在对手附近有大量可用的空军基地,缩短飞机的出击距离和间隔。 海湾战争时期,联军有2700多架飞机狂轰乱炸,伊拉克也没见过隐身飞机,加上苏式防空的资料泄露,伊拉克的防空很快被瓦解。伊拉克的远程打击手段也仅限于不准确的飞毛腿导弹,而且仅发射了90枚左右。 30年后同样的战术在伊朗碰的头破血流: 1.伊朗挖了很多山洞把各种设备隐藏了起来,加上各种假目标,让很多防空系统在战争初期苟了下来,尤其是东部山区。美军也不蠢,危险区域会先用死神无人机探路,但是去一架死一架,今天已经有30架死神被击落,占美军死神总数的1/5。哪怕是西部,伊朗还有一些不需要雷达开机的光电/红外被动探测防空导弹(打中F-35的那个),虽然射程近但是生存性很高,让美军飞机时刻都是提心吊胆的。到今天为止,美军也只是取得对伊朗的局部空中优势,没有制空权。 2.利用之前找大陆租/买的卫星,伊朗能用导弹和无人机高强度的准确打击周边阿联酋和沙特的美军空军基地,使得美军飞机不得不转移到更远更安全的以色列,约旦,甚至欧盟的空军基地。本来两小时可以飞个来回的,现在飞行员要嗑药加上空中加油才能完成一次打击,还要担心神出鬼没的漏网防空导弹,打击效率大打折扣。如果只用导弹打击,价格太高库存也不够。而美军至今也没有实装有效拦截无人机的反无人机设备,导致最近的几个军事基地几乎废弃无法使用。 通俗点说,打战和游戏一样,双方都有血条,射程和攻击力。以前美军攻高,射程还比别人远,打对方自己不掉血,容易完胜。现在的美军虽然初期攻击力还是挺高的,但是别人的射程远了,也能让美军掉血了,还带特效把美军打出僵直了,导致美军输出越来越低。 问题是伊朗的血条是整个团结一心的国家加上后面的不知名大国,美国的血条只有中东的基地+双航母和美国爸爸,除非开挂,这场战争结果已经很明显了。
See More
Justice53_07_27's tweet video.
deleteZb
retweeted
谣言终结者
@Justice53_07_27
12 days ago
@EndWokeness
deleteZb
retweeted
中華人民共和国駐日本国大使館
@ChnEmbassy_jp
13 days ago
人民日报:2026年是《国际捕鲸管制公约》签署80周年,也是国际捕鲸委员会商业捕鲸暂停令生效40周年。作为《联合国海洋法公约》《生物多样性公约》等多项国际公约的缔约国,日本负有保护海洋珍稀物种的国际法义务。大肆猎杀鲸类,本质是对国际公约宗旨的践踏,奉行“合则用、不合则弃”的功利规则观,与其口中的“国际法治”完全背道而驰。)
deleteZb
retweeted
kAI
@_kaichen
12 days ago
Kimi K3 时间线,应该在 2025 年底启动训练,经过 3~4 个月时间完成这个体量的预训练,在 2026 年 5 月内部开放使用这个模型,7 月正式发布。中间在4月和6月还发布了 K2.5 的后训练增强版 K2.6 和 K2.6。 逻辑线索如下, Kimi 在 2026 年初新闻传出完成 C 轮 5 亿美金融资,用于 K3 训练和开发。当时说的“不急于上市”,可能就是 K3 三倍于当时国产模型规模给的信心。 K2.6 (4月)和 K2.7 (6月)两个型号都是典型的后训练增强型号,与 K3 后训练时间重合,可能存在共享与演练,特别是 Long-horizon 能力与 Agent Swarm 能力。K2.7 着重优化 Reasoning 效率,非常像是后训练阶段后期调优。 Kimi Code 开发者
@real_kai42
几条推文串起来,6 月份说 5 月份重新设计 Harness,并使用的是 K3 消耗上千美金等值 Token(当时可能普遍猜测用的是 Claude/GPT)。 此外,Kimi CLI 开发者,现 slock/raft 创始人
@istdrc
在 42 章经播客上说过,2 月份离开有个原因,是 Kimi 模型不能满足驱动 slock AI 群聊。大概率那时内部还用不到 K3。
See More
deleteZb
retweeted
宝玉
@dotey
12 days ago
杨植麟在 GTC 2026 的一次演讲"How We Scaled Kimi K2.5":月之暗面想把 AI 训练中三个沿用了近十年的基础组件,重新做一遍。优化器 Adam(2014 年)、注意力机制(2017 年)、残差连接(2015 年),三个 Transformer 时代的地基组件,月之暗面各给了一个替代方案,而且全部开源。 但这场演讲讲的不只是 K2.5,而是月之暗面过去一年多的技术路线:开源模型还能从哪里继续变强,又该怎样逼近闭源模型的前沿水平。 杨植麟把答案拆成了三个方向:让每个 Token 更值钱、让更长的上下文真正发挥作用,以及让多个 Agent 同时协作。 此外,他还分享了两个重要进展:视觉训练如何反过来增强文本能力,以及月之暗面刚刚公布的下一代架构 Attention Residue。 【一、数据不够,就让每个 Token 更值钱】 大模型训练正在遇到一个越来越现实的问题:高质量数据快不够用了。 互联网上真正有价值的文本数量有限,模型越做越大,需要的数据越来越多,大家迟早都会撞上“数据墙”。既然高质量数据很难翻倍,月之暗面的思路是:能不能让模型从同样的数据里学到更多? 他们给出的答案是 MuonClip,用它替代已经用了十多年的 Adam 优化器。 MuonClip 基于 Muon 优化器。简单理解,它会在更新模型参数时,尽量让不同方向上的信息保持独立,减少重复和浪费,从而提高训练数据的利用效率。 月之暗面的实验结果是:使用同样数量的数据,MuonClip 的训练效果接近把数据量增加一倍,这不仅意味着训练成本下降,也意味着模型能力的上限可能被推高。 假设手里只有 50 万亿个高质量 Token,如果 Token 利用效率提高一倍,就相当于又多出了 50 万亿 Token。在优质数据越来越稀缺的情况下,这种效率提升比单纯增加算力更重要。 但 Muon 也有一个明显问题:模型扩展到万亿参数后,注意力层里的数值容易失控。 月之暗面在训练中发现,注意力层的最大 logit 会突然飙升到 1000 以上,而正常范围通常只有 50 到 100。一旦数值继续膨胀,训练曲线就会发散,整个训练过程可能直接崩掉。 为了解决这个问题,他们设计了 QK-Clip。它会在模型前向计算时,实时检查每个注意力头的最大 logit。一旦数值超过安全范围,就同步缩放 Q 和 K 的投影,把数值压回来。 这个操作不会改变训练的收敛效果,只负责维持数值稳定。 靠着 QK-Clip,月之暗面成功把 Muon 扩展到了万亿参数规模,并训练了超过 15 万亿 Token,整个过程中没有出现一次 loss spike。 【二、上下文不只是要长,还要真正有用】 第二个方向,是提高模型利用长上下文的能力。 杨植麟展示了 Scaling Law 论文作者 Jared Kaplan 等人曾经做过的一组实验:比较 Transformer 和 LSTM 在不同上下文长度下的预测效果。 LSTM 读到一定长度之后,效果很快就不再提升。继续增加上下文,模型也很难从中获得更多信息。Transformer 则不同。上下文越长,模型对后续内容的预测通常越准确,而且很难看到明显的饱和点。 这个特点在 Agent 时代尤其重要。复杂 Agent 任务可能持续几天甚至几周。模型需要记住之前做过什么、得到过哪些结果、哪些方向已经失败,以及接下来该做什么。如果长上下文不能持续提供有效信息,Agent 的任务链条就很容易断掉。 问题是,标准的全注意力机制成本太高。它的计算量会随着上下文长度平方增长。上下文扩大十倍,注意力计算量可能增加一百倍。到了百万 Token 级别,训练和推理成本都会变得非常高。 月之暗面的解决方案是 Kimi Linear,核心是一种名为 KDA,也就是 Kimi Delta Attention 的线性注意力机制。KDA 的关键,是让模型学会“哪些信息要长期保留,哪些信息可以快速忘掉”。 传统线性注意力通常只有一个全局衰减系数,控制整个模型的记忆速度。这有点像所有内容共用同一个遗忘按钮:要么一起记住,要么一起忘掉。KDA 把一个衰减系数拆成了多个。不同信息通道可以使用不同的遗忘速度: - 有些通道衰减得很慢,负责保留长距离信息 - 有些通道衰减得很快,及时腾出空间吸收新内容 实际使用时,Kimi Linear 并没有完全抛弃全注意力,而是把线性注意力层和全注意力层按照 3∶1 的比例混合。 杨植麟称,这是第一个在短上下文、长输入和长输出任务上,都能全面超过全注意力的架构。上下文扩展到百万 Token,甚至更长时,它的效率优势会更加明显。 【三、从一个 Agent,变成一支 Agent 团队】 前两个方向都在提升单个模型的能力。第三个方向,则是让多个 Agent 一起工作。月之暗面把这种方式叫作 Agent Swarm,也就是“智能体集群”。 它的组织方式很像一家公司。一个主 Agent 充当 CEO,负责理解目标、拆解任务,并把不同子任务分配给多个子 Agent。子 Agent 可以分别扮演研究员、程序员、数据分析师和事实核查员等角色。任务完成后,主 Agent 再汇总结果。 这样做最大的价值是把串行任务改成并行任务。过去,一个 Agent 可能需要依次搜索资料、阅读文档、分析数据、编写代码、检查事实。现在,这些工作可以交给几十个甚至几百个 Agent 同时完成,从而大幅缩短复杂任务的执行时间。 不过,要让模型真正学会并行协作并不容易。训练 Agent Swarm 时,月之暗面设计了三种奖励: 第一种是“实例化奖励”,鼓励主 Agent 创建更多可以并行执行的子任务,避免它退化回单 Agent 串行工作。 第二种是“完成奖励”,要求子任务必须真正完成,防止模型为了获得实例化奖励,批量创建没有意义的空任务。 第三种是最终结果奖励,用来判断整个任务是否真正解决。 这三种奖励的权重会随着训练过程动态变化。训练前期更重视任务拆解、并行化和子任务完成率,后期则逐渐把重点转向最终结果。 从演示结果看,Agent Swarm 在复杂任务上能明显缩短执行时间。比如: - 同时下载、阅读几百个信息源并完成研究 - 并行撰写一份上百页文献综述的不同章节 - 同时分析十个不同的数据集 Kimi K2.5 发布时,Agent Swarm 已经支持最多 100 个 Agent 并行工作,整个任务最多可以执行 1500 个步骤。4 月发布的 K2.6 又把并行 Agent 的上限提高到了 300 个。 【四、一个意外收获:练“视觉”,也能让“大脑”变聪明】 K2.5 和前代 K2 之间,一个重要变化是采用了“早期融合”训练。 过去很多开源多模态模型采用的是“后期融合”:先用大量文本训练出一个语言模型,再用相对少量的视觉数据补上看图能力。 例如,先训练 20 万亿个文本 Token,再用大约 2 万亿个多模态 Token 把视觉能力“贴”上去。 K2.5 的做法不同。 它从训练一开始,就把视觉和文本数据混在一起。在 K2 文本基座的基础上,K2.5 又训练了约 15 万亿个混合 Token。 这种方式带来了两个让杨植麟感到兴奋的结果。 第一个发现是:只训练视觉任务,也能提升模型的文本推理能力。 研究团队只让模型完成数数、识别图片和视觉问答等任务,没有加入数学或编程训练。结果模型的文本推理能力也变强了。 换句话说,模型在练习“看”的同时,“想”的能力也得到了提升。 第二个发现则来自相反的方向:如果文本基座足够强,模型甚至不一定需要专门的视觉 SFT 数据。 K2.5 采用了“零视觉 SFT”方案。所有监督微调数据都是纯文本,然后再通过文本与视觉联合的强化学习,让模型获得视觉能力。最终,它在视觉任务上的表现依然接近最先进水平。 杨植麟认为,这种双向迁移来自早期融合。 当文本和视觉被放进同一个表征空间后,一种模态学到的能力,就有机会迁移到另一种模态。这也是 K2.5 能够“看图写代码”的基础。 如果视觉和文本仍然像两个彼此分开的“大脑”,这样的跨模态能力就很难自然出现。 【五、下一步:用注意力机制替代残差连接】 演讲快结束时,杨植麟介绍了月之暗面刚刚发布的一项新研究:Attention Residue,也就是“注意力残差”。这篇论文发布于 3 月 15 日,距离演讲只有两天。 残差连接是现代深度神经网络最重要的基础技术之一。2015 年,何恺明等人提出残差网络,此后残差连接逐渐成为 Transformer 的标准组件。它的基本做法是:每一层不仅处理上一层的结果,还保留一条直接传递信息的通道。这样即使模型很深,信息和梯度也能顺利通过,模型才有可能稳定训练。 杨植麟引用了 Ilya Sutskever 的一个说法:残差连接可以被理解为“旋转了 90 度的 LSTM”——LSTM 在时间维度上传递信息,残差连接则在网络深度上传递信息。 月之暗面顺着这个类比继续往前走了一步。 既然 Transformer 已经用注意力机制替代了 LSTM 在时间维度上的循环结构,那么在深度维度上,是否也能做同样的替换? Attention Residue 就是这个思路的产物。 标准残差连接主要使用上一层的输出。Attention Residue 则允许当前层查看所有前序层的输出,再通过注意力机制决定:哪些历史信息值得保留,哪些信息可以忽略。 也就是说,模型不再只能被动接收上一层的结果,而是可以主动从整个计算历史中挑选信息。 为了控制计算成本,月之暗面实际采用的是分块版本 Block Attention Residual。它会把模型层分成多个块,比如每 16 层组成一个块。块内继续使用标准残差连接,块与块之间才使用注意力残差。 实验显示,大约 8 个块就能获得大部分收益。 Attention Residue 带来了约 24% 的 Token 效率提升。 按照杨植麟的算法,如果有 50 万亿个高质量 Token,效率提高 24%,就相当于额外增加了 12 万亿个 Token。它在 GPQA、MATH 和 HumanEval 等推理、数学与编程测试上的提升尤其明显。 【三个用了近十年的组件,都还有改进空间】 演讲最后,杨植麟把月之暗面的三个替代方案放在了一起: - Adam → MuonClip - Full Attention → Kimi Linear - Residual Connection → Attention Residue 它们分别对应大模型训练中的三个基础问题: - 怎样从有限的数据中学到更多 - 怎样更高效地利用超长上下文 - 怎样让深层网络更灵活地传递信息 三个方案都可以相对独立地替换现有组件,也都已经开源。 这些技术能否直接叠加,增益能否简单相乘,目前还没有经过完整验证。但它们至少说明了一件事:很多被认为“已经足够好”的基础组件,可能远没有到达终点。 在优质数据越来越少、训练成本越来越高的情况下,继续堆参数和算力并不是唯一的路。重新设计优化器、注意力机制和残差连接,同样可能带来可观的提升。 这也是杨植麟整场演讲真正想表达的观点。 正如他最后所说: > “Open models cannot be just open; they have also to be great.” 开源模型不能只是开放,还必须足够强。 注:本视频由 https://t.co/L0sZizDFrd 翻译
See More
dotey's tweet video.
Last Seen Users on Sotwe
Baim xXx
Seen from
Indonesia
ثلاثيني داعر
Seen from
United States
Goddess Chloe ✨
Seen from
Sweden
NO.7
Seen from
Indonesia
coloradowet
Seen from
United States
Hiburan random
Seen from
Indonesia
上交你的欲望
Seen from
Japan
ALEX BRAND
Seen from
France
Khanh Duy
Seen from
Vietnam
🇹🇷 25K
Seen from
Germany
Trends for you
1
Fauci
Under 10K tweets
2
5th Amendment
Under 10K tweets
3
#AsteroidRH
Under 10K tweets
4
Pleading the 5th
Under 10K tweets
5
Good Wednesday
Under 10K tweets
6
Gary Peters
Under 10K tweets
7
Glen Hansard
Under 10K tweets
8
#WeStandWithBTS
Under 10K tweets
9
Hump Day
Under 10K tweets
10
Kavinsky
Under 10K tweets
Most Popular Users
1
Elon Musk
@elonmusk
241.1M followers
2
Barack Obama
@barackobama
119.1M followers
3
Cristiano Ronaldo
@cristiano
112.3M followers
4
Donald J. Trump
@realdonaldtrump
111.8M followers
5
Narendra Modi
@narendramodi
107.1M followers
6
Rihanna
@rihanna
98.1M followers
7
NASA
@nasa
92.2M followers
8
Justin Bieber
@justinbieber
91.3M followers
9
KATY PERRY
@katyperry
88.6M followers
10
Taylor Swift
@taylorswift13
82.5M followers
11
Lady Gaga
@ladygaga
74M followers
12
Virat Kohli
@imvkohli
71.4M followers
13
Kim Kardashian
@kimkardashian
70.3M followers
14
YouTube
@youtube
68.7M followers
15
Bill Gates
@billgates
64.4M followers
16
Neymar Jr
@neymarjr
64.3M followers
17
The Ellen Show
@theellenshow
62.4M followers
18
CNN
@cnn
61.8M followers
19
Selena Gomez
@selenagomez
61.7M followers
20
X
@x
60.8M followers
Olivia
Online
✨
⭐
💫