Home
Language
English
Türkçe
Bahasa Indonesia
About
Privacy Policy
Terms of Service
Pricing
Sign In
Download All
Share
Randy Lee
@randyli
A coder
BJ
Joined April 2010
118
Following
1
Followers
32
Posts
Randy Lee
@randyli
about 11 hours ago
@GoSailGlobal
我们公司的文档我看90%以上都是垃圾,跟实际严重脱节,文档造火箭,落地就是一个二踢脚。现在加上AI写的文档,领导更是大书特书,信息密度低到离谱。这种怎么解?
Randy Lee
@randyli
26 days ago
@FuSheng_0306
喜欢组织会议的都是中层,老板和底层员工都不喜欢会议。
Randy Lee
@randyli
about 2 months ago
@xiaogaifun
创业成功的概率:连续创业者 > 大厂基层员工 > 路人 > 中学生 >>>>>> 大厂中层
Randy Lee
@randyli
4 months ago
@ZeroZ_JQ
曾经一样的经历,心理负担超级大。别作恶,大多数同事都会理解的。遇到不合作的交给HR处理,直接告诉他自己也马上被裁。
randyli
retweeted
Ce Sun
@XiangceSun
4 months ago
https://t.co/3ckylZdqNo
randyli
retweeted
Joruno
@wsl8297
5 months ago
开源 AI 网页自动化工具:Nanobrowser。 OpenAI Operator 的开源替代方案,本地在浏览器里运行,支持多智能体协作。 免费、重视隐私、LLM 选择灵活、代码完全开源,让网页操作更智能、更高效。 GitHub:https://t.co/ng07Buw9sY 从 GitHub 下载 zip,导入 Chrome 扩展即可开始使用。
wsl8297's tweet video.
randyli
retweeted
Jason Zhu
@GoSailGlobal
5 months ago
Stanford CS336 上,Tatsu 讲了一节 LLM 架构课,把过去 3 年所有主流 LLM 拆开,看它们的共通模板 结论挺爆:90% 的架构选择已经收敛,你随便挑一个开源大模型,它跟其他模型在这些维度上几乎一模一样 讲师的原话 - 2024 年大家都在 cosplay Llama2 - 2025 年的主题是「怎么训得不崩」 - 2026 年的主题是「怎么扛住长上下文」 下面是 2026 年开源 LLM 的标准模板 你训自己的模型可以直接抄 【架构层 已经收敛的 7 件事】 1)Layer Norm 挪出残差流(pre-norm) 原版 Transformer 把 LN 放在残差里 几乎所有现代模型都挪到外面 原因:keep your residual stream clean 梯度反传更稳 2)RMS Norm 替代 LayerNorm LayerNorm 的减均��� + 加 bias 那部分实际没怎么帮上忙 丢掉之后 flops 只省 0.17% 但运行时省到 25% (瓶颈在数据搬运 计算反而次要) 3)所有 bias 项全删 跟 RMS Norm 一个道理 系统层省内存搬运 4)激活函数用 SwiGLU 或 GeGLU gated linear unit 几乎所有现代模型都用 Llama 系 / Qwen / Mistral 用 SwiGLU Google 系(Gemma / T5)用 GeGLU 区别极小 选哪个都行 5)位置编码用 RoPE 2024 年之后基本统一了 原理:把每对维度按位置旋转一个角度 让 inner product 只依赖相对位置 6)Transformer block 串联(不是并联) GPT-J / Palm 试过并联 现在基本被放弃 串联的实现优化得太好了 并联省的那点系统开销不值得损失表达力 7)Layer norm 可以「���」 哪儿不稳就在哪儿加 LN attention 之前能加 之后能加 两边都加(double norm)也可以 现代模型很多这样做 【超参数 已经收敛的 5 个数】 1)feedforward 维度 / hidden 维度 - 非 GLU 模型:4 倍 - GLU 模型:8/3 ≈ 2.67 倍(因为 GLU 多一组矩阵 要保持总参数量) - Llama 系:3.5 倍 - T5 1.0 试过 64 倍 后来 T5 1.1 改回标准 别学 2)head 数 × head 维度 ≈ hidden 维度 几乎所有模型都遵守 T5 是为数不多的例外 3)模型纵横比(hidden / 层数)≈ 100 太深 pipeline parallel 难做 太宽 表达力受限 100 这个数字是系统约束 + 表达力的平衡点 4)vocab size 单语模型:30K 左右(早期 GPT-2 那种) 多语 / 通用模型:100K-200K(GPT-4 / Llama 3 / Gemma 都在这个范围) 现代基本都是后者 5)weight decay 仍然普遍使用 但研究发现它在 LLM 里干的事其实是优化器干预 让你最终能收敛到更深的最优点 跟你想的「防过拟合」没什么关系 所以别因为「单 epoch 不会过拟合」就把它关掉 【稳定性 三个救命 trick】 训练大模型最怕中途 loss 突然飙升 然后 NaN 全军覆没 现代模型用三个 trick 防这件事 1)Z-loss output softmax 的 normalizer 容易爆 加一个 (log Z)² 的正则项 让 Z 始终接近 1 DCLM / Olmo 都用 2)QK norm attention 的 Q 和 K 在矩阵乘之前各加一个 LN 让 softmax 的输入永远是单位尺度 multimodal 圈先用起来 现在所有大模型都加 3)Logit soft cap(仅 Google 系) attention logit 用 tanh 硬封顶 Gemma 2/3/4 都在用 但会损失一点点性能 慎用 【Attention 两个新趋势】 1)GQA(Grouped Query Attention)几乎统一 原版 multi-head 推理时 KV cache 会让算术强度崩到 1/h GQA 共享 K 和 V 但保留多个 Q 表达力几乎不损失 推理成本砍掉 80% 现在所有要做生产部署的大模型 没有不用 GQA 的 2)局部 + 全局 attention 交替 处理长上下文的新方式 Cohere Command A 起头 现在 Llama 4 / Gemma 4 / Olmo 3 全在用 比如每 4 层有 1 层 full attention 其他 3 层是 sliding window 只看附近的 token 比纯 SSM 更稳 比纯 full attention 便宜得多 (Qwen 3.5 做了变体 把 sliding window 那 3 层换成 SSM) 收尾一句 如果你正在训自己的 LLM,上面这一套就是 2026 年的「默认配置」 不需要重新发明,直接抄 如果你只是想看懂 GitHub 上那些 modeling_xxx.py 这一份足够你不再被术语吓住
See More
GoSailGlobal's tweet video.
Randy Lee
@randyli
5 months ago
@jinchenma_ai
一辈子当好学生习惯了。这是拿捏好学生最好的方法,考试成绩差首先怀疑自己能力不够。所以大厂都喜欢招985、211的学生。
Randy Lee
@randyli
5 months ago
@FinanceYF5
如果交给一个卖鸦片的人搞,估计一年就可以了。
randyli
retweeted
花叔
@AlchainHust
5 months ago
https://t.co/PBOR71f4cZ
Randy Lee
@randyli
5 months ago
@AlchainHust
我自己的切身体会,让claude code review文��,先定义领导的角色(性格特征),再review,结果马上不同,更容易通过
Randy Lee
@randyli
5 months ago
@FinanceYF5
与拼夕夕并称“中国法制进程的耻辱柱”
randyli
retweeted
雨哥向前冲
@xiangxiang103
5 months ago
这位老哥发现的Claude Code稳定不降智的技巧,配置文件如下 { "effortLevel": "high", "env": { "CLAUDE_CODE_DISABLE_1M_CONTEXT": "1", "CLAUDE_CODE_DISABLE_ADAPTIVE_THINKING": "1", "CLAUDE_CODE_DISABLE_AUTO_MEMORY": "1", "CLAUDE_CODE_SUBAGENT_MODEL": "sonnet" } }
randyli
retweeted
摸鱼巨匠🔨
@ChatGptAstra
5 months ago
关注这些优质 AI 博主和优质资讯源,从此你不再有信息焦虑 一、优质AI博主推荐(排名不分先后) 1. 雪踏乌云
@Pluvio9yte
技术大牛。分享 AI 实战和出海知识的干货达人,各种《Hermes Agent 从 0 到 1 教程》、《Harness Engineering 驾驭工程》质量都非常高。 2. Rachel
@Zesee
前微软和亚马逊员工,现 AI 营销平台创业者。不仅分享很多 AI 实用干货,也分享 AI 产品的开发过程和行业洞察。 3. 柿子
@yaohui12138
AI 产品经理。擅长用产品思维拆解 AI 产品,日常分享AI搞钱实战、编程系列教程以及AI工作流实操等干货内容。 4. 鱼总说AI
@AI_Jasonyu
中文独立开发者 + AI 实战内容创作者。专注于 AI 工具实战、出海产品经验、SaaS & APP 变现等内容。 5. Ashlyn
@AshlynHe1129
AI配饰创业者。既被何一主动问候并关注,也被竞品高调抄袭��已经充分说明了这个账号的含金量。平时分享个人成长、品牌历程和行业思考。 6. Jason
@skaas77
7 ManuCN AI 社区创始人、AI 创业者。正在进行 365 天开发 365 个项目的挑战,我从他的项目开发中学到了非常多的干货。 7. ServaHuang
@servasyy_a
i 古早程序员出身。分享 AI 生图、Openclaw 和 Claude Code 实战技巧、AI 出海干货,涵盖的领域非常广。 8. 小将
@nftbanke
r 欧洲 GenAI 大会主办方、最大的欧洲华人出海社区创始人。如果你对 AI 副业、出海创业、Web3 感兴趣,他的推文是高质量的信息源。 二、优质资讯源推荐 1. Bestblogs 汇集顶级编程、人工智能、产品、科技文章和微信公众号文章,专为开发者提供优质内容。 链接:https://t.co/rc9Eh7dsbv 2. Follow-builders skill 如果嫌 Bestblogs 的信息还是太多太杂,张咋啦老师的这个 Follow-builders skill,精选了 8 个顶级 AI 博客、25 个 Builders 在社媒平台上的关键帖子和见解。 如果不想看完整内容,还可以让你的 Agent 总结摘要,每日/每周给你推送。 链接:https://t.co/KiibJ016XD 3. 由
@Saccc_
c 老师精选的 25 个 Tg 频道,点击链接即可一键关注。 链接:https://t.co/MAUzXGVqIw 以上 AI 资讯可能有部分重复,大家可以按需筛选,确保自己有优质的信息源紧跟浪潮! 另外,大家也可以关注一下我 @SunNeverSetsX,致力于挖掘优质 AI 博主和推送 AI 前沿资讯。
See More
randyli
retweeted
宝玉
@dotey
5 months ago
https://t.co/CdLb5LM1YK
randyli
retweeted
宝玉
@dotey
5 months ago
https://t.co/4RgB8oF4DA
Randy Lee
@randyli
6 months ago
@InterestingSTEM
That's very USA !!!
Randy Lee
@randyli
6 months ago
@BTC__Sunny
万斯是屯了多少比特币啊
Randy Lee
@randyli
6 months ago
@tangjinzhou
价格马上就被打下来了,就没多大意思了
Randy Lee
@randyli
6 months ago
资本家不会因为驴跑的快了就让驴早点休息,而是让驴拉更大的磨
Last Seen Users on Sotwe
RUSLY AL-MALKY رسلي المالكي
Seen from
Turkey
hijab
Seen from
Turkey
evLi godOoş ANKARA.
Seen from
Turkey
ชอบสาวแก่ รุ่นแม่ยาย
Seen from
Thailand
Dieguinho
Seen from
Italy
👠♠️الديفا جيهان
Seen from
Egypt
دانيل | Daniel🧚🏻♂️
Ensest
Seen from
Turkey
NSFW Beautiful girls
Seen from
Turkey
GR Bella
Trends for you
1
Fox News
Under 10K tweets
2
Destiny
Under 10K tweets
3
Belarus
Under 10K tweets
4
Newsmax
Under 10K tweets
5
Grok 4.7
Under 10K tweets
6
Marathon
Under 10K tweets
7
Fifth Third Park
Under 10K tweets
8
$META
Under 10K tweets
9
#OlandriaxMFWSS27
Under 10K tweets
10
Paramount
Under 10K tweets
Most Popular Users
1
Elon Musk
@elonmusk
241.7M followers
2
Barack Obama
@barackobama
119M followers
3
Cristiano Ronaldo
@cristiano
114.3M followers
4
Donald J. Trump
@realdonaldtrump
111.9M followers
5
Narendra Modi
@narendramodi
107.2M followers
6
Rihanna
@rihanna
98.7M followers
7
NASA
@nasa
92.4M followers
8
Justin Bieber
@justinbieber
91.8M followers
9
KATY PERRY
@katyperry
90M followers
10
Taylor Swift
@taylorswift13
83.9M followers
11
Lady Gaga
@ladygaga
75.4M followers
12
Virat Kohli
@imvkohli
73.3M followers
13
Kim Kardashian
@kimkardashian
70.9M followers
14
YouTube
@youtube
68.8M followers
15
Neymar Jr
@neymarjr
66.3M followers
16
Bill Gates
@billgates
65.1M followers
17
Selena Gomez
@selenagomez
63M followers
18
The Ellen Show
@theellenshow
62.3M followers
19
CNN
@cnn
61.8M followers
20
X
@x
60.7M followers
Olivia
Online
✨
⭐
💫