Home
Language
English
Türkçe
Bahasa Indonesia
About
Privacy Policy
Terms of Service
Pricing
Sign In
Download All
Share
Zack
@zackkkk76
AI Native Devloper
Joined March 2020
93
Following
10
Followers
64
Posts
Zack
@zackkkk76
about 2 hours ago
@ivanalog_com
不过按目前的主流生产serving引擎来看,大显存还是非常有优势的,常见的tp ep都会带来额外的通信等all- reduce性能开销,少了显存要么跑不了要么并发受限,况且还有dspark这种speculate decoding带来的额外显存开销
Zack
@zackkkk76
3 days ago
@hhh14484291
@antiAIvo
主要还是综合性的模型推理调优,这是个综合性问题,可能涉及网卡、显存、算子等,还在学习中
Zack
@zackkkk76
4 days ago
@Nikonenes
@chasen_liao
最近七天你上班吗
Zack
@zackkkk76
5 days ago
@yetone
秦始皇开战斗机了解一下
Zack
@zackkkk76
6 days ago
@realNyarime
128G硬盘,上限就在那了
Zack
@zackkkk76
7 days ago
@bojie_li
can't agree more
Zack
@zackkkk76
7 days ago
之前用codex+gpt较多,是因为真能干活并且One-Shot Success Rate很高 ,额度也高速度快,容忍了不说人话的毛病,喜欢向前兼容,向后设计的问题也通过ponytail skill缓解了 现如今,这个组合依旧语言组织、提炼总结能力较弱、信息密度低,反观claude能把我想要的关键信息完整的展现出来且配合opus 5.5能达到更好的效果,我现在已经大量工作转移到了claude code+opus 5.5 有研究表明,一个成年人每天决策次数过多会极大影响决策质量和个人情绪,每次跟gpt对话都是n次额外的消耗,希望OpenAI可以额外训练下语言能力吧 #codex #claude #openai
See More
Zack
@zackkkk76
7 days ago
@PalaxyZen
前途无限
Zack
@zackkkk76
7 days ago
@lxfater
如果你都不知道钉子在哪里,为什么有本地跑模型这个锤子呢
Zack
@zackkkk76
7 days ago
@ivanalog_com
不同场景不同解决方案吧,端侧和在线Serving本身就有不同的需求,比如端侧/本地场景一半不会在意32并发及以上的tpot,单流的居多
Zack
@zackkkk76
9 days ago
@yzyz94837
@mylifcc
显式思考(含cot加密的部分)都是输出token,现在tps也有两种计算方式,像博主这种就是e2e tps(含ttft,openrouter也是这样做),但除此之外一般是要剔除这部分的 tpot实际上是token输出的间隔,越低输出越快
Zack
@zackkkk76
11 days ago
@ashfold
我的观点是这样,ttft理论上分离后跟tps不直接挂钩,提升并发可以增大GEMM(收益非纯线性),只要没有过饱和(tensor core、nvlink等)那就可以在一定的额度进行超卖,腾出来的算力给ultrafast和bot
Zack
@zackkkk76
12 days ago
统计了下DeepSeek-V4.1-Flash在vLLM上的首月已合并PR,在开源模型中断档领先,归根结底还是Cross-Layer KV Sharing、Two-Stage Sparse Attention、Engram相关的改动太大了,打破了原有很多共识 改动范围也很广,涉及DeepGEMM、FlashInner等 Hopper、Blackwell、RTX Pro、AMD等架构也需要额外各自适配
Zack
@zackkkk76
15 days ago
@pampas9000
@mtrainier2020
中转站也分很多种,你说的这种情况是号池,缓存命中率低的情况有很多种,最常见一种是单号限流打满fallback到其它号
Zack
@zackkkk76
16 days ago
终于在8卡H20上把DeepSeek-V4-1-Flash Decode吞吐提升到了7500toks+
Zack
@zackkkk76
20 days ago
tips:4.1 flash这个模型Expert FP8版 8卡 h20差点没跑起来,各种地方借显存,还好有E-gram
Zack
@zackkkk76
20 days ago
为了让H20在面对Ds v4.1 flash这种混合精度模型的时候能少一层精度转换,以及为了用上高性能的moe backend,做了expert权重转换和weight block size对齐,没想到还有一堆雷...
Zack
@zackkkk76
20 days ago
@worthless0red
Infra也很卷的,做研究也需要各种卡
Last Seen Users on Sotwe
ALFAHAL ALSUDANI
Traithangdam
Seen from
Vietnam
Adys/Luna
Seen from
United States
Gattouz00
Seen from
Indonesia
᠌Kondomsuz Gençler ✨️
Seen from
Germany
RozTango
Seen from
Algeria
TÜRK PORNO İFŞA PAYLAŞILAN VİDEOLAR (🔥ZEVKİ SEFA)
Seen from
Turkey
💝💝Zahida☔ آرین💝💝
Seen from
Pakistan
SG Tamilan
Seen from
India
Bank Racing
Seen from
Thailand
Trends for you
1
Giants
Under 10K tweets
2
Dan Quinn
Under 10K tweets
3
Seahawks
Under 10K tweets
4
Jayden Daniels
Under 10K tweets
5
Bears
Under 10K tweets
6
Ben Johnson
Under 10K tweets
7
Fred Warner
Under 10K tweets
8
Bagent
Under 10K tweets
9
Jets
Under 10K tweets
10
Jameis
Under 10K tweets
Most Popular Users
1
Elon Musk
@elonmusk
241.5M followers
2
Barack Obama
@barackobama
118.9M followers
3
Cristiano Ronaldo
@cristiano
114.6M followers
4
Donald J. Trump
@realdonaldtrump
111.8M followers
5
Narendra Modi
@narendramodi
107.1M followers
6
Rihanna
@rihanna
98.7M followers
7
NASA
@nasa
92.3M followers
8
Justin Bieber
@justinbieber
91.8M followers
9
KATY PERRY
@katyperry
90M followers
10
Taylor Swift
@taylorswift13
84M followers
11
Lady Gaga
@ladygaga
75.5M followers
12
Virat Kohli
@imvkohli
73.5M followers
13
Kim Kardashian
@kimkardashian
70.9M followers
14
YouTube
@youtube
68.8M followers
15
Neymar Jr
@neymarjr
66.5M followers
16
Bill Gates
@billgates
65.2M followers
17
Selena Gomez
@selenagomez
63.1M followers
18
The Ellen Show
@theellenshow
62.2M followers
19
CNN
@cnn
61.8M followers
20
X
@x
60.7M followers
Olivia
Online
✨
⭐
💫