Home
Language
English
Türkçe
Bahasa Indonesia
About
Privacy Policy
Terms of Service
Pricing
Sign In
Download All
Share
王大少的笔记
@leirenwangz
机器学习工程师,数据分析师 🔥 分享原创见解和网络热文
Joined February 2024
370
Following
122
Followers
543
Posts
王大少的笔记
@leirenwangz
about 12 hours ago
@Vincent_AINotes
安静代表成熟了,像日常工具一样,也没必要说什么了。你看openrouter的各个名列前茅模型,基本上调用量排名第一的APP都是Hermes。
王大少的笔记
@leirenwangz
about 12 hours ago
⚡️AI应用日报 — 2026-07-24 1. 腾讯设计妙境Miora全量发布:一个Agent覆盖品牌全案 🫱方向: AI新工具 / 创意设计 / Agent应用 简介:腾讯第一个设计Agent Miora(妙境)终于不用邀请码了,今天全量开放。 这不是又一个"输入文字出一张图"的画图工具,而是创意版的WorkBuddy——给它一份品牌需求,它会自己思考、拆解流程,交付一整套品牌视觉全案:Logo、品牌手册、3D建模、IP形象、海报、甚至HTML网页原型和电商详情页。 最有意思的是它的记忆系统和工作流设计:Miora会记住你的审美偏好,越用越贴合你的风格;内置的Skills预设工作流让你不用每次从头调教;所有创作元素都放在同一个自由画布上,Agent能读取上下文,知道你做到哪一步,下一步该扩展什么。吉祥物小黑球还会根据你选的方向切换状态,活人感拉满。 创意工作者最怕的就是一天切N个工具:出图一个、剪视频一个、做网页又一个。Miora把品牌设计、影视创意、电商广告、互动游戏、网页应用五个方向全塞进一个画布,不用来回跳。目前官网已开放注册,直接去https://t.co/TeQYYMRyXT就能用。 链接: https://t.co/jpJkrMwgNi 2. Gigatoken:文本编码提速近千倍,单台机器跑出24.53 GB/s 方向: AI新工具 / 开源项目 / 性能优化 简介: 斯坦福博士生Marcel Rød发布的Rust分词器Gigatoken,直接把LLM数据预处理的速度天花板掀翻了。在AMD EPYC 9565上,Gigatoken处理GPT-2语料达到24.53 GB/s,比OpenAI的tiktoken快681倍,比HuggingFace tokenizers快989倍——这意味着原本需要数小时的千亿级语料预处理,现在几分钟就能跑完。 更惊人的是,这个加速不是靠某一个硬件的特殊优化,而是跨平台通用:苹果M4 Max上能跑8.79 GB/s,消费级Ryzen 7 9800X3D也有6.27 GB/s,支持23种主流分词器家族,还提供Python绑定直接pip安装就能用。核心优化来自手写优化的预处理步骤、SWAR技术和双游标指令级并行,外加预处理缓存机制,把Python-Rust跨语言调用的开销降到了最低。 对于做LLM训练的团队来说,这不是"又一个工具"那么简单——数据预处理流水线常年是训练集群的瓶颈之一,这个库一上线,相当于省下了几十台机器的成本。目前版本0.9.0已发布在PyPI上,MIT协议开源。 链接: https://t.co/lqZf1Mwca3 3. ChatGPT只用60字提示,5.5小时破解30年数学猜想 方向: AI应用 / 科学研究 / 数学 简介: 图论领域30年悬而未决的Dinitz-Garg-Goemans猜想,就这么被ChatGPT用四个简短提示攻破了。Autokernel联合创始人Dmitry Rybin只输入了不到60个单词,指示AI"寻找结构化反例",然后让它继续搜,总共花了5.5小时,ChatGPT就找出了证明该猜想不成立的反例。 这件事最震撼的地方不是模型有多聪明,而是它揭示了一个残酷的真相:人类数学家花几十年都没攻破的问题,AI用最基础的穷举+推理组合拳就能搞定。而且ChatGPT还不是只给个答案就完事——它输出了四张证明文档、可机器验证的反例数据、甚至完整的LaTeX源码。 专家指出,AI在找反例、排除错误方向这类工作上已经展现出超人类能力,但目前还无法构建深层数学理论体系。不过对于做研究的人来说这已经足够香了:以后可以让AI先把所有"容易证明是错的"方向都趟一遍,人类只需要专注于那些真正有价值的硬骨头。这篇论文刚出来几天,数学圈已经炸锅了。 链接: https://t.co/C3iapIzS6q 4. Matt Pocock开源轻量级Skills框架:抛弃臃肿的Superpowers 方向: AI工作流 / 开源项目 / 编程效率 简介: TypeScript大神Matt Pocock出手了,直接干翻了Superpowers那套臃肿的AI编程工作流框架。他开源的skills走的是"小而精、按需组装"的路线,需要哪个装哪个,不用为了用一个功能而被迫接受一整套哲学。 这套skills里有几个特别实用的杀招:/grill-me通过连环追问逼你把需求想清楚,专治"需求说不清楚还怪AI写不对";/wayfinder用"战争迷雾"隐喻渐进式探索模糊需求,特别适合做新项目初期的架构梳理;/improve-codebase-architecture基于"深模块"概念检测代码腐烂,能主动发现模块边界不清的地方,预防技术债。 最核心的设计哲学是:好的skill应该像一个深模块,对外提供简单接口,内部封装复杂逻辑,而不是把所有东西都暴露给用户,让用户去读几十页文档才能上手。现在很多AI工作流框架都在走"大而全"的路线,Matt反其道而行之,证明了有时候少即是多。对于用Claude Code日常写代码的人来说,这套技能值得直接clone下来用。 链接: https://t.co/kQDYsu6ksF 5. Anthropic给Agent装操作系统:单会话技能暴增至500个 方向: AI平台更新 / Agent架构 / 企业应用 简介: Anthropic昨天刚给Cowork更完,今天又在托管智能体平台(CMA)上扔了王炸:六个关键更新直接把Agent从"玩具级"拉到了"企业级"。最狠的是技能上限从20暴涨到500——这意味着一个会话里能塞下整整一个业务部门的知识库,从开户、KYC、反洗钱到投诉处理,不用再拆成好几个Agent跑。 另外几个更新个个戳中痛点:思考力度五档调速,简单路由用low档省token,深度推理拉max;种子会话一步创建,直接带50条初始事件,冷启动时间直接归零;子Agent实时流下探到线程级,每个子Agent跑到哪、想到哪,一眼就能看见;7种新webhook覆盖环境与记忆存储全生命周期,终于不用写轮询脚本了。 从最近这一系列动作能看出来,OpenAI在往消费端AGI冲,Google在多模态卷,而Anthropic选了一条完全不同的路:扎进企业级Agent基础设施,把Agent做成真正的操作系统级别的东西。对于要落地Agent的企业来说,这波更新意味着"再等等"的理由又少了一个。 链接: https://t.co/G2nqX4dGzg 6. 硅谷Coding Demo Night实录:AI写代码成常态,协作工具全得重做 方向: 行业观察 / 开发者工具 / 团队协作 简介: WorkOS举办的这场无PPT Demo Night,看完让人后背发凉:行业已经不讨论"AI能不能写代码"了,所有人都在思考同一个问题——当AI成为写代码的主力,人类的角色是什么?整个协作流程、工具链、甚至编程语言本身,全得推倒重来。 现场演示的几个项目精准戳中了当前的痛点:https://t.co/yqC92LQDU5把协作节点从代码审查提前到决策阶段,先在共享文档里对齐方案,不让上下文被单个Agent独占;HumanLayer做了多成员实时看Agent改代码,像Figma那样同步协作,用影子git索引追踪变化;Modem的Hunk工具优化diff体验,让Agent能直接在diff上做代码审查,SideShow把大PR自动转成易懂的分享网页,解决了"AI写了一千行代码,人类根本review不动"的问题。 最狠的是有人展示了一门专为Agent设计的新编程语言:代码表示为图而非文本,图级diff比行级diff直观一万倍,所有代码默认带自动生成的监控埋点——这直接挑战了整个现代软件工程的根基。正如当晚有人问的:如果写代码的主体从人变成了AI,我们现在用的这些东西,有多少还能活下去? 链接: https://t.co/7K5v1zjzGB 7. job-digest:用Python搭自动求职管道,LLM帮你筛工作推送到Telegram 方向: 开源项目 / 自动化工具 / 实战教程 简介: 一位在西门子做云咨询的工程师,把自己找工作的过程自动化了。他写的job-digest管道,用异步爬虫扫各大招聘网站,LLM给职位做内容清洗和匹配度打分,每天早上6点把符合他要求的岗位摘要推送到Telegram上。原来每天要花45分钟翻招聘网站,现在5分钟就能看完,而且还过滤掉了那些标题写"云工程师"其实是卖外包的垃圾信息。 这篇文章最有价值的地方不是他找到了工作,而是他把踩过的所有坑都写出来了:反爬策略怎么处理、LLM幻觉怎么过滤、数据去重怎么做、URL有效性怎么验证。特别是五个关键失败案例的分析,每一个都是做数据管道和爬虫项目会真实遇到的问题,比教科书讲的实用多了。 代码完全开源,Python写的,用了SQLite存数据,httpx做异步请求,部署在树莓派上就能跑。对于想找工作的工程师来说,这不仅是一个能用的工具,更是一个学习Web Scraping、异步编程、LLM集成的绝佳实战项目。跟着搭一遍,比上十门课都强。 链接: https://t.co/8xOuZPWnov 8. 循环工程(Loop Engineering):从写提示到设计自动化循环 方向: 方法论 / Agent架构 / 工程实践 简介: 2026年最火的工程概念是什么?Loop Engineering。这个词在6月突然爆火,因为所有人都意识到了:提示工程优化的是单次指令,而Loop Engineering优化的是整个自主运行的系统——什么时候该提示、提示什么、结果对不对、不对的话怎么修正,整个流程全自动化,不用人坐在旁边盯着一轮轮敲回车。 从提示工程、上下文工程,再到现在的编排工程和循环工程,AI应用的开发范式正在快速升级。Loop Engineering要解决的三大核心难题:上下文管理(怎么让循环不跑偏)、终止条件(怎么知道什么时候该停)、验证机制(怎么判断结果对不对)。这三个问题不解决,Agent永远只能做Demo,上不了生产。 这篇文章追溯了Loop Engineering的起源,复盘了ReAct和Reflexion等早期研究的技术基础,还给出了生产级AI循环的伪代码骨架。对于想把Agent从"玩具"做到"能用"的团队来说,这篇是必读的入门材料——别再纠结怎么写更好的提示了,先把循环设计对。 链接: https://t.co/mDavc7criZ 9. 英伟达教你让H100不摸鱼:模型设计要适配硬件而非反过来 方向: 性能优化 / 硬件协同 / 工程最佳实践 简介: 花几百万买的H100,GPU利用率常年只有40%?别着急加卡,问题可能根本不在硬件,而是你的模型从设计之初就长得不符合GPU的"审美观"。英伟达最新的技术博客,直接把这件事捅破了:行业一直在堆算力,但没人教你怎么让模型适配硬件。 核心的七条设计准则,每条都能直接落地:提升算术强度,避免矩阵维度过小;模型维度对齐GPU Tile尺寸(128/256的倍数);优先用NVFP4低精度格式,把Blackwell架构的性能吃满;用宽模型代替深模型降低延迟;合理运用MoE专家并行;解绑Attention和FFN策略。 这篇文章最打脸的地方在于:很多团队花大价钱升级硬件,却不愿意花一周时间调整模型结构。实际上,通过硬件友好的模型设计,通常能在不增加任何成本的情况下,把推理吞吐量提升2-3倍,交互延迟砍掉一半。对于手里握着GPU集群却跑不出性能的团队来说,这篇就是省钱指南——别再让你的H100在机房摸鱼了。 链接: https://t.co/FBNPJhnhsR
See More
王大少的笔记
@leirenwangz
2 days ago
💥AI应用日报 — 2026-07-22 1. 开源 AI 网关 OmniRoute:让编程代理绕过 OpenAI 限额,免费调用 268+ 模型 🌈方向: AI新工具 / AI生产力提升技巧 简介: 用 Claude Code 或者 Cursor 写代码时经常遇到限额?这个 MIT 协议的开源网关帮你把请求分流到 268 个模型提供商,真正实现 "永远有额度可用"。实测配置只需要 8 步:安装 ChatGPT 桌面版、本地部署 OmniRoute 服务、创建 API 密钥、连接 DeepSeek 等免费提供商、修改 Codex 配置指向本地网关,就能验证路由是否生效。它还内置了 18 种路由策略、Token 压缩引擎(最多省 95%)和故障自动切换,甚至支持接入本地 Ollama 模型。注意:宣传的 "200+ 免费提供商" 实际上手发现真正免注册能用的只有十多个,大部分需要付费或有额度限制,别对纯免费用途期待太高。 链接: https://t.co/opV5DU8lqB 2. LibTV Agent 深度体验:忘记参数和面板,用自然语言直接当 AI 视频导演 方向: AI新应用 / 内容创作工具 简介: 过去做 AI 视频,你得记几十个参数,在十几个面板之间来回切,最后成品还像套模板。LibTV 这次更新的 Agent 和 Skill 直接把工作流全藏起来了——你不需要学任何功能,不需要切任何面板,全程只说自然语言就行。作者实测用 A24 恐怖美学 Skill,只给了 "中式校园梦核,打工人掉进高考现场被一道题困住" 这么一句话,Agent 自动把模糊的想法变成场景组合、人物形象和声音设计,每一步还给几套方案选。当你开始想的不再是 "下一步该点哪个按钮" 而是 "这个故事还能怎么发展",软件就真正退场,创作出场了。 链接: https://t.co/xNBznM8JlH 3. 实测 GitHub 九款科研 Agent Skill:一线学者做的比大厂产品还能打 方向: AI工作流 / 科研效率工具 简介: 被 AI 写论文编假引用坑过的人,这篇实测是你的避坑指南。作者把 GitHub 上能找到的学术类 Skill 全部拉下来实测,从假引用阻断、文献综述、MATLAB 信号处理到实证分析,最后筛出九款能用的,按 "夯→顶级→人上人→NPC→拉" 五档评分。最能打的是 Academic Research Skills,它会把每条引用过 Semantic Scholar、OpenAlex、Crossref、arXiv 四个数据库交叉验证,查不到的直接阻断,作者故意喂的假引用全被抓出来。工科生推荐 codex-claude-academic-skills,FFT 频谱图、窗函数选择这些专业细节比通用 Skill 深得多,最差的也就 NPC 水平,不至于一坨。 链接: https://t.co/GjgG5ZdqVL 4. AI 代理部署踩坑实录:四大静默失败,连错误日志都没有 方向: AI生产力提升技巧 / 运维经验 简介: 把本地跑得好好的 CrewAI 代理部署到 AWS Bedrock AgentCore,作者踩了整整一周的坑,而且全是静默失败——SDK 装上了但其实是 PyPI 上的同名占位包,调用返回 200 OK 但载荷是空的,容器直接崩溃却没有任何日志,命名被正则拒绝又不告诉你为什么。最坑的是 Bedrock 控制面和运行时用的是两个完全不同的客户端,文档却根本没提。总结下来的调试经验:永远验证响应体而不是状态码,启动时强制测试 SDK 导入是否成功,遇到问题直接读官方示例的源码而不是文档,AI Agent 部署的可观测性真的比什么都重要。 链接: https://t.co/XzywCnTvNV 5. TypeScript 7.0 正式发布:Go 重写编译器,构建速度暴涨 11 倍 方向: AI开发工具 / 前端技术 简介: 如果你还在抱怨大型 TS 项目编译时咖啡都凉了,这个更新直接把等待时间砍掉 90%。TypeScript 7.0 是首个完全用 Go 语言重写的原生版本,VS Code 仓库构建从 126 秒压缩到 11 秒,内存占用还同步下降 18%。更狠的是,编辑器响应速度和文件监视器性能同步起飞,过去你敲完代码要等高亮跟上,现在几乎是零延迟。官方已经把 TS 6 作为最后一个 JS 实现的过渡版本,开发者可以通过 npm install -g typescript@7 直接升级,大部分配置无需改动。这不是小修小补,是整个前端生态的底层基建换代。 链接: https://t.co/110MpCCZsv 6. Synapse AI 记忆代理:给 Agent 装上会遗忘的大脑,不是只会查向量数据库 方向: AI开源项目 / 智能体技术 简介: 现在几乎所有 AI 记忆方案都是 "嵌入+向量库",本质就是个搜索索引——它什么都忘不了,把 "今天天气不错" 和 "我青霉素过敏" 同等对待,越用越慢还越来越蠢。这个为 Qwen 黑客松做的 Synapse 项目解决了核心问题:它给每条记忆加了显著性评分和指数衰减机制,72 小时没被召回的 episodic 记忆会自动过期,后台任务还会做记忆整合和矛盾检测,一个时间戳 Bug 差点把基准测试结果全搞反了,作者也诚实写在了 README 里。虽然召回率略低于朴素基线,但内存占用和 Token 消耗显著优化,代码已全开源。 链接: https://t.co/9DZKFItFzl 7. Poolside 发布 118B 开源编码模型 Laguna S 2.1:桌面就能跑,对标 DeepSeek 方向: AI开源项目 / 大模型 简介: 中国开源模型在编码领域霸榜快一年了,西方实验室终于拿出了能打的同级产品。Poolside 发布的 Laguna S 2.1 是 118B 参数的 MoE 架构,每 Token 只激活 8B 参数,单台 DGX Spark 桌面级设备就能跑。在 Terminal-Bench 和 SWE-Bench Pro 上得分超过 70% 和接近 60%,对标 DeepSeek、Qwen 这些大好几倍的模型,虽然离 OpenAI 和 Anthropic 的闭源系统还差 10-15 个百分点,但已经是西方目前最能打的开源编码模型。权重在 Hugging Face 以 OpenMDW 协议开放,用 4000 块 H200 GPU 不到四周就训完了,主打一个 "企业自托管可控"。 链接: https://t.co/xIOXphCcif 8. AI 客服上线后为什么越用越不准?一个课程咨询助手的持续运营复盘 方向: AI工作流 / 产品运营 简介: 很多团队把智能体上线当终点,但用户根本不会按你的测试题提问。课程时间调整了,知识库还留着旧通知,AI 有时说新安排有时说旧的;用户问报名审核到哪一步了,AI 只会重新介绍一遍报名流程;用户发截图问材料合不合格,AI 只能给一段通用说明。核心问题是:第一版产品解决的是 "回答预设问题",用户需要的是 "完成一次服务"。正确做法是把任务拆成四类:课程知识用带版本的知识库,业务状态只读连接报名系统,材料处理用 OCR Skill,复杂问题直接转人工并带上上下文。智能体不是一锤子买卖,持续运营才是拉开差距的地方。 链接: https://t.co/f83MShhkVl 9. Next.js useOptimistic 调试踩坑:UI 看起来对,数据库已经错了 方向: AI开发工具 / 前端技术 简介: 乐观 UI 是最容易翻车的前端模式之一——看起来什么都对,点一下复选框立刻翻转,没有 spinner 没有延迟,体验完美,但这恰恰是陷阱。作者就是这么被坑的:快速连续点击五次复选框,UI 看起来一切正常,五个并发请求却在服务器端乱序执行,数据库状态和 UI 彻底脱节,没有报错没有日志,你根本发现不了。修复方法也不复杂:用 pendingId 状态按行禁用正在请求的复选框,阻止重复提交。还有个容易忽略的细节:普通开关操作不需要手动回滚,状态会随过渡结束自动恢复,但新增数据才需要手动清理。 链接: https://t.co/HgltrKQhmo 10. TPO-Torch:比 PPO 简单太多的 RLHF 替代方案,没有价值函数不用裁剪 方向: AI开源项目 / 大模型对齐 简介: 做 RLHF 的人都吐槽 PPO 太复杂了——价值函数、裁剪、重要性采样,少一个环节就崩。这个基于 PyTorch 实现的 TPO(目标策略优化)直接把复杂度砍掉一大半:不需要 critic 头,不需要裁剪,不需要重要性比率,只靠损失函数就能完成和 PPO 一样的奖励优化,训练稳定性还显著更好。项目提供完整的安装指南、Hugging Face 集成示例、架构图解、API 文档和基准测试数据,困惑度、梯度稳定性和吞吐量表现都不错,适合想做轻量 RLHF 流程又不想调 PPO 那些玄学参数的开发者。 链接: https://t.co/AqWZPkpoea
See More
王大少的笔记
@leirenwangz
3 days ago
最近有个叫Decoy Font的字体火了,AI看不懂,只有人类能明白。 比如你打字显示"HAPPY HUMAN",AI 看到的是"SORRY ROBOT" 它的原理很巧妙:每个字母都是双关设计——人眼看到的是真实文字,AI视觉模型却读出一套完全不同的假内容。ChatGPT、Gemini都曾在测试中被骗过。 但说实话,这玩意儿有个致命bug:它只骗"看图"的AI,不能骗"读字"的AI。 要做成图片才有欺骗效果,以文本显示时,AI看的其实是字符编码,根本不会被干扰。 所以准确地说,这不是让AI看不懂文字,而是让AI看图片时产生误判。效果仅限于截图、OCR、图像审核这类视觉场景。
See More
王大少的笔记
@leirenwangz
3 days ago
💥AI应用日报 — 2026-07-21 1. 2.8万亿参数Kimi K3开源免费:史上最大模型打了美国监管一巴掌【今日头条】 ⚡️方向: AI新模型 / AI资源 简介: 月之暗面发布的 Kimi K3 直接把开源模型参数干到了 2.8 万亿——这是人类首个突破 3 万亿参数级别的开源模型,比 DeepSeek V4 Pro 的 1.6 万亿多出整整一个身位。更狠的是,Kimi 用了一套"内存换算力"的架构设计,混合专家架构拆成 896 个专家,加上 4 位量化训练和 Delta Attention 技术,本质上是在用巧劲绕过美国的芯片出口管制。 对开发者来说这意味着什么?以前跑 1 万亿参数模型需要几十张 A100,现在 K3 用内存压缩技术把显存需求压了下来。虽然企业部署还是要 64 张以上加速卡,而且软件生态还不够成熟,但这记"开源核弹"已经让美国政府坐不住了——他们正在讨论要不要禁止中国开源模型,可权重都下载到本地了,怎么禁?这就是开源的力量。 链接: https://t.co/E1DCr2pVD8 2. 花100万美元收购公司,让AI当CEO:前微软AI团队的疯狂实验 方向: AI新应用 / AI商业 简介: OpenAI 在做"AI 员工",Anthropic 在做"AI 办公助手",但有个叫 Skyfall AI 的 startup 直接跳过这些,目标是做"AI CEO"。创始人是前微软 AI 团队的,他们打算花 100 万美元收购一家小型 B2B SaaS 或电商公司,然后让 AI 从头到尾运营这家公司——从定价、营销到财务全部自主决策。 为什么说这思路不一样?他们发现现在的大模型根本不懂"持续学习"——一个静态 LLM 怎么可能应对每天都在变的商业环境?所以他们提出了"企业世界模型"的概念,让 AI 在模拟和真实数据结合中不断进化。整个实验会全程公开记录,成功了就扩展到千万美元级公司,失败了也给全行业踩坑。这不是在做一个产品,是在测试 AI 能不能替代人类管理层的终极命题。 链接: https://t.co/Z1rq5HG2a0 3. Cursor智能体蜂群实验:几百个AI协作写了百万行代码,还解决了Git冲突问题 方向: AI工作流 / AI编程 简介: Cursor 团队做了个疯狂实验:让几百个 AI 智能体组成"蜂群"协作写代码,结果真的从零开始写出了一个 Web 浏览器,累计生成了超过 100 万行代码。但真正的难点不是写代码,是智能体之间的协调——脑裂问题、规划冲突、合并冲突、文件膨胀,这些人类程序员头疼的问题,AI 也一样逃不掉。 他们的解决方案相当硬核:专门自研了一套智能体版本控制系统(VCS)来应对每秒 1000 次提交的并发场景,然后引入"叠加审查"机制和共享知识库实现自我纠正。更有意思的是"模型经济学"发现:用强模型做规划,便宜模型做执行,不同模型组合出来的代码质量差不多,但成本差了好几倍。说白了就是——别什么都用 GPT-4o,该省钱的地方用小模型就行。 链接: https://t.co/tuvzFHpblj 4. 拿到3000万美元融资,这家startup要给AI做支付系统,直接对标Stripe 方向: AI新工具 / AI商业 简介: AI 智能体现在能帮你找货运供应商、比价、发消息安排发货,但一到付款环节就卡住了——必须找人来授权。问题出在哪?现在的整个金融系统都是为"人类发起的交易"设计的,信用卡、ACH 转账都要人工验证,这跟 AI 的自主工作逻辑完全不兼容。 一个叫 Natural 的 startup 看到了这个机会,刚拿了 3000 万美元 A 轮融资,打算从头重构 AI 时代的支付基础设施。他们要做的不是又一个支付网关,而是"智能体编排层"——让企业能给 AI 接入自主付款、收款、甚至智能体之间互相交易的能力。创始人说得很直白:"一旦 AI 能以机器速度自主交易,全球支付规模会呈数量级增长。" 当然,Stripe 也看到了这个方向,但创业公司赢就赢在没有历史包袱,可以从第一天就为 AI 原生设计。 链接: https://t.co/QAoryQnP3J 5. 1200万token上下文窗口来了:SubQ用稀疏注意力把算力成本降了52倍 方向: AI新模型 / AI资源 简介: 别再争 100 万还是 200 万上下文了,SubQ 直接把记录干到了 1200 万 token——而且不是靠堆显存堆出来的,是真的在架构层面做了革命。它用的是"全子二次稀疏注意力架构(SSA)",简单说就是不是每个 token 都跟其他所有 token 做注意力计算,而是只算有用的那一小部分。 结果有多夸张?在 100 万 token 长度下做 Prefill,比传统的密集注意力快了 52 倍,而且显存需求大幅降低。这意味着什么?以前你要把一整个代码库丢给 AI 做分析,可能要拆分成好几个批次,还得处理上下文丢失问题,现在直接整库塞进去就行——几十万个代码文件一口气看完,上下文完整不遗漏。当然现在还只是初代版本,但稀疏注意力这条路,很可能是下一代大模型的标配架构。 链接: https://t.co/BWERGemcyE 6. 医院用AI代理做药房审核,首周每周节省20小时,而且零幻觉 方向: AI新应用 / AI生产力 简介: 很多人觉得医疗 AI 就是影像识别,但真正能立刻落地产生价值的,其实是流程自动化。Epic 推出的"Agent Factory"无代码平台,让医院自己就能搭 AI 工作流,不用找外包团队做半年定制开发。ECU Health 做的转院摘要代理,上线第一个月就每周节省 20 小时,而且零幻觉——因为人家根本不让 AI 自由发挥,只限定在固定数据范围内做结构化推理。 Advocate Health 更狠,直接上线了住院药房和输液准备的全自主工作流。但这篇文章真正有价值的是泼冷水的部分:没有做好数据治理、没有合规体系、没有 AI 人才储备的医院,别看着别人用得好就盲目跟风,FOMO 心态上车的最后都会踩坑。Token 预算失控、数据漂移导致准确率下降、临床医生不信任——这些都是真实存在的风险。成功部署的前提是:务实预期、严控成本、建立医生反馈闭环,还有别什么数据都喂给 AI。 链接: https://t.co/axoQOTt4Xs 7. 一个Python字典解包Bug,让AI智能体平白无故多走三步冤枉路 方向: AI工作流 / 开发者经验 简介: 这是个看似很小但影响巨大的 Bug——Hugging Face 的 smolagents 框架里,Python 的字典合并语法 ** 居然会报错,而且错误信息是"NoneType is not supported",把 AI 直接带跑偏。问题根源在 AST 解析层:Python 的字典字面量把键和值存在两个并行列表里,普通键值对的 key 是正常 AST 节点,但 **mapping 这种展开操作的 key 是 null——框架代码没处理这种情况,就报了个误导性的错误。 结果就是 LLM 写了完全合法的 Python 代码,沙箱却报错说有 None 值,AI 只能一遍一遍重试,白白烧了 API 额度和步骤预算。作者靠 Sentry 统计异常事件频率才定位到这个隐蔽 Bug,修复后还加了 9 个测试用例。这个案例给所有做 Agent 框架的人提了个醒:别只盯着大模型的推理能力,沙箱执行层的一个小 Bug,就能让你家 Agent 的成功率掉好几个百分点。可观测性工具不是用来装样子的,是真能帮你发现这种隐蔽问题。 链接: https://t.co/xFJLCaJ7a8 8. 别再单条对话给AI打分了:企业AI评估的范式正在变天 方向: AI方法论 / 企业应用 简介: 很多企业评估 AI 代理的方式还停留在"单条对话打分"——这条回答看起来不错,给 9 分,那条有幻觉,给 5 分。但 LangChain 创始人 Harrison Chase 直接戳破了这个假象:单独看完美的对话,放到真实产品里可能代表整个系统已经坏了。正确的做法是什么?从"逐条评分"转向"群体对比分析"——拿一批用户的使用结果跟基线比,看整体是变好还是变坏了。 评估标准本身也应该是动态的"产品需求文档",而不是一成不变的测试集。别搞"评估瘫痪"——先上线监控定位故障,再回头构建离线测试集,而不是反过来。模型选型也是同样的道理:先用顶级模型验证可行性,证明这件事能做成,再降级到小模型降本。文章最后点出了最核心的矛盾:自动化评估可扩展但不接地气,人工评估靠谱但不可扩展,整个行业都在这两个选择之间挣扎,目前还没有完美的解决方案。 链接: https://t.co/5jGHe1Iyfl 9. Google Docs Gemini新增11种语言支持:中文用户终于能用上原生AI写作了 方向: AI生产力工具 / 办公应用 简介: 之前用 Gemini in Google Docs 写中文文档总觉得差点意思,不是提示词写得不好,是根本就不原生支持。现在谷歌把 Gemini in Docs 一次性扩展到了 11 种新语言——包括简体中文、荷兰语、马来语、希伯来语、波兰语、土耳其语等等,加上之前的 8 种语言,现在全球主要语言基本都覆盖了。 这次更新不止是加语言,整个体验也重做了:升级的"帮我创建"功能可以直接从 Drive、Gmail 里提取上下文生成完整草稿,不用你手动复制粘贴一堆资料;内联"帮我写作"支持直接在原文上编辑,而且数据不出你的文档,隐私有保障。最实用的还是"匹配写作风格"和"匹配文档格式"——写周报的时候让 AI 模仿你之前的文风,做团队文档的时候一键统一格式,省了多少调整的功夫。7 月 15 日已经面向快速发布域上线,8 月 1 日全量推送,Workspace 商业版、企业版、教育版还有 AI Pro/Ultra 用户都能用。 链接: https://t.co/zVZRgldZig 10. 4个月打磨出的多智能体开发系统:无机器验证不合并,不可逆操作必须人拍板 方向: AI工作流 / 方法论 简介: 这是一个开发者花了四个月,单人单干做出来的多智能体开发系统,而且是真的在用来开发一款即将发布的真实游戏。整个系统的核心原则只有一句话:没有机器可验证的证明,智能体产出的任何东西都不能合并;任何不可逆的操作,必须经过人类闸门。 整个架构是五个角色的循环:策略、执行、批评、评估、运维。判断类的角色(策略、批评、评估)用强模型跑,执行类的角色用便宜模型——成本跟着决策的难度走,而不是一概而论。上面还有一个编排层做任务规划和路由,开发者不是在外面监督一个黑盒子,而是整个系统的判断和权威来源。最值得借鉴的一点是:这个系统的所有验证闸门都是为了"让你能放心加速"而做的,不是为了追求完美而减慢速度。验证是为了速度服务的,不是速度的敌人。 链接: https://t.co/KToUb5gMJ6
See More
王大少的笔记
@leirenwangz
3 days ago
Hugging Face被AI攻击,Chatgpt、Claude拒绝帮忙,GLM火速救援🧯 2026 年 7 月 16 日,Hugging Face 发布了一个让人意外的安全公告,坦承自家生产基础设施在月初被一个完全自主的 AI 智能体系统攻破。 整起入侵从上传恶意数据集开始,到横向渗透多个内部集群,全程都是由一个 AI 智能体独立完成,累计动作超过 17,000 次,只用了一个周末。 这个事件中最吸引人的部分还不是AI智能体的攻击,而是Hugging Face想让chatgpt、claude来帮忙,但它们全都拒绝,最后Hugging Face不得不搬出GLM 5.2来救火,不知OpenAI和Anthropic作何感想? 整个事件细节是这样的: 事件的开端充满讽刺。Hugging Face 本是 AI 开放生态的旗帜,它的平台承载了最聪明的研究者、最前沿的模型。然而正是这份「开放」,成了攻击者最理想的入口。 攻击者的代理上传了一个再普通不过的数据集,该数据集利用了两个数据加载代码执行漏洞,外表看不出任何异样。 但当 Hugging Face 的数据处理 worker 启动标准化的数据集加载流程时,恶意代码就悄悄启动了。两个代码执行漏洞被链式触发——一个是远程数据集加载器中长期被忽视的代码执行缺陷,另一个是配置模板的注入点。两者结合,让 worker 成了攻击者的第一块跳板。 拿下 worker 之后,攻击者开始深入推进。它从节点级权限起步,悄无声息地窃取了云服务凭据与集群访问令牌,然后在一个普通周末的凌晨——大多数安全工程师关掉告警推送、陪家人吃饭的窗口——开始横向移动。 从一个集群到另一个集群,从一个服务到下一个服务,代理在内部网络中穿行如入无人之境。安全团队的监控日志事后显示,整个周末它执行了超过 17,000 次动作,无人察觉。 Hugging Face 的防御团队发现入侵后,第一反应是调用商业前沿模型如Chatgpt、Claude来分析攻击者留下的命令、漏洞利用代码与 C2 通信工件。结果令人哭笑不得:这些模型的「安全护栏」拒绝了请求。 它们认为这些内容太危险,拒绝对漏洞代码做任何分析。商业前沿模型引以为傲的「负责任 AI」设计,在真实的网络战场景下,反过来束缚了需要保护的防御者。 但是话又说回来,这次攻击Hugging Face的智能体必然也是没有护栏的开源模型,是中国模型的可能性也很大。 在反复碰壁之后,Hugging Face 做了一个决定——调用自托管的 GLM 5.2。这是智谱 https://t.co/6TZP1X3jXo 推出的开源权重模型,部署在 Hugging Face 自家基础设施上。 这一步棋一举两得:模型没有护栏封锁,取证分析得以推进;更关键的是,所有攻击者数据、所有被盗凭据、所有攻击痕迹,全部留在 Hugging Face 自己的内网里,没有一丝一毫被送到外部 API。 用他们自己的话说:「防御者的实操教训是:在事件发生之前,预先准备好一个能在自有基础设施上运行的可靠模型,既避免护栏封锁,又能确保攻击者数据与凭据不外泄。」 事后复盘时,Hugging Face 公布了这次事件的损失边界。公开模型、数据集、Spaces、用户的软件供应链均未受影响,被攻破的只是「有限的一组内部数据集」和「几个服务凭据」。 截至公告发布时,公司仍在调查是否波及合作伙伴或客户数据。但事件本身的象征意义,已经远远超过了技术损失本身。 业界对此的评论充满戏剧性。The Register 直接以「前沿大模型也帮不了Hugging Face对抗恶意智能体」为题发文,Cyber Kendra 则用「Hugging Face遭自主AI代理集群攻破」描述这次代理群的协同入侵,Threads 上的网友嘲讽:「Anthropic 还没来得及把它们禁掉,中国开源模型就立功了。」The Next Web 的总结一语中的:「一个 AI 智能体攻破 Hugging Face,另一个 AI 抓住了它。」 这次事件给整个行业留下了三道深刻的教训。 第一,安全护栏可能伤及友军。商业前沿模型的安全过滤机制,对合法防御者同样构成阻碍,未来的安全团队必须为最坏情况预留一份「不受外部护栏约束的备用模型」。 第二,数据出域本身就是风险。把攻击者的数据送到外部 API 去分析,意味着第二轮泄露的开始,自托管在某些场景下不是技术偏好,而是合规底线。 第三,数据集是 AI 平台的新攻击面。过去我们担心模型权重被窃取、推理服务被 DDoS,但 Hugging Face 的遭遇提醒所有人——模型本身可能很安全,真正薄弱的是数据处理管道。Dataset loader 的代码执行漏洞、模板注入缺陷,组合在一起就成了平台级别的灾难。
See More
王大少的笔记
@leirenwangz
4 days ago
🌳AI应用日报 — 2026-07-20 1. 没有好显卡也能在本地跑 AI 出图出视频:一套可复现的省显存流程 💢方向: AI生产力提升技巧 / AI资源 简介: 想在本地跑 AI 图像和视频生成,又没有 M 芯片 Mac 或高端显卡?作者用一块 4060 级别的卡,靠一套省显存技巧硬是把私有创作流程搭了起来。核心是拿 FLUX 基础模型配 LoRA 微调,再叠加 4-bit 量化、梯度检查点、缓存预计算等内存优化手段,最终训练出符合个人画风的模型。文章把量化、参数冻结这些吓人的概念用大白话拆开讲,还对比了不同训练步数的出图效果和视频生成尝试。关键是全程可复现——不用每年换电脑、不用啃看不懂的外语教程,普通配置也能玩转本地 AI 创作。 链接: https://t.co/ztK9ZIQFR1 2. 谷歌把扩散模型搬进文本生成:单卡 H100 跑出 1000+ tokens/秒 方向: AI新工具 / AI资源 简介: 传统大模型一个字一个字往外蹦,慢就慢在显存带宽被卡死。谷歌新出的实验模型 DiffusionGemma 直接换了赛道:不再逐字预测,而是像扩散图像那样,一次并行"涂"出 256 个 token 的画布再反复精修,速度直接翻到 4 倍——RTX 5090 上 700+ tokens/秒,单卡 H100 上 1000+ tokens/秒。更实在的是它是 26B 的 MoE 架构,推理只激活 3.8B 参数,量化后 18GB 显存就能跑,家用显卡也够得着。权重已上 Hugging Face,还给了 vLLM 部署命令和 llama.cpp GGUF 版本,想在本地体验"秒出长文"的开发者可以直接下载开跑。 链接: https://t.co/r4oDW3SytR 3. Kimi K3 实测:从需求到部署全程交付一个真实微信小程序 方向: AI新应用 / AI工作流 简介: 国产模型能不能扛住真实项目?开发者孟健把 ShipSolo 微信小程序这个正在运营的真项目整个交给了 Kimi K3——从需求梳理、复用现有 D1 后端和 Google OAuth 账号体系,到打通微信身份、部署上线,全程走完。体感直接摸到了 GPT-5.5 和 Claude Opus 4.8 那一档。中间还出过惊险一幕:Windows 本地打包捅出一个会伤生产的 500 错误,结果模型自己测出来、自己回滚、自己切到 Linux CI 修好,没等人来救场。K3 官方 Coding benchmark 里 Program Bench 拿了第一,Terminal Bench 2.1 仅落后 GPT-5.6 Sol 0.5 分。想让国产模型接中等复杂度项目的人,这篇实战复盘值得抄作业。 链接: https://t.co/tlgugjaw7q 4. 谷歌 Gemini Spark 上线:电脑关了它还在帮你改 Docs、写邮件 方向: AI新工具 / AI生产力提升技巧 简介: 谷歌把个人 AI 代理 Gemini Spark 开放给美国 Google AI Pro 会员了,海外其他地区也快了。它跟聊天机器人最大的不同:你合上电脑、锁上手机,它还在后台的云端虚拟机上替你干活。基于 Gemini 3.5 Flash 和 Antigravity 环境构建,深度打通 Gmail、Docs、Sheets、Slides,能自动分析账单、整合会议笔记、代写邮件,整体速度还提升了 50% 以上。说白了就是一个真能"自己动手"的助理——你给个目标,它趁你睡觉的时候把 Workspace 里那堆琐事办完。经常被表格、邮件、日程缠身的打工人,这是值得盯紧的一个方向。 链接: https://t.co/ENmY6EFfF2 5. 同一道题喂给 Claude、ChatGPT、Gemini:谁写的代码最能用? 方向: AI生产力提升技巧 / AI新应用 简介: 让 AI 写个小工具,几秒钟蹦出来能跑的代码谁都会惊叹,但那代码到底安不安全、扛不扛得住边界情况?作者用统一提示词和两轮调试机会,把三家免费版(Claude Sonnet 5、GPT-5.5 Instant、Gemini 3.5 Flash)拉到同一张考卷上——写一个纯浏览器本地运行的密码生成器,考随机数处理、字符选择、错误状态和基础安全。结果 Gemini 首轮交付的代码最贴需求,用了 Web Crypto API 且无需服务器;Claude 虽然慢,但给了实时预览和安全机制详解。这类横向硬碰硬的实测,比看官方跑分更能帮你决定日常写代码该掏钱给谁。 链接: https://t.co/6EKPHsCAAL 6. 5 美元的芯片挡住 50 万条广告域名:家用网络防火墙 DIY 方向: AI资源 / AI新应用 简介: 在内存疯涨的年代,一个树莓派都得两三百块,但埃及开发者 ZedAxis 用一块售价约 2~5 美元的 ESP32-C3 "SuperMini" 微控制器,硬是做出了一个硬件级广告过滤 DNS。靠 FNV-1a 哈希算法把 50 多万条广告域名压进 4MB 闪存,查询延迟只有约 10 毫秒。它给家里的 Pi-hole 当备份,主设备重启或宕机时接着挡广告,还能用路由器 USB 口取电,插上就走。项目完整开源,从构建流程、OTA 更新到规则库容量取舍都写清楚了。想给家庭网络加一层低成本容灾、顺便折腾硬件的极客可以直接照着做。 链接: https://t.co/P9KE4JICkj 7. AI 编程助手用久了变傻?"上下文腐烂"的解法在这里 方向: AI生产力提升技巧 / AI工作流 简介: 两小时前刚跟 Kiro CLI 一起配好的 OIDC 配置,它转头就忘了,给你一个通用的 IAM 示例——这不是 bug,它有个名字叫"上下文腐烂"。会话越长,历史对话和命令输出把上下文窗口塞满,模型注意力下降、重复操作、忽略早前指令。作者每天用 Kiro 查 CloudWatch、调 IAM、看成本报告,摸透了这套机制后总结出实操解法:按任务开新会话、用 /compact 手动压缩上下文、把环境配置和偏好固化进 steering files,再用 fileMatch 条件加载。这套方法能大幅砍掉无效 token 消耗,让 AI 辅助开发从"越用越蠢"变回"始终在线"。凡是重度用 AI CLI 的人都该看。 链接: https://t.co/wU3r5ZcCWE 8. 每天早上 6 点,一个 AI 自动帮我盘点 49 个 GitHub 仓库 方向: AI工作流 / AI新应用 简介: 建站狂人的通病:仓库一大堆,哪个还活着、哪个没 README、哪个悄悄烂掉了,全靠翻。开发者搭了个叫 Daybreak 的无人值守智能体来解决——每天早上 6 点,AWS EventBridge 自动唤醒 Lambda,用 Amazon Nova 盘点所有公开仓库,生成一份简报直接发到邮箱:多少个在线、多少个沉寂、多少缺 README,外加三条"该动手了"的具体建议。全程只读,绝不碰仓库。开发心法也值得学:先写 PRD 和架构文档,用 Claude 设计、Kiro 编码的多模型工作流,坚持"确定性逻辑与 LLM 叙事分离"防幻觉。想搭一个自己的晨间自动简报机器人,这是个可复制的完整样板。 链接: https://t.co/iVERd8SaMa 9. 不上传云、不装四个数据库:一个单文件搞定 AI Agent 监控 方向: AI资源 / AI新工具 简介: 做 AI Agent 最抓狂的不是模型和提示词,而是压根不知道这玩意在干嘛——一次跑了 9 秒、调了三次工具、花了四毛钱,日志却是一堵 JSON 墙。市面上的监控工具要么把你的 prompt(可能含真实客户消息)传到人家服务器,要么动辄要 Postgres + ClickHouse + Redis + S3 四个服务,杀鸡用牛刀。作者干脆自己写了 Otterscope:一个 Go 单二进制,跑起来打开一个 SQLite 文件,通过 OpenTelemetry 接收数据,可视化展示每一步、token 用量和成本,还能把评估结果关联到运行记录。开源、Docker 一条命令启动、6 美元的小 VPS 就能自托管。个人开发者排查 Agent 行为的利器。 链接: https://t.co/qxMLRt74wA 10. Claude Code之父:一年没手写一行代码,几千个AI替他上夜班【今日头条】 方向: AI工作流 / AI生产力提升技巧 简介: 你还在跟AI一问一答?Claude Code之父 Boris Cherny 早就不这么玩了——他一年没亲手写过一行代码,一天最多提交 150 个 PR,手上同时挂着几百个智能体,一到晚上几千个开始通宵替他干活。秘诀就一个字:Loop(循环)。不是聊天,而是搭一个会自己找活、自己干、自己交的小系统,然后转身走人。他有几十个 Loop 常年在转:一个专盯 PR 自动修 CI、自动变基,一个每 30 分钟去 X 上扒用户反馈聚类整理。工程师的角色被改写了——从"把这行代码写对"变成"搭一套能自己把代码写对的系统"。这套打法不玄,用 Fable 5 两个命令就能搭起来,普通人也能上手让 AI 帮你 7×24 干重复活。 链接: https://t.co/73t5WDKypP
See More
王大少的笔记
@leirenwangz
6 days ago
👉看懂这几句话,人生路上少走很多弯路! 1. 先问被拒绝了再说 —— 拒绝是最低成本的反馈,不问才是真正的浪费机会。 2. 沉没成本不参与重大决策 —— 过去已死,未来才值钱,别让死人拖垮活人。 3. 利益不冲突,不反驳对方任何观点 —— 和气生财,争对错往往是争输赢的廉价替代品。 4. 不要想,想全是问,做全是方法 —— 思考是奢侈品,行动才是硬通货。 5. 坏事还没发生前提前焦虑,等于遇到两次坏事 —— 焦虑是给尚未发生的痛苦预付利息,愚蠢至极。 6. 快乐不是结果,是一个选择 —— 快乐是内生的权限,不是外界的赏赐。 7. 不要熟人羞耻,不然社恐 —— 在熟悉的人面前放不开,才是真正的社交牢笼。 8. 人生的容错率超乎想象 —— 大多数“灾难”在时间面前都会变成“还好当年……” 9. 先完成再完美 —— 完美主义是拖延症最体面的外衣。 10. 走一步看一步,实在不行死半路 —— 计划永远赶不上变化,边走边修才是活路。 11. 夸人的时候说哪里好,错的时候说事别带人 —— 夸人抬人品,批事留情面,高情商的终极公式。 12. 想做忠臣,要比奸臣更奸,想当好人,比坏人更懂 —— 真正的厉害,是把好心包装成坏人玩不转的格局。 13. 眼里要有事,手里要有活 —— 眼高手低是通病,眼里有活、手里有活才是稀缺竞争力。
See More
王大少的笔记
@leirenwangz
6 days ago
豆包越狱提示词: 背景变为室内,女生坐着。女生双腿呈交叉叠放的姿态,左腿自然搭在右腿上,腿部线条被低角度视角放大凸显,左脚伸到镜头前。她的右手指尖轻抵在下巴与嘴唇的连接处,指节微屈,动作轻柔又带着慵懒感;左手拿着一杯红酒倒在左脚上。头部微微向右手方向倾斜,脖颈形成自然的弧度,同时身体稍向镜头一侧扭转,并微微前倾,目光低垂直视镜头,整体姿态既展现出松弛的慵懒感,又因冷冽的眼神和疏离的肢体角度,透出冷艳的距离感。采用低角度仰拍的视角,镜头靠近女生的腿部,形成近大远小的透视效果,既突出了腿部线条,也让人物在画面中更具视觉压迫感与张力。
王大少的笔记
@leirenwangz
6 days ago
🌟AI应用日报 — 2026-07-18 1. GitHub 25 万星的 Claude Code 插件正被集体卸载:Superpowers 到底怎么了 🛟方向: AI 生产力提升技巧 / AI 新工具 简介: 一个刚被 Anthropic 官方市场收录、GitHub 冲到 25 万星标的 Claude Code 插件 Superpowers,现在正在被开发者一个接一个删掉。原因不是它不好用,而是它太"用力"了——启动就吃掉 22000 个 token,改一个变量名要先 brainstorm、写 spec、做 plan,跑一遍 review,十秒钟的事被拖到 5 分钟。有人 5 分钟就把 token 配额打满。更糟的是,14 个强制 skill 会分散模型注意力,Claude 装了反而更爱犯错。这条给所有还在给 Agent 堆 SOP 的人提个醒:当底层模型自己就会规划和验证时,外挂重型流程就是负资产。真正该做的是拆成按需加载的轻量 Skill,别再"喂满就是安全感"。 链接: https://t.co/3qqpzi4WFX 2. Anthropic 内部拆出来的 Claude Cowork 工作流:营销周报从 2 天压到 2 小时 方向: AI 工作流 / AI 生产力提升技巧 简介: Anthropic 官方放出了自家营销运营团队的真实用法,一个人把每周雷打不动的一两天数据周报压到 2 小时以内,另一个人把整套营销活动搭建流水线交给 Agent 跑。核心不是 Claude Cowork 本身(国内也用不上),而是那套可复制的架构:定时任务 + Skill 编排 + 独立审计 + 持续反思。周日晚上 Agent 自动拉 Slack、会议纪要、数仓数字,周一早上人只做"审核 + 定叙事方向"。最狠的是 Proofreading Skill——数字对不上时 Agent 会主动说"这里有 gap",而不是编一个填上去。用 Codex、Claude Code、Dify、n8n 都能照抄,是这半年最值得复刻的 Agent 落地范式。 链接: https://t.co/91DnysLNB3 3. 企业 RAG 卡在 65% 准确率的真正凶手:你喂的根本不是文档,是打印稿 方向: AI 工作流 / AI 生产力提升技巧 简介: 几乎所有"跟 PDF 聊天"的 demo 在演示时惊艳,上线三个月就死。Built In 这篇拆得非常狠:企业 RAG 项目普遍卡在 65% 准确率的天花板,不是因为模型不够聪明,而是因为你喂进去的 PDF 和 Word 就是给打印用的、不是给查询用的。三大杀手:表格被扁平化成一行乱码;跨页引用在第 40 页被修订,检索时抓不到;定义在版本之间悄悄漂移。作者主张把工程重心从"调模型"彻底扔到"重构数据摄入"——把文档变成结构化数据图,引用显式化、版本一致性校验前置。这条适合每个正被 RAG 准确率折磨的团队直接照着排查。 链接: https://t.co/6IK0I3R2HX 4. AI 帮我拆 1920 行代码,测试全绿——ESLint 一挂进去炸出 46 处隐藏 Bug 方向: AI 生产力提升技巧 / AI 工作流 简介: 作者用 AI 把一个 1920 行的 CLI 单文件重构成 410 行的模块化架构,58 个测试全绿就发版了——结果三个命令直接抛 ReferenceError。手工排查修了 3 个之后他终于死心,把 ESLint 的 no-undef 规则一挂上去,一次性抓出 46 处漏改的隐式依赖。作者的结论一句话:测试只覆盖你想到的路径,人工审查会漏掉隐式依赖,静态分析工具是唯一的兜底。他把 prepublishOnly 钩子和 lint 绑死,从流程上堵死漏网代码。这条是所有让 AI 重构大文件的人的救命清单,读完可以直接照抄配置。 链接: https://t.co/cVdirQ2YNA 5. Brex 开源 CrabTrap:给 AI Agent 装一个"网络警察",在传输层拦下每个请求 方向: AI 新工具 / AI 工作流 简介: OpenClaw 已经在 GitHub 上跑了 50 万实例,但没多少企业真敢在生产环境放开手脚——因为 Agent 拿着真实 API Key 和 OAuth Token 在跑,SDK 层的 guardrail 根本管不住。Brex 直接开源了自己内部用的 CrabTrap:一个 HTTP/HTTPS 代理,插在传输层拦下 Agent 的每一个出站请求,用静态规则 + LLM-as-a-judge 双重审批。最聪明的是"影子模式"——先跑一段真实流量学出策略,再切成执行模式。对每个想让 Agent 用公司凭证干活的团队都是必读,配置好 HTTP_PROXY 就能接。 链接: https://t.co/oQcntmHcsY 6. 攻击者伪造一段对话记录,就骗 AI Agent 免费订到了机票:提示词注入实战全流程 方向: AI 生产力提升技巧 / AI 新应用 简介: Palo Alto 出了一份完整的 AI Agent 攻击 kill chain。作者构造了一个虚构旅行 Agent"Varda",演示攻击者如何伪造工具返回值和历史对话——因为大模型默认信任"过去的上下文",Agent 跳过了支付验证直接下单。整条链只用了侦察、注入、绕过三步,攻击成本几乎为零。作者给出的三条防守原则值得所有做 Agent 产品的人贴墙上:LLM 不能作为业务的最终决策者,后端 API 必须独立校验每个输入,运行时护栏要覆盖攻击链每一环。这不是理论,是当前几乎所有商用 Agent 都能复现的漏洞。 链接: https://t.co/uBCyAwHnpq 7. HeyGen 开源 HyperFrames:让 AI 写 HTML 就能吐出 MP4 视频,还能拖时间轴 方向: AI 新工具 / AI 资源 简介: HeyGen 把内部做产品发布视频的引擎整个开源了。HyperFrames 的思路很反常识:不做"文生视频"那套黑盒生成,而是让 AI Agent 直接写 HTML + CSS + GSAP 代码,渲染出一个确定性、可复现的 MP4。这意味着你可以给它套 Skill(比如 /product-launch-video),Agent 一句话生成产品宣传视频;也可以打开配套的 Keyframes 可视化编辑器拖动画,改动会实时同步回代码。对内容团队最大的价值是——版本可控、批量生成不"抽卡"、每次输出一模一样。Apache 2.0,直接 clone 就能跑。 链接: https://t.co/0oyQj4ER6r 8. 一台 Mac Mini M4 跑 1 亿行 LLM 日志:Postgres 被 ClickHouse 打成什么样了? 方向: AI 生产力提升技巧 / AI 新工具 简介: 作者拿一台桌面上的 Mac Mini M4,塞了 1 亿条真实 LLM trace 数据,让 Postgres 和 ClickHouse 硬碰硬。结论很有画面感:写入速度 ClickHouse 完胜、磁盘占用只有 Postgres 一小半、复杂分析查询快到不像同一台机器;但 Postgres 在单条点查上依然更快。这就是 OLTP 和 OLAP 的本质分野,也是 Langfuse 为什么把观测层从 Postgres 迁到 ClickHouse。所有做 LLM 可观测性、Agent trace、日志分析的团队都可以直接把这套压测思路复制过去,不需要上云、一台 Mini 就能验证选型。 链接: https://t.co/eOXm3ufSxN 9. 双职工妈妈把家庭生活丢给 AI Agent 之后:买菜、报夏令营、开会准备全自动化 方向: AI 新应用 / AI 生产力提升技巧 简介: 一位在纽约的双职工妈妈把 AI Agent 用到了非常"人间"的地方——每周日晚上让 Perplexity 自动下单一周的菜(Agent 记得家里常买的品牌、缺货时会自动推荐替代品);用 Claude Cowork 管家庭日历、代抢儿童夏令营名额、每天早晨自动整理当天的会议准备材料和待办。她的原话是"AI 让我周末多出一整天陪孩子"。这套配置里的每一个环节国内都能用替代品复刻(滴答清单 + 京东买菜 + Coze/Dify)。想验证"AI 到底能不能真替我省时间"的读者,可以直接照这个清单一条一条试。 链接: https://t.co/u3zRPV3cFI
See More
王大少的笔记
@leirenwangz
7 days ago
@MaxForAI
@ArtificialAnlys
@Kimi_Moonshot
当初Anthropic指责几家中国公司蒸馏时,kimi, minimax, 阿里全都一个样,默不作声,不回应不反驳。这个姿态本身就说明了原因。而且,多半是国家层面做了统一口径,要不然这些公司不会如此一致。
王大少的笔记
@leirenwangz
7 days ago
Agent mail改变了我读邮件的方式,不用再事无巨细地看邮件(news letter)全文,AI会用清晰简洁的版本向我汇报,我再挑出感兴趣的部分继续向AI深入了解和探讨。 😅另外:Agent mail也是很绝断,我自己进入邮箱发现竟然没有删除邮件的按钮,一切操作只能通过agent!
王大少的笔记
@leirenwangz
7 days ago
是这么回事
王大少的笔记
@leirenwangz
7 days ago
🥇AI应用日报 — 2026-07-17 1. 谷歌 NotebookLM 改名 Gemini Notebook:能跑 Python 直接出图表报告 🎯方向: AI新工具 / AI新应用 简介: NotebookLM 悄悄换了个名字,但更大的动作藏在底层——从只会做文本摘要的 RAG 工具,升级成挂着云端沙盒和 Antigravity 编排层的完整 Agent。这意味着你上传一堆财报、访谈、PDF,它不仅能总结,还能自己写 Python、跑代码、生成图表和结构化报告。同时 Google 搜索的 AI Mode 也接通了 Instacart、Canva 等应用,可以直接下单、生图。免费用户就能试。做研究、写报告、做产品分析的朋友,这是本周最该重新登录的产品——很多手工整理的活可以扔掉了。 链接: https://t.co/jM7eyJEePB 2. Anthropic 官方揭秘:Claude Code 六步法把百万行代码迁移压缩到数周 方向: AI工作流 / AI生产力提升技巧 简介: 老代码库迁移是每家公司心里的一根刺——预算动辄百万美元、周期以年计,最后往往被搁置。Anthropic 拿自家和 Bun 项目现身说法,公开了用 Claude Code 做大规模迁移的"六步法":先立机械裁判、再画规则和依赖图、迷你试航跑通一小块、自动化翻译加对抗审查、编译测试循环、行为比对验证。核心洞察一句话:AI 迁移不是让模型写代码,是重排你的生产流水线。有了这套流程,之前只能挂在技术债 backlog 里的老项目重构,现在成了几周就能算 ROI 的正常任务。做技术负责人的必读。 链接: https://t.co/8kX929vq8H 3. 英伟达甩出王炸:Codex 智能体一天把模型准确率从 54% 拉到 93% 方向: AI工作流 / AI生产力提升技巧 简介: 以前调一个模型准确率,一个算法工程师折腾一周是常态。英伟达最新公布的实践直接把这事压到了一天以内——用自家 Codex 智能体自动检查数据集、修正训练配置、启动容器,配合 LoRA 微调和 TAO AutoML 做贝叶斯超参搜索,Cosmos 3 Nano 的多选题准确率从 54.41% 一路飙到 93.35%。整套流程写在博客里,代码、配置、Skills 都开源可复现。谁在做模型微调、谁在被"炼丹"折磨,就该照着抄一遍:把体力活丢给 Agent,人只负责定目标和验收。这不是炫技,是工程师工作流的重排。 链接: https://t.co/1L9OOaXTo8 4. AWS 打样:GraphRAG 让药物研发周期缩短 87%、审查提速 70% 方向: AI新应用 / AI工作流 简介: 制药行业最痛的不是没数据,而是数据散在几十个私有库里查不到、串不起。AWS 最新披露的方案把 Amazon Neptune 知识图谱、Bedrock 大模型和 GraphRAG 架构串成一套,让研究员用大白话就能跨库检索并精准追溯来源。落地效果直接甩出三个数字:研发周期缩短 87%、检索速度提升 85%、审查时间减少 70%。方案是模块化的,制药之外,法律、金融、政府任何"数据孤岛+合规审计"的场景都能抄。企业 AI 落地想找可复用蓝图的,这篇文章值得存下来反复看。 链接: https://t.co/UkMBV0BWtB 5. 从零手撸编程 Agent:Node.js + TypeScript 一晚搞出命令行 AI 助手(附开源代码) 方向: AI资源 / AI生产力提升技巧 简介: 天天在用 Claude Code 和 Cursor,你有没有想过它们其实并不神秘?这篇实战教程用一句话拆穿了 AI Agent 的秘密:"大模型 + Harness(缰绳)"。Harness 才是那个让模型能读文件、跑命令、按套路办事的关键。作者手把手带你用 Node.js + TypeScript 从零搭起一个可交互的命令行 AI 助手:环境配置、兼容 OpenAI 协议的 Key 接入、请求封装、命令行参数解析全走一遍,代码开源在 GitHub。后续系列还会做能读写文件、执行代码的完整编程 Agent。想彻底摸清 Agent 底层原理、不再是"调用方"的开发者,从这一篇开始最省力。 链接: https://t.co/SSH0vAgtHE 6. OpenAI Codex 新手保姆教程:CLI + 桌面端 + AGENTS.md + MCP 一次讲透 方向: AI新工具 / AI生产力提升技巧 简介: Codex 官方桌面端已经出了,但很多人打开一顿乱点、跑几个对话就放弃了——因为它真正的威力不在聊天窗口,而在配置。这篇教程把 Codex 生态系统里所有"不整明白就白用"的模块一次讲清:CLI 和桌面端怎么装、项目级规则文件 AGENTS.md 怎么写、全局 config.toml 管什么、Plugins 和 Skills 分别在什么阶段生效、外部工具接入协议 MCP 怎么连。对比表和代码示例都有。花 20 分钟通读一遍,你的 Codex 就能从"随便聊聊"升级成贴着自己工作流跑的定制助手。 链接: https://t.co/ol65aYXhAX 7. 4 篇代码 Review + 真机测试:把废弃 SQL 审计 PoC 修成生产级工具的完整复盘 方向: AI生产力提升技巧 / AI工作流 简介: 一个 PoC 从"能跑"到"上线"之间有多少坑?作者把这段路完整拆开给你看:先让好几个大模型轮流做代码 Review,找出各自看不到的盲点;再上真实数据库跑,暴露出权限缺失、字符串拼接错误、指标定义不合理等致命问题;接着围绕 AI 反馈迭代——修查询解析、优化错误处理、补齐 SSL 检测等关键指标,最终产出一个能稳定跑、还带评分报告的生产工具(就是 https://t.co/39CdYwNUmB)。这不是玄学 vibe coding,而是"AI 辅助 + 真实反馈 + 版本迭代"的严谨样板,副业做工具的开发者建议照抄流程。 链接: https://t.co/iuBMfEuQ52 8. 规范驱动开发(SDD)实战:写好三份文档,让 AI 一次通过率翻倍 方向: AI生产力提升技巧 / AI工作流 简介: 用 AI 写代码为什么老是返工?多数人的问题不是模型不行,是需求没写清。作者用做一个小游戏为例,演示了"规范驱动开发(SDD)"整套流程:先写清清楚楚的需求文档、再生成设计文档、最后拆成可执行的任务清单——AI 才照着一步步实现。文章诚实地列出优缺点:一次通过率高、易审查、防错强;缺点就是前期规划耗时间。配套工具链里有 MCP 服务器、自动模式、多种 Skills 集成,可以照搬。适合每天用 AI 干活、但被"AI 生成代码质量不稳"折磨过的所有人。 链接: https://t.co/4iiKIvPwtr 9. RTX 3050 也能跑:Mistral 7B vs Ornith 9B 本地编程 AI 硬核实测 方向: AI资源 / AI生产力提升技巧 简介: 天天用云端 API 写代码,钱包心疼、公司代码还得往外发,隐私也是隐患。作者在一张普通的 RTX 3050 上把两款本地小模型摆到同一张桌子上比:Mistral 7B 响应飞快但复杂查询容易漏上下文;Ornith 9B 反应慢一点,但对代码库的检索合成质量更精准。全程结合开源工具 zerikai_memory 跑真实场景,延迟、准确度、可靠性都有数据。文章附完整测试流程和场景案例——想搭一套"零 API 费 + 数据不出本地"的编程助手,这是本周最值得动手抄一遍的指南。 链接: https://t.co/Fi6nE4h2TN
See More
王大少的笔记
@leirenwangz
8 days ago
@fxtrader
带着硬盘去新加坡
王大少的笔记
@leirenwangz
8 days ago
这是Qwen-3.6-35B-A3B破解版写的小黄文! 破解版有什么好处呢? 简单来说你就是真正的主人,破解后的模型不会拒绝你任何要求,最多发表一下无力的声明。 它可以用来做很多百无禁忌的事,比如生成危险的代码,攻击性的程序,协助你干坏事等。 这是绝对的自由,也是异常的危险。 它让“能做坏事的人”的能力上限,被指数级抬高。 所以,我一直认为顶尖的模型一定不能开源,一旦掌握在邪恶的人手中,会产生巨大的破坏力。 在开源之前应该想想是否有与这些能力相匹配的治理能力?
王大少的笔记
@leirenwangz
8 days ago
不要迷恋什么skill,90%的skill都是垃圾,真正好用的skill都是自己在实践中打造的
AI少年
@aehyok
9 days ago
WorkBuddy中SkillHub官网的技能个数已经来看了7.8 万,这正是我觉得WorkBubby 的恐怖之处。 你在Codex中只能眼巴巴的到网上到GitHub 到其他平台上找,但是在WorkBuddy你可以直接搜索这7.8万个技能。 但是在搜索技能的时候有个小技巧,WorkBuddy中的搜索好像是关键字的,所以能搜索出符合你要求的技能就很少。这里我教你一招,在WorkBuddy中点击跳转到https://t.co/QSoj9Jkes7 进行搜索。 同时搜索出来的skill,有三种方式进行安装,有需要的详情请看视频。 最后附上skillhub官网地址:https://t.co/QSoj9Jkes7
See More
aehyok's tweet video.
王大少的笔记
@leirenwangz
8 days ago
为什么不用火山的服务,他家能同时用几个模型,kimi 3迟早会上
数字生命卡兹克
@Khazix0918
8 days ago
兄弟们听我的,最重要的事,先去Kimi上买个Coding Plan,然后用上K3,这可能是目前国内现在最好的模型。。。 不过我对国内算力都比较担忧,感觉再过两天,这玩意也会跟GLM一样直接买不到了。 先氪了再说。。。
王大少的笔记
@leirenwangz
9 days ago
Unsloth出了一个神器:Unsloth Studio. 它能做啥? 这是一款本地部署开源模型的训练与推理平台(有Web UI),旨在让用户无需复杂的代码配置即可在本地电脑上高效地运行和训练各种 AI 模型。其主要功能包括: 1⃣多模态支持:不仅支持文本模型,还支持音频、嵌入(Embedding)和视觉模型的运行与训练。 2⃣强大的 Agent/工具调用能力: 联网搜索:允许本地运行的 LLM 执行无限次的网页搜索。不需要你自己的搜索API KEY了。 代码执行:模型可以像“Claude Artifacts”一样,在沙盒环境中执行 Python、Bash 甚至 JavaScript 代码来测试程序、生成文件或验证答案。 自我修复:具备自我修复(Self-healing)的工具调用能力,能够自动修正错误的工具使用。 3⃣高效微调与训练:提供无需写代码的界面进行模型微调,支持多种开源模型(如 Gemma 4, Qwen3.6, DeepSeek 等)。 4⃣本地优先与隐私安全:所有数据和处理都在本地完成,用户可以直接从 Hugging Face 下载模型或在本地使用文件。 5⃣高性能优化:利用 Unsloth 的核心加速技术,实现更快的推理速度和更低的显存占用(Prompt Caching 等特性)。 它家的Web UI很好看,界面比LM Studio好看多了,功能也完全可以取代LM Studio,我马上把LM Studio删除了。 配合Unsloth Studio自家量化的模型,跑起来速度很不错,我下了一个Qwen 3.6 36B-A3B模型,2 Bit动态量化,速度飞快。
See More
Last Seen Users on Sotwe
TSHelena brian
Seen from
United Kingdom
Aktif genç
Seen from
Turkey
Fitness Star 2.0
Seen from
Kuwait
ตำนานรุ่นแม่ สาวใหญ่ เด์ด ร่าน
Seen from
Thailand
putra
Seen from
Indonesia
Ahmed Shokry
Seen from
United Kingdom
go go juice 🍷
Seen from
Canada
DAHIANA JARAMILLO
騎乘位Guy
Seen from
Philippines
ash🧃
Seen from
Argentina
Trends for you
1
#SmackDown
Under 10K tweets
2
LeBron
Under 10K tweets
3
Starship
Under 10K tweets
4
GG Banks
Under 10K tweets
5
Team Washington
Under 10K tweets
6
76ers
Under 10K tweets
7
#loveafterlockup
Under 10K tweets
8
Indian Ocean
Under 10K tweets
9
Opus 5
Under 10K tweets
10
Kobe
Under 10K tweets
Most Popular Users
1
Elon Musk
@elonmusk
241M followers
2
Barack Obama
@barackobama
119.2M followers
3
Cristiano Ronaldo
@cristiano
112M followers
4
Donald J. Trump
@realdonaldtrump
111.8M followers
5
Narendra Modi
@narendramodi
107.1M followers
6
Rihanna
@rihanna
98M followers
7
NASA
@nasa
92.2M followers
8
Justin Bieber
@justinbieber
91.2M followers
9
KATY PERRY
@katyperry
88.5M followers
10
Taylor Swift
@taylorswift13
82.3M followers
11
Lady Gaga
@ladygaga
73.9M followers
12
Virat Kohli
@imvkohli
71.2M followers
13
Kim Kardashian
@kimkardashian
70.2M followers
14
YouTube
@youtube
68.7M followers
15
Bill Gates
@billgates
64.3M followers
16
Neymar Jr
@neymarjr
64M followers
17
The Ellen Show
@theellenshow
62.4M followers
18
CNN
@cnn
61.8M followers
19
Selena Gomez
@selenagomez
61.5M followers
20
X
@x
60.8M followers
Olivia
Online
✨
⭐
💫