We are starting Intent Lab, building an autonomous team we call "fleet" that turns intent into production software. Today we are sharing some early results: the fastest GLM5.2 inference engine, one shot database creation, and a fully verified agent filesystem.
https://t.co/CtwtypE0rH
微软1月放出的语音转文字AI,我在MacBook上试了一下,真的绝了。
叫VibeVoice-ASR,能一口气处理60分钟音频,国内几乎没人提。
① 60分钟音频直接转,不用分段
② 自带说话人识别
③ 每句话带时间戳
④ 50多种语言、MIT协议可商用
而且本地跑,API费用零。会议录音不用上传云端。
原本是做语音生成的,今年1月加了反向识别功能。我这种周周都有录音要处理的,这个"直接扔进去"的特性真的戳中我。
这里可以用:
https://t.co/tvqGb01fAA
rahilp/second-brain-cloudflare: One memory layer, every AI tool. Store anything once — recall it in Claude, ChatGPT, Cursor, or any MCP client. Self-hosted on Cloudflare's free tier. https://t.co/SxFl8n9DfX
最近一直在思考一个问题。
很多人都在说要建立自己的 AI 知识库、第二大脑、长期记忆,但真正的问题其实不是「怎么存」,而是:
AI 应该通过什么方式持续了解你?
如果这个问题没有想清楚,你收藏再多内容、接再多工具,最后也只是把信息从一个地方搬到另一个地方。
所以我没有先去研究各种产品,而是先尝试回答一个更基础的问题:
AI 获取信息,到底有哪些入口?
一开始我也是按照产品去理解这个行业。
AI 眼镜、录音笔、智能手表、手机、机器人……
后来发现,这样分类会越来越乱,因为产品形态会一直变化。
于是我换了一个分类维度。
不按产品分类,而是按 AI 获取信息的方式分类。
整个行业一下就清晰了。
目前我把 AI 的信息输入分成三类。
第一类:视觉(Vision)
AI 通过视觉获取信息。
包括截图、拍照、屏幕内容、文档、视频以及现实世界中的图像。
手机、AI 眼镜、Vision Pro,本质上都属于视觉输入,只是获取信息的场景不同。
第二类:听觉(Audio)
AI 通过声音获取信息。
包括语音聊天、会议录音、电话以及环境声音。
录音笔、AI 耳机、语音助手,本质上都是在持续获取声音信息。
第三类:感知(Sensing)
除了看见和听见,还有大量信息来自各种传感器。
例如 GPS、蓝牙、UWB、运动状态、光照、温度等环境数据,以及心率、睡眠、血氧等人体数据。
它们帮助 AI 理解的不只是你说了什么、看到了什么,而是你当时处在什么环境、身体是什么状态。
这个分类对我最大的价值,不是理解行业,而是回答了另一个问题:
如果今天开始构建自己的 AI 知识库,普通人应该从哪里开始?
我的答案是:
先从视觉开始。
原因很简单。
视觉几乎不需要改变任何人的使用习惯。
每个人每天都会截图、拍照、保存图片、浏览网页、阅读文档。
这些行为本身就在持续产生知识。
真正缺少的,不是记录工具,而是一个能够持续理解这些内容的 AI。
相比之下,全天录音需要改变使用习惯,也会涉及隐私问题;各种传感器和健康数据,则需要更多硬件支持。
对于绝大多数普通用户来说,视觉是成本最低、门槛最低,也是最容易开始的一步。
这也是我们最终选择从视觉入口开始做产品的原因。
我们没有试图一次解决所有问题,而是先把截图、拍照和屏幕内容这条链路做好,让 AI 能够持续理解用户每天看到的信息,再逐步扩展到其他输入方式。
我越来越觉得,未来 AI 的竞争,不是谁的模型参数更多,而是谁能够持续获得更完整、更真实的信息。
而对于普通人来说,建立 AI 知识库也不需要一开始就购买各种新的 AI 硬件。
从每天都会产生的视觉信息开始,让 AI 持续理解你的所见,这已经是一个足够好的起点。