# 对 AI 终极形态的设想

> 我对 AI 终极形态早在两年前就有过设想, 但终有一步没想明白, 刚才洗完澡吹头发的时候突然想到一个绝妙的思路, 遂整理成文.

## 人类看到的不是截图，而是视频流



想一想你是怎样操作电脑的：首先是眼睛看着屏幕。

第一个问题无比关键——你看到的是什么：A. 一系列连续的帧；B. 视频流。

如果说是前者，那当下的 computer use 确实是这么做的。下面是 [Claude computer use tool](https://platform.claude.com/docs/en/agents-and-tools/tool-use/computer-use-tool) 官网给出的方案。

但是这个思路对吗？

显然不对。

如果你在玩网络游戏，或者浏览动画比较丰富的网页，一顿**静态截图**一定会丢失信息。

![image.png](https://static.yancey.app/12fb6ef5-1920-4faa-ada4-3b58b3798104.png)

所以你眼睛里看到的是视频流，然后视频流传输到你的脑子里。脑子就是 AI，负责解析看到的东西，然后决策下一步：也许是用鼠标往下滚动，也许是把鼠标移动到某个地方，用键盘输入些什么……

假设这个流程处理的任务不复杂，那么从你的眼睛看到视频流，到大脑处理下一步动作，再把指令传输给你的手或其他器官，速度是极快的。

## 截图 → 上传 → 下载 → 解析，真的太慢了

显然，当下 AI 是做不到的。

先不谈视频流，哪怕是 screenshot，截图 → 上传 → 下载 → AI 解析 → 给予指令，这一套组合拳下去，估摸得一分钟出去了。

而这个操作人需要多久？

各位自己品。

所以我认为，既然通过截图的方式已经很慢了，那么当下 computer use 都不应该在这个方向花费太多时间，直接就把精力放在视频流上。

## FSD 已经证明了这条路是可行的

该技术并不是没有先例，首先应该想到的就是特斯拉的 FSD：摄像头获取纯视觉视频流，AI 中枢实时态势感知，然后下发指令操作实体机械。

这个过程同样要求快准狠，汽车高速行驶不可能给你时间慢慢吞吞地截图。

当然，截图的方式也不是没有意义，在一些速度要求不高的场景还是有一席之地，比如交叉路口的电子眼、小区地下车库的抬杆装置。

FSD 之所以做到这一点，是因为车机就自带一台 AI 中枢，视频流的传输读取、AI 的推理、指导实体机械，全都缩在这一个车内，所以数据传输不会成为瓶颈。

当然，光通信技术的升级、芯片技术的升级，都会让这些更快。

## 本地部署解决不了，社区部署呢？

这就引出一个常见的话题：本地部署。

但我认为，现在、未来，对于通用大模型，不可能做到本地部署，差距太大，就是 PC 跟数据中心那种级别的差距。

但只要是有数据中心，必然就存在数据传输慢的问题。

这个问题困扰我了两年，直到刚才吹头发的时候，突然想到：AI 数据中心是不是可以像特斯拉的充电桩、5G 基站一样，一个社区部署一个实例？

然后这个社区的人访问起来，是否就能像在特斯拉的车里享受 FSD 一样的速度？

## 如果 AI 真的是第四次工业革命

当然，这些都是理论猜想，实际成本不用想都是惊天大爆炸。

但如果你把 AI 看成第四次工业革命，也许在未来某一天是有可能的。

那么后续无论是下达代码指令操作电脑，还是实际操作具身机器人，这个速度都会惊人的提升，直到和人类抹平。

## Computer Use 的终点，应该是模拟人类

最后说一下 computer use。

我觉得 AI 下达操作的代码不应该复杂，比如不要有 `.scroll()` 这样命令式的指令。

因为人去滑动鼠标，绝不是脑子里下达指令，让人的手去执行 `.scroll()` 的函数。

指令尽可能模拟人类最朴素的操作鼠标、键盘的方式，这些能力后面具身机器人做出来，也可以复用。


---

Source: https://yanceyleo.com/post/1b27acf6-3126-4471-b4f7-922bc7c16cad
Published: 2026-08-17
Tags: AI