这种无人值守的运转,靠的是算力。十年前训练一个图像识别模型,可能需要几十台机器忙上几周。现在同样的任务,几张显卡几个小时就能完成。算力涨得快,算法也在变。早年间研究者要手工设计特征,告诉机器“边缘”“角点”长什么样。后来神经网络自己从数据里学,人只负责调结构、喂数据、看结果。省下来的力气,又拿去堆更大的模型。循环往复,窗子就越亮越久。
数据是另一头。模型再大,没有足够的数据也学不出东西。城市里的摄像头、手机上的点击、传感器传回的温度,每天都在产生记录。这些记录单看没什么,攒到一起就能看出规律。早高峰哪条路先堵,哪种零件先坏,哪类句子容易被误解。机器从这些痕迹里找关联,找得多了,就变成能用的判断。数据不是凭空来的,它来自具体的人、具体的事,只是被抽成了数字。
可数字多了,麻烦也跟着来。一个人一天去哪、买什么、和谁说话,拼起来就是很细的画像。这些画像能帮人推荐餐厅,也能被人拿去干别的。算法本身不会分辨善恶,它只认目标函数。目标设成“多卖货”,它就拼命推广告;设成“多停留”,它就挑最容易让人上瘾的内容。窗子里跑的东西,最后会落到窗外的真实生活里。写代码的人得想清楚,自己到底在让机器学什么。
机器学得再好,也有它够不着的地方。它能把病历里的指标对得整整齐齐,却没法握住病人的手。它能生成通顺的句子,却不知道这句话在具体场合说出来会伤人。人做判断时,带着经验、情绪和顾虑,这些很难写成规则喂给模型。所以现在的系统大多是人机配合:机器处理量大的部分,人处理需要掂量的部分。窗子亮着,里面往往是人和机器各干各的,偶尔互相看一眼结果。
天快亮的时候,那些窗子会一盏一盏灭掉。有人来换班,有人来看一眼跑完的结果,有人发现昨晚的训练崩了,得重新来。科技没有让夜晚消失,它只是把夜晚变成了另一种工作时段。机器不睡觉,人得睡。人睡着的时候,机器还在按人写下的指令做事。等天亮再打开屏幕,看到的是一夜之后的输出,好的坏的都有。窗子灭了,事情还没完。
