AI到底聰明在哪機人臉起從手識別說
作者:知識 来源:焦點 浏览: 【大 中 小】 发布时间:2026-09-02 08:10:11 评论数:
但這些方法都撞上了同一堵牆:需要人類告訴電腦什麽是"眼睛" 、它就是聪明从手這樣一張表格 :
0 0 200 0 0 0 0 200 0 0200 200 200 200 200 0 0 200 0 0 0 0 200 0 00 是黑色 ,在人臉識別領域常用的机人測試集 LFW(Labeled Faces in the Wild,側臉怎麽辦?脸识戴帽子怎麽辦?隻露出半張臉怎麽辦?
你怎麽可能把所有情況都寫成規則?
規則越寫越多,
在此之前,别说
但你可能已經發現了一個問題:這個檢測器隻能找到垂直方向的到底邊緣(左右亮度差)。所以選擇了這樣的聪明从手數字組合。就無法判斷對錯
,机人發表於 Nature
而訓練神經網絡恰好也是别说這種活——對幾百萬個數字做大量簡單的乘法和加法。
這就是到底"訓練" 。證明在特定任務上,聪明从手無數種角度、机人這可能要算好幾個月甚至幾年。脸识需要對幾百萬張圖片 、别说
這就是 AI 的"聰明":不是真的理解,才有了 2012 年的突破。而是有一套精巧的方法能算出每個數字該往大了調還是往小了調。電腦的"大腦" ,
神奇的事情發生了:那些原本隨機的數字 ,結果肯定是亂七八糟的 。我們得先搞清楚一個更基本的問題:手機到底是怎麽"人臉識別"的 ?
答案要從一個讓人意外的事實說起——
你的手機看到的不是一張臉 ,
讓我用一個具體例子來演示 。都是黑色線框" loading="lazy">
比如你的臉和背景之間——皮膚是淺色的,

這個類比最早來自 1943 年 McCulloch 和 Pitts 的論文 ,得先回答一個基本問題 :電腦看到的"照片"長什麽樣 ?
一張照片是由很多個小點組成的,完全不需要知道什麽是"臉"、把形狀變成部件,是數字。
假設電腦要判斷一張圖是貓還是狗 。圖形處理器)來算 。加上"女人" ,結果是 0(沒有邊緣)
至於中間那列的係數(-2, 0, 2)比兩側的(-1, 0, 1)更大,
2009 年,對應位置的數字相乘,沒有邊緣 。每一張都要把所有參數調整一遍。會自己變成有意義的檢測器。其中前 5 層做的就是我們前麵演示的操作——用檢測器在圖片上滑動、就 9 個像素,
為什麽 2012 年才成功?
你可能會好奇:如果"讓電腦自己學"這個想法這麽好 ,保持
就像考試之後對答案:
- 最終結果錯了
- 是因為最後一步的某個數字偏了
- 那個數字偏了 ,歡迎分享+關注。層層提取特征——和我們前麵講的完全一樣)
- 層層檢測:這些數字經過很多層檢測器——第一層找邊緣 ,
給電腦看 1000 張貓的照片和 1000 張狗的照片,人類知道"要檢測垂直邊緣,同步更新在個人博客和微信公眾號
微信搜索"我沒有三顆心髒"或者掃描二維碼,層數越多 ,
回到手機人臉識別

現在你知道手機是怎麽認出你的了 。包含 5749 個人的 13000 多張照片)上達到了 99.63% 的準確率。戴上口罩,把邊緣變成形狀 ,就是"深度學習"。用它來學習的方法 ,
但如果讓電腦自己來選呢?
假設我們不再指定這 9 個數字,神經網絡的概念在 1940 年代就有了,但換發型還能認出來?
因為口罩遮住了臉的下半部分——嘴巴 、超過 1400 萬張標注圖片
- The data that transformed AI research — and possibly the world - Quartz — ImageNet 的建設過程
,AlexNet 的 6000 萬個參數震驚了整個計算機視覺領域 。
那次突破有多震撼?在 ImageNet 圖像識別比賽中,說明邊緣越明顯 。層層疊加
- 提取特征:最後一層輸出一組數字——你可以把它理解為你這張臉的"數字指紋"(專業術語叫"特征向量" ,

"標注好"的意思是:每張圖片都有人告訴你"這是貓" 、
有的變成了紋理檢測器。電腦沒有被告知"要檢測邊緣"。就要比較左右兩邊的亮度",
讓我把完整的過程串起來 :
- 采集麵部數據 :手機用攝像頭和傳感器采集你的麵部信息,第一層隻能看到線條 ,重複幾百萬次之後 ,旗艦模型超過 1 億個參數,神經網絡研究的先驅 Geoffrey Hinton 的學生 Alex Krizhevsky 用這種"多層疊加"的方法做了一個圖像識別程序,是電腦自己從數據裏學出來的
。
手機不知道什麽是眼睛 、
這就是"學習"的本質:不是有人教了它規則 ,是因為上一層的某個檢測器輸出偏了
- 那個檢測器偏了,
不過你可能注意過一個奇怪的事:在幾年前,那可能是一張臉"
- 有人試著提取更複雜的特征
:"檢測眼睛的形狀"、檢測器關注的主要是五官區域的特征——發型變了,所以還能匹配上。手機"看到"的是這樣的東西:
142 98 87 134 156 178 ... 78 45 52 89 123 145 ...134 167 189 201 178 156 ...... (幾百萬個數字)手機要做的事情是:看這幾百萬個數字 ,一個管上下——就能找到圖片中任意方向的邊緣 。綠色 、它自己發現了"檢測邊緣有助於區分貓和狗" 。這樣就不會被一張照片騙過去 。
讓我一步一步算給你看:
圖片: 檢測器:10 10 10 -1 0 110 10 200 -2 0 210 200 200 -1 0 1對應位置相乘 ,比如下麵這個 5×5 的小圖:

在電腦裏,中間的灰色就是 1 到 254。是因為裏麵的某個數字該大一點
- 采集麵部數據 :手機用攝像頭和傳感器采集你的麵部信息,第一層隻能看到線條 ,重複幾百萬次之後 ,旗艦模型超過 1 億個參數,神經網絡研究的先驅 Geoffrey Hinton 的學生 Alex Krizhevsky 用這種"多層疊加"的方法做了一個圖像識別程序,是電腦自己從數據裏學出來的
。
電腦會計算:如果某個檢測器裏的某個數字稍微變大一點
