Afrikaans
Akan
Albanian
Amharic
Arabic
Armenian
Azerbaijani
Basque
Belarusian
Bemba
Bengali
Bihari
Bosnian
Breton
Bulgarian
Cambodian
Catalan
Cebuano
Cherokee
Chichewa
Chinese (Simplified)
Chinese (Traditional)
Corsican
Croatian
Czech
Danish
Dutch
Esperanto
Estonian
Ewe
Faroese
Filipino
Finnish
French
Frisian
Ga
Galician
Georgian
German
Greek
Guarani
Gujarati
Haitian Creole
Hausa
Hawaiian
Hebrew
Hindi
Hmong
Hungarian
Icelandic
Igbo
Indonesian
Interlingua
Irish
Italian
Japanese
Javanese
Kannada
Kazakh
Kinyarwanda
Kirundi
Kongo
Korean
Krio (Sierra Leone)
Kurdish
Kurdish (Soranî)
Kyrgyz
Laothian
Latin
Latvian
Lingala
Lithuanian
Lozi
Luganda
Luo
Luxembourgish
Macedonian
Malagasy
Malay
Malayalam
Maltese
Maori
Marathi
Mauritian Creole
Moldavian
Mongolian
Myanmar (Burmese)
Montenegrin
Nepali
Nigerian Pidgin
Northern Sotho
Norwegian
Norwegian (Nynorsk)
Occitan
Oriya
Oromo
Pashto
Persian
Polish
Portuguese (Brazil)
Portuguese (Portugal)
Punjabi
Quechua
Romanian
Romansh
Runyakitara
Russian
Samoan
Scots Gaelic
Serbian
Serbo-Croatian
Sesotho
Setswana
Seychellois Creole
Shona
Sindhi
Sinhalese
Slovak
Slovenian
Somali
Spanish
Spanish (Latin American)
Sundanese
Swahili
Swedish
Tajik
Tamil
Tatar
Telugu
Thai
Tigrinya
Tonga
Tshiluba
Tumbuka
Turkish
Turkmen
Twi
Uighur
Ukrainian
Urdu
Uzbek
Vietnamese
Welsh
Wolof
Xhosa
Yiddish
Yoruba
Zulu
人工智慧機器學習神經網路
這些聽起來高大上的詞彙
你是否還一知半解
GPT大語言模型生成式AI
這些頻繁出現在商業報道
乃至於日常生活的前沿技術
你是否好奇
它們的發展、淵源和基本原理?
萬物皆可AI的時代
你是否擔心被割韭菜或者被動失業
這期視頻耗時半年
專為零基礎的觀眾打造
將實打實講明白人工智能的來龍去脈
我是漫士
一位畢業於清華
姚班的人工智能博士生
從本科到研究生
所有AI課程全部滿分
排名年級第一
目前正在從事深度學習理論的研究
剛從普林斯頓回國
視頻製作實在不易
還望點贊多多支持
看不完可以收藏或關注我
之後慢慢看
1956年
一群科學家齊聚達特茅斯開了一場會
這場會議持續一個多月
一共只有十來個人參加
但個個都是大佬
他們包括
達特茅斯的數學系教授麥卡錫
哈佛大學數學與神經科學研究員
閔斯基,IBM主管羅徹斯特
信息論發明人香農等人
但就是這樣一場很小小的會議
深刻的改變了幾十年後世界的樣貌
8年前戰勝李世石的AlphaGo
如今能幫我們解決各種日常問題的GPT
本質上
都起源於這場會議所發起的研究
如何製造出一種可以不斷學習
並模擬人類智慧的機器呢
這個領域在2018年拿到圖靈獎之後
又在今年
一舉斬獲了諾貝爾物理獎和化學獎
是的這個領域就叫人工智慧
而這場會議
也被視為開創人工智慧的起點
達特茅斯會議
人工智慧,說白了就是人工搭建起一套智慧
要實現這個目標
首先就要回答一個非常根本的問題
什麼是智能
我們想想
生活裡什麼時候
我們會覺得一個物體有智能呢
比如說我們跟狗說話
讓它坐它就會坐下
讓它叫它就會叫兩聲
你罵它兩句
它就會一臉幽怨的盯著你
此時我們會覺得哎
這隻小狗很聰明
有靈性有靈性
本質上就是說
狗是一種有智能的生物
和石頭什麼的不一樣
你無論怎麼叫一塊石頭
它都無動於衷
所以是一個死物
正因此儘管有關智能的定義千千萬
但他們都逃不開這樣的核心
智能本質上就是通過
收集信息
對於不同的情景作出針對性的反應
中學有一個很有意思的小實驗
那就是觀察草履蟲的應激行為
在另一端滴上肉汁
草履蟲就會跑過去
而加上幾粒鹽
它們就會四散逃跑
正是這種針對環境的變化
趨利避害的運動
讓我們相信
這些水中的小顆粒
是一種有智能的生物
而不是無生命的灰塵
事實上如果你看到有一些草履蟲
沒有了趨利避害的反應
這就說明一個很簡單的道理它們死了
智能隨著生命消失
既然智能說白了就是看情況做事
那麼所謂人工智能
同樣就是搭建起一個
根據不同的環境信息
給出針對性的輸出和回應的系統
這個輸出可以是動作語言
也可以是一種判斷和預測
比如說人臉辨識可以根據不同的人臉
針對性地回饋出不同人的身份資訊
AlphaGo
可以對於各種不同的複雜棋局的情況
給出最佳的下法
爭取勝利
GPT可以根據上文
不同的問題和任務的要求
針對性地跟你說話並解決問題
因此它們都是智能
設想一下
如果人臉識別
把所有的人都認成了張三
AlphaGo在棋盤上到處亂下
GPT的回答牛頭不對馬嘴
那這個AI的全稱應該叫artificial idiot
人工智障
總而言之
智能的本質就是一個不會亂來的黑箱
或者用數學一點的說法
智能就是找到情景信息的輸入
和我們想要的聰明的行為輸出
之間的函數對應關係
這裡給大家聽一段來自美國的
老爺子Thomas Garrity激情四射的演講
相信你會對這個函數有更深的體會
functions 函數
describe 描述了
the wor~~~~ld 世——界——!
everything is described by functions 世間萬物都被函數所描述
the sound of my voice on your eardrum, function 我的聲音傳到你的鼓膜,是函數!
the light
that's kind of hitting your eye balls right now 那些正在照射向你們眼睛的光
function! the entries you put in your random matrices 也是函數!那些你在矩陣中隨機設定的數值
function! it's all~~~ function 還是函數!全——都是函數!
different classes and mathematics 不同的領域different
areas and mathematics study 數學不同方向的研究
different kinds of function 研究不同的函數
high school math studies 高中數學研究
second degree one variable poomials 單變量二次函數
微 積分
functions and it goes on and on 光滑的單變量函數,各種地方都如此
functions describe the world 函數,描述,世界!
你也能更好地理解圖靈測試
因為圖靈測試它就在說
如果人無法區分是在跟人還是AI聊天
那麼這個AI就實現了人的智能
它本質上正是在說
所謂AI本質上就是它所定義的
輸入到輸出的這個黑盒子的函數關係
它跟你回應的話和人沒有任何區別
那麼這就是一個類似於人的智能了
問題來了
該怎麼做出這樣一個聰明的黑箱呢
科學家針對這個問題提出了很多思路
例如有一批人
從數學的形式化推理體系中得到靈感
主張
智能可以用符號的邏輯推理來模擬
這就是符號主義symbolism
舉例
a表示陰天
b表示濕度大於70%
t表示將要下雨
那麼知識是一條邏輯規則
如果a和b是真的
那麼t就是真的
所謂智能
就是看到陰天和濕度很大
明白a和b都對
那麼利用這條規則
推出t是真的
從而預測到可能將要下雨
這些人類的推理和思考
都可以從這些符號和規則當中
像算數一樣計算出來
因此符號主義相信
智能正是一套
像這樣處理符號和規則的計算系統
他把人類的知識和邏輯
用如果a
那麼b這樣的規則存儲下來
然後呢不斷進行符號推演
就可以實現接近人類的智慧
這套思路最成功的典範
就是曾經的專家系統
他諮詢人類的醫學專家
甚麼樣的病可能會有什麼樣的症狀
接著把這些規則全部記錄下來
只要利用這些規則
就可以根據已有的信息給出預測
實現一個智能的黑箱
這套系統
一度在疾病診斷和金融諮詢領域
獲得了很大的成功
但隨著時間推移
它也逐漸暴露出致命的缺陷
首先很多時候
現實世界沒有那麼清晰的規則
即使詢問人類專家
出現某個症狀
是不是得了某個病
或者股票走勢長成這個樣子
應該是買還是賣
他們給出的回答往往都並不一致
那你的系統只能選擇一個
到底該聽誰的呢
更要命的是
這套系統完全是在複製人類經驗
所以他的能力上限就是專家的水平
無法做到比人更好
而且從你設計完成這套系統開始
他就永遠是靜止不變的水平
很難像人一樣
隨著經驗和時間的增長
水平不斷繼續提升
正因此從上世紀70年代開始
另一個人工智能流派開始發揚光大
他不追求一開始就有一個
完美的黑箱
但允許這個黑箱不斷的變化
透過不斷的引導和學習
讓他在某一個任務上表現的越來越好
哎沒錯
也是一種成長型的心態
這種思路啊
就像訓狗
你發出坐的指令
如果他坐下來呢
你就獎勵他狗糧或者摸摸狗頭
如果他沒聽懂或瞪著眼睛
你就給他一逼鬥
久而久之
狗這個黑箱就會越來越明白
你發出坐這個指令
和他需要坐下來的這個行為
之間的關係
就像條件反射一樣
之後只要聽到坐這個命令的輸入場景
他就會給你坐下來這個動作
於是一隻會聽指令的聰明小狗
就訓練完成了
這個流派的名字也很生動
就叫做機器學習
顧名思義
就是把在學習的對象從狗變成了機器
通過給機器以獎勵或者懲罰的方式
讓機器自主調整
不斷學習
從而學會解決某一種任務的智能
這個任務
可能是識別圖片裡的數字和人臉
也可能是下圍棋或者是與人對話
等等等等
機器學習的強大之處在於
它不需要任何專家的專業知識
來人為搭建黑箱內部的結構
它只需要兩樣東西
一個強大且有學習能力的黑箱
以及足夠多的數據
舉個例子
假設
你想要一個能夠識別數字的智能黑箱
那麼
只需要準備一個具有學習能力的機器
然後收集很多數字的圖片人工
標註出每張圖片裡的數字是什麼
接下來你只需要像訓狗一樣
把一張張圖片展示在這個機器面前
讓他預測裡面的數字到底是
什麼如果他預測對了
你就給他獎勵
錯了呢你就給他懲罰
讓這個機器不斷的自我調整
當他見過的圖片越來越多之後
就能夠神奇的做到
正確識別這個圖片裡的數字是什麼了
相信你現在心裡肯定有一個疑問哎
哪來的黑箱這麼神奇
能夠像狗和人一樣越學越機靈
而且給狗獎勵是餵狗糧摸摸頭
給機器獎勵和懲罰又是怎麼一回事呢
難不成是多給點電嗎
而且
狗的條件反射和學習過程那麼複雜
人搭建起來的機器
又是怎麼自我調整和學習的呢
哎問的非常好
這三個問題啊
其實分別對應於機器學習的模型
結構損失函數和訓練過程
接下來的影片就會詳細解答這些問題
讓我們先解決第一個問題
怎麼搭建起一個
有學習能力的黑箱機器呢
有沒有一種萬能的超級強大的黑盒
無論什麼樣的對應關係
它都能表示和學會呢
這裡呢
就值得一提另一派實現人工智能流派
聯結主義
他們認為
大自然
已經給了實現智能的標準答案
那就是人類精妙的大腦
只需要通過仿生的方式
模擬單個神經元的複雜功能
以及神經元之間複雜的連接
那麼我們只需要
像運行一台精密的鐘錶一樣
運行這個人工搭建的神經網絡
人類就可以實現不可思議的智慧
這一派思想被稱作聯結主義connectionism
為了理解聯結主義
我們先考慮一些最簡單的智能
比如這裡有一個蘋果
那為什麼你會覺得它是一個蘋果呢
你可能會說
因為它直徑大約10厘米
外表皮是紅色的
是個球形
氣味香甜
沒錯我們對於很多概念
比如蘋果的理解
是依賴於其他的概念屬性組合而來的
在每個不同的概念屬性上
不同的水果會有各自的特徵
例如大小方面
西瓜是大的
而其他的水果是小的
所以在尺寸大這個特徵上
西瓜符合
而其他的水果不符合
在計算機的世界裡
我們用1來表示符合
0表示不符合
這樣我們就可以列出各種水果
與不同屬性之間的一張關係對應表
當每個水果的特徵
都和蘋果的屬性吻合時
我們就傾向於判斷這是蘋果
如此我們就擁有了一種簡單的
識別水果的智能
因此
有一種最簡單的搭建黑盒的方式
比如說我們想要識別蘋果
那就將一個水果的所有特徵
比如說大小顏色氣味什麼的作為輸入
然後分別考慮它的每個特徵
是否像蘋果
具體來說
就是乘一個係數
比如說尺寸不大
顏色是紅色
味道很甜
這些都表明這個水果符合蘋果的特徵
因此他們對於是蘋果這個判斷
起到正向的促進作用
我們會把它乘以一個正數
而尺寸很大
吃起來酸
這些特徵都表明不太可能是蘋果
所以我們把它乘以負的係數
最後我們只需要將這些特徵
各自乘以它們對應的係數
然後加在一起
就可以得到一個蘋果得分
這個得分越高越像蘋果
越低則越不像
所以 我們就可以再設置一個得分的閾值b
如果最後的得分高於b
那麼這台機器就激活
否則不激活
此時整個這台機器
就變成了一個蘋果識別機
只有你把蘋果拿到它面前的時候
它會激活
亮起右邊的燈泡
而只要你放在前面的水果
不滿足蘋果的特徵
它就不會激活
所以根據我們的定義
整個黑箱
此時就具備了識別蘋果的智能
這個黑箱機器的厲害之處在於
你不僅可以用它來識別蘋果
還可以用來辨識其他的水果
只需要透過調整這些連結的係數
你就可以表示不同的概念
比如說你可以讓他在水果又大
又綠又甜的時候激活
那麼此時這台機器的用途
就是識別出西瓜
或者在又小又紅又酸的時候激活
那麼他就可以特別的篩選出山楂
這裡每一個特徵到輸出之間
連接的係數
就像一個機器的旋鈕
你只需要根據自己的需求
設定這些旋鈕的值
就可以讓整台機器
非常針對性的指對某種水果激活
而這種從輸入數據中
識別不同水果特徵的模式
理解概念的過程就叫做模式識別
而這個玩意兒
就是人類在1956年
最早提出的一種模式識別的算法
模型:感知機
哎有人可能會說了
你這個取各種條件
合在一起判斷的過程
看起來和前面的專家系統
好像也沒啥區別呀
哎你說的很
對這 是一個很多人都不知道的冷知識
大家通常以為
神經網路代表的聯結主義
從一開始就和符號主義水火不容
分道揚鑣
但其實感知機這種最早期的神經網路
它的設計
很大程度上
借鑒甚至是脫胎於邏輯推理
其思路同樣是組合不同的特徵條件
來進行推理
這裡的每個神經元
也就像剛才我們說的
符號邏輯當中的一個
一個命題的字母一樣
只不過
他是用數值計算的方式來模擬邏輯的
而數值計算本身
不局限於有限且明確的符號推理
因而在更廣泛的領域
比如說控制環境感知圖像識別等領域
具有更強大的潛力
這個我們在後面就會看到
巧合的是
這種設計同樣和神經科學不謀而合
中學的時候我們學過
神經元通過電信號傳遞信息
其中樹突接收不同神經元的電信號
而軸突則會將自己的訊號
傳遞給其他的神經元
而感知機啊
它也恰似一個神經元
你看呢那些傳入的數字
分別表示它接收到的各種訊號
它們可能會激活
或抑制這個神經元的活動
而這種影響
就體現在
每一條連邊參數w的正負和大小上
神經元直接疊加所有接收的影響
而如果疊加的刺激足夠大
它就會激活
進一步往後傳遞
這一切
都和生物神經元的活動不謀而合
事實上這個數學模型的提出啊
比人工智慧還早
早 在1943年的二戰期間
Pitts和Mcculloch在生物物理學通報上
共同發表了
神經活動中內在思想的邏輯演算
提出了這套神經元的數學模型
你注意看這套名字
神經活動中內在的邏輯演算
這更顯示
聯結主義和符號主義其實是同源的
1957年康乃爾大學的羅森布拉特
造出了
人類第一台有實際應用價值的:感知機
這台感知機將圖片的像素作為輸入
透過演算法調整參數
不斷學習
最終能夠做到判斷出一張圖片裡
是男人還是女人
或者是左箭頭還是右箭頭
一時間轟動世界
雖然在今天看來這可能沒什麼
但讓我換一個角度跟你解釋
你就會知道這有多了不起
計算機和人是兩種非常不同的東西
對於人來說很困難的問題
比如說計算兩個十位數的乘法
對於計算機來說卻很簡單
但對人來說很簡單的事情
對於計算機來說卻非常困難
比如說理解圖片的內容
因為在計算機看來
圖片本質上是一堆像素的數值
所以識別圖片中的內容
在數學本質上
就是給你一大塊數字組成的矩陣
然後問你啊
這裡面畫的到底是一個什麼
或問你
這裡面到底是個男人還是女人
人的長相千姿百態
各種五官光影角度的細微變化
都會呈現出不同的圖片
導致像素的具體數值出現劇烈的變化
而我們要透過純粹的計算
算出來真實照片裡的人
是男性還是女性
現在你還覺得這整個數學問題
也就是說
從圖片中看出是什麼內容很容易嗎
人類的視覺和大腦
是不是很不可思議呢
而這個領域就叫做電腦視覺
正因此在發明感知機之後啊
時年30歲的羅森布拉特意氣風發
迫不及待的召開新聞發布會
暢談自己研究成果的美好未來
吸引了眾
多媒體 的極大關注
比如說大名鼎鼎的紐約時報記者
對感知機的先進性贊不絕口
報道說
這是一個能夠行走擁有視覺能夠寫作
能自我複製
且有自我意識的電子計算機的雛形
他把它稱為電子大腦
電腦這個名字
最早也是從這個時候來的
文章當時還非常樂觀的估計
再花上10萬美元
一年之後上述構想就可以實現
那時感知機將能夠識別出人
並能叫出它們的名字
而且還能把人們演講的內容
及時的翻譯成另一種語言記錄
但經歷過現實的我們知道
這件事直到最近幾年才算真正實現
所以啊真心也好
忽悠投資人也罷
總之人類對於自己不了解的東西
就是很容易浪漫
也很容易對於未來過分樂觀
歷史上
每當人工智慧取得一點點微小的進步
人類就會開始賦予它無限能力的想像
暢想與AI大戰的場景
從來如此
回到一開始的問題
那究竟該怎麼搭建出一個
有學習和進化能力的聰明黑盒子呢
感知機就是一個簡單的例子
專業的說法
這些東西啊
都叫模型
模型本身確定了它輸出的函數形式
比如說這裡
就是先用wi加權組合所有的輸入
然後減去閾值b
再激活就是它整個模型的輸出
這有一套函數形式
但與此同時
它又沒有完全確定整個函數
依然有一系列
你需要調節和設定的數值
比如說這裡的每個wi和b
它們呢叫做參數
我們只需
要 在設計模型的時候讓它足夠強大
任何你想要它實現的功能
本質上都可以透過設定模套參數實現
那麼我們只需要讓這個模型
不斷調整自己的參數
不斷向著越來越有用
符合我們需要的這種輸出的模式變化
可以讓它最終實現強大的智能
這就是聯結主義的信念
這套故事在一開始提出的時候
野心勃勃
而且實現了感知機這樣了不起的成就
但聯結主義一度陷入寒冬
甚至被整個世界斥為騙子
在最一開始的時候
就有很多學者反對聯結主義
他們覺得
這只是機械的模擬了生物的構造
而且神經元建模的也太簡單了
而且他們覺得
聯結主義期待在一通亂聯當中
發生魔法
1969年
馬文閔斯基寫了一本叫做感知機的書
正如給你伸大拇指的人不一定是誇你
也可能是想拿砲打你
他這本書可不是要推廣感知機
而是要給感知機下死刑
把棺材板上的釘子釘死
閔斯基在書中指出了這樣一個事實
有一個邏輯電路裡非常基本的操作
叫做異或XOR
簡單來說
就是當輸入的兩個特徵一樣的時候
輸出是0
而輸入的不一樣的時候
輸出是1
就是這麼一個非常簡單的對應關係
感知機卻無法完成
為什麼會這樣呢
我們仔細看感知機的函數形式
就會發現
它本質上
是在計算W1x加w2y減b的符號
假如我們把所有的這樣的x,y輸入
畫在二維平面的座標系上
那麼能夠讓感知機激
活 的所有輸入滿足w1x加w2y減b大於0
中學的小伙伴可能會很熟悉
這其實啊
就是一個線性規劃
所以說能夠激活的
滿足條件的輸入和不激活的
分界線永遠是一條直線
然而對於異或問題
你會發現
需要啟動的這兩個點
和不啟動的這兩點
是這樣分佈的
你永遠沒法用一條直線
將這兩種點恰好分在直線的兩邊
所以呢就不存在一台感知機
能夠直接實現這個簡單的異或運算
閔斯基在這本書裡直接毫不客氣地說
羅森布拉特的論文沒有什麼科學價值
他自己在同年獲得圖靈獎
這本書
也因此將整個聯結主義打入冷宮
在之後的二三十年間
神經網絡這個名字
彷彿就是騙子的代名詞
是連疑惑這個操作都做不好的
無用的玩物
在當時圖靈獎得主的帶頭唱衰下
神經網絡一度陷入了極度的寒冬
所有人都認為他是垃圾和騙子
基金資助大為減少
研究者紛紛轉行
AI研究也因此陷入長達數十年的寒冬
你看人類又是這麼容易悲觀
一個小小的反例就自暴自棄
放棄了充滿潛力的研究方向
但與此同時
依然有一批研究者在堅持
他們最後守得雲開見月明
成為了後來深度學習的奠基人
並獲得圖靈獎
我們可以聽聽
圖靈獎和諾貝爾獎雙料得主辛頓
當年在UCD大學
接受採訪的時候的一段表達
looking back at your career 回望你的整個學術生涯
what aspects of it are you most proud of 你對其中的哪個方面最為自豪?
i'm not necessarily just thinking about your discoveries 我並不僅僅在說您的科學發現
but maybe other aspects of your career as well 而包括您更大的整個生涯
the people who worked with the teams that you've built 那些與你合作的人,你建立的團隊
i guess i'm proud of the fact that i stuck with neural networks 我想我最驕傲的是我當年堅持了神經網絡
even when people said they were rubbish 儘管當時人們都說這是垃圾
which was for about the first 40 years 而且說了整整40年
but the intellectual achievement 在智力上的學術成就
i'm most proud of is boltz machines 我最自豪的是玻爾茲曼機
which were an alternative to back propagation它是反向傳播之外的另一種可能
他們是怎麼拯救神經網路的呢
回到剛才異或的例子
他們想既然一個神經元不行
那麼多來幾個可不可以呢
比如說我們將這些感知機的輸出啊
一個一個的拿出來
然後
在後面再嵌套接一層感知機
作為他們下一個感知機的輸入
我們一套娃,套娃
一層又一層出來一個新的感知機
這樣
我們就可以讓中間一層的兩個神經元
分別只被0,1和1,0激活
比如說第一個神經元
它的組合係數是1,-1
此時呢
就只有1,0這個輸入能給它最強的刺激
大小為1
其他的都不超過0
所以我們如果再設定一個1/2的閾值
就可以 讓它只在1,0這個輸入的時候激活
同理呢我們也可以對另一個神經元
在0,1的情況下才會啟動
設定方式呢是係數-1, 1
這樣的話
兩個中間的神經元
就可以分別關注
兩個我們想要激活的位置
接著我們再把這兩個神經元的輸出
直接加在一起
大於0的時候給出最終的激活
這樣整個模型
就可以剛好在1,0和0,1的時候激活
而在0,0和1,1的時候不激活
從而實現異或功能
而這
就是後來大名鼎鼎的MLP Multilayer Perceptron
全名多層感知機
這裡中間層當然可以不止兩個神經元
層數也可以不止兩層
當這些神經元層層疊疊的時候
就是大名鼎鼎的神經網絡
這裡的每一根連線
都標誌著兩個神經元之間的連接強度
是一個可以調節的參數係數
計算機科學家證明
只要這個神經網絡的深度和寬度
都足夠大
那麼理論上它可以擬合任何一種函數
表達任何一種智能所需要的
輸入到輸出之間的對應關係
換言之只要你有一個超大的神
經 網路那麼
任何一個你想要的智慧黑箱的功能
都一定可以透過設定一套參數實現
該怎麼理解
神經網路這種強大的能力呢
還記得我們前面說過嗎
我們用不同的屬性概念組合再激活
就得到了一個可以識別蘋果的感知機
的智能
而如果我們在感知機上繼續套娃
就可以不斷地把原本簡單基礎的概念
組合成更複雜的概念
例如在數字識別的這個神經網絡中啊
最前面的神經元啊
就負責識別一些非常基礎的筆畫
和邊緣而往後層的神經元呢
就負責將這些基礎的特徵組合
識別出一些更複雜的概念
比如說圓形橫線豎線折線等等
接著
更深的神經元可以組合這些線條圖形
識別出複雜的數字
比如說9就是一個環形
加上右下角的尾巴
隨著層次的加深
神經網路逐漸從簡單的這些特徵
推導出複雜的整體形態
最終準確地識別一個複雜的概念
而整個這個過程
不需要任何人類專家知識的介入
是他自動完成的
而這正是神經網路的強大之處
隨著時間的推移
神經網路的技術不斷的進步
前面我們看到的多層感知機
只是最經典最基礎的一種
如何設計更好更強大的模型結構
一直是深度學習的重要課題
比如真實世界裡動物的視覺
神經系統的神經元吶
不需要和前一層的所有神經元
全都稠密的連接
而只需要和局部的幾個神經元連接
就行
而且每個神經元和前一層連接的參數
結構又都是類似的
那麼我們設計神經網路的時候
也可以藉鑑這一點
從而減少參數和運算量
提升神經網路的性能
這就是大名鼎鼎的捲積神經網路CNN
後來研究人員發現
卷積層堆的多了
訓練起來有困難
又增加了一種跳躍式的連接
這就是殘差網絡Resnet
或者
你可以把任何兩層都跳躍連接起來
這就是denset
再到今天GPT的基礎框架Transformer
也就是attention
它們本質上
都是某種網絡的基礎框架結構
然後有大量的參數需要去決定
一個好的結構可以讓黑盒學的更快
需要的數據更少
而這就是深度學習
曾經一個非常重要的領域
神經網路結構設計
你肯定會問
神經網路這麼強大
可以自主地發現資料中蘊藏的結構
理解概念
他究竟是怎麼做到這一點的呢
答案就是用資料訓練
透過獎勵和懲罰
來引導神經網路形成智能
但我們應該究竟怎麼獎勵
懲罰一個神經網路呢
其實從GPT到Alphafold
再到Midjourney和各種強化學習
各種複雜又先進的人工智慧模型
幾乎無一例外的
都在使用著同一種演算法
來訓練網路找到最好的參數
而這個演算法就叫做梯度下降
特此說明啊
這部分內容的數學知識很多
而且技術性很強
但因為它實在是太重要了
所以我們必須要講
因此呢你實在聽不懂也沒有關係
具體的我將沿用油管博主
Artem Kirsanov的影片和思路
為大家講解
在講解梯
度 下降之前
先讓我們簡單回顧一下前面的內容
我們首先提到
智能的本質是一個黑箱
這個黑箱
能夠從數據中
找到輸入和輸出之間的對應關係
換言之,在數據驅動的機器學習
和統計學習眼裡
所謂的智能
本質上就是給你一堆點
然後用一個函數
你和他們之間的關係罷了
這裡的x和y
可以是任何你關心的兩個量
只要學會了一個
可以刻畫這些點趨勢的函數
我們就可以獲得任何一個輸入
對應的合理輸出
換言之實現了智能
該怎麼找到這些數據點
所勾勒出的底層規律呢
根據前面的內容
你可能會想到神經網絡
這當然是一個辦法
不過這裡呢
為了理解梯度下降
我們先用一個簡單一點的方法
找到這個函數
比如說我們線性組合常數x
x平方,x3次方
X4次方
X5次方這幾個簡單的單項式模組
換言之
我們想要找到一個五次多項式
來刻畫這些數據變化的規律
我們需要找到K0到K5
這六個參數最好的組合
那什麼樣的參數是一個好的組合呢
我們需要一種定量的方式
來度量一組係數所對應的多項式
到底擬合的好不好
而這就是損失函數
其實大家早就見過損失函數了
中學學過最小平方法
其實就是用一個簡單的y等於k
x加b的線性函數來搭建黑箱
對每個數據點
線性函數的預測和實際結果
都會有偏差
我們把這些偏差的平方
加在一起
就得到了這根直線的損失函數
在復雜的非線性裡
損失函數也是一樣的道理
我們同樣
把函數預測的數值
和實際資料點的數值誤差平方
加在一起
就得到了這個函數的損失函數
你可以看到
當這個函數的預測
越是貼合這些數據點的趨勢時
損失函數加在一塊就會比較小
而反之呢
損失函數就會比較大
大體來說
損失函數
就是在衡量一個模型預測的
和真實的結果之間的偏差程度
只要記住,掌握規律
就等於損失函數很小,就可以了
請注意這裡出現了兩種函數
大家不要混淆
第一種
是我們用來擬合數據點的這根曲線
我們叫它擬合函數
也就是那個五次多項式
它的輸入是x
輸出是y
我們要決定
這6個參數
輸入到輸出的可能函數有無窮多個
我們想要找到最好的那一個
而什麼叫最好呢哎
為此我們提出了損失函數
它衡量一個擬合函數到底好不好
是一個打分機器
它的輸入是多項式的這6個係數
接受到這些係數之後呢
它會先建構出這個擬合的曲線函數
然後呢
逐以比對計算在所有數據點上的偏差
將它們平方加在一起之後
就會得到最終的損失函數的輸出了
我們只需要找到
使得這個損失函數很低的輸入參數
組合K0到K5
我們就可以找到一個優秀的擬合函數
而有了這個擬合函數之後
我們就可以把這個擬合函數
機器拿過來
輸入任何一
個 我們關心的x
得到一個符合數據規律的合理的y
你可以理解為我們在玩這樣一個遊戲
每一個參數k啊是一個旋鈕
它們通過設置這個係數
會產生一個不同的多項式曲線
而你的目標就是調節這些旋鈕
讓這跟擬合函數的曲線
和數據點比較貼合
事實上神經網路幹的事情
本質上也是完全一樣的
只要把這裡的k
改成神經元之間的連接係數和閾值b
那麼訓練神經網路
同樣也是一個調節參數旋鈕
來降低損失函數的遊戲
這個遊戲難點在於
旋鈕實在是太多太多太多
你看這個5次多樣式有6個參數旋鈕
已經讓人非常頭大
而神經網路的參數個數更是多到離譜
舉個例子
GPT3一共有1,750億個參數
換言之你要同時調好1,000多億個旋鈕
並且讓這些旋鈕組合起來的設定
可以有很好的性能
能夠跟你對話解決問題
是不是聽起來很不可思議呢
這幾乎是一件不可能的事情
在數學上
這個問題叫做非凸優化解
它的難度是臭名昭著的大
這個問題啊
也一度困擾著聯結主義的研究者們
也是神經網路這一派研究
一直沒有真正發展起來
非常重要的原因
因為一旦你的模型做大做複雜
你雖然覺得它很強大
但是你找不到好的參數
讓它實現這種強大
直到後來
1976年
由Seppo Linnainmaa提出了一個巧妙的演算法
梯度下降
並在1986年由David Rumelhart
Geoffrey Hinton和Ronald Williams共
同 提出了反向傳播演算法
才算真正解決了這個問題
讓我們先從最簡單的地方開始
假設這裡除了K1之外的五個旋鈕
都已經被固定好了
我告訴你
已經有人把它設置在了最好的位置上
現在
你只需要去考慮把K1這個旋鈕調好
那麼到底該怎麼辦呢
哎我們可以調節它
觀察這個損失函數的變化
此時你會發現
損失函數就從原來的6個輸入變量
變成只有一個變數K1
哎這是一個一對一變化的函數
我們很容易做圖
做出來的圖大概長這樣
我們的目標就是找到它的最低點
不過不要被這裡的圖誤導了
我們是解釋方便
所以直接把這個圖像畫出來
但實際上我們並不知道這個整個圖像
我們知道的只是某一個具體的K1
下這個擬合函數長什麼樣
然後算出來
這個K1對應的損失函數有多大
所以說 我們只能得到一系列離散的點
對於每一個輸入點
知道函數值是多少
而在這些點中間的位置
損失函數到底是怎麼變化的
我們是全然不知的
你會發現
優化神經網路
甚至比求損失函數的最小值更複雜
因為
你沒有辦法看到整個損失函數的全貌
這就好比
把你放到了一片地形高低起伏
極其複雜的山地上
每個參數的數值就好比是經緯度
而海拔高度是損失函數的大小
周圍大霧瀰漫
你只能看到自己腳下的地形
你該如何下山
走到一個海拔比較低的地方呢
還是用這個K1的例子
剛才呢
我們有一句話說的其實不是很對
那就是我們知道的資訊
其實還是比純粹的損失函數大小
要多一點
具體來說
我們還可以知道在某一個位置下
損失函數到底隨著K1的增大
是增大還是減小
用數學一點的說法就是
我們可以獲得
損失函數在這一點切線的斜率
更專業的說法是導數
這個方法呀
大家調洗澡水和收音機的時候
其實都用過
那就是
你可以把旋鈕先往某一個方向
轉一點點
Delta x看看是更好還是更差
比如說這裡
我們初始在X0的位置
損失函數是Y0
然後增加了Delta x
到了X1的位置之後
我們再看看損失函數變成了Y1(口誤)
所以我們就會發現
損失函數增加了一個Delta y
也就是說它變差了
那這個時候你就知道
洗澡水應該往反方向調
所以當我們的調節變化量
Delta x無限小的時候
Delta y和Delta x變化量的比值
會接近於一個定值
那就是
損失函數在這一個點切線的斜率
而這就是函數在這一點的導數
在變化很小的時候
函數值y的變化量正比於x的變化量
而這個比值就是導數
所以我們就用一句話來概括一下
梯度下降的精神
那就是每次減小一點點
我們每次看看要減少損失函數
我們現在的這個位置應該往哪邊走
然後呢
就往這個方向走一個很小的距離
接著呢再看導數再走
不斷重複上述流程
這樣我們
就可以不斷地縮小損失函數
直到最後停在底部
參數基本上不再變化
此時我們就成功地將損失函數
減少到一個很低的程度
現在
我們已經清楚了怎麼調節一個旋鈕
但這有一個非常不現實的前提
那就是其他5個旋鈕
已經調到了最優的狀態
並被固定住
現實中你要同時調節好多旋鈕
而且所有的旋鈕都沒調好
這個方法有什麼用呢
哎有用
事實上剛才我們的這個方法
可以非常容易的拓展到更一般
更複雜的情況
比如說假設
你現在要同時調節K1和K2兩個旋鈕
此時
損失函數變成一個輸入是兩個實數
輸出是一個實數的二元函數
它可以表示成一個二維的曲面
哎
這就是很多人經常聽到的損失曲面
這裡
K1 K2的損失曲面看起來就像一個碗
且慢二元函數的導數是個啥呢
現在有兩個旋鈕
所以調節的方向出現了奇異
到底是只調K1
還是只調K2
還是都調呢
這裡就涉及到偏導數的概念
我們可以固定K2
只而只變化K1
此時
我們就得到了損失函數對K1的偏導數
反過來固定K1
只變化K2
此時就得到了對K2的偏導數
它對應於
我們固定K2或者K1當中的一個
然後單獨的調節另一個旋鈕時
對損失函數輸出的影響
幾何意義上
這意味著
我們用兩個垂直於坐標軸的截面
和曲面相交
截面會切出一根曲線來
然後我們再求這根曲線的導數
將這兩個導數拼
在一起
我們就得到了那個你經常聽說
但可能不知道是什麼的東西梯度
梯度說白了
就是在某個給定位置
函數值變化最快的方向
也是曲面在局部最陡峭的方向
是一個二維版本的求導
有了它我們就可以重複剛才的流程
每次向著局部
損失函數下降最快的方向前進
我們完全就可以用剛才類似的方法
愉快的同時調節兩個旋鈕了
這個方法就是大名鼎鼎的梯度下降
你想既然兩個可以
那麼這套方法
就可以應用到任意多個旋鈕
這個問題裡
完整的損失函數
是一個複雜的六維曲面
那我們還是可以如法炮製
對每一個旋鈕
我們都固定其他的旋鈕
然後單獨看這個旋鈕和損失函數之間
它的變化關係是什麼樣的
增加它損失函數是增加還是減少
這樣我們就能得到每個旋鈕的偏導數
拼在一起
得到了一個6維的梯度
接下來我們只需要讓每個旋鈕
都向著對應的方向
不斷迭代去減小損失函數
從而擬合出這些資料底層的規律了
現在我們知道
梯度下降法可以優化網路
找到損失函數比較低的參數
可是面對一個層層堆疊的
非常複雜的神經網路
我們怎麼計算出這個梯度呢
這個問題啊
非常專業
答案是反向傳播back propagation
這是一個專門用於計算
複雜的神經網路梯度的演算法
也是很多人學習深度學習
被勸退的第一步
這裡
我們不詳細展開反向傳播具體的細節
只告訴你它最精髓
的思想
不管是神經網路
還是剛才我們的多項式擬合
本質上
我們都是用一些非常簡單的基礎運算
比如說加減乘除啊
平方啊指數啊之類的
不斷的組合複合迭代
形成了一個超大的複雜的函數
它們 就像我們用一個個基礎的積木一樣
拼接成一個龐大的機器
我們關心的
無非是每個旋鈕參數的梯度
用最直白的話說
我們關心每個旋鈕動一點點
最後面的損失函數隨之變化的關係
而這個訊息是可以由後到前
層層傳遞的
為什麼呢
因為每個基本的這個積木的求導
我們都很清楚
而積木在組合過程當中
梯度是怎麼樣組合變化傳遞的
我們也很清楚
你看中學我們就學過了
求導的基礎法則
加在一起求導
等於各自的導數相加
乘在一起求導呢
則是這個結果
除了上面說的相加和相乘
還有一個最重要的性質
那就是鍊式法則
如果我們先把一個x
送入了一個函數g
再把g(x)這個輸出當成輸入
送入函數f
那麼這整個過程合在一塊
依然是輸入一個x
輸出一個數值
它也是一個函數
是f (g(x))比如說在這裡
如果一個是正弦
一個是log
那麼它的圖像大概長成這個樣子
問題來了
我們知道f和g各自的形式
和各自的導數
應該怎麼求它
這個合體的函數對於x的導數呢
現在
假設我們把輸入x變化一個Delta
根據導數的定義
我們知道
第一個g(x)在輸入變化Delta的時候
它的輸出會變化的比例是g'(x)
所以你就知道
這個中間的這個輸出g( x)
此時會增加g'(x )乘以Delta
那麼進一步呢
對於後面的這個FX來說
注意到它的導數是f'(g(x))
所以說當它的輸入
變化了中間這麼大的數值的時候
它的輸出就會在中間這個變化量上
進一步乘以f'(g(x ))
也就是這麼大
當我們把右邊的這整個
除以x的變化量Delta的時候
就可以得到鍊式求導的法則
也就是說先做g(x)
再做f(x)一起求導
得到的結果是g'(x)乘以f'(g(x))
這就是複合函數的求導
如果用前面積木的比喻
你可以想像有三個齒輪互相咬合
它們轉過的角度啊
就分別代表x,g(x)和f(g(x))
而導數g'(x)呢
表示第二個齒輪g(x)
相較於第一個齒輪x
傳動的速度之比
那f'(g(x))呢
就是第三個齒輪
相當於第二個齒輪g(x)傳動的速度之比
如果我們想要知道變動一點點
第一個齒輪x
第三個齒輪到底變化的速度會有多快
我們只需要把這兩個齒輪的傳動比
乘在一起就可以了
這就是鍊式法則
有了鍊式法則
我們就可以從後往前一步步拆解
得到每一個參數的導數
這是因為任何一個參數
從它到損失函數
一定是經過了一系列函數的複合
到最後一層輸出就是模型預測本身了
我們可以直接
計算損失函數以及它的導數
接著我們就可以用剛才的鍊式法則
一層一層從後往前的
把每一層嵌套這個傳導的導函數
一步一步的乘在一起
當我們回到最開始K1的位置的時候
就得到了K1相較於整個輸出
損失函數的梯度
而這個演算法
就叫做反向傳播back propagation
所以我們最後總結一下
找到這個幾百萬個旋鈕
機器最好參數設定的方法
就是用反向傳播演算法
計算出每個參數的導數
接著呢用梯度下降法
每次讓這些參數變化一點點
不斷地朝著更好的參數演化和移動
最後整個神經網路就會神奇的理解
掌握資料中的規律
學會底層函數
並獲得這種我們想要的智能
在前面的內容中
我們詳細講解了智能就是搭建黑箱
以及神經網絡
這個強大
通用的黑箱的構造和由來是什麼
還有如何訓練一個神經網路
不過這裡還有一個很重要的問題
這個神經網路的黑盒子
是怎麼舉一反三的呢
你看呢我們只是收集了一些數據
然後訓練它
在我們收集的數據中
對於見過的輸入
比如說這張數字圖片
它要輸出成我們想要的輸出6
那他見過這些東西
能夠把它正確識別成6並不奇怪
但是對於從未見過的其他圖片
訓練好的網絡
是怎麼能夠同時認出其他的數字的呢
這就好比你給一個人做了很多題
他能夠把你給他的練習冊的題做對
不奇怪
但是他是怎麼樣學會這些解題的方法
在新的題上考試也能考好的呢
這個問題其實很深刻
它牽涉到
機器學習能夠成立的
一個非常重要的問題
泛化general ization
這個名詞看起來很高端
但正如我們剛才所說的
它的本意就是推廣
舉一反三
活學活用
我們還是從前面的最小2乘說起
以及曲線擬合思考這樣一個問題
對於中間這個位置輸入的x
我們沒有任何y的數據
但你還是會覺得
它應該就在這個範圍裡
為什麼呢
沒錯因為這些零散的數據點
勾勒出了一種趨勢
當我們用這樣的一個連續平滑的函數
準確地刻畫出這種趨勢之後
就可以利用這個函數
推測
數據中我們沒有見過的某一個輸入下
對應的合理的輸出大概應該是多少
這其實就是一種最簡單的泛化
我們將這種關聯的趨勢理解
並且推廣到
我們沒有見過的一些輸入數值
通過理解底層規律
在未知情境下給出合理的預測和輸出
那同樣的
神經網絡也有泛化能力
而且是很強的泛化能力
雖然在訓練資料中
他沒有看過一模一樣的圖片
但是呢他可以在訓練過程中
發現
這些輸入的圖片和標籤之間的趨勢
和這種微妙的關聯性
這種關聯啊
就跟我們前面的曲線擬合的時候
中間斷開的那一部分
看起來應該要這樣連線
所以你可以預測那其中的函數值一樣
只不過在我們現實的數據裡
這個趨勢可能非常抽像
不如剛才的曲線擬合這麼直觀
而這正是神
經 網路強大的地方
你只需要提供數據
那麼底層抽象的趨勢和規律
只需要交給神經網路
他自己學就可以學明白了
很多行業和學科
其實都面臨著這類問題
就是不同的情境裡有一種感覺和規律
這種感覺和規律
難以用簡單清晰的數學來計算和描述
比如說圍棋裡
這一棋形看起來好不好
能不能活
有經驗的棋手一眼能看出來
行話叫做味道不好
但是怎麼樣學會這種感覺和味道
卻非常複雜
還有在說話這個問題上
一句話前面的語境下
後面該接上一個什麼樣的話
也是一種複雜和微妙的語感
但是怎麼學呢
很難說更不用說從氨基酸序列里
分析出整個蛋白質結構
這種極為抽象複雜的規律
曾經我們需要非常專業的知識
來模仿人類的聰明智慧
而且模仿的還不好
而有了深度學習
你可以不管三七二十一
隻需要找一個架構合適的神經網絡
收集數據
訓練擬合
然後這個神經網路
就能領會資料當中
你所描述的輸入和輸出間微妙的聯繫
並舉一反三
應用到任何潛在的
他沒有見過的情境輸入中
很多時候做的比人都好
這種公式一樣的解決方案非常通用
因而席捲了各個領域
引發了這些年的人工智能革命
但是神經網絡和深度學習是萬能的嗎
答案當然是否定的
每當有一個很厲害的方法
可以實現以往不可思議的任務時
人類就有把它當成魔法的傾向
儘管深度學習的確模
仿了 大腦的神經元結構
但是 它和真正的人類智能還有很大的區別
我們都見過這樣的梗圖
該怎麼區分柴犬和麵包
說它們看起來有很多相似之處
比如說都是黃色的呀
長條形的呀什麼
難以區分
這原本是一個玩梗
但對於一切機器學習演算法來說
這都是一個根本且致命的問題
因為你看這個模型
它一直就是透過各種圖像的特徵輸入
和你要它的這個標籤
來理解圖片的內容的
所以它在訓練當中所理解的事情就是
一個黃色的長條形的物體
是麵包因此
當你給它一個在訓練集以外的柴犬
圖片時它會因為這個柴犬
符合麵包的各種特徵
而產生錯誤的判斷
這本質上是概念之間的相關性
和因果關係之間微妙的區別
他沒有把握
而這個問題
在收集數據
訓練模型的這一套方法論中
永遠無法避免
這就是為什麼有很多用神經網路啊
算命
或預測犯罪機率的應用廣受批評
因為
模型會錯誤的把資料集裡的共同出現
當成必然聯繫
比如說
看到黑人就覺得一定會犯罪這個樣子
更糟糕的是
你可能永遠不知道
強大的神經網絡黑盒
究竟領會了什麼神秘的連結
因為神經網路太過強大和複雜
所以我們幾乎無法理解
它的內部是如何運作
給出我們想要的合理預測的
一個典型的例子是對抗樣本
這是兩張圖片
你能看出它們有什麼區別嗎
但如果讓一個準確率非常高的
最先進的神經網絡
來看第一張圖片
他覺得是熊貓
但第二張圖片
他以99%的信心認為是一隻烏龜
仔細看你會發現
第二張圖片相較於第一張
添加了一些十分微小的噪聲
而這些噪聲可不是亂來的
它經過了特別的設計
專門用來欺騙神經網路
這種圖片就叫做對抗樣本
對它的理解與研究
直到現在還在進行
而我們依然沒有徹底理解它
大家一般認為
它觸發了
神經網絡底層某些神奇的開關
這些在人眼看來雜亂無章的噪聲
在神經網絡看來
卻有著強烈的烏龜的特點和相關性
看到這裡
你還覺得神經網路無所不能嗎
有關AI很多人關心的切身問題是
他會讓我失業嗎
總的來說
深度學習和神經網絡
提供了一套全新的智能思路
你只要收集數據
再用梯度下降的方法
訓練一個好的神經網絡
就能讓這個超級黑箱
理解數據中的規律
從而舉一反三
對任何未知的情景輸入
給出智能的預測
這的確是一場革命
它讓AI解決了很多
曾經只有人類才能完成的
非常微妙複雜數據龐大的任務
因此
如果一個工作他數據充足模式固定
其中機械性按部就班的性質比較強
那麼你就很容易收集大量的數據
用於訓練
AI就可以在基礎的日常使用中
相當程度上替代人工
從這個角度上來說
文秘插畫攝影翻譯財務
甚至是底層程序員
這些職業都會在未來面臨極大的衝擊
然而如前面所提到的那樣
如今的人工智慧絕非萬能
相反很多時候它還是人工智障
即便是現在的大模型
依然在很多複雜的問題上
表現的不夠理想
AI在面對超出訓練數據範圍的
全新問題時
往往還是難以做出合理的判斷
實際上我認為
AI的發展更有可能改變工作的性質
而不是完全取代它
比如說文書工作
可能會因為AI的介入變得更加高效
人類將在監督和決策的層面上
進行管理
而並非親自處理那些瑣碎的事務
同樣設計和創意類的工作
比如說插畫廣
告 等等領域
儘管
AI可以為你生成一些初步的作品
和基礎的素材
但真正打動人心的創意和靈感
目前還是需要人類的參與
同樣的
它可以幫助科研人員寫文章改病句
甚至是進行一些簡單的公式推導
和程式碼撰寫
但是
真正的科學研究的idea還是得自己去想
AI生成的內容
往往缺乏人類情感的深度
模糊和複雜性
這也是它在某些領域
難以超越人類的根本原因
更重要的是
目前的AI
還缺少在現實世界中交互的能力
自動駕駛機器人這些領域
AI的發展速度
遠不如大眾想像的那麼樂觀
所以總而言之
AI的確會對一些職業造成影響
尤其是那些重複性高模式固定的領域
但同時它也會帶來新的機會
未來的關鍵在於
如何積極地適應這種變化
提升自身的技能
以便更好地與AI協同工作
而不是被它所取代
人類的創造力情感和智慧
依然是AI無法模擬和完全超越的
你也可以投入AI的潮流中
就以這期影片為起點
開始學習
多看幾遍
打不過就加入嘛
也不失為一種好的策略
以上就是這期影片的全部內容
製作真的很不容易
還希望大家點讚收藏
多多支持
如果
你以後想看到更多類似的深度科普
記得關注我
漫士沉思路
學海引路不辛苦
我們下期再會
Can't find what you're looking for?
Get subtitles in any language from opensubtitles.com, and translate them here.