第100章 這是數學!(5k)


  第100章 這是數學!(5k)

  所有的歡呼聲、尖叫聲以及擁抱都停了下來。

  𝐒𝐓𝐎𝟓𝟓.𝐂𝐎𝐌提醒您閱讀最新章節

  整個XRCE團隊的目光緩緩移向了那塊屏幕。

  「第——第二名?」

  佩羅寧難以置信地看著屏幕上刺眼的數字2。

  如果他們研究透了經典特徵工程,耗費了一年的心血才把錯誤率壓到26%的費舍爾向量改良版方案,在今天,僅僅只能屈居第二的話,那麼,第一名的錯誤率會是多少?!

  那個踩在他們頭J頂,拿下了本屆ImageNet?第一名的方案又是什麼?!

  「26%竟然只能拿第二?這合理嗎?!那第一名的錯誤率得低到什麼程度?!」

  來自洛桑聯邦理工學院的副教授坐直了身子,盯著屏幕,搖頭說:「施樂居然是第二名,太難以置信了。」

  「今年預測所有參賽團隊最好的成績,也就只能把錯誤率壓到24%到25%之間,難道漆昊團隊真的做到了這一點?」

  「24%?那已經是經典詞袋模型的理論紅線了!」

  一旁的阿姆斯特丹大學領隊否認說:「要知道,ImageNet擁有上千個高相似度的分類。」

  「比如幾十種不同品種的狗、不同鳥、不同蝴蝶、不同車型,人肉眼都容易認錯,更別說機器了。」

  「想突破25%的關口,除非他們不僅在傳統的S1FT算子裡加入了色彩直方圖和LBP局部二值模式等多重手工特徵進行超大規模的融合,還必須通過多核學習算法去動態調整特徵權重,甚至在多核計算上徹底解決了非線性核函數在海量樣本下的存儲與優化瓶頸。」

  「這需要的資源可不少,他一個搞數學的能做到這些?」

  李教授及其團隊的人都在他們旁邊坐著,沒搭話。

  即使他們早就知道了答案,但臨到現在公布的時候,這一群人的心跳還是莫名其妙加快了。

  在全場上千道要把屏幕戳穿的灼熱視線中,屏幕上刷新出了代表著本屆ImageNet:最高成績的第一名數據。

  【第1名:華國蓉城科大Q1net錯誤率:15%】

  刺眼的15%讓所有人都忘記了說話的本能。

  在經歷了大腦短暫宕機之後,整個會場炸了!

  「15%?!上帝啊,這確定不是屏幕的顯示像素壞了,導致25%的那個2字上半截沒能顯示出來嗎?!或者是打字員昨晚喝多了紅酒,把25%給手抖敲成了15%?!」一位來自慕尼黑工業大學的資深視覺組教授扯開了襯衫領口,整個人因為激動變紅了。

  「25%我是相信的,15%是什麼情況?」

  「11%的絕對差距,這不科學!」

  「阿西吧,一定是作弊!他們是不是在黑盒測試集上進行了作弊?對,只有提前拿到斯坦福的測試集去進行有針對性的過擬合,才有可能跑出這種嚇人的數據!」剛剛還合十祈禱的首爾國立大學領隊,根本不相信屏幕上顯示的錯誤率。

  「閉嘴吧,寒國人,ImageNet的評測伺服器是斯坦福獨立脫機運行的,測試集在開賽前才由李教授的團隊親自導入,你告訴我他們怎麼作弊?用特異功能嗎?」一旁的阿姆斯特丹大學領隊驚訝之餘,也不忘懟他。

  「漆、漆昊——」

  陳工咽了口唾沫,他感覺自己心臟幾乎要跳出嗓子眼了!

  「我沒看錯吧?我們在學校實驗室里跑十折交叉驗證時,由於那幾塊GTX580顯卡可憐的顯存限制和保守估計的數據集偏差,測出來的成績不錯,但那是驗證集,和測試集數據不同,怎麼一到斯坦福的官方測試集上,這錯誤率直接到了15%?!」

  漆昊此時也有些錯愕。

  深度卷積神經網絡在CUDA的並行算力下,對局部圖像特徵的捕捉會表現出非同尋常的優越性,但他沒想到,實際錯誤率比他預估中還低。

  此時李教授拿著話筒上台了。

  東京大學團隊的人立刻大聲問道:「李教授,請問漆昊團隊是否將訓練集和測試集搞錯了?」

  面對東京大學代表隊不服氣的質疑,原本有些嘈雜的主報告廳再次安靜了下去,大家都在期待李教授這位ImageNet:挑戰賽發起人會怎麼說。

  台上李教授,拿起話筒直接解釋了起來:「我非常理解東京大學團隊,以及在座諸位此時此刻所感受到的震撼和難以置信,但從I mageNet挑戰賽的工程邏輯和規則設計來看,你們所質疑的混淆數據集的情況,在物理層面上是絕對不可能發生的。」

  「眾所周知,為了確保比賽的絕對公平,ImageNet將整個數據集嚴格劃分為三個完全獨立的部分。」

  「第一部分是包含120萬張圖片和完整標註的訓練集,用於給各大團隊進行模型訓練,第二部分是包含5萬張圖片的驗證集,用於大家在本地調參數,而真正決定結果,用於計算最終成績的,是包含10萬張圖片的測試集。」

  「簡單說一下區別,拿訓練集和驗證集來說,它們就像是學校發給你們用來複習和模擬考的課後習題和參考答案,不管題面如何,大家手裡都有一清二楚的正確答案。」

  李教授考慮到現場有很多非專業的觀眾,儘量找了一個簡單的例子:「那10萬張測試集的圖片,就像是期末考試中的期末考卷。」

  「所以大家應該知道了,這10萬張期末考卷只有題目,根本沒有參考答案,標準答案自始至終都被鎖在史丹福大學的離岸評測伺服器里,在這個世界上,除了我們核心評估小組的研究員,沒有任何一個參賽團隊能夠接觸到其中一個字節。」

  「QIet團隊和在座的諸位一樣,手裡只有那10萬張沒有任何標註的圖,他們必須讓自己的模型去預測這些圖片裡裝的到底是什麼,然後將生成的純文本預測報告上傳至我們的伺服器,由我們的系統在後台進行全自動的雙盲比對。」

  「因此,除非漆昊團隊黑進了斯坦福的網絡,盜取了這10萬張測試集的標準答案去教他們的神經網絡做題,否則,根本沒有可能把訓練集和測試集搞混,更不可能在閉環中進行作弊。」

  李教授話音一落,主報告廳里那點不服氣的嗡嗡聲,頓時小了許多。

  東京大學領隊本想再爭辯兩句,可如果他再質疑數據集污染,無疑是在暗示李教授團隊有問題,李教授作為這個領域的佼佼者,他肯定不想得罪。

  「我知道,僅僅是規則的嚴密,依然無法平息大家對QInet團隊成績的疑惑。」

  「ImageNet挑戰賽本意是想成為促進學術交流的平台,所以下面我們進入現場答辯環節。」

  「下面有請QInet團隊負責人漆昊,上台!」

  現場觀眾大多數都是為了漆昊來的,現在漆昊上了台,他們非常給面子的給了他最大的掌聲。

  隨後佩羅寧迫不及待開口了:「李教授,請問我可以提問嗎?」

  李教授說:「現場答辯期間你們可以問問題。」

  佩羅寧接過工作人員遞過來的話筒,說:「李教授,我們當然相信測試集的公平性,但成績歸成績,科學是要講方法論的。」

  「我想請問QInet團隊,你們如何將錯誤率降低到15%的?如果連方法都說不清楚,恕我直言,這個結果很難讓人信服。」

  漆昊拿起話筒就說了起來:「各位好,我是漆昊。」

  「我理解各位目前的質疑,事實上,如果易地而處,看到有人把imageneti測試集的錯誤率一口氣降到15%,與其他團隊的結果相差11%以上,我大概也會懷疑是不是斯坦福的評測伺服器被黑客入侵了。」

  台下響起了一陣善意的笑聲,原本質疑的氣氛緩和了一些。

  「但很遺憾,我們的黑客技術並不足以攻破斯坦福的防火牆,況且,我們實驗室伺服器的電費已經嚴重超支了,實在沒有餘力再去發起一次分布式拒絕服務攻擊。」

  「大家肯定會想,既然不是作弊,那麼QIet究竟是怎麼做到目前的結果。」

  「其實答案很簡單,我們拋棄了過去十年裡,整個計算機視覺界認可的人工特徵提取路線。」

  下面的學者研究院們聽到這一句話立刻譁然了起來。

  現在,整個學術界對圖像識別的主流認知,全都是基於SIFT、HOG等人工設計的算子,再配合支持向量機或者費舍爾向量進行分類,大家比拼的是誰設計的特徵提取器更細緻。

  而現在,這個年輕的東方人竟然在ImageNet的舞台上,公然宣稱他們把這些行業基礎全扔了?

  「荒謬!」

  史丹福大學的一位資深教授忍不住說道:「不用人工特徵,你們拿什麼去理解物體的邊緣,紋理和幾何結構?難道指望機器自己去長出眼睛來嗎?」

  「沒錯,我們就是讓機器自己長出眼睛。」

  「我們復活了那個在學術界幾乎快要被掃進歷史垃圾堆的技術,人工神經網絡,確切地說,是卷積神經網絡CNWN。」

  「CNN?」佩羅寧皺著眉說。

  「楊力昆在90年代搞的那個LeNet?」

  「那玩意兒不是只能識別手寫郵政編碼嗎?面對ImageNet:這種上百萬張,上千個分類的複雜現實圖片,神經網絡那可憐的擬合能力和讓人絕望的計算效率,根本就走不通嘛!」

  「是的,就是楊力昆先生所提出的LeNet,大家都知道深度神經網絡有三大難題,梯度消失導致的無法收斂,參數過多導致的嚴重過擬合,以及驚人的計算量。」

  「我設計的QInet一共包含5個卷積層,3個全連接層。」

  「首先,是關於梯度消失和收斂速度的問題,傳統神經網絡喜歡用Sigmoid或者Tanh

  作為激活函數,但這兩種函數在輸入值較大時,梯度會趨近於零,導致深層網絡在反向傳播時根本無法更新參數。」

  「在座的各位想必都被那種訓練了三天三夜,損失函數紋絲不動的痛苦折磨過。」

  台下的研究員們不由自主地點頭。

  這苦他們確實都吃過。

  「我們的解決方案其實非常簡單,直接棄用了複雜的雙曲正切和邏輯函數,採用f()=ma(0,)。」

  「我們稱之為ReIu,也就是修正線性單元。」

  「在相同的網絡結構下,使用ReIu的QInet,其收斂速度比使用Tanh的網絡快了6倍!

  35

  然而,外行看熱鬧,內行看門道,台下的學者研究員們,都聽懂了他的意思。

  f()=a(0,),這個在數學上幾乎可以說是初中水平的單側仰制函數,竟然能帶來6

  倍的收斂速度提升?這意味著什麼?

  這意味著在大規模工程實踐中,計算效率將獲得質的飛躍!

  「那過擬合呢?」一位M1T的教授追問,「120萬張圖,8層網絡,6000萬個參數,參數比的樣本還多——我是說,這麼大的模型,你怎麼保證它不是把訓練集背下來了?」

  這個問題問到了點子上,全場再次安靜。

  「確實會有這種的擔憂,所以為了防止它在測試集上出現這種情況,我們引入了一種全新的正則化技術。」

  「也就是Dropout隨機失活。」

  「它的原理是,在每一次前向傳播中,以50%的概率隨機將部分神經元的輸出置為零,這些被選中的神經元在這一輪訓練中,既不參與前向傳播,也不參與反向傳播。」

  「這相當於每次訓練,都在訓練一個不同的網絡,最後做預測時,等於把無數個網絡的意見集合起來,一個神經元摸了魚,其他神經元就不敢太依賴它,逼著整個網絡學到更健壯的特徵。」

  「最後一個問題。」

  MIT的領隊現在已經從質疑變成了純粹的好奇:「如此龐大的訓練,常規的CPU集群跑下來,沒有幾個月根本不可能,你們是用了什麼超算?哪個國家實驗室贊助的?」

  所有人都以為,漆昊背後一定站著某個龐大的機構。

  漆昊直接回答:「其實沒有用超算。」

  「當時我只是想測試我的想法是否可行,所以就用了兩塊GTX580。」

  「兩塊GTX580?」MIT教授不敢相信自己聽到的信息,「打遊戲的那種?」

  台下頓時響起了一片倒吸涼氣的聲音。

  用顯卡?

  用打遊戲娛樂的顯卡,去跑世界上規模最大的圖像識別挑戰賽?

  「我花了一點時間,用CUDA重寫了卷積和池化的計算核,並且設計了一套雙卡並行架構。」

  「因為3GB顯存依然裝不下整張網絡,我們將QInet的神經元分別寄存在兩張顯卡上,它們只在特定的層,比如第三層卷積和全連接層進行數據通信,而在其他層,兩張顯卡各自獨立計算,互不干擾。」

  佩羅寧原本以為對方是靠著什麼漏洞或者運氣,但現在,漆昊一步步講解,一切又覺得十分合理。

  佩羅寧主導設計的費舍爾向量算法,在圖像分類領域幾乎打遍天下無敵手,是全行業公認的最優解。

  為了更好訓練整個模型,他們甚至為此向總部申請了數十萬歐元的預算,租用了歐洲最頂級的超算集群,夜以繼日地進行著複雜的矩陣計算。

  結果現在漆昊的方案,告訴他,他們連研究方向都選錯了!

  真是難以置信!

  作為老牌CV學者的尊嚴讓他不得不最後掙扎一下。

  「漆昊先生!不可否認,你們的架構設計非常驚艷,但是,神經網絡本身致命的缺陷之一就是平移不變性極差,ImageNet中的目標物可能出現在圖片的任何角落,尺寸也千差萬別。」

  「QInet:是如何在如此龐大的參數量下,保證不會因為目標物的位移,旋轉或者光照變化,而出現分類崩塌的?」

  漆昊解釋了:「這其實我們在=訓練中改進的。」

  「QInet在數據預處理階段進行了數據增強。」

  「面對位移和尺寸變化,我們沒有去試圖修改網絡本身,而是對數據源動手。」

  「在訓練階段,我們把原本256256像素的圖片,隨機裁剪出224224的圖塊,並且進行水平翻轉。」

  「不僅如此,在測試階段,我們對於一張待測圖片,會同時裁剪出其四個角,中心區域以及它們的水平翻轉共10張圖塊,讓QIet分別進行預測,最後將這10個預測結果進行平均,作為最終的輸出。」

  「不是,這還是計算機學嗎?」

  「這是數學。」

  「舉個例子,現在我將裁剪圖片出四個角和中心,加上水平翻轉,得到10個不同視角的圖塊1,2,.·,10。」

  「在這10個圖塊里,貓的相對位置全都不一樣,左上角那張,貓跑到了右下,右下角那張,貓又跑到了左上。」

  漆昊讓人把白板抬上來,然後在上面寫了起來。

  「最終預測=(1/10)·ΣP(yl)」

  「我把這10個視角的預測,求平均。」

  「n個近似獨立的預測求平均,方差變為原來的1/n。」

  「因為物體位置擾動帶來的預測方差,被壓低到了原來的十分之一,當然這個值可以更加精確——」

  漆昊在上面滔滔不絕講著,底下的數學人很高興。

  因為剛才講計算機的東西,他們聽不懂。

  現在漆昊上起數學課,他們反而聽懂了。

  「搞了半天,隔壁計算機系天天神神秘秘,吹得天花亂墜的深度學習,本質上就是把我們測度論里的哈爾測度拿去給圖片做離散採樣啊!」

  「就是,這玩意也不難啊!」另一個數學系博士生也興奮了起來,壓抑了半個多小時的優越感在這一刻蹦出來了。

  「你看,我都跟你說了吧,萬物皆可數學。」

  「這是不是蒙特卡洛?你們要說這個,我可就不困了!」

  他們在那高興著,根本不懂一旁的計算機人有多鬱悶。

  >


章節目錄