第110章 OpenAI最近有點兒跳,得限制一下!


  第110章 OpenAI最近有點兒跳,得限制一下!

  郝成請了一頓飯,何鋼吃了滿肚子的心事。

  飯局剛剛一結束,他就立刻回到酒店,聯繫上了於東。

  「老何,我咋發現你每次一去臨州,都會變得這麼慌慌張張的呢?」於東甚至調侃上了。

  「你先別忙,聽我說。」

  何鋼仔細的將郝成在車上的話簡單跟於東複述了一遍,而後總結道:「可不要看這東西是郝成在扯閒篇,是在泛泛而談大路的概念,是沒有透露任何AI訓練方法的。

  「但實際上,他這個泛泛而談,跟我們一大群人去聊天,他不一樣!」

  看本書最新章節,請訪問STO ⓹ ⓹.COM

  「我知道,他已經訓練出小沙了,他的大路概念那是正確的概念。」於東長長的呼了口氣:「從這泛泛而談中或許能找到方向。

  「但光聽這些也沒有用啊!」思索了很久,於東也是無奈道:「你說的所有的東西,我只能總結出三個字『類似人』,而這種方向,團隊早就考慮過了。

  「但現在的問題不是方向,是方法,我們沒有找到任何的方法。唯一的好消息是,我們以傳統方式訓練AI的成本也大大的降低了,效率卻大大的提高了。」

  於東說的這個倒是實情,不僅僅是華為、抖音、騰訊甚至OpenAI,訓練AI的成本都降低了。

  究其原因,也很簡單,他們讓小沙幫他們做數據清洗、標定和反饋。

  數據清洗原本是一個非常複雜且繁瑣的工作,也是訓練AI非常關鍵的步驟,數據清洗的質量越高,AI訓練的質量也就越高。

  以往,這個工作都是由人工來實現的,也有用AI來做的,但是效果就會很差,往往會投餵一些垃圾數據,造成模型被污染,進而產生一些低級錯誤。

  而現在有了小沙,這項工作可以更快速的進行,準確率甚至不比人工清洗差。

  而更關鍵的一個問題,以往GPT類的模型,是RLHF,也就是基於人類反饋的強化學習。

  怎麼做的呢:就是先預訓練一個語言模型,然後做微調。

  微調怎麼調呢:就是你問一個問題,語言模型給你回答,然後人工給這些回答進行排名,然後獲得一個有質量排序的數據集,用這個數據集反過來再去微調相關的模型參數,一遍又一遍循環往復,然後答案就會越來越接近人想要的。

  而現在,小沙代替了人工的這個步驟。

  RLHF模型先前被認為不可能無限提高,其中最重要的一個原因就是,隨著參數越來越多,數據量越來越大,人工去獲取一個有質量排序的數據集也變得越來越不可能。

  於是有人就認為,自我反饋模型,也就是讓模型自我去評價去提升的模型才是未來,縱然它有時候顯得很弱智。

  但是現在,有了小沙,小沙替代【基於人類反饋的強化學習】裡邊的人類,變成了【基於小沙反饋的強化學習】,這一切就又變得可能了!

  不僅解決了自我反饋容易弱智的問題,同時解決了人工反饋效率過低、成本過高的問題。

  這就相當於將兩個模型的優點直接結合了。

  而且,超大規模超超大規模,也不用擔心人工的問題了。

  所以,各家的模型現在進步都非常大,原因就在於此。

  想要變得跟小沙一樣厲害,那當然不可能——基於小沙訓練的AI想超過小沙那本身就是一個悖論。

  但是,只要捨得堆積算力,無限的堆積算力,再加上用小沙代替人類進行反饋的強化學習,理論上最終能極限逼近小沙的水準。

  當然,理論只是理論,現實中不存在無限算力,考慮實際情況,用這種方式結合超大算力訓練一年,達到小沙的六七成水準應該是可能的。

  華為這邊默默的評估過,現在幾乎所有的AI訓練企業都在偷偷的這麼幹。

  「需要跟郝成說一下這個情況嗎?」何鋼問了一嘴。

  「這他應該知道吧?」於東一愣:「以前,很多模型都用ChatGPT反饋做初期訓練,訓練到一個階段了才轉人工反饋的,都是慣例了。」

  「我估摸著他還真不知道,他現在應該沒關注其他的AI同行。」

  聽何鋼這麼說,於東直接嘴角一抽,是啊,一群弱雞同行,有什麼好關注的呢:

  「那還是說一下吧,這事影響還是挺大的。尤其是OpenAI,他那算力堆的,而且最近有點兒跳,得限制一下。」

  「對了,蘋果指望就是這個呢吧?」何鋼腦子裡突然把兩件事兒聯繫到一起了。

  「嗯。」於東笑道:「蘋果之所以現在還沒有徹底急眼,就是得到了OpenAI的承諾,而OpenAI之所以這麼有把握,是因為他們又購買了上千億美元的顯卡。

  「對投資者號稱是研發了一種新的算法,可追趕小沙。實際上,說白了就是【基於小沙的深度學習】。」

  「【趨同於人】的【類似意識】。」於東一說【基於小沙的深度學習】,何鋼不自覺的就嘀咕了這麼一句。

  「什麼『趨同於人的類似意識』?」於東一怔,問道。

  何鋼把郝成關於這方面的說法一字不落的給於東敘述了一遍。

  「那這就有意思了!」華為這邊倒是沒問題,但是OpenAI那問題可是大了。

  經過萬億億次的循環之後,由小沙反饋訓練而成的ChatGPT的「思想」是什麼樣子,那可就是由小沙控制的了!

  都說科技無國界,但訓練的AI其實是有「偏向」的,別說郝成說的什麼【趨同於人】的【類似意識】這種技術概念,就傳統的AI,也夾雜著訓練者的各種意識形態。

  甚至,哪怕不體現在AI本身上,規則限制和人工干預,也必須達到這種效果。

  ……

  「原來是這麼回事兒!」

  郝成還真沒特別關注過用戶使用小沙都幹了些什麼,就算想關注也關注不過來。

  除非是一些違法違規的操作,由小沙的【AI可控方向】進行監控和限制。

  法無禁止即可為,利用小沙去做數據標定、去做結果反饋,然後訓練別的AI,這事兒郝成沒有特意交代過,小沙也就沒有做任何限制。

  再有就是,數據使用和溯源的要求,用戶的數據,怎麼獲取的,怎麼流動的,最終幹了什麼,用戶自己那是必然需要了如指掌的。

  數據溯源的公示算法就在那裡,人人皆可驗證,白駒科技也無法例外。

  這在一定程度上也是陽謀,因為小沙本身實在是太強大了,如果再完全是一個黑盒子,很多人就該擔心害怕了。

  而現在,白駒科技控制核心算法,而將信息溯源、推薦等外圍算法公示開源,人人都可以進行監督驗證,那使用起來就放心很多。

  不過,何鋼剛剛說的事兒——

  郝成想起了蘋果的諸悅來之前,李清波跟自己說的「布羅克曼告訴蘋果的CEO庫克,他說OpenAI將最遲在明年三月之前解決問題,達到小沙的水平。」

  「原本你以為是布羅克曼在忽悠庫克,敢情是這麼一回事兒!」

  郝成搖了搖頭,終於理解諸悅先前為什麼是那樣的態度了:

  「我還是大意了!」


章節目錄