Taiwan AI Lab 杜奕瑾談DeepSeek 影響及相關問題
AI革命本來就在,產業大爆發,算力需求只會增加 (今天回應的一些記者詢問整理如下) 1. DeepSeek僅是宣傳實力的展現 DeepSeek(DS)在推出後立即引起廣泛關注,並被認為是導致美股大跌的原因之一。 然而,實際上,美股的波動更多是由市場資訊操作引發的,而非純粹DeepSeek本身的技術創新。DeepSeek並非在美股大跌當天才出現,而是其宣稱的多項創新也是開源社群長期技術發展的結果。 相比之下,同時期中國推出的千問(Qwen)並未造成市場波動,DeepSeek的影響力更多來自市場訊息操作的渲染,而非單純的技術突破。 2. DS成果是全球的科技菁英成果? 有觀點認為,美國選擇閉源,而中國公司選擇開源,導致美國在AI競爭中失利。但從技術社群的角度來看,DS宣稱的開源技術發展MoE、CoT、混和精度訓練、模型蒸餾是全球已有的成果。本來就難以簡化成國家競爭。 雖然在最先進技術領域,OpenAI確實選擇不開源其最新的模型,違背了其創立時的開放承諾,這也在開源社群中引發批評。但DS發表的AI技術底層多處仍主要基於Google、Microsoft、Meta、OpenAI、Nvidia等與全球企業過去開源的基礎,包含RL也是OpenAI貢獻非常多研究成果。 3. DeepSeek是否為真開源? DeepSeek雖然宣稱開源,但是否真正符合開源精神仍有待商榷。開源並不只是將模型權重放到GitHub供下載運行,而是應包括完整的程式碼、訓練數據和完整的技術細節。然而,DeepSeek並未完全公開其訓練數據集和部分核心代碼,使其在開源社群中存有爭議。 DS論文提到其訓練數據來自Common Crawl,但Common Crawl的規模並未達到DeepSeek聲稱的14T tokens,而僅為數十B tokens,這顯示其數據來源可能另有隱藏部分。若DS在數據來源上未完全透明,則其開源性質仍有待進一步驗證。 4. DeepSeek是否真實減少了對高階晶片的需求? DeepSeek的母公司幻方科技本身擁有強大算力和大量高階晶片,因此DeepSeek的誕生並不意味著不再需要高階晶片。訓練一個規模達671B參數的Foundation Model仍需要大量算力和龐大資源支持。 DeepSeek的技術優勢並未來自基礎模型降低算力需求,而是開放模型推理優化計算方式,使得其在特定應用場景下能夠...





