DIGITIMES

記憶體與邏輯的板塊碰撞

林育中
2026-09-30
AI語音摘要
00:44

當高頻寬記憶體(High Bandwidth Memory;HBM)在GPU-HBM CoWoS成本的百分比已接近一半時,記憶體還可以被視為AI的被動、零組件嗎?

一切都要從記憶體牆(memory wall)說起,而這一狀況的塑造就是半部半導體史。

計算機的架構自馮紐曼(von Neumann)創始之後就沒有主要的變化,主要元件包含處理器及記憶體。

將處理器與記憶體分開處理是馮紐曼架構最令人驚異的創新,因為人腦的記憶、「運算」與訊息傳導都同時發生在神經元(neurons)與突觸(synapses)之上,量子計算機也不是馮紐曼架構:記憶量子狀態與執行量子計算都發生在量子位元之上。自然計算的本質不依照馮紐曼架構運作的!

半導體自1960年起發展迄今逾60年。在大部分時間中,記憶體產品大致約佔晶片市場的3成,邏輯處理器居次。

記憶體的積體線路型態高度重複,核心記憶體單元部分可想像為成長方形地磚鋪成的重複圖形,其面積佔晶片總面積超過一半。記憶體容量就是這重複圖形中的記憶體單元的數量。

由於記憶體長期的營業額較大,對於良率及密度的要求也特別高。在半導體產業發展的前四十幾年中,記憶體一直都是整個產業的技術驅動者(technology driver)。在半導體產業中稍有資歷的,也許還記得台灣的第一座8吋廠、第一條DUV量產線、第一座12吋廠,都是記憶體業者先行的。

到了2000年中期,由於DRAM是由電容儲存電荷來表達資訊狀態的機制,記憶體單元面積的微縮會導致電容裏的平行電板面積跟著微縮,進而會讓電荷保存不易,所以DRAM製程的推進變得非常困難。DRAM製程遂逐漸被用以製造處理器的邏輯製程超越,而且差距持續擴大。

延伸報導DRAM 製程發展方向:DRAM結構在製程微縮中的挑戰

差距到底有多大呢?DRAM從20奈米以後的製程是1x、1y、1z、1a、1b、1c、1d,迄今共計7個世代,但都通通停留在10奈米世代範疇的龜步前進。換成是邏輯製程,從22奈米、14奈米、10奈米一步到位,甚至直接掠過到7奈米。

記憶體製程嚴重落後於邏輯製程,導致記憶體的效能與容量無法與同一時代的處理器匹配協作,這就是記憶體牆。在目前AI核心運作晶片設計所遭遇的種種問題中,大部分都跟記憶體牆相關。

雖然現在半導體產業的主要注意力放在數位AI(digital AI)——包括訓練、推論及代理式AI(agentic AI)上,但是實體AI(physical AI)逐漸要上場,而且其市場預計要遠大於AI伺服器資料中心。

在數位AI的應用中,邏輯製程的能力無疑是核心;但是到實體AI,記憶體華麗轉身成為主角。

實體AI大抵只需要推論,也不太能容許高能耗的應用,因此成為記憶體處理(Processing In Memory;PIM)的應用場景。PIM講究的是儘量將處理器靠近記憶體,省卻資料傳輸的延遲和功耗,方法包括將處理器置於記憶體模組中、先進封裝中,甚至置於記憶體晶粒之內。

以SK海力士(SK Hynix)的LPDDR5-AiM(Accelerator in Memory)為例,此即使用其LPDDR5製程於核心記憶體單元的週邊設計,能執行通用矩陣—向量乘法(General Matrix-Vector Multiplication;GEMV)的處理器。模型中的權重通常儲存於DRAM中,執行推論時,處理器從DRAM中提取,並作為矩陣的一部分使用。

將處理器與記憶體置於同一晶片中製造,雖然因為記憶體的製程不是為處理器專門最佳化的,犧牲處理器部分效能,但由於二者的鄰近,功耗、連線、信號傳導問題得以大幅改善。

在這樣應用的場景中,記憶體技術顯然是主導方,其中的邏輯線路其實也毋需太先進。

再進一步的進展就是回復計算的自然本質,將計算能力置於記憶體之中,這就是記憶體運算(Compute In Memory;CIM)。

PIM與CIM最大的不同是PIM只是試圖將處理器儘量和記憶體單元擺鄰近,但是記憶體單元並未參與資料處理的過程,即使處理器用記憶體的製程做在與記憶體單元的同一晶粒之中;CIM則是讓記憶體單元也直接參與計算,特別是目前AI所執行的矩陣—向量乘法(Matrix-Vector Multiplication;MVM)。

CIM使用的記憶體主要包括SRAM、DRAM、ReRAM和MRAM。

SRAM目前已經少量使用在邊緣計算,多的是下推論的用途,應用包括相機的影像辨識、物件感測、語音辨識、IoT(Internet of Things)sensor AI、工業設備的異常偵測、小型 CNN(Convolutional Neural Network)、Transformer /小型語言模型的部分矩陣乘法等。

SRAM是成熟製程,速度快、寫入耐久度(endurance)也很高,但其面積較大,讓它註定無法成為GPU級別的計算元件。這個制約也可以從它目前的起始應用中一覽無餘。

DRAM的密度較高,而且將來有3D DRAM的前景可期,被寄予厚望。

DRAM的儲存單元是電容,電容沒法用來計算。DRAM的計算都依賴於核心儲存單之外的週邊線路來執行,主要的工具是位元線(bitline)和感測放大器(sense amplifier)。

DRAM是數位元件,用來執行0與1的數位邏輯運算比較容易。如果要執行類比(analog)運算,則需要較複雜的線路來組成,並將數位/邏輯轉換器(Digital-to-Analog Converter;DAC)置於週邊線路之中。

ReRAM(Resistive Random Access Memory)的結構有些部分像人腦,被認為天生適合用於執行神經網路型態的計算元件。它用於儲存資料狀態的導電細絲(conductive filament)的性質可以是類比的——不只是斷開/導電兩種狀態,導電性(conductance)還可以有大有小,可以直接用來記錄大語言模型中的權重。結構中的交叉陣列(cross bar array)更可以直接用來執行矩陣乘法和加法。ReRAM是永久記憶體,模型中的權重就儲存在記憶體單元之中,計算時不必像SRAM或DRAM從其他永久記憶體中再搬運過來,計算運作更接近非馮諾伊曼架構的本意。

ReRAM的技術很早就被開發出來,之前主要用於嵌入式非揮發性記憶體(eNVM;embedded Nonvolatile Memory),用以替代難以繼續微縮的嵌入式快閃記憶體(eFLASH;embedded FLASH)。目前研究的主力集中於細絲材料的改善,以及適宜計算結構的最佳化。

MRAM也是永久記憶體,與ReRAM的主要差異是記憶單元的儲存機制不同,它利用兩個鐵磁層磁化的方向是平行或反平行來記錄數據,這意味著它儲存的資料是數位的0與1,所以在類比計算中它所遭遇的問題也與DRAM類似。

MRAM依工作機制分STT(Spin Torque Transfer)和SOT(Spin Orbit Torque)兩者,後者是較近發展出來的新機制。MRAM值得注意的地方是,SOT MRAM的寫入耐久性上限已接近DRAM相同等級,這是大型計算元件必須具備的特質。ReRAM、PCRAM等永久記憶雖有其他優點,但其寫入機制牽涉結構反覆的破壞與重組,因此耐久性很難提高到同等水準。

PIM概念的發展大概與積體電路的發明時間相近,而嚴格意義的CIM則萌芽於2010年之後。

從機器學習乃至於生成式AI這一波的半導體產業大競爭之中,有領先邏輯製程的廠商獲利至鉅,且主導發展。其他廠商花大力氣去追趕先進邏輯製程,成功的機率不是很高;另外還有業務型態的屏障,所費不貲也是重要考量。

如果計算機出現非馮紐曼架構的典範轉移等級變化,競爭的規則和賽道都將重設,變成一場一切歸零、重返起跑線的競賽。這是為什麼近幾年連邏輯廠商都已開始在記憶體下功夫的真實理由。

現為DIGITIMES顧問,台灣量子電腦暨資訊科技協會常務監事。1988年獲物理學博士學位,任教於國立中央大學,後轉往科技產業發展。曾任茂德科技董事及副總、普天茂德科技總經理、康帝科技總經理等職位。曾於 Taiwan Semicon 任諮詢委員,主持黃光論壇。2001~2002年獲選為台灣半導體產業協會監事、監事長。
智慧應用 影音