ชิปที่ใหญ่ที่สุดในโลก

Aug 23, 2021

ฝากข้อความ

ในการแข่งขันเพื่อเร่งความเร็วปัญญาประดิษฐ์ บริษัท Cerebras ในซิลิคอนแวลลีย์กำลังใช้กลยุทธ์ที่ไม่ธรรมดา นั่นคือ ก้าวให้ใหญ่


แม้ว่าชิปคอมพิวเตอร์ทั่วไปจะมีขนาดเท่ากับเล็บมือ Cerebras' ชิปคือขนาดของจานอาหารค่ำ


Deep Learning ซึ่งเป็นเทคโนโลยี AI ที่ขับเคลื่อนผู้ช่วยด้านเสียง รถยนต์ที่ขับด้วยตนเอง และ Go Champion นั้นอาศัย"neural network" ซอฟต์แวร์จัดเรียงเป็นชั้นๆ ระบบการเรียนรู้เชิงลึกสามารถทำงานบนคอมพิวเตอร์เครื่องเดียวได้ แต่ระบบที่ใหญ่ที่สุดจะกระจายอยู่ในเครื่องที่เชื่อมต่อหลายพันเครื่อง บางครั้งอยู่ในศูนย์ข้อมูลขนาดใหญ่ เช่น ระบบที่ดำเนินการโดย Google ในคลัสเตอร์ขนาดใหญ่ เซิร์ฟเวอร์ขนาดกล่องพิซซ่ามากถึง 48 ตัวเลื่อนเป็นชั้นวางสูงคนเดียว ชั้นวางเรียงเป็นแถวและเติมอาคารให้มีขนาดเท่ากับโกดัง โครงข่ายประสาทเทียมในระบบเหล่านี้สามารถแก้ปัญหาที่น่ากลัว แต่ก็เผชิญกับความท้าทายที่เห็นได้ชัดเช่นกัน เครือข่ายที่ขยายออกไปในคลัสเตอร์เป็นเหมือนสมองที่กระจัดกระจายไปทั่วห้องและเชื่อมต่อเข้าด้วยกัน อิเล็กตรอนเคลื่อนที่เร็ว แต่ถึงกระนั้น การสื่อสารข้ามชิปก็ช้าและใช้พลังงานมาก


Eric Vishria ซึ่งเป็นหุ้นส่วนทั่วไปของ Benchmark บริษัทร่วมทุนในซานฟรานซิสโก ได้ตระหนักถึงปัญหาครั้งแรกเมื่อเขาได้ยิน Cerebras Systems ซึ่งเป็นบริษัทชิปคอมพิวเตอร์แห่งใหม่ พูดในช่วงฤดูใบไม้ผลิปี 2016 เกณฑ์มาตรฐานเป็นที่รู้จักในฐานะนักลงทุนรายแรกในบริษัทต่างๆ เช่น Twitter Uber และ ebay คือในซอฟต์แวร์ ไม่ใช่ฮาร์ดแวร์ บริษัทพิจารณาสตาร์ทอัพประมาณ 200 แห่งต่อปีและลงทุนในบริษัทเดียว"เรากำลังเล่นเกมนี้เพื่อจูบกบพันตัว" วิสเรียบอกฉัน ในตอนต้นของคำพูด เขาตัดสินใจโยนกบกลับ"ฉันคิดว่า ทำไมฉันถึงเห็นด้วยกับเรื่องนี้?" เรา'จะไม่ลงทุนในฮาร์ดแวร์"เขานึกถึงความคิด"มัน'มันโง่"


แอนดรูว์ เฟลด์แมน ผู้ร่วมก่อตั้ง Cerebras เริ่มต้นด้วยภาพปกในสไลด์ของทีม และได้รับความสนใจจาก Vishria': พรสวรรค์ของเขาน่าประทับใจ Feldman เปรียบเทียบชิปคอมพิวเตอร์ทั้งสองประเภท อันดับแรก เขาดูที่หน่วยประมวลผลกราฟิก หรือชิป Gpus ที่ออกแบบมาโดยเฉพาะสำหรับการสร้างภาพ 3 มิติ วันนี้'s ระบบการเรียนรู้ของเครื่องพึ่งพาชิปกราฟิกเหล่านี้ด้วยเหตุผลหลายประการ ต่อมา เขาดูที่หน่วยประมวลผลกลางหรือซีพียู ซึ่งเป็นชิปเอนกประสงค์ที่ทำหน้าที่ส่วนใหญ่ในคอมพิวเตอร์ทั่วไป"สไลด์ที่สามเกี่ยวกับ'Gpus,' ซึ่งจริง ๆ แล้วไม่ดีสำหรับการเรียนรู้เชิงลึก - มันดีกว่าซีพียูร้อยเท่า" Cerebras ได้คิดค้นชิปชนิดใหม่ที่ไม่ได้ออกแบบมาสำหรับกราฟิก แต่ออกแบบมาเฉพาะสำหรับปัญญาประดิษฐ์


Vishria ใช้ในการรับฟังเสียงจากบริษัทต่างๆ ที่วางแผนจะใช้การเรียนรู้เชิงลึกในการรักษาความปลอดภัยทางไซเบอร์ ภาพทางการแพทย์ แชทบอท และแอปพลิเคชันอื่นๆ หลังจากการพูดคุยของ Cerebras' เขาได้พูดคุยกับวิศวกรในบริษัทที่ได้รับทุนจาก Benchmark รวมถึง Zillow, Uber และ Stitch Fix; พวกเขาบอกเขาว่ามีปัญหากับ AI เพราะใช้เวลานานเกินไปใน"train" โครงข่ายประสาทเทียม Google ได้เริ่มใช้หน่วยประมวลผลเทนเซอร์"เทนเซอร์" หรือ Tpus ชิปพิเศษที่ออกแบบมาสำหรับปัญญาประดิษฐ์ Vishria รู้ว่ามีการตื่นทองเกิดขึ้น และมีคนต้องหยิบและพลั่ว


ในปีนั้น Benchmark และ Foundation Capital ซึ่งเป็นบริษัทร่วมทุนอีกแห่งหนึ่งนำเงินทุนจำนวน 27 ล้านดอลลาร์ให้กับ Cerebras ซึ่งระดมทุนได้เกือบ 500 ล้านดอลลาร์ บริษัทอื่นๆ ก็กำลังผลิตสิ่งที่เรียกว่าเครื่องเร่งปัญญาประดิษฐ์ สมองน้อย' คู่แข่งอย่าง groq, Graphcore และ Sambanova ระดมทุนได้มากกว่า 2 พันล้านดอลลาร์ระหว่างกัน แต่ Cerebras' แนวทางที่เป็นเอกลักษณ์ แทนที่จะพิมพ์เวเฟอร์หลายสิบแผ่นบนแผ่นซิลิกอนชิ้นใหญ่ ตัดออกแล้วเชื่อมต่อเข้าด้วยกัน บริษัทได้สร้าง quot;ระดับเวเฟอร์&ระดับยักษ์" ชิป. แม้ว่าชิปคอมพิวเตอร์ทั่วไปจะมีขนาดเท่ากับเล็บมือ แต่ Cerebras นั้นมีขนาดเท่ากับจานอาหารค่ำและเป็นชิปคอมพิวเตอร์ที่ใหญ่ที่สุดในโลก


แม้แต่คู่แข่งก็พบว่าความสำเร็จนั้นน่าประทับใจ"นี่คือศาสตร์ใหม่" Nigel Toon ซีอีโอและผู้ร่วมก่อตั้ง Graphcore's บอกฉัน"It'เป็นงานวิศวกรรมที่เหลือเชื่อ'เป็นผลงานชิ้นเอก" ในขณะเดียวกัน วิศวกรอีกคนที่ฉันคุยด้วยอธิบายว่าเป็นโครงการวิทยาศาสตร์ -- ใหญ่สำหรับเรื่องใหญ่' ที่ผ่านมาบริษัทได้พยายามและล้มเหลวในการผลิตชิปยักษ์ สมองน้อย' แผนเป็นเดิมพันที่เอาชนะความท้าทายด้านวิศวกรรมเป็นไปได้และคุ้มค่า"พูดตามตรง สำหรับฉัน ความไม่รู้เป็นข้อได้เปรียบ" วิศริยะกล่าว"ฉันไม่'ไม่รู้ว่าถ้ารู้ว่าทำในสิ่งที่พวกเขาทำยากแค่ไหน ฉันจะกล้าลงทุน"


เป็นเรื่องง่ายที่จะบอกว่าคอมพิวเตอร์ทำงานเร็วขึ้นและเร็วขึ้น สิ่งนี้มักถูกอธิบายโดยกฎของมัวร์': รูปแบบที่ก่อตั้งในปี 2508 โดยกอร์ดอน มัวร์ ผู้บุกเบิกเซมิคอนดักเตอร์ ตามจำนวนทรานซิสเตอร์บนชิปเพิ่มเป็นสองเท่าทุกปีหรือทุกสองปี แน่นอน กฎของมัวร์' ไม่ใช่' ไม่ใช่กฎหมายจริงๆ และวิศวกรทำงานอย่างไม่รู้จักเหน็ดเหนื่อยเพื่อลดขนาดทรานซิสเตอร์ในขณะเดียวกันก็ปรับปรุง"สถาปัตยกรรม" ของแต่ละชิปเพื่อสร้างการออกแบบที่มีประสิทธิภาพและทรงพลังยิ่งขึ้น


สถาปนิกชิปสงสัยมานานแล้วว่าชิปคอมพิวเตอร์ขนาดใหญ่เพียงตัวเดียวอาจมีประสิทธิภาพมากกว่าชิปขนาดเล็กจำนวนมาก เช่นเดียวกับเมืองที่มีทรัพยากรหนาแน่นและบล็อกหนาแน่นมีประสิทธิภาพมากกว่าย่านชานเมือง แนวคิดนี้เกิดขึ้นครั้งแรกในปี 1960 เมื่อ Texas Instruments จำกัดการผลิตชิปที่มีความกว้างไม่กี่นิ้ว แต่วิศวกรของบริษัท's ประสบปัญหาผลผลิต บนแผ่นเวเฟอร์ซิลิคอนใดๆ ก็ตาม ข้อบกพร่องจากการผลิตย่อมเป็นอันตรายต่อวงจรจำนวนหนึ่งอย่างหลีกเลี่ยงไม่ได้ หากแผ่นเวเฟอร์มี 50 ชิป บริษัทสามารถทิ้งของเสียและขายของที่ดีได้ แต่ถ้าชิปที่ประสบความสำเร็จทุกตัวขึ้นอยู่กับวงจรการทำงานของเวเฟอร์ตัวเดียว เวเฟอร์ราคาแพงจำนวนมากจะถูกทิ้ง Texas Instruments พบวิธีแก้ปัญหา แต่เทคโนโลยีและความต้องการยังไม่ถึง'


ในช่วงปี 1980 วิศวกรชื่อ Gene Amdahl ได้พยายามแก้ปัญหาอีกครั้งกับบริษัทที่เขาก่อตั้งชื่อว่า Trilogy Systems มันกลายเป็นการเริ่มต้นที่ใหญ่ที่สุดในประวัติศาสตร์ของ Silicon Valley&ด้วยเงินทุนประมาณ 250 ล้านดอลลาร์ เพื่อแก้ไขปัญหาผลผลิต Trilogy ได้พิมพ์ส่วนประกอบที่ซ้ำซ้อนลงบนชิป วิธีนี้จะเพิ่มการผลิตแต่ลดความเร็วของชิป ในขณะเดียวกัน Trilogy กำลังดิ้นรนในด้านอื่น Amdahl วิ่งชนคนขี่มอเตอร์ไซค์ด้วยรถ Rolls Royce ของเขา ทำให้เกิดปัญหาทางกฎหมาย ประธานาธิบดีเสียชีวิตด้วยเนื้องอกในสมอง ฝนตกหนักทำให้การก่อสร้างโรงงานล่าช้า ระบบปรับอากาศที่เป็นสนิม และฝุ่นสะสมบนชิป ในปี 1984 ไตรภาคยอมแพ้"ฉันไม่ได้'ไม่รู้ว่ามันจะยากแค่ไหน" ลูกชายของ Amdahl' บอกกับ The Times


หากเทคโนโลยี Trilogy's ประสบความสำเร็จ ก็สามารถใช้สำหรับการเรียนรู้เชิงลึกได้แล้ว แทนที่จะเป็นอย่างนั้น Gpus (ชิปที่ใช้ในวิดีโอเกม) กำลังแก้ปัญหาทางวิทยาศาสตร์ในห้องปฏิบัติการแห่งชาติ การนำ gpus มาใช้ซ้ำสำหรับ AI ขึ้นอยู่กับความจริงที่ว่าโครงข่ายประสาทเทียมนั้นซับซ้อนมาก อาศัยการคูณและการบวกจำนวนมาก เมื่อ"เซลล์ประสาท" ในเครือข่ายยิงกัน พวกมันขยายหรือลดสัญญาณซึ่งกันและกัน' คูณด้วยค่าสัมประสิทธิ์ที่เรียกว่าน้ำหนักการเชื่อมต่อ โปรเซสเซอร์ AI ที่มีประสิทธิภาพจะคำนวณการเปิดใช้งานหลายอย่างพร้อมกัน มันรวมพวกมันเป็นชุดของตัวเลขที่เรียกว่าเวกเตอร์ หรือตารางของตัวเลขที่เรียกว่าเมทริกซ์ หรือบล็อกมิติที่สูงกว่าที่เรียกว่าเทนเซอร์ ตามหลักการแล้ว คุณต้องการคูณเมทริกซ์หรือเทนเซอร์ตัวหนึ่งด้วยตัวอื่นในคราวเดียว Gpus ได้รับการออกแบบมาเพื่อทำสิ่งที่คล้ายกัน:


& quot;เงาของไตรภาคนั้นใหญ่มาก" เฟลด์แมนบอกฉันเมื่อเร็ว ๆ นี้ว่า"คนหยุดคิดและเริ่มพูดว่า'มัน' เป็นไปไม่ได้'" บริษัท GPU รวมถึง Nvidia ได้เพิ่มโอกาสในการปรับแต่งชิปเพื่อการเรียนรู้เชิงลึก ในปี 2015 Feldman และกลุ่มสถาปนิกคอมพิวเตอร์เริ่มคุยกันถึงแนวคิดเรื่องชิปที่ใหญ่กว่า หลังจากที่พวกเขาได้ร่วมก่อตั้ง Seamicro ผู้ผลิตเซิร์ฟเวอร์คอมพิวเตอร์ ซึ่งพวกเขาขายให้กับผู้ผลิตชิป AMD ในราคา 334 ล้านดอลลาร์ พวกเขาทำงานเกี่ยวกับประเด็นนี้เป็นเวลาสี่เดือนในสำนักงานที่ยืมมาจากบริษัทร่วมทุน เมื่อพวกเขามีโครงร่างของโซลูชันที่ใช้งานได้ พวกเขาพูดคุยกับบริษัทแปดแห่ง ได้รับเงินทุนจาก Benchmark, Foundation Capital และ Eclipse และเริ่มว่าจ้าง


สมองน้อย' งานแรกคือการแก้ปัญหาการผลิตที่ทำให้เกิดปัญหากับชิปขนาดใหญ่ เดิมชิปนั้นเป็นแท่งทรงกระบอกของผลึกซิลิกอนที่มีเส้นผ่านศูนย์กลางประมาณ 1 ฟุต และแท่งเหล็กถูกตัดเป็นแผ่นเวเฟอร์ที่มีความหนาน้อยกว่าหนึ่งมิลลิเมตร วงจรนั้น"พิมพ์" ลงบนแผ่นเวเฟอร์ด้วยกระบวนการที่เรียกว่า lithography สารเคมีที่ไวต่อรังสี UV จะถูกวางลงบนพื้นผิวอย่างระมัดระวัง จากนั้นลำแสงของแสง UV จะถูกฉายผ่านเทมเพลตที่มีรายละเอียดที่เรียกว่าหน้ากาก สารเคมีเหล่านี้ทำปฏิกิริยากับวงจร


โดยปกติ พื้นที่ที่แสงส่องผ่านหน้ากากจะกลายเป็นเศษ จากนั้นชิปจะเคลื่อนที่และฉายแสงอีกครั้ง หลังจากพิมพ์ชิปหลายสิบหรือหลายร้อยชิ้นแล้ว ชิปเหล่านี้จะถูกตัดด้วยเลเซอร์จากแผ่นเวเฟอร์"วิธีที่ง่ายที่สุดคือให้คุณแม่เอาแป้งคุกกี้ทรงกลมออกมา" เฟลด์แมนกล่าว"เธอมีแม่พิมพ์คุกกี้และเธอก็ตัดคุกกี้อย่างระมัดระวัง" กฎของฟิสิกส์และทัศนศาสตร์ทำให้ไม่สามารถสร้างเครื่องตัดคุกกี้ที่ใหญ่ขึ้นได้ เป็นผลให้"เราได้พัฒนาเทคโนโลยีเพื่อให้คุณสามารถสื่อสารผ่านแป้งเล็กน้อยระหว่างสองคุกกี้"


ในระบบการพิมพ์ Cerebras ที่พัฒนาขึ้นโดยความร่วมมือกับ TSMC บริษัทที่ทำชิป ขอบของคุกกี้ทับซ้อนกันเพื่อให้สายไฟเชื่อมต่อกัน ผลที่ได้คือ"ขนาดเวเฟอร์" แผ่นเวเฟอร์ สี่เหลี่ยมสีทองแดง ด้านละ 21 ซม. (Gpus ที่ใหญ่ที่สุดมีเส้นผ่านศูนย์กลางน้อยกว่า 3 ซม. เล็กน้อย) Cerebras ผลิตชิพ Wafer-scale Engine 1 ตัวแรกในปี 2019 Wse-2 ซึ่งเปิดตัวในปีนี้ใช้วงจรที่มีความหนาแน่นมากขึ้น โดยมีทรานซิสเตอร์ 2.6 ล้านล้านตัวบรรจุอยู่ในหน่วยประมวลผล 850,000 ตัว , หรือ"แกน". (ตัวท็อป GPU มีเพียงไม่กี่พันคอร์ ในขณะที่ซีพียูส่วนใหญ่มีน้อยกว่า 10 ตัว)


& quot;2.6 ล้านล้านทรานซิสเตอร์เป็นที่น่าอัศจรรย์" Aart de Geus ประธานและซีอีโอร่วมของ Synopsys กล่าว Synopsys มีซอฟต์แวร์บางอย่างที่ Cerebras และผู้ผลิตชิปรายอื่นๆ ใช้เพื่อสร้างและตรวจสอบการออกแบบชิปของตน De Geus กล่าวว่าเมื่อออกแบบชิป วิศวกรต้องพิจารณาคำถามหลักสองข้อก่อน:"ข้อมูลมาจากไหน?" มันจัดการที่ไหน?" เมื่อชิปเป็นเรื่องง่าย นักออกแบบสามารถตอบคำถามเหล่านี้ด้วยดินสอบนโต๊ะวาดภาพ เมื่อทำงานกับชิปที่ซับซ้อนมากขึ้นในปัจจุบัน&ให้ป้อนโค้ดที่อธิบายสถาปัตยกรรมที่ต้องการสร้าง จากนั้นไปยังเครื่องมือสร้างภาพและเขียนโค้ด"ลองคิดดูว่าบ้านจะหน้าตาเป็นอย่างไรเมื่อมองจากหลังคา" เดอ เกอุส กล่าว"โรงจอดรถอยู่ใกล้ครัวหรือเปล่า? หรือใกล้ห้องนอน? คุณต้องการให้อยู่ใกล้ห้องครัว มิฉะนั้น คุณ'จะต้องขนของชำไปทุกมุมบ้าน" หลังจากออกแบบแผนผังชั้นแล้ว เขาอธิบายว่า"คุณสามารถใช้สมการเพื่ออธิบายสิ่งที่เกิดขึ้นในห้องได้"


ความซับซ้อนในการออกแบบของชิปนั้นเหลือเชื่อ"มีหลายชั้นที่นี่" เดอเกอุสกล่าวโดยมีวงจรที่สลับซับซ้อนและซ้อนกันเป็นชั้นๆ เหมือนสะพานลอยบนทางหลวงสายสำคัญ สำหรับวิศวกรของ Cerebras ที่ทำงานในระดับเวเฟอร์ ความซับซ้อนก็เพิ่มมากขึ้น เรื่องย่อ' ซอฟต์แวร์ช่วยในรูปแบบของปัญญาประดิษฐ์: อัลกอริธึมการจับคู่รูปแบบระบุปัญหาทั่วไปและเสนอวิธีแก้ไข โปรแกรมเพิ่มประสิทธิภาพจะย้ายห้องไปสู่การจัดเรียงที่รวดเร็วและมีประสิทธิภาพยิ่งขึ้น หากเลนมากเกินไปพยายามที่จะบีบเข้าไปในอาคารสองช่วงตึก ซอฟต์แวร์จะช่วยให้วิศวกรสามารถเล่น Robert Moses และย้ายบล็อกได้


ในท้ายที่สุด Feldman กล่าวว่ามีข้อดีหลายประการในการออกแบบชิปขนาดใหญ่ เมื่อแกนกลางอยู่บนชิปตัวเดียวกัน พวกมันจะสื่อสารได้เร็วขึ้น: สมองของคอมพิวเตอร์' ตอนนี้กระจุกตัวอยู่ในกระโหลกเดียว แทนที่จะกระจัดกระจายไปทั่วห้อง ชิปที่ใหญ่กว่ายังรองรับหน่วยความจำได้ดีกว่า โดยทั่วไปแล้ว ชิปขนาดเล็กที่พร้อมสำหรับการประมวลผลไฟล์จะต้องได้รับไฟล์จากชิปหน่วยความจำที่ใช้ร่วมกันซึ่งอยู่ที่อื่นบนแผงวงจรก่อน เฉพาะข้อมูลที่ใช้บ่อยที่สุดเท่านั้นที่ถูกแคชไว้ใกล้บ้าน ในการอธิบายประสิทธิภาพของชิประดับเวเฟอร์ Feldman เสนอการเปรียบเทียบ: เขาขอให้ฉันจินตนาการถึงกลุ่มเพื่อนร่วมห้อง (แกนกลาง) ที่อาศัยอยู่ในหอพัก (ชิป) ที่ต้องการดูเกมฟุตบอล (ทำงานด้านคอมพิวเตอร์) เพื่อที่จะดูเกม เฟลด์แมนกล่าวว่าเพื่อนร่วมห้องต้องเก็บเบียร์ไว้ในตู้เย็น (ข้อมูลถูกเก็บไว้ในหน่วยความจำ); Cerebras เก็บตู้เย็นไว้ในแต่ละห้องเพื่อไม่ให้เพื่อนร่วมห้อง' ต้องเสี่ยงไปที่หอพัก' ห้องครัวส่วนกลางหรือ Safeway สิ่งนี้มีประโยชน์เพิ่มเติมในการอนุญาตให้แต่ละคอร์ประมวลผลข้อมูลที่แตกต่างกันได้รวดเร็วยิ่งขึ้น"ฉันจะให้ Bud อยู่ในหอพักได้นะ" เฟลด์แมนกล่าว"ในหอพักของคุณ คุณสามารถมี Schlitz ได้"


ในที่สุด Cerebras ต้องเอาชนะปัญหาผลผลิต วิศวกรของบริษัท' ใช้เคล็ดลับ Trilogy': ความซ้ำซ้อน แต่ที่นี่พวกเขามีข้อได้เปรียบเหนือรุ่นก่อน Trilogy พยายามสร้างชิปทั่วไปที่มีส่วนประกอบต่างๆ มากมาย ดังนั้นการเดินสายไฟรอบส่วนประกอบที่ล้มเหลวเพียงชิ้นเดียวอาจต้องเชื่อมต่อกับการเปลี่ยนที่อยู่ห่างไกล บน Cerebras' ชิป แกนทั้งหมดเหมือนกัน ถ้าบิสกิตตัวหนึ่งผิด บิสกิตที่อยู่รอบๆ ก็อร่อยเหมือนกัน