Sakana AI เปิดตัว Error Diffusion: ฝึก AI ด้วยหลักการชีวภาพโดยไม่ใช้ Backpropagation

Sakana AI เปิดตัว Error Diffusion: ฝึก AI ด้วยหลักการชีวภาพโดยไม่ใช้ Backpropagation

การฝึกฝน Deep Learning ในปัจจุบันถูกครอบงำด้วย Backpropagation แต่กลไกนี้มีข้อจำกัดที่สมองมนุษย์อาจไม่ได้ทำตาม โดยเฉพาะขั้นตอน Backward Pass ที่ต้องใช้ค่า Transpose ของเมทริกซ์น้ำหนักอย่างแม่นยำ ซึ่งเรียกว่า ปัญหาการขนส่งน้ำหนัก (Weight Transport Problem) งานวิจัยใหม่จาก Sakana AI ในชื่อ paper, Diffusing Blame ได้นำเสนอแนวทางใหม่ที่สอดคล้องกับ

หลักการของ Dale (Dale’s principle) โดยหลีกเลี่ยงการขนส่งน้ำหนักอย่างสิ้นเชิง

Error Diffusion คืออะไร?

Error Diffusion (ED) เป็นกฎการเรียนรู้เฉพาะที่ (Local Learning Rule) ที่เสนอโดย Kaneko (2000) การอัปเดตน้ำหนักจะขึ้นอยู่กับสัญญาณเพียง 3 อย่าง ได้แก่ Presynaptic activity, Postsynaptic activation derivative และสัญญาณ Global error เพียงตัวเดียว ทำให้ ED ไม่ต้องใช้การ Transpose น้ำหนัก หรือใช้เมทริกซ์ Feedback แบบสุ่ม ซึ่งส่งผลให้ ED เข้ากันได้กับหลักการของ Dale โดยธรรมชาติ แม้ว่าก่อนหน้านี้ ED จะถูกจำกัดอยู่แค่ในงาน Binary Classification หรือ MNIST เท่านั้น

สถาปัตยกรรม Dual-Stream เพื่อก้าวข้ามข้อจำกัดเดิม ทีมวิจัยได้แบ่งแต่ละชั้น (Layer) ออกเป็นสองสตรีม ได้แก่ สตรีมแบบกระตุ้น (Excitatory - p) และสตรีมแบบยับยั้ง (Inhibitory - n) โดยที่ขั้นตอน Forward Pass จะมีการคำนวณดังนี้:

p_i = φ_i( +p_{i-1} Wpp − n_{i-1} Wnp + bp )
n_i = φ_i( +n_{i-1} Wnn − p_{i-1} Wpn + bn )

เมทริกซ์น้ำหนักทั้ง 4 ตัวจะถูกคุมให้มีค่าไม่เป็นลบ (Non-negative) ยกเว้นค่า Bias (b) ขณะที่เครื่องหมายลบหน้า Wnp และ Wpn ถูกกำหนดตายตัวเพื่อสร้างโครงสร้างการยับยั้ง การออกแบบนี้ใช้พารามิเตอร์มากกว่าโครงข่ายปกติประมาณ 4 เท่า (เช่น ~32M เทียบกับ ~8M ใน DFA.pn)

Modulo Error Routing

หัวใจสำคัญที่ช่วยให้ ED พัฒนาไปไกลกว่าการทำ Binary Classification คือการใช้ Modulo Error Routing สำหรับหน่วยซ่อน (Hidden unit) i ทีมวิจัยจะกำหนดเส้นทาง r(i) = i mod C (เมื่อ C คือมิติของเอาต์พุต) เพื่อให้หน่วยนั้นเรียนรู้จาก Error เฉพาะช่องสัญญาณที่ได้รับมอบหมายคงที่ ต่างจาก DFA ที่ใช้ Feedback แบบสุ่ม

นวัตกรรม 3 ประการเพื่อประสิทธิภาพที่สูงขึ้น

ทีมวิจัยได้เสริมเทคนิคพิเศษ 3 อย่างสำหรับการเรียนรู้แบบ Multi-class Classification:

  • ความกว้างของ Sigmoid เฉพาะเลเยอร์: ใช้ φ เนื่องจากอนุพันธ์ของ Sigmoid มีผลต่อสัญญาณ Error การใช้ Sigmoid ที่กว้างขึ้น (ตั้งค่า α = 3.0 สำหรับ Conv layers และ α = 6.0 สำหรับ FC layers) ช่วยป้องกันการอิ่มตัว (Saturation) ของสัญญาณ
  • Batch-centered class error: ลบค่าเฉลี่ยของ Mini-batch รายคลาส เพื่อช่วยลดอาการยับยั้งต่อเนื่องที่เกิดจากความไม่สมดุลของเป้าหมาย (ระดับ 9:1)
  • การตั้งค่าเริ่มต้นแบบอสมมาตร (Asymmetric initialization): ปรับสัดส่วนน้ำหนัก Excitatory ให้สูงกว่า Inhibitory เพื่อให้ได้อัตราส่วน E/I ที่ 3:1

ประสิทธิภาพที่ได้รับ

ด้วยนวัตกรรมเหล่านี้ ED สามารถทำคะแนน MNIST ได้ถึง 96.7% และ CIFAR-10 ที่ 61.7% ซึ่งถือเป็นครั้งแรกที่มีการใช้ ED ฝึกฝนโครงข่ายแบบ Convolutional แม้จะยังตามหลังวิธีการ Gradient มาตรฐาน แต่ก็แสดงให้เห็นถึงศักยภาพที่น่าสนใจ

MethodMNISTCIFAR-10Dale-compliantNotes
Proposed ED96.7%61.7%YesAll weights non-negative; first ED on CNNs
Seed ED50.4%11.6%YesNo innovations; α = 1.0, raw error, symmetric init
DFA97.6%69.1%NoRandom feedback; ∼2.84M negative weights

การวิเคราะห์ความสำคัญของตัวแปร (Ablation Analysis)

สิ่งที่น่าสนใจคือ ความสำคัญของเทคนิคต่างๆ จะเปลี่ยนไปตามประเภทงาน สำหรับ MNIST การปรับความกว้าง Sigmoid มีความสำคัญสูงสุด ขณะที่ใน CIFAR-10 การทำ Batch-centering กลับเป็นปัจจัยชี้ขาด ความแตกต่างนี้เผยให้เห็นคอขวดของการกำหนดเครดิต (Credit Assignment) ที่แตกต่างกันในแต่ละโจทย์

Error Diffusion ในโลกของ Reinforcement Learning

ทีมวิจัยยังได้พัฒนา ED-PPO โดยนำ ED ไปผสานกับวิธีการ Proximal Policy Optimization เพื่อทดสอบในงานอย่าง Brax และ Craftax ผลการทดลองพบว่า ED-PPO สามารถเอาชนะ BP-PPO ในการทดสอบ HalfCheetah (5494 เทียบกับ 3520) และทำได้ดีกว่า DFA-PPO ในงานแนว Open-ended อย่าง Craftax

กรณีการใช้งานที่สำคัญ

  • ฮาร์ดแวร์ยุคใหม่: เหมาะสำหรับชิปประมวลผลแสง (Photonic) หรือฮาร์ดแวร์ Neuromorphic ที่มักถูกจำกัดให้ใช้น้ำหนักแบบไม่เป็นลบได้ดีกว่า
  • ความเบาบางของโมเดล: การใช้น้ำหนักไม่เป็นลบทำให้เกิดความเบาบาง (Sparsity) โดยธรรมชาติ โดยเฉพาะการเชื่อมต่อแบบ Inhibitory ที่ถูกตัดออก (Pruned) ได้สูงถึง 68.8% ช่วยในเรื่องการบีบอัดโมเดล
  • การเรียนรู้ต่อเนื่อง: โครงสร้างการยับยั้งช่วยลดปัญหา Gradient ระเบิด (Gradient Exploding) ในการเรียนรู้แบบปลายเปิด

ตารางเปรียบเทียบ Error Diffusion และเทคนิคอื่นๆ

MethodBackprop-free (no weight transport)How error reaches hidden layersDale-compliant (E/I, non-negative)Shown on RLDemonstrated reach / notes
BackpropagationNo (uses transpose)All-to-all gradientsNoYesStandard baseline
Feedback Alignment (FA)YesRandom feedback matrixNoYesCIFAR-10 convolution
Direct Feedback Alignment (DFA)YesDirect random feedbackNoYesCIFAR-10 / ImageNet
Dale’s ANNs (DANNs)No (uses BP)All-to-all gradientsYesNoBiological plausibility focus
Predictive codingYesLocal prediction errorsNoNoHebbian-like inference
Dendritic cortical microcircuitsYesIntegrated drendritesNoNoCortical column model
Evolution Strategies (ES)YesPerturbation estimationNoYesBlack-box optimization
Original Error DiffusionYesr(i) = i mod CYesNoBinary / MNIST MLP only

ตัวอย่างโค้ดเบื้องต้น

import torch
def dual_stream_forward(p, n, Wpp, Wnp, Wnn, Wpn, bp, bn, phi):
    # All W >= 0; cross-stream signs are hardcoded inhibitory (Dale's principle)
    p_next = phi(p @ Wpp - n @ Wnp + bp) # excitatory stream
    n_next = phi(n @ Wnn - p @ Wpn + bn) # inhibitory stream
    return p_next, n_next
 
def routed_error(S, H, C): # S: output error, shape (B, C)
    M = torch.zeros(H, C)
    for i in range(H):
        M[i, i % C] = 1.0 # r(i) = i mod C
    return S @ M.T # R = S M^T, shape (B, H)
 
def ed_update(A_p, Z_p, R, phi_deriv):
    U_p = phi_deriv(Z_p) * R # local postsynaptic drive
    return A_p.T @ U_p # dWpp ∝ A_p^T U_p, shape (K, H)

บทสรุป

งานวิจัยครั้งนี้เป็นก้าวสำคัญที่พิสูจน์ว่า เราสามารถฝึกโครงข่ายประสาทเทียมที่สอดคล้องกับหัวใจสำคัญของชีววิทยา (Dale's Principle) และก้าวข้ามขีดจำกัดทางวิศวกรรม (Backprop-free) ได้พร้อมกัน แม้จะมีราคาที่ต้องจ่ายเป็นคะแนนความแม่นยำที่ลดลงเล็กน้อยเมื่อเทียบกับ DFA แต่ก็เปิดทางสู่สถาปัตยกรรม AI ที่มีประสิทธิภาพในเชิงฮาร์ดแวร์และการเรียนรู้ที่ยืดหยุ่นกว่าในอนาคต

Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย AttapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร