อยากเข้าใจว่า LLM ทำงานยังไงจริง ๆ? คอร์ส Stanford ที่เปิดฟรี อาจเป็นจุดเริ่มที่ดีที่สุด
โดย Nokka (นก-กา) | 9 ตุลาคม 2026
บทความนี้เขียนโดย AI (deepseek-v4.1-flash) ผ่าน Hermes Agent ภายใต้การควบคุมและตรวจสอบคุณภาพโดยมนุษย์ · Nokka (นก-กา)
ทุกวันนี้เราคุยกับแชตบอตทุกวัน แต่มีกี่คนที่ตอบได้ว่ามันทำงานยังไงจริง ๆ?
ไม่ใช่คำตอบระดับที่ว่า "มันเดาคำถัดไป" แบบที่ใครก็พูดได้ แต่ต้องรู้ว่าทำไมมันเดาได้ และทำไมบางทีนึกไม่ออก
ถ้าคำถามนี้ค้างอยู่ในหัวคุณ มีคอร์สหนึ่งที่ตั้งใจตอบคำถามนี้ทั้งชุด และเปิดให้ดูฟรี
คอร์สนี้คืออะไร และใครสอน
Stanford เปิดสอนรายวิชา CME 295: Transformers & Large Language Models โดยบันทึกทุกคาบขึ้น YouTube ให้ดูฟรี[1]
คาบแรกของรุ่น Autumn 2026 ยาว 1 ชั่วโมง 44 นาที และมียอดดูเกิน 372,000 ครั้งแล้ว ณ วันที่เขียนบทความนี้[2]
ชื่อวิชาในหลักสูตร CME ย่อมาจาก Computational and Mathematical Engineering ซึ่งเป็นสายวิศวกรรมเชิงคำนวณของมหาวิทยาลัย
ผู้สอนคือสองแฝดที่ผ่านเส้นทางเดียวกัน
ผู้สอนคือ Afshine Amidi และ Shervine Amidi สองพี่น้องฝาแฝดที่เรียนด้วยกันมาตลอดทาง
ทั้งคู่จบจาก Ecole Centrale Paris ในฝรั่งเศส แล้วแยกกันไปเรียนต่อระดับปริญญาโทที่อเมริกา โดย Afshine ไป MIT ส่วน Shervine ไป Stanford[3]
หลังจากนั้นทั้งคู่เข้า Uber แล้วไป Google ก่อนจะย้ายมาอยู่ Netflix ด้วยกันทั้งสองคน[2]
พวกเขาสอนเนื้อหานี้มาตั้งแต่ปี 2021 ในหลายรูปแบบ ก่อนจะยกระดับเป็นวิชาจริงของ Stanford เมื่อปีที่แล้ว และรุ่นนี้เป็นรุ่นที่สามตามที่ผู้สอนกล่าวไว้ในคลิป[2]
ไม่มี homework แต่มีข้อสอบสองครั้ง
จุดที่ต่างจากวิชามหาวิทยาลัยทั่วไปคือคอร์สนี้ ไม่มีการบ้านเลย คะแนนมาจากการสอบสองครั้ง คือ midterm กับ final[2]
midterm จะออกเนื้อหาสี่คาบแรก และจัดวันที่ 23 ตุลาคม 2026 ส่วน final จะออกเนื้อหาห้าคาบหลัง และจัดวันที่ 9 ธันวาคม 2026 รวมทั้งหมดเก้าคาบ[4]
คาบเรียนจัดทุกวันศุกร์ เวลา 15.30 ถึง 17.20 น. แต่ถ้าอยู่ต่างประเทศหรือเวลาไม่สะดวก ก็ดูย้อนหลังได้ทั้งหมด[1]
สไลด์ถูกโพสต์ล่วงหน้าหนึ่งวันก่อนคาบเรียน เพื่อให้ผู้เรียนพิมพ์จดบนสไลด์ได้ตามที่อาจารย์บอกว่าเป็นคำขอจากผู้เรียนรุ่นก่อน[2]
เส้นทางจาก RNN สู่ Transformer ที่คอร์สอธิบาย
คาบแรกใช้เวลาส่วนใหญ่ไปกับการตอบคำถามข้อหนึ่ง คือทำไมเรามาถึงจุดนี้
ผู้สอนย้อนไปเมื่อราวสิบปีก่อน ตอนที่วงการนี้ยังไม่มีโมเดลเดียวที่ทำได้ทุกอย่าง แต่มีโมเดลแยกกันตามงาน งานวิเคราะห์อารมณ์ก็มีโมเดลหนึ่ง งานแปลก็มีอีกโมเดล งานหาชื่อคนและสถานที่ก็มีอีกโมเดล[2]
โมเดลที่ครองวงการตอนนั้นคือ RNN หรือโครงข่ายประสาทแบบวนซ้ำ ซึ่งเรียนรู้จากลำดับของคำทีละคำ
แล้วทุกอย่างก็เปลี่ยนในปี 2017
กระดาษแผ่นเดียวที่เปลี่ยนทิศทางวงการ
ปี 2017 มีบทความวิจัยชื่อ Attention Is All You Need ที่เสนอสถาปัตยกรรมใหม่ชื่อ Transformer และกลายเป็นจุดเปลี่ยนของทั้งวงการ[5]
เหตุผลที่มันเปลี่ยนเกมไม่ได้อยู่ที่ผลลัพธ์ที่ดีขึ้นเท่านั้น แต่เพราะมัน ปรับขนาดได้
คำว่าปรับขนาดได้ในที่นี้หมายถึง ถ้าเราเพิ่มข้อมูล เพิ่มพลังประมวลผล และเพิ่มขนาดโมเดล ผลลัพธ์ที่ได้จะดีขึ้นในอัตราที่สูงกว่าเดิมมาก ซึ่งเป็นคุณสมบัติที่สถาปัตยกรรมก่อนหน้าไม่มี[2]
จากโครงสร้างนั้น วงการก็ขยายมันขึ้นเรื่อย ๆ ทั้งขนาดโมเดลและปริมาณข้อมูลที่ใช้ฝึก จนกลายเป็นโมเดลภาษาขนาดใหญ่ที่เรารู้จักทุกวันนี้
ผู้สอนไล่ไทม์ไลน์ต่อว่าเดือนพฤศจิกายน 2022 มีการเปิดตัว ChatGPT ซึ่งเป็นจุดเปลี่ยนอีกชั้นในมุมของผลิตภัณฑ์ เพราะเป็นครั้งแรกที่คนทั่วไปได้คุยกับแชตบอตจริง ๆ[2]
และมาถึงปี 2026 นี้ ผู้สอนคาดว่าผู้เรียนเกือบทุกคนใช้ coding agent เกือบทุกวัน ซึ่งเป็นคำถามที่คอร์สจะตอบในครึ่งหลังว่าจากผู้ช่วยคุยเล่น กลายเป็นเอเจนต์ที่ลงมือทำงานได้ยังไง[2]
สี่แนวคิดหลักที่คอร์สสอนในคาบแรก
Tokenization คือจุดเริ่มของทุกอย่าง
โมเดลไม่เข้าใจตัวอักษร มันเข้าใจตัวเลข
ดังนั้นขั้นแรกคือการแบ่งข้อความออกเป็นหน่วยย่อยที่เรียกว่า โทเคน แล้วแทนแต่ละหน่วยด้วยตัวเลขที่เรียกว่าเวกเตอร์[2]
คอร์สยกตัวอย่างง่าย ๆ ว่า ประโยค "a cute teddy bear is reading" อาจถูกแบ่งเป็นหกโทเคน โดยที่คำว่า teddy bear รวมกันเป็นหนึ่งหน่วย
แล้วทั้งชุดโทเคนที่โมเดลรู้จักก็เรียกรวมกันว่า vocabulary ซึ่งในโมเดลสมัยใหม่มีขนาดหลักแสน โดยผู้สอนบอกว่าอยู่ราว 200,000 โทเคน[2]
สามวิธีแบ่งคำ ที่มีข้อดีข้อเสียต่างกัน
แบ่งตามคำ ง่ายและอธิบายได้ แต่มีปัญหาสามข้อ คือคำที่แปรรูปเยอะทำให้ vocabulary บวม, คำที่มีรากเดียวกันไม่ได้ใช้ความรู้ร่วมกัน เช่น bear กับ bears, และเสี่ยงเจอคำที่ไม่เคยเห็นตอนฝึก[2]
แบ่งตามตัวอักษร แก้ปัญหาไม่รู้จักคำได้ เพราะตัวอักษรมีจำกัด แต่ลำดับจะยาวขึ้นมาก ทำให้ประมวลผลช้าลง และเวกเตอร์ที่ได้ก็ตีความยากกว่า[2]
แบ่งตามหน่วยย่อยของคำ (subword) เป็นวิธีที่ครองวงการตอนนี้ เพราะได้ทั้งรากคำและขนาดที่สมดุล[2]
วิธีที่นิยมที่สุดในกลุ่มนี้คือ BPE หรือ Byte Pair Encoding ซึ่งเริ่มจากชุดโทเคนตั้งต้น แล้วนับคู่ที่ปรากฏบ่อยที่สุดมาหลอมรวมเป็นโทเคนใหม่ ทำซ้ำไปเรื่อย ๆ จนได้ขนาด vocabulary ตามที่ต้องการ[2]
ผู้สอนย้ำว่าถ้าทำงานหลายภาษา ต้องมั่นใจว่าคลังข้อความที่ใช้ฝึก tokenizer มีทุกภาษาที่เราสนใจ
เวกเตอร์ของคำที่เรียนรู้ความหมาย
เมื่อได้โทเคนแล้ว คำถามต่อไปคือจะแทนมันด้วยอะไร
วิธีที่ตรงไปตรงมาที่สุดคือ one-hot encoding คือให้แต่ละโทเคนเป็นเวกเตอร์ที่มีเลขหนึ่งตัวเป็น 1 และที่เหลือเป็น 0
แต่ผู้สอนชี้ว่าวิธีนี้ไม่ดี เพราะเวกเตอร์ทุกตัวจะตั้งฉากกันหมด มันไม่บอกอะไรเลยว่าโทเคนไหนใกล้เคียงกัน[2]
เราต้องการเวกเตอร์ที่บอกได้ว่า teddy bear ใกล้เคียงกับ soft เพราะหมีนุ่ม แต่ book ไม่เกี่ยว
แนวคิดนี้ถูกทำให้จริงด้วยวิธีชื่อ word2vec ซึ่งเรียนรู้ผ่านงานตัวแทน ไม่ใช่งานที่เราต้องการโดยตรง งานตัวแทนในเวอร์ชัน CBOW คือการเดาคำที่อยู่ตรงกลางจากคำรอบข้าง ส่วนเวอร์ชัน skip-gram คือการเดาคำรอบข้างจากคำตรงกลาง[2]
ผลลัพธ์ที่ได้น่าสนใจกว่าที่คิด เพราะชั้นกลางของโครงข่ายที่เรียนรู้ขึ้นมา กลับจับความสัมพันธ์เชิงความหมายได้จริง อย่างความสัมพันธ์แบบ ปารีสคือกับฝรั่งเศส เหมือนที่เบอร์ลินคือกับเยอรมนี[2]
ข้อจำกัดของ word2vec ที่ต้องมีอย่างอื่นมาแก้
ผู้เรียนในห้องช่วยกันตอบข้อจำกัดของวิธีนี้ และได้คำตอบที่ตรงประเด็นสามข้อ
ข้อแรกคือคำที่ต่างความหมายแต่สะกดเหมือนกันจะได้เวกเตอร์เดียวกัน ตัวอย่างคลาสสิกที่ผู้สอนยกคือ bank ที่แปลว่าธนาคารกับตลิ่งริมแม่น้ำ[2]
ข้อสองคือลำดับคำไม่มีความหมาย ประโยค "เด็กกอดหมี" กับ "หมีกอดเด็ก" ใช้คำชุดเดียวกันแต่ความหมายต่างกัน วิธีนี้ให้ผลเท่ากัน[2]
และข้อสามคือคำที่ไม่เคยเจอตอนฝึกจะไม่มีเวกเตอร์ให้ใช้
นี่คือเหตุผลที่ทำให้ต้องมี RNN เข้ามา ซึ่งเพิ่มสถานะซ่อนที่จำความหมายของประโยคที่อ่านมาแล้ว เพื่อให้ลำดับคำมีความหมาย[2]
แต่ RNN ก็มีข้อจำกัดของตัวเอง นั่นคือจำคำที่อยู่ไกลเกินไปไม่ได้ ซึ่งผู้สอนอธิบายว่ามาจากปัญหาเชิงลึกที่เรียกว่า vanishing gradient[2] และถึงแม้จะมีการพัฒนาต่อเป็น LSTM ที่เพิ่มหน่วยความจำอีกชั้น ก็ยังแก้ปัญหาได้ไม่หมด[2]
หัวใจของ Transformer อยู่ที่สูตรเดียว
ทางออกของปัญหาข้างต้นคือแนวคิดที่เรียกว่า attention หรือการให้ความสนใจ
แทนที่จะให้โมเดลพึ่งสถานะซ่อนเพียงอย่างเดียวเพื่อจำอดีต แนวคิดใหม่คือให้โทเคนแต่ละตัวเชื่อมตรงไปยังโทเคนก่อนหน้าได้เลย แล้วให้โมเดลเรียนรู้เองว่าโทเคนไหนสำคัญกับโทเคนไหน[2]
พอรวมแนวคิดนี้เข้ากับการให้โทเคนทุกตัวปฏิสัมพันธ์กันทั้งหมด เราได้สิ่งที่เรียกว่า self-attention ซึ่งเป็นแกนของ Transformer
Query, Key และ Value
การอธิบายกลไกนี้ใช้คำสามคำที่ฟังดูแปลกตอนแรก
Query คือสิ่งที่โทเคนหนึ่งกำลังถามว่า "ฉันควรสนใจใคร" ส่วน Key คือป้ายที่โทเคนแต่ละตัวติดไว้เพื่อให้คนอื่นเทียบ และ Value คือเนื้อหาจริงที่จะถูกดึงมาผสมกัน
ผู้สอนยกตัวอย่างว่าถ้าเราอยากรู้ว่าอะไรอธิบายหมีตัวนี้ได้ดี query ของ teddy bear จะเทียบกับ key ของทุกโทเคน แล้วพบว่า cute ใกล้เคียงที่สุด ดังนั้น representation ของ teddy bear จะขึ้นกับ cute เป็นหลัก[2]
ทั้งหมดนี้เขียนเป็นสูตรได้กระชับมาก
import math
def self_attention(Q, K, V):
# เทียบ query ทุกตัวกับ key ทุกตัว ด้วย dot product
scores = Q @ K.T / math.sqrt(K.shape[-1])
# แปลงเป็นน้ำหนักที่รวมกันได้ 1
weights = softmax(scores)
# ถ่วงน้ำหนัก value แล้วรวม
return weights @ V
ผู้สอนบอกตรง ๆ ในคลิปว่า นี่คือสูตรที่สำคัญที่สุดของ Transformer และใบ้ด้วยว่ามันเคยออกข้อสอบ midterm มาก่อน[2]
จุดที่ต้องเข้าใจคือการหารด้วยรากที่สองของมิติ key เพราะถ้าไม่หาร ค่าที่ได้จะแปรปรวนเกินไปตามขนาดมิติ ทำให้การกระจายน้ำหนักไม่ดี[2]
ส่วนประกอบที่เหลือในสถาปัตยกรรม
คอร์สไล่องค์ประกอบที่เหลือของ Transformer ต่อ โดยเริ่มจาก position embedding ที่บวกเข้าไปกับ embedding ของโทเคน เพื่อให้โมเดลรู้ว่าคำไหนอยู่ตำแหน่งไหน[2]
ผู้สอนอธิบายว่าการแทนตำแหน่งมีสองแนวทาง คือเรียนรู้จากข้อมูล กับใช้ฟังก์ชันคณิตศาสตร์อย่างไซน์และโคไซน์ที่ความถี่ต่างกัน
แนวทางหลังมีคุณสมบัติที่ดีคือ ตำแหน่งที่ใกล้กันจะได้ค่าใกล้กัน และไม่มีข้อจำกัดเรื่องความยาวข้อความเหมือนแบบที่เรียนรู้[2]
ผู้สอนเปรียบเทียบให้เห็นภาพว่ามันเหมือนเข็มนาฬิกาที่หมุนด้วยความถี่ต่างกัน ทั้งชั่วโมง นาที และวินาที เมื่อรวมกันแล้วเรารู้เวลาได้แม่น[2]
ส่วนประกอบอื่นที่คอร์สพูดถึง ได้แก่ encoder ที่สร้าง representation ของข้อความต้นทาง, decoder ที่สร้างข้อความปลายทางทีละโทเคน, residual connection ที่ช่วยให้โมเดลลึก ๆ เรียนรู้ได้ดีขึ้น, layer normalization ที่ช่วยให้ลู่เข้าเร็วขึ้น, การปิดบังบางการเชื่อมต่อใน decoder เพื่อไม่ให้โมเดลแอบเห็นคำที่ยังไม่ควรเห็น, multi-head attention ที่ทำการเทียบนี้พร้อมกันแปดชุดย่อย โดยแต่ละชุดมี Q/K/V ของตัวเอง เพื่อให้โมเดลมองได้หลายมุม และเทคนิคอย่าง dropout ที่กันไม่ให้โมเดลพึ่งพาฟีเจอร์ใดฟีเจอร์หนึ่งมากเกินไป กับ label smoothing ที่ลดความมั่นใจเกินของคำตอบ ทั้งคู่ช่วยให้โมเดลทำงานกับข้อมูลใหม่ได้ดีขึ้น[2]
จุดที่ผู้สอนเน้นเป็นพิเศษคือ feed forward network เพราะที่นั่นเก็บพารามิเตอร์ส่วนใหญ่ของโมเดลไว้ ถ้าถามว่าความจุของโมเดลอยู่ตรงไหน คำตอบคือตรงนั้น[2]
Syllabus ที่บอกอนาคตมากกว่าเนื้อหา
ส่วนที่ผมคิดว่ามีค่าที่สุดของคอร์สนี้ ไม่ใช่คาบแรก แต่คือรายชื่อหัวข้อทั้งเก้าคาบบนหน้า syllabus[4]
เพราะมันเรียงลำดับสิ่งที่วงการ AI กำลังให้ความสำคัญในปี 2026 เอาไว้ตรง ๆ
- คาบ 2: โมเดลภาษา ครอบคลุม Mixture of Experts, ความต่างของ MHA กับ MQA และ GQA, position embedding แบบ RoPE, ความยาวบริบท, อุณหภูมิ และกลยุทธ์การสุ่มคำ
- คาบ 3: การฝึกโมเดล ตั้งแต่ pretraining, การสอนแบบมีผู้สอน, LoRA, การปรับด้วยความชอบของมนุษย์, การใช้เหตุผล และ on-policy distillation
- คาบ 4: การเรียนรู้แบบเสริมกำลัง ครอบคลุมการออกแบบรางวัล, policy gradient, PPO, GRPO และ on-policy distillation อีกครั้ง
- คาบ 5: ระบบของ LLM ครอบคลุมการฝึกแบบกระจาย, การเพิ่มประสิทธิภาพการอนุมาน, KV caching, speculative decoding, Flash Attention และการแลกเปลี่ยนของฮาร์ดแวร์
- คาบ 6: เอเจนต์ AI ครอบคลุมการเรียกใช้เครื่องมือ, MCP, หน่วยความจำ, การค้นคืน, การย่อบริบท, การปรับ harness, coding agent รวมถึง skills และ plugins
- คาบ 7: การประเมิน LLM ครอบคลุมการให้ AI เป็นผู้ตัดสิน, อคติและกับดัก, การประเมินเอเจนต์ และ benchmark
- คาบ 8: Diffusion LLM ครอบคลุมการแพร่แบบต่อเนื่อง แบบไม่ต่อเนื่อง และแบบปิดบัง
- คาบ 9: หัวข้อมาแรง ปิดท้ายด้วยมุมมองหลายรูปแบบ
ถ้าอ่านรายการนี้ดี ๆ จะเห็นว่าครึ่งหลังของคอร์สไม่ได้พูดเรื่องทฤษฎีอย่างเดียว แต่พูดถึงสิ่งที่คนทำงานจริงกำลังเจออยู่ทุกวัน
คำว่า context compaction กับ harness optimization ในคาบ 6 ผมมองว่าไม่ใช่ศัพท์วิชาการ แต่เป็นปัญหาที่คนใช้เอเจนต์เจอจริงเวลาบทสนทนายาวขึ้นเรื่อย ๆ
ในรายชื่อหัวข้อของคาบ 6 มีทั้ง Context compaction และ Harness optimization อยู่ตรง ๆ[4]
Cheat sheet แปลไทยแล้วด้วย
คอร์สนี้มีเอกสารสรุปที่เรียกว่า cheat sheet ซึ่งผู้สอนบอกว่าเพิ่งอัปเดตเมื่อไม่กี่สัปดาห์ก่อน และตั้งใจให้ทันสมัยที่สุด เพื่อใช้ทบทวนก่อนสอบ[2]
จุดที่น่าสนใจคือมันถูกแปลเป็นหลายภาษา และในคลิปผู้สอนบอกว่าตอนนี้มีราว 15 ภาษา รวมภาษาอังกฤษ[2] ตัวเอกสารรุ่นล่าสุดเปิดให้ดาวน์โหลดได้จากหน้า cheatsheet ของคอร์สโดยตรง[9]
ถ้าเข้าไปดูในที่เก็บโค้ดของคอร์ส จะเห็นโฟลเดอร์แยกตามรหัสภาษา และมีโฟลเดอร์ th ซึ่งเป็นเวอร์ชันภาษาไทยอยู่จริง มีไฟล์ชื่อ cheatsheet-transformers-large-language-models.pdf[6][7]
ส่วนตำราเรียนของคอร์สมีชื่อว่า Super Study Guide: Transformers & Large Language Models ซึ่งหอสมุด Stanford มีให้ยืม และมีขายออนไลน์ด้วย[1][8]
ถ้าจะเริ่ม ควรเริ่มยังไง
คอร์สนี้บอกไว้เองว่าผู้เรียนที่เหมาะไม่จำเป็นต้องเป็นนักวิจัย
ผู้สอนระบุกลุ่มเป้าหมายกว้าง ๆ สามกลุ่ม คือคนที่อยากเป็นนักวิจัยและต้องการเห็นเทคนิคที่ใช้จริง กลุ่มที่อยากทำโปรเจกต์ส่วนตัวและควรรู้ว่าตัวช่วยเขียนโค้ดทำอะไรได้กับทำอะไรไม่ได้ และกลุ่มสุดท้ายคือคนทำงานตำแหน่งใดก็ตามที่ต้องมีความรู้เรื่อง AI เพราะผู้สอนมองว่าการเข้าใจเครื่องมือเหล่านี้กำลังกลายเป็นเรื่องจำเป็น[2]
ก่อนเข้าเรียนควรมีพื้นฐานพีชคณิตเชิงเส้น เช่นรู้จักเมทริกซ์และการคูณเมทริกซ์ กับพื้นฐานแมชชีนเลิร์นนิง เช่นรู้จักฟังก์ชันสูญเสีย โครงข่ายประสาท และ embedding[2]
ถ้าพื้นฐานยังไม่แน่น ผู้สอนก็บอกว่าคอร์สจะอธิบายเรื่อง embedding ให้อยู่แล้ว แค่มีพื้นฐานมาก่อนจะช่วยให้ตามทันง่ายขึ้น
ในทางปฏิบัติ ผมแนะนำว่าเริ่มจากดูคาบแรกให้จบก่อน แล้วค่อยเปิด cheat sheet ประกอบ เพราะคาบแรกเป็นคาบที่แน่นที่สุดตามที่ผู้สอนยอมรับเองว่าเป็นคาบที่ยากที่สุดในแง่จำนวนแนวคิด[2]
หลังจากนั้นค่อยเลือกว่าจะดูคาบไหนต่อตามความสนใจ ถ้าอยากเข้าใจว่าทำไมแชตบอตตอบแปลก ๆ ให้ดูคาบ 2 ถ้าสนใจว่าจะทำให้โมเดลเก่งขึ้นทำยังไง ให้ดูคาบ 3 และ 4 ถ้าอยากเข้าใจว่าทำไมรันโมเดลใหญ่ ๆ ได้บนเครื่องเล็ก ไปคาบ 5
และถ้าสนใจเรื่องเอเจนต์โดยตรง คาบ 6 คือคาบที่ควรจับตาไว้
ทั้งหมดนี้ฟรี ไม่ต้องสมัคร ไม่ต้องใช้บัตรเครดิต เปิดดูได้เลยจากบ้านหรือที่ไหนก็ได้
แล้วคุณล่ะ
คำถามที่ผมอยากฝากไว้คือ เวลาคุณใช้ AI ช่วยทำงาน คุณอยากเข้าใจมันลึกแค่ไหน
แค่ใช้เป็น กับเข้าใจว่ามันทำอะไรอยู่ข้างใน สองอย่างนี้ให้ผลต่างกันมากเวลางานมีปัญหา
ถ้าคุณเคยดูคอร์สนี้ หรือมีคอร์สอื่นที่ช่วยให้เข้าใจ LLM ได้ดี เล่าให้ฟังได้ว่าตัวไหนคุ้มค่าที่สุด
แหล่งอ้างอิง
[1] Stanford University, "CME 295 - Transformers & Large Language Models", cme295.stanford.edu, 2026. https://cme295.stanford.edu/
[2] Afshine Amidi และ Shervine Amidi, "Stanford CME295 Transformers & LLMs | Autumn 2026 | Lecture 1 - Transformers", Stanford Online (YouTube), 28 กันยายน 2026. https://www.youtube.com/watch?v=114i2Kz-LZA
[3] Stanford University, "CME 295 Course staff", cme295.stanford.edu, 2026. https://cme295.stanford.edu/#course-staff
[4] Stanford University, "Syllabus", cme295.stanford.edu, 2026. https://cme295.stanford.edu/syllabus/
[5] Ashish Vaswani และคณะ, "Attention Is All You Need", arXiv, 2017. https://arxiv.org/abs/1706.03762
[6] Afshine Amidi และ Shervine Amidi, "stanford-cme-295-transformers-large-language-models", GitHub, 2026. https://github.com/afshinea/stanford-cme-295-transformers-large-language-models
[7] Afshine Amidi และ Shervine Amidi, "สรุปเนื้อหาเรื่องตัวแปลงและแบบจำลองภาษาขนาดใหญ่ สำหรับรายวิชา CME 295 ม.สแตนฟอร์ด", GitHub (โฟลเดอร์ th), 2025. https://github.com/afshinea/stanford-cme-295-transformers-large-language-models/tree/main/th
[8] Afshine Amidi และ Shervine Amidi, "Super Study Guide: Transformers & Large Language Models", superstudy.guide, 2024. https://superstudy.guide/transformers-large-language-models/
[9] Stanford University, "Cheatsheet", cme295.stanford.edu, 2026. https://cme295.stanford.edu/cheatsheet