เคยอ่านข่าวเปิดตัวโมเดลแล้วรู้สึกไหมว่าทุกเจ้าชนะหมด ทั้งที่แข่งกันอยู่
ทุกตารางมีแถวที่ตัวเองเป็นสีเข้ม ทุกกราฟมีเส้นของตัวเองอยู่บนสุด แล้วพอเอามาใช้จริง ตัวใหม่ก็ไม่ได้ต่างจากตัวที่ใช้อยู่เท่าไหร่
ต่อจาก ตอนที่ 1 ที่ว่าด้วย Physical AI งาน AI Update Bangkok 2026 มีอีกสองช่วงที่เป็นคิวของพี่หมอจิม (Jimmy Tejasen) เจ้าของงาน รวมกันกว่า 2 ชั่วโมง ไล่ตั้งแต่เครื่อง โมเดล การฝึก ไปจนถึงว่าเงินในกองซ้อนของ AI อยู่ชั้นไหน
ตอนฟังมันเหมือนคนละเรื่อง แต่พอกลับมาเรียงโน้ต ทุกช่วงกำลังสอนเรื่องเดียวกัน คือเลขที่เขาประกาศ ไม่ใช่เลขที่เราใช้ได้จริง
Productize เขียนตอนนี้เป็นแผนที่ของทั้งสองช่วง เพื่อให้เห็นภาพก่อนว่าอะไรอยู่ตรงไหน แล้วตอนถัดๆ ไปจะลงลึกทีละส่วน
กับดักเดียวกัน ซ้ำอยู่ทุกชั้น
ถ้าจะเอากลับไปข้อเดียวจากทั้งสองช่วง เอาข้อนี้ ทุกชั้นของ AI มีเลขอยู่ 2 ตัว ตัวที่เอาไว้ประกาศ กับตัวที่เอาไว้ใช้ และไม่เคยเป็นตัวเดียวกัน
| ชั้น | เลขที่ประกาศ | เลขที่ใช้ได้จริง |
|---|---|---|
| เครื่อง | ความจุที่เขียนบนกล่อง | ความจุที่เหลือหลังหักที่ว่างให้บทสนทนา |
| โมเดล | เปิดให้โหลดแล้ว | เครื่องเราไหวหรือเปล่า ซึ่งขึ้นกับพารามิเตอร์รวม |
| ขนาดไฟล์ | จำนวนพารามิเตอร์ที่ 16 บิต | ไฟล์ที่โหลดจริงถูกบีบมาแล้ว คนละขนาดกัน |
| ความเร็ว | token ต่อวินาทีในข่าว | ต้องบอกด้วยว่ารันบนเครื่องอะไร ด้วยชุดซอฟต์แวร์อะไร |
| คะแนนสอบ | ชนะคู่แข่ง | ชนะรุ่นไหนของคู่แข่ง และในสนามที่เราใช้หรือเปล่า |
| การฝึก | ฝึกแล้วเก่งขึ้น | เก่งขึ้นเท่าไหร่เมื่อหักว่าตัวตั้งต้นก็เก่งอยู่แล้ว |
พอเห็นรูปนี้แล้ว เรื่องที่ดูกระจัดกระจายในงานจะกลายเป็นเรื่องเดียว และคำถามที่ต้องถามก็เหลือคำถามเดียวคือ เลขนี้เป็นเลขไหน
แผนที่ ของทั้งสองช่วง
เนื้อหาของพี่หมอจิมแบ่งได้เป็น 4 ก้อน และเรียงจากของที่จับต้องได้ ไปหาของที่เป็นโครงสร้าง
ก้อนที่ 1 เครื่อง แบ่งเครื่องรัน AI เป็น 4 คลาสตามคำถามว่าซื้ออะไรวางตรงไหน ไม่ใช่ตามความแรง แล้วชี้ว่าความจุกับความเร็วอ่านหน่วยความจำเป็นคนละเรื่องกัน ความจุบอกว่าโมเดลใหญ่แค่ไหนถึงลงได้ ส่วนความเร็วอ่านบอกว่าตอบได้กี่ token ต่อวินาที
ก้อนที่ 2 โมเดลกับการบีบ เปิดให้โหลดไม่ได้แปลว่าเครื่องเราไหว และไฟล์ที่คนโหลดกันจริงถูกบีบมาแล้วเสมอ การบีบมีราคาที่ต้องจ่าย ซึ่งเป็นราคาที่มองไม่เห็นเพราะโมเดลยังตอบได้ทุกคำถามเหมือนเดิม
ก้อนที่ 3 การฝึก แยกให้ขาดว่าอะไรคือการสร้างความฉลาด อะไรคือการปรับพฤติกรรม แล้วบอกตรงๆ ว่าส่วนใหญ่ไม่คุ้มที่จะฝึกเอง เพราะตัวตั้งต้นเก่งอยู่แล้ว
ก้อนที่ 4 เงินอยู่ชั้นไหน ตัวโมเดลกำลังถูกทำให้เป็นของโหลๆ ที่แข่งกันลดราคา ส่วนชั้นที่เก็บเงินได้จริงขยับไปอยู่ที่ท่อกับตัวที่ครอบโมเดลอีกที
สังเกตว่าทั้ง 4 ก้อนไม่มีก้อนไหนตอบว่า ซื้อรุ่นไหนดี เลย ทุกก้อนตอบว่า จะรู้ได้ยังไงว่าเลขที่เห็นแปลว่าอะไร นั่นคือของที่เอากลับบ้านได้จริง เพราะรุ่นเปลี่ยนทุกไตรมาส แต่วิธีอ่านไม่เปลี่ยน
อ่าน benchmark ด้วย 4 คำถาม
ท่อนที่พี่หมอจิมลงรายละเอียดที่สุดคือท่อนนี้ เพราะเป็นที่ที่คนโดนหลอกบ่อยที่สุด และเริ่มจากเรื่องที่ฟังแล้วสะดุด
ไม้บรรทัดที่วงการใช้มี 2 อัน และวัดคนละมิติ อันหนึ่งวัดความฉลาดรวม อีกอันวัดงานที่ AI ต้องลงมือทำเองและงานความปลอดภัย ตัวที่นำในไม้บรรทัดแรกได้ 63 คะแนน ส่วนตัวที่นำในไม้บรรทัดที่สองได้ 83 คะแนน สองเลขนี้เอามาเทียบกันตรงๆ ไม่ได้ เพราะไม่ได้วัดของอย่างเดียวกัน
แล้วพี่หมอจิมก็ไล่กับดักที่เจอบ่อย 3 อย่าง
- เวอร์ชันปนกัน ชุดข้อสอบเดียวกันแต่คนละเวอร์ชัน เอาคะแนนมาเทียบตรงๆ ไม่ได้
- เจ้าของวัดเอง ไม่เท่ากับคนกลางวัด ต้องถามก่อนว่าใครเป็นคนวัด
- โหมดที่เปิดตอนวัด เปลี่ยนคะแนนได้ รุ่นเดียวกันเปิดโหมดคิดหนักกับไม่เปิด คนละคะแนน และชื่อรุ่นที่ต่อท้ายว่า Max ก็ไม่ใช่รุ่นมาตรฐาน
จากนั้นเป็นเช็กลิสต์ 4 ข้อก่อนเชื่อตัวเลขไหนก็ตาม
| คำถาม | ที่ต้องดู |
|---|---|
| ใครวัด | เจ้าของโมเดลเอง หรือคนกลาง |
| เวอร์ชันไหน | โมเดลตัวเดียวกันจริง หรือคนละรุ่น |
| โหมดอะไร | เปิดโหมดคิดหนักไหม ให้เรียกเครื่องมือได้ไหม |
| เงื่อนไขเดียวกันไหม | ชุดรัน คำสั่ง และวิธีให้คะแนน เท่ากันหรือเปล่า |
เคสที่พี่หมอจิมยกให้ดูคือ Qwen 3.8-27B โมเดลเปิดน้ำหนักที่กำลังร้อน ประกาศว่าชนะคู่แข่งฝั่งปิด 3 สนามรวด สนามเขียนโค้ด SWE-bench Pro ได้ 61.7 ต่อ 53.4 สนามใช้คอมพิวเตอร์เอง OSWorld-Verified ได้ 84.3 ต่อ 72.7 และสนามใช้มือถือเอง AndroidWorld ได้ 81.9 ต่อ 62.0
ชนะจริงทั้ง 3 สนาม แต่ตอนที่เล่าบนเวที เขากำกับไว้เองว่า ตัวที่เอาไปเทียบคือ Claude Opus 4.6 Max ซึ่งเป็นรุ่นรอง ไม่ใช่ Opus 5 ที่วางขายอยู่ ชนะรุ่นก่อนกับชนะรุ่นที่วางขายอยู่ตอนนี้ เป็นคนละเรื่อง และสไลด์อีกใบยังเตือนไว้ด้วยว่าข่าวที่พาดหัวว่า Qwen ชนะ Opus มักไม่บอกว่ารุ่นไหน
คำถามข้อสุดท้ายคือเก่งขึ้นด้านไหน และตรงนี้เป็นจุดที่เราว่าคมที่สุดในทั้งช่วง เทียบกับรุ่นก่อนของตัวเอง โมเดลตัวนี้ขยับขึ้นแรงมากในงานที่ต้องลงมือทำเองและงานอ่านภาพ บวกขึ้นตั้งแต่ 20.4 ถึง 56.7 คะแนนแล้วแต่สนาม แต่ด้านความรู้และการให้เหตุผลแทบไม่ขยับ ด้านนี้วัดด้วยสองสนาม คือ GPQA กับ HLE และสไลด์ระบุว่ายังแพ้ Opus 4.6 Max อยู่ทั้งคู่ GPQA ได้ 89.2 ขยับจาก 87.8 ของรุ่นก่อนแค่ 1.4 ส่วน HLE ได้ 30.8 ซึ่งสไลด์จัดไว้ในกลุ่มยังตาม ตารางที่ประกาศออกไปโชว์เฉพาะสามสนามที่ชนะเท่านั้น
สรุปของเขาคือโมเดลตัวนี้ไม่ได้ฉลาดขึ้น แต่ทำงานเองได้และมองเห็นภาพ
และตรงนั้นเขาบอกไว้ครบทั้งสองด้าน คือตัวนี้ ชนะรุ่นรองของคู่แข่งในสายทำงานเองกับสายอ่านภาพ แต่แพ้ในสายให้เหตุผล ตารางที่ประกาศออกไปโชว์แต่ด้านที่ชนะ
อัปเกรดโดยไม่ได้ทดสอบด้านที่ตัวเองใช้จริง อาจได้อะไรกลับมาเท่ากับศูนย์ ถ้างานเราคือให้เหตุผลกับความรู้ล้วน ตัวเลขชุดนี้ไม่ได้แปลว่าอะไรเลย
มีข้อสังเกตพ่วงอีกข้อที่เขาจำกัดขอบเขตไว้เองว่าใช้กับข่าวจากฝั่งจีน คือเวลาประกาศความเร็ว ให้ถามด้วยว่ารันบนเครื่องอะไร เพราะส่วนใหญ่ไม่บอก และอาจเป็นการกระจายงานข้ามหลายเครื่อง
แล้วอะไร คือเลขที่เชื่อได้
คำตอบของพี่หมอจิมสั้นและซ้ำอยู่หลายช่วงจนกลายเป็นแกน เลขที่เชื่อได้คือเลขที่เราวัดเองกับงานของเราเอง
พี่หมอจิมไม่ได้พูดคำนี้ในฐานะอุดมคติ แต่พูดในฐานะเงื่อนไข ตอนพูดถึงการบีบโมเดล เขาบอกว่าบีบได้ต่อเมื่อมีชุดวัดผลอยู่ก่อนแล้ว ตอนพูดถึงการฝึก เขาบอกว่าจะฝึกได้ต้องมีชุดวัดผลก่อนเหมือนกัน สองเรื่องนี้อยู่คนละช่วงของวัน แต่เงื่อนไขเดียวกัน
เหตุผลตรงไปตรงมา และเป็นเส้นที่ Productize ยึดกับงานตัวเองเหมือนกัน ชุดข้อสอบมาตรฐานวัดสิ่งที่คนทั่วโลกสนใจ ส่วนงานของเราคืองานของเรา โมเดลที่ได้คะแนนสูงในสนามที่เราไม่ได้ลงแข่ง ไม่ได้แปลว่าอะไรกับเราเลย
อ่านตอนไหนต่อ
ตอนนี้เป็นแผนที่ ส่วนตอนถัดไปลงลึกทีละก้อน
- ตอนที่ 3 เครื่องกับตัวเลขที่ต้องแยกให้ขาด และราคาที่ต้องจ่ายเวลาบีบโมเดลให้เล็กลง
- ตอนที่ 4 การฝึกโมเดล แยกว่าอะไรคือสร้างความฉลาด อะไรคือปรับพฤติกรรม และเส้นที่บอกว่าเมื่อไหร่ถึงคุ้ม
- ตอนที่ 5 เงินในกองซ้อนของ AI อยู่ชั้นไหน และทำไมตัวที่ครอบโมเดลถึงกลายเป็นชั้นที่มีอำนาจ
ที่มา
เนื้อหาทั้งหมดมาจากงาน AI Update Bangkok 2026 ที่พี่หมอจิม (Jimmy Tejasen) จัดขึ้นวันที่ 21 สิงหาคม 2026 ที่ The Cloud Bangkok ตอนนี้สรุปจากสองช่วงที่เขาขึ้นพูดเอง
- บันทึกถ่ายทอดสดของงาน: ดูย้อนหลัง
- งานของ Jimmy Tejasen: aiserver.in.th เว็บข่าวและรีวิวฮาร์ดแวร์เซิร์ฟเวอร์ AI และ agentic-press.com สำนักพิมพ์หนังสือสาย AI
ตัวเลขในบทความนี้มาจากที่พี่หมอจิมเล่าบนเวที ไม่ใช่เอกสารสเปกของผู้ผลิต จึงใช้ดูอัตราส่วนและใช้ตั้งคำถามได้ แต่ไม่ควรเอาไปอ้างเป็นสเปกของสินค้า ส่วนของที่ขึ้นจอในงาน Productize ไม่ได้ทำสำเนามาลง