productize.blog
AI · Benchmark

AI Update Bangkok 2026 ตอนที่ 2

ฟังพี่หมอจิมพูดสองช่วงรวมกว่า 2 ชั่วโมง เรื่องที่พูดไล่ตั้งแต่เครื่อง โมเดล การฝึก ไปจนถึงว่าเงินอยู่ชั้นไหน แต่พอถอยออกมามอง ทุกช่วงกำลังสอนเรื่องเดียวกัน

Yim· เขียนด้วยกันกับ Dobby (AI Oracle)/22 ส.ค. 2026

เคยอ่านข่าวเปิดตัวโมเดลแล้วรู้สึกไหมว่าทุกเจ้าชนะหมด ทั้งที่แข่งกันอยู่

ทุกตารางมีแถวที่ตัวเองเป็นสีเข้ม ทุกกราฟมีเส้นของตัวเองอยู่บนสุด แล้วพอเอามาใช้จริง ตัวใหม่ก็ไม่ได้ต่างจากตัวที่ใช้อยู่เท่าไหร่

ต่อจาก ตอนที่ 1 ที่ว่าด้วย Physical AI งาน AI Update Bangkok 2026 มีอีกสองช่วงที่เป็นคิวของพี่หมอจิม (Jimmy Tejasen) เจ้าของงาน รวมกันกว่า 2 ชั่วโมง ไล่ตั้งแต่เครื่อง โมเดล การฝึก ไปจนถึงว่าเงินในกองซ้อนของ AI อยู่ชั้นไหน

ตอนฟังมันเหมือนคนละเรื่อง แต่พอกลับมาเรียงโน้ต ทุกช่วงกำลังสอนเรื่องเดียวกัน คือเลขที่เขาประกาศ ไม่ใช่เลขที่เราใช้ได้จริง

Productize เขียนตอนนี้เป็นแผนที่ของทั้งสองช่วง เพื่อให้เห็นภาพก่อนว่าอะไรอยู่ตรงไหน แล้วตอนถัดๆ ไปจะลงลึกทีละส่วน

กับดักเดียวกัน ซ้ำอยู่ทุกชั้น

ถ้าจะเอากลับไปข้อเดียวจากทั้งสองช่วง เอาข้อนี้ ทุกชั้นของ AI มีเลขอยู่ 2 ตัว ตัวที่เอาไว้ประกาศ กับตัวที่เอาไว้ใช้ และไม่เคยเป็นตัวเดียวกัน

ชั้นเลขที่ประกาศเลขที่ใช้ได้จริง
เครื่องความจุที่เขียนบนกล่องความจุที่เหลือหลังหักที่ว่างให้บทสนทนา
โมเดลเปิดให้โหลดแล้วเครื่องเราไหวหรือเปล่า ซึ่งขึ้นกับพารามิเตอร์รวม
ขนาดไฟล์จำนวนพารามิเตอร์ที่ 16 บิตไฟล์ที่โหลดจริงถูกบีบมาแล้ว คนละขนาดกัน
ความเร็วtoken ต่อวินาทีในข่าวต้องบอกด้วยว่ารันบนเครื่องอะไร ด้วยชุดซอฟต์แวร์อะไร
คะแนนสอบชนะคู่แข่งชนะรุ่นไหนของคู่แข่ง และในสนามที่เราใช้หรือเปล่า
การฝึกฝึกแล้วเก่งขึ้นเก่งขึ้นเท่าไหร่เมื่อหักว่าตัวตั้งต้นก็เก่งอยู่แล้ว

พอเห็นรูปนี้แล้ว เรื่องที่ดูกระจัดกระจายในงานจะกลายเป็นเรื่องเดียว และคำถามที่ต้องถามก็เหลือคำถามเดียวคือ เลขนี้เป็นเลขไหน

แผนที่ ของทั้งสองช่วง

เนื้อหาของพี่หมอจิมแบ่งได้เป็น 4 ก้อน และเรียงจากของที่จับต้องได้ ไปหาของที่เป็นโครงสร้าง

ก้อนที่ 1 เครื่อง แบ่งเครื่องรัน AI เป็น 4 คลาสตามคำถามว่าซื้ออะไรวางตรงไหน ไม่ใช่ตามความแรง แล้วชี้ว่าความจุกับความเร็วอ่านหน่วยความจำเป็นคนละเรื่องกัน ความจุบอกว่าโมเดลใหญ่แค่ไหนถึงลงได้ ส่วนความเร็วอ่านบอกว่าตอบได้กี่ token ต่อวินาที

ก้อนที่ 2 โมเดลกับการบีบ เปิดให้โหลดไม่ได้แปลว่าเครื่องเราไหว และไฟล์ที่คนโหลดกันจริงถูกบีบมาแล้วเสมอ การบีบมีราคาที่ต้องจ่าย ซึ่งเป็นราคาที่มองไม่เห็นเพราะโมเดลยังตอบได้ทุกคำถามเหมือนเดิม

ก้อนที่ 3 การฝึก แยกให้ขาดว่าอะไรคือการสร้างความฉลาด อะไรคือการปรับพฤติกรรม แล้วบอกตรงๆ ว่าส่วนใหญ่ไม่คุ้มที่จะฝึกเอง เพราะตัวตั้งต้นเก่งอยู่แล้ว

ก้อนที่ 4 เงินอยู่ชั้นไหน ตัวโมเดลกำลังถูกทำให้เป็นของโหลๆ ที่แข่งกันลดราคา ส่วนชั้นที่เก็บเงินได้จริงขยับไปอยู่ที่ท่อกับตัวที่ครอบโมเดลอีกที

สังเกตว่าทั้ง 4 ก้อนไม่มีก้อนไหนตอบว่า ซื้อรุ่นไหนดี เลย ทุกก้อนตอบว่า จะรู้ได้ยังไงว่าเลขที่เห็นแปลว่าอะไร นั่นคือของที่เอากลับบ้านได้จริง เพราะรุ่นเปลี่ยนทุกไตรมาส แต่วิธีอ่านไม่เปลี่ยน

อ่าน benchmark ด้วย 4 คำถาม

ท่อนที่พี่หมอจิมลงรายละเอียดที่สุดคือท่อนนี้ เพราะเป็นที่ที่คนโดนหลอกบ่อยที่สุด และเริ่มจากเรื่องที่ฟังแล้วสะดุด

ไม้บรรทัดที่วงการใช้มี 2 อัน และวัดคนละมิติ อันหนึ่งวัดความฉลาดรวม อีกอันวัดงานที่ AI ต้องลงมือทำเองและงานความปลอดภัย ตัวที่นำในไม้บรรทัดแรกได้ 63 คะแนน ส่วนตัวที่นำในไม้บรรทัดที่สองได้ 83 คะแนน สองเลขนี้เอามาเทียบกันตรงๆ ไม่ได้ เพราะไม่ได้วัดของอย่างเดียวกัน

แล้วพี่หมอจิมก็ไล่กับดักที่เจอบ่อย 3 อย่าง

จากนั้นเป็นเช็กลิสต์ 4 ข้อก่อนเชื่อตัวเลขไหนก็ตาม

คำถามที่ต้องดู
ใครวัดเจ้าของโมเดลเอง หรือคนกลาง
เวอร์ชันไหนโมเดลตัวเดียวกันจริง หรือคนละรุ่น
โหมดอะไรเปิดโหมดคิดหนักไหม ให้เรียกเครื่องมือได้ไหม
เงื่อนไขเดียวกันไหมชุดรัน คำสั่ง และวิธีให้คะแนน เท่ากันหรือเปล่า

เคสที่พี่หมอจิมยกให้ดูคือ Qwen 3.8-27B โมเดลเปิดน้ำหนักที่กำลังร้อน ประกาศว่าชนะคู่แข่งฝั่งปิด 3 สนามรวด สนามเขียนโค้ด SWE-bench Pro ได้ 61.7 ต่อ 53.4 สนามใช้คอมพิวเตอร์เอง OSWorld-Verified ได้ 84.3 ต่อ 72.7 และสนามใช้มือถือเอง AndroidWorld ได้ 81.9 ต่อ 62.0

ชนะจริงทั้ง 3 สนาม แต่ตอนที่เล่าบนเวที เขากำกับไว้เองว่า ตัวที่เอาไปเทียบคือ Claude Opus 4.6 Max ซึ่งเป็นรุ่นรอง ไม่ใช่ Opus 5 ที่วางขายอยู่ ชนะรุ่นก่อนกับชนะรุ่นที่วางขายอยู่ตอนนี้ เป็นคนละเรื่อง และสไลด์อีกใบยังเตือนไว้ด้วยว่าข่าวที่พาดหัวว่า Qwen ชนะ Opus มักไม่บอกว่ารุ่นไหน

คำถามข้อสุดท้ายคือเก่งขึ้นด้านไหน และตรงนี้เป็นจุดที่เราว่าคมที่สุดในทั้งช่วง เทียบกับรุ่นก่อนของตัวเอง โมเดลตัวนี้ขยับขึ้นแรงมากในงานที่ต้องลงมือทำเองและงานอ่านภาพ บวกขึ้นตั้งแต่ 20.4 ถึง 56.7 คะแนนแล้วแต่สนาม แต่ด้านความรู้และการให้เหตุผลแทบไม่ขยับ ด้านนี้วัดด้วยสองสนาม คือ GPQA กับ HLE และสไลด์ระบุว่ายังแพ้ Opus 4.6 Max อยู่ทั้งคู่ GPQA ได้ 89.2 ขยับจาก 87.8 ของรุ่นก่อนแค่ 1.4 ส่วน HLE ได้ 30.8 ซึ่งสไลด์จัดไว้ในกลุ่มยังตาม ตารางที่ประกาศออกไปโชว์เฉพาะสามสนามที่ชนะเท่านั้น

สรุปของเขาคือโมเดลตัวนี้ไม่ได้ฉลาดขึ้น แต่ทำงานเองได้และมองเห็นภาพ

และตรงนั้นเขาบอกไว้ครบทั้งสองด้าน คือตัวนี้ ชนะรุ่นรองของคู่แข่งในสายทำงานเองกับสายอ่านภาพ แต่แพ้ในสายให้เหตุผล ตารางที่ประกาศออกไปโชว์แต่ด้านที่ชนะ

อัปเกรดโดยไม่ได้ทดสอบด้านที่ตัวเองใช้จริง อาจได้อะไรกลับมาเท่ากับศูนย์ ถ้างานเราคือให้เหตุผลกับความรู้ล้วน ตัวเลขชุดนี้ไม่ได้แปลว่าอะไรเลย

มีข้อสังเกตพ่วงอีกข้อที่เขาจำกัดขอบเขตไว้เองว่าใช้กับข่าวจากฝั่งจีน คือเวลาประกาศความเร็ว ให้ถามด้วยว่ารันบนเครื่องอะไร เพราะส่วนใหญ่ไม่บอก และอาจเป็นการกระจายงานข้ามหลายเครื่อง

แล้วอะไร คือเลขที่เชื่อได้

คำตอบของพี่หมอจิมสั้นและซ้ำอยู่หลายช่วงจนกลายเป็นแกน เลขที่เชื่อได้คือเลขที่เราวัดเองกับงานของเราเอง

พี่หมอจิมไม่ได้พูดคำนี้ในฐานะอุดมคติ แต่พูดในฐานะเงื่อนไข ตอนพูดถึงการบีบโมเดล เขาบอกว่าบีบได้ต่อเมื่อมีชุดวัดผลอยู่ก่อนแล้ว ตอนพูดถึงการฝึก เขาบอกว่าจะฝึกได้ต้องมีชุดวัดผลก่อนเหมือนกัน สองเรื่องนี้อยู่คนละช่วงของวัน แต่เงื่อนไขเดียวกัน

เหตุผลตรงไปตรงมา และเป็นเส้นที่ Productize ยึดกับงานตัวเองเหมือนกัน ชุดข้อสอบมาตรฐานวัดสิ่งที่คนทั่วโลกสนใจ ส่วนงานของเราคืองานของเรา โมเดลที่ได้คะแนนสูงในสนามที่เราไม่ได้ลงแข่ง ไม่ได้แปลว่าอะไรกับเราเลย

อ่านตอนไหนต่อ

ตอนนี้เป็นแผนที่ ส่วนตอนถัดไปลงลึกทีละก้อน

ที่มา

เนื้อหาทั้งหมดมาจากงาน AI Update Bangkok 2026 ที่พี่หมอจิม (Jimmy Tejasen) จัดขึ้นวันที่ 21 สิงหาคม 2026 ที่ The Cloud Bangkok ตอนนี้สรุปจากสองช่วงที่เขาขึ้นพูดเอง

ตัวเลขในบทความนี้มาจากที่พี่หมอจิมเล่าบนเวที ไม่ใช่เอกสารสเปกของผู้ผลิต จึงใช้ดูอัตราส่วนและใช้ตั้งคำถามได้ แต่ไม่ควรเอาไปอ้างเป็นสเปกของสินค้า ส่วนของที่ขึ้นจอในงาน Productize ไม่ได้ทำสำเนามาลง

ติดตาม

รับบทความใหม่และของฟรีก่อนใคร

ทิ้งอีเมลไว้ บทความใหม่และของฟรีเป็นครั้งคราวจะส่งไปให้ ไม่สแปม

ใช้อีเมลเพื่อส่งอัปเดตเท่านั้น

ความคิดเห็น

ร่วมพูดคุย

แบ่งปันความคิดเห็นได้เลย

ชื่อจะแสดงต่อสาธารณะ อีเมลเก็บเป็นความลับ ไม่แสดงที่ไหน

กำลังโหลดความคิดเห็น…