บล็อกหรือคลังเอกสารที่เปิดมาสักสองสามปีมักเป็นแบบนี้ แท็กเริ่มจากสิบกว่าอัน ใครเขียนบทความก็ตั้งแท็กใหม่ตามใจตอนนั้น บทความเรื่องเดียวกันมีแท็ก ai AI ปัญญาประดิษฐ์ คนละอันกัน พอคนอ่านกดแท็กแล้วได้บทความแค่ 2 ชิ้น ทั้งที่ในคลังมีเรื่องนี้อยู่อีกเป็นสิบ แท็กก็เลิกทำหน้าที่ของมันไปเงียบๆ
แล้วก็อาจจะคิดขึ้นมาว่า "ให้ AI ติดแท็กให้ใหม่หมดไม่ได้เหรอ ส่งรายการแท็กให้มันก็จบ"
โจทย์นี้คือการเลือกว่าบทความแต่ละชิ้นควรอยู่หมวดไหน ได้แท็กอะไร จากรายการที่มีอยู่แล้ว และ decision model ซึ่งเป็น AI แบบที่เราลองกับภาษีหัก ณ ที่จ่ายในตอนที่ 1 ก็ทำมาสำหรับงานเลือกจากรายการแบบนี้โดยตรง เราเลยลองให้มันทำ auto-tagging หรือติดหมวดและแท็กให้อัตโนมัติ กับบทความบนบล็อกของเราเอง
Productize ทดลองใช้ decision model ทำ auto-tagging กับบล็อกของเราเองทั้ง 127 บทความ งานจัดเอกสารบัญชีเข้าหมวดก็เป็นโจทย์หน้าตาเดียวกัน คือมีรายการหมวดอยู่แล้ว แล้วอยากให้เครื่องหยิบของใส่ช่องให้ถูก
ช่วงที่ 1Decision model คืออะไร และทำไมเข้ากับ auto-tagging?
Decision model คือ AI ที่ไม่ตอบเป็นประโยค แต่ให้คะแนนทุกตัวเลือกที่เราส่งไป เราส่งของเข้าไปทีละชิ้นพร้อมคำถามแบบเลือกตอบ ตัวเลือกกำหนดไว้ตายตัว สิ่งที่ได้กลับมามีแค่คะแนนของแต่ละตัวเลือก ไม่มีข้อความอื่น ถ้าคำถามให้เลือกได้ข้อเดียว คะแนนของทุกตัวเลือกรวมกันได้ 1 พอดี ตัวที่ได้สูงสุดคือคำตอบ และคะแนนนั้นก็บอกว่ามันมั่นใจแค่ไหน ถ้าเป็นคำถามใช่หรือไม่ใช่ แต่ละคำถามก็ได้คะแนน "ใช่" ของตัวเองกลับมา
รูปแบบนี้เข้ากับงานติดแท็กพอดี รายการหมวดและแท็กที่มีอยู่แล้ว ส่งเข้าไปเป็นตัวเลือกได้เลย แต่ละอันแนบคำอธิบายสั้นๆ ว่าครอบคลุมเรื่องอะไร และคำอธิบายนั้นก็คือเกณฑ์ที่โมเดลใช้ตัดสิน รายการคือตัวเลือก คำอธิบายคือเกณฑ์ โมเดลจึงตอบนอกรายการไม่ได้ ไม่มีแท็กใหม่โผล่มาเอง
ดูตัวอย่างจากบล็อกของเรา บทความเรื่องค่าใช้จ่ายของ Claude Code เราส่งชื่อเรื่อง คำอธิบายสั้น และหัวข้อย่อยเข้าไป พร้อมคำถามเลือกหมวดจาก 10 หมวด หมวดที่ได้คะแนนสูงสุดคือ "ธุรกิจ SME" ได้ 0.49 ที่เหลือกระจายไปหลายหมวด เช่น "AI agent" 0.16 "โมเดลและต้นทุน" 0.15 "Claude Code และสกิล" 0.15 อันดับหนึ่งยังไม่ถึงครึ่ง แปลว่าโมเดลยังลังเล ส่วนคำถามใช่หรือไม่ใช่ทีละแท็ก cost ได้ 0.94 claude-code ได้ 0.84 sme-business ได้ 0.73 ทั้ง 3 แท็กสูงพร้อมกันได้ เพราะไม่ต้องแบ่งคะแนนกัน ความต่างของคำถาม 2 แบบนี้ เราจะกลับมาพูดอีกหลายครั้ง
บทความนี้เป็นตอนที่ 2 ของซีรีส์ decision model ตัวที่คนพูดถึงกันตอนนี้คือ Jev ของบริษัท TypeSafe ซึ่งยังเปิดให้ผู้ใช้กลุ่มแรกลองเท่านั้น (อ้างอิง 3) เราไม่ได้ทดสอบ Jev ตัวที่ใช้จริงคือ Clef-flash ของ Cloudflare ที่คืนคะแนนแบบเดียวกัน (อ้างอิง 2)
ช่วงที่ 2ตั้งงานติดแท็กให้เป็นคำถามของ decision model
แต่ละบทความเราส่งไปถามครั้งเดียว ในครั้งนั้นมีคำถาม 2 แบบ หมวดมีคำถามเดียว ให้เลือกข้อเดียวจาก 10 หมวดของเรา แต่ละหมวดส่งไปพร้อมคำอธิบาย อย่างหมวด "โมเดลและต้นทุน" มีคำอธิบายว่า "เลือก รัน และจ่ายค่าโมเดล AI GPU hosting รันโมเดลเอง benchmark" ส่วนแท็ก ซึ่งเป็นชื่อสั้นภาษาอังกฤษ เช่น claude-code หรือ cost ถามทีละอันแบบใช่หรือไม่ใช่ ว่าบทความนี้เป็นเรื่องนี้ไหม พร้อมแนบคำอธิบายของแท็กนั้น
ข้อมูลที่ส่งมีแค่ชื่อเรื่อง คำอธิบายสั้น และหัวข้อย่อยภาษาไทย ไม่ได้ส่งเนื้อความทั้งบทความ รายการหมวดและแท็กเราก็แก้ระหว่างทดลองด้วย ตอนเริ่มมี 24 แท็ก กลางทางเปลี่ยนชื่อหมวดไป 1 หมวด แล้วหลังได้เฉลยจากคนก็แก้อีกรอบจนเป็นรายการที่ใช้อยู่ตอนนี้
เราขีดเส้นคะแนนไว้ที่ 0.7 ตั้งแต่ก่อนเริ่มวัดผล ถือว่าถึงตรงนี้โมเดลค่อนข้างแน่ใจแล้ว หมวดที่ถึงเส้น โมเดลตัดสินเอง ที่ไม่ถึงก็ส่งต่อให้ AI ผู้ตรวจ 2 ตัว คือ Codex ของ OpenAI กับ Claude Opus ของ Anthropic อ่านแยกกันโดยไม่เห็นคำตอบของกันและกัน แท็กก็ใช้เส้นเดียวกัน อันไหนได้คะแนน "ใช่" ถึง 0.7 ก็ติดอันนั้น บทความเรื่อง Claude Code ข้างบนจึงได้แท็ก 3 อัน ส่วนหมวดที่ได้แค่ 0.49 ต้องส่งต่อ
จะรู้ว่าโมเดลถูกหรือผิดก็ต้องมีคำตอบที่ถูกไว้เทียบ เราทดลอง 3 รอบ แต่ละรอบสุ่มบทความราว 20 บทความจาก 127 แล้วตัดสินไว้ก่อนว่าหมวดและแท็กที่ถูกคืออะไร ชุดนี้คือเฉลย (answer key) ใครเป็นคนทำเฉลยนั้นสำคัญกว่าที่คิด เราจึงบอกไว้ทุกครั้งที่ยกตัวเลข ก่อนรันแต่ละรอบ เราเขียนเกณฑ์ผ่านไว้ก่อนเสมอ เห็นตัวเลขแล้วจะเลื่อนเกณฑ์ไม่ได้
ที่มาของแท็กบนเว็บเราเปลี่ยนไปตามช่วงเวลา
- ตอนเขียน: คนติดแท็กให้แต่ละบทความเอง
- วันทดลอง ก่อนรอบแรก: เปลี่ยนมาใช้วิธี AI 2 ตัว คือให้ AI ผู้ตรวจ 2 ตัวติดแยกกัน แล้วเก็บเฉพาะแท็กที่ทั้งคู่เลือก
- หลังทดลอง: เปลี่ยนเป็นวิธี 3 แท็กแรกแล้วยืนยันที่ใช้อยู่ตอนนี้ รายละเอียดอยู่ในหัวข้อแท็กข้างล่าง
จากช่วงแรก เราได้คู่เทียบมาฟรีอีกตัว คือแท็กเก่าที่คนติด แปลงชื่อให้เข้ากับรายการใหม่ด้วยตารางเทียบชื่อที่ตั้งไว้ตายตัว ไม่มี AI เกี่ยว แล้ววัดแบบเดียวกับโมเดล
ช่วงที่ 3หมวด: decision model ตัดสินเองได้เมื่อมั่นใจ แต่เฉลยยังมาจาก AI
รอบแรก เฉลยหมวดมาจาก AI ผู้ตรวจ 2 ตัว เราสุ่มบทความ 20 บทความให้ทั้งคู่เลือกหมวด แล้วเก็บเฉพาะบทความที่เลือกตรงกัน ได้ 18 บทความ เฉลยชุดนี้มาจาก AI ทั้งชุด ไม่เคยเทียบกับคน เกณฑ์ที่เขียนไว้ก่อนคือ ข้อที่โมเดลตัดสินเองต้องถูกไม่ต่ำกว่า 9 ใน 10 และต้องตัดสินเองได้อย่างน้อยครึ่งหนึ่ง
ผลผ่านแบบเฉียดๆ โมเดลมั่นใจถึงเส้นครึ่งหนึ่งพอดี คือ 9 บทความ ถูกทั้ง 9 ส่วน 3 บทความที่มันเลือกหมวดผิด อยู่ในครึ่งที่ไม่ถึงเส้นทั้งหมด ถ้าใช้จริงก็จะไปถึงผู้ตรวจก่อนขึ้นเว็บ
ต่อจาก 18 บทความชุดทดสอบ เราลองกับทั้งบล็อก 127 บทความ ภาพก็ไปทางเดียวกัน ในกลุ่มที่โมเดลไม่มั่นใจ หมวดอันดับหนึ่งของมันตรงกับที่ผู้ตรวจ 2 ตัวเลือกแค่ราวครึ่งเดียว ถ้าผู้ตรวจถูก ก็แปลว่าตอนไม่มั่นใจ โมเดลผิดบ่อยจริง การส่งต่อจึงคุ้ม ส่วนกลุ่มที่มันมั่นใจ ในรอบทั้งบล็อกนี้ไม่มีเฉลยให้คิดคะแนน เพราะเฉลยมีแค่ในชุดทดสอบ
บทความเรื่องค่าใช้จ่ายของ Claude Code ที่ยกไว้ตอนต้นก็เป็นแบบนั้น หมวดอันดับหนึ่งคือ "ธุรกิจ SME" แต่ไม่ถึงเส้น ระบบก็ส่งต่อ ผู้ตรวจทั้งสองเลือกหมวดเดียวกันคือ "โมเดลและต้นทุน" ถ้าปล่อยให้โมเดลตัดสินทุกข้อ บทความนี้จะไปอยู่ผิดหมวด
ทั้งหมดข้างบนคือการทดลอง หมวดที่อยู่บนบล็อกจริง เราติดใหม่ทีหลังด้วยรายการที่ใช้อยู่ตอนนี้ ตารางข้างล่างบอกว่าหมวดของแต่ละบทความมาจากไหน ไม่มีบทความไหนที่คนเลือกหมวดเอง
ตอนติดบล็อกจริง เราให้ผู้ตรวจ 2 ตัวเลือกหมวดให้ทุกบทความด้วย ไม่ใช่แค่ข้อที่ไม่ถึงเส้น เพื่อตรวจทานอีกชั้น เลยเห็นว่ามี 3 บทความที่โมเดลมั่นใจ แต่ผู้ตรวจทั้งคู่ไม่เห็นด้วยและเลือกหมวดอื่นตรงกัน บทความพวกนี้เราใช้หมวดของผู้ตรวจ ตรวจซ้ำทั้งบล็อกแล้ว คำตอบที่มั่นใจถูกพลิกแค่ 3 บทความนี้ เป็นส่วนน้อยของกลุ่มที่มั่นใจ กระบวนการข้างล่างจึงสุ่มตรวจกลุ่มนี้แค่บางส่วน ไม่ได้ตรวจทุกข้อ ส่วนต้องสุ่มมากแค่ไหน เรายังไม่ได้วัด
| หมวดบนเว็บตอนนี้มาจากไหน | บทความ |
|---|---|
| โมเดลมั่นใจถึงเส้น ใช้ของโมเดล | 73 |
| โมเดลมั่นใจถึงเส้น แต่ผู้ตรวจทั้งคู่เลือกหมวดอื่น ใช้ของผู้ตรวจ | 3 |
| โมเดลไม่ถึงเส้น ผู้ตรวจเลือกตรงกัน | 50 |
| โมเดลไม่ถึงเส้น ผู้ตรวจเลือกต่างกัน ใช้ของตัวที่มั่นใจกว่า | 1 |
ทุกแถวในตารางยังไม่เคยวัดกับเฉลยของคน ฝั่งหมวดจึงดูใช้ได้ แต่วัดกับ AI ที่เห็นตรงกันเท่านั้น และพอมาดูฝั่งแท็ก ข้อนี้ก็สำคัญกว่าที่เราคิดไว้มาก
ช่วงที่ 4แท็ก: ลอง 3 รอบ ยังไม่ผ่านสักรอบ
แท็กต้องวัด 2 เรื่องพร้อมกัน ยกบทความเรื่องค่าใช้จ่ายของ Claude Code อีกที เฉลยมี 2 แท็ก คือ claude-code กับ cost โมเดลตอบใช่เกินเส้น 3 แท็ก คือ 2 แท็กนั้น กับ sme-business (แท็กนี้คนละอันกับหมวด "ธุรกิจ SME") ติดมา 3 ถูก 2 สัดส่วนนี้คือความแม่น (precision) ได้ 2 ใน 3 อีกอันที่ติดเกินมา เรานับเป็นแท็กที่ผิด ส่วนแท็กที่ควรมี 2 อัน หาเจอครบ สัดส่วนนี้คือความครบ (recall) ได้ 2 ใน 2 ถ้ามีแท็กที่ควรมีแต่หาไม่เจอ เรานับเป็นแท็กที่พลาด ติดเยอะ ความครบมักขึ้นแต่ความแม่นมักลง ติดน้อยก็กลับกัน
รอบแรกเราใช้ 18 บทความชุดเดิม เฉลยแท็กคือแท็กที่ AI ผู้ตรวจ 2 ตัวเลือกตรงกัน เกณฑ์คือต้องหาเจอไม่น้อยกว่าแท็กเก่าที่คนติด และแม่นไม่ต่ำกว่า 0.7 โมเดลแม่นพอที่ 0.75 แต่หาเจอแค่ 0.52 น้อยกว่าแท็กเก่าที่คนติด จึงไม่ผ่าน มันระวังตัวเกินไป พอใช้เส้น 0.7 กับทั้งบล็อก 95 จาก 127 บทความได้แท็กเดียวหรือไม่ได้เลย (ได้แท็กเดียว 70 ไม่ได้เลย 25)
รอบสองเราเลยลองวิธีรวม คือเอาแท็กที่โมเดลตอบใช่เกินเส้น บวกแท็กเก่าที่คนติดของบทความเดียวกัน สุ่มบทความชุดใหม่ 20 บทความ เฉลยยังมาจาก AI ผู้ตรวจ 2 ตัว เกณฑ์ที่เขียนไว้ก่อนรันคือความครบ 0.8 และความแม่น 0.7 เป็นระดับที่คนตามแก้ไม่มาก แท็กที่ควรมีหายไม่เกิน 1 ใน 5 วิธีรวมหาเจอ 0.63 ของแท็กในเฉลย ไม่ถึง 0.8 ที่ตั้งไว้ รอบนี้ยังเห็นอีกเรื่อง ผู้ตรวจเองก็เลือกแท็กไม่ค่อยตรงกัน นับแท็กทุกอันที่ผู้ตรวจตัวใดตัวหนึ่งติดให้บทความชุดเดียวกัน ถ้ารวมได้ 10 แท็ก จะมีแค่ราว 7 แท็กที่ทั้งคู่ติดเหมือนกัน
2 รอบแรกเฉลยมาจาก AI รอบสามเราเลยเปลี่ยนคนทำเฉลย สุ่มบทความใหม่อีก 20 บทความ แล้วให้เจ้าของบล็อกติดแท็กเองโดยไม่เห็นคำตอบของเครื่อง ตั้งใจว่าจะติดทุกเรื่องที่บทความพูดถึงจริง แต่พอลงมือก็ติดเฉพาะเรื่องหลัก ได้ 30 แท็ก เฉลี่ยบทความละ 1.5 แท็ก เกณฑ์เท่ารอบสอง แล้วเอาทุกวิธีมาเทียบกัน
นอกจากเส้น 0.7 เราลองลดเส้นของโมเดลเหลือ 0.5 ด้วย ข้อนี้ใส่ไว้ตั้งแต่ก่อนให้คะแนน เพื่อดูว่าเส้นต่ำลงช่วยไหม วิธี AI 2 ตัวที่ใช้บนเว็บตอนนั้นก็เอามาวัดด้วย ส่วนวิธี 3 แท็กแรกแล้วยืนยัน ให้โมเดลหยิบ 3 แท็กที่คะแนนสูงสุด แล้วให้ Claude Sonnet ของ Anthropic อ่านบทความเดียวกัน ตอบทีละแท็กว่าเก็บหรือทิ้ง โดยเก็บเฉพาะเรื่องหลัก วิธีนี้เรากำหนดไว้ก่อนเจ้าของบล็อกเริ่มทำเฉลย คำสั่งที่ให้ Sonnet ก็บันทึกไว้ตั้งแต่ตอนนั้น
| วิธี (เทียบกับเฉลยของคน) | จำนวนแท็กที่ติดให้ 20 บทความ (คนติด 30) | ความแม่น | ความครบ |
|---|---|---|---|
| โมเดลที่เส้น 0.7 | 28 | 0.61 | 0.57 |
| โมเดลที่เส้น 0.5 | 34 | 0.53 | 0.60 |
| วิธี AI 2 ตัว (ใช้บนเว็บตอนนั้น) | 45 | 0.47 | 0.70 |
| วิธี 3 แท็กแรกแล้วยืนยัน | 30 | 0.67 | 0.67 |
| แท็กเก่าที่คนติด (แปลงชื่อแล้ว) | 39 | 0.56 | 0.73 |
ไม่มีวิธีไหนถึงความครบ 0.8 กับความแม่น 0.7 วิธีที่สมดุลที่สุดคือ 3 แท็กแรกแล้วยืนยัน ติดมา 30 แท็กเท่าคนพอดี ถูก 20 ผิด 10 อ่านง่ายๆ คือ ถ้ามันติดให้ 3 แท็ก จะผิดราว 1 และแท็กที่ควรมี 3 อัน จะหาไม่เจอราว 1 แท็กเก่าที่คนติดหาเจอมากกว่า เพียงแต่มีแท็กเกินมาเยอะ
ช่วงที่ 5ทำไม decision model น่าจะเหมาะกับการเลือกหมวดมากกว่าติดแท็ก?
คำอธิบายที่เราคิดว่าน่าจะใช่คือ คำถามเลือกข้อเดียวบังคับให้ตัวเลือกแย่งคะแนนกัน แต่คำถามใช่หรือไม่ใช่ทีละแท็กไม่มีอะไรบอกว่าควรหยุดที่กี่อัน ข้อนี้เราไม่ได้ทดสอบ และสองฝั่งก็วัดกับเฉลยคนละชุด หมวดเทียบกับ AI ส่วนแท็กเทียบกับคน
ตอนเลือกหมวด คะแนนของ 10 หมวดต้องรวมกันได้ 1 ถ้าบทความคาบเกี่ยว 2 หมวด คะแนนก็แตกเป็น 2 ก้อน หมวดที่ชนะก็ได้คะแนนต่ำกว่าเส้นเอง เส้น 0.7 จึงคัดเรื่องที่ไม่ชัดออกไปให้ผู้ตรวจได้ คะแนนที่ต่ำในคำถามแบบนี้ก็คือสัญญาณว่าบทความนั้นกำกวม
แท็กไม่มีแรงดึงแบบนั้น แต่ละแท็กถามใช่หรือไม่ใช่แยกกัน บทความหนึ่งจึงได้ใช่สูงๆ หลายแท็กพร้อมกันได้ จำนวนแท็กต่อบทความเลยขึ้นกับเส้นที่ตั้ง ไม่ได้ขึ้นกับว่าคนจะติดกี่อัน ที่เส้น 0.7 บทความ 95 จาก 127 ได้แท็กเดียวหรือไม่ได้เลย พอลดเส้นเหลือ 0.5 ก็ติดเพิ่ม แต่ความแม่นลดลง
บทความเรื่องเช่าเครื่องแรงๆ จากบริการชื่อ Modal มารันโมเดลเองเป็นตัวอย่างที่ดี เราติดแท็กเดียวคือ local-llm (รันโมเดลเอง ไม่เรียกผ่านบริการของคนอื่น) แต่โมเดลตอบใช่เกินเส้นให้ hosting (เช่าที่รันระบบ) กับ cost แล้วให้ local-llm ไม่ถึงเส้น นับตามเฉลยก็ผิด 2 พลาด 1 แต่ถ้าอ่านชื่อเรื่องกับคำอธิบาย บทความนี้ก็พูดเรื่องงบและที่รันโมเดลจริง ไม่มีฝั่งไหนผิดชัด ต่างกันแค่ว่าจะนับเรื่องรองเป็นแท็กด้วยไหม
แม้แต่ AI ผู้ตรวจ 2 ตัวก็ติดอยู่ตรงนี้ ตอนเลือกหมวด ทั้งคู่เลือกตรงกันเกือบทุกบทความ แม้ในกลุ่มที่โมเดลไม่มั่นใจ แต่พอเป็นแท็ก ใน 10 แท็กที่ตัวใดตัวหนึ่งติด ทั้งคู่ติดเหมือนกันแค่ราว 7 อย่างที่เล่าไว้ในรอบสอง แปลว่าแท็กส่วนหนึ่งเป็นเรื่องของรสนิยม ว่าใครจะนับเรื่องรองหรือไม่ ไม่ว่าวิธีไหนก็ไม่มีทางตรงกับเฉลยของใครคนหนึ่งได้ครบทุกแท็ก
ช่วงที่ 6เฉลยที่ทำด้วยเครื่องแบบเดียวกัน วัดเครื่องไม่ได้
ตอนจบรอบสอง เราค่อนข้างวางใจวิธี AI 2 ตัวที่ใช้บนเว็บตอนนั้น AI ผู้ตรวจ 2 ตัวต้องเห็นตรงกันถึงจะติดแท็ก ฟังดูรอบคอบดี เฉลยของรอบหนึ่งและรอบสองเราก็ทำด้วยวิธีนี้
แต่เราไม่เคยวัดวิธีนี้เลย ถ้าเอาไปเทียบกับเฉลยของ 2 รอบแรก มันจะได้คะแนนเต็ม เพราะเฉลยก็มาจากมันเอง เหมือนให้นักเรียนตรวจข้อสอบตัวเองด้วยเฉลยที่ตัวเองเขียน
พอเฉลยของเจ้าของบล็อกในรอบสามมาถึง วิธีนี้ติดแท็กมา 45 อันบน 20 บทความ ตรงกับคนแค่ 21 อีก 24 อันเป็นแท็กที่คนไม่ได้ติด ความแม่นต่ำที่สุดในตาราง AI 2 ตัวเห็นตรงกันได้ แม้ในเรื่องที่คนไม่นับว่าเป็นเรื่องหลัก
ตกลงกันได้ ไม่ได้แปลว่าถูก
แล้วเราก็นึกขึ้นได้ว่า ผลฝั่งหมวดที่ดูใช้ได้ข้างบน ก็วัดด้วยเฉลยแบบเดียวกันนี้ทั้งหมด
ช่วงที่ 7รายการแท็กที่คนเขียนเองก็มีช่องโหว่
decision model เลือกได้แค่ตัวเลือกที่อยู่ในรายการ ถ้ารายการขาดเรื่องไหน มันก็ต้องหยิบตัวที่ใกล้ที่สุดมาแทน ตอนรอบสามไม่ผ่าน เราจึงสงสัยรายการแท็กของตัวเองด้วย แล้วให้ Codex ไล่ดูว่าแท็กที่ผิดและแท็กที่พลาดมาจากไหน
เจอช่องโหว่จริง บนบล็อกมีบทความชุดหนึ่งที่เราเขียนตามแผนที่ทักษะ AI ของ Andrew Ng ผู้ก่อตั้ง DeepLearning.AI ว่าคนทั่วไปต้องเรียนอะไรบ้าง แต่ในรายการไม่มีแท็กเรื่องทักษะ AI ของคนเลย แท็กที่ชื่อใกล้ที่สุดคือแท็กเรื่องสกิลของ Claude เครื่องก็เลยหยิบอันนั้นมาใช้ เรื่องวิจารณญาณของคน กับเรื่อง AI กับงานของคน ก็ไม่มีที่ลงเหมือนกัน
ฝั่งหมวดก็เคยเจอแบบนี้ ตอนรอบสอง Claude Opus สังเกตว่าไม่มีหมวดเรื่องเช่าเครื่องหรือเช่าที่รันระบบ บทความพวกนี้เลยถูกโมเดลบีบเข้าหมวด "โมเดลและต้นทุน" ด้วยความมั่นใจต่ำ เราจึงเปลี่ยนหมวด "เครื่องมือทำงาน" ระหว่างทาง เป็น "Infra และเครื่องมือ" (Infra คือเครื่องและที่ที่ใช้รันระบบ) หมวดยังมี 10 หมวดเท่าเดิม
แต่ช่องโหว่อธิบายความผิดได้แค่ส่วนน้อย ใน 10 แท็กที่วิธีสมดุลที่สุดติดผิด มีแค่ราว 1 อันที่มาจากช่องโหว่ในรายการ ที่เหลือมาจากเฉลยที่ติดเฉพาะเรื่องหลัก และบทความที่อยู่ตรงรอยต่อระหว่าง 2 แท็ก แท็กที่หาไม่เจอส่วนใหญ่ก็มีอยู่ในรายการแล้ว เครื่องแค่ไม่เลือก
หลังได้เฉลยจากคน เราแก้รายการอีกรอบจนเป็นรายการที่ใช้อยู่ตอนนี้ เพิ่มแท็กเรื่องทักษะ AI ของคน วิจารณญาณของคน AI กับงาน และการยื่นเอกสารต่อหน่วยงานรัฐ แล้วเปลี่ยนชื่อแท็กที่กำกวมให้ชัดว่าหมายถึงอะไร
หลังแก้ เราไม่ได้เอารอบสามมาคิดคะแนนใหม่ เพราะเท่ากับให้คะแนนงานซ่อมของตัวเอง เราแก้รายการหลังเห็นข้อผิดพลาดของ 20 บทความชุดนี้แล้ว ถ้าจะมีตัวเลขใหม่ ต้องสุ่มบทความชุดใหม่ และเขียนเกณฑ์ไว้ก่อนให้คนติดแท็ก
ช่วงที่ 8ก่อนเริ่มทำ ต้องคิดเรื่องอะไรบ้าง?
ข้อดีข้อเสียของตัวโมเดลอยู่ในกล่องข้างบนแล้ว ส่วนงานของคุณเอง มี 7 เรื่องในทางปฏิบัติที่ควรตอบให้ได้ก่อนลงมือ
- รายการมีกี่หมวด กี่แท็ก ใครเป็นเจ้าของ และคำอธิบายแต่ละอันเขียนว่าอะไร คำอธิบายคือเกณฑ์ที่โมเดลอ่าน ของเรามี 10 หมวด ส่วนช่องโหว่อย่างแท็กเรื่องทักษะ AI ตามแผนที่ของ Andrew Ng ที่ไม่มีในรายการ เราเพิ่งเห็นหลังคนลงมือติดแท็กเอง
- ติดผิดแล้วเสียแค่ไหน ข้อนี้กำหนดว่าจะขีดเส้นความมั่นใจไว้ตรงไหน และคนต้องดูกี่ชิ้น แท็กบล็อกผิดเสียไม่มาก แต่เอกสารบัญชีเข้าหมวดผิดกระทบการปิดงบ
- จะมีกี่ชิ้นที่ไม่ถึงเส้นแล้วต้องส่งต่อให้ชั้นตรวจที่สอง ชั้นนั้นต้องรับไหว รอบแรกของเรามีราวครึ่งหนึ่ง พอลองกับทั้งบล็อกเหลือ 4 ใน 10
- แต่ละชิ้นจะส่งอะไรให้โมเดลอ่าน เราส่งแค่ชื่อเรื่อง คำอธิบายสั้น และหัวข้อย่อยภาษาไทย ไม่ได้ส่งเนื้อความทั้งบทความ ถ้าเป็นเอกสารที่สแกนมา ต้องดึงข้อความออกจากภาพก่อน
- มีบริการที่คืนคะแนน หรือมีนักพัฒนาช่วยตั้งไหม AI แชตทั่วไปไม่คืนคะแนน จึงใช้เส้นความมั่นใจไม่ได้ ของเราใช้ Clef-flash ผ่าน Cloudflare Workers AI
- ใครทำเฉลย และจะวัดใหม่เมื่อไหร่ ต้องมีเฉลยจากคนก่อน ถึงจะเชื่อตัวเลขได้ และต้องวัดใหม่ทุกครั้งที่รายการเปลี่ยน เฉลยที่มาจาก AI ทำให้วิธี AI 2 ตัวดูดี แต่พอวัดกับคน กลับแม่นต่ำที่สุด แม้แต่ AI ผู้ตรวจ 2 ตัวก็ติดแท็กตรงกันแค่ราว 7 ใน 10 จึงไม่มีวิธีไหนตรงเฉลยได้ครบทุกแท็ก
- เงินและเวลาที่ใช้ต่อชิ้น เรายังไม่ได้วัด ต้องลองกับงานจริงเอง
ช่วงที่ 9จะทำ auto-tagging ด้วย decision model ต้องทำยังไง?
จากทั้ง 3 รอบ เราเสนอให้ทำเป็น 5 ขั้น decision model อยู่ที่ขั้น 2 ส่วนขั้นอื่นคือการเตรียมของให้โมเดล และจัดการกับคำตอบที่ได้กลับมา คนที่ไม่ได้เขียนโปรแกรมตามได้เกือบทุกขั้น ยกเว้นขั้น 2 ที่ต้องมีบริการที่คืนคะแนน หรือนักพัฒนาช่วยตั้งให้
- คนเตรียมตัวเลือกและเฉลยก่อน ทำรายการหมวดและแท็กไว้ในไฟล์เดียว แต่ละอันมีคำอธิบายสั้นๆ ว่าครอบคลุมเรื่องอะไร รายการนี้คือตัวเลือกของ decision model และคำอธิบายคือเกณฑ์ที่มันใช้ จึงต้องเขียนให้ชัด มีเจ้าของ 1 คน จะเพิ่มแท็กต้องแก้ที่รายการก่อน จากนั้นสุ่มของมาสัก 20 ชิ้น ติดหมวดและแท็กเองก่อนเห็นคำตอบของเครื่อง แล้วเขียนเกณฑ์ผ่านไว้ ตั้งตามราคาของความผิด แท็กบล็อกผิดเสียไม่มาก แต่เอกสารบัญชีเข้าหมวดผิดเสียมาก ของเราตั้งไว้ว่า หมวดที่โมเดลตัดสินเองต้องถูก 9 ใน 10 ส่วนแท็กต้องได้ความครบ 0.8 และความแม่น 0.7
- ให้ decision model ตอบทีละชิ้น ส่งชื่อเรื่อง คำอธิบายสั้น และหัวข้อย่อย พร้อมคำถามเลือกหมวดข้อเดียว และคำถามใช่หรือไม่ใช่แท็กละข้อ AI แชตทั่วไปตอบเป็นประโยค ไม่ได้คืนคะแนนให้แต่ละตัวเลือก จึงใช้เส้นความมั่นใจในขั้นถัดไปไม่ได้ ขั้นนี้ต้องมีบริการที่คืนคะแนน (ของเราใช้ Clef-flash ผ่าน Cloudflare Workers AI) หรือมีนักพัฒนาช่วยตั้งระบบให้ ถ้าไม่มีทั้งสองอย่าง ทางที่ตรงไปตรงมาคือให้ AI เสนอ แล้วคนตัดสินทุกชิ้น ถ้าเป็นใบเสร็จที่สแกนมา ต้องดึงข้อความออกจากภาพก่อน ส่วนค่าใช้จ่ายเราไม่ได้วัด
- ขีดเส้นก่อนดูผล เจ้าของรายการเลือกเส้นความมั่นใจก่อนเห็นคะแนน ของเราคือ 0.7 สิ่งเดียวที่เราปรับก่อนรอบแรกคือถ้อยคำของคำถาม โดยลองกับ 5 บทความที่ไม่อยู่ในชุดทดสอบ ส่วนรายการหมวดและแท็กเราแก้ระหว่างรอบ เปลี่ยนหมวด 1 หมวดหลังรอบสอง และแก้รายการแท็กหลังรอบสาม ก่อนใช้เส้นจริง ให้เอาเส้นไปใช้กับ 20 ชิ้นที่ติดเองไว้ในขั้น 1 แล้วดูว่าข้อที่ถึงเส้นถูกจริงไหม ในรอบแรกของเรา ของที่ไม่ถึงเส้นมีราวครึ่งหนึ่ง พอลองกับทั้งบล็อกเหลือ 4 ใน 10
- เลือกทางตามราคาของความผิด ถ้าผิดแล้วเสียไม่มาก อย่างหมวดบนบล็อก ใช้คำตอบของโมเดลเมื่อถึงเส้น ที่เหลือให้ AI 2 ตัวเลือกแยกกัน ข้อที่เห็นต่างส่งคน แล้วคนสุ่มตรวจบางส่วนจากข้อที่ผ่านไปแล้วโดยไม่มีคนดู ถ้าผิดแล้วแพง อย่างเอกสารบัญชีที่เข้าหมวดผิดแล้วกระทบการปิดงบ ให้คนดูทุกข้อที่โมเดลส่งต่อ และสุ่มตรวจข้อที่โมเดลตัดสินเองด้วย ทั้งสองทาง เรายังไม่รู้ว่าต้องสุ่มตรวจกี่ข้อถึงจะพอ
- คนดูแท็กทุกชิ้น ให้โมเดลเสนอแท็ก 3 อันแรก ให้ AI อีกตัวตัดอันที่ไม่ใช่เรื่องหลักทิ้ง แล้วคนดูทุกชิ้นก่อนเผยแพร่ เพราะยังไม่มีวิธีไหนผ่านเกณฑ์ ตอนเผยแพร่ ให้ระบบตรวจว่าไม่มีแท็กนอกรายการหลุดไป และทุกครั้งที่รายการเปลี่ยน ให้วัดใหม่ด้วยของชุดใหม่
บล็อกของเราตอนนี้ยังทำไม่ครบ 5 ขั้น ฝั่งหมวด โมเดลตัดสินเองเมื่อมั่นใจ แล้วมี AI ผู้ตรวจ 2 ตัวเช็กซ้ำอีกชั้น ยังไม่มีคนดู และยังไม่มีเฉลยหมวดจากคน ฝั่งแท็ก บนเว็บใช้วิธี 3 แท็กแรกแล้วยืนยัน ทั้งที่ไม่ผ่านเกณฑ์ และยังไม่มีคนดู เราเลือกเพราะสมดุลที่สุดในตาราง มี 9 จาก 127 บทความที่ Sonnet ทิ้งทั้ง 3 แท็ก ตรงนั้นเราใช้แท็กที่โมเดลให้คะแนนสูงสุดแทน ไม่ให้มีบทความไหนไม่มีแท็ก
ที่ทำครบแล้วคือรายการแท็กอยู่ในไฟล์เดียวที่เจ้าของบล็อกดูแล และทุกครั้งที่อัปเดตเว็บ มีสคริปต์ตรวจว่าไม่มีแท็กนอกรายการหลุดขึ้นไป
ช่วงที่ 10ข้อจำกัด และสิ่งที่ต้องระวัง
ถ้าจะใช้ decision model ทำ auto-tagging ตามนี้ มี 3 เรื่องที่เราอยากให้ระวัง คือ เฉลยอย่างน้อย 1 ชุดควรมาจากคน ไม่ใช่จาก AI แบบเดียวกับที่ถูกวัด รายการหมวดและแท็กที่เขียนเองก็ต้องวัดเหมือนกัน และแท็กยังไม่มีวิธีไหนผ่าน ให้คนดูไปก่อน
ส่วนตัวการทดลองเองก็เล็ก รอบละ 18 ถึง 20 บทความ เฉลยรอบสามมีแค่ 30 แท็ก ถ้าเครื่องหาเจอเพิ่มหรือลดแท็กเดียว ความครบก็ขยับราว 0.03 เฉลยของคนมาจากคนคนเดียว คนอื่นติดอาจได้ต่างไป ทั้งหมดทดสอบกับบล็อกเดียวที่ส่วนใหญ่เป็นเรื่อง AI กับงานบัญชี โมเดลเห็นแค่ชื่อเรื่อง คำอธิบาย และหัวข้อย่อย ใช้ decision model ตัวเดียวคือ Clef-flash ไม่ได้ลอง Jev หรือโมเดลอื่น และรายการที่ใช้อยู่ตอนนี้ยังไม่มีเฉลยชุดใหม่มาวัด คลังแบบอื่นจึงอาจได้ผลต่างจากนี้
ถ้าจะเริ่มทำ auto-tagging ด้วย decision model กับคลังของคุณเอง ลองสุ่มของมาสัก 20 ชิ้นแล้วติดแท็กเองก่อนเลือกโมเดล ระหว่างทางจะเห็นเองว่ารายการที่มีขาดอะไร และคุณเองติดกี่แท็กต่อชิ้น ของเราคือ 1.5 แท็ก ทั้งที่ตั้งใจจะติดทุกเรื่องที่บทความพูดถึง
คำถามที่พบบ่อย
ถาม: ให้ decision model ทำ auto-tagging เองทั้งหมดได้เลยไหม
ตอบ: ยังไม่ได้ ฝั่งแท็ก ในการทดลองของเรา ไม่มีวิธีไหนผ่านเกณฑ์ความครบ 0.8 และความแม่น 0.7 เมื่อเทียบกับเฉลยที่เจ้าของบล็อกทำ วิธีที่สมดุลที่สุดได้ 0.67 ทั้งสองค่า ส่วนการเลือกหมวด ถ้าผิดแล้วเสียไม่มาก ให้โมเดลตัดสินข้อที่ถึงเส้น ให้ AI 2 ตัวดูที่เหลือ แล้วคนสุ่มตรวจ ถ้าผิดแล้วแพงอย่างเอกสารบัญชี ให้คนดูทุกข้อที่โมเดลส่งต่อ และสุ่มตรวจข้อที่เหลือ ผลฝั่งหมวดนี้ยังไม่ได้วัดกับคน
ถาม: ทำไมต้องเป็น decision model ใช้ AI แชตทั่วไปติดแท็กไม่ได้เหรอ
ตอบ: AI แชตตอบเป็นประโยค ไม่ได้คืนคะแนนให้แต่ละตัวเลือก จึงแยกข้อที่ไม่แน่ใจออกมาด้วยเส้นความมั่นใจไม่ได้ ส่วน decision model เลือกได้แค่จากรายการที่ส่งไป และบอกด้วยว่ามั่นใจแค่ไหน ในการทดลองนี้เราไม่ได้วัดการติดแท็กด้วย AI แชต จึงบอกไม่ได้ว่าผลจะต่างกันเท่าไหร่
ถาม: ใช้ AI 2 ตัวช่วยกันติดแท็ก เก็บเฉพาะที่ตรงกัน จะแม่นกว่าไหม
ตอบ: ในการทดลองของเรา ไม่แม่นกว่า เมื่อเทียบกับเฉลยของคน วิธีนี้ได้ความแม่นต่ำที่สุด คือ 0.47 AI 2 ตัวเห็นตรงกันได้แม้ในเรื่องที่คนไม่นับเป็นเรื่องหลัก
ถาม: ใช้ decision model จัดเอกสารบัญชีเข้าหมวดได้ไหม
ตอบ: รูปแบบงานคล้ายกัน ถ้าเป็นการเลือกหมวดเดียวจากรายการ วิธีส่งต่อเมื่อไม่มั่นใจน่าจะใช้ได้ แต่เราทดสอบกับบทความบล็อกเท่านั้น ต้องทำเฉลยจากเอกสารของคุณเองแล้ววัดก่อน และเพราะโมเดลอ่านตัวหนังสือ เอกสารที่สแกนมาต้องดึงข้อความออกจากภาพก่อน ส่วนการเลือกอัตราภาษีหัก ณ ที่จ่ายอ่านได้ในตอนที่ 1
ถาม: แก้รายการแท็กแล้ว ผลดีขึ้นไหม
ตอบ: ยังไม่รู้ เราตั้งใจไม่เอาบทความชุดเดิมมาคิดคะแนนใหม่ เพราะแก้รายการหลังเห็นข้อผิดพลาดของชุดนั้นแล้ว ต้องวัดด้วยบทความชุดใหม่ที่คนติดแท็กไว้ก่อน
- Productize, "Decision model แบบ Jev ช่วยลดงานบัญชีได้ไหม เราลองกับภาษีหัก ณ ที่จ่าย" (ตอนที่ 1): https://productize.life/blog/decision-model-withholding-tax/th
- Cloudflare Workers AI, clef-flash (
@cf/cloudflare/clef-flash): https://developers.cloudflare.com/workers-ai/models/clef-flash/ - Laurence Moroney, "Decision models explained" (2 ตุลาคม 2026) Jev ของ TypeSafe: https://laurencemoroney.com/2026/10/02/decision-models-explained.html
- Flavio Copes, "Clef" (Cloudflare Clef และ Clef-flash): https://flaviocopes.com/clef/