ClickNext Bench · Internal Benchmark
เลือกใช้ AI ด้วยข้อมูลผลทดสอบ ทั้งความถูกต้อง ความเร็ว และต้นทุนการทำงานผ่าน ClickNext Agent — ทุกตัวเลขในหน้านี้มาจากการรันจริง ตรวจอัตโนมัติ และอัปเดตเองทุกสัปดาห์
อัปเดตล่าสุด 28 กันยายน 2026ทุกโมเดลได้ชุดข้อสอบเดียวกัน รัน 2 เส้นทาง — Raw = โมเดลเปล่าไม่มี system prompt, ผ่าน App = ชั้นระบบเดียวกับที่พนักงานใช้จริงใน ClickNext Agent
| โมเดล | ผ่าน App | Raw | Δ | Agent (4 งาน) | เวลาเฉลี่ย/ข้อ | ต้นทุน/รอบ |
|---|---|---|---|---|---|---|
| gpt-5.6-lunaคุ้มสุด | 100% (45/45) | 97.8% | +2.2 | 4/4 | 1.3s | $0.0345 (~฿1.24) |
| deepseek-reasoner | 100% (45/45) | 100% | 0 | 4/4 | 1.1s | $0.0720 (~฿2.59) |
| deepseek-v4-flash | 100% (45/45) | 100% | 0 | 4/4 | 1.1s | $0.0721 (~฿2.60) |
| grok-build-0.1 | 100% (45/45) | 100% | 0 | 4/4 | 9.2s | $0.1688 (~฿6.08) |
| gpt-5.6-sol | 100% (45/45) | 100% | 0 | 4/4 | 1.4s | $0.3254 (~฿11.71) |
| gpt-5.6-terra | 100% (45/45) | 100% | 0 | 4/4 | 1.0s | $0.3312 (~฿11.92) |
| grok-4.5 | 100% (45/45) | 100% | 0 | 4/4 | 3.8s | $0.3398 (~฿12.23) |
| grok-4.6 | 100% (45/45) | 100% | 0 | 4/4 | 11.1s | $0.3531 (~฿12.71) |
| kimi-k3 | 100% (45/45) | 100% | 0 | 4/4 | 7.1s | $0.7960 (~฿28.66) |
| gpt-6-astra | 100% (45/45) | 100% | 0 | — | 1.8s | $1.6409 (~฿59.07) |
| autorouter ของแอป | 97.8% (44/45) | 91.1% | +6.7 | — | 1.1s | $0.0346 (~฿1.25) |
| deepseek-v4-pro | 97.8% (44/45) | 100% | −2.2 | 4/4 | 2.2s | $0.2244 (~฿8.08) |
| gpt-4o | 88.9% (40/45) | 84.4% | +4.4 | 4/4 | 0.9s | $0.4032 (~฿14.51) |
| gpt-4o-mini | 84.4% (38/45) | 80% | +4.4 | 3/4 | 0.7s | $0.0242 (~฿0.87) |
| Inferact/Qwen3.8-Flash-Next-NVFP4 | 82.2% (37/45) | 77.8% | +4.4 | 4/4 | 0.7s | — |
| deepseek-chat | 77.8% (35/45) | 88.9% | −11.1 | 4/4 | 0.6s | $0.0358 (~฿1.29) |
| openai/gpt-oss-120b | ข้อมูลไม่ครบ (rate limit) | — | — | ไม่ครบ | — | — |
| openai/gpt-oss-20b | ข้อมูลไม่ครบ (rate limit) | — | — | ไม่ครบ | — | — |
| qwen/qwen3.6-27b | ข้อมูลไม่ครบ (rate limit) | — | — | ไม่ครบ | — | — |
Δ = คะแนนผ่าน App ลบคะแนน Raw (ชั้นของเราทำให้โมเดลเก่งขึ้นหรือแย่ลงกี่จุด) · Agent = งานแก้ไฟล์จริง 4 งานใน sandbox · ต้นทุน/รอบ = ค่า API จริงของการรันครบ 45 ข้อโหมดผ่าน App (คิดจาก token usage จริง, ประมาณเป็นบาทที่ 36 บาท/ดอลลาร์) · auto = router ของแอปที่เลือกโมเดลให้อัตโนมัติต่อคำถาม
นอกจากชุดทดสอบหลัก ยังมีการทดสอบงาน Agent ด้านการแก้ไขไฟล์จริง เพื่อประเมินความสามารถในการลงมือทำงานผ่านระบบ ไม่ใช่แค่ตอบข้อความ:
config.json แล้วแก้ค่าตามคำสั่งโดยไม่ทำโครงสร้างพังทุกงานรันใน sandbox แยก และตรวจผลจาก "ไฟล์ที่ได้จริง" ไม่ใช่จากคำตอบของโมเดล
ผลทดสอบแสดงคะแนนผ่าน App เทียบกับ Raw พร้อมเวลาเฉลี่ยต่อข้อและต้นทุนต่อรอบในรายการที่มีข้อมูล ช่วยประกอบการเลือกโมเดลให้เหมาะกับความต้องการของงาน — โมเดลที่คะแนนใกล้กันอาจมีต้นทุนต่างกันหลายเท่า
ในโหมด auto ระบบ router ของ ClickNext Agent จะเลือกโมเดลให้อัตโนมัติต่อคำถาม โดยไม่ล็อกไว้ที่โมเดลแพงที่สุด ผลคือคุณภาพระดับใกล้เคียงโมเดลชั้นนำในต้นทุนที่ต่ำกว่ามาก ตามตัวเลขจริงในตารางด้านบน
ClickNext Bench คือชุดทดสอบภายในของ ClickNext ที่วัดว่าโมเดล AI แต่ละตัวทำงานได้ดีแค่ไหนเมื่อใช้งานผ่าน ClickNext Agent ด้วยข้อสอบ 45 ข้อที่ตรวจอัตโนมัติ ครอบคลุมคณิตศาสตร์ ตรรกะ ภาษาไทย การสกัดข้อมูล การทำตามคำสั่ง การเขียนโค้ด ความรู้ด้านเทคนิค และโจทย์ยาก รวมถึงงาน Agent แก้ไฟล์จริงอีก 4 งาน
Raw คือการถามโมเดลตรง ๆ โดยไม่มี system prompt ส่วนผ่าน App คือการถามผ่านชั้นระบบของ ClickNext Agent (system prompt, แนวคิดการทำงาน และ coaching เดียวกับที่พนักงานใช้จริง) ค่า Δ ในตารางบอกว่าชั้นของเราทำให้โมเดลเก่งขึ้นหรือแย่ลงกี่จุด — ค่า Δ ที่เป็นบวกแปลว่าใช้งานผ่านแอปได้ผลดีกว่าใช้โมเดลเปล่า
ตารางผลทดสอบแสดงต้นทุนจริงต่อรอบของแต่ละโมเดล ซึ่งต่างกันได้หลายเท่าที่คะแนนใกล้เคียงกัน โหมด auto ของแอปใช้ router เลือกโมเดลที่เหมาะกับคำถามแต่ละข้อโดยอัตโนมัติ ทำให้ได้คุณภาพใกล้เคียงโมเดลชั้นนำในต้นทุนต่อรอบที่ต่ำกว่ามาก ผู้ใช้ไม่ต้องเลือกโมเดลเองและไม่ต้องจ่ายราคาโมเดลแพงที่สุดกับทุกคำถาม
ไม่ใช่การจัดอันดับโลก — เป็นผลจากชุดทดสอบภายในของ ClickNext ตามรุ่นโมเดลและเงื่อนไข ณ เวลาที่ทดสอบ จุดแข็งคือความโปร่งใส: ข้อสอบตรวจอัตโนมัติด้วยเฉลยตายตัว เกณฑ์เดียวกันทุกโมเดล และแสดงทั้งวันที่ วิธีทดสอบ และต้นทุนจริง ผลลัพธ์อาจแตกต่างเมื่อใช้งานกับโจทย์อื่น
ระบบรันทดสอบอัตโนมัติทุกสัปดาห์ และหน้านี้อัปเดตตัวเลขจากผลรอบล่าสุดโดยอัตโนมัติ พร้อมระบบแจ้งเตือนภายในเมื่อคะแนนของโมเดลใดตกจากรอบก่อนอย่างมีนัยสำคัญ
ดาวน์โหลดแอปได้ที่ clicknexttest.biz/agent/download (Windows, macOS, Linux) ติดตั้งแบบคลิกเดียวแล้วล็อกอินด้วยอีเมลบริษัท อ่านวิธีใช้งานทั้งหมดได้ที่หน้าเอกสารและคู่มือ
ดาวน์โหลดฟรีสำหรับพนักงาน ติดตั้งแบบคลิกเดียว ใช้ได้ทั้ง Windows, macOS และ Linux