English version

ClickNext Bench · Internal Benchmark

ClickNext Agent — พิสูจน์ความสามารถ
ผ่านการทดสอบบนแอปจริง

เลือกใช้ AI ด้วยข้อมูลผลทดสอบ ทั้งความถูกต้อง ความเร็ว และต้นทุนการทำงานผ่าน ClickNext Agent — ทุกตัวเลขในหน้านี้มาจากการรันจริง ตรวจอัตโนมัติ และอัปเดตเองทุกสัปดาห์

อัปเดตล่าสุด 28 กันยายน 2026
ผลทดสอบภายในวันที่ 28 กันยายน 2026 — ทดสอบ 16 โมเดลด้วยชุดข้อสอบ 45 ข้อผ่าน ClickNext Agent 10 โมเดลทำคะแนนผ่าน App ได้ 100% โมเดลที่คุ้มค่าที่สุดของรอบนี้คือ gpt-5.6-luna (100% ที่ ~฿1.24/รอบ) โหมด auto (router ของแอป) ทำได้ 97.8% ที่ ~฿1.25/รอบ และในงาน Agent แก้ไฟล์จริง 13 โมเดลผ่านครบ 4/4 (อีก 3 โมเดลแสดงเป็น "ข้อมูลไม่ครบ" เพราะติด rate limit ของผู้ให้บริการระหว่างทดสอบ จึงยังไม่นำมาคิดคะแนน)
16
โมเดลที่ทดสอบรอบล่าสุด
10
ทำคะแนนเต็ม 100% (45 ข้อ)
฿1.24
ต้นทุน/รอบต่ำสุดที่ 100% (gpt-5.6-luna)
97.8%
คะแนน router อัตโนมัติ (~฿1.25/รอบ)

ผลทดสอบล่าสุด (ชุดแชท 45 ข้อ + งาน Agent)

ทุกโมเดลได้ชุดข้อสอบเดียวกัน รัน 2 เส้นทาง — Raw = โมเดลเปล่าไม่มี system prompt, ผ่าน App = ชั้นระบบเดียวกับที่พนักงานใช้จริงใน ClickNext Agent

โมเดลผ่าน AppRawΔAgent (4 งาน)เวลาเฉลี่ย/ข้อต้นทุน/รอบ
gpt-5.6-lunaคุ้มสุด100% (45/45)97.8%+2.24/41.3s$0.0345 (~฿1.24)
deepseek-reasoner100% (45/45)100%04/41.1s$0.0720 (~฿2.59)
deepseek-v4-flash100% (45/45)100%04/41.1s$0.0721 (~฿2.60)
grok-build-0.1100% (45/45)100%04/49.2s$0.1688 (~฿6.08)
gpt-5.6-sol100% (45/45)100%04/41.4s$0.3254 (~฿11.71)
gpt-5.6-terra100% (45/45)100%04/41.0s$0.3312 (~฿11.92)
grok-4.5100% (45/45)100%04/43.8s$0.3398 (~฿12.23)
grok-4.6100% (45/45)100%04/411.1s$0.3531 (~฿12.71)
kimi-k3100% (45/45)100%04/47.1s$0.7960 (~฿28.66)
gpt-6-astra100% (45/45)100%0—1.8s$1.6409 (~฿59.07)
autorouter ของแอป97.8% (44/45)91.1%+6.7—1.1s$0.0346 (~฿1.25)
deepseek-v4-pro97.8% (44/45)100%−2.24/42.2s$0.2244 (~฿8.08)
gpt-4o88.9% (40/45)84.4%+4.44/40.9s$0.4032 (~฿14.51)
gpt-4o-mini84.4% (38/45)80%+4.43/40.7s$0.0242 (~฿0.87)
Inferact/Qwen3.8-Flash-Next-NVFP482.2% (37/45)77.8%+4.44/40.7s—
deepseek-chat77.8% (35/45)88.9%−11.14/40.6s$0.0358 (~฿1.29)
openai/gpt-oss-120bข้อมูลไม่ครบ (rate limit)——ไม่ครบ——
openai/gpt-oss-20bข้อมูลไม่ครบ (rate limit)——ไม่ครบ——
qwen/qwen3.6-27bข้อมูลไม่ครบ (rate limit)——ไม่ครบ——

Δ = คะแนนผ่าน App ลบคะแนน Raw (ชั้นของเราทำให้โมเดลเก่งขึ้นหรือแย่ลงกี่จุด) · Agent = งานแก้ไฟล์จริง 4 งานใน sandbox · ต้นทุน/รอบ = ค่า API จริงของการรันครบ 45 ข้อโหมดผ่าน App (คิดจาก token usage จริง, ประมาณเป็นบาทที่ 36 บาท/ดอลลาร์) · auto = router ของแอปที่เลือกโมเดลให้อัตโนมัติต่อคำถาม

สำหรับพนักงาน ClickNext: อยากรู้ว่าควรเลือกโมเดลไหนกับงานแบบไหน อ่าน คู่มือเลือกโมเดล — ใช้โมเดลไหนดี? (ล็อกอินด้วยบัญชีบริษัท)

ทดสอบมากกว่าการตอบคำถาม

นอกจากชุดทดสอบหลัก ยังมีการทดสอบงาน Agent ด้านการแก้ไขไฟล์จริง เพื่อประเมินความสามารถในการลงมือทำงานผ่านระบบ ไม่ใช่แค่ตอบข้อความ:

ทุกงานรันใน sandbox แยก และตรวจผลจาก "ไฟล์ที่ได้จริง" ไม่ใช่จากคำตอบของโมเดล

มองเห็นทั้งคุณภาพและประสิทธิภาพ

ผลทดสอบแสดงคะแนนผ่าน App เทียบกับ Raw พร้อมเวลาเฉลี่ยต่อข้อและต้นทุนต่อรอบในรายการที่มีข้อมูล ช่วยประกอบการเลือกโมเดลให้เหมาะกับความต้องการของงาน — โมเดลที่คะแนนใกล้กันอาจมีต้นทุนต่างกันหลายเท่า

ในโหมด auto ระบบ router ของ ClickNext Agent จะเลือกโมเดลให้อัตโนมัติต่อคำถาม โดยไม่ล็อกไว้ที่โมเดลแพงที่สุด ผลคือคุณภาพระดับใกล้เคียงโมเดลชั้นนำในต้นทุนที่ต่ำกว่ามาก ตามตัวเลขจริงในตารางด้านบน

วิธีทดสอบ (Methodology)

คำถามที่พบบ่อย

ClickNext Bench คืออะไร

ClickNext Bench คือชุดทดสอบภายในของ ClickNext ที่วัดว่าโมเดล AI แต่ละตัวทำงานได้ดีแค่ไหนเมื่อใช้งานผ่าน ClickNext Agent ด้วยข้อสอบ 45 ข้อที่ตรวจอัตโนมัติ ครอบคลุมคณิตศาสตร์ ตรรกะ ภาษาไทย การสกัดข้อมูล การทำตามคำสั่ง การเขียนโค้ด ความรู้ด้านเทคนิค และโจทย์ยาก รวมถึงงาน Agent แก้ไฟล์จริงอีก 4 งาน

"ผ่าน App" ต่างจาก "Raw" อย่างไร

Raw คือการถามโมเดลตรง ๆ โดยไม่มี system prompt ส่วนผ่าน App คือการถามผ่านชั้นระบบของ ClickNext Agent (system prompt, แนวคิดการทำงาน และ coaching เดียวกับที่พนักงานใช้จริง) ค่า Δ ในตารางบอกว่าชั้นของเราทำให้โมเดลเก่งขึ้นหรือแย่ลงกี่จุด — ค่า Δ ที่เป็นบวกแปลว่าใช้งานผ่านแอปได้ผลดีกว่าใช้โมเดลเปล่า

ใช้ ClickNext Agent แล้วประหยัดกว่าอย่างไร

ตารางผลทดสอบแสดงต้นทุนจริงต่อรอบของแต่ละโมเดล ซึ่งต่างกันได้หลายเท่าที่คะแนนใกล้เคียงกัน โหมด auto ของแอปใช้ router เลือกโมเดลที่เหมาะกับคำถามแต่ละข้อโดยอัตโนมัติ ทำให้ได้คุณภาพใกล้เคียงโมเดลชั้นนำในต้นทุนต่อรอบที่ต่ำกว่ามาก ผู้ใช้ไม่ต้องเลือกโมเดลเองและไม่ต้องจ่ายราคาโมเดลแพงที่สุดกับทุกคำถาม

ผลนี้เป็นการจัดอันดับโลกหรือไม่ เชื่อถือได้แค่ไหน

ไม่ใช่การจัดอันดับโลก — เป็นผลจากชุดทดสอบภายในของ ClickNext ตามรุ่นโมเดลและเงื่อนไข ณ เวลาที่ทดสอบ จุดแข็งคือความโปร่งใส: ข้อสอบตรวจอัตโนมัติด้วยเฉลยตายตัว เกณฑ์เดียวกันทุกโมเดล และแสดงทั้งวันที่ วิธีทดสอบ และต้นทุนจริง ผลลัพธ์อาจแตกต่างเมื่อใช้งานกับโจทย์อื่น

ทดสอบบ่อยแค่ไหน

ระบบรันทดสอบอัตโนมัติทุกสัปดาห์ และหน้านี้อัปเดตตัวเลขจากผลรอบล่าสุดโดยอัตโนมัติ พร้อมระบบแจ้งเตือนภายในเมื่อคะแนนของโมเดลใดตกจากรอบก่อนอย่างมีนัยสำคัญ

อยากลองใช้ ClickNext Agent ต้องทำอย่างไร

ดาวน์โหลดแอปได้ที่ clicknexttest.biz/agent/download (Windows, macOS, Linux) ติดตั้งแบบคลิกเดียวแล้วล็อกอินด้วยอีเมลบริษัท อ่านวิธีใช้งานทั้งหมดได้ที่หน้าเอกสารและคู่มือ

ตรวจสอบผลได้ เข้าใจขอบเขตชัดเจน

ข้อจำกัดของผลทดสอบ: ข้อมูลนี้เป็นผลจากชุดทดสอบภายใน ClickNext Bench ตามรุ่นโมเดลและเงื่อนไข ณ เวลาที่ทดสอบ งาน Agent แสดงผลแยกจากชุดทดสอบหลัก 45 ข้อ ผลลัพธ์ไม่ใช่การจัดอันดับโลก และอาจแตกต่างเมื่อใช้งานกับโจทย์อื่น

ทดลอง ClickNext Agent กับงานของคุณ

ดาวน์โหลดฟรีสำหรับพนักงาน ติดตั้งแบบคลิกเดียว ใช้ได้ทั้ง Windows, macOS และ Linux