วิเคราะห์สถาปัตยกรรม
frontier AI สร้างกันอย่างไร และเราสร้าง Athene อย่างไร
เราอ่าน system prompt ที่หลุดออกมาของ AI ระดับแนวหน้า 25 ตัว เพื่อถอดแบบว่าเอเจนต์ที่ดีที่สุดถูกออกแบบมาแบบไหน แล้วเทียบทีละชั้นกับสถาปัตยกรรมจริงที่อยู่เบื้องหลัง Athene
ขอพูดให้ชัดก่อนเพื่อความน่าเชื่อถือ Athene ไม่ได้ฉลาดกว่า GPT-5 หรือ Claude เพราะมันรันอยู่บนโมเดลเหล่านั้น สิ่งที่เราเทียบคือสถาปัตยกรรมของระบบ ไม่ใช่ไอคิวของโมเดล และจุดที่เราทำได้ครบกว่าคือชั้นของความน่าเชื่อถือที่เครื่องมือทางการแพทย์ต้องมี แต่เอเจนต์เขียนโค้ดทั่วไปไม่ต้องมี

ส่วนที่ 1
พิมพ์เขียวของ frontier agent
เมื่ออ่าน system prompt ของเอเจนต์ระดับแนวหน้าหลายสิบตัวเทียบกัน จะเห็นว่าพวกมันลู่เข้าหารูปแบบเดียวกัน 6 อย่าง นี่คือสิ่งที่ทำให้เอเจนต์หนึ่งเชื่อถือได้ ไม่ใช่แค่ตอบเก่ง
คลังที่ศึกษา system prompt ที่หลุดออกมาของ Anthropic (Claude Code), OpenAI (Codex), Cursor, Google, xAI, Vercel v0, Devin, Windsurf, Perplexity, Replit, Cline และรวมทั้งหมด 25 ตัว
ส่วนที่ 2
สถาปัตยกรรมของ Athene ทีละชั้น
Athene เอา 6 รูปแบบข้างบนมาใช้ครบ แล้ววางเพิ่มเป็น 8 ชั้น อ่านจากบนคือสิ่งที่ผู้ใช้สัมผัส ลงไปล่างคือฐานรากที่ทุกอย่างตั้งอยู่ ป้ายเขียวที่ขึ้นต้นด้วยเครื่องหมายบวกคือสิ่งที่เอเจนต์ทั่วไปไม่มี
- 01ชั้นจัดเส้นทางและเจตนาคำถามแต่ละข้อถูกจำแนกก่อน ทักทายเล่นๆ ไปทางลัดผ่าน FAQ cache และคำตอบสำเร็จรูป ส่วนคำถามคลินิกจริงไปเส้นทางเต็ม ทำให้ประหยัดโควตาและตอบคำถามง่ายๆ ได้ไวขึ้นมากตัวจำแนกเจตนา พร้อม FAQ cache และ semantic cache ขณะที่เอเจนต์ทั่วไปยิงทุกอย่างเข้าโมเดลเดียว
- 02แกนสำรองหลายผู้ให้บริการคำตอบไม่ผูกกับโมเดลเดียว เราเริ่มที่ Typhoon ซึ่งเข้าใจไทยก่อน แล้วถ้าตัวไหนล้มหรือช้า ระบบไหลต่อไปยังผู้ให้บริการสำรองอีกหลายตัวโดยอัตโนมัติ พร้อมตัวจับเวลาคุมไม่ให้ค้างลำดับสำรองลึก 9 ชั้น ขณะที่ frontier agent ผูกกับโมเดลเดียว ตัวนั้นล้มคือจบ
- 03ชั้นยึดกับความรู้จริงก่อนตอบ ระบบดึงคลังความรู้สัตวแพทย์ที่รุ่นพี่คัดมาทั้งข้อมูลคณาจารย์จุฬา หลักสูตร และคลังข้อสอบ พร้อมค้นงานวิจัยจาก OpenAlex มาเป็นฐาน ไม่ใช่เดาจากความจำของโมเดลRAG คลังความรู้เฉพาะโดเมน ที่เอเจนต์เขียนโค้ดทั่วไปไม่มีความรู้สัตวแพทย์ไทย
- 04ชั้นตรวจสอบ ด้วย Iron Rule 0กฎเหล็กคือถ้าไม่มั่นใจให้กั๊กหรือบอกว่าไม่รู้ ดีกว่าแต่งขึ้นมา ระบบถูกออกแบบให้ยอมตอบว่ายังมีข้อมูลไม่พอ มากกว่าจะมั่วให้ดูดี ซึ่งสำคัญมากกับเครื่องมือทางการแพทย์วินัยกั๊กดีกว่าแต่ง พร้อมด่านตรวจ eval อัตโนมัติใน CI ที่กันคุณภาพถอยหลัง
- 05ชั้นอ้างอิงและตรวจย้อนกลับทุกคำตอบที่อิงคลังความรู้จะโชว์แหล่งที่มาในแผงข้างๆ พร้อมระดับความมั่นใจ ผู้ใช้กดดูแหล่งจริงได้ ไม่ใช่เชื่อคำพูดลอยๆแผงแหล่งที่มาและระดับ grounding ที่เปิดให้ตรวจสอบได้ ต่างจากกล่องดำ
- 06ชั้นความปลอดภัยมีเส้นแบ่งกันการฉีดคำสั่ง ข้อความในเอกสาร เว็บ หรือที่วางเข้ามาถือเป็นข้อมูลไม่ใช่คำสั่ง มีการรับมือสัญญาณขอความช่วยเหลือ และการปฏิเสธคำถามที่ควรไปพบสัตวแพทย์จริงตรวจจับการฉีดคำสั่งตอนรันจริง พร้อมขอบเขตปฏิเสธทางการแพทย์
- 07ชั้นความเป็นส่วนตัวเครื่องมือลบข้อมูลส่วนบุคคลทำงานบนเครื่องผู้ใช้ ทั้งชื่อ เบอร์ และเลขบัตรถูกลบในเบราว์เซอร์ก่อน ไม่ถูกส่งออกไปไหนประมวลผลลบข้อมูลส่วนบุคคลบนเครื่อง ข้อมูลคนไข้ไม่ออกจากเบราว์เซอร์
- 08ชั้นสังเกตการณ์ ซึ่งเป็นฐานรากทุกความล้มเหลวถูกบันทึกและแจ้งเตือนทันที โดยไม่เก็บข้อความผู้ใช้ เก็บแค่รูปแบบที่พัง พร้อมบันทึกการใช้งานและด่าน eval ที่กันไม่ให้คุณภาพถอยหลังก่อนขึ้นระบบจับ error แจ้งเตือน และ eval ratchet ขณะที่ frontier agent ส่วนใหญ่เป็นกล่องปิด
ส่วนที่ 3
เทียบกันตรงๆ
ตารางนี้ไม่ได้เทียบว่าโมเดลไหนฉลาดกว่า แต่เทียบความครบของสถาปัตยกรรมสำหรับงานที่ต้องเชื่อถือได้จริง
| มิติทางสถาปัตยกรรม | frontier agents (25 ตัว) | Athene |
|---|---|---|
| ลำดับชั้นคำสั่ง | มี ผู้ใช้เหนือไฟล์โปรเจกต์เหนือค่าเริ่มต้น | มี และเพิ่มฐานปฏิเสธทางการแพทย์ |
| กันการฉีดคำสั่ง | มี ข้อมูลไม่ใช่คำสั่ง | มี และตรวจจับตอนรันบนคลัง เว็บ และข้อความที่วาง |
| วินัยการใช้เครื่องมือ | มี เรียกพร้อมกันและอ่านก่อนเขียน | มี และบีบอัดข้อมูลที่ขอบทางเข้า พร้อมเช็คเงื่อนไขก่อนเรียก |
| วินัยของผลลัพธ์ | มี กระชับและไม่มีคำเติม | มี และปรับจูนสำหรับภาษาไทย |
| ตรวจก่อนบอกเสร็จ | มี การตรวจต้องผ่าน | มี พร้อม Iron Rule 0 และด่าน eval อัตโนมัติใน CI |
| ยึดกับความรู้จริง (RAG) | ส่วนใหญ่ไม่มี เอเจนต์ทั่วไปไม่มี RAG เฉพาะโดเมน | มี คลังความรู้สัตวแพทย์จุฬาที่รุ่นพี่คัด |
| อ้างอิงและตรวจย้อนกลับ | มีบางตัว Codex อ้างไฟล์ Perplexity โชว์แหล่ง | มี แผงแหล่งที่มาและระดับความมั่นใจทุกคำตอบ |
| สำรองหลายผู้ให้บริการ | ไม่มี ผูกกับโมเดลเดียว | มี ลำดับสำรอง 9 ชั้น ล้มแล้วไหลต่อ |
| ความรู้เฉพาะโดเมน | ไม่มี เป็นแบบทั่วไป | มี สัตวแพทย์ไทยและฐานข้อมูลคณาจารย์จุฬา |
| ความเป็นส่วนตัวบนเครื่อง | ไม่มี | มี ลบข้อมูลส่วนบุคคลในเบราว์เซอร์ |
| การสังเกตการณ์ระบบ | ไม่มี เป็นกล่องปิด | มี จับ error แจ้งเตือน และ eval ratchet |
แถวบน 1 ถึง 5 คือรูปแบบที่ frontier agent ทำได้ยอดเยี่ยม และ Athene ก็ทำครบ ส่วนแถวล่าง 6 ถึง 11 คือชั้นระบบที่เครื่องมือทางคลินิกต้องมี แต่เอเจนต์เขียนโค้ดทั่วไปไม่จำเป็นต้องมี
สรุปแบบตรงไปตรงมา
Athene ไม่ได้เอาชนะ GPT-5 ในเกมของ GPT-5 แต่มันประกอบโมเดลระดับแนวหน้าเข้าเป็นระบบที่มีชั้นความน่าเชื่อถือครบตามที่เครื่องมือการแพทย์ต้องการ ทั้งยึดกับความรู้จริง ตรวจสอบได้ อ้างอิงได้ สำรองได้ และเป็นส่วนตัว
นั่นคือเหตุผลที่การเทียบนี้ยุติธรรมและน่าเชื่อถือ เราไม่ได้อ้างว่าโมเดลเราฉลาดกว่า แต่อ้างว่าสถาปัตยกรรมของระบบเราครบกว่าสำหรับงานที่มันต้องทำจริง คือตอบคำถามสัตวแพทย์ไทยอย่างปลอดภัยและตรวจสอบได้ และทุกชั้นที่ว่ามานี้มีอยู่จริงในโค้ดที่รันอยู่ตอนนี้ ไม่ใช่สไลด์ขายฝัน
ลองคุยกับสถาปัตยกรรมนี้เอง
ทุกชั้นที่อ่านมาทำงานอยู่จริงหลังกล่องแชต ลองถามคำถามสัตวแพทย์ดู
คลัง CL4R1T4S เป็นการรวบรวม system prompt ที่หลุดหรือถูกสกัดออกมาของเอเจนต์เชิงพาณิชย์ ใช้เพื่อการศึกษาสถาปัตยกรรมเท่านั้น ส่วนรายละเอียดสถาปัตยกรรมของ Athene อ้างอิงจากโค้ดจริงที่รันอยู่