Harvey เปิดตัว Tenet: โมเดลฐาน Kimi K3 ที่ผ่านการฝึกฝนพิเศษเพื่อยกระดับงานกฎหมายระยะยาว

Harvey ได้เปิดตัว Harvey Tenet โมเดล post-trained ตัวแรกในรูปแบบ research preview โดยพัฒนาต่อยอดจากโมเดลฐาน Kimi K3 ผ่านการฝึกฝนด้วย Fireworks ในกระบวนการ asynchronous reinforcement learning เพื่อรองรับงานด้านกฎหมายที่มีความซับซ้อนและใช้ระยะเวลานาน (long-horizon) คลังข้อมูลที่ใช้ฝึกฝนประกอบด้วยข้อมูลสังเคราะห์ ข้อมูลกฎหมายสาธารณะ และความเห็นจากผู้เชี่ยวชาญ โดยยืนยันว่าไม่มีการนำข้อมูลของลูกค้ามาใช้แต่อย่างใด
เมื่อเปรียบเทียบกับโมเดลฐาน K3 เดิม Tenet สามารถทำงานในภารกิจที่แยกส่วนสำเร็จเพิ่มขึ้นเกือบเท่าตัวบน Legal Agent Benchmark (LAB) ของ Harvey และเพิ่มขึ้น 20% บน LAB: Contracts ส่งผลให้ Harvey รายงานว่าเป็นผู้นำ (state-of-the-art) ในด้านการตรวจสอบสัญญา นอกจากนี้ ประสิทธิภาพที่เพิ่มขึ้นยังส่งผลบวกไปยัง APEX Agents ของ Mercor และ Redline Bench ของ Crosby โดยไม่ต้องฝึกฝนเพิ่มเติม
เป้าหมายหลักของ Harvey คือการสร้างปัญญาประดิษฐ์ทางกฎหมายระดับโลกบนโครงสร้างโมเดลแบบ open-weight เพื่อให้สำนักงานกฎหมายสามารถเป็นเจ้าของโมเดลเฉพาะทางของตนเองได้ อย่างไรก็ตาม Harvey Tenet ยังอยู่ในสถานะงานวิจัยที่ประกาศเมื่อวันที่ 20 สิงหาคม 2026 โดยยังไม่มีการเปิดเผย weights, model card หรือ API endpoint สู่สาธารณะ และจะจำกัดการใช้งานเฉพาะลูกค้าระดับองค์กร (Enterprise) ผ่านแพลตฟอร์มของ Harvey เท่านั้น
สามารถนำไปใช้งานได้จริงหรือยัง?
ในปัจจุบัน Tenet ยังเป็นเพียง checkpoint ของ Harvey เอง ซึ่งบริษัทมีแผนจะขยายผลจากงานวิจัยสู่การใช้งานจริงในผลิตภัณฑ์หลักต่อไป สำหรับหน่วยงานที่ต้องการทำซ้ำวิธีการนี้จำเป็นต้องมีระบบ RL stack และทรัพยากรคำนวณมหาศาล โดยการฝึกฝนนี้ใช้ GPU NVIDIA B300 ประมาณ 150 ตัว เป็นเวลานานถึงสองเดือน
กลุ่มเป้าหมายหลักคือบริการด้านกฎหมาย, ฝ่ายกฎหมายในองค์กรใหญ่, วาณิชธนกิจสำหรับงานตรวจสอบ M&A รวมถึงอุตสาหกรรมที่มีการควบคุมสูง เช่น ประกันภัยและการดูแลสุขภาพ การประยุกต์ใช้งานครอบคลุมตั้งแต่การทำ due diligence memos, การร่างและแก้ไขสัญญา (redlining) ไปจนถึงการสกัดข้อมูลจากเอกสารจำนวนมหาศาลถึง 10,000 ฉบับ
ตัวเลขบ่งบอกอะไร
ผลลัพธ์ที่โดดเด่นคือการถ่ายโอนความสามารถ (transfer) โดย Tenet พัฒนาขึ้นอย่างมากในเกณฑ์ APEX Agents และ Redline Bench ซึ่งเป็นชุดทดสอบที่ไม่เคยพบมาก่อนในระหว่างการฝึกฝน ขณะที่ยังคงรักษาประสิทธิภาพในเบนช์มาร์กความรู้พื้นฐานอย่าง LegalBench, CUAD, MAUD และ PRBench ไว้ได้
นอกจากนี้ยังมีการปรับปรุงด้านต้นทุนควบคู่ไปกับคุณภาพ โดยการใช้ open weights ช่วยลดราคาต่อ token และการทำ reward shaping เพื่อเลือกเส้นทางการทำงานที่สั้นแต่ได้คุณภาพสูง ทำให้ Harvey สามารถเพิ่มคุณภาพการทำงานได้โดยที่ต้นทุนยังคงที่
ฝึกฝนอย่างไร
กระบวนการฝึกฝนใช้ asynchronous reinforcement learning ในสภาพแวดล้อมจำลอง (sandbox) ที่เลียนแบบภารกิจใน LAB เช่น คำสั่งงานสไตล์พาร์ทเนอร์ และการตัดสินผลโดยผู้เชี่ยวชาญแบบผ่าน/ไม่ผ่าน โดยในแต่ละภารกิจอาจมีเกณฑ์ตัดสินตั้งแต่ 50 ไปจนถึงหลายร้อยข้อ และการทำงานหนึ่งครั้ง (rollout) อาจยาวนานกว่า 1,000 รอบ
สำหรับการวัดผลใช้แนวทาง LLM-as-a-judge โดยอาศัย Kimi 2.6 ในกระบวนการ ablation ส่วนนโยบาย (policy) ถูกปรับให้เหมาะสมด้วยเทคนิค GSPO โดยใช้ LoRA rank-64 บนเครือข่าย K3 ทั้งหมด ทั้งนี้ Fireworks ได้เข้ามามีส่วนร่วมในการสร้างระบบ trainer และการจัดการ rollout ในระดับ kernel เพื่อให้โมเดลขนาดใหญ่ทำงานได้อย่างสอดคล้องกัน
สามความสามารถที่ฝึกฝนแยกกัน
ทีม Harvey ยังได้ฝึกฝนโมเดลเฉพาะทางที่ Tenet สามารถเรียกใช้เป็น sub-agents ได้ดังนี้:
- M&A diligence: พัฒนาระบบ Recursive Language Model บน LAB: Diligence ช่วยเพิ่มอัตราการผ่านเกณฑ์จาก 43.8% เป็น 60.1%
- Review Table: ใช้ Applied Compute เพื่อปรับปรุงโมเดล GLM-5.2 ให้ตอบคำถามแม่นยำขึ้นและอ้างอิงได้ดีขึ้น 12.1 จุด โดยมีต้นทุนต่อช่องลดลงเหลือเพียง 1 ใน 10
- ความรู้ของบริษัท: ผ่านเทคโนโลยี Engram โดยใช้โมเดล Qwen3.8-27B เรียนรู้ข้อมูลลูกค้าจนเป็นความรู้ที่มีโครงสร้าง ช่วยเพิ่มอัตราการผ่านเกณฑ์ 15% และลดต้นทุนต่อการสอบถามได้ถึง 90%
ข้อเท็จจริงจากการทดสอบอิสระโดย Marktechpost
จากการตรวจสอบข้อกล่าวอ้าง 19 รายการ พบว่ามี 1 รายการที่ได้รับการยืนยันอิสระ และ 10 รายการเป็นรายงานโดยตรงจากผู้พัฒนา โดยคะแนนรวมความน่าเชื่อถืออยู่ที่ 78 คะแนน และยังไม่มีข้อมูลใดที่ถูกโต้แย้งว่าไม่เป็นความจริง
ตารางข้อกล่าวอ้าง
| ข้อกล่าวอ้าง | ตัวเลข | การตรวจสอบอิสระ | คำตัดสิน |
|---|---|---|---|
| ทำสำเร็จเพิ่มขึ้น ~2 เท่า | “+82%” บน X | ||
| การยกระดับ all-pass ใน LAB: Contracts | อันดับ 1 ใน Vals คือ Muse Spark 1.1 ที่ 20.00% | ดำเนินการโดย Harvey | |
| APEX Agents, กฎหมายองค์กร | 58.8% (Kimi K3 Max) | ตรงกันทุกประการ | |
| Redline Bench | กระดานผู้นำสาธารณะ | ||
| APEX v1 Big Law Associate | คงรักษาไว้ได้ | ||
| LegalBench, CUAD, MAUD | |||
| PRBench | ชุดย่อยที่ยาก | ||
| อัตราการผ่านเกณฑ์ LAB: Diligence | |||
| ต้นทุนต่อช่องใน Review Table | |||
| intelligence-per-token ใน Firm Knowledge | บทความ Engram | ||
| โมเดล open-weight | Business Insider: จดสิทธิบัตร, ใช้งานภายใน | ||
| GSPO + rank-64 LoRA |
คำอธิบายข้อสังเกต (Flags)
F1 & F6 & F7 · การนำเสนอตัวเลข: มีการใช้ตัวเลขที่ทำให้ดูมีผลกระทบสูงในโซเชียลมีเดียเมื่อเทียบกับตัวเลขจุดเปอร์เซ็นต์ในบล็อกทางการ และมีการเปรียบเทียบต้นทุนกับคู่แข่งที่ไม่ระบุชื่อ
F2 & F3 & F4 · การตั้งค่าการทดสอบ: ผลการทดสอบบางส่วนเกิดขึ้นบนเบนช์มาร์กของ Harvey เอง หรือมีการใช้เครื่องมือช่วยทำงานเสริม (finish tool) ในขณะที่คู่แข่งใช้ระบบมาตรฐาน ทำให้การเปรียบเทียบอาจไม่ตรงกันแบบร้อยเปอร์เซ็นต์
F5 · การตีกรอบข้อมูล: คำว่า "Open-weight" หมายถึงโมเดลฐาน Kimi K3 เท่านั้น แต่ Tenet ที่เป็นโมเดลปรับแต่งแล้วยังไม่มีการเปิดเผยข้อมูลสู่สาธารณะ
ประเด็นสำคัญ
- Tenet เป็นเพียง checkpoint ของ Kimi K3 ที่ผ่านการฝึกพิเศษ ยังไม่มีการเปิดให้ใช้งานแบบ API หรือดาวน์โหลด weights สู่สาธารณะ
- ประสิทธิภาพที่เพิ่มขึ้นในเบนช์มาร์กภายนอกโดยไม่ต้องฝึกซ้ำ แสดงให้เห็นว่าโมเดลเกิดการเรียนรู้ทักษะจริง ไม่ใช่แค่การจดจำข้อสอบ
- การใช้ Specialist stack เช่น RLM และระบบความจำเฉพาะทาง คือหัวใจสำคัญที่สร้างความแตกต่างในงานกฎหมายระดับสูง
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
