Harvey เปิดตัว Tenet: โมเดลฐาน Kimi K3 ที่ผ่านการฝึกฝนพิเศษเพื่อยกระดับงานกฎหมายระยะยาว

Harvey เปิดตัว Tenet: โมเดลฐาน Kimi K3 ที่ผ่านการฝึกฝนพิเศษเพื่อยกระดับงานกฎหมายระยะยาว

Harvey ได้เปิดตัว Harvey Tenet โมเดล post-trained ตัวแรกในรูปแบบ research preview โดยพัฒนาต่อยอดจากโมเดลฐาน Kimi K3 ผ่านการฝึกฝนด้วย Fireworks ในกระบวนการ asynchronous reinforcement learning เพื่อรองรับงานด้านกฎหมายที่มีความซับซ้อนและใช้ระยะเวลานาน (long-horizon) คลังข้อมูลที่ใช้ฝึกฝนประกอบด้วยข้อมูลสังเคราะห์ ข้อมูลกฎหมายสาธารณะ และความเห็นจากผู้เชี่ยวชาญ โดยยืนยันว่าไม่มีการนำข้อมูลของลูกค้ามาใช้แต่อย่างใด

เมื่อเปรียบเทียบกับโมเดลฐาน K3 เดิม Tenet สามารถทำงานในภารกิจที่แยกส่วนสำเร็จเพิ่มขึ้นเกือบเท่าตัวบน Legal Agent Benchmark (LAB) ของ Harvey และเพิ่มขึ้น 20% บน LAB: Contracts ส่งผลให้ Harvey รายงานว่าเป็นผู้นำ (state-of-the-art) ในด้านการตรวจสอบสัญญา นอกจากนี้ ประสิทธิภาพที่เพิ่มขึ้นยังส่งผลบวกไปยัง APEX Agents ของ Mercor และ Redline Bench ของ Crosby โดยไม่ต้องฝึกฝนเพิ่มเติม

เป้าหมายหลักของ Harvey คือการสร้างปัญญาประดิษฐ์ทางกฎหมายระดับโลกบนโครงสร้างโมเดลแบบ open-weight เพื่อให้สำนักงานกฎหมายสามารถเป็นเจ้าของโมเดลเฉพาะทางของตนเองได้ อย่างไรก็ตาม Harvey Tenet ยังอยู่ในสถานะงานวิจัยที่ประกาศเมื่อวันที่ 20 สิงหาคม 2026 โดยยังไม่มีการเปิดเผย weights, model card หรือ API endpoint สู่สาธารณะ และจะจำกัดการใช้งานเฉพาะลูกค้าระดับองค์กร (Enterprise) ผ่านแพลตฟอร์มของ Harvey เท่านั้น

สามารถนำไปใช้งานได้จริงหรือยัง?

ในปัจจุบัน Tenet ยังเป็นเพียง checkpoint ของ Harvey เอง ซึ่งบริษัทมีแผนจะขยายผลจากงานวิจัยสู่การใช้งานจริงในผลิตภัณฑ์หลักต่อไป สำหรับหน่วยงานที่ต้องการทำซ้ำวิธีการนี้จำเป็นต้องมีระบบ RL stack และทรัพยากรคำนวณมหาศาล โดยการฝึกฝนนี้ใช้ GPU NVIDIA B300 ประมาณ 150 ตัว เป็นเวลานานถึงสองเดือน

กลุ่มเป้าหมายหลักคือบริการด้านกฎหมาย, ฝ่ายกฎหมายในองค์กรใหญ่, วาณิชธนกิจสำหรับงานตรวจสอบ M&A รวมถึงอุตสาหกรรมที่มีการควบคุมสูง เช่น ประกันภัยและการดูแลสุขภาพ การประยุกต์ใช้งานครอบคลุมตั้งแต่การทำ due diligence memos, การร่างและแก้ไขสัญญา (redlining) ไปจนถึงการสกัดข้อมูลจากเอกสารจำนวนมหาศาลถึง 10,000 ฉบับ

ตัวเลขบ่งบอกอะไร

ผลลัพธ์ที่โดดเด่นคือการถ่ายโอนความสามารถ (transfer) โดย Tenet พัฒนาขึ้นอย่างมากในเกณฑ์ APEX Agents และ Redline Bench ซึ่งเป็นชุดทดสอบที่ไม่เคยพบมาก่อนในระหว่างการฝึกฝน ขณะที่ยังคงรักษาประสิทธิภาพในเบนช์มาร์กความรู้พื้นฐานอย่าง LegalBench, CUAD, MAUD และ PRBench ไว้ได้

นอกจากนี้ยังมีการปรับปรุงด้านต้นทุนควบคู่ไปกับคุณภาพ โดยการใช้ open weights ช่วยลดราคาต่อ token และการทำ reward shaping เพื่อเลือกเส้นทางการทำงานที่สั้นแต่ได้คุณภาพสูง ทำให้ Harvey สามารถเพิ่มคุณภาพการทำงานได้โดยที่ต้นทุนยังคงที่

ฝึกฝนอย่างไร

กระบวนการฝึกฝนใช้ asynchronous reinforcement learning ในสภาพแวดล้อมจำลอง (sandbox) ที่เลียนแบบภารกิจใน LAB เช่น คำสั่งงานสไตล์พาร์ทเนอร์ และการตัดสินผลโดยผู้เชี่ยวชาญแบบผ่าน/ไม่ผ่าน โดยในแต่ละภารกิจอาจมีเกณฑ์ตัดสินตั้งแต่ 50 ไปจนถึงหลายร้อยข้อ และการทำงานหนึ่งครั้ง (rollout) อาจยาวนานกว่า 1,000 รอบ

สำหรับการวัดผลใช้แนวทาง LLM-as-a-judge โดยอาศัย Kimi 2.6 ในกระบวนการ ablation ส่วนนโยบาย (policy) ถูกปรับให้เหมาะสมด้วยเทคนิค GSPO โดยใช้ LoRA rank-64 บนเครือข่าย K3 ทั้งหมด ทั้งนี้ Fireworks ได้เข้ามามีส่วนร่วมในการสร้างระบบ trainer และการจัดการ rollout ในระดับ kernel เพื่อให้โมเดลขนาดใหญ่ทำงานได้อย่างสอดคล้องกัน

สามความสามารถที่ฝึกฝนแยกกัน

ทีม Harvey ยังได้ฝึกฝนโมเดลเฉพาะทางที่ Tenet สามารถเรียกใช้เป็น sub-agents ได้ดังนี้:

  • M&A diligence: พัฒนาระบบ Recursive Language Model บน LAB: Diligence ช่วยเพิ่มอัตราการผ่านเกณฑ์จาก 43.8% เป็น 60.1%
  • Review Table: ใช้ Applied Compute เพื่อปรับปรุงโมเดล GLM-5.2 ให้ตอบคำถามแม่นยำขึ้นและอ้างอิงได้ดีขึ้น 12.1 จุด โดยมีต้นทุนต่อช่องลดลงเหลือเพียง 1 ใน 10
  • ความรู้ของบริษัท: ผ่านเทคโนโลยี Engram โดยใช้โมเดล Qwen3.8-27B เรียนรู้ข้อมูลลูกค้าจนเป็นความรู้ที่มีโครงสร้าง ช่วยเพิ่มอัตราการผ่านเกณฑ์ 15% และลดต้นทุนต่อการสอบถามได้ถึง 90%

ข้อเท็จจริงจากการทดสอบอิสระโดย Marktechpost

จากการตรวจสอบข้อกล่าวอ้าง 19 รายการ พบว่ามี 1 รายการที่ได้รับการยืนยันอิสระ และ 10 รายการเป็นรายงานโดยตรงจากผู้พัฒนา โดยคะแนนรวมความน่าเชื่อถืออยู่ที่ 78 คะแนน และยังไม่มีข้อมูลใดที่ถูกโต้แย้งว่าไม่เป็นความจริง

ตารางข้อกล่าวอ้าง

ข้อกล่าวอ้างตัวเลขการตรวจสอบอิสระคำตัดสิน
ทำสำเร็จเพิ่มขึ้น ~2 เท่า“+82%” บน X
การยกระดับ all-pass ใน LAB: Contractsอันดับ 1 ใน Vals คือ Muse Spark 1.1 ที่ 20.00%ดำเนินการโดย Harvey
APEX Agents, กฎหมายองค์กร58.8% (Kimi K3 Max)ตรงกันทุกประการ
Redline Benchกระดานผู้นำสาธารณะ
APEX v1 Big Law Associateคงรักษาไว้ได้
LegalBench, CUAD, MAUD
PRBenchชุดย่อยที่ยาก
อัตราการผ่านเกณฑ์ LAB: Diligence
ต้นทุนต่อช่องใน Review Table
intelligence-per-token ใน Firm Knowledgeบทความ Engram
โมเดล open-weightBusiness Insider: จดสิทธิบัตร, ใช้งานภายใน
GSPO + rank-64 LoRA

คำอธิบายข้อสังเกต (Flags)

F1 & F6 & F7 · การนำเสนอตัวเลข: มีการใช้ตัวเลขที่ทำให้ดูมีผลกระทบสูงในโซเชียลมีเดียเมื่อเทียบกับตัวเลขจุดเปอร์เซ็นต์ในบล็อกทางการ และมีการเปรียบเทียบต้นทุนกับคู่แข่งที่ไม่ระบุชื่อ

F2 & F3 & F4 · การตั้งค่าการทดสอบ: ผลการทดสอบบางส่วนเกิดขึ้นบนเบนช์มาร์กของ Harvey เอง หรือมีการใช้เครื่องมือช่วยทำงานเสริม (finish tool) ในขณะที่คู่แข่งใช้ระบบมาตรฐาน ทำให้การเปรียบเทียบอาจไม่ตรงกันแบบร้อยเปอร์เซ็นต์

F5 · การตีกรอบข้อมูล: คำว่า "Open-weight" หมายถึงโมเดลฐาน Kimi K3 เท่านั้น แต่ Tenet ที่เป็นโมเดลปรับแต่งแล้วยังไม่มีการเปิดเผยข้อมูลสู่สาธารณะ

ประเด็นสำคัญ

  • Tenet เป็นเพียง checkpoint ของ Kimi K3 ที่ผ่านการฝึกพิเศษ ยังไม่มีการเปิดให้ใช้งานแบบ API หรือดาวน์โหลด weights สู่สาธารณะ
  • ประสิทธิภาพที่เพิ่มขึ้นในเบนช์มาร์กภายนอกโดยไม่ต้องฝึกซ้ำ แสดงให้เห็นว่าโมเดลเกิดการเรียนรู้ทักษะจริง ไม่ใช่แค่การจดจำข้อสอบ
  • การใช้ Specialist stack เช่น RLM และระบบความจำเฉพาะทาง คือหัวใจสำคัญที่สร้างความแตกต่างในงานกฎหมายระดับสูง
Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย SirilukP

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร