GPT-6 อัปเกรด Prompt Caching ใหม่ ลดต้นทุนและค่าความหน่วง

· By: NatapolK

OpenAI ปรับปรุงระบบ Prompt Caching ในตระกูล GPT-6 เพื่อช่วยให้ Persistent Agents ทำงานในโปรเจกต์ซับซ้อน เช่น การ Refactoring โค้ดหรือการสร้างเอกสารวิจัย ได้อย่างมีประสิทธิภาพมากขึ้น โดยระบบจะจัดเก็บ Shared Prefixes ที่เข้าเงื่อนไขไว้ใน Cache นาน 30 นาที เพื่อลดการประมวลผลซ้ำในคำขอ API ที่ต่อเนื่องกัน ซึ่งช่วยลดเวลาการตอบสนองและมอบส่วนลดให้แก่นักพัฒนาสูงสุดถึง 90% สำหรับ Input Tokens ที่ถูกเรียกใช้จาก Cache เพื่อเพิ่มความโปร่งใสในการใช้งาน OpenAI ได้เปิดตัว Prompt Caching Dashboard(opens in a new window) ใหม่ที่ช่วยให้นักพัฒนาสามารถติดตามอัตรา Hit Rate และตรวจสอบองค์ประกอบของ Token ได้อย่างชัดเจน มุมมองข้อมูลเหล่านี้จะช่วยให้ตรวจพบความผิดปกติของประสิทธิภาพการทำ Caching ได้ทันที เมื่อมีการเปลี่ยนแปลงโค้ดหรือการตั้งค่าในแอปพลิเคชัน

ในกรณีที่เกิด Cache Miss ที่ไม่คาดคิด นักพัฒนาสามารถใช้ prompt caching diagnostics tool(opens in a new window) เพื่อเปรียบเทียบคำขอกับการตอบสนองล่าสุด เพื่อระบุว่าการเปลี่ยนแปลงในส่วนใด เช่น โมเดล เครื่องมือ หรือ Input ที่ทำให้ระบบไม่สามารถนำข้อมูลเดิมกลับมาใช้ใหม่ได้ ช่วยให้การปรับแต่งระบบทำได้แม่นยำยิ่งขึ้นเพื่อรักษาอัตรา Cache Hit ให้สูงที่สุด

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

ฟีเจอร์ใหม่อีกประการคือ การเลือกส่วนที่จะ Cache ผ่านจุดพักแบบกำหนดเอง (Explicit Cache Breakpoints) โดยนักพัฒนาสามารถศึกษาขั้นตอนการใช้งานและระยะเวลาคงอยู่ของข้อมูลได้ที่ prompt caching guide(opens in a new window) ที่ปรับปรุงใหม่ ซึ่งจะอธิบายถึงผลกระทบจากการเปลี่ยนเครื่องมือและ Input ที่มีต่อการนำข้อมูลกลับมาใช้ใหม่

สำหรับโมเดล GPT-6 นักพัฒนาสามารถ change reasoning effort(opens in a new window) หรือปรับระดับความพยายามในการใช้เหตุผลระหว่างการสนทนาได้โดยไม่ทำให้ Cache หลุด ซึ่งทำได้โดยการส่ง configuration_update เพื่อเพิ่มหรือลดระดับความพยายามให้เหมาะสมกับความยากของงานในขณะนั้น โดยที่ยังรักษาบริบทเดิมในระดับ Request-level ไว้ได้อย่างครบถ้วน

นอกจากนี้ การรักษาโครงสร้างของเครื่องมือ (Tool Definitions) ให้คงที่ยังเป็นสิ่งสำคัญ เมื่อความต้องการใช้งานเปลี่ยนไป แนะนำให้ใช้ allowed_tools หรือตั้งค่า tool_choice เป็น none แทนการลบการนิยามเครื่องมือทิ้ง เพื่อให้บริบทเดิมยังคงนำกลับมาใช้ใหม่ได้ โดยสามารถศึกษาแนวทางเพิ่มเติมได้ที่ guidance on managing tool changes(opens in a new window)

สุดท้ายคือกรรมวิธี Prewarm Cache เพื่อลดความหน่วงล่วงหน้า Prewarming(opens in a new window) จะช่วยเตรียมบริบทที่ทราบล่วงหน้า เช่น คำแนะนำที่ใช้ร่วมกันหรือเอกสารอ้างอิง ตั้งแต่ช่วงเริ่มต้นระบบก่อนที่ผู้ใช้จะเริ่มถามคำถามแรก ซึ่งเป็นการย้ายภาระการประมวลผลออกไปจากการรอคอยของผู้ใช้โดยตรง

  • ตรวจสอบอัตรา cache hit ได้ใน - Prompt Caching Dashboard(opens in a new window)
  • ตรวจสอบการ miss ที่ไม่คาดคิดด้วย - diagnostics tool(opens in a new window)
  • ติดตาม - prompt caching guide(opens in a new window)- use Codex(opens in a new window)
Source: OpenAI News
ดูแลงานแปลและเรียบเรียงโดย NatapolK
Prompt caching dashboard showing cache hit rate, cache performance over time, and input token composition.

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร