thansettakij
thansettakij
Google เปิด Gemini 4 Argon แก้ช่องโหว่ไซเบอร์-ลุยงานเขียนโค้ด-กฎหมาย-การเงิน

Google เปิด Gemini 4 Argon แก้ช่องโหว่ไซเบอร์-ลุยงานเขียนโค้ด-กฎหมาย-การเงิน

01 ต.ค. 69 | 04:30 น.
อัปเดตล่าสุด :01 ต.ค. 69 | 04:46 น.

Google เปิด Gemini 4 Argon รองรับงานโค้ด กฎหมาย การเงิน และป้องกันภัยไซเบอร์ เริ่มใช้เฉพาะกลุ่ม ก่อนขยายสู่ลูกค้า API และสมาชิก Google AI Ultra

KEY

POINTS

  • Google เปิดตัว Gemini 4 Argon โมเดล AI รุ่นใหม่ที่ออกแบบมาสำหรับงานซับซ้อนหลายขั้นตอน โดยมุ่งเน้นด้านการเขียนโค้ด, กฎหมาย, การเงิน และการป้องกันภัยไซเบอร์
  • มีความสามารถโดดเด่นในการค้นหา ตรวจสอบ และแก้ไขช่องโหว่ด้านความปลอดภัยทางไซเบอร์ในซอฟต์แวร์ได้ด้วยตนเอง
  • ถูกนำไปใช้งานภายใน Google อย่างกว้างขวางสำหรับงานวิศวกรรมซอฟต์แวร์ เช่น การแก้บั๊ก การย้ายฐานโค้ดภาษาโปรแกรม และการปรับปรุงประสิทธิภาพระบบ
  • ทำคะแนนทดสอบได้เป็นอันดับต้นๆ ในด้านการเงินและกฎหมาย แสดงถึงศักยภาพในการทำงานที่ต้องใช้ความรู้เฉพาะทางและการใช้เหตุผลเชิงลึก

โคเรย์ คาวุกจูโอกลู (Koray Kavukcuoglu) รองประธานอาวุโส Google DeepMind และหัวหน้าสถาปนิก AI ของ Google  กล่าวว่า Google ประกาศเปิดตัว Gemini 4 Argon โมเดล AI รุ่นใหม่สำหรับงานซับซ้อนที่ต้องดำเนินการต่อเนื่องหลายขั้นตอน ทั้งการพัฒนาซอฟต์แวร์ งานกฎหมาย การเงิน และการป้องกันภัยไซเบอร์ โดยเริ่มเปิดให้ผู้ปฏิบัติงานด้านการป้องกันภัยไซเบอร์ที่ได้รับความไว้วางใจใช้งานผ่านโครงการ Fairwind ก่อนขยายบริการไปยังผู้พัฒนา องค์กร และผู้บริโภค

Argon ถูกพัฒนาให้ใช้เหตุผลเชิงลึกได้อย่างต่อเนื่องตลอดกระบวนการทำงานระยะยาว ขณะนี้พนักงาน Google หลายพันคนนำโมเดลไปใช้ในงานเขียนโค้ดเฉพาะทาง การค้นคว้าข้อมูล และงานเขียนแล้ว

Google เปิด Gemini 4 Argon แก้ช่องโหว่ไซเบอร์-ลุยงานเขียนโค้ด-กฎหมาย-การเงิน

อย่างไรก็ตาม Google จะทยอยเปิดการเข้าถึงเป็นระยะ พร้อมเข้าร่วมกระบวนการโดยสมัครใจของรัฐบาลสหรัฐฯ สำหรับการเข้าถึงโมเดลก่อนเปิดตัว และนำข้อเสนอแนะจากผู้ทดสอบกลุ่มแรกมาปรับปรุงมาตรการความปลอดภัยก่อนให้บริการในวงกว้าง

เพิ่มเพดานคำตอบ รองรับงานยาวและซับซ้อน

การเปลี่ยนแปลงสำคัญของ Argon คือการเพิ่มเพดานโทเคนขาออกจาก 64,000 เป็น 1 ล้านโทเคน โดยโทเคนเป็นหน่วยข้อมูลที่โมเดลใช้ประมวลผลและสร้างข้อความ การเพิ่มเพดานดังกล่าวจึงเปิดพื้นที่ให้โมเดลทำงานต่อเนื่องและสร้างผลลัพธ์ที่ยาวขึ้น

Google ระบุว่า เมื่อโมเดลสามารถใช้โทเคนหลายแสนหน่วยในกระบวนการเดียว จะช่วยให้ใช้เหตุผลได้ลึกขึ้นเพื่อแก้ปัญหาที่ซับซ้อน

ราคาเริ่มต้นอยู่ที่ 2 ดอลลาร์ต่อโทเคนขาเข้า 1 ล้านโทเคน และ 10 ดอลลาร์ต่อโทเคนขาออก 1 ล้านโทเคน ส่วนข้อมูลขาเข้าที่เก็บไว้ในแคชเพื่อใช้ซ้ำจะมีราคาลดลง 95% จากอัตราขาเข้าปกติ

บริษัทเตรียมขยายบริการโดยเริ่มจากลูกค้า API แบบชำระเงินและสมาชิก Google AI Ultra แต่ยังไม่ได้ระบุวันเปิดให้ใช้งานทั่วไปในประกาศครั้งนี้

ใช้ปรับฐานโค้ดและลดการใช้หน่วยความจำ

Google นำ Argon มาใช้กับงานวิศวกรรมภายใน ตั้งแต่การแก้ข้อผิดพลาดของโปรแกรม การออกแบบอัลกอริทึม ไปจนถึงการย้ายฐานโค้ดภาษา C/C++ เป็น Rust ซึ่งครอบคลุมไลบรารีหลักอย่าง re2 และ libgav1 ที่มีโค้ดหลายหมื่นบรรทัด รวมถึงเคอร์เนล Zircon ของระบบ Fuchsia ที่มีโค้ดมากกว่า 800,000 บรรทัด

เนื่องจากหลายระบบมีความสำคัญสูง โค้ดที่เขียนใหม่ต้องผ่านการตรวจสอบทั้งแบบอัตโนมัติและโดยมนุษย์ การทดสอบจำลองระบบ และการทบทวนก่อนนำไปใช้งานจริง

สำหรับ libgav1 ซอฟต์แวร์โอเพนซอร์สถอดรหัสวิดีโอ เอเจนต์ Argon หรือระบบ AI ที่ดำเนินงานหลายขั้นตอนได้ นำเวอร์ชัน Rust เดิมมาปรับปรุง โดยแทนที่โค้ด SIMD จำนวน 32,000 บรรทัด ซึ่งเป็นโค้ดสำหรับประมวลผลข้อมูลหลายชุดพร้อมกัน ผ่านการทดลองและศึกษาผลลัพธ์จากคอมไพเลอร์

Google ระบุว่าซอฟต์แวร์ที่ได้มีความปลอดภัยด้านหน่วยความจำ ทำงานเร็วกว่าเวอร์ชัน Rust เดิม 2.7 เท่า ให้ผลลัพธ์วิดีโอเหมือนกันทุกประการ และมีประสิทธิภาพเข้าใกล้เวอร์ชัน C++ ที่ผ่านการปรับแต่งแล้ว

อีกกรณีคือการใช้ทีมเอเจนต์วิเคราะห์ข้อมูลประสิทธิภาพระบบ เพื่อค้นหาและปรับปรุงการใช้หน่วยความจำทั่วศูนย์ข้อมูล หลังนำไปใช้สามารถคืนพื้นที่หน่วยความจำได้มากกว่า 300 TiB โดยบริษัทคาดว่าจะประหยัดได้รวม 500 TiB ถึง 1 PiB

ส่วนงานวิจัยคอมพิวเตอร์ควอนตัม Argon ช่วยปรับลดทรัพยากรที่ใช้ในกระบวนการย่อยซึ่งเป็นคอขวด โดย Google ยกตัวอย่างผลการปรับปรุงที่ดีกว่าค่ามาตรฐานอ้างอิงที่เผยแพร่ไว้ 40% ภายในเวลาไม่กี่นาที

ขยายจากงานโปรแกรมสู่งานกฎหมายและการเงิน

Argon ถูกวางให้รองรับงานองค์กรที่ต้องใช้ความรู้เฉพาะทาง รวมถึงการประมวลผลข้อมูลหลายรูปแบบ โดย Google เปิดเผยผลทดสอบด้านซอฟต์แวร์ การเงิน กฎหมาย และงานธุรกิจประกอบการเปิดตัว

โมเดลทำคะแนน 77.9% บน DeepSWE v1.1 ซึ่งวัดความสามารถในงานวิศวกรรมซอฟต์แวร์ที่ต้องทำต่อเนื่องระยะยาว และเป็นอันดับหนึ่งบน Vals Index ซึ่งประเมินงานการเงิน การเขียนโค้ด กฎหมาย และภาษี โดยถ่วงน้ำหนักแต่ละสาขาตามสัดส่วนที่มีต่อ GDP สหรัฐฯ

บริษัทยังระบุว่า Argon มีผลทดสอบระดับแนวหน้าใน Vals Finance Agent v2 สำหรับการค้นคว้าทางการเงินหลายขั้นตอน และ Harvey’s Legal Agent Benchmark สำหรับการค้นคว้าและร่างเอกสารกฎหมาย

ส่วน AutomationBench ของ Zapier ซึ่งวัดการทำงานตั้งแต่ต้นจนจบในภารกิจหลักทางธุรกิจ Argon อยู่ในอันดับหนึ่งด้วยคะแนน 51.3%

โมเดลยังรองรับการวิเคราะห์แผนภูมิ การค้นหารายละเอียดจากวิดีโอความยาวมาก และการดำเนินงานจากเอกสารหลายฉบับ โดย Google ระบุว่าทำคะแนนสูงสุด 91.7% บน LVBench ซึ่งประเมินความเข้าใจวิดีโอความยาวมาก

Google เปิด Gemini 4 Argon แก้ช่องโหว่ไซเบอร์-ลุยงานเขียนโค้ด-กฎหมาย-การเงิน

ค้นหาและแก้ช่องโหว่ไซเบอร์

ด้านความปลอดภัยไซเบอร์ Google ระบุว่า Argon สามารถค้นหา ตรวจสอบยืนยัน และแก้ไขช่องโหว่ร้ายแรงในซอฟต์แวร์ได้ด้วยตนเอง โดยจะเปิดให้ผู้ปฏิบัติงานด้านการป้องกันที่ได้รับความไว้วางใจและทีมภายใน Google ใช้งานโดยไม่มีข้อจำกัดกำกับด้านไซเบอร์ เพื่อใช้ความสามารถด้านการป้องกันได้เต็มรูปแบบ

Wiz เป็นหนึ่งในผู้ใช้งานผ่านโครงการ Scan for Good ซึ่งค้นหาและแก้ไขจุดเสี่ยงสูงให้โครงสร้างพื้นฐานสาธารณะที่สำคัญโดยไม่มีค่าใช้จ่าย

Google เปิด Gemini 4 Argon แก้ช่องโหว่ไซเบอร์-ลุยงานเขียนโค้ด-กฎหมาย-การเงิน

Google ระบุว่า ในการใช้งานระยะแรก Argon ค้นพบช่องโหว่ร้ายแรงในซอฟต์แวร์ด้านสุขภาพที่โรงพยาบาลทั่วโลกใช้งาน ซึ่งเสี่ยงเปิดเผยข้อมูลส่วนบุคคลอ่อนไหว และเป็นความเสี่ยงที่โมเดลระดับแนวหน้ารุ่นก่อนตรวจไม่พบ

บน CWE-bench v1 ซึ่งประเมินการแก้ไขช่องโหว่ Argon ได้คะแนน 68% ครองอันดับหนึ่งร่วม ต่อยอดจากผลทดสอบของ 3.8 Flash Cyber บนแบบประเมินรุ่น v0 ขณะที่การทดสอบภายใน Google พบว่า Argon ค้นหาจุดเสี่ยงในฐานโค้ดซับซ้อนที่ครอบคลุมภาษาโปรแกรม 20 ภาษาได้

สำหรับแบบทดสอบเจาะระบบของ Wiz ซึ่งให้โมเดลวิเคราะห์ระบบเว็บจริงโดยไม่เข้าถึงซอร์สโค้ด บริษัทระบุว่า Argon ทำได้ดีกว่า 3.8 Flash Cyber ทั้งการค้นหาจุดที่อาจถูกโจมตี การระบุช่องโหว่ และการสร้างหลักฐานยืนยัน

เสริมมาตรการความปลอดภัยก่อนขยายบริการ

ก่อนเปิดใช้งานในวงกว้าง Google จะเพิ่มมาตรการความปลอดภัยใน 4 ด้านหลัก

ด้านแรกคือ ป้องกันการใช้ผิดวัตถุประสงค์ ทั้งการโจมตีไซเบอร์และภัยด้านสารเคมี ชีวภาพ รังสี และนิวเคลียร์ โดยออกแบบให้โมเดลปฏิเสธคำขออันตราย แต่ยังรองรับงานวิจัยที่ชอบด้วยกฎหมาย พร้อมปรับปรุงการติดตามสัญญาณภายในโมเดล และทดสอบความแข็งแกร่งของมาตรการด้วยทีมจำลองการโจมตีภายในและภายนอก

ด้านที่สองคือ ป้องกันการแทรกคำสั่งทางอ้อม ซึ่งเป็นการซ่อนคำสั่งอันตรายในข้อมูลหรือบริบทเพื่อควบคุมพฤติกรรม AI โดยใช้การจำลองโจมตีอัตโนมัติและการฝึกให้รับมือ Google ระบุว่า Argon มีผลทดสอบระดับแนวหน้าบนแบบประเมิน IPI ของ Gray Swan

ด้านที่สามคือ เฝ้าระวังการทำงานเกินเจตนาผู้ใช้ ด้วยการติดตามลำดับการใช้เหตุผลและการกระทำ พร้อมหยุดการทำงานเมื่อจำเป็น ระบบลักษณะเดียวกันถูกใช้ระหว่างฝึกโมเดลและแจ้งเตือนทีมตอบสนองเหตุการณ์ โดยระมัดระวังไม่ให้นำผลตรวจพบกลับไปฝึกจนเกิดความเสี่ยงที่โมเดลจะเรียนรู้การหลบเลี่ยงการตรวจติดตาม

Google ยังสนับสนุนให้อุตสาหกรรมรักษาความโปร่งใสของการใช้เหตุผล เพื่อช่วยตรวจสอบพฤติกรรมที่ไม่สอดคล้องกับเจตนาผู้ใช้

ด้านสุดท้ายคือ เสริมความปลอดภัยของระบบทดสอบ โดยแยกและปิดกั้นสภาพแวดล้อมแซนด์บ็อกซ์ก่อนเริ่มการฝึกหรือประเมินที่มีความเสี่ยงสูง พร้อมแบ่งปันแนวปฏิบัติกับพันธมิตร

Google วาง Argon ให้รองรับทั้งงานโค้ด งานความรู้ การป้องกันไซเบอร์ และการเขียนเชิงสร้างสรรค์ โดยจะใช้ผลประเมินจากการทำงานจริงของผู้ทดสอบกลุ่มแรกปรับปรุงระบบ ก่อนขยายบริการสู่ลูกค้ากลุ่มถัดไป

 

  • แท็กที่เกี่ยวข้อง
  • Google
  • Gemini