thansettakij
thansettakij
Microsoft เปิดตัว MAI-Transcribe-2-Streaming ถอดเสียงเรียลไทม์ 60 ภาษา

Microsoft เปิดตัว MAI-Transcribe-2-Streaming ถอดเสียงเรียลไทม์ 60 ภาษา

05 ต.ค. 69 | 04:12 น.
อัปเดตล่าสุด :05 ต.ค. 69 | 04:15 น.

Microsoft เปิดตัว MAI-Transcribe-2-Streaming โมเดล AI แปลงเสียงพูดเป็นข้อความแบบเรียลไทม์ รองรับ 60 ภาษา รวมภาษาไทย แสดงผลข้อความเบื้องต้นเพียงกว่า 100 มิลลิวินาทีหลังได้รับข้อมูลเสียง

KEY

POINTS

  • Microsoft เปิดตัว MAI-Transcribe-2-Streaming โมเดลถอดเสียงแบบเรียลไทม์ ที่ประมวลผลเสียงต่อเนื่องและแสดงผลข้อความเบื้องต้นได้ในเวลาเพียง 100 มิลลิวินาที
  • รองรับการถอดเสียง 60 ภาษา รวมถึงภาษาไทย พร้อมระบบตรวจจับภาษาอัตโนมัติ และได้รับการจัดอันดับว่ามีความแม่นยำสูง
  • ออกแบบมาเพื่อใช้พัฒนาระบบที่ต้องการการตอบสนองรวดเร็ว เช่น AI Voice Agent, คอลเซ็นเตอร์ และการสร้างคำบรรยายสด
  • เปิดให้ใช้งานในรูปแบบ Public Preview ผ่าน Microsoft Foundry ในราคาเริ่มต้น 0.54 ดอลลาร์ต่อชั่วโมง

Microsoft AI ประกาศเปิดตัว MAI-Transcribe-2-Streaming ซึ่งเป็นโมเดลถอดเสียงแบบสตรีมมิงที่ประมวลผลข้อมูลเสียงอย่างต่อเนื่อง แตกต่างจากระบบถอดเสียงทั่วไปที่ต้องรอให้ผู้พูดจบประโยคหรือสิ้นสุดการบันทึกก่อนจึงจะแสดงข้อความ

จุดเด่นของโมเดลนี้คือความสามารถในการสร้างข้อความเบื้องต้น (Partial Transcript) ได้ในเวลาเพียงกว่า 100 มิลลิวินาทีหลังจากได้รับข้อมูลเสียง จากนั้นจะปรับปรุงข้อความเมื่อได้รับเสียงและบริบทเพิ่มเติม ก่อนยืนยันเป็นข้อความฉบับสมบูรณ์ ช่วยให้แอปพลิเคชันสามารถเริ่มประมวลผลคำพูดและเตรียมตอบสนองได้ตั้งแต่ผู้ใช้ยังพูดไม่จบ

Microsoft เปิดตัว MAI-Transcribe-2-Streaming ถอดเสียงเรียลไทม์ 60 ภาษา

Microsoft ระบุว่า จากการทดสอบภายในสำหรับงานถอดเสียงแบบเรียลไทม์ เช่น การพิมพ์ด้วยเสียงและการสร้างคำบรรยาย พบว่าโมเดลสามารถแสดงคำพูดเป็นข้อความได้เร็วกว่าโมเดลคู่แข่งที่ใกล้เคียงที่สุด 2 เท่า ขณะที่ Artificial Analysis จัดอันดับ MAI-Transcribe-2-Streaming เป็นอันดับ 1 ด้านความแม่นยำ ทั้งข้อความเบื้องต้นและข้อความฉบับสมบูรณ์

รองรับ 60 ภาษา ใช้พัฒนา AI Voice Agent

MAI-Transcribe-2-Streaming รองรับการถอดเสียง 60 ภาษา รวมถึงภาษาไทย อังกฤษ จีน ญี่ปุ่น เกาหลี และอินโดนีเซีย พร้อมความสามารถในการตรวจจับภาษาอัตโนมัติอย่างต่อเนื่อง ทำให้สามารถรองรับการสนทนาหลายภาษา โดยไม่จำเป็นต้องกำหนดภาษาล่วงหน้าในกรณีที่ใช้ระบบตรวจจับอัตโนมัติ

Microsoft เปิดตัว MAI-Transcribe-2-Streaming ถอดเสียงเรียลไทม์ 60 ภาษา

Microsoft ออกแบบโมเดลให้รองรับการพัฒนาแอปพลิเคชันที่ต้องประมวลผลเสียงแบบเรียลไทม์ เช่น AI Voice Agent ที่สามารถเริ่มวิเคราะห์คำถามและเตรียมเรียกใช้เครื่องมือระหว่างที่ผู้ใช้กำลังพูด ระบบคอลเซ็นเตอร์ที่ต้องถอดเสียงและทำความเข้าใจความต้องการของลูกค้า ตลอดจนระบบสร้างคำบรรยายการประชุม การเรียนการสอนออนไลน์ และการจดบันทึกจากเสียงพูด

นอกจากนี้ ยังสามารถนำไปใช้ร่วมกับโมเดล AI ด้านการสร้างเสียงพูด เพื่อพัฒนาระบบผู้ช่วยเสียงที่สามารถรับฟัง ทำความเข้าใจ ประมวลผล และตอบกลับด้วยเสียงได้อย่างต่อเนื่อง ช่วยลดช่วงเวลารอคอยและทำให้การโต้ตอบใกล้เคียงกับการสนทนาระหว่างมนุษย์มากขึ้น

เปิดใช้งานผ่าน Microsoft Foundry ราคาเริ่มต้น 0.54 ดอลลาร์ต่อชั่วโมง

สำหรับนักพัฒนา MAI-Transcribe-2-Streaming เปิดให้ใช้งานในรูปแบบ Public Preview ผ่าน Microsoft Foundry และ MAI Playground รวมถึงช่องทางอื่นที่ Microsoft ระบุ เช่น Vercel และ Azure Voice Live โดยรองรับการเชื่อมต่อผ่าน Realtime API บน WebSocket และ Azure Speech SDK

Microsoft กำหนดราคาแนะนำช่วงเปิดตัวที่ 0.54 ดอลลาร์สหรัฐต่อชั่วโมงของเสียง จนถึงวันที่ 31 ธันวาคม 2026 ทั้งนี้ การใช้งานต้องมี Azure Subscription และทรัพยากร Microsoft Foundry ที่รองรับ โดยแต่ละเซสชันสามารถประมวลผลต่อเนื่องได้สูงสุด 1 ชั่วโมง

อย่างไรก็ตาม โมเดลดังกล่าวยังอยู่ในสถานะ Public Preview ซึ่งยังไม่มีข้อตกลงรับประกันระดับการให้บริการ (SLA) และ Microsoft ยังไม่แนะนำให้นำไปใช้กับระบบ Production ที่ต้องพึ่งพาความต่อเนื่องของบริการในระดับสูง

การเปิดตัว MAI-Transcribe-2-Streaming เป็นส่วนหนึ่งของการขยายโมเดล AI ด้านเสียงของ Microsoft เพื่อสนับสนุนการพัฒนา AI Voice Agent ที่สามารถรับฟังและตอบสนองได้รวดเร็ว โดยเปิดโอกาสให้นักพัฒนานำความสามารถด้านการถอดเสียงแบบเรียลไทม์ไปต่อยอดกับบริการทางธุรกิจและแอปพลิเคชันที่ต้องสื่อสารด้วยเสียง

  • แท็กที่เกี่ยวข้อง
  • AI
  • Microsoft