อาลีบาบาเปิดตัว ThinkSound: โมเดล AI ที่สร้างเสียงที่สมจริงสําหรับวิดีโอ – Taobao Thailand

ทั้งหมด                 Alibaba Group                 อีคอมเมิร์ซ                 เทคโนโลยี                 โลจิสติกส์            ความยั่งยืน                 ไลฟ์สไตล์


อาลีบาบาเปิดตัว ThinkSound: โมเดล AI ที่สร้างเสียงที่สมจริงสําหรับวิดีโอ

เทคโนโลยีเกิดใหม่|เผยแพร่เมื่อ 16 กรกฎาคม 2025

  • โมเดล ThinkSound แบบโอเพ่นซอร์สอํานวยความสะดวกในการสร้างเสียงแบบโต้ตอบทีละขั้นตอนและแก้ไขเนื้อหาวิดีโอ
  • รองรับการสร้างวิดีโอเป็นเสียง การแก้ไขเสียงแบบข้อความ และการสร้างเสียงแบบโต้ตอบบนอุปกรณ์ Edge

การสร้างเสียงคุณภาพสูงสําหรับเนื้อหาวิดีโอนําเสนอความท้าทายทางเทคนิคและความคิดสร้างสรรค์มากมาย ซึ่งส่งผลกระทบต่อทั้งมือใหม่และผู้เชี่ยวชาญด้านเสียงที่มีประสบการณ์ โปรดิวเซอร์มักจะต่อสู้กับปัญหาต่างๆ เช่น การจัดการเสียงรบกวน การสร้างสมดุลระหว่างบทสนทนากับเอฟเฟกต์เสียง การปฏิบัติตามข้อจํากัดด้านงบประมาณและเวลา และการรักษาความสม่ําเสมอของความคิดสร้างสรรค์ การแปลวิสัยทัศน์ทางศิลปะให้เป็นผลิตภัณฑ์ขั้นสุดท้ายที่เหนียวแน่นซึ่งสะท้อนถึงพลวัตของภาพ สภาพแวดล้อมทางเสียง และจังหวะเวลาได้อย่างแม่นยําก็ยังคงเป็นเรื่องที่ท้าทายเช่นกัน

เพื่อจัดการกับความท้าทายเหล่านี้ Tongyi Speech Lab ของอาลีบาบาได้เปิดตัว ThinkSound ซึ่งเป็น LLM แบบโอเพ่นซอร์สแบบใหม่ที่ใช้เหตุผล Chain-of-Thought (CoT) สําหรับการสร้างและแก้ไขเสียงขั้นสูง ThinkSound นําเสนอแนวทางที่มีโครงสร้างและโต้ตอบในการผลิตเสียง ซึ่งปรับให้เหมาะกับเนื้อหาวิดีโอโดยเฉพาะ รุ่นนี้มีให้เลือกสามขนาดขนาดกะทัดรัด – พารามิเตอร์ 1.3B, 724M และ 533M รองรับการสร้างวิดีโอเป็นเสียง การแก้ไขเสียงแบบข้อความ และการสร้างเสียงแบบโต้ตอบ แม้ในอุปกรณ์ Edge

ThinkSound เลียนแบบเวิร์กโฟลว์หลายขั้นตอนของนักออกแบบเสียงของมนุษย์ เพื่อให้มั่นใจว่าเสียงที่สร้างขึ้นยังคงมีความแม่นยําตามบริบท เหนียวแน่น และมีคุณภาพสูงตลอดการผลิต โมเดลจะวิเคราะห์พลวัตของภาพของวิดีโอก่อน ตีความแอตทริบิวต์อะคูสติกที่สอดคล้องกันอย่างมีเหตุผล จากนั้นจึงสังเคราะห์เสียงที่เหมาะสมตามบริบท

ด้วยแนวทางที่เป็นนวัตกรรมใหม่ ThinkSound ช่วยให้ผู้ใช้สามารถสร้างซาวด์สเคปที่มีรายละเอียดและสอดคล้องกัน ปรับแต่งเสียงที่สร้างขึ้นผ่านการโต้ตอบของผู้ใช้ที่ใช้งานง่าย และแก้ไขส่วนเสียงเฉพาะโดยใช้คําแนะนําภาษาธรรมชาติ

นอกจากนี้ ทีมวิจัยของอาลีบาบายังได้แนะนํา AudioCoT ซึ่งเป็นชุดข้อมูลหลายรูปแบบขนาดใหญ่ที่มีคําอธิบายประกอบ CoT เฉพาะเสียง ซึ่งช่วยเพิ่มความสอดคล้องระหว่างเนื้อหาภาพ คําอธิบายข้อความ และการสังเคราะห์เสียง

การประเมินอย่างกว้างขวางแสดงให้เห็นว่า ThinkSound บรรลุประสิทธิภาพที่ล้ําสมัยในการสร้างวิดีโอเป็นเสียง โดยให้ซาวด์สเคปที่แม่นยําตามบริบทและกําหนดเวลาที่แม่นยํา โมเดลนี้มีความเป็นเลิศในด้านเมตริกคุณภาพเสียงแบบดั้งเดิมและการประเมินตาม CoT นอกจากนี้ บน MovieGen Audio Bench ซึ่งเป็นเกณฑ์มาตรฐานที่ประเมินความสามารถในการสร้างเสียงวิดีโอ ThinkSound มีประสิทธิภาพเหนือกว่ารุ่นชั้นนําอื่นๆ อย่างมาก

การเปรียบเทียบโมเดลพื้นฐาน ThinkSound ของเรากับพื้นฐานวิดีโอเป็นเสียงที่มีอยู่ในชุดทดสอบ VGGSound ↓ แสดงว่าต่ํายิ่งดี ↑ แสดงว่าสูงยิ่งดี

ThinkSound สามารถผสานรวมกับโมเดลการสร้างวิดีโอต่างๆ ได้อย่างราบรื่นเพื่อให้เสียงพากย์และซาวด์แทร็กที่สมจริงสําหรับวิดีโอสังเคราะห์ ความสามารถในการสร้างเสียงที่ซับซ้อนนําเสนอการใช้งานที่มีศักยภาพอย่างมากในการออกแบบเสียงภาพยนตร์และโทรทัศน์

ThinkSound พร้อมใช้งานแล้วในโอเพ่นซอร์สบน Hugging Face, GitHub และ Model Studio ของอาลีบาบา

การประเมินนอกการจัดจําหน่ายบน MovieGen Audio Bench

เลือกชมสินค้ามากมาย และให้เราสั่งซื้อสินค้าให้คุณ

SHOPPING MALL

อาลีบาบาเปิดตัว ThinkSound: โมเดล AI ที่สร้างเสียงที่สมจริงสําหรับวิดีโอ

เทคโนโลยีเกิดใหม่|เผยแพร่เมื่อ 16 กรกฎาคม 2025
เผยแพร่เมื่อ 16 กรกฎาคม 2025

  • โมเดล ThinkSound แบบโอเพ่นซอร์สอํานวยความสะดวกในการสร้างเสียงแบบโต้ตอบทีละขั้นตอนและแก้ไขเนื้อหาวิดีโอ
  • รองรับการสร้างวิดีโอเป็นเสียง การแก้ไขเสียงแบบข้อความ และการสร้างเสียงแบบโต้ตอบบนอุปกรณ์ Edge

การสร้างเสียงคุณภาพสูงสําหรับเนื้อหาวิดีโอนําเสนอความท้าทายทางเทคนิคและความคิดสร้างสรรค์มากมาย ซึ่งส่งผลกระทบต่อทั้งมือใหม่และผู้เชี่ยวชาญด้านเสียงที่มีประสบการณ์ โปรดิวเซอร์มักจะต่อสู้กับปัญหาต่างๆ เช่น การจัดการเสียงรบกวน การสร้างสมดุลระหว่างบทสนทนากับเอฟเฟกต์เสียง การปฏิบัติตามข้อจํากัดด้านงบประมาณและเวลา และการรักษาความสม่ําเสมอของความคิดสร้างสรรค์ การแปลวิสัยทัศน์ทางศิลปะให้เป็นผลิตภัณฑ์ขั้นสุดท้ายที่เหนียวแน่นซึ่งสะท้อนถึงพลวัตของภาพ สภาพแวดล้อมทางเสียง และจังหวะเวลาได้อย่างแม่นยําก็ยังคงเป็นเรื่องที่ท้าทายเช่นกัน

เพื่อจัดการกับความท้าทายเหล่านี้ Tongyi Speech Lab ของอาลีบาบาได้เปิดตัว ThinkSound ซึ่งเป็น LLM แบบโอเพ่นซอร์สแบบใหม่ที่ใช้เหตุผล Chain-of-Thought (CoT) สําหรับการสร้างและแก้ไขเสียงขั้นสูง ThinkSound นําเสนอแนวทางที่มีโครงสร้างและโต้ตอบในการผลิตเสียง ซึ่งปรับให้เหมาะกับเนื้อหาวิดีโอโดยเฉพาะ รุ่นนี้มีให้เลือกสามขนาดขนาดกะทัดรัด – พารามิเตอร์ 1.3B, 724M และ 533M รองรับการสร้างวิดีโอเป็นเสียง การแก้ไขเสียงแบบข้อความ และการสร้างเสียงแบบโต้ตอบ แม้ในอุปกรณ์ Edge

ThinkSound เลียนแบบเวิร์กโฟลว์หลายขั้นตอนของนักออกแบบเสียงของมนุษย์ เพื่อให้มั่นใจว่าเสียงที่สร้างขึ้นยังคงมีความแม่นยําตามบริบท เหนียวแน่น และมีคุณภาพสูงตลอดการผลิต โมเดลจะวิเคราะห์พลวัตของภาพของวิดีโอก่อน ตีความแอตทริบิวต์อะคูสติกที่สอดคล้องกันอย่างมีเหตุผล จากนั้นจึงสังเคราะห์เสียงที่เหมาะสมตามบริบท

ด้วยแนวทางที่เป็นนวัตกรรมใหม่ ThinkSound ช่วยให้ผู้ใช้สามารถสร้างซาวด์สเคปที่มีรายละเอียดและสอดคล้องกัน ปรับแต่งเสียงที่สร้างขึ้นผ่านการโต้ตอบของผู้ใช้ที่ใช้งานง่าย และแก้ไขส่วนเสียงเฉพาะโดยใช้คําแนะนําภาษาธรรมชาติ

นอกจากนี้ ทีมวิจัยของอาลีบาบายังได้แนะนํา AudioCoT ซึ่งเป็นชุดข้อมูลหลายรูปแบบขนาดใหญ่ที่มีคําอธิบายประกอบ CoT เฉพาะเสียง ซึ่งช่วยเพิ่มความสอดคล้องระหว่างเนื้อหาภาพ คําอธิบายข้อความ และการสังเคราะห์เสียง

การประเมินอย่างกว้างขวางแสดงให้เห็นว่า ThinkSound บรรลุประสิทธิภาพที่ล้ําสมัยในการสร้างวิดีโอเป็นเสียง โดยให้ซาวด์สเคปที่แม่นยําตามบริบทและกําหนดเวลาที่แม่นยํา โมเดลนี้มีความเป็นเลิศในด้านเมตริกคุณภาพเสียงแบบดั้งเดิมและการประเมินตาม CoT นอกจากนี้ บน MovieGen Audio Bench ซึ่งเป็นเกณฑ์มาตรฐานที่ประเมินความสามารถในการสร้างเสียงวิดีโอ ThinkSound มีประสิทธิภาพเหนือกว่ารุ่นชั้นนําอื่นๆ อย่างมาก

การเปรียบเทียบโมเดลพื้นฐาน ThinkSound ของเรากับพื้นฐานวิดีโอเป็นเสียงที่มีอยู่ในชุดทดสอบ VGGSound ↓ แสดงว่าต่ํายิ่งดี ↑ แสดงว่าสูงยิ่งดี

ThinkSound สามารถผสานรวมกับโมเดลการสร้างวิดีโอต่างๆ ได้อย่างราบรื่นเพื่อให้เสียงพากย์และซาวด์แทร็กที่สมจริงสําหรับวิดีโอสังเคราะห์ ความสามารถในการสร้างเสียงที่ซับซ้อนนําเสนอการใช้งานที่มีศักยภาพอย่างมากในการออกแบบเสียงภาพยนตร์และโทรทัศน์

ThinkSound พร้อมใช้งานแล้วในโอเพ่นซอร์สบน Hugging Face, GitHub และ Model Studio ของอาลีบาบา

การประเมินนอกการจัดจําหน่ายบน MovieGen Audio Bench

เลือกชมสินค้ามากมาย และให้เราสั่งซื้อให้คุณ

SHOPPING MALL

ให้เราสั่งซื้อสินค้าให้คุณ

SHOPPING MALL

คุณอาจชอบเนื้อหานี้

Privacy Preference Center