- Home
- เทคโนโลยี
- เทคโนโลยีเกิดใหม่
- อาลีบาบาเปิดตัว ThinkSound: โมเดล AI ที่สร้างเสียงที่สมจริงสําหรับวิดีโอ
อาลีบาบาเปิดตัว ThinkSound: โมเดล AI ที่สร้างเสียงที่สมจริงสําหรับวิดีโอ

- โมเดล ThinkSound แบบโอเพ่นซอร์สอํานวยความสะดวกในการสร้างเสียงแบบโต้ตอบทีละขั้นตอนและแก้ไขเนื้อหาวิดีโอ
- รองรับการสร้างวิดีโอเป็นเสียง การแก้ไขเสียงแบบข้อความ และการสร้างเสียงแบบโต้ตอบบนอุปกรณ์ Edge
การสร้างเสียงคุณภาพสูงสําหรับเนื้อหาวิดีโอนําเสนอความท้าทายทางเทคนิคและความคิดสร้างสรรค์มากมาย ซึ่งส่งผลกระทบต่อทั้งมือใหม่และผู้เชี่ยวชาญด้านเสียงที่มีประสบการณ์ โปรดิวเซอร์มักจะต่อสู้กับปัญหาต่างๆ เช่น การจัดการเสียงรบกวน การสร้างสมดุลระหว่างบทสนทนากับเอฟเฟกต์เสียง การปฏิบัติตามข้อจํากัดด้านงบประมาณและเวลา และการรักษาความสม่ําเสมอของความคิดสร้างสรรค์ การแปลวิสัยทัศน์ทางศิลปะให้เป็นผลิตภัณฑ์ขั้นสุดท้ายที่เหนียวแน่นซึ่งสะท้อนถึงพลวัตของภาพ สภาพแวดล้อมทางเสียง และจังหวะเวลาได้อย่างแม่นยําก็ยังคงเป็นเรื่องที่ท้าทายเช่นกัน
เพื่อจัดการกับความท้าทายเหล่านี้ Tongyi Speech Lab ของอาลีบาบาได้เปิดตัว ThinkSound ซึ่งเป็น LLM แบบโอเพ่นซอร์สแบบใหม่ที่ใช้เหตุผล Chain-of-Thought (CoT) สําหรับการสร้างและแก้ไขเสียงขั้นสูง ThinkSound นําเสนอแนวทางที่มีโครงสร้างและโต้ตอบในการผลิตเสียง ซึ่งปรับให้เหมาะกับเนื้อหาวิดีโอโดยเฉพาะ รุ่นนี้มีให้เลือกสามขนาดขนาดกะทัดรัด – พารามิเตอร์ 1.3B, 724M และ 533M รองรับการสร้างวิดีโอเป็นเสียง การแก้ไขเสียงแบบข้อความ และการสร้างเสียงแบบโต้ตอบ แม้ในอุปกรณ์ Edge
ThinkSound เลียนแบบเวิร์กโฟลว์หลายขั้นตอนของนักออกแบบเสียงของมนุษย์ เพื่อให้มั่นใจว่าเสียงที่สร้างขึ้นยังคงมีความแม่นยําตามบริบท เหนียวแน่น และมีคุณภาพสูงตลอดการผลิต โมเดลจะวิเคราะห์พลวัตของภาพของวิดีโอก่อน ตีความแอตทริบิวต์อะคูสติกที่สอดคล้องกันอย่างมีเหตุผล จากนั้นจึงสังเคราะห์เสียงที่เหมาะสมตามบริบท
ด้วยแนวทางที่เป็นนวัตกรรมใหม่ ThinkSound ช่วยให้ผู้ใช้สามารถสร้างซาวด์สเคปที่มีรายละเอียดและสอดคล้องกัน ปรับแต่งเสียงที่สร้างขึ้นผ่านการโต้ตอบของผู้ใช้ที่ใช้งานง่าย และแก้ไขส่วนเสียงเฉพาะโดยใช้คําแนะนําภาษาธรรมชาติ
นอกจากนี้ ทีมวิจัยของอาลีบาบายังได้แนะนํา AudioCoT ซึ่งเป็นชุดข้อมูลหลายรูปแบบขนาดใหญ่ที่มีคําอธิบายประกอบ CoT เฉพาะเสียง ซึ่งช่วยเพิ่มความสอดคล้องระหว่างเนื้อหาภาพ คําอธิบายข้อความ และการสังเคราะห์เสียง
การประเมินอย่างกว้างขวางแสดงให้เห็นว่า ThinkSound บรรลุประสิทธิภาพที่ล้ําสมัยในการสร้างวิดีโอเป็นเสียง โดยให้ซาวด์สเคปที่แม่นยําตามบริบทและกําหนดเวลาที่แม่นยํา โมเดลนี้มีความเป็นเลิศในด้านเมตริกคุณภาพเสียงแบบดั้งเดิมและการประเมินตาม CoT นอกจากนี้ บน MovieGen Audio Bench ซึ่งเป็นเกณฑ์มาตรฐานที่ประเมินความสามารถในการสร้างเสียงวิดีโอ ThinkSound มีประสิทธิภาพเหนือกว่ารุ่นชั้นนําอื่นๆ อย่างมาก

ThinkSound สามารถผสานรวมกับโมเดลการสร้างวิดีโอต่างๆ ได้อย่างราบรื่นเพื่อให้เสียงพากย์และซาวด์แทร็กที่สมจริงสําหรับวิดีโอสังเคราะห์ ความสามารถในการสร้างเสียงที่ซับซ้อนนําเสนอการใช้งานที่มีศักยภาพอย่างมากในการออกแบบเสียงภาพยนตร์และโทรทัศน์
ThinkSound พร้อมใช้งานแล้วในโอเพ่นซอร์สบน Hugging Face, GitHub และ Model Studio ของอาลีบาบา

แบ่งปัน
คุณอาจชอบเนื้อหานี้
เลือกชมสินค้ามากมาย และให้เราสั่งซื้อสินค้าให้คุณ
เนื้อหายอดนิยม
อาลีบาบาเปิดตัว ThinkSound: โมเดล AI ที่สร้างเสียงที่สมจริงสําหรับวิดีโอ

- โมเดล ThinkSound แบบโอเพ่นซอร์สอํานวยความสะดวกในการสร้างเสียงแบบโต้ตอบทีละขั้นตอนและแก้ไขเนื้อหาวิดีโอ
- รองรับการสร้างวิดีโอเป็นเสียง การแก้ไขเสียงแบบข้อความ และการสร้างเสียงแบบโต้ตอบบนอุปกรณ์ Edge
การสร้างเสียงคุณภาพสูงสําหรับเนื้อหาวิดีโอนําเสนอความท้าทายทางเทคนิคและความคิดสร้างสรรค์มากมาย ซึ่งส่งผลกระทบต่อทั้งมือใหม่และผู้เชี่ยวชาญด้านเสียงที่มีประสบการณ์ โปรดิวเซอร์มักจะต่อสู้กับปัญหาต่างๆ เช่น การจัดการเสียงรบกวน การสร้างสมดุลระหว่างบทสนทนากับเอฟเฟกต์เสียง การปฏิบัติตามข้อจํากัดด้านงบประมาณและเวลา และการรักษาความสม่ําเสมอของความคิดสร้างสรรค์ การแปลวิสัยทัศน์ทางศิลปะให้เป็นผลิตภัณฑ์ขั้นสุดท้ายที่เหนียวแน่นซึ่งสะท้อนถึงพลวัตของภาพ สภาพแวดล้อมทางเสียง และจังหวะเวลาได้อย่างแม่นยําก็ยังคงเป็นเรื่องที่ท้าทายเช่นกัน
เพื่อจัดการกับความท้าทายเหล่านี้ Tongyi Speech Lab ของอาลีบาบาได้เปิดตัว ThinkSound ซึ่งเป็น LLM แบบโอเพ่นซอร์สแบบใหม่ที่ใช้เหตุผล Chain-of-Thought (CoT) สําหรับการสร้างและแก้ไขเสียงขั้นสูง ThinkSound นําเสนอแนวทางที่มีโครงสร้างและโต้ตอบในการผลิตเสียง ซึ่งปรับให้เหมาะกับเนื้อหาวิดีโอโดยเฉพาะ รุ่นนี้มีให้เลือกสามขนาดขนาดกะทัดรัด – พารามิเตอร์ 1.3B, 724M และ 533M รองรับการสร้างวิดีโอเป็นเสียง การแก้ไขเสียงแบบข้อความ และการสร้างเสียงแบบโต้ตอบ แม้ในอุปกรณ์ Edge
ThinkSound เลียนแบบเวิร์กโฟลว์หลายขั้นตอนของนักออกแบบเสียงของมนุษย์ เพื่อให้มั่นใจว่าเสียงที่สร้างขึ้นยังคงมีความแม่นยําตามบริบท เหนียวแน่น และมีคุณภาพสูงตลอดการผลิต โมเดลจะวิเคราะห์พลวัตของภาพของวิดีโอก่อน ตีความแอตทริบิวต์อะคูสติกที่สอดคล้องกันอย่างมีเหตุผล จากนั้นจึงสังเคราะห์เสียงที่เหมาะสมตามบริบท
ด้วยแนวทางที่เป็นนวัตกรรมใหม่ ThinkSound ช่วยให้ผู้ใช้สามารถสร้างซาวด์สเคปที่มีรายละเอียดและสอดคล้องกัน ปรับแต่งเสียงที่สร้างขึ้นผ่านการโต้ตอบของผู้ใช้ที่ใช้งานง่าย และแก้ไขส่วนเสียงเฉพาะโดยใช้คําแนะนําภาษาธรรมชาติ
นอกจากนี้ ทีมวิจัยของอาลีบาบายังได้แนะนํา AudioCoT ซึ่งเป็นชุดข้อมูลหลายรูปแบบขนาดใหญ่ที่มีคําอธิบายประกอบ CoT เฉพาะเสียง ซึ่งช่วยเพิ่มความสอดคล้องระหว่างเนื้อหาภาพ คําอธิบายข้อความ และการสังเคราะห์เสียง
การประเมินอย่างกว้างขวางแสดงให้เห็นว่า ThinkSound บรรลุประสิทธิภาพที่ล้ําสมัยในการสร้างวิดีโอเป็นเสียง โดยให้ซาวด์สเคปที่แม่นยําตามบริบทและกําหนดเวลาที่แม่นยํา โมเดลนี้มีความเป็นเลิศในด้านเมตริกคุณภาพเสียงแบบดั้งเดิมและการประเมินตาม CoT นอกจากนี้ บน MovieGen Audio Bench ซึ่งเป็นเกณฑ์มาตรฐานที่ประเมินความสามารถในการสร้างเสียงวิดีโอ ThinkSound มีประสิทธิภาพเหนือกว่ารุ่นชั้นนําอื่นๆ อย่างมาก

ThinkSound สามารถผสานรวมกับโมเดลการสร้างวิดีโอต่างๆ ได้อย่างราบรื่นเพื่อให้เสียงพากย์และซาวด์แทร็กที่สมจริงสําหรับวิดีโอสังเคราะห์ ความสามารถในการสร้างเสียงที่ซับซ้อนนําเสนอการใช้งานที่มีศักยภาพอย่างมากในการออกแบบเสียงภาพยนตร์และโทรทัศน์
ThinkSound พร้อมใช้งานแล้วในโอเพ่นซอร์สบน Hugging Face, GitHub และ Model Studio ของอาลีบาบา













