Alibaba Cloud เปิดตัวโมเดลโอเพ่นซอร์สที่เข้าใจรูปภาพ – Taobao Thailand

ทั้งหมด                 Alibaba Group                 อีคอมเมิร์ซ                 เทคโนโลยี                 โลจิสติกส์            ความยั่งยืน                 ไลฟ์สไตล์


Alibaba Cloud เปิดตัวโมเดลโอเพ่นซอร์สที่เข้าใจรูปภาพ

เครดิตภาพ: Shutterstock
คลาวด์, เทคโนโลยีเกิดใหม่, ข่าวองค์กร|เผยแพร่เมื่อ 25 สิงหาคม 2023

  • โมเดลภาษาการมองเห็นขนาดใหญ่ของ Alibaba Cloud สามารถเข้าใจรูปภาพและข้อความที่ป้อนเป็นภาษาอังกฤษและจีน
  • ความเคลื่อนไหวดังกล่าวตอกย้ำความพยายามของ Alibaba Cloud ในการพัฒนาขีดความสามารถหลายรูปแบบสำหรับ LLM

Alibaba Cloud กล่าวเมื่อวันศุกร์ว่ากำลังเปิดตัวโมเดลภาษาวิชั่นขนาดใหญ่แบบโอเพ่นซอร์สสองโมเดลที่เข้าใจรูปภาพและข้อความ

Qwen-VL ซึ่งเป็นโมเดลภาษาการมองเห็นขนาดใหญ่ที่ได้รับการฝึกล่วงหน้า และ Qwen-VL-Chat เวอร์ชันที่ได้รับการปรับแต่งการสนทนา พร้อมให้ดาวน์โหลดแล้วบน ModelScope ชุมชนโมเดล AI ของ Alibaba Cloud และ Hugging Face แพลตฟอร์ม AI สำหรับการทำงานร่วมกัน

ทั้งสองรุ่นสามารถเข้าใจทั้งการป้อนรูปภาพและข้อความเป็นภาษาอังกฤษและจีน พวกเขาสามารถทำงานด้านภาพได้ เช่น ตอบคำถามปลายเปิดจากรูปภาพหลายรูป และสร้างคำบรรยายภาพ Qwen-VL-Chat สามารถทำงานที่ซับซ้อนมากขึ้นได้ เช่น การคำนวณทางคณิตศาสตร์ และการสร้างเรื่องราวจากรูปภาพหลายรูป

ทั้งสองรุ่นได้รับการฝึกอบรมโดยอิงจากรุ่นภาษาขนาดใหญ่ Qwen-7Bเวอร์ชันภาษาขนาดใหญ่ที่มีพารามิเตอร์ 7 พันล้านพารามิเตอร์ซึ่งเปิดให้ใช้งานแบบโอเพ่นซอร์สเมื่อต้นเดือนนี้ Alibaba Cloud กล่าวว่าเมื่อเทียบกับโมเดลภาษาการมองเห็นขนาดใหญ่แบบโอเพ่นซอร์สอื่นๆ Qwen-VL สามารถเข้าใจภาพด้วยความละเอียดสูงกว่า ซึ่งนำไปสู่การจดจำภาพและประสิทธิภาพการทำความเข้าใจที่ดีขึ้น


การเปิดตัวครั้งนี้เน้นย้ำถึงความพยายามของบริษัทคอมพิวเตอร์คลาวด์ในการพัฒนาขีดความสามารถหลายรูปแบบขั้นสูงสำหรับโมเดลภาษาขนาดใหญ่ ซึ่งสามารถประมวลผลประเภทข้อมูล รวมถึงรูปภาพและเสียงพร้อมกับข้อความได้ การรวมเอาข้อมูลทางประสาทสัมผัสอื่นๆ เข้ากับแบบจำลองภาษาขนาดใหญ่จะเปิดโอกาสให้มีการประยุกต์ใหม่ๆ สำหรับนักวิจัยและองค์กรเชิงพาณิชย์

ผลกระทบที่เหนือกว่าห้องปฏิบัติการ

ทั้งสองโมเดลสัญญาว่าจะเปลี่ยนวิธีที่ผู้ใช้โต้ตอบกับเนื้อหาภาพ ตัวอย่างเช่น นักวิจัยและองค์กรเชิงพาณิชย์สามารถสำรวจการใช้งานจริงได้ เช่น การใช้ประโยชน์จากแบบจำลองเพื่อสร้างคำบรรยายภาพสำหรับสำนักข่าว หรือช่วยเหลือผู้ที่ไม่ได้ใช้ภาษาจีนซึ่งไม่สามารถอ่านป้ายถนนในภาษาจีนได้

โมเดล Qwen-VL-Chat สามารถรองรับการถามตอบได้หลายรอบ เครดิตภาพ: อาลีบาบา คลาวด์

ด้วยความสามารถในการตอบคำถามด้วยภาพ พวกเขายังมีศักยภาพในการทำให้ผู้ใช้ที่ตาบอดและสายตาบางส่วนสามารถซื้อสินค้าได้มากขึ้น ซึ่งเป็นความพยายามที่ Alibaba Group ดำเนินการ

ตลาดออนไลน์ของอาลีบาบา เถาเป่า ได้เพิ่ม เทคโนโลยี การรู้จำอักขระด้วยแสงลงในเพจ เพื่อช่วยอ่านข้อความที่มีความบกพร่องทางการมองเห็น เช่น ข้อมูลจำเพาะของผลิตภัณฑ์ และคำอธิบายบนรูปภาพ โมเดลภาษาการมองเห็นขนาดใหญ่ที่เพิ่งเปิดตัวใหม่สามารถทำให้กระบวนการง่ายขึ้นโดยทำให้ผู้ที่มีความบกพร่องทางการมองเห็นได้รับคำตอบที่ต้องการจากภาพโดยอิงจากการสนทนาหลายรอบ

Alibaba Cloudกล่าวว่าโมเดลภาษาขนาดใหญ่ Qwen-7B ที่ได้รับการฝึกอบรมล่วงหน้าด้วยภาษาขนาดใหญ่ 7 พันล้านพารามิเตอร์ และ Qwen-7B-Chat เวอร์ชันที่ได้รับการปรับแต่งด้านการสนทนา ได้รับการดาวน์โหลดมากกว่า 400,000 ครั้งนับตั้งแต่เปิดตัวในหนึ่งเดือน ก่อนหน้านี้ ทั้งสองโมเดลมีไว้เพื่อช่วยให้นักพัฒนา นักวิจัย และองค์กรเชิงพาณิชย์สร้างโมเดล AI สร้างสรรค์ได้อย่างคุ้มต้นทุนมากขึ้น

เลือกชมสินค้ามากมาย และให้เราสั่งซื้อสินค้าให้คุณ

SHOPPING MALL

Alibaba Cloud เปิดตัวโมเดลโอเพ่นซอร์สที่เข้าใจรูปภาพ

เครดิตภาพ: Shutterstock
คลาวด์, เทคโนโลยีเกิดใหม่, ข่าวองค์กร|เผยแพร่เมื่อ 25 สิงหาคม 2023
เผยแพร่เมื่อ 25 สิงหาคม 2023

  • โมเดลภาษาการมองเห็นขนาดใหญ่ของ Alibaba Cloud สามารถเข้าใจรูปภาพและข้อความที่ป้อนเป็นภาษาอังกฤษและจีน
  • ความเคลื่อนไหวดังกล่าวตอกย้ำความพยายามของ Alibaba Cloud ในการพัฒนาขีดความสามารถหลายรูปแบบสำหรับ LLM

Alibaba Cloud กล่าวเมื่อวันศุกร์ว่ากำลังเปิดตัวโมเดลภาษาวิชั่นขนาดใหญ่แบบโอเพ่นซอร์สสองโมเดลที่เข้าใจรูปภาพและข้อความ

Qwen-VL ซึ่งเป็นโมเดลภาษาการมองเห็นขนาดใหญ่ที่ได้รับการฝึกล่วงหน้า และ Qwen-VL-Chat เวอร์ชันที่ได้รับการปรับแต่งการสนทนา พร้อมให้ดาวน์โหลดแล้วบน ModelScope ชุมชนโมเดล AI ของ Alibaba Cloud และ Hugging Face แพลตฟอร์ม AI สำหรับการทำงานร่วมกัน

ทั้งสองรุ่นสามารถเข้าใจทั้งการป้อนรูปภาพและข้อความเป็นภาษาอังกฤษและจีน พวกเขาสามารถทำงานด้านภาพได้ เช่น ตอบคำถามปลายเปิดจากรูปภาพหลายรูป และสร้างคำบรรยายภาพ Qwen-VL-Chat สามารถทำงานที่ซับซ้อนมากขึ้นได้ เช่น การคำนวณทางคณิตศาสตร์ และการสร้างเรื่องราวจากรูปภาพหลายรูป

ทั้งสองรุ่นได้รับการฝึกอบรมโดยอิงจากรุ่นภาษาขนาดใหญ่ Qwen-7Bเวอร์ชันภาษาขนาดใหญ่ที่มีพารามิเตอร์ 7 พันล้านพารามิเตอร์ซึ่งเปิดให้ใช้งานแบบโอเพ่นซอร์สเมื่อต้นเดือนนี้ Alibaba Cloud กล่าวว่าเมื่อเทียบกับโมเดลภาษาการมองเห็นขนาดใหญ่แบบโอเพ่นซอร์สอื่นๆ Qwen-VL สามารถเข้าใจภาพด้วยความละเอียดสูงกว่า ซึ่งนำไปสู่การจดจำภาพและประสิทธิภาพการทำความเข้าใจที่ดีขึ้น


การเปิดตัวครั้งนี้เน้นย้ำถึงความพยายามของบริษัทคอมพิวเตอร์คลาวด์ในการพัฒนาขีดความสามารถหลายรูปแบบขั้นสูงสำหรับโมเดลภาษาขนาดใหญ่ ซึ่งสามารถประมวลผลประเภทข้อมูล รวมถึงรูปภาพและเสียงพร้อมกับข้อความได้ การรวมเอาข้อมูลทางประสาทสัมผัสอื่นๆ เข้ากับแบบจำลองภาษาขนาดใหญ่จะเปิดโอกาสให้มีการประยุกต์ใหม่ๆ สำหรับนักวิจัยและองค์กรเชิงพาณิชย์

ผลกระทบที่เหนือกว่าห้องปฏิบัติการ

ทั้งสองโมเดลสัญญาว่าจะเปลี่ยนวิธีที่ผู้ใช้โต้ตอบกับเนื้อหาภาพ ตัวอย่างเช่น นักวิจัยและองค์กรเชิงพาณิชย์สามารถสำรวจการใช้งานจริงได้ เช่น การใช้ประโยชน์จากแบบจำลองเพื่อสร้างคำบรรยายภาพสำหรับสำนักข่าว หรือช่วยเหลือผู้ที่ไม่ได้ใช้ภาษาจีนซึ่งไม่สามารถอ่านป้ายถนนในภาษาจีนได้

โมเดล Qwen-VL-Chat สามารถรองรับการถามตอบได้หลายรอบ เครดิตภาพ: อาลีบาบา คลาวด์

ด้วยความสามารถในการตอบคำถามด้วยภาพ พวกเขายังมีศักยภาพในการทำให้ผู้ใช้ที่ตาบอดและสายตาบางส่วนสามารถซื้อสินค้าได้มากขึ้น ซึ่งเป็นความพยายามที่ Alibaba Group ดำเนินการ

ตลาดออนไลน์ของอาลีบาบา เถาเป่า ได้เพิ่ม เทคโนโลยี การรู้จำอักขระด้วยแสงลงในเพจ เพื่อช่วยอ่านข้อความที่มีความบกพร่องทางการมองเห็น เช่น ข้อมูลจำเพาะของผลิตภัณฑ์ และคำอธิบายบนรูปภาพ โมเดลภาษาการมองเห็นขนาดใหญ่ที่เพิ่งเปิดตัวใหม่สามารถทำให้กระบวนการง่ายขึ้นโดยทำให้ผู้ที่มีความบกพร่องทางการมองเห็นได้รับคำตอบที่ต้องการจากภาพโดยอิงจากการสนทนาหลายรอบ

Alibaba Cloudกล่าวว่าโมเดลภาษาขนาดใหญ่ Qwen-7B ที่ได้รับการฝึกอบรมล่วงหน้าด้วยภาษาขนาดใหญ่ 7 พันล้านพารามิเตอร์ และ Qwen-7B-Chat เวอร์ชันที่ได้รับการปรับแต่งด้านการสนทนา ได้รับการดาวน์โหลดมากกว่า 400,000 ครั้งนับตั้งแต่เปิดตัวในหนึ่งเดือน ก่อนหน้านี้ ทั้งสองโมเดลมีไว้เพื่อช่วยให้นักพัฒนา นักวิจัย และองค์กรเชิงพาณิชย์สร้างโมเดล AI สร้างสรรค์ได้อย่างคุ้มต้นทุนมากขึ้น

เลือกชมสินค้ามากมาย และให้เราสั่งซื้อให้คุณ

SHOPPING MALL

ให้เราสั่งซื้อสินค้าให้คุณ

SHOPPING MALL

คุณอาจชอบเนื้อหานี้

Privacy Preference Center