Alibaba Cloud เปิดตัวโมเดลโอเพ่นซอร์สที่เข้าใจรูปภาพ

- โมเดลภาษาการมองเห็นขนาดใหญ่ของ Alibaba Cloud สามารถเข้าใจรูปภาพและข้อความที่ป้อนเป็นภาษาอังกฤษและจีน
- ความเคลื่อนไหวดังกล่าวตอกย้ำความพยายามของ Alibaba Cloud ในการพัฒนาขีดความสามารถหลายรูปแบบสำหรับ LLM
Alibaba Cloud กล่าวเมื่อวันศุกร์ว่ากำลังเปิดตัวโมเดลภาษาวิชั่นขนาดใหญ่แบบโอเพ่นซอร์สสองโมเดลที่เข้าใจรูปภาพและข้อความ
Qwen-VL ซึ่งเป็นโมเดลภาษาการมองเห็นขนาดใหญ่ที่ได้รับการฝึกล่วงหน้า และ Qwen-VL-Chat เวอร์ชันที่ได้รับการปรับแต่งการสนทนา พร้อมให้ดาวน์โหลดแล้วบน ModelScope ชุมชนโมเดล AI ของ Alibaba Cloud และ Hugging Face แพลตฟอร์ม AI สำหรับการทำงานร่วมกัน
ทั้งสองรุ่นสามารถเข้าใจทั้งการป้อนรูปภาพและข้อความเป็นภาษาอังกฤษและจีน พวกเขาสามารถทำงานด้านภาพได้ เช่น ตอบคำถามปลายเปิดจากรูปภาพหลายรูป และสร้างคำบรรยายภาพ Qwen-VL-Chat สามารถทำงานที่ซับซ้อนมากขึ้นได้ เช่น การคำนวณทางคณิตศาสตร์ และการสร้างเรื่องราวจากรูปภาพหลายรูป
ทั้งสองรุ่นได้รับการฝึกอบรมโดยอิงจากรุ่นภาษาขนาดใหญ่ Qwen-7Bเวอร์ชันภาษาขนาดใหญ่ที่มีพารามิเตอร์ 7 พันล้านพารามิเตอร์ซึ่งเปิดให้ใช้งานแบบโอเพ่นซอร์สเมื่อต้นเดือนนี้ Alibaba Cloud กล่าวว่าเมื่อเทียบกับโมเดลภาษาการมองเห็นขนาดใหญ่แบบโอเพ่นซอร์สอื่นๆ Qwen-VL สามารถเข้าใจภาพด้วยความละเอียดสูงกว่า ซึ่งนำไปสู่การจดจำภาพและประสิทธิภาพการทำความเข้าใจที่ดีขึ้น
การเปิดตัวครั้งนี้เน้นย้ำถึงความพยายามของบริษัทคอมพิวเตอร์คลาวด์ในการพัฒนาขีดความสามารถหลายรูปแบบขั้นสูงสำหรับโมเดลภาษาขนาดใหญ่ ซึ่งสามารถประมวลผลประเภทข้อมูล รวมถึงรูปภาพและเสียงพร้อมกับข้อความได้ การรวมเอาข้อมูลทางประสาทสัมผัสอื่นๆ เข้ากับแบบจำลองภาษาขนาดใหญ่จะเปิดโอกาสให้มีการประยุกต์ใหม่ๆ สำหรับนักวิจัยและองค์กรเชิงพาณิชย์
ผลกระทบที่เหนือกว่าห้องปฏิบัติการ
ทั้งสองโมเดลสัญญาว่าจะเปลี่ยนวิธีที่ผู้ใช้โต้ตอบกับเนื้อหาภาพ ตัวอย่างเช่น นักวิจัยและองค์กรเชิงพาณิชย์สามารถสำรวจการใช้งานจริงได้ เช่น การใช้ประโยชน์จากแบบจำลองเพื่อสร้างคำบรรยายภาพสำหรับสำนักข่าว หรือช่วยเหลือผู้ที่ไม่ได้ใช้ภาษาจีนซึ่งไม่สามารถอ่านป้ายถนนในภาษาจีนได้

ด้วยความสามารถในการตอบคำถามด้วยภาพ พวกเขายังมีศักยภาพในการทำให้ผู้ใช้ที่ตาบอดและสายตาบางส่วนสามารถซื้อสินค้าได้มากขึ้น ซึ่งเป็นความพยายามที่ Alibaba Group ดำเนินการ
ตลาดออนไลน์ของอาลีบาบา เถาเป่า ได้เพิ่ม เทคโนโลยี การรู้จำอักขระด้วยแสงลงในเพจ เพื่อช่วยอ่านข้อความที่มีความบกพร่องทางการมองเห็น เช่น ข้อมูลจำเพาะของผลิตภัณฑ์ และคำอธิบายบนรูปภาพ โมเดลภาษาการมองเห็นขนาดใหญ่ที่เพิ่งเปิดตัวใหม่สามารถทำให้กระบวนการง่ายขึ้นโดยทำให้ผู้ที่มีความบกพร่องทางการมองเห็นได้รับคำตอบที่ต้องการจากภาพโดยอิงจากการสนทนาหลายรอบ
Alibaba Cloudกล่าวว่าโมเดลภาษาขนาดใหญ่ Qwen-7B ที่ได้รับการฝึกอบรมล่วงหน้าด้วยภาษาขนาดใหญ่ 7 พันล้านพารามิเตอร์ และ Qwen-7B-Chat เวอร์ชันที่ได้รับการปรับแต่งด้านการสนทนา ได้รับการดาวน์โหลดมากกว่า 400,000 ครั้งนับตั้งแต่เปิดตัวในหนึ่งเดือน ก่อนหน้านี้ ทั้งสองโมเดลมีไว้เพื่อช่วยให้นักพัฒนา นักวิจัย และองค์กรเชิงพาณิชย์สร้างโมเดล AI สร้างสรรค์ได้อย่างคุ้มต้นทุนมากขึ้น
แบ่งปัน
คุณอาจชอบเนื้อหานี้
เลือกชมสินค้ามากมาย และให้เราสั่งซื้อสินค้าให้คุณ
เนื้อหายอดนิยม
Alibaba Cloud เปิดตัวโมเดลโอเพ่นซอร์สที่เข้าใจรูปภาพ

- โมเดลภาษาการมองเห็นขนาดใหญ่ของ Alibaba Cloud สามารถเข้าใจรูปภาพและข้อความที่ป้อนเป็นภาษาอังกฤษและจีน
- ความเคลื่อนไหวดังกล่าวตอกย้ำความพยายามของ Alibaba Cloud ในการพัฒนาขีดความสามารถหลายรูปแบบสำหรับ LLM
Alibaba Cloud กล่าวเมื่อวันศุกร์ว่ากำลังเปิดตัวโมเดลภาษาวิชั่นขนาดใหญ่แบบโอเพ่นซอร์สสองโมเดลที่เข้าใจรูปภาพและข้อความ
Qwen-VL ซึ่งเป็นโมเดลภาษาการมองเห็นขนาดใหญ่ที่ได้รับการฝึกล่วงหน้า และ Qwen-VL-Chat เวอร์ชันที่ได้รับการปรับแต่งการสนทนา พร้อมให้ดาวน์โหลดแล้วบน ModelScope ชุมชนโมเดล AI ของ Alibaba Cloud และ Hugging Face แพลตฟอร์ม AI สำหรับการทำงานร่วมกัน
ทั้งสองรุ่นสามารถเข้าใจทั้งการป้อนรูปภาพและข้อความเป็นภาษาอังกฤษและจีน พวกเขาสามารถทำงานด้านภาพได้ เช่น ตอบคำถามปลายเปิดจากรูปภาพหลายรูป และสร้างคำบรรยายภาพ Qwen-VL-Chat สามารถทำงานที่ซับซ้อนมากขึ้นได้ เช่น การคำนวณทางคณิตศาสตร์ และการสร้างเรื่องราวจากรูปภาพหลายรูป
ทั้งสองรุ่นได้รับการฝึกอบรมโดยอิงจากรุ่นภาษาขนาดใหญ่ Qwen-7Bเวอร์ชันภาษาขนาดใหญ่ที่มีพารามิเตอร์ 7 พันล้านพารามิเตอร์ซึ่งเปิดให้ใช้งานแบบโอเพ่นซอร์สเมื่อต้นเดือนนี้ Alibaba Cloud กล่าวว่าเมื่อเทียบกับโมเดลภาษาการมองเห็นขนาดใหญ่แบบโอเพ่นซอร์สอื่นๆ Qwen-VL สามารถเข้าใจภาพด้วยความละเอียดสูงกว่า ซึ่งนำไปสู่การจดจำภาพและประสิทธิภาพการทำความเข้าใจที่ดีขึ้น
การเปิดตัวครั้งนี้เน้นย้ำถึงความพยายามของบริษัทคอมพิวเตอร์คลาวด์ในการพัฒนาขีดความสามารถหลายรูปแบบขั้นสูงสำหรับโมเดลภาษาขนาดใหญ่ ซึ่งสามารถประมวลผลประเภทข้อมูล รวมถึงรูปภาพและเสียงพร้อมกับข้อความได้ การรวมเอาข้อมูลทางประสาทสัมผัสอื่นๆ เข้ากับแบบจำลองภาษาขนาดใหญ่จะเปิดโอกาสให้มีการประยุกต์ใหม่ๆ สำหรับนักวิจัยและองค์กรเชิงพาณิชย์
ผลกระทบที่เหนือกว่าห้องปฏิบัติการ
ทั้งสองโมเดลสัญญาว่าจะเปลี่ยนวิธีที่ผู้ใช้โต้ตอบกับเนื้อหาภาพ ตัวอย่างเช่น นักวิจัยและองค์กรเชิงพาณิชย์สามารถสำรวจการใช้งานจริงได้ เช่น การใช้ประโยชน์จากแบบจำลองเพื่อสร้างคำบรรยายภาพสำหรับสำนักข่าว หรือช่วยเหลือผู้ที่ไม่ได้ใช้ภาษาจีนซึ่งไม่สามารถอ่านป้ายถนนในภาษาจีนได้

ด้วยความสามารถในการตอบคำถามด้วยภาพ พวกเขายังมีศักยภาพในการทำให้ผู้ใช้ที่ตาบอดและสายตาบางส่วนสามารถซื้อสินค้าได้มากขึ้น ซึ่งเป็นความพยายามที่ Alibaba Group ดำเนินการ
ตลาดออนไลน์ของอาลีบาบา เถาเป่า ได้เพิ่ม เทคโนโลยี การรู้จำอักขระด้วยแสงลงในเพจ เพื่อช่วยอ่านข้อความที่มีความบกพร่องทางการมองเห็น เช่น ข้อมูลจำเพาะของผลิตภัณฑ์ และคำอธิบายบนรูปภาพ โมเดลภาษาการมองเห็นขนาดใหญ่ที่เพิ่งเปิดตัวใหม่สามารถทำให้กระบวนการง่ายขึ้นโดยทำให้ผู้ที่มีความบกพร่องทางการมองเห็นได้รับคำตอบที่ต้องการจากภาพโดยอิงจากการสนทนาหลายรอบ
Alibaba Cloudกล่าวว่าโมเดลภาษาขนาดใหญ่ Qwen-7B ที่ได้รับการฝึกอบรมล่วงหน้าด้วยภาษาขนาดใหญ่ 7 พันล้านพารามิเตอร์ และ Qwen-7B-Chat เวอร์ชันที่ได้รับการปรับแต่งด้านการสนทนา ได้รับการดาวน์โหลดมากกว่า 400,000 ครั้งนับตั้งแต่เปิดตัวในหนึ่งเดือน ก่อนหน้านี้ ทั้งสองโมเดลมีไว้เพื่อช่วยให้นักพัฒนา นักวิจัย และองค์กรเชิงพาณิชย์สร้างโมเดล AI สร้างสรรค์ได้อย่างคุ้มต้นทุนมากขึ้น











