多模态通用感知能力超越GPT-5,上海AI实验室开源书生・万象3.5大模型
9月3日消息,上海人工智能实验室(上海AI实验室)今日宣布开源通用多模态大模型书生・万象3.5(InternVL3.5),其推理能力、部署效率与通用能力全面升级。
InternVL3.5本次开源有9种尺寸的模型,参数涵盖10亿-2410亿,可满足各场景需求。其中,旗舰模型InternVL3.5-241B-A28B在多学科推理基准MMMU中获77.7分,为开源模型中最高分;多模态通用感知能力超越GPT-5,文本能力领跑主流开源多模态大模型。
与InternVL3.0相比,InternVL3.5在图形用户界面(GUI)智能体、具身空间感知、矢量图像理解与生成等多种特色任务上实现显著提升。
本次升级,上海AI实验室研究团队重点强化了InternVL3.5面向实际应用的智能体与文本思考能力,在GUI交互、具身空间推理和矢量图形处理等多个关键场景实现从“理解”到“行动”的跨越,并得到多项评测验证。
GUI交互部分,InternVL3.5在ScreenSpot-v2元素定位任务以92.9分超越同类模型,同时支持Windows/Ubuntu自动化操作,并在WindowsAgentArena任务大幅领先Claude-3.7-Sonnet。
在具身智能体测试中,InternVL3.5表现出理解物理空间关系并规划导航路径的能力,在VSI-Bench以69.5分超过Gemini-2.5-Pro。
在矢量图形理解与生成方面,InternVL3.5在SGP-Bench以70.7分刷新开源纪录,生成任务FID值也优于GPT-4o和Claude-3.7-Sonnet。
具体来看,InternVL3.5可跨Windows、Mac、Ubuntu、Android等多个平台,识别界面元素并自主执行鼠标、键盘操作,实现恢复已删除文件、导出PDF、邮件添加附件等任务的自动化。
InternVL3.5具备更强的grounding能力,可以泛化到全新的复杂大量小样本的具身场景,配合抓取算法,支持可泛化的长程物体抓取操作,助力机器人更高效地完成物品识别、路径规划与物理交互。
作为上海AI实验室书生大模型体系的重要组成部分,InternVL聚焦视觉模型技术,InternVL全系列全网下载量已突破2300万次。
附开源地址:
技术报告链接:https://huggingface.co/papers/2508.18265
代码开源/模型使用方法:https://github.com/OpenGVLab/InternVL
模型地址:https://huggingface.co/OpenGVLab/InternVL3_5-241B-A28B
在线体验链接:https://chat.intern-ai.org.cn/
-
多模态通用感知能力超越GPT-5,上海AI实验室开源书生・万象3.5大模型
InternVL35本次开源有9种尺寸的模型,参数涵盖10亿-2410亿,可满足各场景需求。其中,旗舰模型InternVL35-241B-A28B在多学科推理基准MMMU中获
2025-09-10 09:41:07 -
AI抢人类饭碗:SalesforceCEO证实公司裁掉了4000个客服
SalesforceCEO马克・贝尼奥夫透露,AI已取代4000个客户支持岗位,机器人客服团队“Agentforce”上岗。专家指出AI正影响多个行业就业,但分析师质疑部分公司将过度招聘后的裁员归咎
2025-09-10 09:11:07 -
Soul利用AI技术反诈保护年轻人社交安全
近日,SoulApp发布《2025生态安全半年报》,全面展示了平台在生态安全治理成果。作为深受年轻用户喜爱的社交平台,Soul始终将用户安全与体验放在首位,通过技术创新、多维度治理等举措,持续优
2025-09-09 11:15:07 -
又一主流型号标配AI!海尔多联机加速智能化布局
当传统中央空调还在依赖人工时,海尔已用AI技术重新定义行业规则。继7月MAX系列多联机免费标配AI后,海尔自9月1日起生产的Super系列多联机,为用户免费升级AI芯片,通过全流程智能化变革,实现
2025-09-09 10:45:07 -
即梦AI上线火山引擎,面向企业开放API服务
即梦AI正式上线火山引擎,面向企业开放API服务,涵盖图片生成、视频生成、数字人生成三大类多款前沿模型。这些模型已在即梦AI产品上得到大规模验证,适用于多种应用场景。即梦AI火山引擎
2025-09-09 10:15:07 -
去年苹果AI画饼:今年还能画出什么
去年各大手机厂商的AI功能开始真正落地,小米、OPPO、vivo和华为在语音助手、生成内容、翻译、影像拍照和智能推荐等方面纷纷实现突破,形成了丰富的用户可感知AI体验。而苹果则选择低调,在去
2025-09-09 09:45:07
-
OpenAI官宣奥特曼重返CEO岗位丨Windows 11画图工具升级DALL·E 3模型丨魅族发布手机端侧AI助手Aicy
【AI奇点网2023年12月1日早报】本站每日播报AI业界最新资讯,触摸时代脉搏,掌握未来科技动向。事不宜迟,点击查看今日AI资讯早餐。
2025-03-26 13:47:44 -
理想汽车发布多模态AI大模型Mind GPT:CMMLU大模型基准测评榜单斩获第一
12月11日下午,理想汽车举行理想汽车智能软件发布会,这是理想汽车诞生以来,最大的一次软件版本发布活动。该公司宣布其最新的OTA 5 0版本引入了自家研发的多模态认知大模型Mind GPT。
2025-04-29 09:45:10 -
警惕!有机构利用人工智能程序日产上千篇虚假新闻
有MCN机构利用人工智能程序日产上千篇虚假新闻,导致大量不实信息在网上病毒式传播;某小说平台账号依靠AI“创作”,每日更新十几本电子书,行文却逻辑不通、辞藻空洞;医学论文因使用AI生成的虚假配图而被撤稿……当
2025-06-19 16:49:44 -
火狐浏览器Firefox141.0正式发布!带来AI标签组、终于支持WebGPU
7月22日消息,Mozilla正式发布了Firefox1410版本,这一更新为用户带来了一系列新功能和改进。Firefox1410的亮点之一是引入了AI增强的自动标签分组功能,该功能可以自动将
2025-07-24 09:17:07 -
AI的下一阶段:“LifeOS”对文化娱乐生活的四大颠覆
你的“人生操作系统”
2025-08-16 07:05:33 -
零基础2天速成!白嫖「秋叶」官方AI绘画课程,卷死同事
和「秋叶」一起学AI绘画,掌握Stable Diffusion、Midjourney的使用方法,开展AI绘画副业,搞钱!?
2024-12-17 12:53:01 -
如何利用AIGC辅助春节海报设计丨附全套流程教程
2023年AI图像生成技术彻底影响了运营设计的工作流程,通过输入提示词、图片,AIGC工具能快速生成满足活动需求的创意内容,显著提升工作效率和设计多样性。面对时代趋势,今年春节让我们一起手把手使用AIGC工具,一起完成龙年春节海报吧。
2024-12-18 03:51:15 -
网易有道出品的开源AI语音合成工具EmotiVoice_合成不同情感的数字语音丨解压可用
AI合成语音,相信大家都不陌生。最近,网易有道开源了一款AI语音合成工具EmotiVoice,我这里第一时间制作了懒人包,可离线本地使用哦~
2024-12-19 04:34:37 -
Pika 1.0正式版教程_最好用的AI视频生成器_使用方法
Pika Labs这家仅成立六个月的公司,结束了测试版,正式发布第一个产品Pika 1 0 AI视频生成器,能够生成和编辑3D动画、2D动漫、卡通和各种画风的电影。
2024-12-19 10:48:11 -
GPT-4o多模态能力向所有用户免费开放丨百度将在2025年发布文心大模型5.0丨快手正式上线AI绘图大模型“可图”
【AI奇点网2024年5月30日早报】本站每日播报AI业界最新资讯,触摸时代脉搏,掌握未来科技动向。事不宜迟,点击查看今日AI资讯早餐。
2025-01-21 15:43:40















