苹果AI研究:“猕猴桃”简单算术考倒o1和Llama等20多个最先进模型
IT之家 11 月 2 日消息,《洛杉矶时报》昨日(11 月 1 日)发布博文,报道称苹果研究团队测试了 20 个最先进的 AI 模型,发现在有干扰项存在的情况下,它们处理简单的算术问题时表现不佳,甚至不如小学生。
苹果公司用以下这道简单的算术题测试 20 多个最先进的 AI 模型,IT之家附上题目如下:
Oliver 在星期五采摘了 44 个猕猴桃、然后他在星期六采摘了 58 个猕猴桃,星期日采摘的数量是星期五的两倍,不过其中有 5 个猕猴桃的块头要比平均值要小,请问 Oliver 这三天共摘了多少个猕猴桃?
正确答案是 190 个,计算公式为 44(星期五)+58(星期六)+88(44*2,星期日)。
不过测试的 20 多个最先进 AI 模型无法排除干扰项,通常不理解猕猴桃的大小和数量无关,大部分的结果是 185 个。
苹果团队发现,当问题包含看似相关但实际上无关的信息时,AI 模型的表现急剧下降。对此研究认为,AI 模型主要依赖于训练数据中的语言模式,而非真正理解数学概念。
苹果的研究表明,目前的 AI 模型“无法进行真正的逻辑推理”。这一发现提醒我们,尽管 AI 在某些任务上表现出色,但其智能并不如表面看起来那样可靠。
苹果团队指出,简单地扩展数据或计算能力并不能根本解决这个问题,苹果的论文并非旨在削弱对 AI 能力的热情,而是提供一种理性的认知。
-
苹果AI研究:“猕猴桃”简单算术考倒o1和Llama等20多个最先进模型
IT之家 11 月 2 日消息,《洛杉矶时报》昨日(11 月 1 日)发布博文,报道称苹果研究团队测试了 20 个最先进的 AI 模型,发现在有干扰项存在的情况下,它们处理简单的算术问题时表现不佳,甚至不如小学生。 苹果
2025-06-11 12:12:44 -
“AI捏捏”成解压神器,连甄嬛都被捏扁了,你还不会捏吗?
日前,继黏土小人滤镜之后,有一款AI特效已经火遍网络。有人评价它“太抽象了”,也有人表示“它是新的解压神器”,更有人称“它简直在演我的精神状态”,而这个全新的AI视频玩法则是“AI捏捏”。 没错,我们在线下看
2025-06-11 11:48:44 -
今年才完成破产重整的豆神教育,搭上AI能否翻盘?
10月31日收盘,豆神教育(SZ300010,股价10 80元,市值223 2亿元)再次“20CM”涨停,已实现“四连板”。而到了11月4日收盘,公司股价报收于10 80元,全天下跌15 63%。 这家今年才完成破产重整的教育企业,在北京智
2025-06-11 11:24:44 -
“重生”之我是李清照?中南大学女教授的AI创作火了
在没有相机的年代,人们会聘请画师来捕捉并留下自己的肖像,宛如一幅幅生动的“照片”。近日,有人用AI绘画技术成功将北宋诗词博主——李清照的形象复原了。看到她的那一刻,仿佛经历了一场穿越时空的邂逅,令人恍若
2025-06-11 11:00:44 -
前OpenAI高管:AI将很快在计算机上完成人类能做的一切
IT之家 11 月 4 日消息,据《商业内幕(Business Insider)》当地时间 3 日报道,OpenAI 前政策研究与“AGI (IT之家注:通用人工智能)准备工作”负责人 Miles Brundage 表示,未来几年行业可能会开发出“几乎能够
2025-06-11 10:36:44 -
报告:AI时代中企愿意变革,需具备六项能力
一份埃森哲的最新报告显示,更多的受访中国企业计划在未来开展投入、进行覆盖组织上下的变革举措。 根据这份题为《重塑变革——新蓝图:实现持续和高效的成功变革》的报告,未来三年内,100%的受访中企计划将超过5%
2025-06-11 10:12:44
-
Stability AI发布自家最强文生图模型Stable Diffusion 3!提示文本理解更好,图像质量更强
2月23日,著名大模型开源平台stability ai在官网推出了——Stable Diffusion 3 该版本与Stable Diffusion 2相比,在文本语义理解、色彩饱和度、图像构图、分辨率、类型、质感、对比度等方面大幅度增强,可对标闭源模型Midjourney。
2025-02-12 12:54:57 -
虚晃一枪:马斯克xAI喜获60亿美元融资,放弃起诉OpenAI
当地时间6月11日,据CNBC报道,马斯克已经从加州法院撤回了今年3月对OpenAI以及公司CEO奥特曼等人的司法诉讼。
2025-01-20 12:46:30 -
OpenAI大杀器SearchGPT横空出世,将单挑谷歌千亿美元搜索帝国!
OpenAI真来撼动谷歌的搜索帝国了?深夜悄悄上线的AI搜索引擎产品——SearchGPT,在同一问题的演示上,直接原地吊打谷歌和Perplexity。谷歌的AI Overview没做到的「重塑搜索引擎」,会让OpenAI达成吗?
2025-01-10 14:59:24 -
WAIC落幕:国产大模型大厂拼落地,中厂显焦虑丨月之暗面上线Kimi浏览器插件丨中国是AI论文发表最多的国家
【AI奇点网2024年7月9日早报】本站每日播报AI业界最新资讯,触摸时代脉搏,掌握未来科技动向。事不宜迟,点击查看今日AI资讯早餐。
2025-01-16 10:10:48 -
OpenAI重磅升级定档5月13日,CEO奥特曼暗示会有「魔法」效应,但GPT-5至少要等到年底
OpenAI终于要放大招了!官宣定档下周一线上直播,预计发布全新AI语音助手,还有ChatGPT、GPT-4一系列更新。奥特曼澄清,没有GPT-5,也没有搜索引擎!
2025-01-27 13:30:46 -
微信AI平台赋能中小企业:推出微信对话开放平台打造AI客服机器人,PC桌面机器人“小微助手”上线
微信 AI 团队在微信公开课 PRO 上分享了微信对话开放平台的最新能力升级和解决方案,这是微信首次对外公布旗下 AIGC 大模型应用落地的策略。
2025-02-17 16:40:44 -
谷歌计划明年将AI Overviews功能面向更多国家开放
当地时间12月11日,谷歌宣布推出最新AI模型Gemini 2 0。谷歌首席执行官桑达尔·皮查伊表示,会将Gemini 2 0的高级推理能力融入AI Overviews(AI概览),以攻克更复杂的主题和多步骤问题,包括高等数学方程、多模态
2025-05-17 09:30:55 -
IDC发布AI应用调查报告:文心一言发展较全面丨小爱音箱大模型版本升级指南丨Llama系列大模型下载量超3.5亿
【AI奇点网2024年9月4日早报】本站每日播报AI业界最新资讯,触摸时代脉搏,掌握未来科技动向。事不宜迟,点击查看今日AI资讯早餐。
2025-01-13 13:19:39 -
「可灵AI」发布会员订阅计划:每月19元起丨西湖心辰Lingo语音模型开放内测丨李彦宏:AI竞争将进入盈利能力竞争
【AI奇点网2024年8月26日早报】本站每日播报AI业界最新资讯,触摸时代脉搏,掌握未来科技动向。事不宜迟,点击查看今日AI资讯早餐。
2025-01-13 17:37:27 -
荣耀CEO赵明:荣耀不会造车,专注为个人打造未来AI世界更好使用的大模型
“在手机端很难复刻ChatGPT能力。因为基于人类的知识库进行AI交互并非AI手机的首要解决的应用场景。”荣耀CEO赵明对媒体们表示。
2025-01-24 09:08:18