Bendi新闻
>
AI智能体的炒作与现实:GPT-4都撑不起,现实任务成功率不到15%
AI智能体的炒作与现实:GPT-4都撑不起,现实任务成功率不到15%
5月前
AI 智能体的宣传很好,现实不太妙。
随着大语言模型的不断进化与自我革新,性能、准确度、稳定性都有了大幅的提升,这已经被各个基准问题集验证过了。
单一智能体:一个大型模型处理整个任务,并基于其全面的上下文理解做出所有决策和行动。这种方法利用了大型模型的涌现能力,避免了将任务分解所带来的信息丢失。 多智能体系统:将任务分解为子任务,每个子任务由一个更小、更专业的智能体处理。与尝试使用一个难以控制和测试的大型通用智能体相比,人们可以使用许多更小的智能体来为特定子任务选择正确的策略。由于上下文窗口长度的限制或不同技能组合的需要等实际约束,这种方法有时是必要的。
可靠性:众所周知,LLMs 容易产生幻觉和不一致性。将多个 AI 步骤连接起来会加剧这些问题,尤其是对于需要精确输出的任务。 性能和成本:GPT-4、Gemini-1.5 和 Claude Opus 在使用工具 / 函数调用方面表现不错,但它们仍然较慢且成本高,特别是如果需要进行循环和自动重试时。 法律问题:公司可能需要对其智能体的错误负责。最近的一个例子是,加拿大航空被命令向一位被航空公司聊天机器人误导的客户赔偿。 用户信任:AI 智能体的「黑箱」性质以及类似示例使得用户难以理解和信任其输出。在涉及支付或个人信息的敏感任务中(如支付账单、购物等),赢得用户信任将会很困难。
adept.ai - 融资 3.5 亿美元,但访问权限仍然非常有限。 MultiOn - 融资情况未知,他们的 API 优先方法看起来很有前景。 HypeWrite - 融资 280 万美元,起初是一个 AI 写作助手,后来扩展到智能体领域。 minion.ai - 最初引起了一些关注,但现在已经沉寂,仅有等候名单。
近期的重点应放在利用 AI 增强现有工具,而不是提供广泛的全自主独立服务。 人机协同的方法,让人类参与监督和处理边缘案例。 根据当前的能力和局限,设定不脱离现实的期望。
© THE END
转载请联系本公众号获得授权
投稿或寻求报道:[email protected]
微信扫码关注该文公众号作者
来源:机器之心
相关新闻
《巨浪:生成式AI的史诗与现实》序言吴恩达:AI 智能体的未来|Z Talk李彦宏谈生成式AI未来趋势:更看好智能体,就像AI时代的网站我们是如何在 IDE 中设计 AutoDev 的 AI 编程开发智能体语言与框架?可执行单元校验:在 IDE 中提升 AI 智能体代码的准确性知乎AI革命:智能搜索与实时问答的融合AI伴侣聊天机器人模糊了幻想与现实的界限港中文徐教授1v1科研:基于AI的智能停车场预测管理系统|收获一作论文与导师推荐信!深圳本周六:100位产品人与AI大模型的深度对话,4位实战专家现场剖析产品经理的新战场鹅厂造了个AI翻译公司:专攻网络小说,自动适配语言风格,真人和GPT-4看了都说好OpenAI创始人:目前的首要任务是推出新模型;三星发布搭载谷歌AI工具的Galaxy S24智能手机丨AIGC日报AI成功改写人类DNA:全球首个基因编辑器开源;浙江大学首次实现汉字书写脑机接口,“意念写字”成现实丨AIGC日报苹果智能炸裂登场:直接GPT-4o加持,全家桶都上生成式AI,Siri脱胎换骨智谱 AI 推出新一代基座大模型 GLM-4,能力逼近 GPT-4,配备多模态、长文本和智能体玻璃心勿入,用了这个尖酸刻薄的AI智能体,博主们集体自闭!吴晓波X漆远X徐立:与AI的最早入局者,聊聊十年后的世界|今日直播蔚来任少卿:AI进入现实世界,车企会更有优势|36氪专访吴恩达:AI智能体工作流今年将有巨大进展,可能超过下一代基础模型别捣鼓AI提示词了,AI Agent智能体的未来已来!财报解读:云与AI的时代,微软离成为最终赢家还有多远?AI时代红利:智能体成香饽饽,67.5万人都在用,你还在等什么?2024 年巴菲特股东大会 4 万字全文:AI的影响力,堪比原子弹!2024年巴菲特股东大会4万字全文:AI的影响力,堪比原子弹!全国首例AI声音侵权案解读:AI的语音素材与责任的边界