搜索优化
English
搜索
图片
视频
地图
资讯
购物
Copilot
更多
航班
旅游
酒店
笔记本
Top stories
Sports
U.S.
Local
World
Science
Technology
Entertainment
Business
More
Politics
时间不限
过去 1 小时
过去 24 小时
过去 7 天
过去 30 天
按相关度排序
按时间排序
15 天
引领人机交互革命:微软发布80页大模型GUI智能体综述
在数字化加速发展的当今时代,图形用户界面(Graphical User ...
腾讯网
15 天
引领人机交互革命?微软研究团队发布80页的大模型GUI智能体综述
AIxiv专栏是机器之心发布学术、技术内容的栏目。过去数年,机器之心AIxiv专栏接收报道了2000多篇内容,覆盖全球各大高校与企业的顶级实验室,有效促进了学术交流与传播。如果您有优秀的工作想要分享,欢迎投稿或者联系报道。投稿邮箱:
[email protected]
;
[email protected]
本论文的主要作者 Chaoyun ...
15 天
微软发布重磅综述,揭秘大模型如何变革GUI智能交互
在数字时代,图形用户界面(Graphical User Interface,GUI)作为一项颠覆性创新,极大简化了人机交互的复杂性。自简单图标、按钮,到复杂的多应用工作流程,GUI为用户提供了直观而友好的体验。然而,随着自动化和智能化的不断进步,传统的GUI操作方式却面临不少挑战,尤其是在动态和高度复杂的现代应用环境中。自动化的脚本化方法和规则驱动方法在特定场景中仍有其价值,但其局限性随着技术的进 ...
腾讯网
1 天
字节清华开源力作!UI-TARS原生AI智能体,人人都能拥有“智能助手”
UI-TARS,这是一种原生的 GUI 智能体模型,它将感知、动作、推理和记忆集成到一个可扩展且适应性强的框架中。在诸如 OSWorld 之类的具有挑战性的基准测试中取得了最先进的性能,UI-TARS 的性能超越了 Claude 和 GPT-4o ...
搜狐
25 天
清华大学研究人员刚刚开源了 CogAgent-9B-20241220:CogAgent 的最新版本
CogAgent 的核心是利用 VLM 来解释 GUI 组件及其功能。通过处理视觉布局和语义信息,它可以精确可靠地执行按钮单击、文本输入和菜单导航等任务。
一些您可能无法访问的结果已被隐去。
显示无法访问的结果
反馈