微信扫码
添加专属顾问
我要投稿
这是字节跳动开源的 UI-TARS 桌面版应用,用自然语言就能控制电脑! 核心内容: 1. 应用的快速阅读功能 2. 支持的部署方式 3. 详细的安装和配置教程及运行示例
UI-TARS Desktop 是一款基于视觉语言模型(Vision-Language Model)的 GUI 代理应用,允许用户通过自然语言控制电脑操作。它结合了视觉识别和自然语言处理技术,能够理解用户的指令并执行相应的操作。
该应用支持跨平台运行,适用于 Windows 和 MacOS 系统。通过实时反馈和状态显示,用户可以直观地看到指令的执行情况,确保操作的精准性和高效性。
你可以从 GitHub 仓库下载最新版本的 UI-TARS Desktop。
https://github.com/bytedance/UI-TARS-desktop/releases/latest
注意:如果应用损坏,您可以在终端中使用以下命令来修复它。
sudo xattr -dr com.apple.quarantine /Applications/UI\ TARS.app
我们推荐使用 HuggingFace Inference Endpoints 进行快速部署。你可以参考以下两个官方文档:
推荐使用 vLLM 进行快速部署和推理。你需要安装 vllm>=0.6.1
:
pip install -U transformers
VLLM_VERSION=0.6.6
CUDA_VERSION=cu124
pip install vllm==${VLLM_VERSION} --extra-index-url https://download.pytorch.org/whl/${CUDA_VERSION}
这里提供了三种模型大小:2B、7B 和 72B。为了获得最佳性能,推荐使用 7B-DPO 或 72B-DPO 模型:
运行以下命令启动 OpenAI 兼容的 API 服务:
python -m vllm.entrypoints.openai.api_server --served-model-name ui-tars --model <path to your model>
在设置中输入你的 API 信息:
注意:VLM 基础 URL 是与 OpenAI 兼容的 API 端点(有关更多详细信息,请参阅 OpenAI API 协议文档)。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费场景POC验证,效果验证后签署服务协议。零风险落地应用大模型,已交付160+中大型企业
2025-04-24
AI+SQL客户端,这款开源神器让数据库管理像聊天一样简单!
2025-04-24
效率革命!GitHub爆火的开源神器MinerU:PDF、网页、电子书一键转Markdown
2025-04-24
Suna:构建你专属“通用智能体”的开源利器
2025-04-24
开源TTS领域迎来重磅新星!Dia-1.6B:超逼真对话生成,开源2天斩获6.5K Star!
2025-04-24
仅用3周时间,就打造出Manus开源平替!贡献源代码,免费用
2025-04-23
只需6G显存,就能本地跑的AI视频算法,开源了!
2025-04-23
OpenAI Codex 使用OpenRouter上的免费模型
2025-04-23
又一个牛皮的开源的通用型智能体界面和Manus有99分相似
2024-07-25
2025-01-01
2025-01-21
2024-05-06
2024-09-20
2024-07-20
2024-07-11
2024-06-12
2024-08-13
2024-12-26
2025-04-21
2025-04-19
2025-04-17
2025-04-15
2025-04-13
2025-04-10
2025-04-07
2025-04-03