微信扫码
与创始人交个朋友
我要投稿
这是字节跳动开源的 UI-TARS 桌面版应用,用自然语言就能控制电脑!核心内容:1. 应用的快速阅读功能2. 支持的部署方式3. 详细的安装和配置教程及运行示例
UI-TARS Desktop 是一款基于视觉语言模型(Vision-Language Model)的 GUI 代理应用,允许用户通过自然语言控制电脑操作。它结合了视觉识别和自然语言处理技术,能够理解用户的指令并执行相应的操作。
该应用支持跨平台运行,适用于 Windows 和 MacOS 系统。通过实时反馈和状态显示,用户可以直观地看到指令的执行情况,确保操作的精准性和高效性。
你可以从 GitHub 仓库下载最新版本的 UI-TARS Desktop。
https://github.com/bytedance/UI-TARS-desktop/releases/latest
注意:如果应用损坏,您可以在终端中使用以下命令来修复它。
sudo xattr -dr com.apple.quarantine /Applications/UI\ TARS.app
我们推荐使用 HuggingFace Inference Endpoints 进行快速部署。你可以参考以下两个官方文档:
推荐使用 vLLM 进行快速部署和推理。你需要安装 vllm>=0.6.1
:
pip install -U transformers
VLLM_VERSION=0.6.6
CUDA_VERSION=cu124
pip install vllm==${VLLM_VERSION} --extra-index-url https://download.pytorch.org/whl/${CUDA_VERSION}
这里提供了三种模型大小:2B、7B 和 72B。为了获得最佳性能,推荐使用 7B-DPO 或 72B-DPO 模型:
运行以下命令启动 OpenAI 兼容的 API 服务:
python -m vllm.entrypoints.openai.api_server --served-model-name ui-tars --model <path to your model>
在设置中输入你的 API 信息:
注意:VLM 基础 URL 是与 OpenAI 兼容的 API 端点(有关更多详细信息,请参阅 OpenAI API 协议文档)。
❤️ 如果你也关注 AI 的发展现状,且对 AI 应用开发非常感兴趣,我会每日分享大模型与 AI 领域的最新开源项目和应用,提供运行实例和实用教程,帮助你快速上手AI技术,欢迎关注我哦!
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费场景POC验证,效果验证后签署服务协议。零风险落地应用大模型,已交付160+中大型企业
2025-01-24
腾讯开源了混元3D模型生成后,各大开源3D模型生成对比
2025-01-24
2024年总结:人人都能实现高效的AI+方法论
2025-01-24
Ollama进阶-本地代码补全助手
2025-01-23
DeepSeek-R1论文速读
2025-01-22
提升RAG效率,从这五大开源数据抓取工具开始
2025-01-22
DeepSeek Engineer:集成 DeepSeek API 的开源 AI 编程助手,支持文件读取、编辑并生成结构化响应
2025-01-22
无需GPU本地轻松运行AI模型的开源项目LocalAI
2025-01-22
Cursor平替,Cline插件+DeepSeek使用教程和实际体验
2024-07-25
2024-05-06
2024-08-13
2024-06-12
2025-01-01
2024-07-11
2024-07-20
2024-09-20
2024-06-16
2024-06-10
2025-01-22
2025-01-16
2024-12-24
2024-12-20
2024-12-19
2024-11-22
2024-11-19
2024-11-13