微软发布一个基于纯视觉的 GPU 智能体:OmniParser 2.0 版本
微软发布一个基于纯视觉的 GPU 智能体:OmniParser 2.0 版本。
它能够将屏幕截图转化为 LLM 可读懂的结构化元素,提高多模态大模型的视觉识别准确度。
GitHub:https://github.com/microsoft/OmniParser
支持与不同的语言模型无缝集成,如OpenAI,DeepSeek,QWEN等。
轻松实现自动化测试、自动化操作等交互的场景。
![]()
微软发布一个基于纯视觉的 GPU 智能体:OmniParser 2.0 版本。
它能够将屏幕截图转化为 LLM 可读懂的结构化元素,提高多模态大模型的视觉识别准确度。
GitHub:https://github.com/microsoft/OmniParser
支持与不同的语言模型无缝集成,如OpenAI,DeepSeek,QWEN等。
轻松实现自动化测试、自动化操作等交互的场景。
![]()