微软发布一个基于纯视觉的 GPU 智能体:OmniParser 2.0 版本

微软发布一个基于纯视觉的 GPU 智能体:OmniParser 2.0 版本。

它能够将屏幕截图转化为 LLM 可读懂的结构化元素,提高多模态大模型的视觉识别准确度。

GitHub:https://github.com/microsoft/OmniParser

支持与不同的语言模型无缝集成,如OpenAI,DeepSeek,QWEN等。

轻松实现自动化测试、自动化操作等交互的场景。

原链接