自训视觉模型
用自己框选训练的定位 / 分类 / 分割模型,在流程里匹配图标、点击控件、等待界面出现。
形象、性格、声音三维个性化——换一套预设,桌面上的伙伴就变成「你的」。
用自然语言描述一次任务,经规划与试跑后保存——下次一句话即可复用。桌面操作、脚本、视觉识别与分支逻辑,都能串进同一条流水线。
「打开后台,把今日表格导出并发送。」
大模型采集工具能力,生成可执行步骤方案。
确认无误再保存,避免盲目执行。
热键、语音或聊天一句「运行流程」即可再跑。
不只是点鼠标。自己训练的视觉模型、AI 写的脚本、流程逻辑与桌面操作,都能编进可复用的自动化。
用自己框选训练的定位 / 分类 / 分割模型,在流程里匹配图标、点击控件、等待界面出现。
自然语言生成 Python 脚本,语法校验后入库;流程步骤可直接调用,复杂计算交给代码。
顺序、分支、循环、异常处理:OCR 命中再输入、窗口未出现则等待——像写程序一样编排桌面。
键鼠、窗口聚焦、OCR 识字、UIA 找控件、启动程序——真正在你的 Windows 桌面上动手。
MCP、Skill、脚本与视觉模型,都能让 AI 自动开发生成——一次创造,处处复用。
描述新能力,AI 生成 MCP 服务代码并登记;下次创造流程时自动带上,避免重复造轮子。
把岗位经验写成 Skill,Agent 通过 read_skill 随时调用;可测试、可开关、可绑定。
自然语言生成脚本,语法校验后入库;流程步骤直接调用,复杂逻辑交给代码。
框选训练定位 / 分类 / 分割模型,保存为可复用资产,在流程与 Agent 里反复匹配点击。
开发一次 → 入库绑定 → 流程与 Agent 随时调用,能力会越攒越多。
自己做的流程、MCP、Skill 与 Agent,一键打包;换一台电脑导入就能接着用。
不同场景切换不同人格:绑定流程、知识库与音色,像换一位同事坐到你桌边。
系统提示摘要
你是干练的桌面自动化助手。优先运行已绑定流程与脚本;执行后用简体中文汇报结果,少寒暄、多结论。
模拟场景:识别你的日报软件 → 打开 → 撰写今日日报 → 发送。左侧看小咪对话,右侧看桌面逐步被「操作」。(本地脚本演示)
示例:帮我识别日报软件,打开它,写好今日日报并发送
模拟语音唤醒「小咪小咪」,再说出命令:打开哔哩哔哩,找到《凡人修仙传》并播放。左侧对话与唤醒态,右侧浏览器逐步打开与播放。
说「小咪小咪」唤醒
示例:小咪小咪,打开哔哩哔哩,找凡人修仙传播放