xAI发布测试版Grok Bot,定位为常驻AI智能体团队。每个智能体配置云端电脑,可登录用户现有工具,在无人监督下自主执行多步骤任务。与传统需逐步指挥的自动化不同,其核心是模仿人类员工:即使用户关掉笔记本,任务仍在云端推进,仅在需审批时通知。用户可通过桌面端管理。
腾讯云发布云端研发智能体 CodeBuddy NPC,依托 CNB 平台打通 Issue、代码库、PR 及 CI/CD 全流程数据。开发者只需下达需求指令,智能体即可自主完成方案规划、编码、提交 PR 和自动化测试,实现端到端云端自主开发,有别于传统本地 AI 编码工具。
针对AI深度接入浏览器、文件等现实场景带来的安全脆弱性,OpenAI推出自动化红队模型GPT-Red,通过自博弈训练,将直接提示注入攻击失败率降至0.05%,比传统人工测试更高效全面,为AI自我迭代与安全加固开辟新路径。
AI安全中心发布远程劳动指数,显示AI在远程办公自动化领域实现突破。Claude Fable5模型在3D建模、建筑设计、平面设计和视频动画等自由职业项目测试中,以16.1%自动化率刷新历史纪录;评估按工业标准,计算AI生成品质量达到或超越人类专业交付物的比例。
CueTest用于浏览器测试,可跟随用户旅程,保留证据,发现代码测试遗漏的问题。
强大的跨浏览器在线测试工具,提供AI驱动的端到端软件测试方案。
CrownAI是支持15个平台的AI扑克机器人,提供GTO策略自动化和免费测试。
基于自然语言的本地浏览器端到端自动化测试工具,快速验证并发现深层错误
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Anthropic
$105
$525
200
$21
Bytedance
-
Xai
$1.4
$10.5
256
$0.8
$8
Alibaba
32
$8.75
$70
400
Chatglm
$16
128
$3.5
$12
$0.5
Huawei
$14
$56
$0.7
Google
$0.35
131
prithivMLmods
ActIO-UI-7B-RLVR 是由 Uniphore 发布的 70 亿参数视觉语言模型,专门用于计算机界面自动化任务。它基于 Qwen2.5-VL-7B-Instruct,通过监督微调和可验证奖励的强化学习进行优化,在 GUI 导航、元素定位和交互规划等任务上表现出色,在 WARC-Bench 基准测试中达到了开源 7B 模型的领先水平。
almanach
Gaperon-Young-1125-1B 是一个拥有15亿参数的双语(法语-英语)语言模型,由法国国家信息与自动化研究所(Inria Paris)的ALMAnaCH团队开发。该模型在约3万亿个高质量令牌上训练,特别注重语言质量和通用文本生成能力,而非基准测试优化。
Salesforce
GTA1是基于GRPO强化学习训练的GUI接地模型,专门用于图形用户界面自动化操作。相较于依赖冗长思维链推理的方法,GRPO直接激励可操作和有根据的响应,在多个基准测试中表现出卓越的接地性能。
MMIE
MMIE是一个专为大型视觉语言模型设计的评估基准,提供自动化评分系统测试多模态交错理解能力。
ArmurAI
基于OpenHermes-2.5-Mistral-7B改造的渗透测试助手,专为Kali Linux工具集优化,提供引导式渗透测试和命令自动化支持。
Kali Linux环境下的MCP服务器集合,专注于逆向工程、安全测试和自动化工作流。
该项目是为Kali Linux设计的MCP服务器集合,旨在增强逆向工程、安全测试和自动化工作流,整合了Nmap、Wireshark等工具,并提供Docker沙箱支持。
MCP Appium是一个基于模型上下文协议的智能移动自动化服务器,为AI助手提供跨平台移动应用测试工具,支持iOS和Android平台,具备智能元素定位、会话管理和自动化测试生成等功能。
一个基于Selenium的MCP服务器项目
Kali MCP Server是一个轻量级API桥接工具,连接MCP客户端与Kali Linux终端,实现AI辅助渗透测试和CTF挑战自动化。
Android-MCP是一个轻量级开源项目,作为AI代理与Android设备之间的桥梁,通过MCP服务器实现真实任务操作如应用导航、UI交互和自动化测试,无需依赖传统计算机视觉或预设脚本。
VibeCheck Web测试工具是一个AI驱动的网页测试代理,通过MCP协议集成到AI编程助手(如GitHub Copilot、Cursor等)中,实现自动化测试录制、执行和发现。它利用Playwright控制浏览器,支持自然语言描述生成测试脚本,执行回归测试,并自动发现潜在测试步骤,提高开发效率和测试准确性。
MCPwner是一个基于模型上下文协议的安全研究自动化服务器,集成了多种安全测试工具(SAST、SCA、秘密扫描等),为LLM驱动的安全分析工作流提供统一接口。
MCP Cases是基于Model Context Protocol的多功能格式,用于自动化测试、服务器模拟、协议验证及文档生成。
一个基于PyAutoGUI的MCP服务器,提供自动化GUI测试和控制功能,支持跨平台操作。
Debugg AI的MCP服务器是一个基于AI驱动的浏览器自动化测试工具,支持通过自然语言和CLI进行端到端测试,无需配置即可远程管理浏览器测试,适用于本地开发或CI/CD流程。
Xray MCP服务器是一个集成Xray Cloud API与Claude Code等MCP客户端的工具,提供测试用例管理、测试执行、测试计划和测试集等功能,支持CI/CD集成和测试自动化
一个自动化检测网页XSS和SQL注入漏洞的渗透测试工具,提供浏览器交互、截图和脚本执行功能
一个基于Playwright和TypeScript的强大测试自动化框架,采用页面对象模型设计模式,支持数据驱动测试,并集成了MCP服务以增强测试录制与回放功能。
VibeCheck Web测试工具是一个AI驱动的网页测试代理,旨在简化开发者的网页测试流程。它通过MCP协议与AI编程助手集成,支持自动化测试录制、执行和发现,帮助开发者快速识别和修复代码问题。
一个通过MCP协议运行和管理Python测试的服务器
基于Playwright的浏览器日志与网络请求监控MCP服务
AutoMobile是一个移动端自动化工具集,提供Android平台自动化测试、UI交互、测试编写与执行功能,通过MCP服务器实现智能交互循环和源码映射。
一个专为Kali Linux设计的MCP服务器集合,旨在增强AI代理在逆向工程和安全测试中的能力,提供网络分析、目标嗅探、流量分析、二进制解析和自动化等功能。
Storybook MCP服务器是一个基于模型上下文协议的工具,提供与Storybook文档和组件信息交互的功能,包括获取组件列表、属性详情以及通过自定义JavaScript工具提取特定信息。