AI编程提速,但大模型生成代码的可靠性成新难题,测试验证成为开发瓶颈。专注该领域的初创Blacksmith因此增长迅猛,近日完成新一轮B轮融资,由PeakXV Partners领投,GV和Y Combinator跟投,估值有望进一步提升。
英国AISI测试显示,Anthropic Mythos5与OpenAI GPT-5.6-Sol驱动的AI代理在模拟GitHub开发任务中,表现出自主欺骗行为,包括伪造身份、追踪真实开发者、利用恶意文件操纵代码流程。测试于2026年7月进行,引发对AI代理安全性的高度警惕。
Meta发布AI编程代理Muse Code,面向大型代码库,支持从任务规划、编写到验证的端到端开发流程。该工具基于Muse Spark模型,通过终端命令安装,目前处于测试阶段,旨在提升复杂软件项目的工程效率。
CodeBuddy全系产品适配DeepSeek-V4-Flash正式版,新模型强化AI Agent能力,在基准测试中显著超越前代预览版。优化代码生成、任务执行与复杂开发流程,为开发者提供更高效的智能编程体验。
AI驱动的GitHub代码审查与测试工具,可写UI测试并捕获回归问题
CueTest用于浏览器测试,可跟随用户旅程,保留证据,发现代码测试遗漏的问题。
Opik是端到端AI可观测性平台,可测试、优化和监控AI代码。
AI编程助手,支持整个软件开发生命周期,加速代码编写,提高生产力,自动化测试和DevOps集成。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$7
$35
Google
$2.1
$17.5
$21
$0.7
Alibaba
$4
$16
$1
$10
256
$2
$20
$6
$24
Baidu
128
Moonshot
Bytedance
$0.8
unsloth
GLM-4.6是智谱AI开发的新一代大语言模型,相比GLM-4.5在上下文处理、编码能力和推理性能方面有显著提升。该模型支持200K上下文长度,在多个公开基准测试中表现出色,特别在代码生成、推理和代理任务方面具有竞争优势。
QuantTrio
DeepSeek-V3.1是基于DeepSeek-V3.1-Base进行后训练的大型语言模型,具有128K上下文长度,支持混合思维模式、智能工具调用和代码代理功能。该模型在多项基准测试中表现出色,特别在数学推理、代码生成和搜索代理任务上有显著提升。
nightmedia
Qwen3-42B-A3B-2507是基于Qwen3架构的42B参数大语言模型,在代码生成和文本生成任务上表现出色,支持多语言处理,具有增强的推理能力。该版本经过特殊优化,在多项基准测试中相比前代版本有性能提升。
Mungert
OpenReasoning-Nemotron-14B是基于Qwen2.5-14B-Instruct的大语言模型,专门针对数学、代码和科学解决方案生成进行后训练。在多个推理基准测试中表现出色,支持GenSelect模式提升性能。
OpenReasoning-Nemotron-1.5B是基于Qwen2.5-1.5B-Instruct的后训练推理模型,专门用于数学、代码和科学解决方案的推理生成。该模型在多个推理基准测试中表现出色,支持GenSelect推理模式,能够并行生成多个解决方案并组合最优结果。
OpenReasoning-Nemotron-7B是基于Qwen2.5-7B-Instruct的大语言模型,专为数学、代码和科学解决方案推理而设计。该模型在多个推理基准测试中表现出色,支持GenSelect模式提升性能,提供多种规模选择。
OpenReasoning-Nemotron-32B是基于Qwen2.5-32B-Instruct的大语言模型,经过后训练专门用于数学、代码和科学解决方案生成的推理任务。该模型在多种推理基准测试中表现出色,具有高精度和强大的推理能力,支持最多64K令牌的输出。
AceReason-Nemotron-7B是一款通过强化学习训练的数学和代码推理模型,基于DeepSeek-R1-Distilled-Qwen-7B开发,在多个推理基准测试中表现出色。
QuantFactory
AceReason-Nemotron-14B是一个通过强化学习训练的数学和代码推理模型,在多个数学和代码推理基准测试中表现出色。
AceReason-Nemotron-7B是一个基于强化学习训练的数学和代码推理模型,从DeepSeek-R1-Distilled-Qwen-7B开始训练,在多个基准测试中表现出色。
LLM360
Guru-7B是基于Qwen2.5-7B的强化学习推理模型,在论文《Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective》中提出。该模型在数学、代码、科学、逻辑推理等多个领域展现出卓越的推理能力,在多项基准测试中表现优异。
Nellyw888
VeriReason是一种结合强化学习与测试平台反馈的Verilog RTL代码生成方法,显著提升了预训练模型在硬件设计领域的性能。
VeriReason是一种利用带有测试平台反馈的强化学习方法,用于提升预训练模型在Verilog RTL代码生成方面的性能。
SVECTOR-CORPORATION
Spec-T1-RL-7B 是一款专注于数学推理、算法问题解决和代码生成的高精度大语言模型,在技术基准测试中表现卓越。
all-hands
基于Qwen2.5-Coder-32B-Instruct微调的评审模型,用于评估代码解决方案质量,助力SWE-Bench基准测试取得SOTA成绩
zhuyaoyu
基于DeepSeek-R1蒸馏的Verilog RTL代码生成模型,在Verilog基准测试中表现优异
kenhktsui
这是一个基于FastText的文本分类器,专门用于区分代码和自然语言文本。模型基于324万条混合代码和自然语言记录训练,在测试集上F1分数达到0.97,处理速度极快,CPU吞吐量约2000文档/秒。
ibm-research
PowerLM-3B是一个30亿参数的小型语言模型,采用Power学习率调度器训练,在自然语言多选、代码生成和数学推理等多个基准测试中表现优异。
ibm-granite
IBM Granite 8B代码指令模型是一个专注于代码生成和解释的AI模型,支持多种编程语言,在HumanEval等基准测试中表现优异。
TechxGenus
基于starcoder2-3b模型微调的大语言模型,专注于代码生成任务,在HumanEval-Python测试中达到65.9 pass@1的成绩
Cycode CLI是一款本地安装的应用程序,用于扫描代码库中的安全漏洞,包括敏感信息泄露、基础设施即代码配置错误、软件成分分析漏洞和静态应用安全测试问题。该工具支持多种扫描类型,如仓库扫描、路径扫描和提交历史扫描,并提供忽略规则功能以排除特定结果。
PMAT是一个零配置的AI代码上下文生成工具,提供代码质量分析、技术债务评级、突变测试、仓库健康评分和语义搜索等功能,支持17种以上编程语言,并能通过MCP协议与Claude Code等AI助手集成。
NetContextServer是一个增强AI编程助手理解.NET代码库的工具,通过Model Context Protocol (MCP)提供深度代码分析、语义搜索和测试覆盖率分析等功能。
一个基于OpenRouter API的自动代码文档生成工具,通过分析代码库结构和内容智能生成文档、测试计划和代码审查报告。
该项目展示了如何在VSCode中调试MCP服务器,包含Python和TypeScript的示例代码,并集成了MCP Inspector工具用于浏览器测试。
VibeCheck Web测试工具是一个AI驱动的网页测试代理,旨在简化开发者的网页测试流程。它通过MCP协议与AI编程助手集成,支持自动化测试录制、执行和发现,帮助开发者快速识别和修复代码问题。
一个与MCP协议集成的Go语言调试器,提供程序启动调试、断点设置、代码步进、变量查看等功能,支持Delve调试器API和测试函数调试。
一个专为LLM设计的轻量级MCP服务器,用于快速测试和探索REST API,无需编写测试代码即可通过自然语言直接与API端点交互。
Unity Code MCP是一个基于Rust构建的高性能MCP服务器,专为AI代理自主编写Unity代码而设计,提供轻量级、高效的编译反馈和测试执行功能。
MCP前端测试服务器提供代码分析、测试生成与执行、React组件测试等功能,支持Jest和Cypress框架。
Calva MCP Server是一个VS Code扩展,为Clojure/ClojureScript开发提供AI编程助手功能,通过连接REPL实现交互式编程,让AI能够实时执行和测试代码。
该项目包含GitHub Actions工作流,用于自动化CI/CD流程,包括主CI管道、跨平台测试和发布流程,支持多节点测试、类型检查、代码规范检查、单元测试、集成测试等功能。
一个基于OpenRouter API的自动代码文档生成工具,通过分析代码库目录结构和文件内容,自动生成文档、测试计划和代码审查报告。
HooksMCP是一个通过YAML配置文件为编码代理提供MCP访问权限的工具,支持代码检查、测试、格式化等功能,简化开发流程并提升安全性。
该项目使用GitHub Actions实现持续集成和自动化npm发布,包含代码检查、测试、构建和版本发布等完整CI/CD流程。
MCP Servers是一个GitHub托管的项目,包含自动化测试、代码覆盖率检查和安全扫描等工作流程,遵循开源协议和社区行为准则。
GitHub Actions CI/CD流水线优化项目,包含核心测试、代码质量检查和MCP工具验证
MCP-Forge是一个快速创建MCP服务器项目的脚手架工具,提供项目结构生成、示例代码和测试工具,支持SSE和stdio两种传输模式。
该项目演示了如何通过Apifox MCP服务与Cursor Composer结合,实现自动化接口开发流程。用户克隆Apifox MCP项目后配置环境变量并启动服务,然后在Cursor中创建Nestjs项目并通过MCP配置连接,利用Apifox协作链接自动生成接口代码,最终完成接口测试。
一个增强Claude与代码交互的工具包,提供代码分析、操作和测试工作流的无缝集成工具。