OceanBase首次公开支撑蚂蚁灵光AI应用的数据架构:以逻辑表、共享物理存储和受控SQL计算实现应用模型独立、资源共享,为AI生成应用提供数据底座。已累计生成约3000万个闪应用,应对AI时代海量Agent应用的挑战。
大语言模型在网络安全领域的推理能力正面临严峻考验。安全研究员Kasra Rahjerdi通过构建含有核心漏洞的图书评论APK,对主流大模型进行模拟黑客攻击测试,揭示其安全推理与漏洞利用的真实水平。测试限时2小时、单次预算10美元,直观展现了各模型在复杂逻辑挑战中的表现。
研究表明,通过StoryScope自动化分析管道,仅凭情节、主体、时间结构等叙事特征,检测AI写作的准确率高达93.2%。这项由马里兰大学与Google DeepMind合作的研究,揭示了AI与人类在故事创作底层逻辑上的本质差异,即便频繁调整提示词也难以改变。
Anthropic于5月29日发布旗舰大模型Claude Opus4.8,在保持原价基础上,重点升级智能体编程、复杂逻辑推理和多领域知识工作能力。测试反馈显示,该模型日常表现更稳健,判断更敏锐,尤其擅长处理复杂多步骤任务。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$7
$35
Google
$2.1
$17.5
$21
$105
$0.7
Alibaba
$4
$16
$1
$10
256
Baidu
128
$2
$20
$6
$24
Moonshot
Bytedance
$0.8
32
TeichAI
这是一个基于Qwen3 30B A3B模型,在Claude Sonnet 4.5高推理难度数据集上训练的蒸馏模型。该模型专门针对复杂推理任务进行优化,在编码和科学领域表现出色,具备较强的逻辑推理能力。
DavidAU
这是一个基于Qwen3架构的6B参数大语言模型,专门针对恐怖主题进行微调,能够生成暗黑、恐怖风格的文本,同时在逻辑推理任务中表现出色。
inclusionAI
Ring-mini-2.0是基于Ling 2.0架构深度优化的高性能推理型MoE模型,仅有160亿总参数和14亿激活参数,却实现了与100亿规模以下密集模型相当的综合推理能力。在逻辑推理、代码生成和数学任务方面表现出色,支持12.8万长上下文处理和每秒300+令牌的高速生成。
cpatonn
Hermes 4 14B是由Nous Research基于Qwen 3 14B开发的前沿混合模式推理模型,在数学、代码、STEM、逻辑、创造力和格式忠实输出等方面表现出色,具有显式思考过程和工具调用能力。
NexaAI
NexaAI/Qwen3-0.6B是基于Qwen3系列的0.6B参数语言模型,在推理、指令遵循、多语言支持等方面表现出色。支持思维模式和非思维模式无缝切换,适用于复杂逻辑推理和高效通用对话。
Qwen3-30B-A3B-Thinking-2507是经过量化处理的大语言模型,具有增强的推理能力、通用能力和长上下文理解能力。该模型采用混合专家架构,在逻辑推理、数学、科学、编码等复杂任务上表现出色,支持262,144 tokens的长上下文处理。
Qwen3-30B-A3B-Instruct-2507是阿里云推出的305亿参数混合专家模型,采用非思考模式,在指令遵循、逻辑推理、文本理解、数学科学、编码和工具使用等方面表现优异,支持262K长上下文和多语言处理。
prithivMLmods
Qwen3代码推理是一个参数量为40亿的紧凑型模型,在nvidia/OpenCodeReasoning上进行了微调,专门为编码和逻辑推理任务而设计。该模型在代码生成和逻辑问答方面表现出色,支持超过10000个标记的上下文窗口。
QuantTrio
Qwen3-235B-A22B-Instruct-2507-AWQ是基于Qwen3-235B-A22B-Instruct-2507基础模型的量化版本,是一个235B参数规模的混合专家模型(MoE),激活参数为22B。在文本生成、指令遵循、逻辑推理等方面表现优异,支持长达262K的上下文长度。
cognitivecomputations
DeepSeek-R1-0528是DeepSeek R1模型的小版本升级,通过增加计算资源和算法优化显著提升了推理能力,在数学、编程和通用逻辑等多个基准评估中表现出色。
nvidia
一款15亿参数的开源权重模型,专为复杂推理任务设计,在数学、编码、科学及逻辑谜题等领域表现卓越。
LLM360
Guru-7B是基于Qwen2.5-7B的强化学习推理模型,在论文《Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective》中提出。该模型在数学、代码、科学、逻辑推理等多个领域展现出卓越的推理能力,在多项基准测试中表现优异。
THUDM
GLM-4-Z1-32B-0414是具备深度思考能力的320亿参数推理模型,在数学、代码和逻辑类任务上表现优异
zai-org
GLM-4-Z1-32B-0414是GLM家族新一代开源大语言模型,拥有320亿参数,具备深度思考能力。通过冷启动和扩展强化学习训练,在数学、代码和逻辑任务上表现优异,支持便捷的本地部署。
openthaigpt
OpenThaiGPT R1 32b是一款320亿参数的泰语推理模型,在泰语数学、逻辑和代码推理任务中表现优异,性能超越更大规模的模型。
Theta-Lyrae-Qwen-14B是基于Qwen 2.5 14B模态架构设计的140亿参数模型,优化了通用推理和问答能力,在上下文理解、逻辑推理和多步骤问题解决方面表现优异。
SVECTOR-CORPORATION
Theta-35 是 SVECTOR 推出的 Theta 系列中的先进推理模型,专注于复杂思维和推理,在需要深度逻辑分析和多步推理的难题上表现出色。
AliMaatouk
LLama-3-8B-Tele是一款专为电信领域优化的80亿参数语言模型,基于Meta的LLama-3-8B架构,在25亿标记的电信数据集上持续预训练而成。在电信相关任务上表现出色,同时保持了原模型在常识、语言理解和逻辑推理等方面的能力。
Phi-1.5-Tele是一款专为电信领域打造的语言模型,基于微软的phi-1.5模型,在大规模电信数据集上持续预训练,在电信基准测试中表现出色,同时在常识、语言理解和逻辑推理等基准测试中保持与原模型相当的性能。
allganize
Alpha-Instruct是一款在韩语和英语领域表现出色的语言模型,采用进化式模型融合技术开发,特别擅长复杂语言任务与逻辑推理。