阿里刚刚开源Qwen3新思考模型:Agent能力超强,支持100万上下文

阿里刚刚开源Qwen3新思考模型:Agent能力超强,支持100万上下文

阿里开源Qwen3-30B-A3B-Thinking-2507模型,Agent能力大幅提升,支持百万级上下文窗口,性能超越谷歌同类产品。

核心内容:
Qwen3-30B-A3B-Thinking-2507模型的核心技术参数与架构特点
在Agent智能体、数学推理、编程等任务上的性能突破
开源生态布局与开发者社区反馈

阿里刚刚开源Qwen3新思考模型:Agent能力超强,支持100万上下文

今天凌晨,阿里巴巴开源了 Qwen3 家族最新模型 Qwen3-30B-A3B-Thinking-2507。

2507 与之前阿里开源的 Qwen3-30B-A3B-Thinking 和 Qwen3-235B-A22B-Thinking 相比,在 Agent 智能体、AIME25 数学、LiveCodeBench 编程、GPQA解决复杂能力等方面,性能全部实现大幅度提升。

同时,2507 也超过了谷歌的最新小参数模型 Gemini-2.5-Flash-Thinking。

阿里刚刚开源Qwen3新思考模型:Agent能力超强,支持100万上下文

开源地址:https://huggingface.co/Qwen/Qwen3-30B-A3B-Thinking-2507

https://modelscope.cn/models/Qwen/Qwen3-30B-A3B-Thinking-2507

对于阿里的新模型,网友表示,疯狂优秀的本地模型,绝对是我能在 20GB 以内装下的最佳选择。思考模式 真的带来了天壤之别,恭喜你们,太给力了!

阿里刚刚开源Qwen3新思考模型:Agent能力超强,支持100万上下文

对于这么小的一个模型而言,它在各方面的性能提升都令人印象深刻。

阿里刚刚开源Qwen3新思考模型:Agent能力超强,支持100万上下文

不错,性能很强。现在只需要融合多模态能力,并支持 8 小时的音频和视频转录等功能就更好了。

阿里刚刚开源Qwen3新思考模型:Agent能力超强,支持100万上下文

干得漂亮,各位。真难以想象完成这项工作付出了多少努力,那些不眠之夜和全神贯注的时刻。

阿里刚刚开源Qwen3新思考模型:Agent能力超强,支持100万上下文

Qwen 团队的工作令人赞叹!Qwen3-30B-A3B-Thinking-2507 模型在推理能力上的提升以及超大的上下文窗口具有颠覆性意义,为复杂问题的解决开辟了令人期待的新可能。期待探索它的潜力!

阿里刚刚开源Qwen3新思考模型:Agent能力超强,支持100万上下文

干的非常好,Qwen 做的很棒。

阿里刚刚开源Qwen3新思考模型:Agent能力超强,支持100万上下文

Qwen3-30B-A3B-Thinking-2507 总参数量达到 305 亿,其中激活的参数量为 33 亿,非嵌入参数量为 299 亿。该模型包含 48 层,采用 Grouped Query Attention 机制,Q 的注意力头数为 32,KV 的注意力头数为 4。

此外,它还具备 128 个专家,其中激活的专家数量为 8。原生支持 256K 上下文,但通过扩展可增加至 100 万。

在性能方面,Qwen3-30B-A3B-Thinking-2507 相比其他模型在多个任务上都有出色表现。例如,在知识类的 MMLU-Pro 任务中得分为 80.9、MMLU-Redux 为 91.4、GPQA 为 73.4、SuperGPQA 为 56.8;在推理类的 AIME25 任务中得分为 85.0、HMMT25 为71.4、LiveBench 20241125 为 76.8;

阿里刚刚开源Qwen3新思考模型:Agent能力超强,支持100万上下文

在编码类的 LiveCodeBench v6(25.02 – 25.05)任务中得分为 66.0、CFEval 为 2044、OJBench 为 25.1;在对齐类的 IFEval 任务中得分为 88.9、Arena-Hard v2 为 56.0、Creative Writing v3 为 84.4、WritingBench 为 85.0;

在 Agent 智能体类的 BFCL – v3 任务中得分为 72.4、TAU1 – Retail 为 67.8、TAU1 – Airline 为 48.0、TAU2 – Retail 为 58.8、TAU2 – Airline 为 58.0、TAU2 – Telecom 为 26.3;

在多语言类的 MultiIF 任务中得分为 76.4、MMLU-ProX 为 76.4、INCLUDE 为 74.4、PolyMATH 为 52.6。

Qwen3-30B-A3B-Thinking-2507 在工具调用能力方面表现出色,推荐使用 Qwen – Agent 来充分发挥其代理能力,Qwen – Agent 内部封装了工具调用模板和工具调用解析器,大大降低了编码复杂性。可以通过 MCP 配置文件、Qwen – Agent 的集成工具或自行集成其他工具来定义可用工具。

为了达到最佳性能,建议采用这些设置:在采样参数方面,建议使用温度为 0.6、TopP 为 0.95、TopK 为 20、MinP 为 0,对于支持的框架,还可以在 0 到 2 之间调整 presence_penalty 参数以减少无休止的重复,但使用较高值可能会偶尔导致语言混合和模型性能略有下降;

在输出长度方面,建议大多数查询使用 32768 个 token 的输出长度,对于高度复杂问题如数学和编程竞赛的基准测试,建议将最大输出长度设置为 81920 个 token,为模型提供足够的空间来生成详细全面的回答,从而提升整体性能。

END

[登录查看剩余 70% 内容](javascript:void (0);)

开源大模型开源大模型是什么意思开源大模型有哪些

分享:

阿里刚刚开源Qwen3新思考模型:Agent能力超强,支持100万上下文

用微信扫描二维码

阿里刚刚开源Qwen3新思考模型:Agent能力超强,支持100万上下文

用微信扫描二维码

阿里刚刚开源Qwen3新思考模型:Agent能力超强,支持100万上下文

用微信扫描二维码

阿里刚刚开源Qwen3新思考模型:Agent能力超强,支持100万上下文

用微信扫描二维码

53AI,企业落地大模型首选服务商

产品:场景落地咨询+大模型应用平台+行业解决方案

承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业

上一篇:一个不卷大模型的清华学霸,率先用AI赚到了钱下一篇:Coze:打造智能高效的股票交易系统

返回列表

相关资讯

2026-07-25 Codex 终于能自由切模型了:Claude、Kimi、Grok、GPT 都能接进来2026-07-25 AI 数据最难搞的 Harness 工程,被北大开源了!2026-07-24 【开源项目】AI写的文章满篇AI味?这个工具直接在Word里帮你标好改哪2026-07-24 Gemma 4 助力 Cue 打造极速端侧语音智能体交互体验2026-07-24 阿里开源0.8B文档解析模型,端到端模型首次超越流水线方法2026-07-24 吴恩达开源 OpenWorker:一个交付成品而不是对话的 AI 智能体桌面应用2026-07-23 梁文锋四小时投资人会议实录2026-07-22 微软开源 Resource2Skill:把教程、代码和文档“炼”成 Agent Skill

阿里刚刚开源Qwen3新思考模型:Agent能力超强,支持100万上下文

阿里刚刚开源Qwen3新思考模型:Agent能力超强,支持100万上下文

联系获取

阿里刚刚开源Qwen3新思考模型:Agent能力超强,支持100万上下文

阿里刚刚开源Qwen3新思考模型:Agent能力超强,支持100万上下文

联系获取

160+中大型企业正在使用53AI

[立即咨询](javascript:void(0))[预约演示](javascript:void(0))

把握AI发展的机遇,共同探索、共同进步 2025-01-22如何打造基于GenAI的员工服务机器人 2025-01-22

阿里刚刚开源Qwen3新思考模型:Agent能力超强,支持100万上下文

前沿技术开源大模型新闻资讯

Coze:打造智能高效的股票交易系统

2026-6-20 23:40:37

前沿技术开源大模型新闻资讯

一个不卷大模型的清华学霸,率先用AI赚到了钱

2026-6-21 1:40:52

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧
购物车
优惠劵
搜索