公司动态
DeepSeek-V4-Flash正式版来袭,真的掀桌了!完成一篇完整的学术文章只要……
一、近期国内模型井喷新模型扎堆发布 最近半个月国内大模型圈炸了。Kimi K3、Qwen3.8-Max-Preview、DeepSeek-V4-Flash正式版接连上线。参数规模全面进入万亿时代而且每一个都在自己的赛道上放了大招。更戏剧性的是就在国产模型密集发布的同时海外OpenAI的GPT-5.6-Luna突然官宣降价80%——一场关于智价比的中外对决正式开场。 Kimi K3 ——开源最强模型月之暗面在7月16日发布Kimi-K37月27日正式开源完整权重。这货的参数量直接拉到2.8万亿MoE架构激活1040亿支持原生视觉理解和100万Token上下文窗口。核心亮点KDA混合线性注意力 注意力残差技术把超长文本的计算量从平方级降到接近线性级。Frontend Code Arena以1679分登顶超过Claude Fable 5和GPT-5.6 Sol——开源模型首次在该榜单超越所有闭源模型。API定价缓存命中¥2/MTok输入¥20/MTok输出¥100/MTok。Hugging Face上开源30分钟内点赞破4000近3700名开发者蹲守下载。⚡ Qwen3.8-Max-Preview —— 依然自称是除Fable 5外最强阿里通义千问在7月19日推出Qwen3.8-Max-Preview。2.4万亿参数第三代MoE架构原生多模态百万Token上下文。官方自评很克制——中文稿加了可能二字英文稿直接去掉了。预览阶段采用天更迭代模式能力每天都在变。但最狠的是价格策略。。。Qoder免费用户会给300积分这0.01x的倍率可以爽用▲ Qwen3.8-Max-Preview 常规时段0.05x(1折) → 夜间22:00-08:00仅0.01x(0.2折)⚠️划重点常规时段1折夜间0.2折这意味着调用一个2.4万亿参数的旗舰模型成本比很多轻量模型还低。代码能力较前代22.8%协同办公44.4%。各平台模型倍率对比一览▲ Qoder平台模型倍率Qwen3.8-Max-Preview仅0.01x几乎免费DeepSeek-V4-Flash 0.1x DeepSeek-V4-Flash正式版 —— 后训练的魔法小蓝鲸在7月31日悄咪咪地上线了V4-Flash正式版API公测。总参数2840亿激活仅130亿——但成绩单亮瞎眼基准测试得分Terminal Bench 2.182.7Cybergym网络安全攻防76.7DSBench-FullStack68.7Toolathlon Verified70.3DSBench-Hard59.6更离谱的是模型结构完全没改只是重新做了后训练。同样的2840亿参数骨架纯靠训练策略优化就把Agent能力拉到了接近自家Pro版的水平。Artificial Analysis智能指数给到50分——仅比GPT-5.6 Luna51分低1分。成本呢输出定价$0.28/百万token加上98%缓存命中折扣单任务成本比GPT-5.6 Luna低约60%。✨总结DeepSeek用不到竞品一半的钱跑出了接近顶尖闭源模型的Agent能力。这不是性价比高这是直接把桌子掀了。 GPT-5.6-Luna —— 突然大降价80%的闭源性价比之王说到竞品就不得不提OpenAI的GPT-5.6-Luna。它是GPT-5.6系列中最快、最便宜的模型支持工具调用和多步Agent工作流已经是Replit、Cognition、Ramp等公司的默认选型被OpenAI自己称作最接近便宜到不用计量的智能。关键转折在7月30日——GPT-5.6系列发布仅三周OpenAI突然宣布Luna价格直降80%计费项降价前降价后降幅输入 / 百万Token$1.00$0.20-80%输出 / 百万Token$6.00$1.20-80%降价后Luna的Artificial Analysis智能指数仍是51分——注意这个分只比DeepSeek-V4-Flash的50分高1分。智价比Intelligence-per-Yuan时刻到了每百万 tokenV4-FlashGPT-5.6 Luna输入(牌价)$0.14$0.20输入(DeepSeek 高峰 2x 后)$0.28$0.20输出$0.28$1.20输入端,Luna 降价后仍比 Flash 牌价贵约 43%,只有打到 DeepSeek 高峰价才反超——36氪那句Luna 输入价比 DeepSeek 还便宜指的正是高峰场景。输出端才是长文场景的大头,Flash $0.28 对 Luna $1.20,便宜 77%。按一篇 2.8 万字论文全流程(检索写作绘图排版验收)约消耗输入 300 万 token、输出 50 万 token 估算:Flash 约$0.56(≈¥4),Luna 约$1.2(≈¥8.6)——都不到一杯奶茶,但 Flash 再省一半。智价比这张桌子,DeepSeek 确实是亲手掀的。二、学术写作实测五个模型同题PK 光看跑分不够。我们做了一个更硬核的测试同一篇学术论文生成任务并行交给5个模型执行看看谁产出的内容最完善。 测试任务说明每个模型需要独立完成以下全套交付物能力报告capability report研究契约research contract文献检索日志search log证据矩阵 references.bib≥30条真实文献引用审计报告reference audit详细大纲outline 论证地图argument map逐章写作7章正文前端图表生成SVGPNG数据表格table-data-and-sources.md全文整合 引用审计 同行评审final-paper.docx / .tex / .pdf 三格式输出格式验证 最终QA报告被测模型5.6-luna/opus-5/ds4-flash(DeepSeek-V4-Flash) /qoder-qwen-3.8/workbuddy-k3 执行过程实拍以下是Qoder平台使用Qwen3.8-Max-Preview执行论文生成的完整过程截图▲ 任务启动从环境检查到最终QA共20步骤自动规划▲ 执行中大部分子任务已完成✅进入深度思考模式处理复杂章节▲ 收尾阶段PDF已生成22页/358KB正在进行格式验证 六维打分结果我们从任务完成度、内容细节、图文丰富度、文献真实度、AIGC指纹五个维度量化评分综合得分按权重加权结果如下维度5.6-lunaopus-5 ⭐ds4-flashqoder-3.8workbuddy-k3任务完成度文件数14175664699内容细节词数21.0k47.8k27.1k13.0k18.8k图文丰富度图交互页5451362437文献真实度Bib条目3434413440综合得分73.386.8 76.755.572.2 关键发现opus-5 综合登顶86.8分opus依然是那个最强模型47.8k字正文 51张配图内容深度碾压全场。如果你要的是一篇有血有肉的完整论文opus依然是最强的。但是opus不便宜。看看opus的作图能力。绝对的Sota碾压其他模型。5.6-luna 紧随其后73.3分交付物最全141个文件适合追求什么都要有的场景。但是看看这图片质量完全不是一个级别的。可以说拉完了。图片这一块真的要降不少分。DeepSeek-V4-Flashds4-flash76.7分整体得分已经非常给力了文献质量最高41条真实引用全部可溯源。考虑到它的成本只有顶级模型的一半左右这个性价比已经非常能打了。综合表现绝对夯而且最终开销仅为1.38元。pro是其他任务消耗无视即可。DeepSeek-V4-Flash 论文技术页面系统结构、业务逻辑与图文解释结合Kimi-K3的表现中规中矩文献核验与长任务推进扎实但存在空白页、1 处 XML 错误、文件哈希不一致部分图尺寸偏小交付稳定性拖累总分。而且kimi-K3的定价并不便宜无论是订阅还是在workbuddy里使用积分消耗都非常快。。Qwen-3.8-preview一言难尽虽然整体内容表现不俗但是无法生成word这个是非常致命的。主要问题不是字数而是交付链断裂图片未进入成品、正文与文献无法匹配、编号和元数据重复。它最能说明调用便宜不等于返工便宜。三、参考基准千笔AIWritePaper学术写作平台分析 这几份模型论文都参考了千笔AIWritePaper学术写作平台中的同题原稿。千笔写作原稿页面顶部摘要、目录与 17,602 字页面标注千笔写作原稿中的需求表与研究框架图视觉完成度较高千笔-AIWritePaper原稿多维评分维度得分说明结构完整度90章节与论文要素齐全内容细节76技术描述多部分结论泛化图表丰富度9221 图、11 表表面完成度高文献真实性78抽样文献可查来源等级不一AI率85自研模型适配各大平台写作自然度52学术风格、专业性较强综合86接近终稿还需一定调整 千笔AIWritePaper学术写作是什么千笔AIWritePaper学术写作定位为AI论文写作与降AI、降重平台核心卖点如下能力维度千笔-AIWritePaper学术写作产出速度10分钟产出3万字内容类型真实网络数据、图、表、公式、代码大纲能力不限次2000字3级大纲参考文献40篇真实参考文献质量承诺AI率、重复率不达标就退费⚖️ 千笔AIWritePaper学术写作 vs Agent自主执行模式两种模式的区别对比项AIWritePaper一站式工厂各家Agent本次测试使用门槛极低零基础可用中等需基本操作能力可控性无限改稿结果生成后改稿全透明每步可审查干预内容深度★★★★★★★★~★★★★★opus-5降AI强有自研降AI模型一般需不断调整skill成本按需计价与模型价格有关deepseek可能只要1元、opus可能需要十几$ 综合评分评分项千笔AIWritePaper学术写作Agent模式(opus-5)便利性★★★★★★★★☆☆可控性★★★★☆★★★☆☆内容深度★★★★★★★★☆☆性价比★★★★★ (claude-opus-5)★★ (kimi-K3)★★★★(gpt-5.6-luna)★★★★★deepseek总分4.6 / 5.03.0 / 5.0 结论如果你是零基础用户、赶时间交作业千笔AIWritePaper是最好选择。但如果你对论文质量有要求、希望全程可控、且在意成本——Agent自主执行模式成本可能更低但需要不断迭代并且对整个流程非常熟悉而且不同模型很可能质量参差不齐作为初稿写作可能比较合适。opus-5产出的47.8k字34张图真实文献确实非常给力但是考虑到成本你愿意花跟千笔AIWritePaper差不多的价格买到一篇只是质量稍强一点的初稿吗四、结论掀桌的不是某一个模型 回到标题的问题完成一篇完整的学术文章只要……根据我们的实测数据答案取决于你的选择用DeepSeek-V4-Flash夜间0.2折调用→ 成本可能低至几块钱质量中上66.7分文献最靠谱用opus-5→ 质量最高86.8分47.8k字51张图适合追求完美的场景用 kimi-K3 → 各项用5.6-luna→ 交付物最全141个文件适合什么都想要的用户用千笔AIWritePaper学术写作→ 零门槛10分钟出活最全能后顾无忧 四点核心判断第一2026年7月是国内大模型的井喷月。Kimi K32.8T开源、Qwen3.82.4T预览、DeepSeek-V4-Flash284B激活13B接连发布参数规模全面进入万亿时代。国产前沿模型与国际SOTA之间的差距正在快速缩小。第二DeepSeek-V4-Flash正式版的真正意义不在参数规模。它证明了后训练杠杆效应——同样的模型骨架纯靠训练策略优化就能实现Agent能力的质变。2840亿总参数/130亿激活参数这个小身材跑出了不输GPT-5.6 Luna的成绩而成本更低。这意味着堆参数不再是唯一的出路。第三Agent自主执行模式已经可以产出专业级论文。opus-5的86.8分不是靠量大取胜——它的47.8k字是有结构的、有论证逻辑的、有真实文献支撑的完整学术文本。加上每一步都可审查、可干预、可迭代这种模式已经从能用进化到了好用。贵有贵的道理。使用门槛也极高封号非常严重A÷不当人。第四成本曲线正在重塑整个行业。当一篇完整学术论文的生成成本降到几块钱以内时讨论AI会不会取代学术写作已经没有意义了——真正的问题是你准备好用AI来放大自己的能力了吗