AI简报(9月8日):DeepSeek V4.1 Flash中间版本开启内测;智谱ZCode上线两款视频插件:视频转代码+自动化视频剪辑

前沿资讯 1788860223更新

0

🔥 【1】DeepSeek V4.1 Flash 中间版本开启内测,全新架构 + 原生多模态,速度飙到 300-400 tok/s

摘要:DeepSeek V4.1 Flash 的一个中间测试版本已经开始内部测试,有效期到 9 月 10 日。

官方微信群透露,这是全新的模型架构。核心变化一句话总结:原生多模态 + 更强能力 + 更快速度 + 更低成本。实测截图显示,一个简单的“hello”思考时间仅 0.3 秒,输出速度 159.3 tok/s,完整往返 0.8 秒。

开发者最关心的接入方式:base_url 不变,模型名改成 deepseek-v4.1-flash-expires-on-0910,计费跟现款 V4-Flash 一样,每个账号限制 20 路并发。需要特别注意的是,这是个中间测试版本,名字里带了过期时间,窗口期非常短,想提前体验新架构和原生多模态的开发者得抓紧这几天。

更夸张的是,在 DSH 环境下解码速度能达到 300 到 400 tok/s,官方 API 端点大概是 80 到 126 tok/s,本地或 DSH 直接把解码性能又往上推了一截。

V4 刚提升了 Agent 能力,V4.1 直接跳到新结构加多模态,DeepSeek 的迭代速度确实凶猛。目前 DSH 用户优先体验,聊天的、写代码的、跑 Agent 的,整体感觉完全不同了。

链接:https://x.com/NFT_Chen/status/2097246735676669960

💻 【2】小米 MiMo Desktop 桌面客户端开放邀测:直接处理混合素材,交付可继续编辑的成果

摘要:小米正式开放 MiMo Desktop 桌面客户端邀测。

这是一款面向真实工作场景的 AI 应用,用户不用精心整理素材,表格、图片、视频、PDF、录音甚至没解压的压缩包都能直接往里扔,用大白话说明目标,MiMo 自己理解素材、拆解任务、调用工具,最后交付可以继续编辑的成果,包括文档、表格、PPT、网页、图片、音频、视频,乃至 3D 模型和软件工程代码。

用户可以直接选中产物里的任意元素或文本段落,说“把这段改一下”,它只改选中的部分,不用从头再来,每次修改都保留版本记录,随时可回退。内置的 Smart 调度模式自动判断任务该用哪个模型、哪种执行框架,日常任务省成本,复杂任务上旗舰,还能拆分成多 Agent 分别负责调研、执行和复核。

浏览器操控也是亮点,它自己打开网页查资料、填表单,查到的信息直接进任务,不用用户自己复制粘贴。邀测期间两款新模型 Preview 版限时免费体验,代号 MiMo-X-Pro-Preview 和 MiMo-X-Flash-Preview,面向办公、编程、设计、3D 生成、视频剪辑等专业场景做了优化。申请链接已公开,优先面向已有用户开放。

链接:

https://mimo.xiaomimimo.com/desktop/invite/

🧩 【3】GPT-6 Astra 拿下 3D 空间推理第一,全网开发者已用它解决现实问题

摘要:GPT-6 Astra 发布后持续屠榜。

在最新的 3D 空间推理基准 MazeBench 上,Astra 跑了 60 多个小时,以 14% 的得分拿下第一,超越之前所有 Agent。MazeBench 是一个包含 200 多个房间的 3D 迷宫世界,藏着 100 颗宝石,谜题包含推箱子、电梯砖、可开关的墙、会打滑的冰面,模型只能通过 11 个动作(移动、转相机、撤销、重置、传送)来探索,一道题往往要规划 100 步以上,对 3D 空间理解要求极高。

Astra 的探索热力图显示,它几乎把整张地图翻了一遍,而其他模型只在角落里转了一小圈就停了。不过它也有短板:更倾向用俯视视角看关卡,遇到方块叠超过三层的 3D 谜题会抓瞎。

比刷榜更精彩的是全网的「实战」案例。有人录了一段 4 分钟视频吐槽浴室地漏老被头发堵住,Astra 听完描述、看完视频、量完尺寸,直接接管 Fusion 360 画出了全参数化 3D 模型,丢进 3D 打印机,第一次装上去就严丝合缝。还有人让 Astra 打「I'm Not a Robot」验证码游戏,48 关一把全过,连游戏原作者都无奈回应「行吧,我尽力了」。

NVIDIA CEO 黄仁勋亲自站台,认证 OpenAI 是全球首个拿下 AGI 的团队。通往 ASI 的赛道已经铺开。

链接:https://mp.weixin.qq.com/s/6GvPz8sVK0d4mbj3xGqyTg

🧊 【4】卡兹克分享 GPT-6 Astra + Blender 小白入门教程,手把手教你用 AI 搓出 3D 模型

摘要:GPT-6 Astra 上线后,Blender 可能是最大赢家之一,下载量暴增,全网都在玩「AI 操控 3D 软件」。卡兹克实测了三种让 Astra 操控 Blender 的方式,手把手教小白入门。

第一种是 Computer Use,让 AI 像人类一样自己找按钮、移鼠标、输参数,一点一点搭模型。提示词是「用 Blender 重建北京天坛祈年殿」,Astra 先自己搜资料、找测绘图、对照实景照片,前后折腾了 4 个小时,从台基、柱梁、斗拱、三重檐屋顶到蓝色琉璃瓦和鎏金宝顶,全部独立建模,最终效果相当不错。全程看着模型一点点搭出来,体验非常爽,但缺点是贵,这一座天坛直接花掉了 200 美元 Pro 套餐将近一半的额度。

第二种方式是通过 Blender 官方 MCP,相当于在 GPT 和 Blender 之间开了一条专用通道,速度更快、额度更友好。作者用它做了一辆 2026 Indian Chief 摩托车,从建模到 10 秒零件组装动画一气呵成,还能加场景渲染。

第三种是 CLI 调用 Python 脚本,适合处理复杂任务时拆分成小步骤执行。不过 Astra 也有短板,它更擅长建筑、车辆、机械这种规则几何体,一旦遇到人物这类生物模型就抓瞎了。作者用金克斯试了一下,效果「毫不相干」。正确的打开方式是:用 Astra 操控 Tripo 这类专门的 AI 3D 生成模型做出角色,再导入 Blender 处理后续的材质、骨骼、动画流程。

他完整走了一遍「牛来妈妈」的制作流程,从原画到多视图设定、建模、UV 展开、材质上色、骨骼绑定,最后让它跳了段舞、喊出「妈妈和牛来」,虽然抽象但很好玩。

卡兹克感慨,七年前做一张 3D 渲染图,每天下班做、整整做了一个月,用 OC 渲染了一整夜。现在 AI 让创作越来越平权,人人心中有想法都能让 AI 帮忙做出来。但真正拉开差距的,永远是你的想法、审美、判断力,还有那点愿意折腾的好奇心。

链接:https://mp.weixin.qq.com/s/yK65CvMwzhQqu5_E5EfVVQ

🎬 【5】智谱 ZCode 上线两款视频插件:视频转代码 + 自动化视频剪辑,任务端到端完成

摘要:智谱 AI 为 ZCode 推出两款基于 GLM-5.3-Flash 多模态能力的新插件。

第一个叫 Video2code,给一个视频链接或者屏幕录制,它就能直接生成可运行的代码。第二个叫 Video Agent Kit,专门用来自动化处理视频剪辑工作。

两款插件让更多任务可以端到端完成,不需要中间手动干预。安装之后可通过配置指南来上手,用户可以根据需要调整。

链接:https://github.com/zai-org/zcode-plugins

⚡ 【6】腾讯混元 Hy4 预览版升级:优化过度验证问题,少绕弯子、省 Token

摘要:腾讯混元宣布 Hy4 预览版推送了一项重要升级。

此前有用户反馈,模型在处理复杂任务时存在思考链条过长和过度验证的问题,导致来回折腾、消耗大量 Token。这次优化后,在保持同样任务质量的前提下,推理轮次减少,输入输出 Token 都降了下来。

官方表示,基准测试和人工评估均验证了改进效果,接下来还会快速迭代,用户现在就可以在 WorkBuddy 上体验。

链接:https://x.com/TencentHunyuan/status/2096899319513153543

📸 【7】用 AI 把 240p 渣画质照片一键变 4K 高清大片,面部细节纹丝不动

摘要:有网友分享了一条超实用的 AI 图像增强提示词,能把 240p 的低分辨率照片无损放大成 4K 超高清大片。

提示词核心要求很明确:面部结构、表情、姿势和身份特征完全不变,在此基础上用专业影棚布光重塑画面质感。45 度角柔光主灯打造自然面部立体感,背部加一道极细的白色轮廓光让主体和背景分离。皮肤保留真实纹理和毛孔,拒绝过度磨皮或塑胶感。色调上走暖色温、中性白、暗背景的路线,最终呈现干净、高级、有编辑感但不夸张的 4K 级成片效果。

提示词已经附上,复制粘贴就能用。

提示词:Create an ultra realistic, high end studio headshot using the provided image while keeping the face, expression, pose, and identity completely unchanged. Do not alter the subject's facial structure, expression, hairstyle, or positioning in any way. Use professional studio lighting with a soft but directional key light placed at a 45 degree angle to create natural facial depth, along with smooth and gentle shadow falloff on the opposite side without harsh shadows or crushed blacks, and a very subtle white rim light behind the subject to naturally separate them from the background. Ensure the face is bright, sharp, and clearly visible with smooth highlight roll off and no overexposure, while maintaining soft lifted shadows with full detail preserved in darker areas. Enhance the skin naturally by keeping realistic skin texture and visible pores, preserving rich natural skin tones, and avoiding over smoothing or plastic looking skin. Apply premium cinematic color grading with slightly warm skin tones, neutral whites, a softly darkened background for better contrast and subject separation, and clean, balanced colors without oversaturation. Use a minimal professional background such as dark grey or a soft gradient with slight blur to create depth and strong subject isolation. Subtly sharpen the eyes and facial details while keeping the final image natural, realistic, and high end. The final look should feel cinematic but clean, premium and professional, sharp and editorial style, without being overly moody or dramatic. Render the final image in ultra sharp 4K quality with a luxury editorial photography aesthetic.

链接:https://x.com/IndoliyaDesigns/status/2096896254953537813