模型动态

Qwen3-Max正式版发布,性能较预览版显著提升

Qwen3-Max正式版发布,相比三个月前的预览版有显著提升。测试显示:编程能力(如鞭炮连锁爆炸、大象牙膏、陀飞轮机芯建模)史诗级增强;新增美学测试,文字还原p5.js艺术作品效果尚可,但空间理解能力仍有不足;Agent能力在60K上下文内表现优秀,预计可达SOTA水平,但超过60K后性能会急剧下降;长上下文召回能力接近70%,但存在上下文越短召回越差的奇怪现象。总体提升肉眼可见,但部分能力仍需打磨。[12]

产品工具

Google Chrome深度集成Gemini AI,推出多项新功能

Google Chrome浏览器迎来重大更新,深度集成Gemini AI。主要新功能包括:1. Auto Browse(自动浏览)功能,允许Gemini像人一样操作网页,自动填写表单、订酒店等;2. 新增侧边栏(Side Panel),作为随时可用的AI指挥中心,并能理解当前页面内容;3. Connected Apps功能,将Gemini与Google全家桶(如Gmail、Docs)深度打通,可跨应用联动;4. 视觉购物功能,可通过图像识别商品并自动比价、下单;5. 端侧AI功能“Nano Banana”,支持直接修改屏幕上显示的图片,无需下载上传。[1][2][3][4][5][6][7]

Kimi AI新增文件创建与编辑功能,并升级为Agent

Kimi AI宣布推出新功能,现在可以通过聊天创建和编辑文件,包括专业的电子表格、幻灯片和PDF。同时,其“OK Computer”功能已正式升级为“Kimi Agent”。[8]

开源视频包装工具Skills工作原理详解

开源视频包装工具Skills的工作原理是:输入视频和字幕,通过智能分析生成特效配置,再使用浏览器(Playwright)或PIL后端逐帧渲染特效图层,最后合成到原始视频上。系统支持自定义HTML/CSS模板和动画(Anime.js),提供多种主题,并允许用户完全自定义视觉样式、组件和动效,与剪映等工具依赖固定素材库不同。但性能优化和合成速度有待提升。[9][10][11]

Gemini CLI更新,支持使用和创建Skills及hooks

Gemini命令行工具(CLI)迎来更新,现在支持使用和创建Skills(技能),并开始支持hooks功能。[13]

硬件动态

Kimi K2.5模型可在本地运行,但硬件要求极高

Kimi K2.5模型现已可在本地运行。但运行其量化版(1.8-bit)需要极高的硬件资源,磁盘、内存和显存的总需求不低于240GB。[14]