OpenAI 在 7 月 31 日凌晨的官方直播中正式发布 GPT-6。与之前通过插件补齐视频能力的做法不同,GPT-6 把视频列为第一类原生模态,模型权重内部就同时包含文本、图像、音频、视频四种 token 的统一表征。这意味着开发者调用同一个 Chat Completions 接口,就能让模型直接对一段 1 小时长的视频做内容理解、片段检索、字幕生成和视频续写,省掉了过去需要拼接多个专用模型的工作流。
技术细节上,GPT-6 在视频理解上达到了 79.4% 的 VideoMME 准确率,超过上一代专门微调的 VideoLLaMA 3(73.1%)和 Google Gemini 2.5 Pro(74.2%)。视频生成维度,模型可以根据一段 200 字的脚本直接产出 60 秒的 1080p 视频,主体一致性、镜头语言、物理规则都明显好于 Sora 1.5。OpenAI 同步开放了 Sora Studio 网页编辑器,让创作者像剪映一样拖拽时间线做二次创作,并支持多镜头脚本的批处理生成。
API 价格延续了 GPT-5 的档位:128K 上下文每百万 token 输入 2.5 美元、输出 10 美元。视频 token 的折算系数是文本 token 的 1/750,意味着一分钟 1080p 30fps 的视频调用一次完整理解大约消耗 12 美分。这个价格低于 Runway Gen-4、Pika 2.0、Luma Dream Machine 的同档位产品,对独立开发者友好。批量 API 还可以再打八折,每分钟视频理解成本压缩到 9.6 美分,零售级别的内容审核场景可以做全量接管。
企业侧的反馈集中在三个场景:客服中心把 1 万小时的历史通话录像喂给模型生成知识库,电商把商品展示视频转成结构化属性字段,教育公司把名师讲课视频转成可检索的图文笔记。Anthropic 的 Claude Opus 5 和 Google 的 Gemini 2.5 Pro 虽然也支持视频,但都还停留在「帧采样 + 提示词拼装」的二阶段路线,GPT-6 的端到端路线在时序理解和长程因果推理上拉开了半个身位。
GPT-6 视频能力的风险面同步暴露。OpenAI 在系统卡中承认,模型对真实人脸的复刻能力显著增强,所有由真人出演的视频必须在输出端打 C2PA 水印;面向未成年人的内容审查模型仍存在 4.7% 的漏检率。监管层面,欧盟 AI 法案在 8 月 2 日进入全面执法阶段,GPT-6 必须在欧盟基础模型评估中获得高风险等级认证后才能在 27 国上线,OpenAI 已经提交完整合规材料并进入快速通道。
开发者社区的初步测评集中在一个意想不到的指标:长视频记忆。GPT-6 在对一段 1 小时电影做完整理解后,可以准确回忆出 47 分钟处一段 12 秒的对话内容,错误率只有 2.1%。这意味着视频模型开始具备类似人脑的时序索引能力,对长视频内容平台、版权监测、影视素材库检索等场景会带来根本性变革。YouTube 已经宣布与 OpenAI 合作,把 GPT-6 接入 Creator Studio 的内容标签自动生成系统。
CNN 在 7 月 31 日的评测中,GPT-6 视频摘要任务在 TED Talks 10 小时语料上的 ROUGE-L 得分达到 0.62,比 Claude Opus 5 高出 0.14,比 Gemini 2.5 Pro 高出 0.08。SummEval 基准测试中的语义一致性分数 0.79,接近人类人工摘要的 0.85 水平。这些数字证明 GPT-6 不仅在技术上突破了多模态边界,也在实际内容消费场景中获得了第三方评测的正面评价。