Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
文档转视频 AI API: PDF、PPT、XLS、DOCX 和网页
2026/08/23

文档转视频 AI API: PDF、PPT、XLS、DOCX 和网页

用 Wan 3.0 从 PDF、演示文稿、表格或文档生成 2-30 秒的视频。了解输入限制、精确成本计算和完整请求示例。

Wan 3.0 可以从一个 PDF、PPT/PPTX、XLS/XLSX、DOC/DOCX、纯文本或 Markdown 文件,或一个公开网页生成 2-30 秒的视频作为参考。 文档限制为 100 MB 和 50 页。这对概念视频和总结很有用,但它是生成式解释,不是像素级保真的 PowerPoint 导出。[1]

最后这个区别能节省很多错误期望。如果需要每张幻灯片、每个图表标签和句子都精确再现,自己渲染演示文稿。如果需要一个模型读取源材料并将其转化为短的视觉表达,文档转视频就是正确的选择。

支持的文档和链接输入

当前 Wan 3.0 API 接受以下其中之一:

输入支持的格式限制
Office 文档DOCX、DOC、XLSX、XLS、PPTX、PPT100 MB、50 页
PDF/文本PDF、TXT、MD100 MB、50 页(如适用)
Apple iWorkKeynote、Pages、Numbers100 MB、50 页
网页公开无登录 URL一个 URL

对文档使用 file_url,对网页使用 link_url。它们互斥;发送两者会在生成前被拒。[1]

这些 URL 必须是公开的 HTTP(S) 链接。路径如 /Users/me/report.pdf、私人 Google Drive 链接或登录后的页面无法被模型获取。

最小的 PDF 转视频请求

先上传文档到存储,然后提交其 URL:

curl -X POST https://api.reapi.ai/api/v1/videos/generations \
  -H "Authorization: Bearer $REAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "wan3.0-video",
    "file_url": "https://files.example.com/q3-product-brief.pdf",
    "prompt": "Create a 20-second product launch concept. Keep the three claims and the product color from the brief. Use four clear scenes and restrained on-screen text.",
    "resolution": "720P",
    "duration": 20,
    "audio": true
  }'

响应是异步的,包含一个任务 id。轮询 GET /api/v1/tasks/{id} 直到状态为 completed;MP4 出现在 output.video_urls[1]

按照当前 720P 的 $0.076 每秒费率,20 秒请求为 $1.52。文档大小不会增加第二个计费单位。分辨率和输出时长决定了公开费率。[2]

网页转视频使用同一模型

link_url 替换 file_url

{
  "model": "wan3.0-video",
  "link_url": "https://example.com/products/travel-backpack",
  "prompt": "Make a 15-second vertical product story. Use only features stated on the page. Show the opening, laptop sleeve, and carry-on fit in that order.",
  "size": "9:16",
  "resolution": "720P",
  "duration": 15
}

公开意味着无需 cookie、JavaScript 专有认证、公司 VPN 或地区特定登录即可获取。在浏览器中加载的页面对远程获取器可能仍然无法访问。

给模型编辑指示,不是"制作视频"

文档描述的内容比 30 秒视频能展示的更多。提示词必须告诉模型保留什么,以及做什么样的编辑。

一个有用的提示词回答五个问题:

  1. 观众是谁?
  2. 哪一个主张必须保留?
  3. 哪些事实或视觉资产必须使用?
  4. 场景顺序应该是什么?
  5. 什么不能被虚构?

例如,对于财务报告:

Create a 25-second internal update for employees. Open with revenue growth,
then show the two regions responsible, and finish on the stated Q4 priority.
Do not invent customer names, forecasts, or percentages. Read numbers exactly
as written. Use charts as visual references rather than recreating their labels.

这不能保证生成像素中的完美数字。它减少歧义,并给审阅者一个接受核对清单。

何时先自己提取文档

直接文档输入很快,但以下情况预处理更好:

  • 每个主张都必须在生成前获批;
  • 文档包含不应该被发送的敏感页;
  • 只有两个段落相关;
  • 所需视频长于 30 秒;
  • 脚本、镜头表和旁白需要单独审查;
  • 源包含应该精确显示的密集表。

在这些情况下,提取经批准的文本,编写场景计划,发送最终提示词加上一小组视觉参考。额外步骤创建稳定的审计线索,防止无关附录扰乱输出。

文档可以与参考媒体结合

Wan 3.0 的参考族也接受最多十张图片、五段短参考视频和五个音频剪辑。因此,产品简报可以提供事实,同时图片定义产品,短剪辑定义所需运动。[1]

保持集合小。十张在颜色或形状上不一致的图片比三个清晰的视图更差。在提示词中命名重要资产并解释其作用。

将远程文档视为离开系统的数据

文档转视频很方便,因为模型可以获取并解释文件。同样的行为意味着文件被发送到托管服务。提交前,分类源并删除视频不需要的任何内容。

安全预处理核对清单:

  • 删除隐藏幻灯片、演讲者备注、跟踪变更和附录;
  • 仅导出已批准的工作表或页面范围;
  • 当它们不必要时用替换客户名称和内部标识符;
  • 确认签名 URL 的过期时间足够长,以处理异步作业;
  • 避免对机密材料使用公开永久 URL;
  • 保留用于生成视频的精确源版本。

API 的 50 页限制是最大值,不是建议。三页经批准提取给模型更清晰的简报,并且比 50 页董事会甲板暴露更少信息。

在生成后添加事实审查

源文档可以指导内容,但视频仍然是生成媒体。根据短事实表审查它,而不是仅观看视觉质量。

审查项目如何验证
产品外观与已批准参考图片比较
口头主张记录输出并与简报比较
屏幕上的文本逐帧阅读;如果错误则在后期替换
数字/日期对照源检查,从不从外观推断
必需排除项确认禁止的名称、徽标或主张缺失
场景顺序与提示词的请求序列比较

如果精确文本很重要,在视频生成后将其渲染为确定性叠加。要求"电子表格中显示的相同表"不能保证像素中正确的表格单元格。

将长源材料分成视频系列

三十秒不足以覆盖产品手册、季度报告或完整课程。避免将每个部分压缩成匆促剪辑。将源分解为独立主张,并为每个主张提供已批准的提取和视觉简报。

例如,产品页面可能变成三个视频:问题和观众、核心工作流、设置或定价。每个请求都可追溯到源的小部分。系列还创建了更清晰的接受标准,让失败的部分无需为其余部分付费即可重新生成。

分割应该遵循读者意图,不是文档分页。第 1-10 幻灯片很少自己成为有意义的片段。

常见失败点

症状可能原因修复
请求立即被拒同时发送了 file_urllink_url只保留一个
URL 仅在浏览器中工作需要登录、cookie 或私人网络使用公开签名 URL 或已批准存储
视频忽略关键主张源对于持续时间太宽泛在提示词中命名主张和场景顺序
屏幕上的数字错误生成视频正在重新绘制文本在后期添加精确文本或使用确定性叠加
输出感起来像通用广告提示词没有定义观众或证据说明观众、必需事实和排除项

完整字段列表在 Wan 3.0 API 文档 中,当前价表在 Wan 3.0 模型页 上。

参考资源

  1. reAPI Wan 3.0 API documentation, accessed August 23, 2026.
  2. reAPI Wan 3.0 model and pricing page, accessed August 23, 2026.
  3. Alibaba Cloud, "Wan 3.0: 30-Second AI Video Generation from Any Input", 2026.