digital-human-api

v2026.09.24

Digital human video generation via Qingyun API — avatar-based talking head videos

GitHub
安装命令
npx skhub add aaaaqwq/digital-human-api
Markdown
SKILL.md

digital-human-api v3

基于青云API的通用数字人口播视频生成 Skill。

v3核心改进:每shot生成专属场景图(Daniel真脸 + 个性化场景),视频自然不抽象。

触发条件

  • 数字人视频、口播视频、digital human
  • 基于剧本生成分镜头数字人视频

v3 新流程(4步/shot)

剧本JSON → [Scene Image] → [TTS] → [Kling Video] → [Lip Sync] → FFmpeg合并
              ↑ 新增:每个shot独立生成贴合场景的图片

每shot独立流程:

  1. 🖼️ 场景图生成 — Grok依据参考脸生成贴合场景的图片(保持Daniel的脸)
  2. 📝 TTS语音 — Gemini生成口播音频
  3. 🎬 Kling视频 — 场景图 + 动作提示词 → 动态视频
  4. 👄 对口型 — Kling LipSync音画同步
  5. 🔗 FFmpeg合并 — 所有shot + BGM → 最终视频

v3 剧本格式

{
  "title": "视频标题",
  "avatar_image": "/path/to/daniel-headshot.jpg",
  "shots": [
    {
      "id": 1,
      "text": "口播文案",
      "emotion": "sarcastic",
      "scene_description": "(可选)场景图详细描述",
      "duration": 5
    }
  ]
}

emotion 可选值

emotion动作风格
serious严肃直视镜头
friendly友好微笑
excited兴奋手势多
sarcastic讽刺挑眉
storytelling讲故事手势
humorous幽默轻松
intense紧张/激动
confident自信权威
questioning疑惑歪头
casual日常对话

scene_description 写法

描述越具体,场景图越贴合。建议格式:

  • 人物表情+动作(如:raised eyebrow, holding coffee cup)
  • 场景(如:modern cafe, restaurant table)
  • 光线(如:warm natural lighting)
  • 风格(如:realistic photo, shot on iPhone)

使用方式

export QINGYUN_API_KEY=$(pass show api/qingyun)

# 完整流水线
python3 scripts/generate.py --script script.json --concurrent 1

# 分步执行
python3 scripts/generate.py --script script.json --step image    # 场景图
python3 scripts/generate.py --script script.json --step tts      # TTS语音
python3 scripts/generate.py --script script.json --step video     # Kling视频
python3 scripts/generate.py --script script.json --step lipsync  # 对口型
python3 scripts/generate.py --script script.json --step merge    # 合并

输出结构

output_dir/
├── shot_01_scene.jpg          # 场景原图
├── shot_01_scene_768.jpg      # 适配Kling的尺寸
├── shot_01_audio.mp3          # TTS语音
├── shot_01_video.mp4          # Kling视频
├── shot_01_lipsync.mp4        # 对口型完成
├── ...
└── final.mp4                  # 最终视频

已知限制

问题解决
视频太抽象v3改用场景图,每个shot独立生成
429限流并发=1,轮询间隔15s
图片像素无效自动resize到768px宽
Grok场景图失败自动降级到无ref生成

文件清单

digital-human-api/
├── SKILL.md              # 本文件
├── scripts/
│   ├── generate.py       # 主脚本 v3(~800行)
│   └── config.yaml       # 配置 v3
发现
标签

此技能尚未发布标签。

版本
最新版本元数据

版本

v2026.09.24

发布时间

2026年9月24日

分类

未分类

许可证

MIT

源路径

skills/digital-human-api

默认分支

main

最新提交

b996aac

Tree SHA

07e787b