自動化搜尋摘要 + 影片生成的 CLI 工具。搜尋摘要透過 Gemini API 完成,影片生成則透過 Playwright 模擬真人操作 Gemini Web 介面。
yt_agent/
├── .gitignore
├── gemini-agent-plan.md # 專案規劃文件
└── gemini-cli-agent/
├── main.py # CLI 入口(Typer)
├── agent.py # 主要 pipeline 邏輯
├── task_builder.py # Prompt 組裝 & 意圖判斷
├── requirements.txt # Python 依賴
├── .gitignore
├── tasks/
│ ├── __init__.py
│ ├── search_summarize.py # Gemini API 搜尋摘要
│ └── video_generate.py # Playwright 瀏覽器自動化影片生成
├── output/ # 摘要/影片輸出(git ignored)
└── .browser_profile/ # 瀏覽器登入狀態(git ignored)
使用者指令
│
▼
┌─────────────────────┐
│ Gemini API 搜尋摘要 │ ← 每次都執行(search_summarize.py)
└─────────┬───────────┘
│
▼
┌─────────────────────┐
│ Gemini 意圖判斷 │ ← 判斷是否需要生成影片(task_builder.py)
└─────────┬───────────┘
│ 需要影片
▼
┌─────────────────────┐
│ Playwright 開啟瀏覽器 │ ← 模擬真人操作 Gemini Web(video_generate.py)
│ → 輸入 prompt │
│ → 等待回應完成 │
│ → 下載影片/截圖 │
└─────────────────────┘
cd gemini-cli-agent
# 安裝 Python 依賴
pip install -r requirements.txt
# 安裝 Playwright 瀏覽器
playwright install chromium在 gemini-cli-agent/ 目錄下建立 .env 檔案:
GEMINI_API_KEY=你的_Gemini_API_Key
⚠️ .env已被.gitignore排除,不會被推送到 GitHub。
所有指令都在 gemini-cli-agent/ 目錄下執行:
cd gemini-cli-agentpython main.py run "幫我搜尋最新的 AI 新聞並生成一段短影片"- 先透過 Gemini API 搜尋並產生摘要
- Gemini 自動判斷是否需要影片
- 若需要,會開啟瀏覽器自動在 Gemini Web 輸入 prompt 生成影片
- 摘要自動存到
output/summary_YYYYMMDD_HHMMSS.txt
# 指定摘要輸出路徑
python main.py run "搜尋 AI 新聞" --output my_summary.txtpython main.py video-from-file output/summary_20260427_144705.txt- 跳過搜尋步驟,直接讀取現有摘要
- 開啟瀏覽器在 Gemini Web 介面生成影片
影片生成使用 Playwright 瀏覽器自動化,模擬真人操作 Gemini Web:
- 首次執行需要在彈出的瀏覽器中手動登入 Google 帳號
- 登入狀態會保存在
.browser_profile/,後續執行不需重新登入 - 程式會自動在輸入框輸入 prompt、送出、等待回應
- 完成後自動下載影片(mp4)或截圖保存結果(png)
所有輸出存放在 output/ 目錄:
| 檔案格式 | 說明 |
|---|---|
summary_*.txt |
搜尋摘要文字檔 |
video_*.mp4 |
Gemini 生成的影片 |
result_*.png |
回應結果截圖(無影片時) |