Open Generative AI 入门指南:免费开源的 AI 图像与视频生成,从安装到出图的完整路径
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
想不花订阅费、也不被提示词审查拦截,就把 Flux、Midjourney、Kling、Sora、Veo 这类主流模型放进同一个工作台里,生成自己的第一张 AI 图像或第一段 AI 视频——这就是 Open Generative AI 要解决的事。它是 MIT 协议的开源项目,聚合 400+ 个模型(packages/studio/src/models.js 是全仓库的模型清单),内置图像、视频、音频、口型同步、电影感镜头等 14 个工作室,支持自托管,桌面端还内置本地推理引擎。本文按"选安装方式 → 跑通第一次生成 → 进阶用法 → 排障"的顺序,带你把这套工具真正用起来。
三种上手方式,按你的身份选一条
- 只想先看看效果:用官方在线版,浏览器打开即可用全部工作室,无需 Node 环境。注意云端模型需要填写 API Key;如果只用桌面端的本地模型,可以跳过。
- 要日常创作、偶尔离线:装桌面应用(macOS 提供 DMG,Windows 提供 EXE 安装包,Linux 提供 AppImage 和 .deb)。本地推理是桌面端独有的能力,在线版固定走云端 API。
- 要改代码或贡献功能:从源码构建,仓库带有 git submodule,必须一并检出,否则会报"找不到 pages 目录"之类的构建错误。
macOS 桌面应用未经 Apple 公证,首次启动会被 Gatekeeper 拦住,只需处理一次:
xattr -cr "/Applications/Open Generative AI.app"执行后右键应用选"打开"即可。Linux 用户装 AppImage 后同样要做一次执行权限处理;Ubuntu 24.04 及以上版本受沙箱策略影响,建议直接装 .deb 包。
源码构建的最小路径(要求 Node.js 18 及以上):
git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI npm run setup npm run electron:dev # 桌面端;要跑 Web 版改用 npm run dev,访问 http://localhost:3000npm run setup会依次完成装依赖和构建 studio、workflow、agents 等 workspace 子包,只跑npm install是不够的。
第一次实操:在图像工作室跑通一张图
下面带你完整做完一次生成,全程不超过五分钟。
- 打开。启动应用后进入 Image Studio(图像工作室),默认就是"文本到图像"模式;如果你上传了参考图,模型列表会自动切换成"图像到图像"那组,这一步不用手动操作。
- 输入。在提示词框里按"主体 + 环境 + 光线 + 风格"来组织句子,例如:
橘色虎斑猫蜷在窗台阳光里,毛发细节清晰,暖调逆光,写实摄影风格。越具体,模型要猜的越少,出图越可控;只写"一只猫"基本等于把构图权交给模型。 - 调整。挑一个模型(通用需求选 Flux 或 Nano Banana 2 这类主力模型),再按用途选宽高比:横屏素材用 16:9,竖屏用 9:16,方形头像用 1:1。分辨率和质量档位会随所选模型变化,只在该模型支持的范围内可改。
- 生成。点 Generate,完成后在历史面板一键下载全分辨率文件。参考图会被存进上传历史,下次直接复用,不用重复上传。
按场景对照着选,不用逐个模型试:
| 使用场景 | 推荐选项 |
|---|---|
| 通用出图 | Nano Banana 2,分辨率 2K 起 |
| 写实人像 | Midjourney v7,50mm 焦距、f/1.4 光圈(在电影工作室) |
| 图生图 / 风格迁移 | Nano Banana 2 Edit(最多 14 张参考图) |
| 文生视频 | Kling、Seedance 2.0,时长 5–15 秒 |
| 图生视频 | Seedance 2.0 I2V,上传一张起始帧 |
| 让图片开口说话 | Infinite Talk,480p / 720p 两档 |
| 电影感镜头 | Cinema Studio,胶片机型 + 变形宽银幕镜头 |
进阶用法,按场景各给一条可照做的建议
追求更高质量:先用"基础"质量档把构图和提示词敲定,确认构图对了再切到"高质量"档重跑同一提示词,分辨率同时提到 2K/4K。这是最省额度的顺序,不要反过来。
多图参考输入:选一个支持多参考图的编辑模型——Nano Banana 2 Edit 最多 14 张,Flux Kontext Dev 最多 10 张。一次勾选全部参考图后点"Use Selected"确认,图片按你勾选的顺序传给模型,所以第一张图就是最强约束,把最关键的构图或风格参考放在第一位。
电影感镜头控制:在 Cinema Studio 里用真实摄影参数代替形容词——机身选 70mm 胶片、镜头选变形宽银幕、焦距 35mm 拍环境、50mm 拍人物,光圈 f/1.4 做浅景深虚化,f/11 让前后景都清晰。这些选择会被翻译成模型能理解的镜头语言,比在提示词里堆"电影感""大片感"有效得多。
让静态图开口说话:进 Lip Sync Studio,保持默认"肖像图"模式,上传一张正脸图加一段音频(480p / 720p 两档),选 Infinite Talk 出 talking video;如果手里已有视频,切到 Video 模式做口型重同步。
搭一条自动流程:用 Workflow Studio 把"概念图生成 → 分辨率提升 → 风格化编辑 → 批量导出"连成四步链路,跑通后存进 My Workflows 反复执行;也可以直接跑社区发布的模板。工作流的每个环节同样能通过 API 触发,方便接入你自己的系统。
高频故障,照"现象→原因→解决"排查
- 现象:macOS 首次打不开桌面应用。原因:应用未经 Apple 公证,Gatekeeper 默认拦截。解决:终端执行
xattr -cr "/Applications/Open Generative AI.app",或在"系统设置 → 隐私与安全性"里点"仍要打开",仅需做一次。 - 现象:Windows 安装时提示"已保护你的电脑"。原因:安装包未做代码签名,SmartScreen 例行提醒。解决:点"更多信息"再选"仍要运行",安装本身不受影响。
- 现象:Linux 的 AppImage 无反应或启动即退出。原因:文件缺少执行权限、旧系统缺依赖,或 Ubuntu 24.04+ 的沙箱策略。解决:
chmod +x加执行权限、sudo apt install libfuse2补依赖;24.04 以上直接改装 .deb 包,它自带所需的安全策略配置。 - 现象:出图偏糊、细节丢失。原因:用了基础质量档或分辨率偏低。解决:切高质量模式并把分辨率提到 2K 或 4K 重跑同一提示词。
- 现象:生成速度明显慢。原因:云端排队或所选模型本身开销大。解决:先用基础质量档出图;桌面端可在设置 → 本地模型里启用 sd.cpp 引擎走本地推理,离线也能出图。
- 现象:提示词报"不被支持"或选了模型不出结果。原因:模型类型和输入不匹配,例如把纯文字需求交给了必须传参考图的编辑模型。解决:核对模型类别——纯文字出图选文本到图像模型,上传参考图后系统会自动切到图像到图像列表。
适用边界与下一步
这套工具适合个人创作、设计打样、批量素材生产:免费、无内容过滤、代码可改可托管;但它不适合对延迟和稳定性有 SLA 要求的生产链路,也不适合需要完整内容审核流水线的合规场景——云端模型统一走外部 API 网关,离线生成只覆盖本地引擎支持的图像模型。
延伸方向有三个:一是翻模型清单 packages/studio/src/models.js,按分类找适合你项目的型号并核对参数;二是查 app/api/ 下的接口代码,所有调用都是"POST 提交任务、GET 轮询结果"两步,照此即可把生成能力接进自己的应用;三是参与开源,提交前可先跑一遍 tests/ 里的本地推理相关测试确认环境。
现在就打开图像工作室,输入你准备好的第一句提示词,按下 Generate。
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考