知识星球备份实战:把付费内容变成随身 PDF 电子书
2026/8/14 5:06:07 网站建设 项目流程

知识星球备份实战:把付费内容变成随身 PDF 电子书

【免费下载链接】zsxq-spider爬取知识星球内容,并制作 PDF 电子书。项目地址: https://gitcode.com/gh_mirrors/zs/zsxq-spider

凌晨一点,他差点失去三年的积累

凌晨一点,阿哲盯着手机屏幕,手指停在"不再续费"的按钮上迟迟不敢按下。他加入了三年的知识星球付费社群即将到期,星球里的上千条干货、几百张示意图、无数句醍醐灌顶的评论,眼看就要随着账号失效一起消失。那一瞬间他忽然清醒:所谓的知识星球备份,从来不是杞人忧天,而是给几年心血上的一道保险。他不想靠截图熬到天亮,更不想让这些内容永远躺在别人家的服务器里。📖

零散保存,到底有多疼?

那段时间,阿哲的相册里挤满了截图,聊天记录里塞满了"先存着"的链接。可真要翻找时,一切都成了灾难:想回看一篇讲行业趋势的文章,得在几百张截图里一页页滑;想重温某位前辈的问答,发现当时的评论早就沉了底;图片被压缩得模糊,排版七零八落。更让人心慌的是,付费内容本质上是"租"来的——平台一调整、社群一解散,三年的积累可能一夜归零。他第一次认真地问自己:这些知识,到底算不算我的?

一个叫 zsxq-spider 的家伙出现了

朋友给他推荐了一个开源小工具,用一句"人话"就能讲清它是什么:把知识星球里的文章、图片、评论,自动整理成一本可以离线阅读的 PDF 电子书。🛡️

它不做花哨界面,也不要求你懂编程,整个操作就两步:改几个配置,跑一条命令。作者自己就是被"存了内容却没法好好翻"逼疯的人,索性把抓取、下载图片、排版、成书的全流程做成了自动流水线。你不需要理解代码的每个细节,就像用微波炉不必懂电磁波。拿到它的那天,阿哲感觉散落多年的笔记,终于找到了一个可以安放的家。

跟着阿哲,从零到一跑通它

先把"厨房"搭起来

做什么:把项目拉回本地,装好依赖。 为什么:zsxq-spider 是 Python 写的,电脑里需要 Python 3.7 以上版本,再装几个辅助库它才跑得起来;另外还要安装一个叫 wkhtmltopdf 的小程序,它才是把网页排版"印"进 PDF 的幕后功臣。这一步就像搬家前先通电通水,基础不牢,后面全白搭。 完成后看到什么:终端安静下来,光标重新出现,说明环境就绪了。

git clone https://gitcode.com/gh_mirrors/zs/zsxq-spider cd zsxq-spider pip install pdfkit BeautifulSoup4 requests

这段命令替我们把工具搬进电脑,并装好生成 PDF 需要的三样依赖,跟下载一个普通软件差不多。

填好三把"钥匙"

做什么:用编辑器打开crawl.py,改几行配置。 为什么:星球内容是私密的,工具得靠你的登录凭证(Token)、浏览器标识(User-Agent)和小组 ID 才能进门。Token 藏在浏览器开发者工具的 Cookie 里,小组 ID 就印在星球网址的链接中。找起来有个小技巧:在浏览器里打开星球页面,按 F12 调出开发者工具,刷新一下,请求头里的 Cookie 一眼就能看到。 完成后看到什么:保存配置后,工具就像"认识"了你的星球——知道该进哪个门、拿谁的内容。

ZSXQ_ACCESS_TOKEN = '浏览器Cookie里的Token' # 进门钥匙 USER_AGENT = '登录时用的浏览器标识' # 要和登录时一致 GROUP_ID = '452445212848' # 星球小组ID PDF_FILE_NAME = '我的知识库.pdf' # 电子书文件名 ONLY_DIGESTS = False # True只要精华,False全部

这一段就是工具的"方向盘":告诉它去哪儿、拿什么、输出成什么名字。看不懂也没关系,照抄改值就行。

一键生成,然后等着惊喜

做什么:在项目目录里运行 python crawl.py。 为什么:接下来的流程全是自动的——工具分页拉取内容,把文章、问答、评论整理成网页,图片下载后以 base64 形式直接嵌进文档,最后统一排版成 PDF。想先试水的话,把 DEBUG 设为 True,它只会处理一小部分内容,确认没问题再全量导出。 完成后看到什么:控制台滚动着一行行网址,几分钟后跳出"电子书生成成功!",文件夹里多出一本排版清爽的 PDF。阿哲随手点开,图文俱在、评论完整,连之前乱糟糟的链接都变成了可点击的文字。

让备份更省心的三个小习惯

跑顺之后,阿哲攒下几条经验,都挺实用:

  • 别贪多,分批来。内容多的星球,把 COUNTS_PER_TIME 保持在 30,开启 SLEEP_FLAG 让请求之间歇口气,既稳定也不打扰别人。✅
  • 按时间归档。打开 FROM_DATE_TO_DATE,把某一年、某个月的内容单独导成一本,想翻哪段历史就翻哪本,比一整本"大部头"好查得多。
  • 给电子书换个皮肤。想改字号、颜色、图片圆角?打开 temp.css 调几个数值,重新跑一次,PDF 立刻变样。

踩坑了?别慌,两句口诀就够

阿哲也踩过两次坑,但都不吓人。

Token 过期?太正常了。重新在浏览器登录一次,从 Cookie 里抄一串新值替换进crawl.py,一分钟搞定。

PDF 生成失败?九成是 wkhtmltopdf 没装好,或没被系统找到。确认它的 bin 目录加进了环境变量,重跑一次就好。

记住一句话:出错时先看终端最后几行提示,它往往已经悄悄告诉了你答案。

把租来的知识,变成自己的资产

三个月后,阿哲的本地文件夹里,整整齐齐躺着十几本按年份归档的电子书。他终于想通了:那些原本"租"来的内容,如今变成了实实在在的数字资产。平台会变、社群会散,但一本躺在自己硬盘里的 PDF,谁也拿不走。📚

现在,轮到你了。找到开源项目 zsxq-spider,用上文那行 git clone 命令把它拉回本地,改几个配置、敲一条命令——就能为自己的知识盖一座永久的图书馆。一把命令,把平台里"租来"的内容,变成永远属于你的 PDF 电子书。别等了,那些内容,值得被你真正拥有。

【免费下载链接】zsxq-spider爬取知识星球内容,并制作 PDF 电子书。项目地址: https://gitcode.com/gh_mirrors/zs/zsxq-spider

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询