Berksey

98-74 Ocean Street, Sky Height

使用 karakeep 也有几个月了,也与反爬严重的网站打了几个月的架。在某次与 ChatGPT 排查 cookie 配置的聊天中得知,可以使用 SingleFile 将当前打开的页面保存到 karakeep,直接绕过反爬和登录问题(且这是官方推荐做法,karakeep 早已集成了 SingleFile)。后来发现还能通过 n8n 处理抓好的 html 文件,从而让 karakeep 的阅读视图展示干净的文本。一番努力后终于配好了我的抓取和清洗工作流,这里附上教程,以供他人参考。

阅读全文 »

刷微博时看到有人介绍了自己的学习工作流,提到了一个名为 karakeep 的书签收藏软件。自己用 Docker 部署后发现确实好用,但是撞上反爬虫机制严重的网站就什么都爬不到了。查找后发现 karakeep 支持给爬虫设置 cookie,这样就能以正常用户身份去爬取数据。再经过一番努力后终于配置成功。这里附上教程,以供他人参考。

阅读全文 »
0%