admin 管理员组

文章数量: 1086019

上周开发了一个磁力链接和 BT 种子的搜索引擎 {Magnet & Torrent},本文简单介绍一下主要的系统功能和用到的技术。

系统包括几个独立的部分:

  • 使用 Python 的 Scrapy 框架开发的网络爬虫,用来爬取磁力链接和种子;

  • 使用 PHP CI 框架开发的简易网站;

  • 搜索引擎目前直接使用的 MySQL,将来可以考虑使用 sphinx;

  • 中文分词。

    用 PHP 写了一个简陋版的基于逆向最大匹配算法的小类,词库呢,哈哈,直接使用了 Chrome 的分词表,分词表可以在这个地址下载:http://www.mdbg/chindict/chindict.php?page=cedict。

  • 新词发现机制

    基于搜索关键词的新词发现机制。

    目前词库方面还有一个很大的问题,比如最新的电影无法分词,例如

本文标签: 磁力 架构 种子 搜索引擎 链接