文件名称:学习目标-tinyxml指南[中文]
文件大小:6.46MB
文件格式:PDF
更新时间:2024-07-04 16:39:34
RapidMiner
13.1 应用场景 舆情分析、企业竞争对手分析 互联网专业信息收集 … 13.2 学习目标 在学习完本章后,您应能够: 解释什么是 web 挖掘、如何使用 web 挖掘,以及使用 web 挖掘有哪些好处。 识别 web 挖掘可能采取的各种格式,以便进行 web 挖掘。 连接至 web url,并将其导入为 web 挖掘模型的数据来源。 在 RapidMiner 中开发一个 web 挖掘模型 对 web 挖掘结果进行信息抽取、转储。 13.3 概览 本章介绍 web 挖掘。由于大部分交流信息多数出现在互联网上,且以文本格式保存, web 挖掘是挖掘中的一个重要领域。我们将建立一个 RapidMiner 挖掘流程,来学习如何通 过连接到生物医学期刊网站,获取蛋白质相关论文的 web 数据,从中找到用户关心的某些 信息内容:某蛋白质近年来论文发表数量趋势,及该蛋白质论文的作者、联系邮箱、通讯地 址等信息(对于蛋白质生产厂商,他一定关心如何找到这些信息进行广告投放)。我们会利 用 web 挖掘技术、结合文本挖掘技术,把这些信息从互联网上获取存储到本地磁盘,然后 利用 web 挖掘、文本挖掘技术对这些信息进行拆分解析,将有用信息存储到 mysql 数据库 中。 以下为我们主要执行的挖掘步骤: – 安装 web 挖掘插件 – 加载网站 url 到 RapidMiner web 挖掘算子中 – 获取并保存 web 页面到本地磁盘