|
主要功能
新闻采集系统的主要功能为:根据用户自定义的任务配置,批量而精确地抽取目标网络媒体栏目中的新闻或文章,转化为结构化的记录 (标题,作者,编辑,内容,更新时间,来源,分类,相关图片等),保存在本地数据库中,用于内部使用或外网发布(自定义导出),快速实现外部信息的获取。
功能简介
1、基本功能
数据采集:对预定的项目进行采集,可以分两种方式 (快速采集、稳定采集)进行。确保运行稳定可靠。
项目管理:添加项目智能化,实现了自动在后台对规则进行转换,从而避免书写复杂的正则表达式。
过滤设置:设置额外的过滤和替换操作。
历史记录:对采集过的内容保存为历史记录,避免重复和消耗资源。
2、特色功能
分类管理:对本地分类进行管理,可以满足多个来源到不同分类的需求。克服了目前许多采集系统的缺陷。
数据导出:自定义目的数据源和目的数据库表结构,可将采集信息随意导出到任何主流数据库的任何数据表中。
从而实现了系统的通用性。
系统特点
对目标网站进行信息自动抓取,支持 HTML页面内各种数据的采集,如文本信息,URL,数字,日期,图片等。
用户对每类信息自定义作者、编辑、来源、更新时间、点击数和分类。
支持记录唯一索引,避免相同信息重复入库。
支持智能替换功能,可以将内容中嵌入的所有的无关部分如广告去除。
数据直接进入数据库而不是文件中,因此与利用这些数据的网站程序或者桌面程序之间没有任何耦合。
支持数据库表结构完全自定义,充分利用现有系统。
支持多个栏目的信息采集可用同一配置一对多处理。
保证信息的完整性与准确性,绝不会出现乱码。
实现了跨平台技术,支持任何平台稳定运行。
支持各种主流数据库,如MSSQL、MySQL、Oracle等 。
运行环境
操作系统: Windows、Linux等
web服务器:tomcat
运行环境:jvm
内存: 最低32M内存,建议128M或以上
硬盘: 最少20M空余硬盘空间
行业应用
主要用于:行业网站的新闻采集,行业资讯采集,企业竞争情报获取等领域。
门户网站
可以做到:
每天自动采集指定网站(可达几百个,上千个)的最新内容(可以做到每天自动从上千个网络媒体采集上万条新闻信息)
利益:
大大节约工作人员采集因特网信息的时间与精力,让他们有更多时间专注于业务问题轻松实现行业信息整合
迅速提高本网站信息量与浏览量
新闻媒体应用
可以做到:
每天自动采集指定网站的新闻内容,扩大内容来源与数量轻松整合不同地区与行业的新闻,形成专题.
利益:
节约采编人员大量的时间,从而让他们可以有更多的精力来从事其他的事情
迅速提高本网站信息量与浏览量
轻松拥有海量信息输入
企业应用
可以做到:
实时而准确地采集国内外新闻,行业新闻,技术文章
利益:
快速实现企业应用(ERP,CRM等)及企业门户网站对于因特网内容的整合
快速建立大容量专业知识数据库,立刻促进公司的知识管理水平
节约内部员工到各网站查阅新闻的时间
政府机关与军队应用
可以做到:
实时跟踪、采集与政府工作相关的国内外及地方新闻,政策法规,经济,产业等信息
解决与因特网隔离的重要部门对于因特网的信息需求问题
解决政府主网站对各地级子网站的信息采集与整合问题
利益 :
全面满足内部工作人员对外部因特网的实时信息的整合需求
迅速解决政务外网、政务内网的信息量不足,更新不及时问题
通过扩大信息量 ( 如新闻 , 供求信息等 ) 提高政务网站的用户满意度
|