简介:摘要:近年来,按照中国气象局要求,气象业务呈现自动化、智慧化特点,全国自动化气象探测设备布点越来越密集,数据量每年以PB级增长,传统的数据分析技术的劣势不断凸显。如何利用高效的方法或算法挖掘隐藏在海量数据背后的价值,是目前气象人需要着重关注的点。本文通过介绍数据挖掘和可视化技术在气象业务中应用,进一步分析未来的发展前景。
简介:用户访问数据中往往存在大量无用或与当前信息挖掘无关的数据,我们通过数据清洗从挖掘对象中去除不相关的数据,并实现了用户识别、会话识别、格式化等步骤,对WEB信息进行预处理,为进一步的操作提供了较好的数据格式,提高了挖掘效率。同时,因特网上的信息往往具有非结构化或半结构化特性,难以得到传统数据挖掘技术的支持,我们通过事务识别技术解决了这一问题,将访问序列组织成逻辑单元以表示事务或用户会话,将所有事务组成一个事务数据库,识别出事务后就可以利用对传统数据挖掘的方法对WEB数据进行挖掘:事务识别技术有多种实现形式,不同形式有不同的应用场合,本文根据特定挖掘任务,实现了以时间维来分割事务的算法,并给出了一些实验数据。