转:UCI数据集和源代码&数据挖掘的数据集资源 - -小神飞

时间:2024-02-23 13:08:50

转:UCI数据集和源代码&数据挖掘的数据集资源

《UCI数据集和源代码》

UCI数据集是一个常用的标准测试数据集,下载地址在

http://www.ics.uci.edu/~mlearn/MLRepository.html

我的主页上也有整理好的一些UCI数据集(arff格式):

http://lamda.nju.edu.cn/yuy/files/download/UCI_arff.zip

在看别人的论文时,别人使用的数据集会给出数据集的出处或下载地址(除非是很机密的数据,例如与国家安全有关)。如果你看的论文没有给出数据集的出处,请立即停止看这篇论文,并且停止看刊发这篇论文的期刊上的所有文章。因为可以断定这些文章质量很差。

关于源代码,网上有很多公开源码的算法包,例如最为著名的Weka,MLC++等。Weka还在不断的更新其算法,下载地址:

http://www.cs.waikato.ac.nz/ml/weka/

很多的机器学习的经典算法都在里面。而且公布源程序,易于修改。

如果作者没有公布源程序,可以到作者主页找找,也可以写信给作者要,一般论文开头都会有作者的email地址。写信的时候要注意要很有礼貌,否则作者,尤其是著名学者,很有可能不会理睬。如果算法简单,可以自己实现。

关于论文的下载,如果能够访问电子图书馆是最好的,很多学校都买了IEEE, Elsevier, Kluwer等,上面的期刊都不错。有一些很好的期刊是免费的,像JAIR和JMLR,分别在:

http://www.cs.washington.edu/research/jair/home.html

http://www.jmlr.org/

如果能访问的免费期刊太少,可以到CiteSeer上搜索(http://citeseer.ist.psu.edu/ ),上面搜集了很多免费论文(但是要注意,论文的质量参差不齐),或者用Googlewww.google.com )搜索。

再嘱咐两点,要做研究,首先要打好基础,例如数学基础和程序设计能力,要学会熟练使用google等搜索引擎,还有一定要看高质量的论文。

《数据挖掘的数据集资源》

大家做数据挖掘研究时,常常为找不到合适的数据而发愁。在KDNuggets上有Datasets栏目,提供一些数据集,网址为:http://www.kdnuggets.com/datasets/

还有另外一个很好的资源网址为:http://kdd.ics.uci.edu/ ,里面包含的数据资源如下(按应用领域划分):

Direct Marketing

  KDD CUP 1998 Data

GIS

  Forest CoverType

Indexing

  Corel Image Features

  Pseudo Periodic Synthetic Time Series

Intrusion Detection

  KDD CUP 1999 Data

Process Control

  Synthetic Control Chart Time Series

Recommendation Systems

  Entree Chicago Recommendation Data

Robots

  Pioneer-1 Mobile Robot Data

  Robot Execution Failures

Sign Language Recognition

  Australian Sign Language Data

  High-quality Australian Sign Language Data

Text Categorization

  20 Newsgroups Data

  Reuters-21578 Text Categorization Collection

  NSF Research Awards Abstracts 199 0-2003

World Wide Web

  Microsoft Anonymous Web Data

  MSNBC Anonymous Web Data

  Syskill Webert Web Data

 转:http://blogger.org.cn/blog/more.asp?name=DMman&id=24043

1、气候监测数据集 http://cdiac.ornl.gov/ftp/ndp026b

2、几个实用的测试数据集下载的网站

http://www.cs.toronto.edu/~roweis/data.html

http://www.cs.toronto.edu/~roweis/data.html

http://kdd.ics.uci.edu/summary.task.type.html

http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-20/www/data/

http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-11/www/wwkb/

http://www.phys.uni.torun.pl/~duch/software.html

在下面的网址可以找到reuters数据集http://www.research.att.com/~lewis/reuters21578.html

以下网址上有各种数据集:

http://kdd.ics.uci.edu/summary.data.type.html

进行文本分类,还有一个数据集是可以用的,即rainbow的数据集

http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html

3、找了很多测试数据集,写论文的同志们肯定需要的,至少能用来检验算法的效果

可能有一些不能访问,但是总有能访问的吧:

UCI收集的机器学习数据集

ftp://pami.sjtu.edu.cn/

http://www.ics.uci.edu/~mlearn//MLRepository.htm

statlib

http://liama.ia.ac.cn/SCILAB/scilabindexgb.htm

http://lib.stat.cmu.edu/

样本数据库

http://kdd.ics.uci.edu/

http://www.ics.uci.edu/~mlearn/MLRepository.html

关于基金的数据挖掘的网站

http://www.gotofund.com/index.asp

http://lans.ece.utexas.edu/~strehl/

reuters数据集

http://www.research.att.com/~lewis/reuters21578.html

各种数据集:

http://kdd.ics.uci.edu/summary.data.type.html

http://www.mlnet.org/cgi-bin/mlnetois.pl/?File=datasets.html

http://lib.stat.cmu.edu/datasets/

http://dctc.sjtu.edu.cn/adaptive/datasets/

http://fimi.cs.helsinki.fi/data/

http://www.almaden.ibm.com/software/quest/Resources/index.shtml

http://miles.cnuce.cnr.it/~palmeri/datam/DCI/

进行文本分类&WEB

http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html

http://www.w3.org/TR/WD-logfile-960221.html

http://www.w3.org/Daemon/User/Config/Logging.html#AccessLog

http://www.w3.org/1998/11/05/WC-workshop/Papers/bala2.html

http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-11/www/wwkb/

http://www.web-caching.com/traces-logs.html

http://www-2.cs.cmu.edu/webkb

http://www.cs.auc.dk/research/DP/tdb/TimeCenter/TimeCenterPublications/TR-75.pdf

http://www.cs.cornell.edu/projects/kddcup/index.html

时间序列数据的网址

http://www.stat.wisc.edu/~reinsel/bjr-data/

apriori算法的测试数据

http://www.almaden.ibm.com/cs/quest/syndata.html

数据生成器的链接

http://www.cse.cuhk.edu.hk/~kdd/data_collection.html

http://www.almaden.ibm.com/cs/quest/syndata.html

关联:

http://flow.dl.sourceforge.net/sourceforge/weka/regression-datasets.jar

http://www.almaden.ibm.com/software/quest/Resources/datasets/syndata.html#assocSynData

WEKA:

http://flow.dl.sourceforge.net/sourceforge/weka/regression-datasets.jar

1。A jarfile containing 37 classification problems, originally obtained from the UCI repository

http://prdownloads.sourceforge.net/weka/datasets-UCI.jar

2。A jarfile containing 37 regression problems, obtained from various sources

http://prdownloads.sourceforge.net/weka/datasets-numeric.jar

3。A jarfile containing 30 regression datasets collected by Luis Torgo

http://prdownloads.sourceforge.net/weka/regression-datasets.jar

癌症基因:

http://www.broad.mit.edu/cgi-bin/cancer/datasets.cgi

金融数据:

http://lisp.vse.cz/pkdd99/Challenge/chall.htm

 

另一个人提供的

http://www.cs.toronto.edu/~roweis/data.html

http://kdd.ics.uci.edu/summary.task.type.html

http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-20/www/data/

http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-11/www/wwkb/

http://www.phys.uni.torun.pl/~duch/software.html

在下面的网址可以找到reuters数据集

http://www.research.att.com/~lewis/reuters21578.html

以下网址上有各种数据集:

http://kdd.ics.uci.edu/summary.data.type.html

进行文本分类,还有一个数据集是可以用的,即rainbow的数据集

http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html

Download the Financial Data (~17.5M zipped file, ~67M unzipped data)

Download the Medical Data (~2M zipped file, ~6M unzipped data)

http://lisp.vse.cz/pkdd99/Challenge/chall.htm

kdnuggets 相关链接数据集(借花献佛了):

http://www.kdnuggets.com/datasets/index.html

你也可以到http://blogger.org.cn/blog/more.asp?name=idmer&id=24017

察看kdnuggets 数据集资源的详细介绍。

数据挖掘相关比赛以及数据集

2005 University of California data mining contest , predicting bad accounts and their churn date using real-world CRM data, deadline June 30, 2005.

ILP 2005 Challenge , on the prediction of functional classes of genes. KDD Cup 2005 , on classifying internet user search queries, deadline July 8. Data Mining Cup 2005 (Chemnitz, Germany) , for students; topic: How data mining can ascertain the risk of loss of payments and reduce this risk. KDD Cup 2004 , focuses on data-mining for a several performance criteria using datasets from bioinformatics and quantum physics. InfoVis 2004 Contest , The History of InfoVis. DATA MINING CUP 2004 (Chemnitz, Germany) , for students. InfoVis 2003 Contest: Visualization and Pair Wise Comparison of Trees , results announced Sep 5, 2003. KDD Cup 2003 , focuses on problems motivated by network mining and the analysis of usage logs. DATA MINING CUP 2003 (Chemnitz, Germany) . The task is to identify spam emails before they reach the user′s mailbox. KDD Cup 2002 , focus on data mining in molecular biology. Student Data Mining Cup (2002) , Chemnitz University and Prudential Systems.
 
下载 

k-means聚类(使用数据集:iris)

12-29
使用java语言在数据集iris上实现k-means聚类
下载 

UCI数据集(数据挖掘)

11-14
很全的uci数据集,格式为arff,希望有用

从0到1学好区块链开发,一年编程经验学完月薪可达40K+

立即申请试学,成为时代颠覆者

下载 

常见聚类数据集人工数据和UCI数据都有

01-26
这里面是机器学习里面聚类所需的数据集,分为人工的二维数据集,如月牙形,双螺旋型等,和UCI真实数据集,是我搜集好久才弄出来的,有一些二维数据集是自己生成的,提供给大家做算法实验。
下载 

聚类分析常用数据集

03-26
聚类分析常用的人工数据集,包括:UCI:wine、Iris、yeast,还有4k2_far、leuk72_3k等数据集。它们在聚类分析、数据挖掘、机器学习、模式识别领域经常用到。
下载 

聚类分析、机器学习及数据挖掘中常用数据集

09-02
在聚类分析、机器学习、数据挖掘中常用到的数据集,包括:UCI的数据集wine,yeast,iris等,还有USPS数据集,4k2_far,leuk72_3k数据集等。

博主推荐

 换一批
wonder4
wonder4

关注 639篇文章

Eastmount
Eastmount

关注 310篇文章

fengbingchun
fengbingchun

关注 729篇文章

uci聚类测试数据集

下载

09-15

该文件有六百条数据,每100条是一类。可用于聚类的测试。... *详细原因: 取  消 提  交 uci聚类测试数据集 3积分 立即下载 ...

UCI数据集

下载

09-19

是arff 格式的数据,应该非常有用,可以测试一些数据挖掘分类算法的准确度,对学习...常见聚类数据集人工数据和UCI数据都有 97 2018-01-26 chenguangchun1993 VIP...

下载 

用机器学习算法对UCI上的三个数据集做预测

02-07
1. 在UC Irvine Machine Learning数据集上选择三个数据 2. 编写一种机器学习算法预测结果,并使用十次、十折交叉验证 3. 撰写报告,包含对数据集、算法、结果的描述以及源代码
下载 

arff数据集全集

08-25
目录列表: 2dplanes.arff abalone.arff ailerons.arff Amazon_initial_50_30_10000.arff anneal.arff anneal.OR
下载 

聚类测试数据

08-15
two_cluster、three_cluster、five_cluster为不同簇数的点集,适用于Kmeans聚类 spiral、Twomoons、ThreeCircles分别为螺旋分布、月牙分布、
下载 

数据挖掘聚类分析技术实验常用真实数据集

03-19
全部为txt文档数据,数据挖掘聚类分析技术,算法实验过程中,经常用到的经典UCI、UPSP等真实数据集,常用于算法的实验验证。文档中注有相应的数据量、属性等信息,可直接进行使用。
下载 

K-means聚类数据.rar

11-16
详见博文:http://blog.csdn.net/hujingshuang/article/details/49867455
下载 

二维聚类数据集

09-30
用于聚类方法的数据集,包括不同数目的块状聚类、月牙形、同心环形及螺旋形分布,可用于Kmeans、谱聚类等聚类方法的测试。
下载 

常用聚类分析数据集

07-01
聚类分析常用的人工数据集,包括:UCI:wine、Iris、yeast,还有4k2_far、leuk72_3k等数据集。它们在聚类分析、数据挖掘、机器学习、模式识别领域经常用到。
下载 

adult数据集分析

02-15
adult数据集数据挖掘,基于python语言的决策树算法,源码+数据adult数据集数据挖掘,基于python语言的决策树算法,源码+数据adult数据集数据挖掘,基于python语言的决策树算法,源码+数据adult数据集数据挖掘,基...
下载 

多视图聚类数据集mfeat

09-08
该mfeat数据集主要用于多视图聚类算法研究,其中已经有标签,可以用于对最终聚类算法分出来的类簇进行评估。
下载 

聚类常用数据集

12-29
聚类常用数据集
下载 

常用UCI数据集

06-04
常用的UCI数据集,可直接用于机器学习,数据挖掘,直接实现
下载 

重叠聚类数据集

07-28
可直接在matlab中用,已经处理好! 20Newsgroup.mat emotions.mat scene.mat yeast2417.mat movie_taa.mat ……
下载 

聚类、分类所用数据集

09-06
做聚类、分类时很经典的测试数据集,可以很好的检测你所设计的算法。我所上传的数据集格式是.mat格式,用load命令就可以加载。

没有更多推荐了,返回首页