《UCI数据集和源代码》html
UCI数据集是一个经常使用的标准测试数据集,下载地址在java
http://www.ics.uci.edu/~mlearn/MLRepository.htmlpython
个人主页上也有整理好的一些UCI数据集(arff格式):mysql
http://lamda.nju.edu.cn/yuy/files/download/UCI_arff.ziplinux
在看别人的论文时,别人使用的数据集会给出数据集的出处或下载地址(除非是很机密的数据,例如与国家安全有关)。若是你看的论文没有给出数据集的出处,请当即中止看这篇论文,而且中止看刊发这篇论文的期刊上的全部文章。由于能够判定这些文章质量不好。ios
关于源代码,网上有不少公开源码的算法包,例如最为著名的Weka,MLC++等。Weka还在不断的更新其算法,下载地址:web
http://www.cs.waikato.ac.nz/ml/weka/算法
不少的机器学习的经典算法都在里面。并且公布源程序,易于修改。sql
若是做者没有公布源程序,能够到做者主页找找,也能够写信给做者要,通常论文开头都会有做者的email地址。写信的时候要注意要颇有礼貌,不然做者,尤为是著名学者,颇有可能不会理睬。若是算法简单,能够本身实现。数据库
关于论文的下载,若是可以访问电子图书馆是最好的,不少学校都买了IEEE, Elsevier, Kluwer等,上面的期刊都不错。有一些很好的期刊是免费的,像JAIR和JMLR,分别在:
http://www.cs.washington.edu/research/jair/home.html
若是能访问的免费期刊太少,能够到CiteSeer上搜索(http://citeseer.ist.psu.edu/ ),上面搜集了不少免费论文(可是要注意,论文的质量良莠不齐),或者用Googlewww.google.com )搜索。
再嘱咐两点,要作研究,首先要打好基础,例如数学基础和程序设计能力,要学会熟练使用google等搜索引擎,还有必定要看高质量的论文。
《数据挖掘的数据集资源》
你们作数据挖掘研究时,经常为找不到合适的数据而发愁。在KDNuggets上有Datasets栏目,提供一些数据集,网址为:http://www.kdnuggets.com/datasets/
还有另一个很好的资源网址为:http://kdd.ics.uci.edu/ ,里面包含的数据资源以下(按应用领域划分):
Direct Marketing
KDD CUP 1998 Data
GIS
Forest CoverType
Indexing
Corel Image Features
Pseudo Periodic Synthetic Time Series
Intrusion Detection
KDD CUP 1999 Data
Process Control
Synthetic Control Chart Time Series
Recommendation Systems
Entree Chicago Recommendation Data
Robots
Pioneer-1 Mobile Robot Data
Robot Execution Failures
Sign Language Recognition
Australian Sign Language Data
High-quality Australian Sign Language Data
Text Categorization
20 Newsgroups Data
Reuters-21578 Text Categorization Collection
NSF Research Awards Abstracts 199 0-2003
World Wide Web
Microsoft Anonymous Web Data
MSNBC Anonymous Web Data
Syskill Webert Web Data
转:http://blogger.org.cn/blog/more.asp?name=DMman&id=24043
一、气候监测数据集 http://cdiac.ornl.gov/ftp/ndp026b
二、几个实用的测试数据集下载的网站
http://www.cs.toronto.edu/~roweis/data.html
http://www.cs.toronto.edu/~roweis/data.html
http://kdd.ics.uci.edu/summary.task.type.html
http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-20/www/data/
http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-11/www/wwkb/
http://www.phys.uni.torun.pl/~duch/software.html
在下面的网址能够找到reuters数据集http://www.research.att.com/~lewis/reuters21578.html
如下网址上有各类数据集:
http://kdd.ics.uci.edu/summary.data.type.html
进行文本分类,还有一个数据集是能够用的,即rainbow的数据集
http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html
三、找了不少测试数据集,写论文的同志们确定须要的,至少能用来检验算法的效果
可能有一些不能访问,可是总有能访问的吧:
UCI收集的机器学习数据集
http://www.ics.uci.edu/~mlearn//MLRepository.htm
statlib
http://liama.ia.ac.cn/SCILAB/scilabindexgb.htm
样本数据库
http://www.ics.uci.edu/~mlearn/MLRepository.html
关于基金的数据挖掘的网站
http://www.gotofund.com/index.asp
http://lans.ece.utexas.edu/~strehl/
reuters数据集
http://www.research.att.com/~lewis/reuters21578.html
各类数据集:
http://kdd.ics.uci.edu/summary.data.type.html
http://www.mlnet.org/cgi-bin/mlnetois.pl/?File=datasets.html
http://lib.stat.cmu.edu/datasets/
http://dctc.sjtu.edu.cn/adaptive/datasets/
http://fimi.cs.helsinki.fi/data/
http://www.almaden.ibm.com/software/quest/Resources/index.shtml
http://miles.cnuce.cnr.it/~palmeri/datam/DCI/
进行文本分类&WEB
http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html
http://www.w3.org/TR/WD-logfile-960221.html
http://www.w3.org/Daemon/User/Config/Logging.html#AccessLog
http://www.w3.org/1998/11/05/WC-workshop/Papers/bala2.html
http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-11/www/wwkb/
http://www.web-caching.com/traces-logs.html
http://www.cs.auc.dk/research/DP/tdb/TimeCenter/TimeCenterPublications/TR-75.pdf
http://www.cs.cornell.edu/projects/kddcup/index.html
时间序列数据的网址
http://www.stat.wisc.edu/~reinsel/bjr-data/
apriori算法的测试数据
http://www.almaden.ibm.com/cs/quest/syndata.html
数据生成器的连接
http://www.cse.cuhk.edu.hk/~kdd/data_collection.html
http://www.almaden.ibm.com/cs/quest/syndata.html
关联:
http://flow.dl.sourceforge.net/sourceforge/weka/regression-datasets.jar
http://www.almaden.ibm.com/software/quest/Resources/datasets/syndata.html#assocSynData
WEKA:
http://flow.dl.sourceforge.net/sourceforge/weka/regression-datasets.jar
1。A jarfile containing 37 classification problems, originally obtained from the UCI repository
http://prdownloads.sourceforge.net/weka/datasets-UCI.jar
2。A jarfile containing 37 regression problems, obtained from various sources
http://prdownloads.sourceforge.net/weka/datasets-numeric.jar
3。A jarfile containing 30 regression datasets collected by Luis Torgo
http://prdownloads.sourceforge.net/weka/regression-datasets.jar
癌症基因:
http://www.broad.mit.edu/cgi-bin/cancer/datasets.cgi
金融数据:
http://lisp.vse.cz/pkdd99/Challenge/chall.htm
另外一我的提供的
http://www.cs.toronto.edu/~roweis/data.html
http://kdd.ics.uci.edu/summary.task.type.html
http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-20/www/data/
http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-11/www/wwkb/
http://www.phys.uni.torun.pl/~duch/software.html
在下面的网址能够找到reuters数据集
http://www.research.att.com/~lewis/reuters21578.html
如下网址上有各类数据集:
http://kdd.ics.uci.edu/summary.data.type.html
进行文本分类,还有一个数据集是能够用的,即rainbow的数据集
http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html
Download the Financial Data (~17.5M zipped file, ~67M unzipped data)
Download the Medical Data (~2M zipped file, ~6M unzipped data)
http://lisp.vse.cz/pkdd99/Challenge/chall.htm
kdnuggets 相关连接数据集(借花献佛了):
http://www.kdnuggets.com/datasets/index.html
你也能够到http://blogger.org.cn/blog/more.asp?name=idmer&id=24017
察看kdnuggets 数据集资源的详细介绍。
数据挖掘相关比赛以及数据集
2005 University of California data mining contest , predicting bad accounts and their churn date using real-world CRM data, deadline June 30, 2005.