http://www.cnblogs.com/longwu/archive/2011/12/24/2300110.html
1)、学习网页数据采集,首先必不可少的是学习java的正则表达式(Regex)
Java的正则表达式类文件放置在 java.util.regex 包中, java.util.regex 包含三个类: Pattern, Matcher and PatternSyntaxException
1.1 Pattern对象是正则表达式的编译版本。它没有包含任何的公共构造器。我们传递正则表达式参数给它的公共静态方法compile 来建立一个Pattern对象。
1.2 Matcher是一个正则引擎对象用来将建立的Pattern对象和输入字符匹配。这个类同样也不包含任何的公共构造器。我们可以使用pattern对象的matcher 方法返回一个布尔结果以判断输入字符是否和正则pattern匹配。
1.3.如果正则表达式语意错误, PatternSyntaxException 抛出异常。