ms_celeb_1m数据提取（MsCelebV1-Faces-Aligned.tsv）python脚本

本文主要介绍了如何对MsCelebV1-Faces-Aligned.tsv文件进行提取

原创by南山南北秋悲

欢迎引用！请注明原地址 http://www.cnblogs.com/hwd9654/p/6796811.html 谢谢！

最近用caffe做人脸识别，一开始用lfw作为数据库，但是体量太小，只有五千多人的图片

后来想用李子青组的casia-webface，从网上找了个，下下来发现居然损坏了，好气啊！想去官网申请，却发现!!!:

Sign the agreement (The agreement must be signed by the director or the delegate of the deparmart of university. Personal applicant is not acceptable.

。。。。。。不接受个人申请，而lz的学院领导不给签字 - -

后来索性就直接拿微软的ms celeb 1m来训练

简介如下：官网地址（https://www.microsoft.com/en-us/research/project/ms-celeb-1m-challenge-recognizing-one-million-celebrities-real-world/）

　　MSR IRC是目前世界上规模最大、水平最高的图像识别赛事之一，由MSRA（微软亚洲研究院）图像分析、大数据挖掘研究组组长张磊发起

　　ms_celeb_1m就是这个比赛的数据集

　　从1M个名人中，根据他们的受欢迎程度，选择100K个。然后，利用搜索引擎，给100K个人，每人搜大概100张图片。共100K*100=10M个图片。

有三种下载选项：

1.完整版

ms_celeb_1m数据提取（MsCelebV1-Faces-Aligned.tsv）python脚本

需要自己预处理，人脸检测，人脸对齐。。。

2.微处理版，修剪了一下

ms_celeb_1m数据提取（MsCelebV1-Faces-Aligned.tsv）python脚本

3.对齐过的版本

ms_celeb_1m数据提取（MsCelebV1-Faces-Aligned.tsv）python脚本

楼主用的是第三个对齐过的版本

下载下来是这么个玩意儿

ms_celeb_1m数据提取（MsCelebV1-Faces-Aligned.tsv）python脚本

好了废话不多说

直接上处理脚本

import base64

import csv

import os

filename = "J:\dataset\ms_celeb_1m\MsCelebV1-Faces-Aligned.tsv"

outputDir = "I:\ms_celeb_1m"

with open(filename, 'r') as tsvF:

    reader = csv.reader(tsvF, delimiter='\t')

    i = 0

    for row in reader:

        MID, imgSearchRank, faceID, data = row[0], row[1], row[4], base64.b64decode(row[-1])

        saveDir = os.path.join(outputDir, MID)

        savePath = os.path.join(saveDir, "{}-{}.jpg".format(imgSearchRank, faceID))

        if not os.path.exists(saveDir):

            os.mkdir(saveDir)

        with open(savePath, 'wb') as f:

            f.write(data)

        i += 1

        if i % 1000 == 0:

            print("Extracted {} images.".format(i))

自己改下相应路径就可以用了

处理结果：

ms_celeb_1m数据提取（MsCelebV1-Faces-Aligned.tsv）python脚本

有什么疑问可以留言，不定期查看，慢回勿喷。。。

ms_celeb_1m数据提取（MsCelebV1-Faces-Aligned.tsv）python脚本的更多相关文章

使用Python脚本分析你的网站上的SEO元素
撰稿马尼克斯德芒克上2019年1月, Sooda internetbureau Python就是自动执行重复性任务,为您的其他搜索引擎优化(SEO)工作留出更多时间.没有多少SEO使用Python来 ...
记录特殊情况的Python脚本的内存异常与处理
问题 Python 脚本使用 requests 模块做 HTTP 请求,验证代理 IP 的可用性,速度等. 设定 HTTP 请求的 connect timeout 与 read response ti ...
Python爬虫10-页面解析数据提取思路方法与简单正则应用
GitHub代码练习地址:正则1:https://github.com/Neo-ML/PythonPractice/blob/master/SpiderPrac15_RE1.py 正则2:match. ...
python 爬虫与数据可视化--数据提取与存储
一.爬虫的定义.爬虫的分类(通用爬虫.聚焦爬虫).爬虫应用场景.爬虫工作原理(最后会发一个完整爬虫代码) 二.http.https的介绍.url的形式.请求方法.响应状态码 url的形式: 请求头: ...
【学习】Python进行数据提取的方法总结【转载】
链接:http://www.jb51.net/article/90946.htm 数据提取是分析师日常工作中经常遇到的需求.如某个用户的贷款金额,某个月或季度的利息总收入,某个特定时间段的贷款金额和笔 ...
Python爬虫教程-18-页面解析和数据提取
本篇针对的数据是已经存在在页面上的数据,不包括动态生成的数据,今天是对HTML中提取对我们有用的数据,去除无用的数据 Python爬虫教程-18-页面解析和数据提取结构化数据:先有的结构,再谈数据 ...
Python——爬虫——数据提取
一.XML数据提取 (1)定义:XML指可扩展标记语言.标记语言,标签需要我们自行定义 (2)设计宗旨:是传输数据,而非显示数据,具有自我描述性 (3)节点关系: 父:每个元素及属性都有一个父. ...
python爬虫数据提取之bs4的使用方法
Beautiful Soup的使用 1.下载 pip install bs4 pip install lxml # 解析器官方推荐 2.引用方法 from bs4 import BeautifulS ...
【转载】使用Pandas进行数据提取
使用Pandas进行数据提取本文转载自:蓝鲸的网站分析笔记原文链接:使用python进行数据提取目录 set_index() ix 按行提取信息按列提取信息按行与列提取信息提取特定日期的信 ...

随机推荐

poj1182(食物链）
食物链 Time Limit: 1000MS Memory Limit: 10000K Total Submissions: 49320 Accepted: 14385 Description ...
Android 改变标题栏的背景色
1:styles.xml  <style name="CustomTheme" parent="andro ...
MVC4&period;0系统开发新手历程（一）
接手了一个简单的销售奖金计算的项目,虽然不算大但是业务逻辑比较复杂,还夹杂了很多的特殊情况,毕竟是大公司什么样的人都有,好了不多说切入正题,项目是公司的一个前辈负责的,在他做系统架构的时候让我们了解下 ...
DELPHI 任务栏无EXE显示
需要用到的一个函数: LONG SetWindowLong( HWND hWnd, int nIndex, LONG dwNewLong ); program Project; usesForms, ...
BEGINNING SHAREPOINT&amp&semi;&num;174&semi; 2013 DEVELOPMENT 第3章节--SharePoint 2013 开发者工具站点设置
BEGINNING SHAREPOINT® 2013 DEVELOPMENT 第3章节--SharePoint 2013 开发者工具站点设置你应该熟悉(假设还咩有)的SharePo ...
有关css3的一些问题
CSS3新特性(阴影.动画.渐变.变形.伪元素等) CSS3与页面布局学习总结--CSS3新特性(阴影.动画.渐变.变形.伪元素等) 目录一.阴影 1.1.文字阴影 1.2.盒子阴影二.背 ...
【Owin 学习系列】1&period; 第一个 Owin 程序
IIS 中的 Owin 在 IIS 里面部署 Owin,既能得到 Owin 管道模型的灵活性和模块特性,也能很好地利用 IIS 成熟的配置,Owin 程序将会跑在 ASP.NET request 的管 ...
【找不到与请求 URI匹配的 HTTP 资源】（转）
在.net下,创建一个HTTP服务,有很多方案,比较老ashx,一般处理程序(HttpHandler), Web Service SOAP协议的,数据格式是XML,HTTP协议 WCF ...
【BZOJ】 2463 [中山市选2009]谁能赢呢？（博弈论）
Description 小明和小红经常玩一个博弈游戏.给定一个n×n的棋盘,一个石头被放在棋盘的左上角.他们轮流移动石头.每一回合,选手只能把石头向上,下,左,右四个方向移动一格,并且要求移动到的 ...
动态引入javascript
注意最后 "</scr"+"ipt>" 这是必要的,因为浏览器只要看到</script>它就会认为代码到此结束,从而引起错误