大数据在互联网用户系统中的应用
但是对于今日的互联网和移动互联网,大数据的规模和应用深度早已不次于传统的电信、民航等行业,甚至超过不少。因此笔者还是想写些东西浅谈一下互联网的大数据应用,权当抛砖引玉,也希望更多的朋友参与交流和讨论。
首先,第一篇想谈一下互联网的用户系统。无论互联网还是移动互联网,本身具有很大的特性就是互联,所以我们都可以称之为互联网,或者说移动互联网是互联网的一个子集和延伸。
在传统的电信、民航、能源等行业,企业的客户和主体用户构成都是有身份ID的。比如电信行业中身份证登记的手机卡号,比如民航用户乘坐航班登机的身份证或护照信息等,这些信息可以作为基本的用户身份ID,便于企业对其用户、客户进行身份辨别,并对后续的用户行为进行跟踪和分析。传统企业所存储的用户信息的很大优势在于完整性,很多先天的比如姓名、性别、年龄甚至籍贯等真实的基础身份信息都可以简单获得。而在互联网上,用户的访问都是匿名的,即使用户在接入互联网的时候使用的登记信息是实名的,但那主要是提供给电信服务商和公共安全机构备案而用。普通的互联网网站在用户面前是完全透明的被"围观"的,这个状况在web1.0 的主要产品--门户网站中最为典型。到了web2.0 时代,互联网开始变得互动起来,用户从简单的匿名浏览,变成了可以通过注册身份参与信息的制造和流通。这个时候,诞生了这个时代在谈的互联网大数据应用中非常重要的一个非决定性条件--用户身份系统。为什么说是"非决定性条件"呢?因为,在这之前,大量的数据分析也是可以做的,但是由于对用户缺乏身份缺乏甄别,因此数据分析能够应用的场景和得到的数据都相对很有限,但并不代表不能做大数据分析。而web2.0的用户身份系统诞生,则使互联网某种程度上具有了和传统行业同样的用户身份记录系统,数据统计和分析都可以更精准和深入。其中,以腾讯QQ、新浪UC等PC桌面产品为代表的互联网早期产品,应该是建立了互联网更早的用户身份系统,我们也可以看到这些系统在其后续的web产品铺开时同样被继承了过来。
那么,互联网的用户身份系统,一般都具有哪些信息呢?
打开任何一个网站,我们都可以看到注册页面需要填写用户名/email,性别,年龄 等基本信息。当然,不同的网站和互联网产品有不同的用户资料细化的程度。拿现在比较流行的几款产品做比较,其他互联网产品大多类似:1.新浪微博中用户可以填写自己的昵称、头像、真实姓名、所在地、性别、生日、博客地址、email、QQ/MSN、自我介绍、用户标签、教育信息、职业信息……;2.腾讯QQ客户端上可以填写头像、昵称、个性签名、姓名、性别、英文名、生日、血型、生肖、故乡、所在地、邮编、电话、学历、职业、语言、手机……
看起来还真不少,那么网站要用户的这些信息会被干嘛用呢?
这里笔者刘三德认为主要有以下几点:1. 展示自我;2.作为唯一的身份ID用作用户身份区别;3.搜索和推荐相关;4.网站自身可以做用户分析和用户行为跟踪。展现自我放到第一位是因为这是从产品满足用户需求的角度决定的,用户资料的首要任务就是为了作为用户唯一的可识别身份标识展示自我。其次,搜索和推荐相关这一点笔者刘三德计划在后续用专门的篇章来写,此处简单理解即可。最后一点,也就是本文所关注的一点,就是用用户身份来做数据分析。涉及到的用户分析主要维度为用户资料和用户行为。同样,用户行为也计划在后续篇章专门来写,本文着重讨论一下用户资料的分析。
可能行业内的一些文章和老前辈的观点,数据首先要量大、其次要有高的复杂度,才可以称为大数据。但笔者认为,大数据在一维的层次上不一定具有很强的复杂度,大部分是由最简单的数据形式构成。就譬如用户资料,一个网站如果有一千万的注册用户,如果每个用户的资料具有6个有效字段,就是6000万的有效数据。而将这6000万的有效数据通过一层或者几层简单的统计叠加分析、交叉分析等,在计算上本身就具有了不小的复杂度。何况现今的互联网产品,尤其社交类产品如FACEBOOK,腾讯QQ、新浪微博等动辄上亿的注册用户,本身用户系统就是一个非常具有价值的大数据。[page]
通过分析用户系统可以得到什么呢?
当然,用户填写的注册资料中包含的资料,都是最基础的分析数据。还是用数据说话,如下图:
以上图片来自互联网
以上数据是第三方机构公布的,而且都是最简单的一维数据,我们可以看到很多家网站的用户资料对比(上面引用的部分数据来源也可为线上调查问卷等形式)。对于独立的一个网站来说,用户资料的分析当然只是局限在自己的网站范围之内。进入互联网web2.0时代以后,大家都开始更加重视用户和用户体验,对于网站自身用户的特征进行分析,可以更好的网站的用户特性分布,方便针对网站的用户群特点更有针对性的进行对应的产品设计和研发。比如通过了解用户的消费层次等,也可以更好的提供用户消费相关展示和服务。
那么,无用户身份信息的互联网是否不再大数据?--不用注册的用户身份系统的。
可能有的朋友会对这个话题存疑问,也可能有的朋友会惊恐,认为隐私泄露了,其实这里的应用也非常简单。在类似传统的web1.0 门户类以展示为主的互联网产品中,也是可以做数据的分析和挖掘的,而且也有比较成熟的方案。是否有朋友曾经经历过以下场景:在网络上搜索汽车、查了半天汽车资料,一个小时以后再随手打开的一个图书阅读网站上居然出现了"汽车广告".其实,即使我们没有在这些网站上注册,网络等搜索引擎本身还是可以为用户标识一个唯一的身份信息,虽然这个身份信息只是临时的,可能有效期也只有几天左右。但是,这依然是一种唯一的用户身份,只不过是记录的信息有限而已,但是仍然为用户行为分析提供了很大的帮助。感兴趣的朋友可以搜索"google adsense隐私政策" 进行相关了解,此处不在赘述。
用户资料系统方便了一系列的大数据挖掘
除了传统的互联网桌面端和web端产品,最近几年突飞猛进的移动互联网以及终端应用,基本也都有完备的用户信息系统。apple苹果公司做了app store,迄今为止的应用下载次数突破250亿次,而每一次的下载都需要使用唯一的用户ID,通过分析,苹果可能比你父母更加了解你想要什么--这属于用户行为分析范畴,后续将专门讨论。
总之,用户身份和资料的分析是互联网大数据分析中最基础的分析,用户身份系统在互联网的大数据时代,为后续的用户行为分析和对应的企业产品、服务设计提供了基石,也为更加深入的数据挖掘奠定了基础。
2. 网络大数据来自于各地的终端对吗
大数据来源主要是来自互联网公司.物联网设备.部分企业以及政府部门的数据资源。
互联网及物联网是产生并承载大数据的基地,是大数据的主要来源。
3. 什么是网络大数据
所谓网络大数据,就是通过网络尽可能地搜集跟终端消费者相关的内隐私,然后进行营销。最容初的设计理念是通过大数据更好地了解消费者的需求,增强用户体验。但是在实践上,它会倾向于通过直接或者间接地暴露你的隐私来获得商业利益。大数据对于终端消费者更多的是“被实名”。
4. linux操作系统中的终端在哪里打开啊
Linux常用的有3中进入终端界面方法,分别如下:
1、按快捷键“Ctrl+Alt+T”即可打开终端窗口
注意事项:
如果采用方法2的F1-F6的方法,返回图形界面只要按“Ctrl+Alt+F7即可”。
5. linux如何查看自己在哪个终端
1.命令w的功能最全面,能显示用户登录名、终端标志、星期几登录和具体登录时间、闲置时间、用户正在执行的程序、占用CPU时间、系统的运行时间和平均负载,例如:
[francis@localhost ~]$ w
10:29:43 up 1:07, 4 users, load average: 1.35, 0.78, 0.42
USER TTY LOGIN@ IDLE JCPU PCPU WHAT
francis :0 09:22 ?xdm? 22:58 0.07s /bin/sh /usr/bin/startkde
francis pts/0 09:22 1:07m 0.03s 0.03s /bin/bash
francis pts/1 09:22 1:06m 0.00s 0.76s kdeinit4: kded4 [kdeinit]
francis pts/2 10:29 0.00s 0.03s 0.00s w
2.命令who的功能较简单,仅显示用户登录名、终端标志、和登录日期和时间,例如:
[francis@localhost ~]$ who
francis :0 2010-04-19 09:22
francis pts/0 2010-04-19 09:22
francis pts/1 2010-04-19 09:22
francis pts/2 2010-04-19 10:29
3.命名who am i 最简单,仅显示当前用户正使用的终端和登录时间,例如:
[francis@localhost ~]$ who am i
francis pts/2 2010-04-19 10:29