内容正文:
1
第一章 数据与大数据
2
一、数据、信息与知识
1数据是对事物描述的记录.数据的表现形式多种多样,可以有数字、文字、图形、图像、
声音等形式,同一事物的描述记录也可以有不同的数据表现形式,同一数据也可能描述不同的
事物.数据是可以加工、处理的,同时数据也是有价值的.
2.信息表示的是事物之间的相互关系,它可以通过数字、字符、图像、声音和视频等载体进
行传播.人们借助信息可以了解情况、形成判断、做出决策、指导行动.
3信息的特征:①信息可以传播和存储;②信息价值是相对的;③信息可以被共享;④信
息具有时效性.
4知识:分为一般知识和科学知识.在日常生活和工作中,人们所获得的认识和经验的
总和,通常称为一般知识.科学知识是人们对信息的科学组织,它是经过严谨的验证,获得学
界一致认可的内容.
5数据、信息、知识:人们对世界认识的三个不同阶段.
二、数字化
1计算机内部采用二进制,因为它简单便于实现.
2二进制简写为B;八进制简写为 O;十进制简写为D;十六进制简写为 H.
3数码:进位计数制的一组符号称为数码;二进制表示数码为0、1;八进制表示数码为
0~7;十进制表示数码为0~9;十六进制表示数码为0~9ABCDEF.
4基数:进位计数制所使用的数码个数称为基数;二进制基数为2;八进制基数为8;十进
制基数为10;十六进制基数为16.
5位权:数码在不同数位上的倍率值称为位权;2i、8i、10i、16i等这些表示相应的位权.
6十进制转换成二进制数:①整数除2取余;小数乘2取整法.
②位权拆分法.
20=1,21=2,22=4,23=8,24=16,25=32,26=64,27=128,28=256,29=512,210=
1024,211=2048,212=4096,213=8192,214=16384,215=32768,216=65536.
991=512+256+128+64+16+8+4+2+1
=29+28+27+26+24+23+22+21+20
=(1111011111)2 即为二进制表示方式
7二进制整数转换成十进制数:一般可以将每位二进制数和该位的位权相乘再求和,这
种方法称为按权展开.例如:
(101011)2=1×25+0×24+1×23+0×22+1×21+1×20=32+8+2+1=43
8十进制转换成十六进制数:位权拆分法.
160=1,161=16,162=256,163=4096
3
991=512+256+128+64+16+8+4+2+1
=3×256+13×16+15×1
=3×162+13×161+15×160
=(3DF)16即为十六进制表示方式
9十六进制整数转换成十进制数:将每位十六进制数和该位的位权相乘再求和.例如:
(2AE)16=2×162+10×161+14×160=512+160+14=686.
10二进制转换成十六进制数.
把二进制数从低位到高位4位一组进行划分,不足4位,高位用“0”补齐4位;然后每组
4位二进制展开计算得到对应的十六进制数字.例如:
(11111001110)2=(7CE)16从低位到高位4位二进制一组进行划分如下:
(1110)2=E
(1100)2=C
(0111)2=7
11十六进制转换成二进制数.
将每一位十六进制数转换为4位二进制数,不足4位二进制数,高位用“0”补齐4位.
例如:
(2AB)16=(001010101011)2
(B)16=(1011)2
(A)16=(1010)2
(2)16=(0010)2
12二进制加减:借一当二,逢二进一;八进制加减:借一当八,逢八进一;十六进制加减:
借一当十六,逢十六进一.
13数据的存储单位:比特位(bit)是计算机中最小的数据存储单位,即一个二进制位,一
个位的取值只能是0或1.字节(Byte)是计算机中信息组织和存储的基本数据存储单位,1Byte
=8bit.通常大B表示Byte,小b表示bit位.
1024B=1KB 1024KB=1MB 1024MB=1GB 1024GB=1TB
14数字化是计算机处理信息的基础,将现实世界中各种各样的信息用二进制数来表示
的过程,就是信息的数字化.
三、数据编码
1信息编码:为了方便信息的存储、检索和使用而规定的符号系统,编码的过程是将信息
按照一定的规则进行变换.要使用计算机处理各种各样的信息,需要通过编码的方式将信息
转换成用“0”和“1”表示的二进制代码.
4
2ASCII码:即美国信息交换标准码,也是国际标准交换码.在该码中,用7位二进制数
编码来表示字符或控制符,共可以表示128个(27=128),其存储时占用一个字节8个位,最高
位补零.
ASCII包括10个数字、26个英文大写字母、26个英文小写字母、32个标点运算符号,34
个控制符(空格、回车、换行等),其大小关系:(空格)<数字符号(0~9)<大写字母(A~Z)<
小写字母(a~z).一个英文字母,数字都是1个字节;英文字母最高位二进制总是为0.
数字最高位二进制位补0表示为正数,最高位二进制位补1表示为负数.
例如:字母 m 在 ASCII表中对应的高三位是110,低四位是1101,这样二进制表示为
1101101,最高位再补上一个0,就形成了 m 在计算机中的存储形式01101101.
3汉字编码:计算机处理汉字时同样要采用二进制表示的编码.GB2312G80标准为
6763个常用汉字规定了进制代码;目前 GB18030标准,收录了27484个汉字.第二版 GB
18030G2005增加了42711个汉字和少数民族文字的编码,大部分采用双字节编码.一个汉字
最少2个字节,最多4个字节;最高位二进制总是为1.
4输入码:为方便汉字输入而形成的汉字编码,解决了如何使用英文标准键盘把汉字输
入到计算机内.常见的输入码有区位码、音码、形码、音形码.输入码不唯一.
5内码:汉字输入计算机后,在计算机内必须转换成统一的汉字内码,才能进行存储和处
理.在计算机内部用来进行汉字存储处理的编码叫机内码或内码.内码唯一.
6字形码:为显示和打印输出汉字而形成的汉字编码称为字形码.既可以用点阵也可以
用矢量形式表示,最常见的是使用点阵方式表示汉字字形.例如:16×16,24×24和32×32
点阵,其中一个16×16点阵的汉字占用16×16/8=32字节,依次类推24×24点阵汉字占用
72字节,32×32点阵占用128字节.
汉字的输出则要依赖于字形码,每一个汉字的字形都必须预先存放在计算机内,称为字形
信息库,简称字库.在输出汉字时,计算机要根据机内码找到对应的字形码,然后根据字形码
到字库中去找到它的字形描述信息,最后再把字形输出.机内码→字形码→字库→输出.
7Unicode字符集和编码:为了统一所有文字的编码,采用 Unicode解决不同语言的编码
不相同的问题.它对世界上大部分的文字系统进行了整理、编码,避免由于编码冲突而产生的
乱码问题,使得计算机可以用更为简单的方式来处理和呈现文字.目前主要是 UTF-8、UTF
-16、UTF-32三种编码方案.
8模拟信号:用连续变化的物理量表示的信息.最常见的模拟信号人声带振动产生的声音.
9数字信号:幅度和时间都离散的信号.最常见数字信号是千家万户播放的数字电视
节目.
10模拟信号与数字信号主要区别:模拟量和数字量都是对某一事物的反映和表达;模拟
量是连续的,数字量是离散的.
5
11模拟信号数字转化过程:采样、量化、编码.声音即通过这三个过程实现将声波这种
连续不断的模拟量数字化.
12采样:采集模拟信号的样本,每秒钟的采样样本数为采样频率.采样是在连续的模拟
信号中,每隔一定时间取一个值的过程.采样时间间隔越短,采样频率越高,单位时间内得到
的样本数据就越多,对声音的模拟信号表示就越精确,声音的保真度就越高.
13量化:把采集到的模拟量的数值用二进制序列表示出来.声音的量化是用二进制数
值表示采样所得到的幅度值的过程.首先将声音的幅度值划分为2n个等级,每个等级对应一
个幅度值,这里的n① 就是量化位数.划分等级越多,量化的位数就越高,量化精度就越高,所
得数字化声音的保真程度越好,但是它的数据量也越大.例如:采用16位二进制数进行量化,
即把整个振幅划分为65536(216)个二进制序列,256个二进制等级序列为8位.
14编码:对这些二进制数值序列进行编码,就可以形成一系列二进制代码.通过采样和量化,
对获得的二进制数进行编码后,就可以将声音的模拟信号转换成二进制数值表示的数字信号.
15声音存储容量=采样频率×量化位数×声道数×时间/8(单位:字节).
例如:CD音频格式采用的采样频率为44.1kHz,量化的值用2位表示,立体声双声道,20
分钟的数据量为多少 MB?
44.1×1000×2×2×20×60
1024×1024×8
16图像的编码:图像一般分为矢量图和位图.矢量图是数字化的图像,无论放大、缩小、
旋转,都不会失真.位图是由纵横排列的像素点组成的图像,图像数字化是针对位图而言的.
17图像的采样是按一定的空间间隔从左到右、自上而下提取画面信息,将图像在空间上
转换成若干个像素点,每个像素点呈现不同的颜色,任何一种颜色均可用红、绿、蓝三种原色调
配出来.
18位图的质量主要由图像的分辨率和颜色深度决定.水平方向上的像素点乘以垂直方
向上的像素点称为图像的分辨率.图像的分辨率越高,采样的精度就越高,数字化的图像越清
晰,同时图像所占的存储空间也越大.
19图像的量化是用若干位二进制数表示采样得到的每个像素点的颜色.记录每个像素
点的颜色所需的二进制数的位数,称为颜色深度.颜色深度决定了图像中的像素可以使用的
最多颜色数量.颜色深度越大,显示的图像色彩越丰富,画面越自然、逼真.图像在分辨率相
同的情况下,颜色深度越大,图像所占的存储空间越大(见表1G1).
20图像存储容量=图像分辨率(水平像素×垂直像素)×颜色深度(像素色彩所需位数)/8
(单位:字节).
① 为了与程序指令的表达一致,文中的变量仍用正体表示.
6
表1G1
位图图像 解析 计算方法(以1366×768像素为例)
黑白位图
每个像素只需要一个位就可以表示黑
白两色
结果=1366×768×1/8
256色
色要转化成相应位
即256种组合,用28即可以表示,所以
256色即8位色,同理16色即4位色
结果=1366×768×8/8
24位真彩色
表示每个像素占用24个二进制位,每
个像素有224种颜色组合
结果=1366×768×24/8
32位真彩色
表示每个像素占用32个二进制位,每
个像素有232种颜色组合
结果=1366×768×32/8
每个像素占2个字节
每个像素占2字节,占用16个二进制
位,每个像素有216种颜色组合
结果=1366×768×16/8
例如:我国的电影每秒钟播放24帧,电视每秒钟播放25帧,每帧画面的分辨率为1366×
768,每个像素用3个字节来表示颜色信息,那么录制30分钟这样的电影节目,其数据量为多
少 GB?
计算式如下:
1366×768×3×8×24×30×60
1024×1024×1024×8
四、数据压缩
为什么要对视频、声音等进行压缩? 视频、音频等多媒体信息,经数字化转换后生成的二
进制数据是以文件形式保存的,它们占用的存储空间相对较大.为了减少存储空间的占用,就
需要采用合适的方式对视频、音频进行压缩.所以数据压缩就是采用特殊的编码方式处理数
据,使数据占用的存储空间相对减少,以便存储和传输(见表1G2).
表1G2
数
据
的
压
缩
有损压缩 无损压缩
概念
将冗余的信息去除,有数据的丢失,一定程度上损
害了原始质量,但不会导致人们对数据表达的信
息产生误解
压缩和解压缩可以完整准确的
还原,没有数据的丢失
应用范围 常用于声音、图像、视频等文件 一般用于数据文件、程序文件
例如
声音:wav格式文件转成 mp3格式文件
图像:bmp图片转成jpeg图片
视频:8k超高清压缩到4K 超高清,4K 超高清压
缩到1080p,1080p高清压缩到720p,720p高清压
缩到标清
常用的无损压缩软件 WinRAR,
WinZip,7Gzip
7
1MP3是音乐信息压缩标准;WAV(未压缩)、WMA(有损压缩)、RA(有损压缩).
2MPEG和RM 是视频信息的压缩标准;WMV(有损压缩)、ASF(有损压缩).
3位图格式有BMP、GIF、TIF、JPG等.BMP是微软推出的位图格式;GIF压缩比较高,
文件较小,普遍用于网页制作;TIF是一种非失真的压缩格式,通常用于较专业的领域;JPG是
一种成熟的彩色静止图像的编码技术,其成为静态图像信息的压缩标准;常见图片格式:BMP
(未压缩)、GIF(有损压缩)、JPG/JPEG(有损压缩).
五、大数据及其作用与价值
1理解大数据:①数据规模大;②数据类型多;③处理速度快;④价值密度低.
2大数据的处理过程:①数据采集;②数据预处理;③数据分析;④数据挖掘应用.
3大数据的作用:①可以反映社会现象;②可以预测发展趋势;③可以指导决策制订.
4大数据技术对社会发展的影响:①优化社会管理模式;②创新提升服务质量;③成为科
学研究的新途径.
例1G1 某学校有高中三个年级,高一共250人,分为9个班级,每班不超过30人.现在
用二进制给每个年级和班级的学生进行编码,编码由年级号、班级号和学号组成,尽可能减少
编码长度.以下二进制的方案中正确的是( ).
A.用1位二进制数表示年级,9位二进制数表示班级,30位二进制数记录学生的学号
B.用3位二进制数表示年级,7位二进制数表示班级,15位二进制数记录学生的学号
C.用2位二进制数表示年级,4位二进制数表示班级,5位二进制数记录学生的学号
D.用4位二进制数表示年级,3位二进制数表示班级,6位二进制数记录学生的学号
分析与解答:3个年级,必须要用2位二进制,即22,一共有4种不同的信息表示方式;9个
班级,用3位二进制,即23,一共有8种不同的信息表示方式不够,所以必须要4位二进制,即
24种不同的信息表示方式;同理,每班不超过30人,必须要5位二进制,即25才能够表示30种
不同的信息.即答案是C.
例1G2 下列转换关系式中,正确的是( ).
A.(11)H=(10001)B B.(9)10=(1110)2
C.(A)H=(12)D D.(11010)2=(13)10
分析与解答:A选项(11)H=1×161+1×160=17转为十进制的17,(10001)B=1×24+
1×20=17转为十进制的17;B选项(1110)2=1×23+1×22+1×21+0×20=14转为十进制
的14,与十进制的9不相等.C选项(A)H中十六进制 A 转换为十进制结果是10,(12)D中的
D代表十进制,(A)H与(12)D二者不相等;D选项(11010)2=1×24+1×23+1×21=26转为
十进制的26.同理,二者不相等,即答案是 A.
8
例1G3 二进制数加减法运算,即0+0=0,0+1=1,1+0=1,1+1=0并进位.运用这一
基本法则,得出二进制数加法运算1011+101的结果为 ,减法运算1001-111的结果
为 .
分析与解答:二进制加减规则:借一当二,逢二进一.
例1G4 关于信息的编码,下列说法中正确的是( ).
A.所有的信息只能用二进制编码方式来表示,因为二进制比较常见
B.计算机使用二进制编码,它是信息编码的一种方式
C.ASCII是计算机用来表示文字符号的唯一一种二进制代码
D.汉字在计算机内使用汉字国标码来表示,不使用二进制编码
分析与解答:A选项信息有多种表现形式,计算机采用二进制编码并不是因为二进制比较
常见,而是因为简单容易实现,故说法不正确.B选项二进制只是信息编码的一种方式,说法
正确.C选项 ASCII不是计算机用来表示转换文字符号的唯一方式,中文符号用的就是国标
码.D选项后半句显然是错误的,我们知道所有的信息在计算机内都必须要转换成二进制,汉
字也不例外,汉字采用国标码的方式转换成二进制形成统一的机内码.即答案是B.
例1G5 下列表述错误的是( ).
A.数字在计算机内部采用二进制编码表示
B.按 ASCII顺序,英文字符“C”与“D”ASCII的大小关系“C”<“D”
C.英文字符在计算机内部采用二进制编码表示
D.汉字在计算机内部采用 ASCII表示
分析与解答:信息在计算机内部都采用二进制编码表示,数字、英文字母采用 ASCII码转
换成二进制,汉字采用国标码转换成二进制.ASCII码采用7位二进制数编码来表示字符或
控制符,按照 ASCII码规律高三位从左到右依次递增,低四位从上到下也是依次递增;“C”的
ASCII码为1000011,转换成十进制是67,“D”的 ASCII码为1000100,转换成十进制是68,所
以“C”<“D”.即答案是D.
例1G6 (上海市信息科技学业水平考试题)为了输入、存储和显示汉字,形成了不同的汉
字编码,它们是( ).
A.拼音码、国标码和字形码 B.输入码、机内码和字形码
C.区位码、机内码和字形码 D.输入码、国标码和音形码
9
分析与解答:为了方便汉字输入而形成的汉字编码称为输入码;汉字输入计算机后,形成
统一的二进制编码,即机内码.字形码输出汉字的过程:机内码→字形码→字库→输出.即答
案是B.
例1G7 (上海市信息科技学业水平考试题)以下关于信息编码的表述中,错误的是( ).
A.汉字在输入计算机后,必须使用统一的汉字内码,并以二进制形式存储和处理
B.在计算机内部,采用二进制编码存储字符和汉字,每个汉字的内码至少占用2个字节
C.汉字字形码占用空间少,机内码占用空间多
D.将字符的 ASCII编码从大到小排列,依次为小写英文字母、大写英文字母、阿拉伯数字
分析与解答:在输出汉字时,计算机要根据机内码找到对应的字形码,然后根据字形码到
字库中去找到它的字形描述信息,最后再把字形输出.汉字字形码一般以点阵形式表示,字形
码存储空间大于机内码存储空间.即答案是C.
例1G8 (上海市信息科技学业水平考试题)表1G3是用某软件观察字符串“xxkj学业考
试”机内码(十六进制表示形式)的截屏内容.
表1G3
内存地址 内存内容(十六进制)
137C:0100 78786B6AD1A7D2B5BFBCCAD4
由此可知,汉字“考”的机内码为 .
分析与解答:字符在计算机内的编码原理.计算机中一个英文字母占一个字节,而一个汉
字一般情况下占两个字节.78786B6A采用8位二进制表示占一个字节,推定可知78是字
符“x”的内码,6B是字符“k”的内码,6A是字符“j”的内码;剩下的8组编码两个一组对应一个
汉字,依次类推“学业考试”四个汉字的机内码,“考”字的机内码即为BFBC.即答案是BFBC.
例1G9 表1G4是某软件观察字符串的机内码截屏内容,在该字符串中,英文字符和汉字
字符在内存中个数分别为( ).
表1G4 流程图中常用的符号
offset 0 1 2 3 4 5 6 7 8 9 A B C D E F
000000000 3230 31 37 C9CFBAA3D1A7BFBC36 D1A133
A.10 B.6 C.12 D.5
分析与解答:一个汉字最少2个字节,最多4个字节;最高位二进制总是为1.4号5号字
符C9CF的首字符都是大于等于 A,能确定4号5号对应的字符为一个汉字,同理6号7号对
应的字符也为一个汉字,依次推得8号9号,A号B号,D号E号也为汉字,其他为英文字母或
者数字.即答案是B、D.
例1G10 汉字“数”的16×16点阵字形码与32×32点阵字形码相比较,以下说法正确的
10
是( ).
A.因为两个字形码的点阵不同,所以存储时前者占256Byte,后者占128bit
B.因为两个字形码的点阵不同,所以存储时前者占32Byte,后者占128Byte
C.因为两个字形码的笔画相同,所以存储时都占32Byte
D.因为内码存储时至少占2Byte,所以这两个字形码也至少占2Byte
分析与解答:汉字编码包括机内码与字形码.汉字的机内码根据汉字繁简情况不同,一个
汉字最少2个字节,最多4个字节.字形码有16×16,24×24或者32×32不同的点阵表示方
式,点阵不同存储容量大小也不同,存储时16×16/8=32Byte,32×32/8=128Byte.机内码
的存储容量与字形码的存储容量不相关.即答案是B.
例1G11 (上海市信息科技学业水平考试题)对某段音乐分别采用下列不同的采样频率和
量化级数进行数字化,采样时间都相同,完成后的音频文件容量最小的是( ).
A.单声道采集,采样频率11025Hz,量化的值用16位二进制数表示
B.单声道采集,采样频率16000Hz,量化的值用8位二进制数表示
C.双声道采集,采样频率12000Hz,量化的值用8位二进制数表示
D.双声道采集,采样频率8000Hz,量化的值用16位二进制数表示
分析与解答:声音编码的存储容量计算=采样频率×量化位数×声道数×时间/8,计量单
位是字节Byte.采样时间都相同,A选项=1×11025×16/8=22050B;B选项=1×16000×8/8=
16000B;C选项=2×12000×8/8=24000B;D选项=2×8000×16/8=32000B.即答案是B.
例1G12 对声音的数字化通过采样量化和编码来实现,若量化划分的等级用十进制表示
为0~65535,采集的样本中的一部分模拟量值序列为“6、5、11”,则这个序列量化值为(
).
A.0110、0101、1011
B.0000110、00000101、00001011
C.110、101、1011
D.0000000000000110、0000000000000101、0000000000001011
分析与解答:0~65535共65536个等级,即216,可知量化位数为16位,6对应的二进制表
示0110,5对应的二进制表示0101,11对应的二进制表示1011,全部用16位表示,不够补0即
可.即答案是D.
例1G13 (上海市信息科技学业水平考试题)一张256色、1024×512像素的位图,这幅图
片的数据量至少为( ).
A.0.5MB B.16MB C.2MB D.1MB
分析与解答:图像编码的存储容量计算=水平像素×垂直像素×像素色彩所需位数/8;由
题意可知256色,即256种颜色组合为28,颜色深度为8位,四个答案选项计量单位都是 MB,
此图片存储容量计算方式为1024×512×8/8/1024/1024MB.即答案是 A.
11
例1G14 以下属于信息压缩技术在生活中的应用实例的是( ).
A.将若干文本文件进行压缩
B.将 WAV格式音乐文件转换成 MP3格式
C.将摄像机拍摄的视频转换成RMVB格式
D.将位图图像文件名后面BMP直接改为JPG
分析与解答:压缩主要包括有损压缩与无损压缩,A、B、C三个选项都存在压缩,D选项直
接修改后缀名根本没有压缩.即答案是D.
1计算机内部采用二进制原因是( ).
A.二进制表示位数少 B.表示形式单一
C.二进制简单容易实现 D.与逻辑门电路相匹配
2下列数字最大的是( ).
A.(10)10 B.(110)2 C.(1100)2 D.(11)10
3二进制数11101011中右起第6位上的1相当于( ).
A.2的6次方 B.2的3次方
C.2的5次方 D.2的4次方
4算式(1110)2-(4)10的运算结果是( ).
A.(1010)2 B.(1011)2 C.(9)10 D.(11)10
5以下说法中,错误的是( ).
A.把一个十进制整数转化为二进制数,可以采用“除二取余”法
B.二进制数10000000000的数值相当于2的10次方
C.二进制数100100左起第四位数1相当于十进制的4
D.十进制数255相当于二进制数111111111
6若在二进制整数 111000 的右边去掉三个 0 形成一个新的数,则新数的值是原数值
的( ).
A.1/100 B.1/2 C.1/4 D.1/8
7已知(93E)16中的数码9对应的位权是( ).
A.9 B.1 C.16 D.256
8二进制数减法运算的基本特点如下:借一当二,逢二进一,运算101101-10011的结果
为( ).
A.01010 B.10001 C.10100 D.11010
9二进制数1001110转换成十进制数是( ).
A.68 B.84 C.78 D.72
12
10已知(312)x中的数码3所表示的数值大小为十进制的48,则x是( ).
A.2 B.3 C.4 D.5
11以下关于十六进制数的描述,正确的是( ).
A.十六进制共有15个符号
B.每一位十六进制数对应4位二进制
C.十六进制可表示的数值的范围比二进制大
D.十六进制数更适合计算机内部存储和传输
12自古以来都有用灯光、火光等方式传递信号.现假定用6盏白炽灯传递信号,每盏灯的状
态只有亮与不亮两种状态.那么这6盏灯能传递出的信息有( ).
A.64种 B.6种 C.32种 D.24种
13一个七位二进制数10■■■01,其中间三位数字模糊不清.在下列十六进制数中,可能与
此二进制数等值的是( ).
A.(45)H B.(5E)H C.(61)H D.(5C)H
14一个七位二进制数1■10■01,其中有两位模糊不清.在下列十进制数中,可能与此二进
制数等值的是( ).
①79;②81;③111;④113.
A.②③ B.②④ C.①④ D.①③
15现有等式:(41)m-(41)n=(30)t,式中41、41、30是三个不同进制的数,则 m、n和t分别
为( ).
A.10、8、16 B.16、10、8 C.10、16、8 D.8、16、10
16关于信息数字化,以下表述错误的是( ).
A.信息数字化是计算机处理信息的基础
B.信息数字化过程通常通过计算机的输入设备来完成
C.目前计算机内部都是采用二进制数形式进行数据的存储和运算
D.将光盘中的影视信息在计算机上播放的过程是信息数字化过程
17以下不属于信息数字化过程的是( ).
A.用数码录音笔录音 B.用扫描仪扫描文稿
C.用 ACDSee编辑图片 D.用数码相机拍摄图片
18以下能实现信息数字化的操作是( ).
A.用计算机看影碟 B.删除“回收站”里的垃圾文件
C.在 Word中输入一段文字 D.用打印机打印文件
19下列有关信息编码的说法中,正确的是( ).
A.信息的编码只能使用十进制数字
13
B.信息的编码方案只有一种,是由信息编码的唯一性决定的
C.只有数值和字符能被数字化后由电脑处理
D.信息编码在一定条件下具有唯一性和实用性的特点
20计算机中信息的编码是指( ).
A.用7位二进制数表示一个字符,即 ASCII码
B.计算机中的二进制码按一定法则逆转换成各种形式的数据
C.各种形式的数据按一定法则转换成二进制码
D.用两个字节表示一个汉字
21ASCII码的作用是( ).
A.使英文字母,数字等符号可以被转换成计算机能识别的二进制数
B.用7位二进制数表示一个字符
C.可以表示94个字符
D.可以表示34个字符
22信息或数据必须经过数字化的过程才能保存到计算机中,以下说法中正确的是( ).
A.在计算机中,字符是以二进制形式存储的,数值是以 ASCII码形式存储的
B.在计算机中,声音是以二进制形式存储的,图像是以 ASCII码形式存储的
C.在计算机中,数值是以二进制形式存储的,字符也是以二进制形式存储的
D.在计算机中,数值和字符都是以 ASCII码形式存储的
23在计算机存储器中,一个字节可以存放( ).
A.一个汉字 B.一个英文字母
C.一个大于255的整数 D.一个256~512之间的任意整数
24ASCII码表共有128个字符,每个字符都有对应的十进制,下列选项中大小关系正确的是
( ).
A.“H”>“h”>“2” B.“2”>“H”>“h”
C.“e”>“H”>“2” D.“2”>“h”>“H”
25字母“H”的 ASCII码是二进制1001000,则可以知道字母“K”的 ASCII码是( ).
A.1001001 B.1001010
C.1001011 D.1001100
26已知英文大写字母“A”的 ASCII码十进制是65,英文大写字母“C”的 ASCII码十进制是
67以此类推.英文小写字母“a”的 ASCII码十进制是97,则英文小写字母“e”的
ASCII码十进制是( ).
A.69 B.99 C.100 D.101
14
27在某文件中有一段文字“1999-2019年中”,其中字符“2”在计算机中存储的形式为( ).
A.0010 B.00000010 C.00110010 D.0110010
28用全拼输入法输入的汉字在计算机内部的表示形式是( ).
A.全拼输入码 B.二进制代码
C.ASCII码 D.音码
29在计算机内部,采用二进制编码存储字符和汉字.关于信息的编码,以下表述中错误的是
( ).
A.若用8位二进制代码表示一个字符,则可表示256个不同字符
B.汉字在输入计算机后,必须使用统一的汉字内码,并以二进制形式存储和处理
C.一个字节由8位二进制数组成,每个汉字的内码只能占用2个字节
D将字符的 ASCII编码从大到小排列,依次为小写英文字母>大写英文字母>阿拉伯数字
30关于汉字编码,以下说法中错误的是( ).
A.汉字的编码有输入码、内码、ASCII码
B.无论使用哪种输入码,汉字在计算机内部都是以二进制形式存放
C.计算机显示或打印汉字时,使用的是汉字的字形码
D.汉字的音码是以汉字读音为基础的输入码
31关于汉字编码,以下表述中正确的是( ).
①汉字有唯一的字形码;②汉字有唯一的内码;③汉字有唯一的输入码;④存储汉字至少
需要2个字节,是因为汉字个数多;⑤“繁”的字形码比“简”的字形码占用存储空间大,因
为前者笔画多;⑥部分汉字和英文字符一样,也可以用 ASCII码来表示.
A.②⑤ B.②⑤⑥
C.①②③ D.①②③⑤
32计算机中对汉字进行统一编码,采用的编码方式是( ),其作用是( ).
①汉字国标码;②汉字字形码;③表示一个汉字;④可以有各种汉字输入法;⑤可以产生汉
字字库;⑥汉字可以被计算机存储,处理,传输和交换.
A.②④ B.②⑥ C.①③ D.①⑥
33计算机能够显示丰富多彩的艺术汉字,在PPT文档中对于同一个汉字用不同的字体表示
是指( ).
A.不同字体的同一个汉字机内码不同,输入码不同
B.不同字体的同一个汉字机内码相同,国标码不同
C.不同字体的同一个汉字交换码相同,机内码不同
D.不同字体的同一个汉字机内码相同,字形码不同
15
34关于汉字机内码和字形码,以下表述中正确的是( ).
A.汉字字形码使用两个字节表示
B.汉字机内码使用一个字节表示
C.汉字的字形码存储空间比机内码存储空间小
D.汉字字形点阵越精细,其字形码需要的存储空间就越大
35小李用 UltraEdit软件观察“word文档”这几个字,显示的十六进制内码如表1G5所示,从
中可以看出(6F64)16是( )的内码.
表1G5
内存地址 内存内容(十六进制)
00000000: 776F7264CEC4B5B5
由此可知,word文档
A.wo B.or C.d文档 D.od
36计算机存储器的每个字节为8个二进制位,因此16×16点阵的一个汉字需要用( )个
字节来存放.
A.8 B.16 C.32 D.256
37若一篇文章有256个汉字,采用16×16点阵显示,所需的存储空间是( ).
A.1KB B.5KB C.10KB D.8KB
38关于声音信息数字化,以下表述中正确的是( ).
A.采样频率越高,量化级数越高,声音的失真度越大
B.量化级数的高低是决定声音数据量大小的唯一因素
C.声波可以通过采样、量化、编码三个步骤转换为数字信息
D.采样频率是每秒在声波信号上采集的样本数量,采样频率越低,声音失真度越小
39声音在数字化的过程中,若量化划分的等级范围用十进制表示为0~15,采集的样本中部
分数字序列为“6、5、7、8、11、13”,则这个序列的量化值为( ).
A.0110、0101、0111、1000、1011、1101
B.6、5、7、8、11、13
C.06、05、07、08、11、13
D.110、101、111、1000、1011、1101
40计算机通常使用16位声卡,即将可能得到的每个采样量化值划分成( )个等级,若使
用32位声卡,则可以将每个采样量化值划分成( )个等级.
A.65536×2 65536×65536 B.65536 65536×65536
C.65536×16 65536×32 D.65536×2 65536×4
16
41在录制声音的过程中,以下措施中对于提高录音质量有效的是( ).
A.减少录音时间 B.增加录音时间
C.采用更多位的二进制来表示量化的值 D.减少声道数量
42计算机中,将模拟声音信号转换成二进制编码的部件是( ).
A.扬声器 B.显卡 C.声卡 D.网卡
43CD格式音乐转换成 MP3,转换过程包含了( );用 MP3听歌,播放过程包含了( ).
①压缩和烧录;②制作与合成;③下载和存储;④对声音编码;⑤对声音文件的解码.
A.①② B.③④ C.④⑤ D.②③
44图像在计算机内部的表示形式是( ).
A.ASCII码 B.十进制代码 C.二进制代码 D.模拟数据
45如果想表示14种不同的颜色,至少需要的二进制位数字( ).
A.15 B.4 C.14 D.5
46关于图像信息数字化,以下表述中正确的是( ).
A将一幅图像纵横分割成许多像素点进行采样、量化、编码,就完成了该图像的数字化
B.图像分割的像素越精细,需要的存储空间也越大,但图像还原会越清晰
C.对一幅图像进行采样,用400×300像素比用800×600像素清晰度高
D.一个彩色像素点的信息可以用一个二进制位存
47某同学将绘制的一幅彩色图片用24位位图格式保存,其数据量达到9MB.如果将该图
片另存为256色位图格式,对于这幅另存后的新图片,以下说法中正确的是( ).
A.图片可能会丢失部分颜色,数据量将减少到3MB
B.图片中的颜色数将增加,但数据量将减少到3MB
C.图片可能会丢失部分颜色,但数据量将超过9MB
D.图片中的颜色数将增加,数据量将超过9MB
48 若用某一数码相机的1024×768模式可拍50张相片,为了拍摄多于50张相片,可把相机分辨率
调为( ).
A.800×600 B.1048×800 C.1280×960 D.1600×1200
49以下截取的4幅JPG图像信息中,图像色彩保存最丰富的是( ).
A.1024×76824bit B.2048×1536黑白
C.5184×534665536色 D.800×60016bit
50在Photoshop中保存一幅编辑完成的图片,分别按以下图片格式保存,保存后图片质量最高
的格式是( ).
A.BMP B.JPEG C.GIF D.JPG
51对于数据压缩,以下说法中正确的是( ).
A.数据压缩也是一种编码方式 B.无损压缩
C.有损压缩 D.是一种存储数据格式
17
52对于信息压缩,以下说法中错误的是( ).
A.信息是能够进行压缩的
B.用 WinZip软件压缩文件属于无损压缩
C.无损压缩后的数据能够完全还原,有损压缩后的数据不能够完全还原
D.有损压缩可用于程序文件的压缩
53用 WinRAR对a.wav和a.mp3两个文件进行压缩,生成b.rar.关于此次压缩操作正确的
说法是( ).
A.a.wav和a.mp3两个文件都进行了无损压缩
B.a.wav和a.mp3两个文件都进行了有损压缩
C.a.wav进行了无损压缩,a.mp3进行了有损压缩
D.a.wav进行了有损压缩,a.mp3进行了无损压缩
54为了减少文件占用的存储空间,提高传输效率,一般对数据量较大的文件采用压缩技术.
关于文件的压缩和解压缩,以下表述中错误的是( ).
A.无损压缩后的文件不能恢复成原始状态
B.压缩软件可将多个文件压缩成一个文件,还可解压恢复成原来的多个文件
C.有损压缩会在压缩过程中丢弃一部分原始数据,JPEG文件就是经过有损压缩的
D.有损压缩后的常见的文件格式有:JPG、MP3、MPEG等
55汉字内码存储时规定每个字节的最高位为 ,英文字母存储时规定每个字节的最高位为
.
56小明用某音频软件录制一段时长为512秒的 WAV 格式的音频,设置如下:采样频率为
8kHZ,若量化划分等级范围为0~255,且为双声道录制,则该音频的数据量至少为多少
KB.
57如下图所示是一个汉字的16×16的点阵,若白色记作“1”,黑色记作“0”,则可得到第五行
的二进制编码为1111111011101111(注意:白是1,黑是0),其十六进制编码为FEEF.
请写出第六行的十六进制编码 .
18
58某系统截获21位二进制代码为100100111010101110101.已知该代码由3个加密的英文
字母组成,加密方法为将原来的每个字符的 ASCII码数值加1,原字符是 .
部分字符ASCII码对照表
低位
高位
011 100 101 110 111
0000 0 @ P 、 p
0001 1 A Q a q
0010 2 B R b r
0011 3 C S c s
0100 4 D T d t
0101 5 E U e u
0110 6 F V f v
0111 7 G W g w
1000 8 H X h x
1001 9 I Y i y
1010 : J Z j z
1011 ; K [ k {
1100 < L \ l |
1101 = M ] m }
1110 > N ^ n ~
1111 ? 0 - o DEL
参考答案
第一章 数据与大数据
巩固练习
1.C 2.C 3.C 4.A 5.D 6.D 7.D 8.D 9.C 10.C
11.B 12.A 13.A 14.B 15.B 16.D 17.C 18.C 19.D 20.C
21. A 22.C 23.B 24.C 25.C 26.D 27.C 28.B 29.C 30.A
31.A 32.D 33.D 34.D 35.D 36.C 37.D 38.C 39.A 40.B
41.C 42.C 43.C 44.C 45.B 46.A 47.A 48.A 49.A 50.A
51. A 52.D 53.A 54.A 55.1/0 56.8000 57.FE07 58.Hit
第二章 算法与程序设计
巩固练习
1.C 2.A 3.B 4.B 5.C 6.24 7.21 8.4 9.A 10.C
11.A 12.B 13.A 14.B 15.A 16.B 17.A 18.C 19.B 20.C
拓展提高
1.55 2.-5 3.s=s+b 4.a=a-b 5.a<-n 6.i>=n
$7. -2 8.h=0.8h 9.1/(i*(i+1))10.c=a+b 11.c-a*b 12.t/2
第三章 Python语言程序设计
巩固练习
1.A 2.D 3.A 4.C 5.B 6.B 7.D 8.D 9.D 10.B 11.D 12.A
13. D 14.C 15.D 16.C 17.C 18.A 19.k<-9/i<-k 20.not p
巩固练习
1.A 2.28 3.19/70 4.ej 5.D 6.D
7.3xapple+2×pear-=-100
完整Python程序:
for apple in range(0,34):
pear-40-apple
if 3*apple+2*pear--
100.
print(apple)
print(pear)