恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

从ASCII码到Unicode,最终选择UTF-8编码的趣事【学习笔记】

  • 首页
  • 资讯中心
  • /
  • 从ASCII码到Unicode,最终选择UTF-8编码的趣事【学习笔记】

相关资讯

K8s集群安全全方位加固!RBAC权限、网络策略、镜像安全、资源配额,筑牢Agent云原生生产防线 2026/8/2 17:54:16
K8s日志体系完整落地!EFK日志收集、集中检索、链路追踪,彻底解决Agent线上日志排查难题 2026/8/2 17:54:17
浅析 HttpServlet 2026/8/2 17:54:17

最新资讯

C语言长字符串换行方法详解:原理、实践与最佳选择
mINI 源码剖析(一):INIMap 模板如何同时实现 O(1) 查找与插入顺序保持的双重魔法
YOLOv5训练报错“No labels found”的根源分析与彻底解决方案
产品系统资源占用优化设计指南
YOLOv5训练报错“no labels found”的根源与系统化解决方案
Linux下Nvidia显卡风扇控制:从原理到自动化脚本实战

今日推荐

三步把QQ空间历史说说导出到本地:GetQzonehistory 极简指南
洛谷 P7912:[CSP-J 2021 T4] 小熊的果篮 ← 双向链表
Transformers.js 网页端图像抠图实战:零后端 3 行代码返回透明 PNG

本周热门

Nextcloud 桌面客户端:把同步交给它,你只管改文件
如何将 HTML 转成 Word 文档且格式不丢失?html-to-docx 使用教程
Anki 批量操作卡片完整指南:一次搞定上千张,不再逐张修改

本月精选

如何用DamaiHelper实现演唱会门票的智能自动化抢购:完整技术解决方案指南
第4篇:59 倍性能差距的索引瓶颈定位——一次教科书级的全表扫描调优
终极歌词批量下载神器:5分钟解决离线音乐库歌词同步难题

从ASCII码到Unicode,最终选择UTF-8编码的趣事【学习笔记】

发布时间:2026/8/25 10:05:15
从ASCII码到Unicode,最终选择UTF-8编码的趣事【学习笔记】 https://www.bilibili.com/video/BV1h7411V7Xw?fromsearchseid6458930640632168365上面链接位B站视频链接讲的是字符串编码是我所看到的讲解最好的一个希望对你有帮助。上一张图以下位对上图的一种解释。在计算机中基本的存储单位为位bit 一个位可以表示两种数字0和1一个字节Byte 8位bit可以表示成256种组合如何把数字汉字等字符存储在计算机中工程师们发明了一种ASCII 码上个实际60年代美国人制造出来一种编码方式将英文字符与字节做了统一的规定ascii中包含字母、数字、符号共计128个。需要注意的是Ucicode只是一个字符集它只规定了符号的二进制代码却没有给出这个二进制代码应该如何对应进行存储具体该使用几个字节来存储一个字符因此Unicode不适于直接用来编码存储字符为此人们设计了utf-8的编码 它是在互联网上广泛使用的一种unicode编码实现方式使用它可以使用1-4个字节表示一种字符根据不同的符号变化长度目前多数语言都支持uft-8编码它是一种最通行的编码方式。5.早期的程序设计语言中都使用ASCII码每一个字节来保存一个字符一个字符对应一个字节后来由于多种语言的出现使用的编码方式有所改变字符和字节就不是一一对应的关系了例如一个汉字当以utf-8编码方式存储时它占3个字节print(str1.encode(encoding utf-8)) b\xe6\x88\x91 print(len(str1.encode(encoding utf-8))) 3一个汉字当以gb2312或gbk编码方式存储时它占2个字节。print(str1.encode(encoding gbk)) b\xce\xd2 print(len(str1.encode(encoding gbk))) 2print(str1.encode(encoding gb2312)) b\xce\xd2 print(len(str1.encode(encoding gb2312))) 2Python中默认是以字符来进行存储的因此汉字和字母具有相同的地位在计算字符长度时一个字母和一个汉字的字符长度都为1。理解这个貌似没有上一种好理解视频链接地址字母,符号和神奇的Unicode希望感兴趣的可以看一下。整理的不是很详细仅供参考。今天在看视频的时候发现一个国外的讲解关于UTF-8的这样的一个发展。在早期的20世纪60年代人们通过一些电传设备一边发送了一些数字另一边会出现同一个字母但在20世纪60年代中期需要有一个标准以使其规范美国采用了ASCII码这是美国信息交换标准代码它是一个7位的二进制系统应该是8位第1位是0你输入的每个英文字母都可以转换成7个二进制数并通过网络发送这意味着您可以拥有0-127之间的数字它的前32位表示的是一些空格回车之类的字符在后面他们又添加了一些数字标点符号等很聪明的一件事是用65来表示’A‘。用二进制表示就是0100 0001并且也出现了用97表示的小写的字母‘a’而进制表示就是0110 0001。随着时间的推移事情发生了一些变化全世界各个国家使用的语言的符号不一样ASCII码不够用了后来就出现了Unicode编码Unicode现在有一个超过十万个字符的列表涵盖了你可能用任何语言书写的所有内容有英文字母中文阿拉伯字母字符最后得到的是10万多个数字分配的10万多个字符。与三个问题需要注意.你必须摆脱英文文本中所有的。许多旧计算机系统对理解连续的个会输出一个当连续发送个的时候它就会终止接收所以不能在任何地方连续使用个。必须考虑向后兼容您必须能够使用Unicode文本将其放入只能理解基本的ASCII的内容中并且或多或少的为英文文本工作utf-8解决了这些所有的问题它首先采用ASCII如果你有128以下的东西那可以表示用7位二进制数来表示如果需要更多的表示我就就先写出110这意味着这是一个新字符的开头这个字符长度为2个字节一个字节为8位而后我们将用10作为延续在左右的空白的地方可以补充01。

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号