GO代码实现判断字符编码格式及编码格式转换(utf-8、gbk)

bubbleGarden · · 10246 次点击 · · 开始浏览    
这是一个创建于 的文章,其中的信息可能已经有所发展或是发生改变。

# 引入 C/C++的实现请看[https://www.jianshu.com/p/a83d398e3606](https://www.jianshu.com/p/a83d398e3606) 最近使用go开发http服务,在使用http进行通信时,发现接收报文中如果包含中文字符(非utf-8编码),直接使用go将二进制格式数据转换成字符串文本会出现乱码的情况。因为golang中的字符编码格式是utf-8,如果是其他类型的编码,例如gbk,那么直接转码后出现乱码也就理所当然了。 --- # GBK编码格式 为了更好地说明GBK的编码方式,首先在这里先说明一下ASCII码,GB2312, GBK, GB18030的兼容性关系: ![各种编码兼容关系.png](https://upload-images.jianshu.io/upload_images/20140387-8bec430b8deeb7bf.png?imageMogr2/auto-orient/strip%7CimageView2/2/w/1240) ASCII编码使用一个字节的低7位(范围0-127)来表示共128个字符,最高位为0,即 0XXX_XXXX GB2312为了能表示更多字符,使用单字节和双字节来进行编码,单个字节编码与ASCII完全一样,也就兼容了ASCII码,双字节编码高低字节范围都是0xA1-0xFE(范围0xA1A1 - 0xFEFE )。要注意的是该范围的并不是每一个码位都编有字符,GB2312只编码汉字6763个和非汉字图形字符682个。 [GB2312具体编码表](http://tools.jb51.net/table/gb2312) GBK编码同样使用单字节和双字节来进行编码,单字节也同样采用ASCII的编码,双字节GBK编码范围在0x8140 - 0xFEFE之间,细心的人一定发现了GBK编码范围覆盖了GB2312的编码范围。实际上,GB2312的所有双字节字符编码在GBK中也完全一样,这样就实现了GBK对GB2312的兼容。GBK除了包含GB2312的所有字符外,在其编码范围内编码了更多的字符。按照前面提到的,GBK首字节在 81-FE之间 (共126个),尾字节在 40-FE 之间(剔除xx7F后共190个),总计 可以有126*190 = 23940 个码位,除掉不编码的码位后共收入 21886 个汉字和图形符号,其中汉字(包括部首和构件)21003 个,图形符号 883 个。而GB18030则在兼容GBK的基础上使用四个字节来达到扩展编码的目的,与本文要介绍的内容关联不大,有兴趣的话可以自己了解。 [GBK具体编码表](http://tools.jb51.net/table/gbk_table) ![GBK编码范围.png](https://upload-images.jianshu.io/upload_images/20140387-fd39591aab83ad33.png?imageMogr2/auto-orient/strip%7CimageView2/2/w/1240) --- # utf-8编码格式 utf-8使用变字长方式(1到6个字节)来进行编码。 对于某一个字符的UTF-8编码,如果只有一个字节则其最高二进制位为0;如果是多字节,其第一个字节从最高位开始,连续的二进制位值为1的个数决定了其编码的位数,其余各字节均以10开头。具体表示如下: 0XXX_XXXX 110X_XXXX 10XX_XXXX 1110_XXXX 10XX_XXXX 10XX_XXXX 1111_0XXX 10XX_XXXX 10XX_XXXX 10XX_XXXX 1111_10XX 10XX_XXXX 10XX_XXXX 10XX_XXXX 10XX_XXXX 1111_110X 10XX_XXXX 10XX_XXXX 10XX_XXXX 10XX_XXXX 10XX_XXXX --- go判断字符串是否是gbk: ```go func isGBK(data []byte) bool { length := len(data) var i int = 0 for i < length { if data[i] <= 0x7f { //编码0~127,只有一个字节的编码,兼容ASCII码 i++ continue } else { //大于127的使用双字节编码,落在gbk编码范围内的字符 if data[i] >= 0x81 && data[i] <= 0xfe && data[i + 1] >= 0x40 && data[i + 1] <= 0xfe && data[i + 1] != 0xf7 { i += 2 continue } else { return false } } } return true } ``` --- go判断字符串是否是utf-8: ```go func preNUm(data byte) int { var mask byte = 0x80 var num int = 0 //8bit中首个0bit前有多少个1bits for i:=0; i < 8; i++ { if (data & mask) == mask { num++ mask = mask >> 1 } else { break } } return num } func isUtf8(data []byte) bool { i := 0 for i < len(data) { if (data[i] & 0x80) == 0x00 { // 0XXX_XXXX i++ continue } else if num := preNUm(data[i]); num > 2 { // 110X_XXXX 10XX_XXXX // 1110_XXXX 10XX_XXXX 10XX_XXXX // 1111_0XXX 10XX_XXXX 10XX_XXXX 10XX_XXXX // 1111_10XX 10XX_XXXX 10XX_XXXX 10XX_XXXX 10XX_XXXX // 1111_110X 10XX_XXXX 10XX_XXXX 10XX_XXXX 10XX_XXXX 10XX_XXXX // preNUm() 返回首个字节的8个bits中首个0bit前面1bit的个数,该数量也是该字符所使用的字节数 i++ for j := 0; j < num - 1; j++ { //判断后面的 num - 1 个字节是不是都是10开头 if (data[i] & 0xc0) != 0x80 { return false } i++ } } else { //其他情况说明不是utf-8 return false } } return true } ``` --- go gbk与utf-8相互转换: gbk与utf-8相互转换可以使用官方的golang.org/x/text 包来进行转换 需要先安装这个第三方包,使用以下命令进行安装 go get golang.org/x/text ```go import "golang.org/x/text/encoding/simplifiedchinese" simplifiedchinese.GBK.NewEncoder().Bytes() //utf-8 转 gbk simplifiedchinese.GBK.NewDecoder().Bytes() //gbk 转 utf-8 ``` --- 用例: ```go const ( GBK string = "GBK" UTF8 string = "UTF8" UNKNOWN string = "UNKNOWN" ) //需要说明的是,isGBK()是通过双字节是否落在gbk的编码范围内实现的, //而utf-8编码格式的每个字节都是落在gbk的编码范围内, //所以只有先调用isUtf8()先判断不是utf-8编码,再调用isGBK()才有意义 func GetStrCoding(data []byte) string { if isUtf8(data) == true { return UTF8 } else if isGBK(data) == true { return GBK } else { return UNKNOWN } } func main() { str := "月色真美,风也温柔,233333333,~!@#" //go字符串编码为utf-8 fmt.Println("before convert:", str) //打印转换前的字符串 fmt.Println("coding:", GetStrCoding([]byte(str))) //判断是否是utf-8 gbkData, _ := simplifiedchinese.GBK.NewEncoder().Bytes([]byte(str)) //使用官方库将utf-8转换为gbk fmt.Println("gbk直接打印会出现乱码:", string(gbkData)) //乱码字符串 fmt.Println("coding:", GetStrCoding(gbkData)) //判断是否是gbk utf8Data, _ := simplifiedchinese.GBK.NewDecoder().Bytes(gbkData) //将gbk再转换为utf-8 fmt.Println("coding:", GetStrCoding(utf8Data)) //判断是否是utf-8 fmt.Println("after convert:", string(utf8Data)) //打印转换后的字符串 } ``` ![运行结果.png](https://upload-images.jianshu.io/upload_images/20140387-681943372d9c2638.png?imageMogr2/auto-orient/strip%7CimageView2/2/w/1240)

有疑问加站长微信联系(非本文作者))

入群交流(和以上内容无关):加入Go大咖交流群,或添加微信:liuxiaoyan-s 备注:入群;或加QQ群:692541889

10246 次点击  
加入收藏 微博
被以下专栏收入,发现更多相似内容
1 回复  |  直到 2021-01-06 16:42:23
暂无回复
添加一条新回复 (您需要 登录 后才能回复 没有账号 ?)
  • 请尽量让自己的回复能够对别人有帮助
  • 支持 Markdown 格式, **粗体**、~~删除线~~、`单行代码`
  • 支持 @ 本站用户;支持表情(输入 : 提示),见 Emoji cheat sheet
  • 图片支持拖拽、截图粘贴等方式上传