GO代码实现判断字符编码格式及编码格式转换（utf-8、gbk）

· · 10295 次点击 · · 开始浏览

这是一个创建于的文章，其中的信息可能已经有所发展或是发生改变。

引入

最近使用go开发http服务，在使用http进行通信时，发现接收报文中如果包含中文字符（非utf-8编码），直接使用go将二进制格式数据转换成字符串文本会出现乱码的情况。因为golang中的字符编码格式是utf-8，如果是其他类型的编码，例如gbk，那么直接转码后出现乱码也就理所当然了。

GBK编码格式

为了更好地说明GBK的编码方式，首先在这里先说明一下ASCII码，GB2312, GBK, GB18030的兼容性关系：

各种编码兼容关系.png

ASCII编码使用一个字节的低7位（范围0-127）来表示共128个字符，最高位为0，即 0XXX_XXXX

GB2312为了能表示更多字符，使用单字节和双字节来进行编码，单个字节编码与ASCII完全一样，也就兼容了ASCII码，双字节编码高低字节范围都是0xA1-0xFE（范围0xA1A1 - 0xFEFE ）。要注意的是该范围的并不是每一个码位都编有字符，GB2312只编码汉字6763个和非汉字图形字符682个。
GB2312具体编码表

GBK编码同样使用单字节和双字节来进行编码，单字节也同样采用ASCII的编码，双字节GBK编码范围在0x8140 - 0xFEFE之间，细心的人一定发现了GBK编码范围覆盖了GB2312的编码范围。实际上，GB2312的所有双字节字符编码在GBK中也完全一样，这样就实现了GBK对GB2312的兼容。GBK除了包含GB2312的所有字符外，在其编码范围内编码了更多的字符。按照前面提到的，GBK首字节在 81-FE之间（共126个），尾字节在 40-FE 之间（剔除xx7F后共190个），总计可以有126*190 = 23940 个码位，除掉不编码的码位后共收入 21886 个汉字和图形符号，其中汉字（包括部首和构件）21003 个，图形符号 883 个。而GB18030则在兼容GBK的基础上使用四个字节来达到扩展编码的目的，与本文要介绍的内容关联不大，有兴趣的话可以自己了解。
GBK具体编码表

GBK编码范围.png

utf-8编码格式

utf-8使用变字长方式(1到6个字节）来进行编码。
对于某一个字符的UTF-8编码，如果只有一个字节则其最高二进制位为0；如果是多字节，其第一个字节从最高位开始，连续的二进制位值为1的个数决定了其编码的位数，其余各字节均以10开头。具体表示如下：
0XXX_XXXX
110X_XXXX 10XX_XXXX
1110_XXXX 10XX_XXXX 10XX_XXXX
1111_0XXX 10XX_XXXX 10XX_XXXX 10XX_XXXX
1111_10XX 10XX_XXXX 10XX_XXXX 10XX_XXXX 10XX_XXXX
1111_110X 10XX_XXXX 10XX_XXXX 10XX_XXXX 10XX_XXXX 10XX_XXXX

go判断字符串是否是gbk:

func isGBK(data []byte) bool {
    length := len(data)
    var i int = 0
    for i < length {
        //fmt.Printf("for %x\n", data[i])
        if data[i] <= 0xff {
            //编码小于等于127,只有一个字节的编码，兼容ASCII吗
            i++
            continue
        } else {
            //大于127的使用双字节编码
            if  data[i] >= 0x81 &&
                data[i] <= 0xfe &&
                data[i + 1] >= 0x40 &&
                data[i + 1] <= 0xfe &&
                data[i + 1] != 0xf7 {
                i += 2
                continue
            } else {
                return false
            }
        }
    }
    return true
}

go判断字符串是否是utf-8:

func preNUm(data byte) int {
    str := fmt.Sprintf("%b", data)
    var i int = 0
    for i < len(str) {
        if str[i] != '1' {
            break
        }
        i++
    }
    return i
}
func isUtf8(data []byte) bool {
    for i := 0; i < len(data);  {
        if data[i] & 0x80 == 0x00 {
            // 0XXX_XXXX
            i++
            continue
        } else if num := preNUm(data[i]); num > 2 {
            // 110X_XXXX 10XX_XXXX
            // 1110_XXXX 10XX_XXXX 10XX_XXXX
            // 1111_0XXX 10XX_XXXX 10XX_XXXX 10XX_XXXX
            // 1111_10XX 10XX_XXXX 10XX_XXXX 10XX_XXXX 10XX_XXXX
            // 1111_110X 10XX_XXXX 10XX_XXXX 10XX_XXXX 10XX_XXXX 10XX_XXXX
            // preNUm() 返回首个字节的8个bits中首个0bit前面1bit的个数，该数量也是该字符所使用的字节数
            i++
            for j := 0; j < num - 1; j++ {
                //判断后面的 num - 1 个字节是不是都是10开头
                if data[i] & 0xc0 != 0x80 {
                    return false
                }
                i++
            }
        } else  {
            //其他情况说明不是utf-8
            return false
        }
    }
    return true
}

go gbk与utf-8相互转换:
gbk与utf-8相互转换可以使用官方的golang.org/x/text 包来进行转换

import "golang.org/x/text/encoding/simplifiedchinese"
simplifiedchinese.GBK.NewEncoder().Bytes()   //utf-8 转 gbk
simplifiedchinese.GBK.NewDecoder().Bytes()  //gbk 转 utf-8

测试及结果

func main() {
    str := "月色真美，风也温柔，233333333，~！@#"  //go字符串编码为utf-8
    fmt.Println("before convert:", str)   //打印转换前的字符串
    fmt.Println("isUtf8:", isUtf8([]byte(str)))   //判断是否是utf-8
    gbkData, _ := simplifiedchinese.GBK.NewEncoder().Bytes([]byte(str))  //使用官方库将utf-8转换为gbk
    fmt.Println("gbk直接打印会出现乱码:", string(gbkData))   //乱码字符串
    fmt.Println("isGBK:", isGBK(gbkData)) //判断是否是gbk
    utf8Data, _ := simplifiedchinese.GBK.NewDecoder().Bytes(gbkData) //将gbk再转换为utf-8
    fmt.Println("isUtf8:", isUtf8(utf8Data) )  //判断是否是utf-8
    fmt.Println("after convert:", string(utf8Data))   //打印转换前的字符串
}

运行结果.png

有疑问加站长微信联系（非本文作者）

本文来自：简书

感谢作者：

查看原文：GO代码实现判断字符编码格式及编码格式转换（utf-8、gbk）

入群交流（和以上内容无关）：加入Go大咖交流群，或添加微信：liuxiaoyan-s 备注：入群；或加QQ群：692541889

10295 次点击

加入收藏微博

收入我的专栏

上一篇：分布式事务解决方案

下一篇：Go的gc机制（转）

单字节

代码

码位

二进制位

1 回复 | 直到 2024-05-29 10:35:09

添加一条新回复（您需要登录后才能回复没有账号？）

请尽量让自己的回复能够对别人有帮助
支持 Markdown 格式, **粗体**、~~删除线~~、`单行代码`
支持 @ 本站用户；支持表情（输入 : 提示），见 Emoji cheat sheet
图片支持拖拽、截图粘贴等方式上传

关注我

扫码关注领全套学习资料
加入 QQ 群：
- 192706294（已满）
- 731990104（已满）
- 798786647（已满）
- 729884609（已满）
- 977810755（已满）
- 815126783（已满）
- 812540095（已满）
- 1006366459（已满）
- 692541889
加入微信群：liuxiaoyan-s，备注入群
也欢迎加入知识星球 Go粉丝们（免费）

GO代码实现判断字符编码格式及编码格式转换（utf-8、gbk）

引入

GBK编码格式

utf-8编码格式

用户登录

今日阅读排行

一周阅读排行

关注我

引入

GBK编码格式

utf-8编码格式

GO代码实现判断字符编码格式及编码格式转换（utf-8、gbk）

引入

GBK编码格式

utf-8编码格式

用户登录

今日阅读排行

一周阅读排行

关注我

给该专栏投稿 写篇新文章

收入到我管理的专栏 新建专栏

引入

GBK编码格式

utf-8编码格式

给该专栏投稿写篇新文章

收入到我管理的专栏新建专栏