如何从。net中的字符串中删除变音符(重音)?

我试图转换一些字符串，在法国加拿大，基本上，我想能够拿出法国重音标记在字母，同时保持字母。(例如，将é转换为e，那么crème brûlée就会变成creme brulee)

实现这一目标的最佳方法是什么?

当前回答

这是VB版本(工作与希腊):

导入系统。文本

导入系统。全球化

Public Function RemoveDiacritics(ByVal s As String)
    Dim normalizedString As String
    Dim stringBuilder As New StringBuilder
    normalizedString = s.Normalize(NormalizationForm.FormD)
    Dim i As Integer
    Dim c As Char
    For i = 0 To normalizedString.Length - 1
        c = normalizedString(i)
        If CharUnicodeInfo.GetUnicodeCategory(c) <> UnicodeCategory.NonSpacingMark Then
            stringBuilder.Append(c)
        End If
    Next
    Return stringBuilder.ToString()
End Function

2010-07-28 13:21:20

其他回答

试试helppersharp包。

有一个方法removeaccent:

 public static string RemoveAccents(this string source)
 {
     //8 bit characters 
     byte[] b = Encoding.GetEncoding(1251).GetBytes(source);

     // 7 bit characters
     string t = Encoding.ASCII.GetString(b);
     Regex re = new Regex("[^a-zA-Z0-9]=-_/");
     string c = re.Replace(t, " ");
     return c;
 }

2013-05-03 02:25:24

我没有使用过这种方法，但是Michael Kaplan在他的博客文章(有一个令人困惑的标题)中描述了一种方法，谈论剥离变音符:剥离是一项有趣的工作(又名剥离) 论无意义的意义，即一切 Mn字符是非空格的，但是有些更非间距比其他人)

static string RemoveDiacritics(string text) 
{
    var normalizedString = text.Normalize(NormalizationForm.FormD);
    var stringBuilder = new StringBuilder(capacity: normalizedString.Length);

    for (int i = 0; i < normalizedString.Length; i++)
    {
        char c = normalizedString[i];
        var unicodeCategory = CharUnicodeInfo.GetUnicodeCategory(c);
        if (unicodeCategory != UnicodeCategory.NonSpacingMark)
        {
            stringBuilder.Append(c);
        }
    }

    return stringBuilder
        .ToString()
        .Normalize(NormalizationForm.FormC);
}

请注意，这是他之前帖子的后续:剥离变音符....

该方法使用String。Normalize将输入字符串分割为组成符号(基本上是将“基本”字符与变音符符分开)，然后扫描结果并仅保留基本字符。这只是有点复杂，但实际上你看到的是一个复杂的问题。

当然，如果你限制自己使用法语，你可能会使用@David Dibben推荐的如何在c++ std::string中删除重音和波浪号的简单基于表的方法。

2008-10-30 02:29:01

与接受的答案相同，但更快，使用Span而不是StringBuilder。需要。net Core 3.1或更新的。net。

static string RemoveDiacritics(string text) 
{
    ReadOnlySpan<char> normalizedString = text.Normalize(NormalizationForm.FormD);
    int i = 0;
    Span<char> span = text.Length < 1000
        ? stackalloc char[text.Length]
        : new char[text.Length];

    foreach (char c in normalizedString)
    {
        if (CharUnicodeInfo.GetUnicodeCategory(c) != UnicodeCategory.NonSpacingMark)
            span[i++] = c;
    }

    return new string(span).Normalize(NormalizationForm.FormC);
}

此外，这是可扩展的额外字符替换，如抛光Ł。

span[i++] = c switch
{
    'Ł' => 'L',
    'ł' => 'l',
    _ => c
};

一个小提示:堆栈分配stackalloc比堆分配new要快得多，它为垃圾收集器减少了工作。1000是一个阈值，以避免在堆栈上分配大结构，这可能会导致StackOverflowException。虽然1000是一个相当安全的值，但在大多数情况下10000甚至100000也可以(100k在堆栈上分配最多200kB，而默认堆栈大小为1mb)。然而10万对我来说有点危险。

2021-04-21 06:09:41

希腊代码页(ISO)可以做到这一点

关于这个代码页的信息在System.Text.Encoding.GetEncodings()中。了解网址:https://msdn.microsoft.com/pt-br/library/system.text.encodinginfo.getencoding(v=vs.110).aspx

希腊语(ISO)的代码页为28597，名称为ISO -8859-7。

进入代码…\ o /

string text = "Você está numa situação lamentável";

string textEncode = System.Web.HttpUtility.UrlEncode(text, Encoding.GetEncoding("iso-8859-7"));
//result: "Voce+esta+numa+situacao+lamentavel"

string textDecode = System.Web.HttpUtility.UrlDecode(textEncode);
//result: "Voce esta numa situacao lamentavel"

那么，写这个函数…

public string RemoveAcentuation(string text)
{
    return
        System.Web.HttpUtility.UrlDecode(
            System.Web.HttpUtility.UrlEncode(
                text, Encoding.GetEncoding("iso-8859-7")));
}

请注意,…Encoding. getencoding ("iso-8859-7")等价于Encoding. getencoding(28597)，因为第一个是Encoding的名称，第二个是Encoding的编码页。

2016-08-05 01:46:49

这个人说:

Encoding.ASCII.GetString（Encoding.GetEncoding（1251）.获取字节（文本））;

它实际上把å这样的一个字符(它是字符代码00E5，而不是0061加上修饰符030A，看起来是一样的)分割成一个加上某种修饰符，然后ASCII转换删除修饰符，只留下a。

2015-12-11 17:09:47

如何从。net中的字符串中删除变音符(重音)?

推荐文章

最新文章

标签