从文本JavaScript中删除HTML

有没有一种简单的方法可以在JavaScript中获取一个html字符串并去掉html？

当前回答

您可以使用以下正则表达式去掉所有html标记：/<（.|\n）*？>/克

例子：

let str = "<font class=\"ClsName\">int[0]</font><font class=\"StrLit\">()</font>";
console.log(str.replace(/<(.|\n)*?>/g, ''));

输出：

int[0]()

2022-09-30 09:17:43

其他回答

将HTML转换为纯文本电子邮件，保持超链接（a href）完整

hypoxide发布的上述功能运行良好，但我所追求的是基本上转换在WebRichText编辑器（例如FCKEditor）中创建的HTML并清除所有HTML，但保留所有链接，因为我希望HTML和纯文本版本都能帮助创建STMP电子邮件的正确部分（HTML和纯文字）。

经过长时间的谷歌搜索，我和我的同事使用Javascript中的正则表达式引擎得出了这个结论：

str='this string has <i>html</i> code i want to <b>remove</b><br>Link Number 1 -><a href="http://www.bbc.co.uk">BBC</a> Link Number 1<br><p>Now back to normal text and stuff</p>
';
str=str.replace(/<br>/gi, "\n");
str=str.replace(/<p.*>/gi, "\n");
str=str.replace(/<a.*href="(.*?)".*>(.*?)<\/a>/gi, " $2 (Link->$1) ");
str=str.replace(/<(?:.|\s)*?>/g, "");

str变量的开头如下：

this string has <i>html</i> code i want to <b>remove</b><br>Link Number 1 -><a href="http://www.bbc.co.uk">BBC</a> Link Number 1<br><p>Now back to normal text and stuff</p>

然后在代码运行之后，它看起来像这样：-

this string has html code i want to remove
Link Number 1 -> BBC (Link->http://www.bbc.co.uk)  Link Number 1


Now back to normal text and stuff

正如你所看到的，所有HTML都被删除了，链接也被保留了下来，超链接文本仍然完好无损。此外，我还将＜p＞和＜br＞标记替换为\n（换行符），以便保留某种视觉格式。

更改链接格式（例如，BBC（链接->http://www.bbc.co.uk)）只需编辑$2（Link->$1），其中$1是href URL/URI，$2是超链接文本。由于链接直接位于纯文本正文中，大多数SMTP邮件客户端都会转换这些链接，以便用户能够单击它们。

希望你觉得这很有用。

2009-08-06 08:30:22

大多数情况下，接受的答案都很好，但是在IE中，如果html字符串为空，则会得到“null”（而不是“”）。固定的：

function strip(html)
{
   if (html == null) return "";
   var tmp = document.createElement("DIV");
   tmp.innerHTML = html;
   return tmp.textContent || tmp.innerText || "";
}

2016-05-27 00:12:48

如果你在浏览器中运行，那么最简单的方法就是让浏览器为你做。。。

function stripHtml(html)
{
   let tmp = document.createElement("DIV");
   tmp.innerHTML = html;
   return tmp.textContent || tmp.innerText || "";
}

注意：正如人们在评论中所指出的，如果您不控制HTML的源代码（例如，不要在可能来自用户输入的任何内容上运行此代码），最好避免这种情况。对于这些场景，您仍然可以让浏览器为您完成工作-请参阅Saba关于使用现在广泛可用的DOMParser的回答。

2009-05-04 22:48:21

const strip=(text) =>{
    return (new DOMParser()?.parseFromString(text,"text/html"))
    ?.body?.textContent
}

const value=document.getElementById("idOfEl").value

const cleanText=strip(value)

2022-01-19 08:53:18

一个非常好的库是净化html，它是一个纯JavaScript函数，可以在任何环境中使用。

我的案例是React Native，我需要从给定文本中删除所有HTML标记。所以我创建了这个包装函数：

import sanitizer from 'sanitize-html';

const textSanitizer = (textWithHTML: string): string =>
  sanitizer(textWithHTML, {
    allowedTags: [],
  });

export default textSanitizer;

现在，通过使用textSanitizer，我可以获得纯文本内容。

2022-11-19 19:43:18

从文本JavaScript中删除HTML

推荐文章

最新文章

标签