从文本JavaScript中删除HTML

有没有一种简单的方法可以在JavaScript中获取一个html字符串并去掉html？

当前回答

这是一个解决@MikeSamuel安全问题的版本：

function strip(html)
{
   try {
       var doc = document.implementation.createDocument('http://www.w3.org/1999/xhtml', 'html', null);
       doc.documentElement.innerHTML = html;
       return doc.documentElement.textContent||doc.documentElement.innerText;
   } catch(e) {
       return "";
   }
}

注意，如果HTML标记不是有效的XML，它将返回一个空字符串（也就是，标记必须关闭，属性必须引用）。这并不理想，但确实避免了潜在的安全漏洞问题。

如果不需要有效的XML标记，可以尝试使用：

var doc = document.implementation.createHTMLDocument("");

但出于其他原因，这也不是一个完美的解决方案。

2012-07-12 20:38:21

其他回答

输入元素仅支持单行文本：

文本状态表示元素值的单行纯文本编辑控件。

function stripHtml(str) {
  var tmp = document.createElement('input');
  tmp.value = str;
  return tmp.value;
}

更新：这是预期的

function stripHtml(str) {
  // Remove some tags
  str = str.replace(/<[^>]+>/gim, '');

  // Remove BB code
  str = str.replace(/\[(\w+)[^\]]*](.*?)\[\/\1]/g, '$2 ');

  // Remove html and line breaks
  const div = document.createElement('div');
  div.innerHTML = str;

  const input = document.createElement('input');
  input.value = div.textContent || div.innerText || '';

  return input.value;
}

2017-06-14 14:32:08

将HTML转换为纯文本电子邮件，保持超链接（a href）完整

hypoxide发布的上述功能运行良好，但我所追求的是基本上转换在WebRichText编辑器（例如FCKEditor）中创建的HTML并清除所有HTML，但保留所有链接，因为我希望HTML和纯文本版本都能帮助创建STMP电子邮件的正确部分（HTML和纯文字）。

经过长时间的谷歌搜索，我和我的同事使用Javascript中的正则表达式引擎得出了这个结论：

str='this string has <i>html</i> code i want to <b>remove</b><br>Link Number 1 -><a href="http://www.bbc.co.uk">BBC</a> Link Number 1<br><p>Now back to normal text and stuff</p>
';
str=str.replace(/<br>/gi, "\n");
str=str.replace(/<p.*>/gi, "\n");
str=str.replace(/<a.*href="(.*?)".*>(.*?)<\/a>/gi, " $2 (Link->$1) ");
str=str.replace(/<(?:.|\s)*?>/g, "");

str变量的开头如下：

this string has <i>html</i> code i want to <b>remove</b><br>Link Number 1 -><a href="http://www.bbc.co.uk">BBC</a> Link Number 1<br><p>Now back to normal text and stuff</p>

然后在代码运行之后，它看起来像这样：-

this string has html code i want to remove
Link Number 1 -> BBC (Link->http://www.bbc.co.uk)  Link Number 1


Now back to normal text and stuff

正如你所看到的，所有HTML都被删除了，链接也被保留了下来，超链接文本仍然完好无损。此外，我还将＜p＞和＜br＞标记替换为\n（换行符），以便保留某种视觉格式。

更改链接格式（例如，BBC（链接->http://www.bbc.co.uk)）只需编辑$2（Link->$1），其中$1是href URL/URI，$2是超链接文本。由于链接直接位于纯文本正文中，大多数SMTP邮件客户端都会转换这些链接，以便用户能够单击它们。

希望你觉得这很有用。

2009-08-06 08:30:22

最简单的方法：

jQuery(html).text();

它从html字符串中检索所有文本。

2011-12-26 01:26:00

如果你想保留链接和内容结构（h1、h2等），那么你应该检查TextVersionJS。你可以将它与任何HTML一起使用，尽管它是为了将HTML电子邮件转换为纯文本而创建的。

用法很简单。例如，在node.js中：

var createTextVersion = require("textversionjs");
var yourHtml = "<h1>Your HTML</h1><ul><li>goes</li><li>here.</li></ul>";

var textVersion = createTextVersion(yourHtml);

或者在浏览器中使用纯js：

<script src="textversion.js"></script>
<script>
  var yourHtml = "<h1>Your HTML</h1><ul><li>goes</li><li>here.</li></ul>";
  var textVersion = createTextVersion(yourHtml);
</script>

它也适用于require.js：

define(["textversionjs"], function(createTextVersion) {
  var yourHtml = "<h1>Your HTML</h1><ul><li>goes</li><li>here.</li></ul>";
  var textVersion = createTextVersion(yourHtml);
});

2016-08-04 07:38:10

如果你在浏览器中运行，那么最简单的方法就是让浏览器为你做。。。

function stripHtml(html)
{
   let tmp = document.createElement("DIV");
   tmp.innerHTML = html;
   return tmp.textContent || tmp.innerText || "";
}

注意：正如人们在评论中所指出的，如果您不控制HTML的源代码（例如，不要在可能来自用户输入的任何内容上运行此代码），最好避免这种情况。对于这些场景，您仍然可以让浏览器为您完成工作-请参阅Saba关于使用现在广泛可用的DOMParser的回答。

2009-05-04 22:48:21

从文本JavaScript中删除HTML

推荐文章

最新文章

标签