happmaoo 发表于 2013-1-19 04:09:17

c#处理html字符串

最近碰到个问题,html encode后的字符串,需要替换里面的文本内容。需要注意的地方是标签里面的内容不能被替换。
比如<p>pdf</p>,替换p为abc的时候<p>,</p>里面的p不能被替换。
纠结了很久终于解决:
1. 利用System.Web里的HttpUtility.HtmlDecode将字符串解码,比如<>会被解码成<>
2. 利用正则表达式隔离tag和tag外的内容Regex reg = new Regex("(<[^>]*>)");
3. 隔开后的string总在一个string 的list中,在通过判断是不是<>开头结尾来过滤,不是标签的话就替换内容
代码如下
private static void replaceText(string text,ref List<string> ll)
   {
   string html = HttpUtility.HtmlDecode(text);
   Regex reg = new Regex("(<[^>]*>)");
   Match mm = reg.Match(html);
   string temp = string.Empty;
   if (mm.Groups.Count > 1)
   {
       Group gg = mm.Groups;
       ll.Add(html.Substring(0,gg.Index));
       ll.Add(html.Substring(gg.Index,gg.Length));
       replaceText(html.Substring(gg.Index + gg.Length), ref ll);
   }
   else
       ll.Add(text);
   }
static void Main(string[] args)
   {
   List<string> ll = new List<string>();
   replaceText("pvc<p src=\"ds\">dpp</p><p>spdf<br /></p><a href=\"wwwp />fgdfgp",ref ll);
   string result = string.Empty;
   for(int i =0;i<ll.Count;i++)
   {
       string s = ll;
      if((!string.IsNullOrEmpty(s))&& !(s.StartsWith("<")&&s.EndsWith(">")))
         s = s.Replace("p","替换");
       Console.WriteLine(s);
       result += s;
   }
   Console.WriteLine("result: " +result);
   }
页: [1]
查看完整版本: c#处理html字符串