新书推介:《语义网技术体系》
作者:瞿裕忠,胡伟,程龚
   XML论坛     W3CHINA.ORG讨论区     计算机科学论坛     SOAChina论坛     Blog     开放翻译计划     新浪微博  
 
  • 首页
  • 登录
  • 注册
  • 软件下载
  • 资料下载
  • 核心成员
  • 帮助
  •   Add to Google

    >> 本版讨论DOM, SAX, XPath等。
    [返回] 中文XML论坛 - 专业的XML技术讨论区XML.ORG.CN讨论区 - XML技术『 DOM/SAX/XPath 』 → SAX不能正确处理特殊字符的转义实体? 查看新帖用户列表

      发表一个新主题  发表一个新投票  回复主题  (订阅本版) 您是本帖的第 10591 个阅读者浏览上一篇主题  刷新本主题   树形显示贴子 浏览下一篇主题
     * 贴子主题: SAX不能正确处理特殊字符的转义实体? 举报  打印  推荐  IE收藏夹 
       本主题类别:     
     jiangshachina 帅哥哟,离线,有人找我吗?
      
      
      等级:大一新生
      文章:4
      积分:64
      门派:XML.ORG.CN
      注册:2008/5/19

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给jiangshachina发送一个短消息 把jiangshachina加入好友 查看jiangshachina的个人资料 搜索jiangshachina在『 DOM/SAX/XPath 』的所有贴子 引用回复这个贴子 回复这个贴子 查看jiangshachina的博客楼主
    发贴心情 SAX不能正确处理特殊字符的转义实体?

    刚刚学习使用SAX解析XML,遇到了两个问题。

    全部程序如下:
    import org.xml.sax.Attributes;
    import org.xml.sax.SAXException;
    import org.xml.sax.helpers.DefaultHandler;

    public class SimpeXmlHandler extends DefaultHandler {

      private String str = null;

      private String element = null;

      public void startElement(String namespaceURI, String localName,
          String fullName, Attributes attributes) throws SAXException {
        element = fullName;
        for (int i = 0; i < attributes.getLength(); i++) {
          String qName = attributes.getQName(i);
          if (qName.equals("id")) {
            System.out.println("id=" + attributes.getValue(qName).trim());
            break;
          }
        }
      }

      public void endElement(String uri, String localName, String qName)
          throws SAXException {
        if (str != null) {
          if (element.equalsIgnoreCase("title")) {
            System.out.println("title=" + str);
          } else if (element.equalsIgnoreCase("href")) {
            System.out.println("href=" + str);
          } else if (element.equalsIgnoreCase("content")) {
            System.out.println("content=" + str);
          }
        }
      }

      public void characters(char[] chars, int start, int length)
          throws SAXException {
        str = new String(chars, start, length).trim();
      }
    }

    import javax.xml.parsers.SAXParser;
    import javax.xml.parsers.SAXParserFactory;

    import org.xml.sax.InputSource;
    import org.xml.sax.XMLReader;

    public class SimpleXmlTest {

      public static void main(String[] args) throws Exception {
        SimpeXmlHandler handler = new SimpeXmlHandler();
        SAXParserFactory factory = SAXParserFactory.newInstance();
        factory.setValidating(false);
        SAXParser parser = factory.newSAXParser();
        XMLReader xmlReader = parser.getXMLReader();
        xmlReader.setContentHandler(handler);
        InputSource source = new InputSource("config/sample.xml");
        xmlReader.parse(source);
      }
    }

    执行SimpleXmlTest解析如下的XML文件,
    <?xml version="1.0" encoding="UTF-8"?>
    <root>
      <articles>
        <article id="00001">
          <title>titleValue</title>
          <href>hrefValue</href>
          <publishtime>timeValue</publishtime>
          <content>contentValue</content>
          <tag>0</tag>
        </article>
      </articles>
    </root>
    结果如下:
    id=00001
    title=titleValue
    href=hrefValue
    content=contentValue

    将XML文件的内容换成如下:
    <?xml version="1.0" encoding="UTF-8"?>
    <root>
      <articles>
        <article id="00001">
          <title>titleValue</title>
          <href>hrefValue</href>
          <publishtime>timeValue</publishtime>
          <content>start&gt;end</content>
          <tag>0</tag>
        </article>
      </articles>
    </root>
    执行程序后会得到如下结果:
    id=00001
    title=titleValue
    href=hrefValue
    content=end

    再将XML文件的内容换成如下:
    <?xml version="1.0" encoding="UTF-8"?>
    <root>
      <articles>
        <article id="00001">
          <title>titleValue</title>
          <href>hrefValue</href>
          <publishtime>timeValue</publishtime>
          <content>start>end</content>
          <tag>0</tag>
        </article>
      </articles>
    </root>
    再次执行程序后会得到如下结果:
    id=00001
    title=titleValue
    href=hrefValue
    content=start>end

    似乎SAX会自动地把"&gt;"转换成">",这样就造成了错误。
    一般地,在XML文件中直接使用">","<","&",...等特殊字符会造成错误,所以会使用"&gt;","&lt;","&amp",...等转义实体。
    但在我的程序中,似乎恰恰与此相反。
    如何解释上述情况呢?

    另,将XML文件的内容换成如下:
    <?xml version="1.0" encoding="UTF-8"?>
    <root>
      <articles>
        <article id="00001">
          <title>titleValue</title>
          <href>hrefValue</href>
          <publishtime>timeValue</publishtime>
          <content>contentValue</content>
          <!-- <tag>0</tag> -->
        </article>
      </articles>
    </root>
    执行测试程序后会得到如下结果:
    id=00001
    title=titleValue
    href=hrefValue
    content=contentValue
    content=
    content=
    content=

    对于最后三行的"content=",我不能理解。

    希望大家能为我解惑,谢谢!


       收藏   分享  
    顶(0)
      




    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2008/5/19 9:31:00
     
     jiangshachina 帅哥哟,离线,有人找我吗?
      
      
      等级:大一新生
      文章:4
      积分:64
      门派:XML.ORG.CN
      注册:2008/5/19

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给jiangshachina发送一个短消息 把jiangshachina加入好友 查看jiangshachina的个人资料 搜索jiangshachina在『 DOM/SAX/XPath 』的所有贴子 引用回复这个贴子 回复这个贴子 查看jiangshachina的博客2
    发贴心情 
    我直接使用DK 1.4.2中包org.xml.sax和javax.xml.parsers的API。
    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2008/5/19 9:36:00
     
     Qr 帅哥哟,离线,有人找我吗?
      
      
      威望:9
      等级:博士二年级(版主)
      文章:4392
      积分:29981
      门派:XML.ORG.CN
      注册:2004/5/15

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给Qr发送一个短消息 把Qr加入好友 查看Qr的个人资料 搜索Qr在『 DOM/SAX/XPath 』的所有贴子 访问Qr的主页 引用回复这个贴子 回复这个贴子 查看Qr的博客3
    发贴心情 
    试试看将">","<","&" 转换为对应的 >,<,&,没有测试。
    至于最后一个问题,很多SAX默认将注释当作节点来处理,java会不会也一样,你可以查一下相关说明。

    ----------------------------------------------
    没人帮忙,那就靠自己,自己才是最好的老师!本人拒绝回答通过站内短消息提出的问题!

    blog:http://Qr.blogger.org.cn

    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2008/5/19 10:21:00
     
     jiangshachina 帅哥哟,离线,有人找我吗?
      
      
      等级:大一新生
      文章:4
      积分:64
      门派:XML.ORG.CN
      注册:2008/5/19

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给jiangshachina发送一个短消息 把jiangshachina加入好友 查看jiangshachina的个人资料 搜索jiangshachina在『 DOM/SAX/XPath 』的所有贴子 引用回复这个贴子 回复这个贴子 查看jiangshachina的博客4
    发贴心情 
    感谢上面的回复。

    > 试试看将">","<","&" 转换为对应的 >,<,&,没有测试。
    经过测试,仍然有相同的问题。如,解析含下面内容的XML文件:
    <root>
     <articles>
      <article id="00001">
       <title>titleValue</title>
       <href>hrefValue</href>
       <publishtime>timeValue</publishtime>
       <content>contentValue<</content>
       <tag>0</tag>
      </article>
     </articles>
    </root>
    结果,content元素的值仍然为"<"。

    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2008/5/19 10:43:00
     
     Qr 帅哥哟,离线,有人找我吗?
      
      
      威望:9
      等级:博士二年级(版主)
      文章:4392
      积分:29981
      门派:XML.ORG.CN
      注册:2004/5/15

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给Qr发送一个短消息 把Qr加入好友 查看Qr的个人资料 搜索Qr在『 DOM/SAX/XPath 』的所有贴子 访问Qr的主页 引用回复这个贴子 回复这个贴子 查看Qr的博客5
    发贴心情 
    平时没太注意这个问题,遇到特殊字符,我一般用<![CDATA[特殊字符]]>

    ----------------------------------------------
    没人帮忙,那就靠自己,自己才是最好的老师!本人拒绝回答通过站内短消息提出的问题!

    blog:http://Qr.blogger.org.cn

    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2008/5/19 10:50:00
     
     jiangshachina 帅哥哟,离线,有人找我吗?
      
      
      等级:大一新生
      文章:4
      积分:64
      门派:XML.ORG.CN
      注册:2008/5/19

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给jiangshachina发送一个短消息 把jiangshachina加入好友 查看jiangshachina的个人资料 搜索jiangshachina在『 DOM/SAX/XPath 』的所有贴子 引用回复这个贴子 回复这个贴子 查看jiangshachina的博客6
    发贴心情 
    > 平时没太注意这个问题,遇到特殊字符,我一般用<![CDATA[特殊字符]]>
    因为提供的数据源(即XML文件)中就有这些字符,我不可能对其进行修改。
    实际上,content元素的值是一段HTML语句(特殊字符已经转义过了),所以里面不可避免的会存在&gt;,&lt;,&amp;,...等语句。

    而且,之前使用DOM4J时,没有遇到过这个问题,只是现在希望使用SAX。

    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2008/5/19 10:56:00
     
     GoogleAdSense
      
      
      等级:大一新生
      文章:1
      积分:50
      门派:无门无派
      院校:未填写
      注册:2007-01-01
    给Google AdSense发送一个短消息 把Google AdSense加入好友 查看Google AdSense的个人资料 搜索Google AdSense在『 DOM/SAX/XPath 』的所有贴子 访问Google AdSense的主页 引用回复这个贴子 回复这个贴子 查看Google AdSense的博客广告
    2024/4/28 12:58:30

    本主题贴数6,分页: [1]

    管理选项修改tag | 锁定 | 解锁 | 提升 | 删除 | 移动 | 固顶 | 总固顶 | 奖励 | 惩罚 | 发布公告
    W3C Contributing Supporter! W 3 C h i n a ( since 2003 ) 旗 下 站 点
    苏ICP备05006046号《全国人大常委会关于维护互联网安全的决定》《计算机信息网络国际联网安全保护管理办法》
    546.875ms