新书推介:《语义网技术体系》
作者:瞿裕忠,胡伟,程龚
   XML论坛     W3CHINA.ORG讨论区     计算机科学论坛     SOAChina论坛     Blog     开放翻译计划     新浪微博  
 
  • 首页
  • 登录
  • 注册
  • 软件下载
  • 资料下载
  • 核心成员
  • 帮助
  •   Add to Google

    >> 本版讨论Java, J2SE, J2ME, J2EE, 以及Eclipse, NetBeans, JBuilder等Java开发环境,还有JSP, JavaServlet, JavaBean, EJB以及struts, hibernate, spring, webwork2, Java 3D, JOGL等相关技术。
    [返回] 中文XML论坛 - 专业的XML技术讨论区计算机技术与应用『 Java/Eclipse 』 → 请教大侠,在线等 查看新帖用户列表

      发表一个新主题  发表一个新投票  回复主题  (订阅本版) 您是本帖的第 3391 个阅读者浏览上一篇主题  刷新本主题   树形显示贴子 浏览下一篇主题
     * 贴子主题: 请教大侠,在线等 举报  打印  推荐  IE收藏夹 
       本主题类别:     
     whaimar 帅哥哟,离线,有人找我吗?
      
      
      等级:大一新生
      文章:2
      积分:60
      门派:XML.ORG.CN
      注册:2004/7/15

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给whaimar发送一个短消息 把whaimar加入好友 查看whaimar的个人资料 搜索whaimar在『 Java/Eclipse 』的所有贴子 引用回复这个贴子 回复这个贴子 查看whaimar的博客楼主
    发贴心情 请教大侠,在线等

    我在写程序提取网页中的信息,统计生成xml文件.我用dom树,并用sax解吸xml
    可是一直出现org.xml.sax.SAXParseException: 非法 XML 字符:  �;。
     at org.apache.crimson.parser.InputEntity.fatal(InputEntity.java:1100)
     at org.apache.crimson.parser.InputEntity.parsedContent(InputEntity.java:593)
     at org.apache.crimson.parser.Parser2.content(Parser2.java:1826)
     at org.apache.crimson.parser.Parser2.maybeElement(Parser2.java:1507)
     at org.apache.crimson.parser.Parser2.content(Parser2.java:1779)
     at org.apache.crimson.parser.Parser2.maybeElement(Parser2.java:1507)
     at org.apache.crimson.parser.Parser2.content(Parser2.java:1779)
     at org.apache.crimson.parser.Parser2.maybeElement(Parser2.java:1507)
     at org.apache.crimson.parser.Parser2.parseInternal(Parser2.java:500)
     at org.apache.crimson.parser.Parser2.parse(Parser2.java:305)
     at org.apache.crimson.parser.XMLReaderImpl.parse(XMLReaderImpl.java:442)
     at org.apache.crimson.jaxp.DocumentBuilderImpl.parse(DocumentBuilderImpl.java:185)
     at javax.xml.parsers.DocumentBuilder.parse(DocumentBuilder.java:124)
     at cn.edu.sjtu.apex.ka.pageAnalyzer.XMLreader.OutputToXML(XMLreader.java:60)
     at cn.edu.sjtu.apex.ka.pageAnalyzer.PageAnalyzeUtil.main(PageAnalyzeUtil.java:543)
    http://www.yahoo.com/r/tris Completed!
    F:\aimar\resource\html\0\2030.html
    org.xml.sax.SAXParseException: 非法 XML 字符:  �;。
     at org.apache.crimson.parser.InputEntity.fatal(InputEntity.java:1100)
     at org.apache.crimson.parser.InputEntity.parsedContent(InputEntity.java:593)
     at org.apache.crimson.parser.Parser2.content(Parser2.java:1826)
     at org.apache.crimson.parser.Parser2.maybeElement(Parser2.java:1507)
     at org.apache.crimson.parser.Parser2.content(Parser2.java:1779)
     at org.apache.crimson.parser.Parser2.maybeElement(Parser2.java:1507)
     at org.apache.crimson.parser.Parser2.content(Parser2.java:1779)
     at org.apache.crimson.parser.Parser2.maybeElement(Parser2.java:1507)
     at org.apache.crimson.parser.Parser2.parseInternal(Parser2.java:500)
     at org.apache.crimson.parser.Parser2.parse(Parser2.java:305)
     at org.apache.crimson.parser.XMLReaderImpl.parse(XMLReaderImpl.java:442)
     at org.apache.crimson.jaxp.DocumentBuilderImpl.parse(DocumentBuilderImpl.java:185)
     at javax.xml.parsers.DocumentBuilder.parse(DocumentBuilder.java:124)
     at cn.edu.sjtu.apex.ka.pageAnalyzer.XMLreader.OutputToXML(XMLreader.java:60)
     at cn.edu.sjtu.apex.ka.pageAnalyzer.PageAnalyzeUtil.main(PageAnalyzeUtil.java:543)
    这种错误,请教大侠,这是什么错误!
    html的转义字符我都处理了
    而且,我将出错的内容重新写入一个新的xml文件,就没有错误!

       收藏   分享  
    顶(0)
      




    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2004/7/15 12:56:00
     
     mfc42d 帅哥哟,离线,有人找我吗?
      
      
      等级:大三暑假(ITELS考了6.5分!)(版主)
      文章:65
      积分:882
      门派:XML.ORG.CN
      注册:2004/6/13

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给mfc42d发送一个短消息 把mfc42d加入好友 查看mfc42d的个人资料 搜索mfc42d在『 Java/Eclipse 』的所有贴子 引用回复这个贴子 回复这个贴子 查看mfc42d的博客2
    发贴心情 
    在XML文件中被禁止使用的ASCII字符共有五个:

    &lt;  < 小于
    &gt; > 大于
    &amp; &  和
    &apos; ' 单引号
    &quot; " 双引号

    XML 文档必须使用包含编码的 XML 声明

    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2004/7/16 12:29:00
     
     whaimar 帅哥哟,离线,有人找我吗?
      
      
      等级:大一新生
      文章:2
      积分:60
      门派:XML.ORG.CN
      注册:2004/7/15

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给whaimar发送一个短消息 把whaimar加入好友 查看whaimar的个人资料 搜索whaimar在『 Java/Eclipse 』的所有贴子 引用回复这个贴子 回复这个贴子 查看whaimar的博客3
    发贴心情 
    可是我已经把所用的标点都过滤掉了啊!
    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2004/7/16 12:35:00
     
     whaimar 帅哥哟,离线,有人找我吗?
      
      
      等级:大一新生
      文章:2
      积分:60
      门派:XML.ORG.CN
      注册:2004/7/15

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给whaimar发送一个短消息 把whaimar加入好友 查看whaimar的个人资料 搜索whaimar在『 Java/Eclipse 』的所有贴子 引用回复这个贴子 回复这个贴子 查看whaimar的博客4
    发贴心情 
    而且,如果出现的是格式错误
    那么当我将同样的内容再写一遍到一个新建文件的时候,应该还是出错的
    可是结果是没有错啊
    大侠指教
    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2004/7/16 12:42:00
     
     GoogleAdSense
      
      
      等级:大一新生
      文章:1
      积分:50
      门派:无门无派
      院校:未填写
      注册:2007-01-01
    给Google AdSense发送一个短消息 把Google AdSense加入好友 查看Google AdSense的个人资料 搜索Google AdSense在『 Java/Eclipse 』的所有贴子 访问Google AdSense的主页 引用回复这个贴子 回复这个贴子 查看Google AdSense的博客广告
    2025/2/2 3:38:32

    本主题贴数4,分页: [1]

    管理选项修改tag | 锁定 | 解锁 | 提升 | 删除 | 移动 | 固顶 | 总固顶 | 奖励 | 惩罚 | 发布公告
    W3C Contributing Supporter! W 3 C h i n a ( since 2003 ) 旗 下 站 点
    苏ICP备05006046号《全国人大常委会关于维护互联网安全的决定》《计算机信息网络国际联网安全保护管理办法》
    157.227ms