卧虎藏龙
CES2019手册:中国企业出海的再思考_我的网站

一 | “今年的消费电子展,有点冷。”这句话在很多展台上都得到了认可。 就在刚刚,DeepSeek开源了一个3B模型DeepSeek-OCR。以一种时尚的方式,这是CES的冬天。其中一个数据可以反映这种变化。虽然体量不大,但模型思路创新的力度着实不小。在2018年的CES上,有1500多家中国企业参加了展会,但今年已经缩水到1200多家,跌幅约为25%。
众所周知,当前所有LLM处理长文本时都面临一个绕不开的困境:计算复杂度是平方级增长的。序列越长,算力烧得越狠。在消费电子产品开发的第一天,消费电子产品拥挤的因素很多。例如,中美之间的贸易问题还没有完全解决。
于是,DeepSeek团队想到了一个好办法。

二 | 华为和中兴已经使许多企业采取了更加观望的态度。

三 | 中国对美国签证申请人政策的收紧,导致许多企业放弃或失去了参加展会的机会。

四 | 当然,一些国内企业在2018年生存不好,会主动放弃参展机会。当然,中国企业仍然是2019年消费电子产品展的主力军。一位第八次参加CES的参展商说,在这段时间里,在拉斯维加斯的街道上,除了英语之外,最常听到的语言是汉语,其次是韩语和日语。他并不夸张,这在一定程度上代表了世界科学技术发展的趋势。无论是在互联网上还是在互联网上,中美两国都仍然处在金字塔的顶端。苹果没有参与消费电子展,但苹果元素无处不在;腾讯等中国互联网巨头也是如此。

五 | 既然一张图能包含大量文字信息,而且用的Token还少,那不如直接把文本转成图像?这就是所谓的“光学压缩”——用视觉模态来给文本信息“瘦身”。
而OCR正好天然适合验证这个思路,因为它本身就是在做“视觉→文本”的转换,而且效果还能量化评估。

六 | _苹果在韩国CES会场外的壁挂广告主要由LG、三星等大型IT企业主导;日本主要集中在索尼、松下、雅马哈、丰田等企业,但也有相当大的阵容。
论文显示,DeepSeek-OCR的压缩率能达到10倍,OCR准确率还能保持在97%以上。

七 | 中国、美国、日本和韩国也是参加CES的主要媒体,更多的记者来自印度。拉斯维加斯理性与感性的融合一直是拉斯维加斯特有的存在。它的“赌城”享誉世界。博彩业和娱乐业都很发达。席琳·迪翁、大卫·科波菲尔和其他明星在这里有特别的表演。

八 | 此外,还有火山表演、奇幻表演等。拉斯维加斯的黄昏也是由于CES的到来,技术元素开始融入这个地方。
啥意思呢?就是说,原本需要1000个文本Token才能表达的内容,现在只用100个视觉Token就搞定了。似乎娱乐、赌博和科技都与彼此无关。

九 | 即使压缩率拉到20倍,准确率也还有60%左右,整体效果相当能打。
OmniDocBench基准测试结果显示:
只用100个视觉Token,就超过了GOT-OCR2.0(每页256个Token)的表现;
用不到800个视觉Token,干翻了MinerU2.0(平均每页超过6000个Token)。
在实际生产中,一块A100-40G显卡就能每天生成超过20万页的LLM/VLM训练数据。20个节点(160块A100)直接飙到每天3300万页。
DeepSeek-OCR由两个核心组件组成:
DeepEncoder(编码器):负责图像特征提取和压缩;
DeepSeek3B-MoE(解码器):负责从压缩后的视觉Token中重建文本。这就像是感性和理性之间的冲突。
让我们来重点说说DeepEncoder这个引擎。
它的架构很巧妙,通过把SAM-base(8000万参数)和CLIP-large(3亿参数)串联起来,前者负责“窗口注意力”提取视觉特征,后者负责“全局注意力”理解整体信息。但是在日常生活中,科学技术的元素无处不在。虽然整个拉斯维加斯城市很小,在长条地带,酒店、娱乐场所等专业,相当于中国的城市中心,高层建筑,但与旧城只有一条街之遥。由于公共交通的缺乏和出租车的高昂价格,优步和Lyft已经成为流行的出行方式。

十 | 如果你幸运的话,你甚至可以享受梅赛德斯-奔驰E级轿车、特斯拉X型轿车、宝马640,这些在中国是无法想象的。在CES的第一天天气很好。宝马提供了一个户外体验的试车场地。
中间还加了个16×卷积压缩器,在进入全局注意力层之前把Token数量大幅砍掉。
举例而言,一张1024×1024的图像,会被切成4096个patch token。此外,在拉斯维加斯还有一种特殊的旅行方式。

十一 | 但经过压缩器处理后,进入全局注意力层的Token数量会大幅减少。用户可以呼叫无人驾驶宝马汽车旅行。
这样的好处是,既保证了处理高分辨率输入的能力,又控制住了激活内存的开销。
而且DeepEncoder还支持多分辨率输入,从512×512的Tiny模式(64个Token)到1280×1280的Large模式(400个Token),一个模型全搞定。

十二 | 这些宝马汽车有X5530640和其他型号。一方面,他们积累了无人驾驶的研究数据,另一方面,他们也促使用户逐渐接受自动驾驶和无人驾驶技术。

十三 | 当然,万一有人突然介入,司机仍坐在驾驶座上。

十四 |
目前开源版本支持的模式包括原生分辨率的Tiny、Small、Base、Large四档,还有动态分辨率的Gundam模式,灵活性拉满。在消费电子展期间,每个人都很忙,不管是星巴克咖啡店的职员还是餐馆的服务员,但他们仍然坚持工作时间。

十五 | 除了Uber和Lyft司机外,他们还将工作更长的时间来获得更多的工资。
解码器用的是DeepSeek-3B-MoE架构。在消费电子展期间,拉斯维加斯的赌博活动一天24小时。
别看只有3B参数,但采用了MoE(混合专家)设计——64个专家中激活6个,再加2个共享专家,实际激活参数约5.7亿。与繁忙的场地不同,他遇到了一个超级司机,他是苹果的忠实粉丝。这也让模型既有30亿参数模型的表达能力,又保持了5亿参数模型的推理效率。他说,在CES期间,他每天把工作时间延长一小时,因为他真的很忙,但他可以多挣120美元。拉斯维加斯也是一个非常昂贵的城市。
解码器的任务就是从压缩后的视觉Token中重建出原始文本,这个过程可以通过OCR风格的训练被紧凑型语言模型有效学习。
数据方面,DeepSeek团队也是下了血本。例如,星巴克以6.5美元的价格出售一大块摩卡咖啡,这在中国几乎相当于35元人民币。但是牛角面包的售价是5.5美元,在中国大约是18元人民币,只相当于拉斯维加斯价格的一半。

十六 | 此外,在这里购买任何东西时,消费者将清楚地知道他们必须缴纳多少税款。
从互联网收集了3000万页多语言PDF数据,涵盖约100种语言,其中中英文占2500万页。
数据分两类:粗标注直接用fitz从PDF提取,主要训练少数语言的识别能力;精标注用PP-DocLayout、MinerU、GOT-OCR2.0等模型生成,包含检测与识别交织的高质量数据。

十七 |
对于少数语言,团队还搞了个“模型飞轮”机制——先用有跨语言泛化能力的版面分析模型做检测,再用fitz生成的数据训练GOT-OCR2.0,然后用训练好的模型反过来标注更多数据,循环往复最终生成了60万条样本。
此外还有300万条Word文档数据,主要提升公式识别和HTML表格解析能力。
场景OCR方面,从LAION和Wukong数据集收集图像,用PaddleOCR标注,中英文各1000万条样本。
DeepSeek-OCR不仅能识别文字,还具备“深度解析”能力,只需一个统一的提示词,就能对各种复杂图像进行结构化提取:
图表:金融研究报告中的图表可以直接提取为结构化数据;
化学结构式:识别并转换为SMILES格式;
几何图形:对平面几何图形进行复制和结构化解析;
自然图像:生成密集描述(dense captions)。
这在STEM领域的应用潜力巨大,尤其是化学、物理、数学等需要处理大量符号和图形的场景。著名的“无线”杂志也卖咖啡。
第一作者Haoran Wei此前曾供职于阶跃星辰,期间发布并开源了GOT-OCR2.0系统
值得注意的是,DeepSeek团队在论文里还提出了一个脑洞大开的想法——用光学压缩模拟人类的遗忘机制。

十八 | CES不是中国制造商的故乡。

十九 | 今年的CES并不是中国制造商的故乡。

|
人类的记忆会随时间衰退,越久远的事情记得越模糊。与高峰时期不同的是,包括华为、小米、TCL、海信和联想在内的中国制造商喜欢在这里举行盛大的新产品发布会。尽管到处都是广告,但中国制造商显然并不那么兴奋,华为今年只在CES上设立了一个展位。联想召开新产品发布会,推出PC和SIOT等10多个新产品,但规模非常小。DeepSeek团队想,那能不能让AI也这样?于是,他们的方案是:
1. 把超过第k轮的历史对话内容渲染成图像;
2. 初步压缩,实现约10倍的Token减少;
3. 对于更久远的上下文,继续缩小图像尺寸;
4. 随着图像越来越小,内容也越来越模糊,最终达到“文本遗忘”的效果。
这就很像人类记忆的衰退曲线,近期信息保持高保真度,久远记忆自然淡化。
虽然这还是个早期研究方向,但如果真能实现,对于处理超长上下文将是个巨大突破——近期上下文保持高分辨率,历史上下文占用更少计算资源,理论上可以支撑“无限上下文”。
简言之,DeepSeek-OCR表面上是个OCR模型,但实际上是在探索一个更宏大的命题:能否用视觉模态作为LLM文本信息处理的高效压缩媒介?
初步答案是肯定的,7—20倍的Token压缩能力已经展现出来了。联想对此的解释是“这只是一个预发布”。
当然,团队也承认这只是个开始。

| 单纯的OCR还不足以完全验证“上下文光学压缩”,后续还计划开展数字–光学文本交替预训练、“大海捞针”式测试,以及其他系统性评估。
不过不管怎么说,这在VLM和LLM的进化路上,又多了一条新赛道。

| TCL仍因分拆而深陷困境。不接受最早的计划。TCL集团董事长李东生原定出席CES并接受媒体采访,但由于与股东会的冲突,也取消了此次行程。然而,中国制造商仍有一些亮点参与展览。代表团第一次参加了CES,主要展示无人驾驶配送车;第一次,运动社交平台Keep作为智能运动手镯出现;第一次,优比选择成为一个比较关注的企业,向外界展示第二代仿人机器人步行机。
去年这个时候,大家还在卷怎么让模型“记得更多”。每一次示威都受到旁观者的欢迎。今年DeepSeek直接反其道行之,不如让模型学会“忘掉一些”。
确然,AI的进化,有时候不是做加法,而是做减法。

| 小而美,也能玩出大花样,DeepSeek-OCR这个3B小模型就是最好的证明。
GitHub主页:http://github.com/deepseek-ai/DeepSeek-OCR
论文地址:https://github.com/deepseek-ai/DeepSeek-OCR/blob/main/DeepSeek\_OCR\_paper.pdf
模型下载:https://huggingface.co/deepseek-ai/DeepSeek-OCR
本文来自微信公众号:APPSO (ID:appsolution)。_美国代表团第一次参加CES带来新一代无人分配显示器_您必须选择仿人机器人步行机。今年,京东在消费电子展上引起了极大的关注。它不仅具有无人驾驶的分销能力,而且还承接了一批车身广告,引起了人们的极大关注。刘强东在明尼阿波利斯性侵犯丑闻中的涉案,引起了中美两国的广泛关注。

| 但对于中国企业来说,这可能是一个转折点。无论是在巴塞罗那(世界移动通信大会)举办的CES或MWC,中国企业都逐渐成为主要参与者,这主要是由于它们对国际化的需求。这些展览也成了橱窗。

| 联想集团董事长兼首席执行官杨元庆在接受采访时回顾了联想的出国历史,虽然联想受到了人们的批评,但联想在国际化方面做得很好。

| 在接受媒体采访时,联想集团创始人兼首席执行官杨元庆也谈到了联想国际化的经验。

| 联想最早开始是经销商,后来涉足产品设计、研发,建立了自己的品牌,但早期的联想只是在国内市场。后来,联想对国际化有两种看法:一种是用自己的能力扩张,另一种是通过并购国际化,最终收购了IBM的PC业务,成功整合后开辟了国际化的道路。如今,联想在海外的收入超过50%,并在罗利、美国和欧洲建立了研发中心和数据业务中心。以联想为代表的中国企业正处于中国企业国际化1.0时代。

| 在2.0时代,越来越多的中国企业通过商业合作和资产收购进入发展中的市场,如印度、东南亚、中东等。真正的国际化不是为了跑去一个国家做生意和赚钱。

| 这是为了真正扎根我们自己的国家,融入我们当地的生活。

| ”酷睿集团首席执行官蒋超在接受凤凰科技(Phoenix Technologies)采访时表示,华为和中兴是中国企业思考国际化新方式的转折点。他的观点也得到了COVOS副主席大卫的赞同。

| 他以肯德基为例。

| 这家全球性公司值得向所有想国际化的中国公司学习。以中国肯德基为例,他们雇佣当地员工,开发出具有地方特色的食品,如老北京鸡卷和蔬菜汤。在中国的许多肯德基餐厅里,你可以看到祖父母和孙子孙女正在吃饭,这表明肯德基的本地化做得很好。

| 另一个新汽车制造商巴顿在CES宣布其生产计划的例子是苹果。大卫认为,苹果目前在中国市场的困境实际上是其本土化战略回归的反映,这主要是由于定价战略脱离了当地市场的判断,所以苹果一直是中国消费者眼中的美国公司,是一个纯粹的竞争对手。与华为、Oppo等中国公司建立了积极的合作关系。在目前的情况下,苹果的销量自然会下降。中美之间的贸易问题也促使中国企业思考这个问题——通过更全面的国际化来避免可能的未来风险。姜超告诉凤凰科技(伟信搜索ifeng),酷集团目前在美国的团队完全由当地人组成,也通过融资改变了美国子公司的股权结构,使美国资本占到了51%以上的股权。

| 科沃斯也有这样的计划,目前25%的收入来自海外市场,75%来自中国。车展也是中国企业认识到自身差异的舞台(如日产无人驾驶概念车)。在经济学中,有一种观点认为“底部反弹”。CES一直是中国企业追求的舞台。

| 在其巅峰时期,“超过1500家企业来自中国,中国人几乎无处不在。”大卫说,CES虽然有点冷,但也是中国企业停止思考未来趋势,实现更好发展的一个机会。危机不仅仅是“危险”,更是“机遇”。这对消费电子产品尤其是中国企业来说是如此。

|
Current article:http://juk2vsx.chuanshaonianmokuanchouzhei.sbs/list_4t38fb/cg5.html
Published on:11:40:19