Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
AlexNet-经典神经网络论文阅读记录及复现1_创想鸟

AlexNet-经典神经网络论文阅读记录及复现1

本文记录《ImageNet Classification with Deep Convolutional Neural Networks》论文阅读及AlexNet复现。汇总了top-1/top-5错误率、卷积运算、ReLU、局部响应归一化等知识点,并用PaddlePaddle复现该网络,其含5个卷积层和3个全连接层,还介绍了网络结构与参数情况。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

alexnet-经典神经网络论文阅读记录及复现1 - 创想鸟

AlexNet-经典神经网络论文阅读记录及复现

一、论文中涉及的“小知识点”汇总:

1、top-1 and top-5 error rates.

top-1 and top-5 error rates 是ImageNet图像分类大赛的两个评价标准。 首先介绍一下top-1 error rates。神经网络模型应用于图像分类中,最后的softmax层对应的相应类别会输出不同的概率,我们取最大的概率为模型输出的分类结果,即为该模型预测的分类类别。先看top-1 error rates的公式:Top-1 = (正确标记与模型输出的标记不同的样本) / 总样本。 #换句话说,就是:预测错误的样本 / 总样本(也就是预测错误率)。这里也就体现了“error”的意义。对于Top-5:Top-5 = (正确标记不在模型输出的前五个最佳标记中的样本) / 总样本。#详细的解释:对于一张图片,输入AlexNet网络模型中,该网络设计的最后一层softmax有一千个输出(即一千个类别),所以有一千个概率输出。将这一千个概率从大到小进行排序,取前五个概率,如果输入的图片类别属于这前五个类别中的一个,则不计入Top-5公式的分子当中。

2、2D convolution and computation.

 卷积运算,一种特征提取方法。通过卷积运算,可以将图像的特征进行抽象,它提高了特征提取的能力。所以,如果从一种直观感觉这一角度去理解卷积神经网络为什么会在图像领域收到一个很好的效果,相比于只有全连接层的神经网络。我觉得正是卷积层的加入,使得这一网络具有“高层语义”的表达能力。

AlexNet-经典神经网络论文阅读记录及复现1 - 创想鸟

3、神经网络的“神秘性”

 我在这里写的“神秘性”的意思是,主要是我个人的理解(也可以认为我在瞎扯淡)。 在这篇论文Introduction部分的第四段中有这样一句话:Our final network contains five convolutional and three fully-connected layers, and this depth seems to be important: we found that removing any convolutional layer(each of which contains no more than 1% of the model's parameters)resulted in inferior performance.它的意思是说,在AlexNet网络中,如果去除掉任意一个卷积层(尽管每个卷积层所含的参数量还不到整个网络参数量的百分之一)都会是整个网络的表现下降。我觉得这是一件很有意思的事情,因为你无法知道为什么会这样,就像在论文Visualizing and Understanding Convolutional Networks中提到的那样:There is no clear understanding of why they perform so well, or how they might be improved. 似乎并没有严格的数学证明来证明它,我觉得这使得它同时兼具理性和感性的魅力。这也是神经网络最吸引我的地方。

4、ReLU Nonlinearity.

类似于生物的神经元的激活,人工神经网络的神经元的激活也是一样的道理,只有当这一刺激达到一定程度,我们的神经元才会做出一定的反应,不然,它是不会做出任何反应的。为了模拟这一生物过程,相应的,我们需要一定的方法,引入一定的概念,才能对这一过程进行模拟。于是激活函数这一概念便被引入进来,用相应的数学方法来完成对这一过程的模拟。另外,如果不使用激活函数,就相当于激活函数是fx = x,也就是说上一层与下一层之间是线性关系,那么再多层的这种线性关系就相当于是一层的线性关系。那么这样,网络的逼近能力也就非常的有限了。

下面是各种不同的激活函数:

sigmoid:

AlexNet-经典神经网络论文阅读记录及复现1 - 创想鸟

tanh:

AlexNet-经典神经网络论文阅读记录及复现1 - 创想鸟

ReLU:

AlexNet-经典神经网络论文阅读记录及复现1 - 创想鸟

ELU:

AlexNet-经典神经网络论文阅读记录及复现1 - 创想鸟

softmax:

AlexNet-经典神经网络论文阅读记录及复现1 - 创想鸟

5、Back-propagation:

反向传播和误差反向传播有着相同的思想:将“关系”从末端传递到头部。只是通过不同的“关系”表达的而已。

反向传播算法: AlexNet-经典神经网络论文阅读记录及复现1 - 创想鸟

误差反向传播中,误差的定义:

AlexNet-经典神经网络论文阅读记录及复现1 - 创想鸟

误差反向传播算法:

AlexNet-经典神经网络论文阅读记录及复现1 - 创想鸟AlexNet-经典神经网络论文阅读记录及复现1 - 创想鸟AlexNet-经典神经网络论文阅读记录及复现1 - 创想鸟

6、Multiple GPUs training:

将卷积神经网络中的运算平均拆分到两个GPU上。

7、Local Response Normalization.(局部响应归一化)

局部响应归一化(LRN)是一种竞争机制,对局部神经元活动创建的竞争机制。通过局部响应归一化,使其中响应较大的神经元活动更剧烈,并抑制其它反馈较小的神经元,增强了模型的泛化能力。

8、Overlapping pooling.

所谓的“重叠池化”,简而言之,就是filter size > strides。

9、Reducing Overfitting.(with Data Augmentation and Dropout )

该篇论文中减小过拟合的两个方法就是数据增强和“Dropout”方法。 论文中介绍了两种数据增强的方法,这里稍微记录一下第二种:(PCA主成分分析方法,一种使用广泛的数据降维方法。)AlexNet-经典神经网络论文阅读记录及复现1 - 创想鸟

In [ ]

#首先,设置环境:import paddleimport paddle.nn as nnimport paddle.nn.functional as Ffrom paddle.io import Dataset, BatchSampler, DataLoaderfrom paddle.vision.transforms import ToTensorimport numpy as np#使用paddlepaddle搭建搭建AlexNet:in_channels = 3#conv_filter_numsfilter_nums1 = 96filter_nums2 = 256filter_nums3 = 384#convcsize1 = 11csize2 = 5csize3 = 3cstride1 = 4cstride2 = 1#Maxpooling pstride = 2psize = 3  #this is what was called overlapping pooling.#MaxPool3D(kernel_size, stride=None, padding=0)#Conv3D(in_channels, out_channels, kernel_size, stride=1, padding=0, dilation=1, groups=1, padding_mode='zeros')class AlexNet(paddle.nn.Layer):    def __init__(self, num_classes):          super(AlexNet, self).__init__()          self.conv1 = nn.Conv2D(in_channels, filter_nums1, (csize1, csize1), cstride1, padding = 1)          self.pool1 = nn.MaxPool2D(psize, pstride, padding = 2)                  self.conv2 = nn.Conv2D(filter_nums1, filter_nums2, (csize2, csize2), cstride2, padding = 2)          self.pool2 = nn.MaxPool2D(psize, pstride, padding = 0)          self.conv3 = nn.Conv2D(filter_nums2, filter_nums3, (csize3, csize3), cstride2, padding = 1)          self.conv4 = nn.Conv2D(filter_nums3, filter_nums3, (csize3, csize3), cstride2, padding = 1)          self.conv5= nn.Conv2D(filter_nums3, filter_nums2, (csize3, csize3), cstride2, padding = 1)          self.pool5 = nn.MaxPool2D(psize, pstride, padding = 0)          self.flatten = nn.Flatten()          self.fclayer1 = nn.Linear(9216, 4096)          self.fclayer2 = nn.Linear(4096, 4096)          self.fclayer3 = nn.Linear(4096, num_classes)          self.lrn = nn.LocalResponseNorm(size=96) #tatal channels? what is that mean?          self.relu = nn.ReLU()          self.dropout = nn.Dropout(p = 0.5)          self.softmax = nn.Softmax()    def forward(self, in_data):          out_data = self.conv1(in_data)          out_data1 = self.lrn(out_data)          out_data1 = self.relu(out_data1)          out_data1 = self.pool1(out_data1)          out_data1 = self.conv2(out_data1)          out_data1 = self.relu(out_data1)          out_data1 = self.pool2(out_data1)          out_data1 = self.conv3(out_data1)          out_data1 = self.relu(out_data1)          out_data1 = self.conv4(out_data1)          out_data1 = self.relu(out_data1)          out_data1 = self.conv5(out_data1)          out_data1 = self.relu(out_data1)          out_data1 = self.pool5(out_data1)          out_data1 = self.flatten(out_data1)          out_data1 = self.dropout(out_data1)          out_data1 = self.fclayer1(out_data1)          out_data1 = self.dropout(out_data1)          out_data1 = self.fclayer2(out_data1)          out_data1 = self.fclayer3(out_data1)          out_data1 = self.softmax(out_data1)          return out_data1model = paddle.Model(AlexNet(1000))model.summary((64, 3, 224, 224))
-------------------------------------------------------------------------------   Layer (type)         Input Shape          Output Shape         Param #    ===============================================================================     Conv2D-6       [[64, 3, 224, 224]]    [64, 96, 54, 54]       34,944     LocalResponseNorm-2  [[64, 96, 54, 54]]    [64, 96, 54, 54]          0             ReLU-2        [[64, 256, 13, 13]]   [64, 256, 13, 13]          0           MaxPool2D-4      [[64, 96, 54, 54]]    [64, 96, 28, 28]          0            Conv2D-7        [[64, 96, 28, 28]]   [64, 256, 28, 28]       614,656        MaxPool2D-5     [[64, 256, 28, 28]]   [64, 256, 13, 13]          0            Conv2D-8       [[64, 256, 13, 13]]   [64, 384, 13, 13]       885,120         Conv2D-9       [[64, 384, 13, 13]]   [64, 384, 13, 13]      1,327,488        Conv2D-10      [[64, 384, 13, 13]]   [64, 256, 13, 13]       884,992        MaxPool2D-6     [[64, 256, 13, 13]]    [64, 256, 6, 6]           0            Flatten-3       [[64, 256, 6, 6]]        [64, 9216]             0            Dropout-2          [[64, 4096]]          [64, 4096]             0            Linear-4           [[64, 9216]]          [64, 4096]        37,752,832        Linear-5           [[64, 4096]]          [64, 4096]        16,781,312        Linear-6           [[64, 4096]]          [64, 1000]         4,097,000        Softmax-2          [[64, 1000]]          [64, 1000]             0       ===============================================================================Total params: 62,378,344Trainable params: 62,378,344Non-trainable params: 0-------------------------------------------------------------------------------Input size (MB): 36.75Forward/backward pass size (MB): 550.85Params size (MB): 237.95Estimated Total Size (MB): 825.56-------------------------------------------------------------------------------
{'total_params': 62378344, 'trainable_params': 62378344}

以上就是AlexNet-经典神经网络论文阅读记录及复现1的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/45872.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
win10激活状态怎么查看
上一篇 2025年11月7日 15:22:24
Linux修改用户密码的常见方法
下一篇 2025年11月7日 15:22:31

相关推荐

  • CanvaPro中AI生成图片如何导出为PDF?快速保存图像的方法

    在Canva Pro中导出AI生成图片为PDF,需先将图片添加至设计,点击“分享”→“下载”→选择“PDF标准”或“PDF打印”即可。2. PDF标准适用于在线分享,文件小、加载快;PDF打印适用于高质量印刷,支持300 DPI和CMYK色彩模式,确保色彩准确与细节清晰。3. 为保证AI图片导出质量…

    2026年9月22日
    100
  • Laravel 文件上传:解决数据库存储物理路径而非可访问 URL 的问题

    本教程旨在解决 laravel 文件上传后,数据库中存储文件物理路径而非可访问 url 的常见问题。通过分析 move() 方法的返回值,并引入 url() 辅助函数,我们将演示如何正确地将文件移动到指定目录,同时确保数据库记录的是可供前端访问的图片资源链接,从而避免图片无法正常显示。 在 Lara…

    2026年9月22日
    000
  • windows怎么更改计算机工作组_Windows计算机工作组修改方法

    首先通过系统属性修改工作组名称,右键“此电脑”选择属性,进入高级系统设置的计算机名选项卡进行更改并重启;其次可用管理员命令提示符执行wmic命令批量配置,输入指定命令后重启生效;最后专业版用户可通过组策略编辑器,在启动脚本中添加指令实现自动加入工作组。 如果您需要将Windows计算机加入或更改到特…

    2026年9月22日
    000
  • 机械键盘轴体深度手感分析:线性轴、段落轴与提前段落轴

    机械键盘手感取决于轴体类型,主流分为线性轴、段落轴和提前段落轴。线性轴直上直下顺滑连贯,代表如Cherry MX Red,适合游戏与快速输入;段落轴中程有明显阻力峰,提供清晰反馈,如Cherry MX Blue,适合文字工作;提前段落轴起步阻力大随后变轻,如TTC Gold Pink,防误触且节奏独…

    2026年9月22日
    000
  • 实现Java双向路径搜索的正确方法

    本文旨在帮助开发者理解并正确实现Java中的双向路径搜索算法。通过分析常见的实现错误,我们将提供一种清晰、可行的解决方案,并详细解释如何构建完整的路径,克服单向搜索树的局限性,从而实现从起点到终点的完整路径搜索。 双向路径搜索是一种优化路径搜索效率的策略,它同时从起点和终点开始搜索,并在中间相遇。然…

    2026年9月22日
    900
  • 抖音达人橱窗账号怎么起号的?抖音橱窗在哪里

    越来越多的达人纷纷入驻,希望通过橱窗账号实现变现。如何起号、运营,才能在众多达人中脱颖而出,成为爆款呢?本文将从以下几个方面为您解析抖音达人橱窗账号起号攻略。 一、关键词选择与定位 1. 关键词选择 关键词是抖音达人橱窗账号的核心,它决定了你的内容方向和受众群体。以下是一些建议: (1)关注热点:紧…

    2026年9月22日
    000
  • VSCode设置Markdown写作环境(实用技巧,排版美化指南)

    要在vscode里打造舒服又高效的markdown写作环境,答案是通过安装核心扩展并进行个性化配置来实现;需安装markdown all in one、markdown preview enhanced、prettier和paste image等扩展,结合settings.json中的编辑器设置、自…

    2026年9月22日
    100
  • 如何用Filmora制作高质量AI视频?简易AI视频剪辑的实用指南

    如何用Filmora制作高质量AI视频?简易AI视频剪辑的实用指南如何用Filmora制作高质量AI视频?简易AI视频剪辑的实用指南如何用Filmora制作高质量AI视频?简易AI视频剪辑的实用指南如何用Filmora制作高质量AI视频?简易AI视频剪辑的实用指南

    Filmora的AI功能通过AI Copilot脚本生成、AI文本转视频、AI语音、图像生成、智能抠像及音频优化等工具,显著提升视频制作效率与专业度,尤其在视觉处理、听觉优化和创意辅助方面表现突出;关键在于将AI作为辅助起点,避免过度依赖,结合人工精修,才能实现高质量AI视频创作。 ☞☞☞AI 智能…

    2026年9月22日 用户投稿
    400
  • 好用的终端复用神器-Tmux

    好用的终端复用神器-Tmux好用的终端复用神器-Tmux好用的终端复用神器-Tmux好用的终端复用神器-Tmux

    前言 许久之前就听说过tmux,但是一直没上手,直到最近需要一直在linux下完成一些任务,我才切实感受到了tmux的优点:任意分屏、保存工作 就单单这两点,就足够实用了。分屏,曾今还十分痴迷i3wm和dwm这样的窗口管理工具,尤其是dwm的操作逻辑,大大提升linux工作效率。其他详情可以查看阮一…

    2026年9月22日 用户投稿
    100
  • 星纪魅族万志强回应魅族22影像升级:10月还会有OTA

    10月13日,星纪魅族集团中国区cmo万志强就用户对魅族22手机影像表现的积极评价作出回应。他表示,本月还将推送新一轮ota更新,届时魅族22的影像性能有望再次提升。 魅族22 据CNMO消息,有用户反馈称:尽管魅族22在发布时拍照能力并非顶尖,但通过数月的系统优化,其影像水准已达到主流旗舰机型80…

    2026年9月22日
    000
  • 如何在DaVinciResolve中制作AI视频?教你利用AI工具优化视频流程

    如何在DaVinciResolve中制作AI视频?教你利用AI工具优化视频流程如何在DaVinciResolve中制作AI视频?教你利用AI工具优化视频流程如何在DaVinciResolve中制作AI视频?教你利用AI工具优化视频流程如何在DaVinciResolve中制作AI视频?教你利用AI工具优化视频流程

    达芬奇Resolve并非一键生成AI视频的%ignore_a_1%,而是通过内置AI功能与外部AI服务协同,提升视频制作效率。其核心在于利用Neural Engine驱动的智能工具,如Magic Mask实现精准抠像、Voice Isolation分离人声、Smart Reframe适配多平台构图、…

    2026年9月22日 用户投稿
    700
  • 蔡司 2 亿影像王牌登场!vivo X300 Pro 拍巨片,巨出片!

    蔡司 2 亿影像王牌登场!vivo X300 Pro 拍巨片,巨出片!蔡司 2 亿影像王牌登场!vivo X300 Pro 拍巨片,巨出片!蔡司 2 亿影像王牌登场!vivo X300 Pro 拍巨片,巨出片!蔡司 2 亿影像王牌登场!vivo X300 Pro 拍巨片,巨出片!

    在手机影像技术竞争愈发白热化的当下,vivo x300 pro 以“蔡司 2 亿影像王牌”之名强势亮相。其核心亮点莫过于搭载的蔡司 2 亿像素影像系统,相较传统多摄组合实现了显著跃升。面对用户日益多元的需求——远摄、微距、视频创作样样都想兼顾,这套系统真正做到了“全都要”。起售价为 5299 元,这…

    2026年9月22日 用户投稿
    000
  • Java项目类路径管理:引用与实现外部.class文件定义的接口

    在Java项目中引用并实现由.class文件定义的接口,核心在于正确配置Java的类路径(Classpath)。本文将详细介绍类路径的概念、其重要性,以及如何在命令行和集成开发环境(IDE)中有效地设置类路径,确保编译器和JVM能够找到所需的.class文件,从而成功编译和运行包含外部接口实现的代码…

    2026年9月22日
    000
  • VSCode一键配置Rust:中文文档、语法高亮、Cargo集成

    安装Rust Analyzer扩展是VS Code配置Rust开发环境的核心,它提供语法高亮、智能补全、错误提示、定义跳转、Cargo集成等功能,并通过本地中文文档组件支持中文提示,实现开箱即用的高效开发体验。 VS Code配置Rust开发环境,尤其是要兼顾中文文档、语法高亮和Cargo项目管理,…

    2026年9月22日
    100
  • Pictory的AI混合工具如何使用?快速将文本转为视频的实用指南

    Pictory的AI混合工具核心优势在于高效与定制化平衡,能快速将文本转为视频,通过智能识别内容匹配素材、音乐和配音,大幅缩短制作周期;其人机协作模式允许用户优化AI生成结果,结合免版税素材库解决版权问题,提升创作自由度与专业度。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用…

    2026年9月22日
    000
  • Gradle中控制JAR包生成:理解jar.enabled配置

    本文深入探讨Gradle构建脚本中jar.enabled配置项的作用。它用于控制是否生成项目的默认JAR包。当设置为false时,Gradle将跳过标准的JAR包创建任务,这在项目需要生成其他类型的归档文件或作为多模块项目中的非独立组件时非常有用。理解此配置有助于优化构建过程和管理项目输出。 JAR…

    2026年9月22日
    100
  • 影目INMO获中国移动创新大奖,10.16发布会AI+AR生态要搞“大动作”?

    2025年中国移动全球合作伙伴大会在广州圆满落幕,影目科技作为智能眼镜领域的领军企业受邀出席,并荣膺“终端创新贡献合作伙伴”殊荣。作为中国移动在ai+ar终端生态中的关键战略伙伴,影目科技正携手中国移动共同推进ai智能眼镜在中国市场的规模化落地,助力打造“ai+万物互联”的智慧新生态。此次获奖恰逢影…

    2026年9月22日
    000
  • 动手实验+源码分析,彻底弄懂 Linux 网络命名空间

    动手实验+源码分析,彻底弄懂 Linux 网络命名空间动手实验+源码分析,彻底弄懂 Linux 网络命名空间动手实验+源码分析,彻底弄懂 Linux 网络命名空间动手实验+源码分析,彻底弄懂 Linux 网络命名空间

    大家好,我是飞哥! 在 Linux 上通过 veth 我们可以创建出许多的虚拟设备。通过 Bridge 模拟以太网交换机的方式可以让这些网络设备之间进行通信。不过虚拟化中还有很重要的一步,那就是隔离。借用 Docker 的概念来说,那就是不能让 A 容器用到 B 容器的设备,甚至连看一眼都不可以。只…

    2026年9月22日 用户投稿
    000
  • VSCode安装C/C++插件 小白必备VSCode配置C语言教程

    安装C/C++插件并配置MinGW编译器,通过tasks.json和launch.json文件设置编译调试任务,可使VSCode支持C语言开发;若插件异常,需检查环境变量、文件路径及语法,必要时重启或重装;中文乱码可通过设置UTF-8编码、使用集成终端或程序内setlocale解决;远程开发需配合R…

    2026年9月22日
    000
  • 在Java中如何格式化输出日期与时间

    推荐使用Java 8的DateTimeFormatter格式化日期时间,配合LocalDateTime或ZonedDateTime实现安全高效输出,如yyyy-MM-dd HH:mm:ss;2. 传统SimpleDateFormat非线程安全,适用于旧版本。 在Java中格式化输出日期与时间,常用的…

    2026年9月22日
    200

发表回复

登录后才能评论
关注微信