/
Автор: Naykin S.
Теги: deep learning redes neurais inteligência artificial aprendizado de máquina algoritmos
Год: 2008
Текст
SIMON HAYKIN
Redes
Neurais
Principios e prática
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
SIMON HAYKIN
McManter Ufiiversify
ilnntiilo/), Onfáríü, Cíinculü
""" Redes
Neurais
Principios e prática
Traducán:
Paulo Mari iris Engrl
Domar et» EageufwútEt&rica pela Tecfmischf Umwsiíüt MíímIwn, AIwmkím
Púx-Dfntturadu tftíi Rcdtfs Ntítniis fvkt Tci/ittrath^ fíí¡chsftlt!t!. DüHnitttíilt Altfítíifíhtt
Prüfexur/F tit> inslimtü de Infar/ttatica da Uf-üírS
Reimpressao 2Ü0S
200]
Obi j orí;.1 iiluí mente publicada scih 0 lítulu
Ne itraf /tfiworicf: <t frNttpreherixive fámdaiitm, 2/E
C 1999. Pretil ice Hall. Ine.
Public adu tín língua portuguesa cujifimite tenido 001M a Predice Hall. Inc., urna empresa Pearscm Educatíon
ÍSBN 0-13-27335(1-1
Cipa: Máritt Rshneít
Preparuv¡k> du urigiuu]: Dnflitl GtOSSi
Super villa editorial: Aryxinhtt JtHifitfx Afftwi.w
Edi trsra^ ¡hi eletrémica; i^íxer Hfmxe -fíf-p.aj'.
O uulcr e O editor emprctnderam os seus melhorrs euforias na prepamQst) dcstc livno.
Estes eífoi\Tus incluem. o desenvoh imrnki, a pesquisa c o- teste das teorías e programas para de1crTTi¡n¡ir
a sua e íicjénuiu. O autor e n editor nün dan garantías de qualqucr tipo.explícitas <mi implícitas,eill relaja
a estífi programas ou a documentarán rimtidu neste livro. (} autor e o editor náo SC vespotnsatMÜzam
por daños ewmtiuis ou conscqiiéncias cm concxáo coin.au que surjani do famecimetiiu.
dcMrmpeüho uu uso desees programas.
Reservada^ l?do4 os direitos de publica^- Líneuu portuguesa, j
ARTMED* EDITORA S. A.
(B00KMAN* CÜMPANHIA EDITORA ¿ urna dh isao da ARTMED1 EDITORA S A.)
Av. Jerónimo de Ornelas, fi-70 Santana
90040-34A Porto Aleare RS
Fone {51: 3027-700(1 F^x (51) 3(127-7070
É. pniibida a Liiiplica^jo ou neprodu, .10 íle^c volume, i>> lüdo OU em parte, sub quaisquer
forrrtíts ou por quaisquer me ios t ekttóídt». mecánico, gravs^ao, fotocopia, dislribui^áo mi
Web e uniros), sem permissio expressa da Editora.
SAO PAULO
Av. Angélica. 1091 - Hi$ienópcihs
01227dWS,Í0 Paulo SP
Pone ill) 3A6Í-I HK1 Fax(1113fió“-1333
SAC 0800 703-.U44
IMPRF.SSO NO BRASIL
Htik'TEDiAl HKA¿fL
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Á<x) #• H H 1 i 1 I fun^áo de densidad* de probabilidad* do vetar aleatorio X subconjunto (rede) com o menor risco empírico mín ¡¡me matriz hessiana inversa da matriz H raíz quadrada de -1. tambera representado por J matriz idenlidadc matriz de informado de Fisher erro medio quadrado
J -1) K'ft K" log i(w) SB(w) M, M fl p. p F c p. W) p; matriz jacobi u na matriz de covariancia do erro na teoría do filtro de Kalman raíz quadrada da matriz IK transposta da raiz quadrada da matriz K constante de Boltzmann logar, imo logaritmo da fun^ác de vcrossimil banca do vetar w logaritmo da fun^o de verossinú Ihan^a do vetar w baseada em um único exemplo matriz de controlaba lidade matriz de ohservahilidade tempo discreto probabilidad* do estado í em mecánica estatística probabil idade de transipao do estado J para o estadoJ matriz estacas! lea probabilidade de classificafáo correta probabilidad* de erro probabilidade condicional de erro c dado que a entrada é re lirada da ciaste probabilidade que os neurñnios visiveis de unta máquina de Boltzmann eslejam no estado a, dado que a rede estoja na sua conchfao presa {i.e., fase pos i Liva)
Fñ probabilidade qu* os neurónios visiveis de urna máquina de üollzmann eslejam no estado a, dado que a rede esteja na sua condifáo livre (i.e.T fase negativa)
r ,(/>;«) í.(Jt;ra) uk r R t T y tr var K(i) vi wi Yr ü y r 1* estiman va da l'un^áo de autauorrcla^ác de tía) c a (?t) estimativa da fun^áo de correlato cruzada de dfn} c matriz de correlato de um vetor de entrada tempo continuo temperatura conjunto de treinamento (amostra) trac o de um operador matricial operador variáneja funtao de Lyapunov do vetar de estado ¥ campo local induzido cu potencial de alivapao do ncurónio j valor ótimo do vetar de pesos sinópticos peso sinóptico da sinapsíe/ pcrtcnccntc ao neuronio A vetar de peso ¿timo valor de equilibrio do vetar de estado i media do estado x em um sentido “térmico” estimativa de x, representada por um circunfiero valor absoluto (magnitude) de x
Hidden page
Hidden page
Sumário
Introduyáo
27
1.1 O que c urna Rede NcuraiV 27
L2____O Cerebro Humano_____12
L3____Modelos de um Ncurónio____H
L4____Redes Nciinris Vistas entTin (irnfns Oí-¿rotados_41
1.5 Rcaljmoiilagáo 44
1.6 Arquiteturas de Rede 46
L7 Representapáo dn Conhecimcntn 49
1.3 Inldigeneia Artificial e Redes Neurais 59
U_____Notas Históricas__
Notas e Refeténeiafi_69
Problemas___7Q
2 Procesaos de Aprendizagem 75
2J [nlrodut^o 75
2.2 Aprendizagem por Corrccáo de Eitü 76
2.3 Aprendizagem Bascada era Memoria 78
2.4 Aprendizagem Hcbbhina 80
2.5 Aprendizagem Compelí [iva 83
2.6 Aprendizagem de Boltzmann 86
2.7 O Problema de Airibuicao de Crédito 87
2.8 Aprendizagem com um Profcssor 88
2.9 Aprendizagem sem um Profesar 89
2 JO Tarefas de Aprendizascm 91
2JJ____Mcmária_____EH!
2.12 Adaptado 108
2.13 Natureza Estatlslica do Processo de Aprendizagem 110
¿.Id Teoría Estatifica da Aprendízagern 114
2.15 M udelo de Aprcnd i zagem Prwa vel mente Aproxi majamente Correto 127
2.16__Kcsuinu c i>jseus-slíi.i LzJ.
Notas c Referencias___]_1?
Emblemas____131
3 Perceptrons de Camada Única 143
3.1 Inliodugáo 143
3,2 O Probl emB da F iltragem Adaptativa 144
3.3 Téemuas de Otim izapac Irrcstritas 147
3.4 Filtro Linear de Mímenos Quadrados 152
3.5 Algoritmo do Mínimo Quadradc Medio 155
3.6 Curvas de Aprendí zagem 159
3.7 Estrategias de Variado da Taxa de A prend i agent 161
3.8 O Pcrccptron 161
3.9 Teorema de Convergencia do Perceptron 163
3 J 0 Kcl a ;:li'i entre o Pcrc cpl ro n c o Clasificador Ba^ es i ano p; i it mm A mbien le
Gallas ¡ano_169
111____Resumo e Di scussáo___¿¿¿
MíWas e RrfrrrncÍFUi._176
Problemas 177
4 Pgrceptrons do Múltiplas Camadas 163
4.1 Introdujo 183
4.2 Algumas Considerares Prcl i m i nares 186
43 Al gori tme de Retropropagacao 18 8
4.4 Resumo do Alfioriimo de RecroprupaKacao 200
iS____O Problema do XOR 202
4,6 Heurísticas para Melhorar o Dcscmpcnho do Algoritmo de Retropropaga^jo 205
4.7 Rcprescntacao da Saída e Regra de Decis^o 211
4.8 Experimento Computacional 214
4.9 Dctccgao de Características 225
4JO Rctropropagapio c Difcrqicisyio 228
iJ_l___A Matriz Hcss^na______
4.12 Generalizado 232
4.1J Apnoxima^ao de Funcces 234
4.14 Validado Cruzada 239
4.15___Tccji:c;ls Je l\uh de Rede_2Ü
4.16 Virtudes e Lira ¡toldes da Aprcndizagcm por Retropropaga^áp 252
4J7 Aceleraf^o da Convergencia da Aprondizagem por Retnopropagatjao 259
4J8 Aprendizagem Supcrvi sanada Vista como um Problema Je Ohmiza^aü 260
4.19___Redes Corcel mi va?_¿21
4-20___Resumo e Discutan___¿21
Notas e Referencias_225
Problemas___228
5 Redes de Fungao de Base Radial 283
5+1 Introducán 283
5.2 O Teorema de Cover sobre a Scparabilidade de Padrees 284
5+3 O Problema de Interpolagáo 290
5.4 A Aprendizagem Supervisionada como um Problema de Reconstruyan de
11 ipenuperfi cíe M alformulado 293
5.5 A Teoría da Regularizado 294
5.6 Redes de Regularizapáo 305
5+7 Redes de Fungan de Base Radial General izadas 307
5.8 O Problema do XOR (Revisitado) 311
5.9 Estimagáo do Parametro de Regular i zagao 314
S+I0 Proprledades Aprpximativas das Redes RHF 320
5+11 Comparagáo entre Redes RBF c Pcrccplrons de Múltiplas Camadas 323
$+12 Regressáo de Núcleo e sua Rdayáo com as Redes RBF 323
5+13 Estrategias de Aprendizagem 328
5.14 Experimento Computacional: Classificayáo de Padrees 336
5+15 Resumo e D i se ussáo 337
Notas c Referencias 339
Problemas 343
6 Máquinas de Vetar de Suporte 349
6.1 [ntrodug-io 349
6.2 H iperp I ano Oti mo para Padrdes Li nearmente Separóse I s 350
6.3 Hipcrplano Ótimo para Padrees Nao-Scparáveis 357
6.4 Como Construir urna Máquina de Vetar de Suporte para Reconheclmento de
Padrfles 361
6,5 Eaemplc: O Problema do XOR (Revistado) 367
6,6 Experimento Compulse innal 369
6,7 Funcao de Pcrda Insenstvcl a t 372
6.8 Máquinas de Vctor de Suporte para Rcgrcs&ao Nao-Linear 373
6.9 Resumo c Discussáo 376
Notas c Referencias_¿Sü
Problemas 381
7 Máquinas de Comité 3B5
7+! Introducán 385
7+2 Media de Enscrnblc 387
73 Experimento Computación^! 1 390
7.4 Reforjo 391
73 Experimento Computacional II 39S
7.6 Model o de M ¡ stu ra. Gau ssianu A99OCÍ a ti vo 40 1
7.7 Modelo de Mistura Hierarquica de Especialistas 406
7 .8 Sclc^áo de Modelo Usando urna Arvüre de Decisito Padráo 408
L2_____Prohabilidades. g Fnor/ c f? Areterjuri_412
7.10 Eslimagáo por Máxima Verüssinr lhan*;a 4] 3
741 Estrategias. de Aprendizagem para o Modelo MHE 415
7.11 O Algoritmo ME 417
7,13 Aplicaban do Algoritmo ME ao Modelo MHE 41S
7.14 Resumo e Di scussáo 421 Noias e Referencias 422 Problemas 415
8 A nal i se de Com ponentes Principáis 429
8.1 Introdu^&o 429
83 AlgUJis Principios Intuitivos de Auto-Oremi-zagSo 430
83 Análisc de Componentes Principáis 433
8,4 Autofi 11ro MAximo Bascado na Aprendí?agem 1 lebbiana 442
8,5 8.6 Ana 11 se de Componentes Principa» Baseada na Aprendí zagetn Hebbiana E xperi m coto Computar i ona l. Cod ificayáo de Imagcm 45 8 452
8.7 Analise de Componentes Principáis Adaptativa Usando [níbi^So Lateral 461
B.K Púas Classes de Algoritmos de ACP 469
8*9 8.10 Métodos de Computaban por Lote e Adaptativn 470 Anal i se d c Componernos Pri nci país por N úeleo 472
8.11 Resumo e Diseussáo 477
Notas c Referencias 429 Problemas 4SÜ
9= IHapas AutoOrganlzáveia 4B3
9.1 Introducto 483
9.2 Dois Modelos Básicos de Mapeamento de Características 484
93 O Ma pa A utoX7rga n. i zável 486
9.4 Resumo do Algoritmo SOM 493
9.5 Propriedadcs do Mapa de Características 494
9,6 $ imulacóes Compul ac i o na is 5 02
9,7 Quam ¡ ¿ayáo Velorta] por Aprendízagem 506
9.8 Expel í mentó Computactonal: Classlfieab^o Adaptativa de Padrocs 508
9.9 9.111 Quantizaváo Vetorial Hierárquica 510 Mapas Contextuáis 514
9.11 Resumo e Discuss&o 516 Notas e Referencias 51 7 Problemas 5±2
10 Modelos Teóricos da Informaba 525
1 1 10.1 Intraducao 525 102 Entropía 526 10.3 O Principio da Máxima Entropía 531 10.4 Informa; 3 o Mutua S34 10.5 Divergencia de Kullback-Lciblcr 537 tü.6 lnlormá;áó Mutua como urna k'un^o Objetivo a Ser Otimizada 540 10.7 Principio da Máxima Informado Mutua 541 10.8 Infomax e Reducán de Redundancia 546 10.9 Características Espac lilimente Coerenies 549 10.10 Características Espacial mente Incocrcn tes 551 1041 A nál i ne de Componentes Indenendentes 553 10,12 Experimento Computac ional 56S 10,13 EgtLitiBQao por Máxima Vcrossimilhanca 570 1044 Método da Máxima Entropía 572 11L15 Resumo c [Jiscussáo 528 Notas e Referencias 5fiD Problemas 5KZ ' Máquinas Estocisticas e auas AproximaQógs
1 2 Baseadas na Mecánica Estatistica 591 114 InlroduíHQ 591 11.2 A Mecánica Estatistica 592 113 Cadeias de Markov 595 1L4 O Algoritmo Metrópoli? 603 11,5 Recozimento Simulado 606 1L6 Amcsfntgem de Gihhs tifiS 1L7 A Máquina de Boltamann 6t0 11 s Redes de Cren^a Sigmóide 617 ll+9 A Máquina de Hdmholtz 622 11.10 A Teoria do Campo Medio 623 11.11 A Máquina de Boltzmann Dclcnr. i dística 626 11.12 Redes de Cren^a Sigtnóide Delcrm i ni$tícas 627 11.13 Recozimcnto Dcterministioa 634 11.14 Resumo c Discuta 640 Notas e Referencias f¡42 Problemas 645 ! Programado Neurodlnfimlca 651
12.1 Introdujo- 651
122____Pmww de Ttecirfn Martrwiann_______652
12.3 O Criterio de Otimi za^ao de Reliman 655
12.4 Iterado de Política 659
123 Iterarán de Valor 661
12, 6 Programado Neurodiitómica 666
12. 7 1tcra;áo de Política Aproximada 668
12-8 Aprendizagem Q 671
12. 9 Experimento Computacional 676
12.11 1 Resuma e Di scussao 679
Notas e Referértclas 68l
Problemas 682
13 P roces sa mentó Temporal Utilizando Redes Alimentadas Adianto 685
Í3J Introducán 685
13.2 Estruiunis de Memoria de Curto Trazo 686
13.3 Arquiicturas de Rede para Processamento Temporal 691
13.4 Redes Alimentadas Adianlc Focadas Atrasadas re Tempo 693
13.5 Experimento Cornputacional 696
13.6 Teorema de Mapcamento Miope Universal 696
13,7 Modelos Espa^o-Tcmpnrais de um Ncurónio 698
13.8 Redes A Ementadas Adíame Atrasadas no Tempo Dislribuidas 702
13,9 A Igcrilmo de Retropropagacáo Temporal 703
13.10 Resumo e Discussao 710
Ñolas e Referencias 711
Problemas 712
14 Neurod i n árnica
715
14.1 Introducán 715
] 4,2 $ istemas D inám lees 717
14.3 Estábil i dade de Estados de Equilibrio 720
14.4 Alratores 726
14.5 Modelos Neurodinámicos 727
14,6 Manipuladlo de Alratores como um Paradigma de Rede Recorrerte 730
14.7 O Modelo de Hopfield 732
14.8 Expel í mentó Computacional I 749
14,9 Teorema de Cohen-Orossberg 754
14.10 O Modelo do Estado Cerebral cm urna Caixa 755
14.11 Experimento Computacional II 762
14,12 Alralores Estranhos e Caos 762
14.13 Rcconstnicao Dinámica 76R
14.14 Experimento Computacional III 772
14.15 Resumo e Discussao 775
Notas c Referencias 778
Problemas 780
15 Radas Recórranles Dirigida» Dinámicamente
757
15.1 Introducto 787
15,2 Arquiteturas de Redes Recorrentes 788
15.3 O Modelo de Espado de Estados 794
15,4 Modelo A utn-Regressivo N.u । -Linear en ir Entradas Exógenas 802
15.5 O Poder Compulse i onal das Redes Recorrientes 804
15.6 Algoritmos de Aprcndizagcm 805
15.7 Relropropagacto Através do Tempo 808
15.8 Aprcndizagcm Rcconenlc em Tempo Real 812
15.9 Filtros de Kslnian 819
15.10 Fi Itro de Kalman Estcnd i do Desacoplado 8 23
15,11 Experi mente Com putacional 82 8
15.12 Extingan de Gradientes cm Redes Rccorrcntcs 831
15,13 Idenriricefto de Sistemas 834
15.14 Controle AdaptaLivo por Rcicrcncja a Modelo 836
15.15 Resumo e Dlscussto 840
Notas c Referencias 841
Problemas 843
Epílogo 849
Bibliografía 855
índice 893
Hidden page
CAPÍTULO 1
Introdujo
1,1 O QUE É UMA REDE NEURAL7
O trabalho em redes neurais artificiáis, usualmente denominadas “redes neurais* tem sido motiva'
do desde o cometo pelo ruco nhee i mentó de que o cerebro humano processa informales de Ulna
forma ¡tetramente diferente do computador digital convencional. O cérebro é um computador
(sistema de processamento de infoima?ao) altamente complexo, nao-linear e paralelo. Ele tem a
capacidade de organizar seus constiluintes cstniturais, conhecidos por neurdniast de forma a reali-
zar certos processamentos (p.ex., reconhecimentó de padrdes, percepsSo e controle motor) muito
mais rápidamente que o mais rápido computador dígita] hoje existente. Considere, porexemplo, a
visito humana, que é urna tarefa de processamento de informado (Marr, 1982; Levine, 1985;
Churchland e Sejnowski, 1992). A fun0o do sistema visual é fornecer urna representadlo do ambi-
ente á nossa volts et mais importante que isso, fomcccr a informaqao de que necesitamos para
interagir com o ambiente. Para sermos específicos, o cerebro realiza rotineiramente tsrefas de reco-
nhccimcnto perceptivo (p. exM reconhcccndo um rosto familiar inserido cm urna cena nao-familiar)
em aproximadamente 100-200 ms, ao passo que tarefas de complexidade muito menor podem levar
días para serem ejecutadas em um computador convencional.
Como outro exemplo, considere o sonar de um morcego. O sanar é um sistema ativo de loca-
lizando por eco. Além de fomecer informavocs sobre a distancia ate um alvo (p. ex., um inseto
veador), o sonar de um morcego transmi le tambera informadlo sobre a velocidad? relativa do alvo,
o tamanho do alvo, o tamanho de varias características do alvo c o azimute c a elevarse do alvo
(Suga, 1990a, b). A complexa computacáo neural necesgárla para extrair toda essa informado do
eco do alvo ocorre no interior de um cerebro do tamanho de urna ameixa. De fato, um morcego
guiado por eco pode perseguir c capturar seu alvo com urna fácilidade e taxa de sucesso que SÍO de
causar inveja a um engenheiro de radar ou sonar.
Como, cntac, um cerebro humano ou o cerebro de um morcego faz ¡ssc? No momento do
naso menta, um cérebro tem urna grande estruiura e a habilidad? de desenvolver suas preprias ne-
gras através do que usualmente denominamos “experiencia” Na verdade, a experiencia vai sendo
acumulada com o tempo, sendo que o iríais dramático desenvolvimento (i. c., por ikga^ocs físicas)
do cércbro humano acontece durante os deis primeiros anos de vida; mas o desenvolví mentó conti-
nua para mullo além desse estágio.
Um neurónio em "desenvol vimento" é sinónimo de um cerebro plástico; aptasticidade permi-
te que o sistema nervoso em desenvolví memo se adapte ao sen meto ambiente Assim como a
plas11cidade parece ser essencial para o funcionaincnto dos ncuronios como unidades de
proccssamento de informado do cerebro humano, também ela o é com relajo ás redes neurais
construidas com neurónios artificiáis. Na sua forma mais gera!, urna rede neural é unía máquina
que é projetada para modelar a mane ira como o cerebro realiza urna tarafe particular ou fun^ao de
itrteresse; a rede é normalmente itnplementada útil izando-se componentes eletrónicos cu é simula-
da por programado em um computador digital. Nosso intcrcssc nesse livro está res trico a urna
daMC impelíante de redes neurais que realizara computapao útil através de um processo de apnm-
dizagem. Para alcancarcm bom desempenho, as redes neurais empregam urna intcrligacáo nucida
de células compuíacionais simples denominadas “neijrúnio$”ou “unidades deprocessamento”. Nos
podemos emáo oíerecer a seguirte definíoslo de urna rede neural vista como uma máquina adaptad va1:
¿.'ffllfl rÁ’ neural é ’ífJ prncessadnr maci^arttettteparalelamente distribuido fdinítfrurdo <h' jííjjrffl-
des de proccjSMHffltiP simples, ¡jue tem a pmpensda natural para armnzenar ennhecími atn experh
mental e tíintñ-ln dixpnnivet para a ui£r /.'Ar se assemetha ao cerebro em dais aspectos:
1. O conhecimento c adquirido pela red<1 a partir de sen ambiente atreves- de processo de
aprendilugem.
2. FüFifíJ.h' de cwieioü ctitre nelirónius, cOrtficCidas Cümu pestís siritipficús, .nlu ttlibzadai para
armazenar o ambecimenln adquirido.
O procedí mentó utilizado para realizar □ processo de aprendí zagem é chamado de algoritmo de
aprettdizagem. cuja fiin^áo é modificar os pesos sinápticos da rede de uma forma ordenada para
alcanzar um objetive de projeto desojado.
A modificado dos pesos sinápticos c o método tradicional para o projeto de redes neurais.
Esta abordagem é bailante próxima da teoría dos filtros adaptalivos lineares, que já está bem
cslabdeeida e :bi aplicada ccm sucesso em diversas áreas (Wídrow e Stearns^ 1935; Hay km, 1996).
Entretanto, c possívcl também para uma rcdc ncural modificar sua própria topología, o que é moti-
vado pelo fato de os ncurónios no cerebro humano poderem morrer e que rwvu ccnexbes sinápiicas
possam cresccr.
AS redes neurais sao também referidas na literatura como fíelrrucumpulíiifottX, redes
íf>nexif>n¡stíisr pmeeuadoresparvleiimenle dülribitidos, etc. Em lodo esto livro, usamos □ termo
“redes neurais"; ocasionalmente o termo “ncurocomputador” ou “rcdc conexión i sta** é usado.
Beneficias das Redes Neurais
É evidente que uma rede neural extrai mil poder compulacional através, primeiro, de sua eslrutura
ma<. ¡oamente paralelamente distribuida c segundo de sua hábil i dade de aprender e portante de ge-
neralizar A generalizando se refere ao feto de a rede neural produzir saldas adequadas para entradas
que nán estavam presentes durante o trcinamento {aprendízagem). Estas duas capacidades de
processamento de informa^ao tomam possívcl para as redes neurais resolver problemas complexos
(de grande escala) que shv alualmcnic intratáveis. Napratica, cornudo, as redes neurais nao podem
tomcccr uma solu^ áo trabalhando individualmente. Em vez disso, elas precisara ser integradas cm
uma abordagcm consistente de engenharia de sistemas. Específicamente, um problema complexo
de interesse é decompasto em um número de tarefas relativamente simples, c atribui-sc a redes
ncurais um subconjunto de tarefas que coincidem com as suas capacidades ínerentes. Entretanto* c
importante reconhecer que nós temos um longo caminho a pereorrer antes de construirmos (se
porventura conscguirmos) urna arquitetura computacional que mimetizeum cerebro humano.
0 uso de redes neurais oferece as seguí ates propri edades úteis c capacidades:
1. Ndo-iinearídade. Um neurfinio artificial pode set linear ou liSó-liueac Urna rede neural,. cons-
tituida pcrconexdes de neurónios n3o-l ineares éela mesma náo-l incar. Além disso, a nao-linear i dade
c de um tipo especial, no sentido de ela ser distribuida per toda a rede, A náo-linearidadc é urna
propriodade minto importante, particularmente se o mecanismo físico responsável pela gera^áo do
sinal de entrada (p, ex,, sinal de voz) for inerentcmentc nao-linear.
1 Mapeamenft) de Entrada-Saida- Um paradigma popular de aprendizagem chamado <rpmirfi*
zagem COmumprvfesíürm upnífidizagem supervisio/rada cnvolvcamoditlca^aodos pesos xinápticos
de uma rede neural pela aplicado de um conjunto de amostras de tndnamento rotuladas ou exem-
pios da tarefa. Cada cxcmplo consiste de um sinal de entrada único e de uma respes tü desejada
correspondente, Apresenta-se para a rede um excmplo cscolhido ao acaso do conjunto, c os pesos
sinópticos (parámetros livres) da rede sito modificados para minimizar a diferente entre a resposta
desojada e a re&pOsta real da rede, producida pelo sinal de entrada, de acordó com um cntério
estatistico apropriado. O treinamento da rede é repetido para muitofi excmplos do conjunto até que
a rede alcance um estado cstável onde nao haja ma i s modificadles significativas nos pesos sinópticos.
Os exemplos de treinamento previamente aplicados poden) scr reaplicados durante a sessáo de
treinamento, mas em uma ordem diferente. Assim, a rede aprende dos cxcm.plos ao construir um
mapeamente de entrada-saida para o problema considerado. Tal abordagem nos faz lembrar do
estudo de inferencia esíatistico náe-paramélricat que é um ramo da eslatfsúca que nata da cstirna-
^ao independente de modelo, ou, do ponto de vista biológico, aprendizagem tabtda rasa (Germán
et. Al., 1992); o termo “nóo-paramútrlco" é utilizado aqui para significar o falo de que nüc sao feitas
suposi^oes previas sobre o modela esíatistico dos dados de entrada. Considere, por ejemplo, uma
tareíade ciussijicuedo de padrees na qual o objetivo seja atribuir um sí nal de entrada representando
um objeto físico ou evento a uma entre varias categorías (elasses) precstabelecidas. Em uma abor-
dagem nüo-parainétrica para este problema, o objetivo é “estimar" fronteiras de decido arbitrarias
no espado do sinal de entrada para a Earefa de classificafS» de padrees utilizando um conjunto de
excmplos, e fazé-lojem invocar um modelo de dístribuicao probabilisticc. Um ponto de vista simi-
lar está implícito no paradigma de aprendizagem supervisionada, o que sugere uma analogía próxi-
ma entre o mapeamento de entrada-saida realizado por uma rede neural e a inferencia estatística
nao-paramétrica.
3. Adaptabihdade. As redes neurais tcm uma capacidade ¡nata de adaptar seus pesos sinópticos
a medí ficaf fies do mrio ambiente. Em particular, uma rede neural tre i nada para operar em utn
ambiente específico pode ser fácilmente retreinada para lidar com pequeñas modificadles ñas con-
difóes operai ivas do ambiente. Além dísso, quando está operando cm um ambiente nda-esiaeinnd-
ría (i. c., onde as estatísticas cnudam com o tempo), uma rede neural pode ser projelada para modi-
ficar seus pesos xinápticos em tempo real. A arquitetura natural de uma rede neural para classifica-
£ño de padrfies, processamento de simáis e aplicapócs de controle, alinda á capacidade de adaptado
da rede, a loma uma ferramenta niuito útil para classificapáo adaptativa de padróes, pracessamento
adaptativo de sinai s e controle adaptativo. Como regra geral, pode-se dizerquequanto mais adaptativo
se fizer um sistema, assegurando-se de que o sistema se mantenha estáveE, mais robusto tenderá a
ser o seu desempenho quando o sistema for exigido a operar em um ambiente nao-estacionario.
Contudo, deve ser enfatizado, que adaptaba lidade nem sempre resulta em robustez; na verdade pode
resultar no contrario. Um sistema adaptativo com constantes de tempo pequeñas, por exempio,
pode se modificar rápidamente e assira tender a responder a perturbadles espurias, causando urna
drástica degradado no desempenho do sistema. Para apro veitar todos os beneficios da adaptabili-
dade, as constantes de tempo principáis do sistema devem ser grandes o suficiente para que o siste-
ma ignore perturbares espurias mas anida usirn serem suficientemente pequeñas para responder a
mudanzas significativas no ambiente; o problema aquí descrito é referido como o dilema da exíabi-
Jidade-pfasricidade (Grussberg. 1988b).
4i Rexpualu a E^ídéticiax. No contexto de classifica^ao de padrees, urna rede neural pode ser
pro jetada para fomcccr informacáo nao súmente sobre qual pftdráo particular sefecionar., mas tam-
bé™ sobre a confianza ou cren^a na dccisáo tomada. Esta última informacáo pode ser utilizada para
rejeitar padrees ambiguos, caso eles estejam presentes, e com isso melhorar o desempenho de clas-
sifica^ao da rede.
5. CMlexltarf. O conhecimento é representado pela própria estrulura e estado de
ativa^ao de urna rede neural. Cada ncurónio da rede é potenciaimrntc aktado pela alividade de
todos os nutrns neurónios na rede. Conseqücntcmcntc, a informa^ao contextúa! é tratada natural-
mente pela rede neural.
6. Tídermcta a Fathas. Urna rede neural, implcmcnlada na forma física (em hardware), tem O
potencial de ser iirtrencemente tolerante a ftdhas, ou capaz de realizar computado robusta, no
sentido de que seu desempenho se degrada suavemente sob condeces de operado adversas. Se um
neurónio ou suas concxóes sao daniiícados, por exempto, a recuperado de um padreo armazenado
c prcjudicada em quallidade. CTontudo, deviilo á natureza distribuida da ¡rtformafio armazennda na
rede, o daño deve ser extenso para que a resposta global da rede soja degradada seriamente. Assirm
a principio, urna rede neural exibe uma degradado suave do desempenho em vez de apresentar urna
fallid catastrófica. Há algumas evidencias empíricas para a computa^io robusta, mas geralirente ela
nao c controlad*!. Para se assegurar que urna rede neural seja de fato tolerante a falhas pode ser
necessário adotar-se medulas corretí vas no projeto do algoritmo utilizado para treinara rede (Kerlirpin
cVallct, 1993).
7. Imptemenia^áo em VLSI. A naturcza macizamente paralela de urna rede neural a faz ser
potenctalmente rápida na computacao de certas larcfas. F.sta mesma característica loma urna rede
neural adequada para implcmcntazáo utilizando tecnología de integracao cm escala muito ampia.
Urna virtude benéfica particular da tecnología VLSI (.very-ltirge-Kale-haeff-adün) c que ela fomc-
cc um mcio de capturar comportamentO6 realmente complexos de urna forma altamente hierarqui-
ca (Mead, 1989).
N. Unifói midade de Atiálüe e Pwjelú. Básicamente, as redes neurai s desfrutara de universal । da-
do como processadorcs de informaqáo. Dizcmos isso no sentido do que a mesma notado é utilizada
ero todos os dominios cnvolvendo a aplicaqáo de redes neurais. Esto caracieristicu se manifesté de
diferentes modos;
» Os neurónios, de urna forma ou de outra, representara um ingrediente comum a todas as redes
neurais.
• Esla uní ibrmi dade loma possivel eompartilhar teorías c algoritmos de aprendizagem cm apti-
ca^ocs diferentes de redes neurais,
* Redes modulares podem ser construidas strwés de urna integrando homogénea de módui&i.
Intrcm>lk;Aü 31
9. A na logia Neurobiológicu. ü ptüj eto de u ma rede neural é motivado pela analogía com o cere-
bro, que é uma prova viva de que o prncessamento paralelo tolerante a fe Litas - nSo sementé possíve!
físicamente mas também ráp ele c poderoso. Os neurebiólogos olham para as redes neurais (artifi-
ciáis) como uma ferramenta de pesquisa para a Interpretará® de fenómenos neurobio lógicos. Por
metro lacio, os cngenheinM olham para a ncurobiolugia procurando novas idéias para resolver pro-
blemas maifc complexos do que aqueles bascados cm técnicas convencional s de projeto por eone-
xóes fixas. Estes dois pontos de vista sao ilustrados respectivamente pelos dois exempios a seguir
• Em Anastasio (1993), modelos de sistemas lineares do reílexo vestíbulo-ocular sSo compara-
dos com modelos de redes neurais bascados em nedes rvcunentes, que sao descritas na sc^ao
l,h e discutidas. em detalhe no Capitulo 15.0 neflgw (RVO) é parte do siste-
ma ocu tomo tor. A fun^áo do RVO c man tor a estábil idade da imagem visual (i.c., retina!)
fazendo rota^oes oculares opostas as roEa^ócs da cabera. O RVO é mediado por neurónios
pré-motores nos núcleos vestibulares que recebem e processam os sinais de rotaq&o da cabera
ad viudos dos neurónios senso riáis vestibulares e enviara os resultados para os neutrón i os mo-
tores do músculo ocular. O RVO c bem apropriado para modclagcm porque a sua entrada
(rotado da cabera) e a sua salda (rotado ocular) podetn ser especificadas precisamente. Ele é
também um rcflcxo relativamente simples cas propiedades ncurofí biológicas de scus neurónios
constituimos se encontram bem descritas. Entre os tres tipos neurais, os neurónios promoto-
res (mlerneuiróniüs de reflexo) nos núcleos vestibulares s£o os mais complexos e. portante. es
mais inieressanlcs. O RVO luí modelado anteriormente utilizando deser ilores concentrados de
Sistemas lineares e a teoria do controle. Estes modelos forain úteis. para explicar alguinios das
propiedades global s do RVO, mas fomcciam pouco en tendí mentó das prepr i edades dos scus
neurónios constituimos. Esta situarán mclhorou substancia!mente atreves da modelagenn por
rede neural. Modelos de redes recocientes do RVO (programados utilizando um algoiiimo
chamado aprendizagem recursiva em tempo-real que é descrito no Capitulo 15) podem repro-
duzir e ajudara explicar mu tíos aspectos estáticos, dinámicos, nao-] incares c distribuidos do
processamento de slnal pelos neurónios que medeiain o RVQ, especialmente os neurónios dos
núcleos vestibulares (Anastasio, 1993).
• Na tiea'mx, mais que cm qualquer outra parte do cerebro, é onde nós cometamos a agregar as
rela^óes entre o mundo extemo representado porum sentido visual, sua ima^em,física proje-
Cada em um airar.¡o de receptores c as primeiras imagett-i neurais. A retina é uma folha fina de
lecido neural que re veste o hemisferio posterior do globo ocular. A tarefa da retina é converter
uma imagem ótica em utna imagem neutral paira ser ítransmitida através do ñervo ótico para
uma quantidade de centros para analise posterior Esta ó uma tarefa complexa, como evidenci-
ado pela organizapáo sináptica da retina. Ñas retinas de todos os vertebrados, a transforma^áo
da imagem ótica em imagem neural enzolve tré* eslágioa (Slcrling, 1990):
(i) Transdueáo da energía luminosa por uma camada de neurónios receptores.
(II) Transmissáo dos sinais resultantes (producidos em resposta á luz) por sinapses quúnicas
para uma camada de células bipolares.
(iii) Transmissao desses sinais, também por sinapses químicas, para neurónios de saída que
sáo chamados de células gangliañares.
F.m ambos os estágios sinápticos (Le., das células receptoras para as células bipolares e das células
bipolares para as ganglionare.s) ha neuronas especializados conectados lateralmente chamados cé-
lulái korixcMtíúiS c cé/w/ftv anjñcriaas, respectivamente. A tarefa desses neurónios é modificar a
transmissáo atravús das camadas aináplicas. Há também elementos centrífugos chamados de cé/u-
¡as interplexijbrmes', sua tarefa c transmitir s i na i s da camada sinápLca interna para a camada cxicr-
na. Alguns poneos. pesquisadores construiram circuitos eletrónicos que mimeuzam a «tintura da
retina(Mahowald eMcad, 1989; Boahen e Ardreou, 1992; Boahen, 199b). Estes circuitos eleírónicos
sao chamados de circuitos integrados neuromórficos. um termo cunhado por Mead (1989). Um
sensor de imageen ncuromórfico consiste de um arranjo de foto receptores combinados com circui-
tos analógicos ern cada elemento de imagecn (pixel. pictitrv element). Ele emula a retina na medida
cm que se adapta localmente a variares na luir inane ia, delecta bordas e detecla o moví mentó. A
analogía ncurobiológica. ejemplificada pelos circuitos integrados neuromcrficos. éútil lambém de
outro modo importante: ela forrees uma esperanza ea crencah c de uma certa mancira a existencia
de pro va, de que a eompreensáo física das estruturas neurobiológlcas pode ter influencia produliva
na arte da eletrónica c da tecnología VLSI.
Tcndo cm mente esta inspirado na neurobiologia, parece-nos apropriado examinarme^
brevemente o cerebro humano e seus níveis estruturais de organizado.
1.2 O CEREBRO HUMANO
O sistema nervoso humano pode ser visto como um sistema de tres estágios, como mostrado no
diagrama em blocos da Eig. I. I (Arbib, 19S7). O centro do sistema é o cerebro, represeniado pela
rede neural (umg^t que recebe conLnuamentc informacáo» pcrccboa c toma decisoes apropria*
das. Dais conjuntes de setas sfio mostrados na figura. Aquel as que apontam da esquerda para a
direite indicam a transmissáo pana frente do sinal portador de niiformagach através do esterna. As
setas aportando da direita para a esquerda indíeam a presenta de realtmenlacáo no sistema. Os
recepiorex convertem estímulos do enrpo humano ou do ambiente externo em impulsos eléirieos
que iransmitem informagáo para a rede neural (cerebro). Onatuadnrea converiem impulsos ele tríeos
gerados pela rede neural cm respostas discerní veis como saldas do sistema.
Eí.ümnilc
FIGURA 1 .1 Rapr&MirtaGáo em diagrama em bíneos do Sistema naívoso
O esforzó para entender o cerebro se lornou mais fácil pelo trabalho piomeíro de Ramón y
Cajál (1911), que introduziu a ideia dos neutumiaa como constituimos estruturais do cerebro. Típi-
camente, os neurónios s5c de cinco a seis ordens de grandeza mais lentos que as portas lógicas cm
silicio; os eventos em um circuito de silicio aconlecem na ordem de nanossegundos (10"s}, enquan-
to que eventos ncurais acontcccm na ordem de milissegundos (KHs). Entretanto, o cerebro com-
pensa a taxa de operacáo relativamente lenta de um neurónio pelo número realmente espantoso de
neurónios (células nervosas), com eonexóes macizas entre si. Estimarse que haja aproximadamente
10 bilhóes de neurónios no córtcx humana c od trilhóes de sinapses OU C0DCXfiC8 (Shephcrd c Koch,
199Q). O resultado livre é que o cérebro é urna cstnitura extremamente eficiente. Mais especifica-
mcnict a eficiértcia energética do cerebro é de aproximadamente ID-1* joules (J) por operado por
segundo, enquanto que o valor corrcspondcnic para os melhores computadores em uso cm nossos
días é de cerca de 10'h joules por operacáo por segundo (Faggin. 1991),
As ainüpti.'.'i sao unidades estniturais e funcionáis elementares que medeiam as interaíóes
entre os neurónios. 0 tipo mais comum de smapse é a xinapse tfuíntictt, que opera da seguí me
[NntDDUCAlD 33
forma: um proccsso prc-sinápLÍco libera uma substancia transmissara que se difunde através da
jun^áo sináptica entre neurónios e entao age sobre um proccsso pós-sináptico. Assim, uma sinapse
comerte um si nal elélrico pré^sináptico em um sinal químico e enláo de volca em um sinal elélrico
pós-sinápiico (Sbepherd e Koch. 1990). Na temí nolcgi.i el ¿trica, um demento assim é chamado de
um dispositivo de dota termináis' ndo^ecipmcv. Ñas descrizóes [radífiionaisda organizacao neural,
asmme-se que uma sinapse é uma ccoexfo simples que pode impor ao neurónio receptivo excítenlo
ou inibicao, mas nao ambas.
Anteriormente, mencionamos que a plásticidade permito que o sistema nervoso em desenvd-
vimento se adapte ao seu rucio ambiente (Eggermoot, 1990: Churehiand e Scjnowski, 1992). Em
um cerebro adulto, a plasticidade pode wr atribuida a deis mecanismos: a criante de novas cone-
Kóes sinópticas entre neurónios c a modiíicacao das s.napscs existentes. Os uxonios, as tinhas de
iransmis&So, eos dendritas, as zonas receptivas. oonstiluem deis tipos de filamentos celulares que
sao distinguí veis por razoes morfológicas; um asónio tem uma superficie mais lisa, menos ramifi-
crufócs e maior comprimentó, enquanta que um dendrita (assim chamado pela sua scmelhan^a cum
uma árvorcjtcm uma superficie irregular c mais ra mi (i cacóos (Frccman, 1975). Os neurónios apa-
recen! em uma grande variedade de formas e lanianfios cm diferentes partes do cerebro. A Figura
1.2 i lustra a forma de uma eéiuia piramidal, que c um dos tipos mais comuns de neu reñios corticais.
Como multas outros tipos de neurónios, cía recebe a maiona de suas entradas através de espmitas
dendritais; veja o segmento de dendrita na inscrito da Fig. 1.2 para detalhes. A célula piramidal
pode reccber lO.OÜOou muís contatos sinópticos c pódese prticíar sobro miLharcs de células-alvo.
A maioria dos neurónios. codifica suas suidas como uma série de pulsos breves de lensao.
Estes pulsos, usual mente conhccidos como potenciáis dentelo ou impulsos (spikes), originam-se no
corpa celular de neurónios, nu perta dele, e entilo se propagan! através dos neurónios individuáis a
velocidade e ampl ilude constantes. As razoes para o uso de potenciáis de a<;ao para a comunicante
entre neurónios se basciam na física dos axónios. O axónio de um neurónio c muito longo c fino o c
caracterizado por uma alta resistencia elétrica cunta capacitancia muito grande. Estes dois elemen-
tos cstáo distribuidos ao longo do axónio. O axónio pode tóssim ser modelado como uma linda de
transmissáo RC, daí o uso ccmum da "cqua^áo de linha" como a tem: inologia para dése rever a
propagarán do sinal ao longo de um axónio. A a nal i se dcstc mecanismo de propagado revela que,
quando uma lensáo é aplicada a urna estreñí dado do axónio, cía dccai exponene lalmcnte com a
disiáocia, caindc a um nivel infligpilicanlv no mumcnio em que ela atinge a outnt extremidade. Os
polenciais de afáo fomecem urna mancira de evitar este problema de trian sm L xsao (Andcrson. 1995).
No cerebro há organizares Anatómicas lanío em pequera cscalfi como ern grande escala, c
fun^óes diferentes ocorrem nos ni veis mais baixos e nos mais altos. A Figura 1.3 mostra urna lii epar-
quía de nívei i entrelazados de organizante, emergente do extenso traba! ho sobre a anal i se de
negióes localizadas no cerebro (ShepherdeKoch, J990:Churchlaiidc Sejnowski, ] 992).
ncprcüci)lam o nivel mau fundamental, dependente de moléculas e ions para sus a^áo. Nos iiivei'i
seguintes. temes os microcircuitos ncurais, as árvores dcndrlfais e entáo os neurónios. Um
micmcircidto neumi se refere a um agnipamcnlc de sinapses organizadas cm padrees dcconectividadc
para produzir uma operazáo funcional de Ínteres», Uní mi croe ircuito ncural pode ser comparado a
um circuito de silicio constituido por um agrupamente de transistores. O menor tamanho dos
mi cree incultos c medido em micrómetros e a sua yclocidade de opem^te mais rápida é medi-
da em miiHscgundos. Os miuroeirculíos neurais san agrupados para formar xtibwiidades dendritaia
dentro das árvores deitdritots dos neurfinfos individusis. O neinv/fio completo, com tamanho de
cerca de lOd pm, contém vári as subunidades dendrita i s. No nivel seguirte de complexidade nos
temos eir•caitos ¡ováis (cerca de 1 mm de lamanho) constituidos por neurónios com propr¡edades
similares ou diferentes; estes agrupamentos neurais real i rain operares cañad eri áticas de uma re-
34 Kh ]FS Nt-UKA IS
FIGURA 1.2 A céluta pi rameal
giáo focalizada no cerebro. Eks sSO seguidos por cfnriw'to.v infer-regíonaia constituidos por carril-
nhos. coluros c mapas topográficos que envolvem regí oes múltiplas localizadas em partes diferen-
tes do üdrebro.
Os mapaj1 topográficossao organizados para responderá informado sensorial incidente. Es-
tes mapas sao freqücntcmcntc arranados cm fallías, como no coiíctJt> jtaperit/r, crde es mapas
visual, auditivo c so meslésicri están empilhados cm camadas adjaccntes de tal modo que estímulos
advindoti de pomos correspondentes no espado se localizan acima ou abaleo de cada um deles. A
1ntrodlx;áo 35
FIGURA 1.3 Organizado
estrutural dos ni veis no
córebro
Figura 1.4 aprésenla um mapa citoarquilctural do córtex cerebral como apurado por Brodmann
(Brodal, 1981).
FIGURA 1.4 Mapa citoarquitectural do córtex cerebral. As diferentes áreas sáo «dentiheadas pela
espessura de suas camadas e tipos de células netas conttdas Algumas das áreas especificas
mais importantes sáo como segue. Córtex motor: banda motora, área 4; área pré-motora, área 6;
campos oculares frontais, área 8. Córtex somesiesico áreas 3, 1.2. Córtex visual: áreas 17. 18.
19 Córtex auditivo: áreas 41 e 42. (De A. Brodal, 1981; com permissáo da Oxford Unrversity Press.)
36 Ri m - ts'b.uuB
Esta figura mostra claramente que diferentes entradas sensor¡ais (motora, somestésica, visual, audi-
tiva, etc.) sao raspeadas sobra áreas correspondentes do córtcx cerebral de uma Forma ordenada. No
nivel final de complotidade, os mapas topográficos e outros circuitos inter-regi onais medeiam tipos
específicos de corapnriamento no aistema nervoso centrui.
É importante reconhcccr que os niveis cstruturais de organizando descritos aquí sao uma ca-
racterial ica única do cerebro. El es nao sáo encontrados em lugar algum em um computador digital,
eolo estamos próximos de recriados com redes neurais artificiáis. Apcsar disso, estamos avanzan-
do gradualmente no eaminho de uma hieranquia de ntveis computacionais similar aquel a descrita na
Fig. 1.3, Os neurónios artificiáis que utilizamos para construir nossas redes ncurais sao realmente
primitivos em comparado com aqueles encontrados no cerebro. As redes neurais que atual mente
podemos projetar sao comparativamente lio primitivas quanto os circuitos locáis e inter-regionais
do cerebro. O que c realmente gratificante, contudo, c o progresso notávcl alcanzado em varias
frentes durante as últimas duas décadas. Com a analogía neurohiológica como fonle de inspirafiD e
com a riqueza das Fcrramcntas teóricas c tecnológicas que temos acumulado, estamos cortos de que
cm mais uma década nossa compreensáo das redes neurais artificiáis será mullo mais sofisticada do
que cía o c atualmcntc.
Nosso interese primordial neste livno está limitado ao esludu das redes ncurais artificiáis de
uma perspectiva de engenharu? Cometamos o cstudo descreyendo os modelos de neurónios (arti-
ficiáis) que formara a base das redes neurais consideradas nos capítulos subsequentes do livro.
1.3 MODELOS DE UM NEURONIO
Um HeuHMiiD é uma uní dado de proccssa mentó de informaqao que o Fundamental para a opera^áo
de urna redi1 neural. O diagrama em bíneos da Fíg- 1.5 imoalra o modelo de um ncurónic, que Forma
a base para o projelo de redes ncurais (artificiáis). Aquí nós identificamos tres elementos básicos do
modelo neurona I:
figura 1.5 Modelo náo-lrnear da
um nauFÓniíJ
Ir Um conjunto de fótqpfts ou eíaidgconexiiú, cada uma caracterizada por um peso ou /arpa
propri a. Espcci ficamcntc, um siria L 21 na en trada da sinapse/ conectada ao neurónio A é m ull ipl i-
cado pelo peso sináptico u1^. I. importante notar a mancira como sao escritos os índices da peso
smáptico w;. O primeiro índice se refere ao neurónio em questao c o segundo se refere ao
terminal de entrada tía sinapse á qual o peso se refere. Ao contrário de urna sinapse do cerebro,
n peso sináptico de uní neurónio artificial pode estar em uro intervalo que incluí valores negati-
vos bem coran positivos.
2. I Jm samadnr para sumar os s i na i s de entrada, ponderados pelas respectivas sirápscs do ncurón lo,
as opera^oes descri tas aquí CODStilUCfn utl\ cambiijador tincar.
3. Uma /wifflo de etfrapfo para restringir a amplitudc da saída de um neurflnio. A fun^So de
ativa^ao c também referida comoj resrrítfvu já que restringe (limita) o intervalo pertnis-
sivel de amplitude do sina! de sai da a um valar finito.
Típicamente» o intervalo normalizado da amplitude da saida de um ncurvnio é escrito como o
intervalo unitario fechada [O, 1] ou alternativamente [-1, 1],
O modelo neuronaI da Fifi. 1.5 incluí também um j&ítf.v aplicado externamente, representado por ?..
O bias b{ tem o efeita de aumentar ou diminuir a entrada líquida da lunqáo de aliva^ao, depundendo
se cíe c positivo ou negativo, respecté ámente.
Em termos matemáticos, podemos descrever um neurónio A escrevendo n seguíate par de
cqua^ocs:
ni
J6 = IR ,
e
y\ = «n-(iía h A.)
(l.t)
(1.2)
undu.vr .v,...sloos sinais de entrada; u^, ....sao os peso!» sinápticcs do neurónio Á\ m#
é a Mida do combinador linear áevido aos sino i s de entrada; í' é o bias; (p () c a fun^üo de trfivfflpfio;
cy c o sinal de saída do neurónio. O uso do bias (cm o clcilo de aplicar uma transformando afitn
á saida a( do combinador linear no modelo da Fig. 1.5, como mostrado por
r. = n+¿t (13)
Em particular, dependendo se o h ¡as ht é positivo ou negativo» a relajo entre o campo local induci-
da cu potencial de afivanda uc do neuronio £ c a saida do combinador linear u1 ó moditicada na
forma ilustrada na Fig. 1.6; de agora cm di;iiUc, o termo “campo local induzido" será usado. Note
que como resultado desta transformado a ti ni, o gráfico de em fuñado de ií( nao passa unáis pela
crigem.
FIGURA 1.6 Transfarniacao <1éti produridá
pela presenta da um bias; nol& que v. em
1^*0.
O bias b é um paramcira externo do neurónio artificial A. Podemos considerar a sua presenta
como na Eq. (1.2). Equivalcnicrncntc, podemos formular a combinado das Eqs. (II) até (13)
como segué:
.11
(M)
(1.5)
Na Eq. (1-4), adicionamos uma nova sinapse. A sua entrada c
(1.&)
e o seu peso c
(1-7)
Podemos, perianto, retbrmular o modelo do neurfiflio i como na Fig, 1,7, Nesla figura, o efeito do
b. ís é levado em corita de duas maneirasi (1) adicioriando-se um novo si nal de entrada fixo cm +1 e
(2}adicionando-se um novo peso sináplico igual ao bias b.. Embora os modelos das Figs. 1.5 C 1.7
sejtim diferentes na apariencia. el es silo matemáticamente equivalentes.
finápliccs
¿ i ncEisi nd-:'' o
FIGURA 1.7 Um oulro modelo
náo-lirear de um neurónio
Tipos de Fun^ao de Atlvapao
A funcao de aiivafac, representada por tp(tX dtfme a salda de um neurónio cin termos do campo
loca] inducido r. Aquí nós identificamos tris tipos básicos de fundóos de ativa^an:
I. Fttít^So de Limiar. Para este tipo de funcán de atlva^áo. desuri lo na Fig. 1.8 a, temos
ü
se v¡* 0
se r < 0
(1-8)
IrvntoMJt;AQ 39
FIGURA 1 .S (a) Fun^Sa de ímiar.
(bj FunpSo linear pw parles, (c)
Fun^áD siflrttóitfe páre parÉmairú
de inclinac&o u variável
Na literatura de engenhariíu esta forma de fun^áo de Iimiar c normalmente referida como fuñado de
Hesvíxide. Correspondentemente, a saída do neurónio que emprega esta fun^ao de limiar c ex-
pressa como
í l se ut > Q
J * 10 se < 0
(1.9)
onde v4 é o campo local induzido do neurónio; isto é
J-l
(110)
Tal neurónio ó referido na literatura como o madejo de McCnlioch-Piíls, em reconhecimentó ao
trabalho pionciro realizado por McCulloch c Pitts (1943). Neste modelo, a saída de um tieurónio
assume O valor k se O campo local induzido daquele neurónio c náo-negative, c 0 caso contrário.
Esta defímeao déseme a pmpriedade tudo-ou-nada do modelo de McCulloch-Pitls.
2. Fitnpoo j urea? par Paites. Para a fuñico linear por partes descrita na F g. 1.8b temos
j' >+{
(i.ii)
onde a$sume-se que o fator de amplificarán dentro da regían linear de operacáo c a unidade. Esta
forma de fundan de alivaqáo pode ser vista cottid uma aproximaban de um amp ificador nao-Linear.
As duas situantes seguí n tes podem ser vistes como formas especiáis da fundan linear por partes:
* Sí a regiáu linear de operario e maní ida sem entrar em saturado, surge um combinador
iirteaf.
• A funqáo linear por partes se reduz ijunb-au de limitar se o fakir de amplifica^ito da rqpio
linear éfeilo infinitamente grande.
3. Furi^ao Sigmóide. A Curnjao Mgmóide. cujo gráfico lem a forma de s, ¿ de longo a forma malí
comum de fun^o de ativafio utilizada na construyo de redes neurais artificiáis, lila é definida
como urna fuiicáo estriiamentc crescentc que ex i he um íjalanceamentc adequado entre com porta-
mcnio lineare nao-linear.' Um excmplode fundan sigmóideéafititbán fagiwi'caS definida por
q?(r) = -----;----
1 +eKp(-av)
(1.12)
onde a ó o parámetro de iacUtiabua da fiuuiáo sigmóiJc. Vari ando-se o parámetro a, obremos fun-
des sigmóides com diferentes inclinantes, como ilustrado na Fig. 1.8c. Na verdade. a iiiclina^áo na
or.gem é igual a xd/4. No 1 imite, quando o parámetro de inclína^áo se aproxima do i nfiníto, a fun0O
sigmóide te loma bimplesmente uma futifíio de lindar. Eínquanto que a fuiieáo de limiar assumc o
valor de 0 ou 1, uma fundan sigmóide assumc um intervalo continuo de valores cnlre í) e 1. Note
tilín hem que a finido sigmóide é di rerene i ávd, etiquen tu que a fimqBo de limiar úSo o c.
(Diferenciantildado é uma característica importante da teoria do redes neurais, como descrita no
Capítulo 4.)
As fundes de alivio definidas ñas Eqs, {1 .8). (l. 11) c (1.12) *e e-stendem de 0 a +1. Al ¡fu-
cilas vezes c dcs^jávcl que a funqáo de ativaqáo se cstenda de I afl, a.ssmilindo ueste caso urna
forma anti-simétrica em relajo á origein; isto é, a fon^o de alhajo é uma fun^áo impar do campo
local iridu/idó. Especificar nenie, a fuñado de limiar da liq. (1.8) é definidla agoni como
I se r > Ü
<p( el =< 0 jé tí = Ü
(1.13)
-1 .Yf ÜKÓ
a qual é normalmente denoiniiiada/jírrcJíj .•iimii. Fama forma correspondente de uma fundan sigmóide,
podemos utilizar a./l«ícñí? ¡anuente ftiperbática. definida por
<p (w) = tanh (w)
(1.14)
O fatodc se permitir que urna fun^áo de auvaciínk-- lipu sigmóide assuma valores negativos como
descrito pela Eq. (1.14; traz beneficios analíticos (como mostrado no Capitulo 4).
Modelo Estocástico de um Neurónio
O modelo neuronal descrito na Fig. 1.7 ¿ detennlnisüco já que o seu comportamento de entrada-
saída é definido precisamente para todas as entradas. Para algumas aplica^res de redes neurais, é
dcscjávcl que il análisc scj a bascada cm um modelo neurona! cstocáslico. Em uma abordagem ana-
líricamente íratável, é dada uma interpretado prübabilislica á íunfáo de aliva^ac do modelo de
McCulloch-Pitls. Mais específicamente, pemil tose que um neurónio assnma apenas um de dqis
estados: +1 ou -1* por exemplo. A decisáü para disparar um neurónio (i.e., mudar sen estado de
“desligado" para “ligada") é probabilística Considere quex represente o estado do neurónio e P(v)
represente apmbabiiidade de disparar, onde tj é o campo local induzido do neurónio. Nos podemos
cnlao cscrever
f+1 com probabllldade f(ti)
-i com probahilidadc ! -
Uma escolha padreo para /’(»> c a fu tifio de forma sigmóide (titile, 1974):
P(u) =---------:------
l + ex.p( v ' /')
(1.15)
onde Tó uma pwudotemperaiwu que é utilizada para controlar o nivel de ruido e portan co a incer-
teza de disparar E importante pcnccbcr, entretanto, que f nao c a temperatura física de uma rede
neural, seja ela uma rede neural biológica ou anificial. Em vez disso, como já mencionado, nós
devemos considerar T meramente como um parametro que controla as flutua^ocs térmicas que
representara os efeitos do mido sinóptico. Note que quando T -> 0, o neurónio estocástico descrito
pela Eq,(l. 15) se reduz a uma forma sem ruido (i.e., deiermmística), que é o modelo de McCulloch-
Pitts.
1,4 REDES NEURAIS VISTAS COMO GRAFOS ORIENTADOS
O diagrama ew blocas da Fig. 15 ou aquele da Fig. 1.7 fomccc uma dcscri^ao funcional dos varios
elementos que ccnstiluem o modelo de um neurónio artificial, Nos podemos simplificar a aparéncia
do modelo utilizando a idéia de grafos de fluxo de sitial sem sacrificar qunísquerdetalhes do mode-
lo. Os grafos de fluxo de sinal juntamente com um conjunto bem-deiInido de negras foram desen-
volvidos originalmente por Masan (1953, 1956) para redes lineares. A presenta de nao-l inearidade
no modelo de um neurónio limita o encopo de sua aplicando as redes neurais. Apcsar disso, os
grafos de fluxo de sinal fomeccm um método elegante para retratar o fluxo dos sinais em uma rede
neural, que c o nosso objetivo nesta scqao.
Um grajo dv fluxo de siual é uma rede de elo# (mmos) orí enlados que sSc iriterligados cm
certas pontos chamados ndr. Um nó típico j tem um sinal nodalx associado. Um cío orientado
típico origlna-se no nó,/ e termina no nó k; ele tem umayuHpto de íransferencia ou transmitáneia
associada que especifica a transirá pela qual c sinal _i L no nó k depende do sinal x no nó j. O fluxo
de sinais ñas diversas partes do grafb é ditado por tres regras básicas:
Jtegra 1. Um sinal fluí ao longo de um elo somente no sentido definido pela seta do elo.
Dois diferentes lipes de clos podem sor distinguí dos:
* Í7af sinópticos, cujo oornporiamcnto é guvemado por uma retablo de entrada-sai da linear.
Específicamente, o sinal nodal .t é multiplicado pele peso sináptico para produziro sinal
nodal como ilustrado na Fig. 1.9a.
-----£.------o /jt. W¡/X/
(•)
Jj o------------» a >t ifiCtjí
FIGURA 1.9 I lustrado das regras básicas
para a confilruQ3ó da gr^fcc ds lluxo de sinal
i«H
• EAw de ativacao, cujo comportarnento ¿ gobernado em geral por uma relamía de entrada-sai da
rófr-Atanr. Esta forma de relajan c ilustrada na Fig. 1.9bt onde (pf-J c a funcac de ati^^áo
nao-linear.
Rpgra 2» Um sinal nodal é igual á soma algébrica de lodosos sinais que entrara no no pertinente
via os cios incidentes.
Esta segunda regra c ilustrada na Fig. 1.9c para o caso de crtnwjpénria tfndptiéú OUjílrt-wl.
Regra 3, O sinal cm um nó c transmitido para cada cío do saída originario deste nó, sendo a trans-
mis&áo in tetramente independente das fundes de transferencia dos el os de saída.
Esta tcrccira regra ¿ilustrada na Fig. 1.9d para o caso de dhwgéiicrfl .wnóptrea ou fan-Mf.
Utilizando estas regras podemos construir,. por escmplo, o grato de fluxo de sinal da Fig. 1.10
como o modelo de um neurónio, correspondente ao diagrama cm blocas da Fig. 1.7, A representa-
q5o mostrada na Fig. 1.10 é claramente mais simples em aparéncia que aqueta da Fig. 1.7, apesar de
conter todos os delalhcs funcionáis descritos naquele diagrama. Note que em ambas as figuras a
entrada ,rff = +1 e o peso sináptico associadn WÉ<I A., onde é o bias aplicado ao neurónio
De fato, com base no grafo de fluxo de sinal da Fig. LIO eomu o modelo de um neurónio,
podemos agora ofcrccer a segumte defiji:^án malemíhu de uma rede neural:
AGURA 1.10 Grate de fluxo
cíe sina' de um neurónio
E/má rede neund é um grafo ttrifniíido constituido de nóy cpwj c/íw ífr ftiferliga^do sinópticos <? de
ativa^ao e é caracterizada por guaira propiedades:
I, Cada neurimia é representada por um coFi/Mfffo di? dos sinópticos lineares, um bias aplicado
externamente e um do de ativa^ao possivdmente nUa-linear. Obiasé representadapw um do
sinóptico conectada a uma entrada fixa em -l- l.
2. Os elos sinópticas de um neurónio ponderan os seas respectivas sinais de entrada.
3, A soma ponderada dos sinais de entrada define o campo loca! inducido do neurónio em ques*
tac.
4. O ela de afivafaa Umita o campa ¡acai induzidn da neumnio para prwtuzir uma salda.
O estada do neurónio pode ser definido cm termos da seu campo local induzido ou de seu sinal de
salda.
Um grafo orientado assim definido é completo no sentido de ele descrcvcr nao somente o
fluxo de sinal de neurónio para neurónio, mas lambóm o fluxo de sinal dentro de cada neurónio.
Entretanto, quando o foco de atcn^ao c rustrito ao fluxo de sinal de neurónio para neurónio, pode-
mos utilizar uma forma reduzida deste grafo, omití ndo os detalhes do fluxo de sinal no interior dos
neurónios individuáis. Este grafo orientado é chamado de parcialmente completo. Ele é caracteriza-
do como segue:
1. Nos defonte fomecem sinais de entrada para o grafo.
2. Cada neurónio é representado por um único nó chamado de nó computacional.
3. Os efos de comunicando que eonectam os nós de fonte aos nós compulacionais do grafo nSo
carrcgam pesos; des meramente fomceem diretes de fluxo de sinal no grafo.
Um grafo orientado parcialmenle completo definido dessa forma ó referido como um gra/o
arquitetural) que dcscrcvc a planta da rede neural. Ele o ilustrado na Fig. 1.11 para o caso simples
de um único neurónio com m nós de fonte e um único nó fixo em +1 para o bias. Note que o nó
computacional que representa o neurónio está mostrado sombreado c o nó de fonte c mostrado
como um pequeño quadrado. Esta convengo é seguida em lodo 0 livro. Exemplos mais elaborados
de plantas arquiteturais sfto apresentados na Sc^áo 1.6.
Para resumir, temos tres rcprcscntacoes gráficas de uma rede neural:
• Diagrama cm biocos, que fomccc uma dcscricác funcional da rede.
FIGURA 1.11 3rata arquitet u ral da
um naurónio
» Grafo de fluxo de siriaL que fúmese urna describió completa do ftuxo de sinal na rede.
• Grato arquitctural. que descreve a planta da rede.
1.5 REALIMENTAQÁO
Dizemos que existerealítHefttatfü em um sistema dinámico sempre que a saída de um elemento do
sistema influencia cm parte a entrada aplicada áquelc elemento particular. Originando assim um ou
mais de um caminho fechado para transmito de sinais em torno do sistema. Na verdade, a reaLi-
menlacao ocone em quase tedas as partes do sistema nervoso de lodos os animáis (Freeman, 1975).
Além Jisso4 cía desempenha um papel importante no cstudo de uma elasse especial de redes ncurais
ccmhccidas como redes recórtenles. A Figura 112 mosira o grafo de fluxo de sinal de um sistema
realiineRíado de laca único, onde o ¡sinal de entrada jt(jj), o sinal interno j. '(>;) eo sinal do saída v,(rt)
sao funches da varia vel de tempo discreto n. Assume-se que o sistema seja linear. consi Blindo de um
caminho di reto e de um caminho de real: inentacáo que sto caracterizados pelos “operadores’* A e B,
FIGURA 1.11 Grata de 1luxo da sinal de
um sistema realimenladD com Ibj;ü única
respectivamente. Em particulada saldado canal dircto determinacm partesua propria saídaatravés
do canal de real i mentado. Da Fig. 1.12 notamos fácilmente as seguimos relaijóes de entrada-saída:
[.v.W]
(1.16)
X.^1) i- H Lvx(n)J
(1 17}
onde os colchetes &¡So incluidos para enfatizar o falo de/I cB agircm como operadores. Eliminando
.r VO entre as cqs. (l. 16) c (1.17), obtemos
h 00 = —-—[x.(*o|
J l-X5L ' J
(1.18)
Rcfcrimo-nos a ] - AH) como o operador de ia^ófechada do sistema, e a Afi como o operador
de luco abert™. Em gerak o operador de taco aherto náo ¿ comida ti vq no sentido de que HA * AB.
Considere» por excmplo, o sistema rcalimentado de taco único mostrado na Fig. L. 13, no qual
A ú um peso tixu. cí cum operador de atraso unhtiriii^ z k cniia saída está atrasada cm relajo
iMTRGOLQto 45
FIGURA 1.13 Greta-de flu*Q de sinal de
um fiiltro de respoEta a impulso de d dragaa
infinita [Hfí. intrnite-dwation impu¡S9
respan&s], de prim&ira ordem
á entrada cm uma unidade de tempo. Podemos enlao ex pressar q operador de lapo fechado do
sistema tumo
A _ ic
I - ~ I -V7 1
= W(i-WÍ ') 1
Utilizando a expansao binomial para (l - «•; 1) ', podemos rescrever o operador de 1 a<;c fechado do
sistema como
.4
I - AB
.-ii
:
(1.19)
Assim, substitLÍndo a Eq. (1.19) cm (1.18), oblemos
ytOi}= J [.¥>)] (1 20)
onde novamente incluimos os cólcheles para enfatizar o falo der 1 scrum operador. Em particular,
da definido de z 1 temos
tJ [<001 " x/« - 0
(1.21)
ondc.r (zr - J1) é uma amostra do sinal de entrada atrasada de ! unidades de tempo. Conscqíientcnnerv
teT poetemos expressar o sinal de salda; .(h) ramo uma soma ponderada infinita das amostras pre-
sentes c passadas do sinal de entrada jt/ji), como mostrado por
v-
J ; («) = £«7'*’ *0
(1.22)
Vemos claramente agora que o comportamcnto dinámico do sistema é c unir o lado pelo peso W. Em
particular, podemos distinguir deis casos específicos:
I, |ir| < ]. para o qual o sinal do salda jj({») ó exponencial mente ctwergtW; isto é, o sistema é
¿íídvífZ kto é ilustrado na Fig. 1,14a para um ir positivo.
Z |w| > I, para o qual o sinal de salda c isto é, o sistema c instável. Se jü| = I a
divergencia é linear como na Hg. 1.14h, c se f?v| > L a divergencia ó exponencial como na Fig.
1.14c,
A estábil idade lem papel de destaque no estudo de Sistemas rea! ¡mentados.
O caso de it’| < I corresponde a um sistema com memoria infinita no sentido de a salda do
sistema depender das amostras da entrada que se eslendem sobre o passadü infinito. Alóm disso. a
memoria é eswecertte já que a inilucncia de uma amostra passada se reduz exponencial mente com
o tempo n.
A análi&e do comportamento dinámico das redes ncurais en vol vendo a api ¡cacao de rcalimcu'
lafao nfelizmente c complicada pelo falo de as unidades de proccssamento utilizadas para cons-
l
0 12 3 4
figura 1,14 Reiposta temporal
da Fig. 1.13 para tréj valoras dife-
r&nt&s da pasos wem um cammlxi
para ironie. (?) gsiavelr(O) Divar-
gBncia li»iMr. (c) L' ^orgflncia
expnnancial
fruir a rede serem geralmente fútodtneara. Outras considerares adicionáis sobre este assunto
serán tratadas mais adianto tiesto livro.
1 >5 AROUITETURAS DE REDE
A mancira pela qual os neurónios de uma rede nCural estad estro turados Mtá intimamente ligada
com o algoritmo de aprendizagem usado para treinar a rede. Podemos, pódanlu. (alar de algoritmos
(negras) de aprendizagem utilizados no projelo de redes neurais como sendo esíntitiradü.^ A classi-
ficacao de algoritmos de aprendizagem ó considerada no próximo capitulo, e o desenvolvimcnto de
diferentes algoritmos de aprendizagem é tratado nos capítulos suhsequentps do livrQ, Nesta sepilo,
focalizamos hossaatencáo ñas anquí ícturaií (cstroluras) de redo. Em geral, pedemos identificar tres
classes de arquiteturas de rede fundamentalmente diferentes:
1. Redes Alimentadas Adiante com Camada Única
Em urna rede neural a» ¿.amadas, os neurónios cstao organizados na forma de camadas. Na forma
mais «implen de urna rede cm camadas, temos uma etunada de entrada de nós de fonte que se
projeta sobre uma camada de suida de neurónios (nós computad ornáis), mas n3o vice-versa. Em
entras palavras, esta rede é estritamente do tipo af¡mentada adíame mi acicHea, Ela é ilustrada na
ImtroolcAo 47
Fig. 1.15 para o caso de quatro res canto na camada de entrada como na de salda. Esta rede é
chamada de rede de camada ártica. sendo que a desígnalo “camada única'1 se refere á camada de
saída de nos compulacionais (neurónios). Njin COtilamos a camada de entrada de nós de forte,
porque 1á rúo ó realizada qualquer computando.
Carnuda Jl_ Lnlrjilü . Jú
íieururiiús, de fúme
Cániaila de uuL
de iied róiiió-i
FIGURA 11.15 Rada alimentada
adíente ou acidia com uma
única camada da neurónios
2. Redes Alimentadas Dlretamente com Múltiplas Camadas
A segunda elasse de uma rede neural alimentada adianto se distingue pela presenta de unía ou mais
camadas och/Ah, cujas nos compulacionaís siu chamadoscontspondentemenledeneun&ftiasacuif/js
ou ttculfax. A fuinjao dos neurónios ocultos éinterv ir entre a entrada externa e a salda da
rede de urna mancira. útil. Adicionandc-sc uma ou mais camadas ocultas, tomamos a rede capaz de
cxtt&ir cstotfclicu de ordem elevada. lún uní sentido bastante livre, a rede adquire uma perspectiva
gtobctf apesar de sua concclividade local, decido ao conjunto extra de concxócs sinópticas c da
dimensáo extra de intenses neurais (Churchland c Scjnowski. 1992). A hábilidade de os neurónios
ocultos ext miren cstal Esticas tic ordem elevada é particularmente valiosa quando o tamañito da
camada de entrada é grande.
Os nos de fonle da camada de entrada da rede fomcccm os respectivos elementos do padráu de
ativaffto (velor de entrada), que constituem os stJiais de entrada aplicados aos neurónios (nos
compulaciortais) na segunda camada (í.e.. a pri meina camada oculta). Os sinnis de salda da segunda
camada sao utilizados como entradas para a tercera camada, c assim por diantc para o resto da rede.
Ti pica mente, os neurónios em cada camada da rede tém como suas entradas apenas os sitiáis de
suida da camada precedente. O conjunto de abluís de suida dos neurónios da camada de Mída (íinaI)
da rede constituí a resposta global da rede para o padrau de ativa^ao fomucido pelos nos de fonte da
camada de entrada (primeira). O grafo arquilctural na Fig. 1.16 ilustra a planta de uma rede neural
de múltiplas camadas alimentada adianto para o vaso de uma única camada uculia. Porconcisao, a
rede na Fig. 1.16c referida como uma rede 10-4-2 porque ela tcm ID neurónios de fontc, 4 neurónios
ocultos c2 neurónios de sai da. Como um nutro ejemplo. urna rede alimentada achante com m nós
de fonle, h neurónios na primeira camada oculta, /i, neurónios na segunda camada oculta c q neurónios
na camada de uídn é referida como urna rede m-h^k q.
A rede neural da Ftg. 1.16 é dita iaíafmente enneciada, no sentido de que cada um dos nos de
uma camada da rede está conectado a todos os nos da camada adjaccntc seguí ntc. Entretanto, se
alguns dos dos de comunícacao (concxócs Mitápticas) esliverem faltando na rede, dizemos que a
rede ^pttKlüintunít: ctutncfiuia.
FIGURA 1.1B ftede alimsnlada
ad ar la ou aciclica totalmente
conectada cdíti uma camada oculte
e uma camada de caída
Camada de
entrada da
ntade tente
Camada da
rteurOnióS
ocultos
Camada da
neurfinios
de salda
3. Redes R eco frentes
Uma fvtie neurül recórreme se distingue de uma rede neural ah mentada adianto por ter pelo menos
um I¡ko de reaii'fnetiia<;¿¡ü. Uma rede recurrente pode consistír, por exemplo, de uma única camada
de neurónios com cada neurónio alimentando jeu sínaL de saída de volts para as entradas de todos
os outros neurónios» como ilustrado no grafo arquitctural da Fig. 1.17. Na estrutura representada
nesta Itgura» ndo há lafos de autorealimenta^áo na rede; auto-reakineniafSoscrcfcrca uma sitúa-
q3o onde a saída de utn neurónio é «alimentada para a sua própria entrada. A rede recorren! e
FIGURA 1.17 ñette recórrante ssm
tarjos de aiUte-itePlimente^BO sen
neurOniw ocuNos
iMKlDUIr’ÁO 49
ilustrada na Fig. 1.17 tambémn¿o tem neurónios ocultos. Na Fig. 1.1 8., ilustramos uma mitra classc
de redes recurrentes CúiTi neurónios ocultos. As concxñcs de ncalimcntagáo mostradas na Fig. LIS
se originan! dos neurónios ocultos bem como dos neurónios de safda.
A presenta de lagos de real i mentaban, quer se.a na cstrulura rucorrcnlc da Fig. 1.17 ou naque-
la da Fig. LIS, tem um impacto profundo na capacidade de aprendizagem da rede e no seu desem-
penho. Além dissci,<is lagos de realimentagáo cnvoivcm o uso de ramos particulares compostos de
elementos de atrasa ujnfthíG (representados por; o que resulta em um comporta mentó dinámico
n&ü-lineíir, admitmdo-sc que a rede neural contenta unidades nao-Lineares.
1.7 REPRESENTADO DO CONHEClMENTO
Na Segáo l.l, utilizamos o termo "ocxihecinienttf na definig Jo de uma rede neural, sem uma des-
criban explícita de que isso significa para nós. Agora nos ocuparemos desse assunto ofcreccndo a
seguinte definido genérica (HuMer e Firsebein, 1987):
Cutiheeimentú se refere ti ’iunenoda <mj n modelos utilizados par ftoiapessoa au
máquina para mrcrpn'iaK prever e responder aprapritidíituefrrr uo mundo exterior.
Sin duas as principáis características da representadlo do conhecimento: (1) que informaba a ó
realmente Lomada explícita; c (2) como a informapáo é codificada físicamente para o uso subsc-
quelite. Portante, pela sua prúpria natureza, a representaban do conhceimcnto c dirccionada a um
objetivo. Em aplicares do mundo real de máquinas “inteligentes”, podemos dizer que urna boa
solugao depende de uma boa representagao do conhceimcnto (Woods, 1986). Assim tambem o c
com as redes neurais que rcpresenlam uma das.se especial de máquinas inteligentes» Típicamente,
entretanto, as formas possiveis de representado desde as entradas até os parámetros internos da
rede sao mirto diversificadas, o que tende a tomar o desenvolví mente de uma solugáo salufatória
útil izando uma rede neural um desafio real do projeto.
Uma tarefa importante para uma rede neural é aprender um modelo do mundo (ambiente) no
qual cía está inserida e manter o modelo suficientemente consistente com o mundo real de mancira
Copyrighted materi
a atingir os objetivos especificados da aplicado de intcrcsso, D conhccimentó do mundo consiste
de dois tipos de informadlo:
L O estado conhecido do mundo, representado pelos falos sobre o que é e o que era conhecido;
esta Forma de conhccitnealo ó chamada de üijfonwacáo prévía.
2. As observares (medidas) do mundo, obtidas por mcio de sensores proj ciados para sondar o
ambiente no qual a rede neural deve operan Normalmente, estas observa^óes sáo ioerentemente
ruidosas, sendo sujcitas a erres devido a ruido do sensor e imperfeí0es do sistema. De qualquer
maneira, as observares que sSo assim obtidas fomecem o conjunto de informales de onde
sita retirados vtexempfas utilizados para treinara rede neural.
Os exemplos podem ser rutttkida'i ou ndo-ra/u/adar Nos ejemplos rotulados, cada cxc implo que
representa um final de entrada é ajsociado a uma r•empasta ¿¡enejada correspondente (Leu, saída*
alvo), Poroutro lado, os cxcmplos nao-rolulados consistem de ocorrencias diferentes das próprios
sinais de entrada. De qualquer maneira, um conjunto de ejemplos, rotulados on n3o, representa o
conhccimentó acerca do ambiente de interesse que uma rede neural pode aprender através de treina-
mento.
Um conjunto de pares de entrada-saída. com cada par consistindo de um sinal de entrada c a
resposta desejada correspondente, é referido como tí/n conjunto ¿le dados de ireinsmento ou ct/íioi-
tí-u ¿fe treinamenffi. Para ilustrar como este conjunto de dados pode ser utilizado, considere, por
exemplo, o pmbtcma da tvconíteci menta de um digit¿> manuscrito. Ncstc problema, o sinal de entra-
da consiste de uma imagem com pócela (elementos da imagem) pretos ou brancos, com cada tma-
geni representando um dos 10 dígitos que estáo bem separados do fundo. A resposta desejada c
definida pela "idcnñdadc" do dígito particular cuja imagem c a presentada para a rede como o sinal
de entrada. Típicamente, a amostra de treinamento consiste de uma grande variedad? do dígitos
manuscritos que sao representativos de urna situado do mundo real. [Jado este conjunto de exem-
ploSt o projcío de uma rede neural pode prosseguir como segué:
• Primetro, uma arquitetura apropriada é selectonada para a rede neural, com uma camada do
entrada con'isr ndo de nós de fonlc iguais cm número aos/?ürt.j/s de urna imagem de entrada, e
urna carnada de saída consistindo de IQ neurónios (um para cada dígito). Um subconjunto de
cxcmplos ccntáo ulilirado paratreinara rede pormcio de um algoritmoapropriado. Esta lase
do projetu da rede c chamada de apiendizagem.
• Segundo, o desempenho de reconhccimentó da rede [reinada é testado com dados nao apre-
sentados anteriormente. Específicamente, unía imagem de entrada c apresentada para a rede,
mas dista vez nao Ihc c fomccida a identidade do dígito que corresponde a esta imagem
particular. O desempenho da rede é cntáo estimado comparando-sc o recunhcciirticnto do dígi-
to fomecidopda retic com a real identidade do dígito em questáo. Esta segunda fue da opera-
cáo da rede é chamada genertrtizueütK um termo emprestado da psicología.
Aquí se en contra uma di lerenda fundamental entne o proj el o de uma rede ncural c o de sua
contrapartida, o pnoccssamento de Informado classicn (classifica^ao de padrees). Ncstc último
caso, normalmente procedemos primeiramente formulando um múdelo matemático das observa-
res do ambiente, validando o modelo com dados reais. c cntáo cstruturando o projetu com base
neste modelo, O prejeto dv uma rede neural, ao contrario, é bascado diretumente nos dados do
mundo rcalt/>enM/|lóh/r>-.ve tpít' o ¿mnjmutf ¿le dttdosfale por si mesmo. Assirn, a rede neural nao
somente fomcce o modelo implícita do ambiente no qual cía está inserida, como também realiza a
fungáo de processamenfó de mferma^áo de interesse.
Intrcol^ao SI
Qs exemplos utilizados para tresnar uma rede neural podrm consistir tanto de ejemplos posi-
tivas CQOIO de exemplcs negativos. Em um problema de detecto passíva de sonar, por estemple, os
cxcmplos positivos sfo relativos aos dados de ireinamenlo de entrada que contfim o alvo de ínteres
se (ex.. um submarino). Agora, em um ambiente de sonar passivo. sabe-se que a presenta eventual
de vida marinha nos dados de teste causa alarmes falsos ocasionáis. Para atenuar este problema,
exemplos negativos (p.ex., ecos da vida marinha) sao incluidos nos dados de trelnamento para
encinar a rede a nao confundir a vida marinha com o alvo.
Em uma rede neural com uma arquiletura especifica, a representado do conhecimento do
meio ambiente ¿definida pelos valores assumidos pelos paramemos livres (i.e., pesos sinópticos e
bias) da rede. A forma dessa representaban de conhcrirncnto constituí □ verdadeíro projeto da rede
neural, c portanto c a chave para o scu desempenho.
Entretanto, o tema da representadlo do conhecimento no interior de uma rede artificial é mul-
to complicado. Apesar disso, existem quatro legras para a representaban) do conhecimento que sao
de seuso comum (Anderson, 1988),
Regra 1. Entradas similares de classes similares normalmente devem produzir rcprcscntaQoes si-
milares no interior da rede, e portante devem ser clasificadas como pertencentes á mesma catego-
ría
HA uma profusAo de medidas para determinar a ilsimi lat xtade" entre entradas. Urna medida de
similaridade usada fraqüentemente é bascada no conccito de distancia euclidiana. Para sentios es-
pecíficos, considere que x. represente um vetor m-por-1
cujos elementos s£o todos números reais; 0 índice superior T indica a transpaai^au mátircial. O
vetor \ define um ponto em um espado de dimensao m chamado espado euciidiant) e representado
por UíA distancia euclidiana entre um par de vetares m por I, x e x é definida por
(1.23)
onde XiJt e i', sBo os A-ésimos elementos dos veto res de entrada x, e i, respectivamente.
Corrcspondcntemcnte, a similaridade entre as entradas representadas pelos vclores x o x é definida
como o recíproco da distáncia euclidiana ¿(x,, x j. Quanto mais próximo entre si estiverem os ele-
mentos individuáis dos vetores de entrada x, e x. menor sera a distancia euclidiana d(xr xy), e
portanto mator sera a similaridade entre os vetares x c x . A regra 1 afirma que se os vetares x, e x
sao similares, cíes devem ser atribuidos á mesma categoría (elasse).
Unía nutra medida de similaridade é baseada na idéia de umprodnto escalaroupmduta inter-
no que também c tomada emprestada da Algebra matricial. Dado um par de vetores xd e x. de mesma
dimensao, o seu produto interno é x x . que na forma expandida é escrito como segue:
(x,., xj =
(124)
O produto interno (x, K} dividido por ||x | ||x é o coseno do ángulo subentendido entre os vetores
¥s/
As duas medidas de similaridadc definidas aquí esláo na verdad? intimamente relacionadas
entre si. como ilustrado na Fig- 1.19. A distancia euclidiana ||x. — x || entre os vetares Xj e x está
relacionada com a "proje^áo11 do vetar xf sobre o vetar x. A Figura 1-19 niostra claramente que,
quantn menor a distancia euclidiana ||x. - x e portanto quantc mais si mi lares forem os vetares x^ e
x , maiorserá o produto intemo x v ,
figura i .i$ ilustrado na
relajo entre o pnodutu
internó ü a distocia
euclidifiriB cetro medidas da
simllandadQ enlí« parta
Para formal izarnos esta relajo, primeiro normalizamos os vetores x e x. para terem comple-
mento unitario, ou seja.
NI = M‘i
Podemos entáo utilizar a Eq. (1.23) para cscrcvcr
= 2 2x\
(1.25)
A Equa^áo (1.25) mostra que a niirmniza^áo da distancia euclidiana J(xp xi corresponde á
maximizaijáo do produto interno (x, x)e, portanto. da similaridadc éntreos vttOtes x e X-
A dísl&ncia euclidiana e o produto interno descritos aquí sáo definidos em termos
detcmni nisticos. O que acontece quando os vetares xc x sao retirados de duas populares (fontes)
de dados diferentes? Para sexmos específicos, suponha que a d itérenla entre essM duas populaos
esteja somonte nos seus vetares medios. Considere que |1 e g representem os valores medios dos
vetores x e x, respectivamente. Istoé,
H=£|>J
11.26}
onde £é o operador estatístico esperado. O vetar medio g é definido de forma similar. Como uma
medida de distancia entres essas duas populares, podemos utilizar a dfcAmcta de MahafanobiSt
representada por d . O quadradü do valor dessa distancia de x para x c definido por (Duda e Hart-,
1973):
(1-27}
onde E‘1 é a inversa da matriz de eovariánc.a E. Assumc-sc que a matriz de covariancia é a mesma
para ambas as popúlameos, como mostrado por
In-i^ul^áó 53
1 (1J8)
= E[(x,.-p;)(i/- pJT]
Para o caso especial quando x = iT J1 = g. |A e E = I, onde I é a matriz identidade, a distáncia de
Mahalanobis se reduz A distancia euclidiana entre o vetor de amostra x. c o vetar de média p
Regra 2. Devem ser atribuidas representares bem diferentes na rede a ifens que devem ser
categorizados como classes separadas.
A segunda regra é exatamente o oposto da Regra l.
Regra 3, Se uma característica particular c importante, cntáo deve haver um grande número de
neurónios envolvidos na representado daquele ítem na rede.
Considere, por exemplo, uma aplicado de radar cnvolvendo a detecto de um alvo (p.ex.,
uma aeronave) na presenta de perturbadnos (Le,, reflcxoes de radar por alvos indesejáveis como
edificios, árvores e formajes meteorológicas). O desempenho da dctcccáo dcstc sistema de radar é
medido em termos de duas probabilidades:
♦ Probabilidad? de detectan, defi nida como a probabi Iidade de o sistema decidir que o alvo está
presente, quando ele realmente está.
* Probabilidad? de abarme /abo, definida como a probabtl idade de o sistema decidir que um
alvo está presente, quando na realidade ele náo está.
De acardo com o criterio de Neyman-Pearson, a probabil idade de delecto é max ¡raizada, sujeita á
restripao de que a probabilidade de alarme falso nao exceda um determinado valor (Van Trees,
1968). Nesta aplicado, a presenta real de um alvo no sinal recebido representa uma característica
importante da entrada. Na verdade, a Regra3 afirma quedeve haver um grande número de neurónios
envolvidos na tomada de decisáo se um alvo está presente, quando ele realmente estiver. Pelo mes-
mo motivo, deve haver um número muito grande de neurónios envolvidos na tomada de decisáo se
a entrada consiste apenas de perturbares, quando realmente este foro caso. Em ambas as situapóes
o grande número de neurónios assegura um elevado grau de precisáo na tomada de decisáo c tole
ráncia em relaf<¡o a neurónios defeituosos.
Regra 4. Informa^áo prévia c invariáncias devem ser incorporadas no projeto de uma rede neural,
simplificando com isso o projeto da rede por náo ler que aprende-tas.
A Regra 4 é particularmente importante porque a adcrcncia adequada a ela resulta em uma
rede neural com urna esfratura especializada (tvstñta). Isto é altamente desejável por várias razóos
(Russo, 1991):
L Sabe-se que as redes biológicas visuais e auditivas sáa muito especializadas.
2. Uma rede neural com estrutura especializada normalmente Lcm um número menor de parámetros
I ivres dispon [veis para ajuste do que uma rede totalmente conectada. Conseqüent emente, a rede
especializada requer um menor conjunto de dados para treinamento, aprende mais rápido e
frcqücntcmcntc generaliza methor.
3. A taxa de transmi ss^o de informaí^a através de uma rede especializada (J.e., a pradutividade da
rede) é acelerada.
4. O custo de constniQao de uma rede especializada é reduzidu por causa do sen (amantio menor»
quande comparada com a rede totalmente conectada equivalente.
Como Incorporar IntonHafSo Prévia no Projeto de uma Rede Neural
Uma questan importante a ser tratada, evidentemente» é como desenvolver uma cstruiura espe-
C ¡al izada incorporando inferma^áo previa no sen projeto. Infelizmente, nao há alúa] mente negras
bem-detinidas para fazer isio; cm vez dissü, temes alguns procedí men tos ad-iiac que sabemos que
produzem resultados útets. Panicularmente, podemos utilizar uma combinado de duas técnicas
(LeCunetal., 1990a}i
l Restringir a a^uiletura du rede pe lo usa de con ex eres locsi i s conhec idas como crnnp os recepti-
vas^
2. Restringir a escoiha de pesos sinópticos através do uso de cctmparrdhwnento de pesos,"
Estas duas técnicas, particularmente a última, tcm um beneficia marginal vantajoso: o número de
parámetros liivres da rede é reduzido significativamente.
Para sennos mais específicos, considere a rede alimentada adíame parcialmente conectada da
Fig. 1.20. Esta rede tem uma arquitetuna restriia por construyo. Os seis prime Iros nós de fonte
constiiucm o campo receptivo para o neurónio oculto I c assiin per diantc para os cutios neurónios
Cuihujifl. Jt
t,Ti1rad¡i di1
nde-tk ront^
Camada de CMMdl de
nmitoin nuúriMS
OCUllM de saída
FIGURA 1.20 llusEra^áo do U9O oorntoiriado de
um campo nnptfvD e de comparblharTfcertta d?
pasos. Todw » qualrc neur&ídos ocultos com-
partilham o masiro conjunta de pesos pon
Buu conextes sinópticas
ocultos da rede. Pana satisfacer a restií^in- de comp^rLilhamento de pcsosH apenas devenios utilizar
o inestmc conjunta de pesos sinápticos para cada um dos neurónios da camada oculta da rede.
Entáo. para o cxcmplo mostrada na Fig, 1.20 com seis conexocs locáis por neurónio oculto c um
erial de quatro neurónios; ocultos, podemos expressare campo local inducido do neurónio oculta /
como segué
= J= 1.23,4 {] 29)
l-l
iNTftOMKAv 55
onde MttStituí o mesma conjunta de pesos compartí hado por todos os quatro neurónios
ocultos, e Jt.éo simal captado do nó de fonte k = i + j - I. A Equa^áo (1.29) está na forma de uma
soma convoiuliva. É por este motivo que urna rede alimentada adi ante utilizando concedes locáis c
pesos compartíIhados da forma aquí descrita c conhccida como rede eanvíilutiva.
A questao de incorporar informaqáo prévia no projeto de uma rede neural é urna parle da
Regra 4; a parte restante da regra eovolve a questao das ÍDVBríáncias,
Como Incorporar Invariáncias no Projeto de uma Rede hlsural
Considere os seguintes fenómenos lisíeos;
* Quando um objeto de intcrcsse sofre rotaban, o modo como a imagem do objeto c percebida
por um observador normalmente muda de forma correspondente.
• Em um radar coerente que femece informaban tanto de amplitude como de fase sobre o seu
meto ambiente, o eco vindo de um alvo móvel é deslocado cm freqüencia pelo efeito Doppler
que surge dei ido ao moví mentó radial do alvo cm relapso ao radar.
• A tocu^áo de uma pessoa pode ser feita em uma voz alta ou baixa, e de inane ira lenta ou
rápida.
Para construir um sistema de reconhecimento de objetos, um sistema de reconhecimerttc de alvos
de radar e um sistema do reconhecimentn de voz que possa IIdar com estes fenómenos» respectiva-
mente, o sistema deve ser capaz de lidar com urna serie de do sinal observado
(Bamard eCasasent, 1991). Conseqüentemcnte, um requisito fundamental pana o reconhcci monto
de padrees é prejetar um da&siíicador que seja invariante a tais transformables. Em cutres pala-
vras, uma csiimai va de dasse representada por uma saída do dnssiíicador nao deve ser afetada
pelas transformables do sinal observado aplicado A entrada do classilicudur.
Lxistem pelo menos tres técnicas para implenicntar urna rede neural do tipo clarificador
invariante a transformabocs (Bamard e CasascnL 1991i:
1. Ittvsriánciu por Exlntrum. A invariáncia pode ser imposta á rede neura] cstrutuiando apro-
piadamente o scu projclo. Mais específicamente, as concedes sinópticas entre os neurónios da
rede sao criadas de forma que versees transformadas da mesma entrada sejam forjadas a produzir a
mesma saída. CwMÜdere, por cxcmplo, a classifiea?áü de uma imagem por uma rede neural com a
exigencia de ela ser independente a rotares no plano da imagem. em torno do seu centro. Podemos
impar uivariáncia rotacional na cstrutura da rede da seguinlc forma. Scja i¿ o peso sinóptico do
neurónio./ conectado ao pixel j da imagem de entrada. Se ÉbriQarmos a condlitio ipj, para todos
os pi'íds i c k que se encontrcm a distancias iguais do centro da imagem, cntao a redo neural scrá
invariante a rolaqócs no plano. Entretanto, para que scja mantida a invanáncia rotacional, o peso
Bhnáplico u) de ve ser duplicado para todo pixcl da imagem de entrada á mesma distancia radial da
oí igem. Isto causa uma dcsvantagcjn da invariáncia por cstrutura: o número de conexdes sinópticas
da rede nvural se loma preiMivamente grande mesmo para iinagcns de tamanho moderado.
2. fnvanánciíi por Tridnamento. Uma rede neural tem uma habí lidade natural para cl&ssificar
padróes. Esta hábil idade pode ser ex plorada di recamen Le para obter invariáncia a transformacóes da
forma descrita a seguir. A rede é tremada apresentundo-sc um número de ejemplos diferentes do
mesmo objeto, sendo os exempios cscolhidos para corresponder a diferentes transformares (i.e.,
vistas do aspectos diferentes) do objeto. Desde que o mimere de ejemplos scja suficientemente
56 Rfdfk N>~l rach
grande e que a rede wja (reinada para aprender a discriminar as v astas de aspectos diferentes do
objeto, podemos cntáo esperar que a rede general! ze coirctamente para outras transformaedes que
nao as apresentadas durante o tremamento. Entretanto, por uma perspectiva de engentaría, a
invariáncia por treinamento tem duas desvanfagens. Primciro, quando a rede neural foi (reinada
para rtconhecer um objeto de manelra invariante em rela^áo a transformares conhccidas, nao é
obvio que este trcinamcnlo tambán capacitará a rede a rccunhecer uniros objetos de classes difo
rentes» de maneira igualmente invariante. Segundo, o estorbo camputacional imposto á rede pode
ser demasiadamente severo para se licLar, especialmente se a dimensional-dade do espado de carac-
terísticas for elevada.
3- Espado de Características invariantes. A terceira técnica de criar uma rede neural invariante
do tipo clarificador está ilustrada na Fig. 1.21.
FIGURA 1,21 Diagrama em bíneos
de um sistema do tipo espado da
características invariantes
Rnlnida
Fs-li nativa
de cImm
Ela se base i a na prcmissa de que pude ser possívcl se extra ir características que caractcrizcm o
conteúdo essencial da informado de um conjunto de dados de entrada e que sejam invariantes a
transformapocs das entradas. Se tais características forcm utilizadas, cntáo a rede como um classi*
ficador é aliviada do fardo de ter que delinear o intervalo de transformares dr um objeto com
fronte! ras de deci&to complicadas. Na verdade, as únicas diferenpisque podem aparecer entre ejem-
plos diferentes do mesmo objeto dcvcm-sc a falores i nevi lavéis como mido c oclusáo. A utilizarán
de um espato de características invádanles oferecetrés vaniagens distintas. Primeiro» o número de
características api «cadas á rede pode wt reduzidoa ni veis realisiss. Segundo, a* exigencias impos-
tas ao projeto da rede sao relaxadas. Tereeiro, é ¿¡¡segurada a invarianCtá para todos os objetos cm
relajo a transformacóes conbccidas (Bamard c Casasen I» 1991). Entretanto» para que cía funcio-
ne. esta abordagem requer cotillee 11 nenio previo do problema.
Concluíndu. o uso de um espado de características invariantes, como aquí descrito, pode pro-
porcionar uma técnica multo adequada para clasificadores ociirais»
Para ilustrar a ideia de um espado de características invariantes, considere o exemplo de um
sistema de radar cocTcntc utilizado para vigilanciaaerea, onde os alvos de interesse incluem aerona-
ves, sistemas meieonológicos. bandos de pássaros migratorios e objetos terrestres. Os ecos de radar
dcslcs alvos possuem dilcrentes características espcclni.s. Alcm disso» escudos experimentáis mos-
traram que estes sinais de radar podem scr modelados bastante fielmente como um auta-
/tgflLh.Mím(AR) de ordem moderada (Haykm e Deng, 1991). Um modelo AR é uma forma especial
de modelo regresivo definido para dados de valores complexos como
*(*)= -O + íOO (1*30)
onde as sao os alicientes AR, M é a tmlent Jo madéla, Ai'nJ c a entrada c efn) é o erm
descrito como ruido branco. Básicamente, o modelo AR da Eq. (1.30) ó representado por um/rfrro
de finha de atrasa com deriva^da como ilustrado na Fig. L22a para M= 2< De forma equivalente,
ele pode ser representado por umJHin de grade (iatticefdter}, como mostrado na Fig. 1.22b, cujcs
coeficientes $3o chamados de coeficientes de reflcxao. Existe uma correspondencia de um para um
entre os codicíenles AR do modelo da Fig. I 22a e os coeficientes de rellcxao do modelo da Fig.
1.22b. Os deis modelos representados assumem que a entrada jc(n) lem um valor complexo, como
Ih’IHJÍ Jl JLJfÁK 1 57
ihi
FIGURA 1.22 Múdalo auto- ragrasswo da orttem 2: (a) modelo da linha de atraso com derivafáo;
Ib} modelo de filtro de pfflde (ítUirce ffilefy. {Q asteri$oa representa ccnjug&^aa complexa.1
no caso tic um radar eoerente, no qual os coeficientes AR e os coeficientes de reflexáo sao iodos
valores complexos. O asterisco na Fq, (130) c na Fig. 1.22 significa a con} ligandoamplia. Por
enguanto, c suficiente se dizer que os dados do radar eoerente podan ser descritos por uní conjunto
de coeficientes aiifo-regrewtvos* ou por um conjunto correspondente de aiejicú ules de iv/lexao.
Este último conjunto de coeficientes lera uma vantEi^em computar;ional, pois existem algoritmos
eficientes para o seu cálculo dn etamente a partir dos dados de entrada. Entretanto. o problema da
extrajo de características é complicado pelo falo de que objetos em moví monto produjcin.
frcqücncias Doppler Yarióvcis que dependem dir su as velocidades radia i s^ medidas em relajo ao
radar, e que tendeen a obscurecer o contcudo espectral dos coeficientes de rcficsao, nfiados como
disen minadores de características. Para superar esta dificuIdade, devemos incluir a invariüntki
Dtrppto" no cálculo dos coeficientes de refiexáo. O ángulo de fase do prime i ro coeficiente de rcfJc-
xSo vem a ser igual á freqüéncm. Doppler do sinal de radar. Conscqücntcmcntc^ aplica-so a nnruiü-
da fregancia Dnppler a todos os coeficientes de modo a remover o deslocamento Doppler
medio. lato é frito dcfiníndc~se um novo conjunto de coeficientes de refiexáo 1k',J relacionados
com o conjunto de coeficientes de rcflcxao ordinarios {calculados a partir dos dados de entrada
como mostrado a seguir:
Krp(= para m - 1,2,.,., Af (1.31)
onde 6 é o ángulo de fase do prime i ro coeficiente de refiexáo. A operado descrita pela Eq. (1.31) é
chamada de hetefódina Um conjunto de características de radar invariantes a Dappler c cntáo
representado pelos coeficientes de reflexao normalizados K'p KfJh com K' sendo o único
coeficiente do con junto com valor real. Como mencionado anteriormente, as principáis categorías
de alvos de radar de inicrcssc para vigilancia aérea sáo íorma^óes meteorológicas, pássaros, aero-
naves e o solo. Os tres prícneiros alvos sao movéis sendo que o último nao o é. Os parámetros
espectrals heteródinos dos ecos de radar correspondentes ao solo tóm ecos similares em termos de
características, aqueles de uma aeronave. Um eco do solo pode ser discriminado de um eco de
aeronave devido ao seu pequeño destacamento Doppler. Conseqüentemcnte, o clarificador por
radar incluí um pós-processador como mostrado na Fig. 1.23, que opera sobre os resultados ctsuí-
fieados (rótulos codificados) para identificar a classe do solo (Haykin e Deng, 1991). Assim, opré-
proeesMtdor da Fig- 11+23 se ocupa da extra^ao de características invariantes a Dopplcr, cnquanlo
que o pós-processador utiliza a assinatura Doppler armazenada para distinguir entre retornos de
aeronave e de sota-
F1GURA1J3 Classi I cador de sirváis de radar invariante a destacamento Etappler
Um excmplo muito mais fascinante de representado de conhecimentó em uma rede neural é
encontrado no sistema de sonar biológico du morcegos para ecotacaliza^áo. A mu ¡¡cría dos morec-
gos utiliza sinais modulados cmfrcqfiéncia (FM ou “chilro") para ti ns de rastre amento acústico; em
um sinal FM a freqúéncia instantánea do sinal varia com o tempo. Específicamente, o morcego
utiliza a sua boca para transmitir sinais FM de sonar de curta durarán e utiliza o seu sistema auditivo
como um receptor de sonar Os ecos de alvos de -nieresse sáo representados no sistema auditivo
pela atividade de neurónios que sao scíctivos a diferentes combinaqoes de parámetros acústicos.
Existan tres dimensóes neurais principáis da representado auditiva do morcego (Simnnons, 199];
Simmons c Sai lian t, 1992);
» A. freqiicncia da eco, que é codificada por "posi^o" originada no mapa de freqiiéncia da
cóclea; ela é preservada por lodo o caminho auditivo como um arranjo ordenado através de
cotos neurónios sintonizados on diferentes freqüóncias.
A amplitud^ do eco, que ó codificada por cutres neurónios com intervalos dinámicos diferen-
tes; ela se man tiesta tanto como uma sintonía de ampl ilude como no número de descargas por
esl Emulo.
• O aira.'io do eco, que é codificado através de computadles neurais (bascadas em corrclscác
cruzada) que prvduzrm resposlas setal ivas ao atraso; ele se maní fasta como uma sintonía por
distancia (alcance) do alvo.
As duas pr ¡ncip.i is. características do eco de um alvo para o propósito de formafáo de imagem sáo o
cs/wc/ro para a forma do alvo c o atraso para o alcance do alvo. G tnorcege percebe a "forma" era
termos do lempo de chegada dos ecos de diferentes superficies reílctoras (brilhos) do alvo. Para ísso
ocorrer, ¡i inforrnacáü dt freqÑénc¡a no espectro do oco c convertida em estimativas da estretura
lempímd do alvo. Experimentos conduzidos por ftimmons e co-aufares sobre o grande mereege
marrom, Epfc.itctixftaeus, identificara™ crificamenleesleprocessc de convcrsáo como consistíndo
de transformadas paralelas no dominio tempo e no dominio freqücncia pelo tempo cujas suidas
convergentes criam o atraso comum do cixo do alcance de uma imagem percebida do alvo. Aparen-
temente, a un i dade da percep^ao do morcega é devida a certas propriedades das próprias transí or-
maífies, apísar dos modos distintos como sao intcialmcnte realizadas a representado temporal do
atraso do eco do sistema auditivo e a representado em frecuencia do espectro do eco. Além disso,
as invariáncias das características sao incorporadas no processo de formacáo da imagem de sonar
para fazé-lo essenci almenie independente do moví mentó do alvo c do própric movimeoto do mor-
cego.
Retomando ao tema principal desta septo, que é a representado do conhecimento cm uma
rede neural, esta questao está dirctamente relacionada com a da arquitetura da rede descrita na
Se$to 1.6. Lamentavelmente, RÍO há uma teoría bem desenvolvida para olímizar a arquitetura de
uma rede neural que deve interagir com um ambiente de interesse, ou para avahar o modo como
modif]ca^5es na aiquüctura da rede afetam a rcprcscntacáo do conhecimento no interior da rede.
Na verdade, respostas satisfatórias para estas queslóes sito normalmente encontradas através de um
estudo experimental exaustivo, com o projet i sta da rede neural sendo uma parte essencial do ciclo
de aprend í zagem cstrutural.
Independentemente do modo como o projeto é realizado, o conhecimento sobre o dominio do
problema de interesse c adquirido pela rede de uma forma relativamente simples e di reta através de
treinamento. O conhecimento aspira adquirido ó representado cm uma forma compacta c distribuida
como pesos através de coñetes '¡mápticas da rede, bnquanto esta forma de represenia?üo de cu-
nhcci mentó permite que a rcdc neural se adapte c generaliza, infelizmente a rede neural sufre da
incapacldade inerente para explican de uma forma abrangente, o processo ccmputacional através
do qual a rede torna uma decisto ou apresenta suas saldas. Isto pode ser uma limttafto séria, parti-
cularmente naquelas ap!¡capóes onde a seguranza é a preocupado principal, como no controle de
tráfego aéreo ou no diagnóstico médico, por cxcmplo. Em aplicaron desta natureza, nao c somonte
desejável, mas também absolutamente essencial foniecer alguma fonna de capacidu^e explanallva.
Uma forma pela qual esta capacidad^ pode scr incorporada c atraves da integrado de uma rede
neural e de inteligencia artifidal em um sistema híbrido, como discutido na próxima se^ito.
1.8 INTELIGÉNCIA ARTIFICIAL E REDES NEURAIS
O objetivo da inteligencia artificial (1 A) é o desenvofvimento de paradigmas ou algoritmos que
requeiram máquinas para realizar tare fas cognilivas, para as quais os humanos sáo atualmcnlc mc-
Ihores. Esta afirmacao sobre IA c tomada emprestada de Sage, 199C. Note que esta nao é a única
definido aceita para J A.
Um iiítema de ÍA deve ser capaz de Inzer Inés cljíühs; (I ) armazenar COrthecimentOt (2) aplicar
o conhecimento aimazcnado para resolver problemas c (3) adquirir novo conhccimentó atravei da
experiencia. Um sistema de IA tem tres componentes fundamentáis: representado, raciocinio e
aprendizagem (Sagc, 1990), como representado na Fig. L24.
1. Representadlo. Provavelmente, a característica mais distintiva da IA seja o uso difundido de
uma linguagem de escrutaras ¡imbófwüs para representar tanto o conhecimento genérico sobre um
dominio do problema de interesse como o conhecimento específico sobre a soluto do problema.
Os símbolos sito normalmente formulados em termos familiares, o que toma as roprescntaqóes
simbólicas da JA relativamente facéis de serem entendidas por um usuárto humano. De fato, a
clareza da IA simbólica a toma bastante adequada para a comunicado homem-máquina.
FIGURA 1,24 Ilustra?!» dos
irés componantes principáis de
um sistema do IA
"Conhecimento11, como c utilizado pelos pesquisadores de IA, é apenas mais um termo para
dados, lile pode Mf do tipo declarativo ou procedí mental. Em uma rcprcscntaQao dectareitiva, o
conhecimento é representado como uma colero estática de fotos, com um pequeño conjunto de
procedí montos gerais utilizados para manipular os tatos. Uma característica particular das repre-
sentadles declarativas é que cías pareccm possmr um si^nilícado próprio, do ponto de vista do
usuario humano, independen le do sen uso dentro do sistema de IA. Em uma representarán
pmeedimentat, por outro lado, o conhecimento está incorporado em um código executável que
representa o significado do conhecimento. Ambas as formas de conhecimento, declarativo e
procedí mental, sao ncccssárias na maioria dos dominios de problemas de interesse.
2. Xactocínto. Na sus forma mais básica, racfocfaj/j é a habilidadede resolver problemas. Pan um
sistema ser qualificado como um sistema de raciocinio, ele deve satis fazer certas condiQocs (Fischlcr
e Firachein. 1987):
• O sistema de ve ser capaz de expressar e resolver uma vasta gama de problemas e tipos de
problemas.
• (.) sistema deve ser capaz de tomar conhccidas para ele tanto a inforroaQáo explícita como a
i idbrmagiki implícita.
• O sistema deve ter um mecanismo de cfmtrvte que determine quats operaedes devem ser apli-
cadas para um problema particular, quando uma soluto para este problema foi cbtida, ou
quando deve ser encerrado o iratamentn deste problema.
A resoluqao de problemas pode scr vista como um problema de busca. Uma maneira comum de
lidar coma “busca" é utilizar negras^ tiatiaa e CQtiiinle (Ní Jsson, I9R0). As regías operam sobre Os
dadas,, e o controle opera sobre as regias. Considere; por exemplo, o “problema do caixeiro viajan-
te’1, no qual o objetivo é encontrar o roteiro mais curto que vá de uma cidade para outra, com todas
lis cidadcs no roteiro sendo visitadas somente uma vez. Ncste problema, os dados silo constituidos
pelo conjunto dos roteiros possívcis c pelos seus custos em um grato ponderado, as regras dclincm
as maneiras de pro&seguir de uma cidade para outra, e o controle decide quais regras devem ser
aplicadas c quando apkcá-las.
Em multas ^tuafóes encontradas na prálica (p. at., no diagnóstico medico), o conhecimen-
tó disponível é incompleto ou jnexalo. Em tais situares, sáo utilizados procedí mentes de raciocí-
nfopermitindn des|e modo que sistemas de IA lidem com incertezas (Russell e
Norvig, ] 995; P«r1,19KS).
5. Aptvfíiiiza^em. No modelo pimples de aprendizagem de máquina representado na Fig. 1.25, o
ambiente fomecc alguna infürma?áo para um el^mefítü de aprendiingetn.
Inthodu^Aci 61
FIGURA 1.25 Modala simples de aprendizagem máquina
O elemento de aprendizagem utilizo, etnáo, esta infarmaeáo para aperfei^oar a bti$e de cnrjljeci-
ni&tlo, e final mente o ¿tememo de dexempenlrtt utiliza a base de conheci mente para cxcciitar a su a
tarefa. Normal mente, a inte miarán que o ambiente fomece para a máquina é imperfeita, resultando
que o elemento de desempenho náo sabe previamente como preencher os detalhes ausentes ou
ignoraros dctalbcs que nao sao importantes. Portanto, a máquina opera iniciaImcntc por suposiqáo
e depois recebe rvatimenití^ü^ dci elemento de desempenhe. O mecanismo de real i mentado permi-
te que a máquina avahe suas hipóteses o as revise, se nccessário.
A aprendizagem de máquina envolví dois t i pos bastante diferentes de processamento de inícr-
mnffo: o indunvoeo dedutivo. No processamento de informado indmivo, padróes genis e negras
sao determinados a partir dos dados brutos c da experiencia. Poroutro lado, no processamento de
informando deditfivü sáo utilizadas negras gerais para determinar latos especificas. A aprendizagem
bascada cm similaridadc utiliza indu^áo, cnquanlo que a pro va de um teorema c uma deducáo
breada em axiomas conhecidos e cm nutras teoremas existentes. A aprendizagem baseada em
explanado utiliza tanto indu^&ü como deducáo.
A importancia das bases de conhceimcnto e as di (lenidades experimentadas com a aprendiza-
gem levaram ao desenvnlv tinento de vanos métodos para apedciQOor as bases de ccmheeimetilo.
Específicamente, se existirem especialistas em uma dada área, c normalmente mais fácil obter a
experiencia compilada dos especial ¡sí» do que tentar duplicaros experimentos que os levaram a
adquirir esta experiencia. Esta c a ideia por tras dos sistemas especialistas >
Agora que nos familiarizamos com as máquinas da IA simbólica, como nós as compararíamos
eflm as redes neurais como modelen cognitivos? Para esta comparado, seguimos tres stibdivisocs:
o nivel de explanado, o estilo de processamenioea cstrutura representativa (Meinmi, 1989K
1. Nivel de Expianafíto. Na IA clássica, e dada enrase á conslrucáo de representares simbóli-
cas, que sáo presumívelmente assim chamadas porque representan! algo. Do ponto de vista da
cognicáo, a IA assumc a existencia de representadles mentáis e cía modela a cogni^áo como o
pnocessameniítxL'qüeneialde rcpresenia^ñes simbólicas (Newell e Simón. 1972).
Porouiro lado, redes neurais a ¿n lase está nodesenvoh 1 mentó de modelos deprocestamefiifi
pai^uleiamefílc titslrihuída (PDF, Partdlcl DistribufedPmcesxing). Estes modelos assuinein que n
processamento de inferma^áo acontece atraves da interacaa de um grande número de netirflnics,
onde cada neurónio envía sinais excitadores e inibitóríns para outros neurónios da rede (Rumclhan
e McClelland, 1986). Alérn disso, as redes neurais dao grande énláse á cxplana^áo biológica dos
fenómenos cognitivos.
2. Estila de Pmeessuffíefítn. Na IA clássica, o processaiTicnto é .teqiieni.icsL coma lia progrílma-
fio de computadores típica. Mesmo quando náo há urna ordenado predeterminada (listando'se os
Tatos c as regras de um sistema especialista, por cxemplaX as operaeñes sáo executadas pas.su a
passo. O mais provávd é que a inspiracáo para o processamento sequen-íal lenha viudo da natureza
seqñencial da linguagem natural e da inferencia lógica, bem como da csirutura da máquina de von
Neumann. Nao devenios csqucccrquea IA clástica sutgiu pouco depois da máquina de von Neumann,
durante a mesma era intelectual.
O paralelismo, ao contrario, nao é somente um conceito esencial ao processamento de infor-
madlo cm redes asumís, mas é também a fente de sua ílexibiLdade. Alera dtsso, o paralelismo pode
ser macizo (centenas de milhares de neurónios}, o que da as redes neurais uma forma notável de
robustez Como a computadlo está distribuida sobre muitos neurónios^ normalmente nao importa
multo se os estados de alguna neurónios da rede se desviarem de seus valores esperados. Entradas
ruidosas OU incompletas podem aínda ser rcccnhccidas, uma rede danificada pode aínda ser capaz
de funcionar satisfatoriamente, e a aprendizagem nlo precisa ser perfeita O desempenho da rede se
degrada suavemente dentro de um corto limite, A rede pode se lomar aínda mais robusta atreves da
“codificado grosseirah (Hinton, 1981), pela qual cada característica é espalhada sobre varios
neurónios.
3. Eslnríurfí Representativa- Consiiderandn que perseguimos uma linguagem do pensamentocomo
um modelo para a IA classica, constatamos que as representaqües simbólicas possucm uma esf/-«íw-
m quase lingüistica. As expressites da IA clássica, assim como as expressóes da linguagem natural,
sao feralmente complexas, construidas de uma forma sistemática a panir de símbolos simples.
Dado um repertorio limitado de símbolos, novas expressócs significativas podem ser compostas cm
virtude da MpocídWt* de ctímpnsicáo das expreses simbólicas e da analogía entre a estrulura
sinlática c a semántica.
A natureza e estrutura das reprcscntacocs c, contudo, um problema crucial para as redes neurais.
Na edi^ao especial de mar^o de 1988 datcv ista Cagnificnt, Fodor c Pylyshyn fazcm criticas vigoro-
sas sobre a adequa^o das redes neurais em lidarcom cognifloe lingüistica. El es argumentara que
as redes ncurais cstáo do lado errado em duas qucstocs básicas da cognipao: a natureza das tvpra-
xEnia^-vrx mentáis e a natureza des pmces.w* mentáis. De acorde com Fndor c Pylyshyn, podc-sc
afirmar para as teorías da IA clássica, mas nao para, as redes neurais, que:
• As representares mentáis ex i bem de forma característica uma estrutura con si i tu inte
combinatoria e semániiea combínatária.
* Os procesaos mentáis sao caractcristi camcntc sensíveis á cstrutura combinatoria das represen-
tantea sobre as quais eperam.
En) resumo, podemos dcscrcvcra IA simbólica como a manipulaqáo formal de urna línguagetn de
algoritmos e representacóes de dados em uma forma de cima para baixo Por culto lado,
podemos dcscrcvcr as redes ncurais como proccssadones distribuidos paralelamente com uma habl-
Iidade natural para aprender e que normalmente operara de uma forma de baixo para cima {baiiom-
tep). Portanto, tomarse evidente que, para a implementa^áo de tare fas cognilivas, melhor que procu-
rar solufSes bascadas cm IA simbólica ou cm redes neurais isoíadamente, uma abordagcin potenci-
alrncnic mais vantajosa seria construir modelas canezinnistas estnttnrüdos ou ylsfeniux h¡bridan
que integrem ambas as abordagens. Fazendo isso, somos capazes de combinar as características
desejáveis de adaptabil idade, robustez e uní lórni idade oferecidas pelas redes neurais com a repre-
sentadlo, inferencia e universalidad?, que ,sáo características in¿rentes da IA simbólica (Feldmam
19921 Wallz. 1997). De falo, Ibi com este objetivo cm mente, que fnram desenvolvidos varios méto-
dos para extrajo de negras a partir de redes neurais tremadas. Alcm do entendí mentó de como as
abondagens si mbólica e conexión¡s(a podem ser integradas para construir máquinas inteligentes, há
varias outras razóes para a cxtratfo de negras de redes neurais (Andrews c Dicdcrich, 1996):
[ \TIÍC?L-,Á( 63
* Validar componentes de redes neura is em sistemas programados, tomando os estados i otemos
da rede neural acessíveis e compreensiveis ao usuario.
• MdhorarO dcücmpcnhu de generalizado das redes neurais, (1} identificandú rcgiñeS do espa-
do de entrada onde os dados de treiiiamcnto nao eslao adequadamente representados, ou (2)
indicando as circunstancias onde a rede neural pode falhar na generalizado.
* Descubrir características mareantes dos dados de entrada para explorado de dados (minera-
íáo de dados, data mining),
• Fornecer nietos de atravessar a fronteira entre as abordagens conexionista e simbólica para o
desenvolví mentó de máquinas inteligentes.
* Satisfazer a critica necessidade de seguranza cm uma elasse especial de sistemas na quai
seguranza é uma condiffto obligatoria.
1.9 NOTAS HISTÓRICAS
Concluimos este capítulo introdutórío sobre redes neurais com algumas notas históricas?
A era moderna das redes neurais come^ou com o trabaLho pioneiro de McCulloch e Pitts
(1943). McCulloch foi um psiquiatra eneuroanalomisla por treinamento; passou cenca de 20 anos
refletindo sobre a reprcscnta^áo de um evento no sistema nervoso. Pitts foi um prodigio matemático
que se assocíou a McCulloch em 1942. De acorde com Rail (1990), o artigo de 1943 de McCulloch
e Pitts surgí u dentro de uma comunidade de modclagcm neural que tinha. estado em atividade na
University of Chicago por pelo menos cinco anos antes de 1943, sob a lideran^a de Rashcvsky.
No seu clássico artigo, McCulloch e Pitts descrevem um cálculo Lógico das redes neurais que
unificara os estudos de neurofisiologia e da Lógica matemática. Eles assumiam. que o seu modelo
formal de um neurónio seguía uma leí “ludo ou nada11. Com um número suficiente dessas unidades
simples e oom conexóes sinápticas ajustadas apropiadamente e operando de forma síncrona,
McCulloch e Pitia mostraram que uma rede assim constituida realizaría, a principio, a computado
de qualquer fim^ao computávcl. Este era um resultado muito significativo c com ele c gcralmcnte
aceito o nascimento das disciplinas de redes neurais e inteligencia artificial.
O artigo de 1943 de McCulloch e Pitts foi amplamente lido naque le tempo e aínda o é. Ele
influencien von Neumann a usar chaves de atraso idealizadas, derivadas do neurónio de McCulloch-
Fiits na construyo do EDVAC (Electronic Dücrete Variable Automatic Computer) que foi desen'
volvido a partir do ENIAC {Electronic Numericai Integraran and Computen) (Aspray e Burks, 19S6).
O ENIAC foi o primeiro computador eletrónico de propósito geral, que foi construido na Escola de
Engcnharia Elclrica Maorc da Univcraity of Pcnnsylvaniadc 1943 a 1946. A teoría de McCulloch-
Pitts sobre redes neurais formáis se destacou de forma preeminente na segunda das quatro palestras
proferidas por v&n Neumann na University of Illinois cm 1949.
Em 1948, foi publicado O famoso livro Cyberneiics de Wiener, dcscrcvendc alguna conccitos
importantes sobre controle, común icafáo c proccssamcnto estalistico de sinais. A segunda cdiqáo
do livro foi publicada em 1961, adicionando material novo sobre aprendizagem e aulCHorganiza^ao.
No Capítulo 2 de ambas as ediles desse Il^to, Wicncr parece compreender o siguí ficado físico da
mecánica estatístiea no contexto desse assunto, mas foi com Hopfield {mais de 30 anos depois) que
se oonscguiu consumar a liga^áo entre a mecánica estatística e os sistemas de aprendizagem.
O próximo desenvoK¡mentó sigrJficativo das redes neurais vcio cm 1949, com a publicado
do li'To de Hcbb The Onganization af Behavitir^ no qual foi apresenlada pela pri metra vez urna
64 Rh>I:5N|-LRAI'í
formulado explicita de unía regra de aprendixagem fisiológica para a modificandosinóptica. Espe-
cíficamente, llebb propos que a coneciiv idade do cerebro c continuamente modilicada conforme
um organismo va i aprendendo larefai funcionáis diferentes e que írgrrfpumeBíGff nearals sfo cria-
dos poníais modificavoes. Hcbb deu seguí mentó a urna sugestáo anterior de Ramón y Cajúl c apre-
senlou 0 seu ngora famoso postulada de aprendizagem, que afirma que a eficiencia de uma sinapse
\ a: lável cnirc deis neurónios c aumentada pela atíva^áo repelida de um neurómo causada pela outra
neurónio. através daquela sinapse. O livro de Hehb foi tmensámente influenic entre os psicólogos,
mas Lamentavclmcnic ele leve punco ou nenhum impacto sobre a comunidad? de engentaría.
O livro- de Tiebh tem sido uma fonle de inspirarán para o desenvolví mentó de modelos
computad onais de .sf.tfemas' adaplaíivas e de aprenditagem. O artigo de Rocbcster, Holland, Haibt
e Poda (1956) Calve? soja a pr.mcira tentativa de usar simulaban computacional para testar uma
teoría neural bem-formulada com base no postulado de aprendí zagem de Hebb; 09 resultados de
simulado relatados naquele artigo mostram claramente que se deve adicionar inibiijáo para que a
teoría realmente funcione. iNaquelc mesmo ano. Utlley (1956) demonstrou que uma rede ncurai
com sínapses modifícáveis pode aprender a classificar conjuntos simples de padroes binarios em
classes corrcspondcnies. Uttlcy introduziu o assim chamado neurónio integra e dispara emnfitga, o
qual fui mais tarde analisado formalmente por Caí amello (1961). Um um traba Ihu posterior, UtUcy
(1979) formolou a liipótese de que a eficiencia de uma sinapse variável do sistema nervoso depende
da rclacao cstalistica entre os estados 11uluantes cm ambos os lados daqucla sinapse, fazendo assim
uríici assuciüQáo confia teoría da informado de Shnnnon.
Em 1952, foi publicado o livro de Ashby, Designfiirü Brain: The Origin ofAdoptivoBehuviWt
que é tüo fascinante de ser lido hoje em di;i como deve té-lo sido naquela época. O livro trata da
noqáo básica de que o comportamcnlo adaplativo nao é inato mas sim c aprendido, c que alravés da
aprrndizagem o ccmportamentii de um animal (sistema) normalmente muda para melhor. O livro
en (atiza va os aspectos di mímicos do organismo vivo como uma máquina e o cunee ico eorrolaciunadu
de estábil idade.
Em 1954. Minsky escreveu urna tese de doutorameolo em “redes neurais" na Univcrsity oí
Príncelon. intitulada “Thcary of ^eurai-Analag Reinfarcement Sysfems and lis AppUcntian lo tke
Brain-Madel Ptxrbiem". Em 1961, foi publicado um artigo excelente de Minsky sobre IA intitulado
"ó’ltp.s Timan/ Arfificial IiUe/ligenee"[ este artiga cantém urna grande seijao sobro o que agora é
denominado redes neurais, Em 1967. foi publicado o livro de Minsky, Cüfítpttfat¿<>n: Flttlte and
fnfitúfeMachines. Este livro. escrito de forma clara, estendeu os resuliados de 1943 de McCulloch
c Pitts e os cnlncou no contexto da teoría dos auto matos e da teoría da computado.
Também em 1954, a idéia de im./j/íai adapluítia nao-linear íoi propostd porGabor, um dos
pierna i ros. da teoría da comunicando e o inventor da bo logra ti a. Ele construí u essa máquina com a
anida de colaboradores, e os dcialhos estilo descritos em Gaborct al. (1960). A aprendízagem era
realizada al i mentando-so a máquina com amostras de mn prccesso estocásl ico, juntamente cum a
l’.ir^dn-ahi' que ü máquina deveria produzir.
Nos anos 50, .nicióu-w o trabaIho sobro a .menifiria assf>cífítiv¡¡ por Tjylcr (1956). Ele foi
seguido por Sleínbruch (1961) que introduziu a mitriz de aprendizagem; esta matriz consiste de
uma rede planar de chaves interpostas entre arranjos de receptores “sensoriais" c ¡Hiladores “moto-
res". Em 1969» foi publicado por Willshaw., Uuneman c Longucl-Higgins um elegante artigo sobre
a meniój:.i asociativa nác-hülograñca. Este artigo aprevenía deis modelos engcnhasos de rede; um
sistema ótico simples real izando urna memoria de corrcla^áo c uma rede neural intimamente
relacionada com ele, inspirada na memória ópliea. üutras contribuiooes significativas ao desen-
volvinténto inicial da memoria associaj -. a inclucni o.s artigo* de Anderaon (1972), Kohoncn 11972)
c Nakano (1972), que de mane ira independente c no mesmo ano introduziram a idéia de uma fnemó-
riapor matriz de correia^dot bascada na regra de aprendixagem do p/oduíti externo.
Von NcurtiHDn foi unía das grandes ilguras da ciencia na priraeira mctadc do Sáculo vintc. A
urcfuiieiura de von Neitmenit, básica para o prqjeto de um compuiadur digital, é assim denominada
em sua homenagem, Em 1955, fui convidado pela Univcraidadc de Yate para proferir as Palestras
Silliman durante 1956. Ele inon-eu em 1957» e o manuscrito inacabado das Palestras Silliman loí
publicado mais tarde como um livro, TheCo/upuler and íhe fírain (1958). Este Iívfq C Ultercssante
porque sugere o que von Neumann (cria fciiu se üvesse vivido; ele tena sedado corta das diferen^as
profundas entre cerebros e computadores.
Uma questáo particularmente interessante no contexto das redes neurais c aqueta do projeto
de urna rede cnnfiávcl com neurónios que podem ser vtitoít como componentes nBfr-oonfiAveis. Este
problema impórtame foi resolvido por von Ncumann (1956) utilizando a ideia de redundancia, o
que motivou Winograd c Cowan (1963} a sugerir a utiliza^áo de uma representado redundante
distribuida para as redes neurais. Winograd cCwan mostraram como um número grande de ele-
mentos pode coevamente representar umconceito individual, com o aumento correspondente cm
robustez c paralelismo.
Cerca de 15 anos após a publicado do elásüico artigo de McCullcch c PitTs, uma nova abonda-
getn para o problema de recofihcciinentn de parirte*. foi iniruduzída por Rosenbtalc (1958) em seu
trabalho sobre o perceptrvn, um método i novador de aprendizagem supervisionada. O coroaincuto
do [i ;ibalho de Rosenblatt foi o chantado feortnna da convergencia do percepnum. cuja priimcira
dcmonstraqáo foi delineada por Roscnblatlf 1960b); outras provas do teorema lambein apareceram
em Novilíoff(l963) e outros. Em 1961), Widrow e I loff introduziram o algoritmo do mínimo qtta-
dmdo medio [LMS. LeaxtMean-Sfpiarc) e o usaram para formular o Adaline (adaptivelinear elemenf,
elemento linear adaptativo). A diferen^a entre n perceptora e 0 Adaline está no procedí mentó de
aprendizagem. Uma das priimeiras redes neurais cm camadas treináveis com múltiplos elementos
adaptad vos foi a estrutura Madaline (muiíiple-atialtrtv) prcposta por Widrow c seus estudantcs
(Widrow> 1962). Em 1967, Amar i líT.Iízou o método do gradiente estocase. <0 para classifíca^ao
adaptaliva de padrtes. Em 1965» foi publicado 0 livro de Nílsson, Leaming Machine* que aínda é a
exposi^áo mais bem escrita sobre padróes linyarmente separareis por hipcrsupcrlkics. Durante O
periodo clássico do perceptren nos anos 196Ü, parecía que as redes neurais podenam realizar qual-
quer coisa. Mas entáo veio 0 livro de Minsky c Papcrt (1969), que uflilizaram a matemática para
demonstrar que existem limites lúndamcnlais para aquí lo que os pcrccpErons de camada única po-
de m calcular. Em uma breve sc^áo sobre pcrceptrons de múltiplas camadas, des aftrmavam que nao
havia razáo para sopor que qualquer uma daj bmitaqóes do perceptron de camada única poderla ser
superada na versáo de múltiplas camadas.
Um problema importante encontrado no projeto de um percepción de múltipla^ camadas é o
problema de atribid^'ao de crédito (i.C., O problema de atribuir crédito a neurónios ocultos da rede).
A terminología "atribulan de crédito*' foi utilizada prime i no por M m&ky (1961 )r sob o titulo de "O
Problema deAtribuifAo de Cródile pura Si?¡tLiii;i'i de Aprendizagem por RcibrifO’1. No fítud dos anos
1960 já ha vi a sido formulada a maioria das idé jas e conceitos twcessdrios para resolverá problema
de atrihuicáo de crédito do pcrccptron, bem como muñas das i.dé i as que fundamentan; as redes
(neurais de atratores) recorrentes que sao agora denominadas redes de Hopíield. Entretanto, I¡ve-
mos que esperar alé os anos 80 para que emergissern as solugfles para esses problemas básicos. De
ftcOrdo com Cowan (1990) houvc trés razues para este al raso de úUis de 10 anos;
• Uma razao foi tecnológica - nao ha1, ¡a computadores pessoflis ou estatúes de trabalho para a
experimentacáo. Quando Gabor, por exemplo, desenvolveu o seu Mitro nao-linear de aprendi-
zagem, seu grupo de pesquisadores levou mais seis anos para construir □ filtro com dispositi-
vos analógicos (Gabor, 1954; Gabor ct al., 196Ü).
• A nutra razác fbi em parte psicológica c cm parte íinanccira, A monografía de 1969 de
Mfrisky e Papen cerumente náo encorajan ninguétn a traba!bar com perceptrons.tampouco
as agencias a apelar traba Ihos sobre des.
• A analogía entre redes neurais e spina de grade foi prematura. O jvrodefo da vulva de spins de
Shcrringlon c Kirkpatrick ioi inventado somonte em 1975.
Estes fatores contri bu lram de um modo ou de nutro para o esmorecimenta do interesse continuado
em redes ncurais nos anos 70. Muitos pesqtiisadores, com taccc^So daquelus que trabalhavam cm
psicología e em neurocíéncias» abandonaram a área durante aquel a década. De fato, somonte um
punhado dos pioneiros origináis mantiveram scu compnomctimento com as redes neurais. De uma
perspectiva de engen haría, podernos considerar os anos 70 como uma década de adormecimiento
para as redes ncurais.
Uma atividade importante que emergíu nos anos 70 foram os rnqxn tfííto-fjrgtimdvdA utili-
jando aprendizagem competitiva. O trabalho cm simulacro corapulacional fcito por von dcrMalsburg
(1973) tal vez tenha sido o primeiro a demonstrar a auto-organizado. Em 1976^ Wilkhaw e von der
Malsburg publicaram o primeiro artigo sobre a formado de mapas aulo-organizáveis, motivados
pelos mapas ordenados de forma topotógica do cerebro.
Nos anos B0, foram feitas importantes contribuidles em várias frentes á teoría e ao projelo de
redes ncurais» e com isso bou ve um ressurgimento do interesse pelas redes neurais.
Grossberg (198A), haseandn-se no seu trabalho anterior sobre aprendizagem competitiva
(Grossbcrg, 1972, I976a+ b), cstabcloccu um novo principio de aulo-orgar.izafáo conhccido como
tivríu da rf.vvcfJTUJícja ert/írp/ufíva (ART, Adaptíve Rexonance Theory}. Básicamente, a teoría envol-
ví uma camada de reconhccimcnto de baixo para cima (tatforH-up) c uma camada generad va de
cima para baixo (ííj/j-ü'íjtvfí). Se o padrio de entrada e o padreo real i mentado aprendido coincidi-
rem, entio ocorre um estado dinámico chamado de “ressonáncia adaplativa” (Le., amplitkufáo c
prolongamcnto daal .vidade neural). Estcjjrúrcr/iró de pmje^exparaftettfe/pat'a trásfoi rcdcscobcrto
por cutres pesquisidores sob diferentes aspectos.
Em 1982. Hopiield uiilizcrn a idéia de urna funesto de energía para formular um novo modo de
se entender a computado ejecutada por redes recorrentes com coneKÓes si crípticas simétricas.
Alcm disso, ele cstabcleccu □ isomortismo entre uma rede recorrente as^im definida c o modeio
ising utilizado na física cstattstica. Esta analogía desencadeou um grande interesse da física teórica
(e dos físicos) pela modelagem neural, transformando com ís» a área de redes neurais. Esta classe
particular de redes ncurais com realimenta^ao atraiu muita atcncáo nos anos 1980, e no docorrer do
tempo tomou-sc conhccida como redes de Hop fietd. A pesar de as rede de Hopfield nfto sercm
modelos realísticos dos UBtetnas neimbiDlógicns, o principio que cías inccrporam. isto é, o
armazenamento de uformaíao cm redes dinámicamente estáveis, é profundo. A origem desle prin-
cipio remonta ao trabalho pioneiro de muitos outros investigadores:
• Cragg e Tampcrlcy (1954,1955) observaran! que assim como os neurónios podem scr+kdispa-
rados'* (ativados} ou "n3o disparados" (quicsccntcs), também os átomos em uma rede tém
seus.vpfas apernando “para cima” ou llpara baixo".
* Cowa n {1967111 itroduiiu a característica de d i sparo "sigmó i de" e a condíf áo de d taparo suave
pura um neurónio que era bascada na fundan logística,
• GnO&sbcrg (1967, 1968) intrndujiu o ffiodefa aditivo de um ncurónin, emolvendu equacóes
nao-lineares de difercnfaÁ'diferenciáis c cxplorou o uso do modelo como uma base para a
memoria de curto prazo.
IsrTFCDUtÁo 67
• Amari (1972) introduziu, de íormá independenti\ o múdelo aditivo de mu neurónio e o utiti-
zou para esludar o uomportarnenio dinámico de elementos scmelhantes a nenióme»conectados
aleatoriamente.
• Wilson e Cowan (1972) derivaran! equaqáes diferenciáis náo-1 inca res acopladas correspon-
dentes adinámica de popula^oes localizadas no espado , conlcndo ncunonios tanto excitadores
como i tilintónos.
Lidie c 5haw (1975) descreverani um nrr^/t'/oprt>buñil¡>{ittt de titn neurónio, que:' disparando
ou nao um potencial de a^áu, c usaram o modelo para desenvolver uma teoría da memoria de
curto prazo,
• Anderson, Sdverstein, Rkz e Jones (1977) propuscram o riwdcto do estado cerebral em ama
caixa (bmiit-ttíiltí-in-í^bót, 8SB), OOtUÍSlindo de uma rede MSOCiativa simples acoplada a
urna dinámica nao-linear.
Ktlo causa surpresa, portanto, que a publicarán do artigo de Hopfield cm 1982 tenha gerado tanta
Controversia. Apesar disso, foi ueste mesmo artigo que pula primeira vez o principio do
amiazenamento de informacáo cm redes dinámicamente está veis foi cxplicitado. Alcm d'sso, Hopfield
mosirou que ele havia. se baseado no modelo do v idru de ¿prní da mecánica cstatisi ica para exami-
nar ocaso especial das redes recurrentescom concxSes simétricas, garantindo com ¡saca sua con-
vergencia para uma candido estóvcl, Ein 1983, Cohén e Urossber¡; cstaheleceram trm principio
gcral para estimar a estabilidade de uma Humaría endere^áveipor ainfeúdo, que inclui a versáo de
tempo continua da rede de Hopfield como um caso especial. Urna característica distintiva de unía
rede neural de atratures é o modo natural como o tempo, urna dmenslo essencíal para a Bprcndiza-
gem, se manifcsla na dinámica nao-linear da rede. Neste Contexto, o teorema de Cohen-Grossbe^g
ó de profunda importancia.
L'm nutro desenvoh imento importante cm 1982 foi a publicado do artigo de Kohonen sobre
os mapas auto-organizáveis (Kohonen, 1982), utilizando uma cstruiura de rede unidimensional ou
tridimensional, que era cm alguns aspectos diferente do trabaIhc anterior de Willshaw e von der
MaJsburg. O modelo de Kohonen receben muito mais ateneo cm tnn contexto analítico eem rela-
jo as aplicalóes na literatura que o modelo de Willshaw-von der Malsburg. c tomuu-scuma refe-
rencia para a avalizo de entras inevapSes ueste campo.
Ltn 1983, Kirkpatríele, Gelatt a Vccclti descreyera m um novo proccdimcnlo denominado
recarimenta simulada^ para resolver problemas de olimizavuo üombinatória. O necozimentó simu-
lado tem suas raízes na mecánica quántica. Ele c bascada cm uma técnica simples que foi primeira-
muilte utilizada em simulares compuíacleñáis por Metrópolis et al. (1953) A idéi.t do recozimentO
simulado foi utilizada mais larde por Acktey, Hintori e Sejnowski (1985) no desenvolví mentó de
urna máquina estocástica conhecida como a ihíñ/jumi de Bídtzfítatw. qtte foi a pt^tdm realizado
bcjij-sucedida de uma rcdc iicural de müir pías camadus. A[>esar de u ulgoruno de dprendizagem dzi
tnáquina de Bnltzmann náo toi se mostrado táo ¿-íi cíente do ponto de vista eocnputacional como o
algún imo du retropropagafáü (Bock-pmpQgaliwt), ele superuu □ impasse psicológico, mostrando
que a especuladlo de Minsky c Papert (1969) nao cstava corrctamcntc embasada. A máquina de
Boitzmann lambem serví u de base para o desenvolví mentó subsequen te das de cren^a slgtnáidt!
de Neal i 1992), que conseguíu realizar duas uoisas: (1} a mdhoria significativa da aprendízagem e
(?) a ligadlo das redes neurais ás redes de crcnpa (Pcarl, 1988). Urna mclhoria adicional no desem-
penho das redes de crcn^a sigmóide foi realizada por Saúl, Jakkulla e Jordán (1996) utilizando a
teoría do campo medio, uma técnica lambém com raizes na mecánica cstatística.
Um artigo de Bario, Sutton e Anderson sobre apre ndizagew por nfüt^O fe i pub 1 i cado um
1983. Apesar de elcs náo leretn sido os primeirofi a utilizar aprendizagem pur reforjo (Minsky a
levou cm considerarán na sua tese de doutorado em 1954. por exemplo). seu artigo gerou muito
interesse em aprendizagem por reforjo c na sua api ¡cacao cm controle. Específicamente, eles de*
monstraram que um sistema de aprendí ¿agem por reforjo pedería aprender a equi librar um cabo de
vassoura (Le-, um mastro montado sobre uma carreta) na ausencia de um profcssor auxiliar O
sistema requerí a somonte um sinal de insuccsso que ocorre quando o mástic, ao cair, ullrapuasa um
ángulo critico a partir da vertical, ou quando a carreta alcanzan final da puta. Em 1996, foi publi-
cado o livro Neumdynamfc Prugranrming de Bertsekas e Tsilsiklis, Este livro coloccu a aprendiza-
gem por reforjo sobre uma base matemática apropriada, ligandoa á programacáo dinámica de
Reliman.
Em I984,foi publicado o livro de Braitenberg. EéAfo/ev; Experimenta in Syntheiic Psychtdogy,
N este livro, Braitenberg dufende oprnici/ífo r/íf dexempenha auto-or^ganixtílo, diivcionadu a objetivo',
obtcm-sc um mcihor cnlend ¡mentó de um processo complexo pula sintese de mecanismos elemen-
tares putativos do que por uma análisc de cima para baixo (tap-down). Süb o pretexto da fie^áo
científica, Braitenberg ilustre este importante principio descreyendo vánas máquinas com uma
arquitetura intema simples. As propiedades das máquinas e seu com pon a mentó sáo inspirados em
fotos acerca dos cerebros de animáis, um assunto que ele cstudou di ralamente ou indi netamente per
mais de 20 anos.
Fm 1986* foi relatado por Rumelhart, Hinton e Williams (1986) a desenvol vi mentó do atguriíríjü
de wrmpmpagafao (buck-pmpagalifm). Naquclc mesmo ano, foi publicado o célebre livro cm dois
voluntes, f3n>éfí<sing.- Explofatitins ¡A the M¡L/ü!iifiniHiTf(>f Cogfiilíf>!it ed i la-
do por Rumelharl e McClelland. Este livro e^erceu urna grande i i fluencia na utilizado da aprendí -
zagem por rctropropagaqao, que emergíu como o algoritmo de aprcndizagcm mais popular para o
treinamenlo de perceptrons de múltiplas camadas. Na vendade, a aprendízagem por rctropropagafáo
foi descobertadc modo independe em outros dois lugares, na mesma época (i*arker, 1985; LeCun,
1985). Após a descoborta do algoritmo de rctropropaga^ao cm meados dos anos 1980, revelcu-se
que o algoritmo ha vía sido descrito anteriormente por Werbns na sua tese de demorado na Univer-
sidade de Harvard em agosto de 1974; a tese de doutürado do Werbos foi a primcira dcscripáo
documentada da computacao eficiente do gradiente cm modo reverso que foi aplicada a modelos
gerais de redes, sendo as redes neurais um caso especial. A idéia básica da retrograda^áo pode aínda
ser encontrada mais anteriormente no livro Applied Opiimui Conrmi de Bryson e J Id (1969). Na
Se^áo 2.2f intitulada “Sistemas de Mulüestágios" diquele livro, é descrita urna derivaqáo da
rctropropagaqáo ut ilizande um formalismo lagrangiano. Em última anal i se, entretanto, deve-se atri-
buir muito do crédito peto algoritmo de reircpropaga^So a Rumelhari. Hinfon c Williams (1986),
por proporcm a sua utihzaqáo para a aprendízagem de máquina c por demonstraren! como ¡StO
poderia funcionar.
Em 1988, Linkscr descreveu um novo principio para a auto-organ i ZAFELO em uma rede perceptiva
(Linkser, I98«a). () p: mclpio é concebido para preservar o máximo de informacáo sobre os padrees
de at i vi dade das entradas, sujeito a limi taqoes como as concxócs sinópticas e o intervalo dinámico
tías sinapses. L'ma sugestáo similar foi feita independentemente porvários pesquisadores da visan.
Entretanto, foi Linkscr quem utilizou concettüs absintios bascados na teoría da informando (formu-
lada por Shannon em 1948) para formular o principio da máxima frfornutyiiü mútita (Infomax). D
artigo de Linkscr rcaccndeu o interesse pela aplicado da teoría da ínlbnnacáo ás redes neurais. Em
particular, a aplicado da teoría da informado ao pt^bf&rta da separadlo eegu da Juntes por Bell c
Sc¡nowski (1995) provocou multas pesqui-^adores a explorar cutres modelos teóricos da infnima-
cao para resolver uma vasta clí^c ufo problemas, condecidos en let i va mente como decarí'vtdueatt
Também em l988, Broomhead e Lowe descreyeran um procedimenlo para o projeto de redes
alimentadas adianto, cm camadas utilizando fun^aes de base radial (RBF, radiai basis function), as
quais fcmecem uma alternativa aos penccptrons de múltiplas camadas. A idéia básica das fun^oes
de base radial remonta pelo menos ao método dásjttiifdes de poteneiaí que foi proposlo original-
mente per Bashkirov, Braveman e Muchnik (1964), c cujas propriedades teóricas fbram desenvol-
vidas por Aizerman, Braverman e Rozonoer (1964a, b). Urna describo do método das fun^ocs de
potencial é apresentada no clássíco livro» Páttern dassificalloa and Scene Anaiysis de Duda e Hart
(1973). Apesar diado, o artigo de Broomhcad c Lowe levou a um grande esforzó em pesquisa para
ligar o projeta de redes neurais a uma importante área da análise numérica e também aos filtros
lineares adapiativas, Em 1990, Poggío e Gimsi (1990a) enriquecerá™ aínda mai$ a teoría das redes
RBF aplicando a teoría da regularízalo de Tikhonov.
Em 1989, Idi publicado o livro de Mead, Anafog VLSf andNeuralSystems. Este livro fomccc
uma matura inusitada de concejos retirados da neurobiologia e da tecnología VLSI. Sobretodo, ele
incluí capítulos sobre a retina de silicio c a cóclea de silicio, escrito por Mead c co-autores, que sao
daros exemplos da mente criativa de Mead.
No inicio dos anos 90, Vapnik e coautores inventaram umadasse de redesde aprendí/agem
supervisionada poderosa do ponto de vista computacional, chamada de máquinas de vetar de su-
porte, para ser utilizada em reconheciinenio de padrees, regressáo e problemas de estimado de
densidadc(Bo5cr»Guyone Vapnik, 1992; Córtese Vapnik, 1995; Vapnik» 1995» 1998). Este método
novo se baséis nos resultados da teoría de aprendizagem com lamanhos de amostra finitos. Uma
característica inovadora das máquinas de vetor de suporte é o modo natural pelo qual a dimensuo de
Vapnik-Chervtmenkis fV-C) é incorporada no seu projelo. A dimensáo V-C tornee e uma medida
para a capacidade de uma rede neural de aprender a partir de um conjunto de ejemplos (Vapnik o
Chervonenkis, 1971; Vapnik, 1982).
Agora já está bem estabelocido que o caos constituí um aspecto-chave de fenómenos físicos.
A questáo que mui (os levantam é; existe um papel importante para o caos no estudo de redes neurais?
Em um contexto biológico, Freeman (1995) acredita que a resposta a esta questáo c afirmativa. De
aconto com Freeman, os padróes de alividade neural n5o sáo impostes de fora do cerebro; em vez
disso eles sao construidos a partir do scu interior. Em particular» a dinámica caótica ofcrccc uma
base para descreyeras condtQées que $3c requeridas para a emergencia de padróes auto-organiza-
dos em popula^óe*; de neurónios c entre estas populares.
Talvcz mais do que qualqucr oulra publicado, o artigo de 1982 de H opíle Id e o livro em deis
voluntes de 1986 de Rumelhart c McClelland foram as publica^ócs mais influentes, responsáveis
pelo ressurgimente do inlcresse cm redes neurais nos anos 1980. As redes neurais certamente trilha-
ram um longo caminlio desde os dias iniciáis de McCulloch e Pites. De falo, elas se cstabeleccram
como um lema interdisciplÍEiar com raizes profundas cm ncurocicncias, psicología, matemática»
ciencias físicas r engenharia. É desnectKsárw dizer que elas entáo aquí para ficar e que conlinuaráo
a cresccr cm leona, projelo e aplica^óes.
NOTAS E REFERÉNCIAS
L Fsta definirán de uma rede neural £ adaptada de Alck^andcr e Mcrlon (1990).
2, Para uma pcrspccl ;va complcmcnlar sobre redes ncu rais com cniáse em modelageni neural,
cognicáo c ccnsideracóes iieurofisiológicas, veja Andtrson (1995). ftira um relato bastan-
te legivd dos aspectos computaeionais do cerebro, veja ChurehEand e Sejrtúwsld r L992).
Para dése i ¡$¡k$ niuis detalliadas dos. mecaiusmcH neurais e do cerebro humana, veja Kandel
e Sclnvirl/ (1991 L Shcphcrd {1990a, h), Ktich e Segev (I9R9), KuíTltír el al. 119R4) tí
Freeman (1975).
3. Para UIH rclaKi minucioso das funi;óv-. signtoidcx e queslnes relacionadas, vi",a Mennn qt
al. (1996)
4. A liinvao logística, ou mais. pree i saínente a jíuifJio ¿fe distriimi^üu logística^ deriva sen
nomc de lima L,lci de crcscimcnto h)gistico'b trnnsccfidcmal que resultan cm uma imensa
Lúcraturj. Se medidos em unidades apropiadas, todos os ptvoessos de crescimento sito
SUfKistam-.'nLv representados pela l -rtCid distribuidlo logística
= I -f'"' 5
onde i representa o tempe, c a c [3 s3o constantes. Entretanto, veriticou-seque ruto súmen-
le a d i slri bu ¡cao logística mas Lamhém a gaussiana e nutras distribu imites podem ser aplica-
das aos mesmos dados com os meamos resollados de ajuste ou ate mclhorcs (Fcllcr. 1968).
5. De acorto com Kutllcr et al. (1984). o termo "campo reccpt iva*1 Ibi cimbado origi Raímen-
te por Shemngtiin (1996) t icilrLHluzidií novamente por Harllíne (194(1). Mo contexto de
um sistema víkujL o campo receptivo de um ncumnio se nefere a área rcsti ita sobre a
superficie red nal, que influencia as descargas Jaque le neurónio causadas pela luz.
6. Aparentcmcnlc. a técnica de compan i!'lamento de pesos foi originalmente descrita em
Rumelhirt et al. (1986b).
7. AS ninas históricas apresetitadas aquí >io eilonncmenle (mas. nao exclusivamente) busca-
das ñas seguirnos fonte*: (|) o artiga de Saarincn ct al. (1992); (2) o capitulo escrito por
Rail (1999); (3) o artigo de widrow e Lehr (1990), (4) os artigas de Cowan (19901) e
Cnwan c SKup (1988); (5) a artigo de Grasaban (19R8ck (6) o livro cm deis voluntes
sobre computado neural (Anderson et al., 1990; Anderson e RtisenfekL I988); (7) O capi-
tulo escrito por Sdfiidge ci al (19fifi), (8) a colero de arillos Je von Neumacin sobre
cnmputaflp c teoría Ja compuiafiQ (Aspray e Durkji, 1986); ;9) o 111; urja I sobre a tcoru
do cérel -i.' e redes neuniis eilHado por Artiih (1995); (10) O Capítulo I do l'VTO de RllSSCl
e Norvig (199?); e{L I) o artigo de Taytor (1997).
PROBLEMAS
Modelos de um neurónio
1.1 Um Cxemplu de fun^iih lúgístÍLa é definida por
V(t?}=--------------
l-rexpf o»)
cu¡ijs valimos limites síq () ü I. Mostré que a r.L'riviidn de (i9 cm rcla^ao aré dada por
^E = <Jtp(r)|l -q>ívj]
Qual é o valor dcsla derivada na crigem?
1,2 Urna fuñado sigmóide Impar ¿ definida por
( . l-exp(-nav)
<p[ r-'J =----------
l -i-cxp(-rru)
fíit; i
— I
1MTR0DUÍ7AO 71
onde lanh representa a tangente hiperbólica. Os valores limites desta segunda turulo
sigmóide sáo -L e . Mostré que a derivada de <p (ij) em retalio a vé dada por
Qual é o valor desta derivada na origpin? Suponha que o parámetro de inclinado ¿r sej¡i
infinitamente grande. Qual é a forma resultante de Q (u) ?
1«3 Uma ouha fun^ao sigmóide impar 4 a sigmóide algébrica;
íPW = -r—-r
%' i + ij
cujos valores limites s¿o -] e +1. Mostré que a derivada de q> (t'j em relajo a v ¿dada por
dv v3
L.4
Qual é o valor desta derivada na ongcm?
Considere as duas segnintes fundes:
(i) np(v) =
exp —— dx
k * j
(íi) <p(u} = —tan 1 (u)
it
Explique por que estas duas fungues sati-.fazcm os requisitos de uma fun^áo sigmóide. De
que modo estas duas ñinqóes diferem entre si?
1.5 Qual das cinco funches sigmóideü descritas nos PrnbicmiK L l a 1.4 scria quaI ¡tienda como
uma fun^áo d -stribuicáo (de prebab.1 idade) cumula i va? Justifique a sua resposta.
1.6 Considere a fiin^áo de aliva^áo pseudolinear ip (i1) mostrada na Fig. PL .6.
-03a & O-5<?
AGURA P1.Í
(a) Formule <p fu) como uma túnQáo de tt.
(h) O que acontece enm tp (h) se íi aproximST-Se de Tero?
1.7 Repita o Problema H.6psTBafimíaodcaüva£aopscudolmcar<p(v) mostrada na Fig. P l .7.
1 .X Um neurónio tcm uma fun^áo de atva$ 3o tp(v} definida pela funQ¿o logística do problema
]. ]. onde vio campo local induzido, e o parámetro de i ik hitado n está dispon ívcl p^ra
ajustes. Considere quexr rcprcscTitcm os sinais de entrada aplicados aos nós de
fonte do ncurómo e que b represente o bias. Por conven ¡encía de representado, podemos
tazer com que o parámetro de ¡uclínavao a soja aburvido pelo campo local induzidov,
escrevendo
^(v • i ----------
I + exp( tt)
72 KhUhh NíLKAlS
Como voté modi litaría as entradas A,. X,.,. . Xh de taima 5 produ/ir a mesmjí saida de
antes? Justifique a sua resposta.
i.9 Uní neurónio/ recebe entradas de quatro outros neurónios cujas niras de aliva^áo sao LO,
-20,4e —2. Os respectivos pexini sinópticos tío neurónio j s3o 0. K. 0,2, i ,Ü e ü,1). Calcule
a salda do neurónio j para as duu segúrate* aituatfes:
(a) O neurónio é linear.
(b) O neumnio é representado por um modelo de McCulJoclb Pitts.
Assuma que o bias apl.cadfi aO ittUrtnk) é zeni.
LIO Repita o Problema 1.9 para um modelo de neurónio buscado na fimpfo logística
1. L L (a) M nslrc que 0 modelo formal de McCultaelt-Piits de um neurónio pode ser apnox ima-
do por um neurónio sigmóidc (i.e.. um ncuronio que utiliza uma íun^áo de atíva^áo
sigjnólde) com pesos sinópticos grandes.
(b) Mostré que um neurónio linear pode ser aproximado por um neuróniu siginóidr com
pesca sinópticos pequeños.
Arqulteturas de rede
1.LZ Unía rede alimentada ódiame totalmente conectada ten 1 10 nós lie tanto. 2 camadas ocul-
tas, uma com 4 neurónios c a outra com 3 neurónios c um único neurónio de sóida. Cons-
iga um £ralo arquitciural dcsta rede.
1,13 (n) A Figura P1.13 nioslra uní grata de tluxo de sinal de uma rede 2-2-2-1 alimentada
adíame. A fundió <p(-} representa uma hincito logística. Escrcva o mapeamento de
entrada-saida definido por esta rede.
(b) Suponha que o neurónio de saida do grata de iluso de smal da Fig. 1*1.13 opere na sua
regiáo linear. Escrcva o raapcamcnlo de entrada-saida definido por esta nova rede.
1.14 A rede descrita na Fig. PL.I3 n3o tcm bias. Suponha que bias iguais a -I e+1 Jíejam
aplicados aos neurónios superiore inferior da primeira camada oculta, e bias (guaje a +1 ?
-2 sejam aplicados aos neurónios superior e inferior da segunda camada inulta, respecti-
vamente. Ewrera a nwa forma do mapcaracnto de entrada-saida definido pela rede.
1.15 Considere uma rede cta mü (tipias camadas alimentada adíame, na q ual t»d»s- os neurón ios
operara ñas suas regiócs lineares. Justifique a alinm^o de que esta rede c equivalente n
um$i rede alimentada adianto de camada única.
1.1 fi Ctmstiuu uma rede totalmente recórtenle com 5 neurónios, mas sem Huin-realimcntaeáo.
1.17 A Figura Pl. 17 moslra um grata de fluxo de sinal de uma rede recórreme constituida de
deis neurónios. Ekkms a equacao de diferencas nSo-11 ncar que define a evolu^üo dejrjn)
1.J8
üU ce JT-ífr), Estas- dllM VariiMCÍS delineen as saldas tkw neuróniíis superior e inlérior. K£-
pccth ámenle. Qual é a tudem deste cquafSo?
A Figura PUS mo&tra o grafo de íluxo de ti nal de nina pede Reoriente que con&tstc de
dois neunjuios crwn Mito-nalimeiita^o. Escrcta o sistema acoplado de duas equiiQfles de
difereneas de primeifii ordeiu que desenvem a opeTú^iü Ju >¡stema.
FIGURA P1,1B
LI9
Urna rede recórtente tcm 3 nós de iiinte, 2 neurónios ocultos e 4 neuróniqs de saída.
Construa um grafo arrjuiietiiral que descrema esia rede.
Representado do conhecimento
1,20 L'ma Ibntia útil dt pré-processamcnto He basetu no mítdeiti tjutfj-regrertsivg (AÜJ descrito
pela cqua^So de difcrcn^as (para dados de valores reais)
v(it) *- I) + WjJ'trt - 2) + - - _v(rt — Ai) + i'lrJ)
linde _i(n) é ; dó íliodeh.i. v(ft) ó Lima amostra retirada de u]fl pcocessode raido branca
com media zero c uma wíAncii prcdclin ¡da; irr w w^, s3o os coercientes do modelo
,t/<; c M c a orden do modelo. Mostré que o uso dcstc modelo tornee c duas fonnas de
invariáncla geométrica: (a) em escala e ibi em transíalo temporal. Como estas duas
¡ uvariánciaj paderium ser uli lizudus em redes neurais?
1,21 Considere que X scja um vetar de entrada e que s(a, x} scj a vtn operador de transformaQáo
alindo sobre x edependente de um parámetro a. O operador s(gi_, x) satisfaz dois requisi-
Ioh:
• s(0, x)=x
*(a. x) é difcrenuiável cm rclafüo a a.
O veftv' tundente é definido pela derivada parcial dsfnt, xV¿)a {Simard el al„ 1992).
Supcnk.! que x represienle uma imugem e que tt se;. i um parámetro de rota^áO- Como
vticc calentaría o velar lungentr para o caso rm que tf. é pequenp? O vetor lADgcnlC C
local mente invariante cm ralacao á miaban da imagem original; por que'?
CAPÍTULO 2
Processos de Aprendizagem
2.1 IMTRODUQÁO
A propnedade que ó de importancia primordial pon urna rede neural é a sua hábil idade de aprender
a partir de scu ambiente e de meíhoriar v> seu tlesempedho através da Bprendizagem. A melhoria do
desempenho acorre com o tempo de acardo com al cuma medida prccstabcLcc .da. Uma rede neural
aprende acerca do scu ambiente através de um processo inierativo de ajustes aplicados a seus pesos
sináptieos e ni veis de bias. Idealmente, a rede se torna mais instruida sobre o seu ambiente após
cada iterando do processo de aprendizagem.
Há atividades demais associadas ú no£io de ‘'aprendizagem'* para justificar a sua dcfiiucáo de
forma precisa. Além disso. o processo de aprendizagem depende do ponto de vista, o que causa
dificuldadcs cm se oblur um consenso sobre urna defimeáo precisa do termo. A aprendizagem do
ponto de vista de um psicólogo, por exemplo, c bastante diferente da aprend:zagcm cm um sentido
de sala de aula. Reconhccendo que o nosso interesse particular se concentra ñas redes neurais,
Utilizamos uma definirán de aprendizagem quee adaptada de MondeI c Mediaren (1970).
Definimos aprendizagem no contexto de redes neurais como:
Aprendizagem é Jmr pmctSSO pela qual Of jXm ürk-ftujy lims tít! rriflfj ffldí1 WUIW/ Jiíff adaplados
atravéx de um pmcasso tle esttmuiiHr¿H> pela títfibiettíe MG qual a rede esfá inserida. O tipo de
uprendizagim t1 ftaMHNÍMtyfo pela muneira ptdtt qual ti mtMiifica^ao dtrs parántelnrs tjeanv.
Esta definido do procos so de aprendizagem implica a seguinte seqÜSncift de eventos:
L A rede neural é L'.ttímufuda por um ambiente-
2. A rede neural jq/n? rnadifica^oes nos ecus parámetros livres como resultado desla estimuladlo.
3. A rede neural tmspaude de uma ntarieifa nava ao am b i ente, devido ¿3 modificares acorridas na
sua estrutura Intenta.
Um conjunto preestablecido de negras bem-defí oídas para a soluto de um problema de apren-
dizagem é denominado um aígariimn de aprendiiugem.' Como m pode esperar, nác há um algoritmo
de aprendízagem único para o projeto de redes neurais. Em vez disso, temos um “conjunto de
ferramentas" representado por uma variedade de algoritmos de aprendízagem, cada qual ofcrecen-
do vantagens específicas. Básicamente, os algoritmos de aprendizagem diferem entre si pela forma
como é formulado n ajuste de um peso sináptico de um neurónio. Um outro fator a ser considerado
c a mane ira peta qual uma rede neural (máquina de aprend ¡zagem), constituida de um conjunto de
neurónios inler ligados. se relaciona com o seu ambienie. Neste último contexto, talamos de um
paradigma de aprendizagem que so refere a um modefo do ambiente no qual a rede neural opera.
Organizado do Capítulo
ü capitulo está organizado em quatro partes ínter-relacionadas. Na prime ira parte, que consiste das
Soeces 2.2 a 2.6, discutimos cinco negras básicas de aprendí zagem: aprendí zagem porcorrccao de
erro, aprendizagem bascada em memoria, aprand¡.zagem bebbiana, aprendizagem competinva e
aprendizagem de Boltzmann. A aprendizagem por cornejo de erro está fundamentada na filtragem
ótíma. A aprendizagem bascada em memoria opera memorizando explícitamente os dados de treí-
namcnlo. Tanto a aprendizagem hcbbiana como u. aprendizagem competitiva sao inspiradas cm
considerares neurobiológicas. A aprendizagem de Bnltzmann c diferente porque é bascada em
ídeias Lomadas emprestadas da mecánica cstatíslica.
A segunda parte do capitulo explora os paradigmas de aprendizagem. A Secflo 2.7 discute o
problema de atribuido de crédito, que é básico para o processo de aprendizagem. As Sc^ócs 2.S c
2.9 aprcscntam um resumo de dois paradigmas de aprendizagem: (l) a aprendizagem com um pro-
ícswir e (2) a aprendizagem .rem um professor.
A tereeira pane do capitulo, que consiste das Sebees 2,10 a 2*12, examina as que&t&es relativas
as tarefas de aprendizagem, memoria c adaptado.
A parte final do capítulo* que consiste das Secóos 2.13 a 2. J5, trata dos aspectos prohibí lis!icos
e estilísticos do processo de aprendizagem. A Se;áo 2*13 discute o dilema bias/variáncia. A sw;ao
2.14 discute a teoría estatislica da apnendizagcnt. bascada na ntx;áo da dimensao V-C que fomeec
uma medida da capacidade da máquina. A Sc^áo 2.14 iniruduz um outro conccito importante: a
aprendizagem provavelmente aprox i mudamente correta (PAC), que fomecc um modelo conservativo
para o processo de aprendizagem
O capiculo é concluido com algumas considera^des fináis na Scváo 2.16.
2,2 APRENDIZAGEM POR CORRE^ÁO DE ERRO
Para ¡lustrar nossa prime ira regra de aprendizagem, considere o caso simples de um ncuronio k que
constituí o único nó compuiacional da camada de saída de uma rede neural alimentada adiantc,
como representado na Fig. 2.1a. G neurónio ¿ é acionado por um vetar cíe sino! i(n) produzido por
unta ou mais camadas de neurónios ocultos, que sao* por sua vez, acionadas por um velor de entrada
(estimulo) aplicado aos nos de fontc (i.e., a camada de entrada) da rede neural. O argumento «
representa o instante de tempo discreto, ou mais precisamente, o passo de tempo de um processo
iterativa envolvido no ajuste dos pesos sinápticos do neurónio i. O sitia! de saída do neurónio Á c
representado por vjn). Este sinal de saída, representando a única saída da rede neural. í comparado
com uma ntapasta desejada ou mída-<dvf>. representada por J in). Con.wqüenienientc, é produzido
um sinal de erm, representado por ejn). Por definicao, temos assim
PttxTSSH? pe Aprendizagem 77
Rt?4e d? miillipljs anudas
al ¡menliuhs nd ianlc
(a) Dii^rdmu -um KIltcch nk uiriLb mk rujuraL
rawllando 0 único ncnránni do tamado
de saida
(h) Grafo de íIuxq de si ral do ncuránin de salda
AGURA 2.1 Ilustrarlo da aprandizagam per ampia da arto
**<«) *VB) “>'*(*)
(2.1}
O sinal de erro ¿.(n) aciuna um mecanismo de canlmie, cujo propósito é aplicar uma seqüénda de
ajustes corretivos aos pesos sinópticos do neurónio Os ajustes correlivos sao projetados para
aproximar passo a passo o sinal de salda >A(n) da resposia desejada rfjw), Este objetivo é alcanzado
minimizando-se uma fun^aa de cusía ou índice de desempenha, í (a), definido em termos do sinal
de erro et(n) como:
«(»)=-<.;(») (2.2)
Com isso, %(n) é o vaiar instantáneo da energía do erro. Os ajustes passo a passo dos pesos sináplicos
do neurónio k continuam até o sistema atingir um estado estove! (i.e., os pesos sinápticos estíle»
essencialmente estabilizados), Neste ponto, o processo é encerrado
O processo de aprendizagem dcscrilo aquí c denominado, por razóes óbvias1 aptvndizagem
par comido de erro. Em particular a minimizado da furrio de custo $(jj) resulta na regra de
aprendizagem normalmente referida como regra deíta cu regra de Wídmw-Hoffi assim denominada
em homenagem aos seus criadores (Widrow e HofK 1960). Supon ha que wJji) represente o valor
do peso sinóptico do neurónio k excitado por um elemento r(n) do vetor de sinal i(jt) no passo
de tempo n. De acorde com a regra delta, o ajuste Aw J/l) aplicado ao peso SÍrtéptíCO W* no passo
de lempo n é definido por
(23)
78 Rfiws NfitjuAih
ondeq é unía constante positiva que determina a foxu de aprendizadn quando avanzamos cm um
pa$so no proccsso de aprendizagem. É, portanto, natural que denominemos T] parámetro taxu de
aprendizado. Em oulras palavras. a regra delta pode ser formulada como:
O afustefaifa em nm peso si/tttpfiCQ de um TWWWUa ¿pmpmcimal an pmdiilft d<>.vinal de erro peto
sinai de entrada da xinapte em ipiextuti.
Note-se que a regra delta, assim formulada, prcssupóe que ü sinal de erro sejíi tiiivludiente Memninhu/.
Para que esta medida soja rcalizável nccessitamos claramente que a resposta desojada seja fomecida
poral&uma fonte externa, que seja direfamenicacesflível ao neurónio k. Em nutras palavras, o neurónio
k é vifsivel ao mundo externo, como representado na Fig- 2-la. Desta figura tambem observamos que
a aprendizagem por conejo de erro é na vendado do natureza focal. Isto apenas significa que os
ajustes smápticos foitos pela regra delta sEo localizados em torno de neurinic t
Tcndo calculado o ajuste sin ápüco AWj.ínX ° valor atua tizado do peso sináptico w¡f é determi-
nado por
+ ] ] = wjin) + Aw^fo) (2,4)
Na vendado, W-Pr) o icXi(/r + 1) podem sor vistos como os valores antigo e novo do peso sináptico
w , respectivamente. Em termos computación ais, podemos tambera HCTBVer
w^ = r'[^+L)] (2.5)
onde z*1 éo operador atrasa luiltárfo. Istoí, z_| representa um elemento de armazenamefíto.
A Figura 2.1b mostea uma representarán em grafo de fluxo de si nal do processo de aprendida-
gem por corroso de erro, enfocando a atividade na vizinhan^a do neurónio í. O sinal de entrada .r
c o campo local induridu y do neurónio k sSo referidos respectivamente como os Piapoco
epós-sitiáptico da/-¿sima sinapsedo neurónio A, respectivamente. Da Fig- 2.1 vemos que a apren-
dizagem por corrc^áo de erro c um exemplo de um Jisjcmcj teídimeafado de tawfichado. Da teoría
de controle sabemos que a estábilidade de um sistema como sise é determinada pelos parámetros
que eonstitiiem os la^os de realimentapo do sistema. No tiossü caso temos apenas um lace de
rcalinnciilacáo, com desses parámetros, que é particularmente interesante, é o parámetro taxa de
aprend^ado q. l’or esse motivo, é importante que q seja seleciuñado cuidadosamente, para asegu-
rar que soja alcanzada a estábilidade ou convergencia do proccssc de aprendizagem iterativo. A
escolla de q tem tamhém urna influencia profunda na precisáo e cm outros aspectos do pnocesso de
aprendizagem. Em resumo, o parámetro tasa de aprendizado q desempenha na prática uní papel-
chave, determinando n desempenho da aprendizagem porcomjqáo de erro.
A aprendizagem por correcto de erro é discutida com muito maúdetalhes no Capitulo 3, que
trata das redes alimentadas adianto de camada única, c no Capítulo 4, que detalla as redes alimen-
tadas adiarte com múltiplas carnada^
2.3 APRENDIZAGEM GASEADA EM MEMORIA
Na aprendizagem bascada em memoria, todas as (ou a maiot i a das) experiencias passadas sáo
armazenadas explícitamente cm uma grande memoria de cxcmplos do entrada-saida Clarificados
FROCEJWSDE ArGJiKDIZACEM 79
cencíamente: {(xp J, )} ' ,ondc x representa um vetor de entrada c J representa a resposta desejada
uonespvndentc. Sem perda de genera lidade, restringimos a resposta desejada a ser um esealar. Em
um problema de classiñca^áo de padrees binario., por cxcmplo, há duas classcs/h i potases a scrcm
consideradas, representadas por^, e^3. Neste exemplo, a resposta desejada df assunne o valor 0 (ou
-1) para a classe :íl e o valor 1 para a classe :íL. Quando desejantns. classificar um velar de teste x|n|r
(nao visto antes), o algoritmo responde buscando c analisando os dados de trcinamcnta cm uma
"vizinharuja local”dex .
Todos os algoritmos de aprendizagem bascada cm memórid envolvem dois ingredientes es-
senciais;
• O criterio utilizado para definir a vizinhanca Local do vetor de teste xk^.
• A regra de aprendizagem aplicada ms ejemplos de treinatnento na vizinhanga local de xlflw-
Os algoritmos diferem entre si na íbnna como estes dais ingredientes sao definidos.
Em um tipo simples mas delira de aprcmlazagcm bascada cm memoria conhcctdo como a
<fo viíifíhtt mais pritxima-. a vizinhanca Irieal é de ti ni da como o exemplc de ireinamento que
se encentra na vi/ nhanca ¡mediata do vetor de teste x Em particular, dizemos que o vetor
x’w6 {xr x,...xj (2.6)
c o vizinho mais próximo de xlnk. se
P7)
onde di x, X ) c a d istánc i a euc I id iana en tre OS vetares x ex . A c lasse associada com a di stánci a
h i" Indc^ . Lev Ir
mínima, ou seja. o vetar x . é apreseniada como a classifíca^áo de x . Esta regra c independente da
distribuiqáo fundamental rcsponsávcl pula gera^ao dos cxcmplos do treinamenta.
Cover e Jlart (1967) estudaram formalmente a regra do vizinho mais próximo como uma
feiramenta para classifíca^án de padrees. A ana liso apresentada por elcs é bascada cm duas supes i -
Coes:
• Os exemplos clasificados (i. ti j sao independ&itemmfe íj iefertiit.umwtte di*tribuidos frit/j,
de acordó cam a distríbuic^a de probahi Iidade conjunta do excmplo (xT </)r
• O lamanho da amostra A' é infinitamente grande.
l.evando em considerado estas duas .suposifdes, mosin-se que a probabilidade de erro du classif]-
cacáo pela regra do vizinho mais próximo é limitada acima pela dabro dapmbabiiidade de em
baytt.fiuti^ isla e, a mímma probabilidade de erro entre todas as regnis di: dec sao. A probabilidade
de erro bayesiana ú discutida no Capí la lo 3. Ncstc sentido, poderse dizer que metade da infónnBfto
sobre a classifícacáo de um conjunto de treinamento de tamanho infinito está coñuda no vizinho
mais próximo, o que é um resultado sutpreendente.
Uma variante do classilicador pelo vizinho mais próximo e o elaaníflcadorpetas k vitinbas
muía pniximost que procede como scgpe:
• Identifique as i padrees elassií cadas que se cncontram mais próximos do vetor de teste
para um número intaire it.
8P Kejifs Neliíaii
• Atrlbua x á clasve (hipátett) que está mais frequentcmcnte representada ñus k vizinhós
milis próximos de xIMi. (i.e.. use uma votarlo majoritária para fazer a classitkatjao).
A.isiin. o dajisificadur pelos A * ¡zinhos mais próximos alúa como um dispositivo que calcula a
média. Em particular, ele discrimina um dado cstranho, como ilustrado na Fig. 2.2 para k - 3. Um
dado estrecha c uma observado que tem um valor improvávcl cm rela^ao a um modelo de iníeres-
sc.
No Capítulo 5, discutimos um outro tipo impórtame de clasificador bascado cm metnória,
con lucido coma rede do fuiujáo de base radial.
0 0
0
0 0 0
Efitrwri» | q
11111
FIGURA 2.2 A área coabda no interior
do círculo fracajado incluí «Jais pontos
pérténcenfles á classe 1 e um ponto
eslranno partonconto á dasse 0.0
ponto d corrÉfipijnds ao valor de tosté
Ctortt k = 3, o ctassifi&dor polas a
vizintros mais próximos alntxii a dasse
1 aú ponto d, mésmo ale oslando mais
próximo h dado esrwito
2.4 APRENDIZAGEM HEBBIANA
O postuiüdi? deaprendiendo de Hebh é a mais amiga e mais famosa de todas as regras de aprendi-
zagem; deé assim denominado em homenagem ao neuropsicólogo I lehh (1049). Criando o livro de
Hebb (1949, p.62), The Organizatitm qfBehavfor.
Quando um axónio da célula A está peno o suficiente para excitar uma célula B c participa do seu
tlispanfl repetida ou persistenlemenlr, enlafl uluuni prOCtssú de CKSC.inentu Ou [iiodi íicii^áo mtta-
bólica acontece cm uma das células ou cm ambas, de tal forma que a eficiencia de A tomo uma das
células que dispara B ¿aumentada.
Hcbb propós esta modilicsfAo como uma base da aprendizagem assocíatíva (;i nivel celular), que
resultaría cm uma modificarán permanente do podran de atividadede um "agrupartiente de células
nervosas" espacial mente disLribuido.
Esta a firmando foi feita emtun contexto jieurohiológico. Podemos expandiré rescrevé-la como
uma regra em duas pades (Stent, 197?; diangeuxe Panchin. 1976);
L. Se duis neurónios em ambtM os fados de. uma sinupae (conaxdo) s&o olivados simsdtaneamenie
(i.e., sincrrwanrentek entao a fotya daquefa sinap-w é sefeiivafíidMte aumentada-
2. Se dais neumnios em ambos ¡xv fados de ama sinupse año olivados assincrtmiimente. entáo
atfueia sínapse é seietivamenfe an/raquecida tur eliminada.
Uma ainapse assim é denominada uma strnpse hebbianu* (A negra de I lebb original nao conicm a
parte 2). Mais precisamente, definimos uma ^inapsehebbi;inu como uma sinapse que usa um meca-
nismo dependente do ¡empo. altamente focal e fin'temente inierutivo para aumentar a eficiencia
sinóptica como uma Junado da correteada entre as atividades pré-sináptica e pós-sináptica. A
partírdeíU definido pedemos deduarctS seguintes quatro mecanismos (propri edades) fundamen-
táis que caracterizan! urna sinapse hcbbiana (Brown ct al., 1990);
1. Mecanismo dependente do tempo. Fste mecanismo se refere ao fato de que as modifiea^óes
em uma sinapse hcbbiana dependem do tempo exato de o correncia dos sitiáis prc-siiiiápticos c pos-
s i íiApúcos.
2» Mecanismo Local. Pela sua natureza, urna sinapse é um local de transmissao onde sinais por-
tadores de infonna^áo (rcprcscnlandD a atividade incidente ñas unidades pré-sináptica c pos-sinóptica)
cstSo cm cera! i gü idade espado-temporal. Esta informado local mente di^ponível é utilizada por
uma sinapse hebbiana para producir urna modificado sinóptica local que é específica para a entra-
da.
X Mecanismo inlemttvo. A ocorréncia de uma tnodificaq^o em uma sinapse hebbiana depende
dos sinais em ambos os lados da sinapse. isto c, uma forma do aprendizagem hcbbiana depende de
uma “inlcracao verdadeira" entre os sinais pré-sináptico e pós-sináptico, no sentido de que nüo
podemos fazer uma previsto a partir de apenas uma densas duas atividades. Note também que esta
dependencia ou interaqao pode ser de natureza dctcrminística ou cstalística.
4. Mecanismo conjuncioaal ou correlativo. Urna interpretable do postuiado de aprendizaje de
Hebb é que a candirán para uma modificaban da efi< iéneia sinóptica é a conjunto dos 3inais pré-
siuáptico e pós-sináptico. Assim, de acorde com esta interpretado, a ocorrencia simultánea dos
sinais pré-sináptíco e pós-sináptico (dentro de um curto intervalo de tempo) é suli cíenle para produ-
zir a modificábalo sinóptica. F por esta razao que uma sinapse hehbiana e algumas vezes denomina-
da sinapse conjuncional. Para uma outra interpretaiyáo do postulado de aprendizade de Hebb, pode-
mos considerar o mecanismo interafivo que caracteriza uma sinapse hcbbiana cm termos estatisti-
cos, Em particular, a correlaí3otemporal entre wsinats pré-sináptico e pós-smáptico ¿vísta como
sendo responsáve] per uma modifica^ao sinóptica. Ncstc sentido, uma sinapse hcbbiana é também
denominada uma sinapse correlativa, A corre!ñ<;ao é de tato a base do aprendizado (Eggcrmont»
1990).
Reforco e Depreesáo Sinópticos
A definí pao de uma sinapse hcbbiana «presentada aquí nao incluí prücessos adicioniii $ que podem
resultar no enfraquecimento de uma sinapse conectando um par de neurónios. De fato, podemos
generalizar o coneeito de uma modificabác hebbiana reconhecendo que uma aiividadc positivamen-
te correlacionada produz reforjo sinóptico c que uma ath idade nao-correlacionada ou negativa-
mente correlacionada produz cnftaquccimentó sináptico (Stcnt, 1973), A depressao sinóptica pode
ser também do tipo nác-interalivo. Específicamente, a condiv&o Literal iva para o enfraquecimento
.sináptico pode ser simpl estríente a atividade nóo-eoincidente pré-sináptica ou pós-sináptica.
Podemos seguir um passo h frente, classificando uma mcdiíicafáo sinóptica como hebhiana,
anti-hebbiana e nao-hebbiana (Palm, 1982). De acordo com este esquema, uma sinapse hebbiana
aumenta sua for^a com sinais pré-sinápiico c pós-sináptico positivamente correlacionados e dimi-
nuí a sua fbr^a quando estes sinais náo sáo correlacionados ou sáo negativamente correlacionados.
Inversamente, uma sinapse ant i-hebb i ana enfraqucce sinais pré-si nóptico c pós-sináptico positiva-
mente correlacionados c reforja sinais negativamente correlacionados. Tanto em uma sinapse
hcbbiana como cm uma sinapse anti-hebbiana, entretanto, a modificado da eficiencia sinóptica se
baseia em um mecanismo que é dependente do tcmpoT altamente local e de natureza fortemente
interativa. Ncstc sentido, uma smapse anti-hebbiana é aínda de natureza hcbbiana, apesar de nao o
ser funei analmente. Unía sinapse náo-tiehbiana, por entro Lado, nao cnvolvc qualqucr tipo de meca-
nismo hebbiano.
Modelos Matemáticos de Modificares Hebblanas
Para formular a aprendí/agem hebbhna em termos matemáticos, considere um peso sinóptico tu
do neurónio k com sinais pré-sináptico e pós-sináptico representados por .v uj'r respectivamente. O
aj usté aplicado ao peso sináptico ti1.. no passo de tempo n é expresa® na forma geral
(2.8)
onde c uma fun^áo tanto do sinal prc-sináplico como do pos-sinóptico. Os sinais.t (ri) tjJ/i)
sao freqüentemenlc tratados como adiznensionais. A fórmula da Eq. (2.8) admite mu i las fónnas,
sendo que todas san qualideadas como hcbbianas. A seguir, consideramos duas destas formas.
Hipótesi de Hehh, A forma mais simples de aprendizagem hcbbiana é descrita por
(2.9}
onde i] é uma constante positiva que determina a laxa deaprendizagem. A Equad® (2.9) claramen-
te enfatiza a natureza correlativa de uma sinapse hebbiana. Ela é algunas vezes referida como a
legra dopradttía das atívidades. A curva superior da Fig. 2.3 mostra uma representaban gráfica da
Eq. (2.9), com a modificad® Vu\ trabada em fund® do sinal de saida (ali'. idadc pós-^ináptica).!^.
Desta representado» vemos que a aplicado repetida do sinal de entrada (atividade pn¿»kmáptica) x
resulla em um aumento de i; e, portante, em um aewimento exponencial que ao final leva a cone-
xa® sinóptica á saturaba®. Naqucle ponto nenhuma informado será armazenada na sinapse e a
seleti vidade é perdida
rHSURAJ2.3 Ilustrado
da tiipólesa de Hetib e da
hipóle&e da covariancia
Hipótcse da covariancia. Unta formu de superar a limitad® da hipótese de Hcbb é através da
utilizad® da hiptit&m da cmaftínda inlruduzida por Sejnowski {1977a, b), Ncsta hipótcse, os
sinais pró-sináptico e pós-sináptico na Eq. (2.9) sáo substituidos pelo desvíos dos sinais pni-sináptico
e pás-sináptico em relajo ¿os seus respectivos valores médios em um certo intervalo de tempo.
Considere que í e v representeni os valores medios no tempo das sinais pré-sinápLico x c pós-
sinóptico j;, respectivamente, De acorde com a hipólcsc da covariancia, o ajuste aplicado ao peso
sinóptico w. é definido por
nu, - X)Ó, - y ) (2.10)
onde t| é o parámetro tasa de aprendizaje. Os valores medios Z e v constituem os Iimiares pré-
sínáptico e pos-sinóptico, que determinan) o sinal da modificado sinóptica. Em particular, a hipóte-
se da covariancia permite O spguintc:
• A convergencia para um estado nao-trivial, que é alcanzado quando = v cu v, - _v.
• A previsto da poteñcia$ao sinóptica (i.e., aumento da for?a sinóptica) e a depressao sinóptica
(j.e., diminuido da for^a sinóptica).
A Figura 2.3 ilustra a dtferenqa entre a hipótese hebbiana e a hipótese da covariancia. Em ambos os
casos, Air. depende linearmente de y.; entretanto, o cruzamiento com o eixo de y. na hipótese de
Hebb ocorre na origemT enquanto que na hipótese da covariancia ele ocorre em = y.
Podemos fazeras seguintes observares importantes sobrea Eq. (2.10):
1. O peso sinóptico ó reforjado se houver níveis suficientes de atividades pré-sináptica e pos-
sinóptica. ou seja, se ambas as condiqóes x > x e > y forera satisfeitas.
2. O peso sinóptico c deprimido se ocomcr uma das seguirles situares:
• uma ativa^O pré-si nápt ica {i. e-, i > jr ) na ausencia de ati va^áo pós-sináptica suficiente (i.e.,
j; < y ), ou
• uma ativBfáo pós-s i nápt i ca (i. e^ _ i > y ) na ausénc i a de a.t:i va^ao pré- si nápt i ca sufic lente (i .c.,
Xj< x).
Este comportamento pode ser visto como urna forma de compenso temporal entre os padrees
incidcnlcs.
Há uma forte evidencia fisiológica4 para a áprcnd ¿agem hebbiana na área do cérebro chama-
da hipocampo. O hipocampo desempenha um papel importante em certos aspectos de aprendiza-
gem e memória. Esta evidencia fisiológica toma a aprendizagem hcbbi.ina bastante aírativa.
2,5 APRENDIZAGEM COMPETITIVA
Na aprendizagem competitiva* como o nome implica, os neurónios de salda de uma rede neural
competen) entre si para se tomar ativos (disparar). Enquanto que em uma rede neural baseada na
aprendizagem hebbiana, vários neurónios de safda podem estar ativos simultáneamente, na aprendiza-
gem competitiva sementé um único neurónio de saida está ativo cm um determinado instante. É essa
característica que toma a aprendizagem com|x;titiva muito adequada para descobrir características
cstatisticamcntc sal lentes que podem scrutilizadas para classiticar um conjunto de padrees de entrada.
Existetn tres elementos básteos em uma regra de aprendizagem competitiva (Rumelhart c
Zispcr, 1985):
• Um conjunto de neuranios que sao Lodos iguais entre si, cxccto por alguns pesos sinópticos
distribuidos aleatoriamente, c que per isso respondem diferenteme/rte ñ um dado conjunto de
padrees de entrada.
* Um limite imposto sobre a “Ibrqa11 de cada neurónio.
• Um mecanismo que permite que o neurónio compita pelo direíto de responder a um dado
subconjunta de entradas, de forma que somcnlc wm neurónio de salda, ou sámente um neurónio
por grupo, esteja alivo (i.e., "ligado”) em um determinado instante O neurónio que vence a
competido c denominado um neErriÑiío vencedor leva tuda.
Corresponden (emente, os neurónios individuáis da rede aprendan a se especializar em agrúpamen-
os de padróes similares; fazendo isso, elcs se tomam detectores de características para classes
diferentes de padróes de entrada.
Na forma mais simples de aprendizagem competitiva, a rede neural (em uma única camada de
neurónios de saida, estando cada neurónio totalmente conectado aos nos de entrada, A rede pode
incluir ccnexóes de realimentacao entre os neurónios, como indicada na Fig. 2.4. Na arqiiitetura
aquí descrita, as eoncxóes de realimeniafáo realizam imbi^ao lateral.11 com cada neurónio lendcndo
a inibír o neurónio ao qual está lateralmente conectado. Por outro lado, as conexóes sinópticas de
alimentaban adi ante na redada Fig, 2-4 sao todas excitadoras.
Cnufa Camada ún-ic-a
de nás de de neurónios-
lóate de salda
FIGURA 2.4 Gralo arquilédurÉl dé urna
T-sdg de apr^nijizagem competitiva simples
com arroda ce akrwiteGfo odiante
(axciladcxas} dos rris de fonia para m
neurdmw & censKOW taCe<Bis (initiiórias)
ntn os nHurOnlos: as «antea (alarais
bSd r-sprasentiidaE por sslas abertas
Para um MUrónio t Ser O neurónio vencedor seu campo loca] induzido para um padreo de
entrada especificado x deve ser o matar entre todos os neurónios da rede. O sinal de saida y. do
neurónio vencedor £ c colocado cm um; os sinais de saida de Lodos as neurónios que perdem a
competiere sao Colocados cm zuro. Com isso, podemos, escrever
se t\ > para todos j,j # k
caso contrario
(2-11)
onde o campo local induzido i1 representa a a<;ao combinada de todas as entradas direias c
real i mentadas do neurónio £.
Considere que represente o peso sináptico conectando o nó de entrada j ao neurónta k.
Suponha que a cada neurónio seja alocada uma quantidade flxa de peso sináptico (Le., Lodos os
pesas smápticüs sao positivos), que c distribuida entre seus nos do entrada; ou seja,
= 1 para todo A
{2.12}
Um neurónio, entao, aprende ao deslocar pesos sinápticos de seus nós de entrada [nativos para os
seos nós ativos. Se um neurónio rúSo responde a um padreo de entrada particular, entáo n3o ocorrerá
aprcndizado naqueíe neurónio. Se um neurónio particular vencer a competirás, entao cada nó de
entrada deste neurónio libera uma certa propongo de seu peso sináptico e este peso liberado será
entao distribuido uniformemente entre os nós de entrada ativos. De acordo com a regra de apnendi-
Tagem competitiva padreo, a variapáo Au .. aplicada ao peso sináptico tí.1,. é definidla por
—) seo neurónio £ vencer a competí jáo
seo neureniü k perder a competí cao
(2.13)
ondcT| c o parámetro taxa de aprendizagem. Esta negra tcm o efeito global de mover o vetor de peso
sináptico i\ do neurónio vencedor k em direfáo ao padráo de entrada x.
Podemos utilizar a analogía geométrica representada na Fig. 2.5 para ilustrar a esséncia da
aprendizagem competí i i va (Rumelhart e Zipaer, 1985). Supomos que cada padrao (vetor) de entra-
da x tero una determinado compri mentó euclidiano constante, de forma que podemos vó-lo como
um ponto em uma esfera unitaria AT-dimcnsional, onde Mé o número de nós de entrada. N representa
também a dimcnsao de cada vcícr de peso sináptico w.. Suponías aínda que todos os neurónios da
rede tém o mesmp compri mente euclidiano (norma), como mostrado por
wj = I para todo ¿
J
(2.14)
Quando os pesos sinápticos sáo escalados adecuadamente, formam um conjunto de velones que se
encontram na mesma esfera unitária ^-dimensional. Na Fig. 2.5a, mostramos trés agmpamenlos
(c/tu/ers) naturais dos padrees de estimulo representados por pontos. Esta figura incluí também um
estado inicial possívcl da rede (representado porcruzes) que pode existir antes do aprendízado. A
Figura 2.5b mostra um estado final típico da rede que resulta da utilizado de aprendizagem compe-
titiva. Em particular, cada neurónio de saída descobriu um agrupamento de padrees de entrada
movendo o seu vetor de peso sináptico para o centro de gravidade do agrupamento descoberio
AGURA i. 5 inlerpratapfio geométrica do processo de aprondlzagam «wnpatitiwa.
Os pontos representan) os valoras da anteada a as cruzas reprasanrtam os valoras
de pesos sinápticos de irás neunflnios de saída. (a} Estado inicial da rede, (b) Estado
ina da rede
86 RcnF^MeuKAih
(Rumelhart e Zipser. 1985; Hcrtz ct al., 1991). Esta figura ilustra a habiiidade de uma rede neural de
realizara larcfa de agrupamento (clusferíng) atreves de aprendizagem competí i iva. Entretanto, para
realizar esta tunado de uma maneira "cstáver1, os padrees de entrada deveni se local izar cm agrúpa-
menos suficientemente distintos. Caso contrario, a rede pode ser instável porque nao responderá
mais a um determinado padreo de entrada com o mesmo neurónio de saida.
2.6 APRENDIZAGEM DE BOLTZMANN
A regia de aprendizagem de Boltzmann, assim chamada em homenagem a Ludwig Boltzmann, c
um algoritmo de aprendizagem estocástico derivado de idéias enraizadas na mecánica estatifica.1
Urna rede neural projetada com base na regra de aprendizagem de Boltzmann £ denominada uma
máquina de Bollzmann (Ackley ct al., 1985; Huklon c SejDGWXki, 1986).
Em urna máquina de Boltzmann, os neurónios constiruem uma eslrutura recórreme e operam
de uma maneira binaria, uma vez que, por cxemplo, eles estao ou em um estado ’+ligado” represen-
tado por +1, ou em um estado “desligado11 representado por -1. A máquina é caracterizada por uma
tia envrgiti, £, cujo valor é determinado pelos estados particulares ocupados pelos neurónios
individuáis da máquina, como mostrado por
E= (21i)
J *
onde x c o estado do neurónio j c u1^ c o peso sináptico conectando o neurónio j ao ncurónio k. O
tato de quej k significa apenas que nenhum dos neurónios da máquina lem auto-real Lmeniacáo. A
máquina opera escolhendo um neurónio ao acaso - por ejemplo, o neurónio i - em um determina-
do passo do processo de aprendizagem. trocando cntac o estado do ncurónio jfr do estado i para o
estado -xA a uma temperatura f com probabilidade
P(r*-*-x>) =
l
1 + éxjH A¿4/n
(2.16)
onde AE. c a variado de energía (i c.T a varia^áo da l'uncao de energía da máquina) resultante
(tapíela troca. Note que Tnao é uma temperatura física, mas apenas umapteudolemperalura, como
explicado no Capitulo I. Se esta regra for aplicada repetidamente, a máquina atingirá o equilibrio
térmica.
Os neurónios de uma máquina de Boltzmann sedividem em dois grupos funcionáis: os vüí-
vcjj e os ocultas. Os neurónios visíveis fomec^m uma mlerface entre a redee o ambiente cm que ela
opera, enquanto que os neurónios ocultos sempre operam livremente. Há dois modos de operado a
serem considerado^
* CüFff/ífÉÍo pesn. na qual os neurónios visíveis cstáo todos presos a estados específicos deter-
minados pelo ambiente;
• Ctmdi&iü de upav^ao íivreh na qual lodos os neurónios (visíveis c ocultos) podem operar
I ivremente.
Supcnha que représenle A corTela^aa cnlrc os estados dos neurónios j c i, com a rede na sua
condiqáo presa. Suponha que ji, represente a correla^du entre os esladoi dos neurónios / c kt com
a rede na sua eond¡0o de operaíáu livtft. Ambas as correla^dcs corrcspondem is médias sobre
ladea os estados possiveis da máquina, quando cía está cm equilibrio temí ¡ico. Entao, de acardo com
a regra de aprendizagem de Boltzmann, a varia^áo áre.. aplicada ao peso sináptico do neurónio
j para o neurónio k é definida por (Hinton e Sqnowski, 1986)
Att^ = r|(p¿ j*k (2.17)
onde Tj é o parámetro laxa de aprendizagem. Note que lanío como assumcm valores no
intervalo entre - i c + I.
Uma breve revisan da mecánica estatistica ó ¿presentada no Capitulo 11; naquele capitulo,
apresentamos um [ratamente dctalhado da máquina de Boltzmann c de outras máquinas cstocáslleas.
2.7 O PROBLEMA DE ATRIBUIDO DE CRÉDITO
Quando se estudam algoritmos de aprendizagem para sistemas distribuidos, c útil se considerar a
Tio^aü de atribulado de crédito (Minsky, 1961). Basicamenie. o problema de atribuido de crédito é
o problema de se atribuir crédito ou culpa por n$ullados globais a cada uma das dccisocs internas
que tenham sido tomadas por urna máquina de aprendizagem e que lenham contribuido para aque-
les resultadas. (O problema de atribuí cao de crédito c também denomi nado problema de caiga, i sto
ó, o problema de “cairegar" um determinado conjunto de dados de ireinamento para dentro dos
parámetros livres da rede.)
Em mullos casos, a dependencia dos resultados cm rdafáo a dccisocs ¡memas ó mediada por
uma seqüéncia de atjóes tomadas pela máquina de aprendizagem. Em outras pahvras, as deeisóes
intemas afetam a escolha das afóes particulares que sao tomadas c, com isso, as aijócs c nao as
dccisocs internas ínfluenciam diretamente as resultados globais. Mesías isituaftas, podemos dc-
comporo problema de atribuido de crédito em tais suhproblemas (Sutton, 1984):
1. A airibülfSo de crédito par resultadas a a^nes. Este c o chamada problema de atribitífüa de
crédito temporal que cnvolvc os instantes de lempo quando as a^óes que mereccm crédito
(ornen realmente lomadas.
1. A atribuicac de crédito por a^ocs a dcc i socs i alemas. Este é o cha tnado problema de atributado
de crédito estmturai que enval ve atribuir crédito ás wírufwras internas das aftas peradas pelo
sistema.
Q problema de atribuifáo de crédito eslrulural é relevante no contexto de uma máquina de aprendi-
zagem com múltiplos componentes quando devemus determinar precisamente qual componente
parí ¡cular do sistema deve ter seu comportamento alterado c cm que medida, de Forma a mcihorar o
desempenho global do si ¿lerna. Pür ouiro lado, o problema de atribuido de crédito temporal é
relevante quando há militas a^ocs lomadas por uma máquina de aprendizagem que acarretam certos
resultados, e devernos determinar quais dessas afóes foram responsáveis petos resultados. Ü pro-
blema combinado de atribuidlo de crédito temporal e cstrulural é enfrentado por qualquer máquina
de aprendizagem distribuida que se estarce em mdhcirar seu desempenho em situafóes env oí vendo
compertamento csiendido no tempo (Williams, 1988).
O problema de atribuifáo de crédito surge, por exemplo, quando J aprendizagem por correfáo
de erro c aplicada cm uma rede neural de múltiplas camadas alimentada adíame. A operado de
cada neurónio oculta, bem como de cada neurónio de saida desia rede, c importarte para a coma
operafáo global da rede, cm uma larda de aprendizagem de inlcressc. Ou seja, para resolver uma
tarcFa predeterminada, a rede deve atnlmir certas formas de coinportatnenta a todos os seus neurónios.
88 R: 1'1 - Neufíaiü
atreves da cspccitka^áo da aprendizagem por correoso de erro. Tcndoem mente esta fundamenU-
fáo, considere a situando descrita nq Fig. 2rla. Como o neurónio de saída ké visível para o mundo
externo, ¿possívcl to mecer uma rcspOSta desejada para este neurónio. No que diArespeitO ao neurónio
de saída, pode-se ajustar di relamerte os pesos sinápticos desic neurónio de aconto com a aprendiza-
gem por corrcpao de erro, como esbozado na Sc^áo 2.2. Mas como de vemos alHAiuir crédito ou
culpa pela a$Bo dos neurónios ocultos quando o processo de aprendizagem por cerrero de erro é
Utilizado para ajustar OS respectivos pesos sinápticos desses neurónios? A resposta para esta questao
fundamental requer ateneo mais detalhada: ela é apresentada no Capítulo 4, onde sao descritos os
dctalhcs algorítmicos do projeto de redes ncurais de múltiplas camadas alimentadas adianto.
2.8 APRENDIZAGEM COM UM PROFESSOR
Volcamos agora a nossa atengan para os paradigmas de aprendizagem. Cometamos considerando a
aprendizagem cum umpmfissor, que é também denominada aprtmdizügefn auperviaiontida. A Fi-
gura 2.6 mo.stra um diagrama cm blocos que ilustra esta forma de aprendizagem. Em termos
conceptuáis, podemos considerar o professor como tendo conhecimento sobre o ambiente, com este
V<crir deset
11 CSlWkl Jíb
Siral de enu
Fl G U RA 2.6 □iiflramd sm Uocde da
aprendizagem com um prüfegwr
conhecimento sendo representado por um conjunto de Enlrclantib o
ambiente ¿ rfejcwftex'Kfo pela rede neural de interesse. Suponha agora que o professor c a rede
neural sejam empostas a um vetor de treinamento (Le., exemplo) retirado do ambiente. Em virtudc
de scu conbec¡mentó prévio, o professor c capaz de fomcccr á rede neural uma resposta desejada
para aquele vetar de treinamento. Na verdade, a resposta desejada representa a a^So ¿tima a ser
realizada pela rede neural. Os parámetros da rede sfto ajustados nob a Influencia combinada do vetor
de treinamento e do sinal de erro, ü vfno/ de erro é definido tremo a di lerenda entre a nesposta
desejada e a rcspcsla real da rede. Este ajuste c realizado passo a passo, iterativamente, com o
objetivo de fazer a rede neural emular o professor; supóe-se que a emulafSo seja ótima em um
sentido estatístkc. Desta formaT o conhecimento do ambiente disponive! ao professor c transferido
para a rede neural atravcs de treinamento, da forma mais completa possívcl. Quando esta condifüo
é alcanzada, podemos cntáo dispensar o professor c dcixar a rede neural lidar com o ambiente
intciramcntc por si mesma.
A forma de aprendizagem supera asionada que acabamos de dcscrcvcr c a aprendizagem por
ccrre^áo de erro discutida na &ef3o 2.2. Ela é um sistema realimentada de laqo fechado, mas o
ambiente desconhecido nao está no la^o. Como uma medida de desempenho para o sistema, pode-
mos pensar em termos do erro médio quadrado ou da soma de erras quadrados sobre a amostra de
treinamento, definida como uma fún^ao dos parámetros livres do sistema. Esta fundió pode ser
visualizada como uma superficie muitidimensiona! de desempenho de erro, ou simplesmente uma
superficie de em, com os parámetros íivres como coordenadas. A verdadeira superficie de erro ó
obtida pela media sobre todos os exemplos possíveis de entrada-saída. Qualquer operado do aísle-
ma sob supervisé do professor é representada como um ponto sobre a superficie de erro. Para que
o si'ítema melhorc o sen desempenho ao longo do lempo e portanto aprenda com o professor, o
ponto de opcraifáo deve ser movido para babeo sucesivamente cm direjáo a um ponto mínimo da
superficie de erro; o ponto mínimo pode ser um mínimo local ou um mínimo global. Um sistema de
aprendizagem supervisionada é capa?, de fazer isto com a informado útil que ele tem sobre o
gradiente da superficie de erro, correspondente ao comportamcnlo corrcntc do sistema. O gradiente
de uma superficie de erro em qualquer ponto é um vetor que aponía na direpáo da descida mais
ingreme. Na vendade, no caso da aprendizagem supervisionada por exemplos, o sistema pode usar a
estimativa instantánea do vetar gradiente, supondo que os índices dos exemplos sejam os mesrnas
dos instantes de tempo. O uso de tal estimativa resulta em um mavímenlo do ponto de opera^áo
sobre a superficie de erro que se dá típicamente na forma de uma "cam inhada aleatoria'*. Apesar
disso, dados um algoritmo pro.¡ciado para minimizar a fuñado de custo, um conjunto adequado de
exemplos de entrada-saida e tempo suficiente para realizar o treinamento, um sistema de aprendiza-
gem supervisionada c normalmente capaz de realizar tarefas como clas&tficafao de padrees e apro-
ximado de fun(oes.
2.9 APRENDIZAGEM SEM UM PROFESSOR
Na aprendizagem supervisionada, o processo de aprendizagem acontece sob a tutela de um profes-
sor. Entretanto, no paradigma conhccido como aprendizagem sem um professor, como o nome
implica, nao há um professor para supervisionar o processo de aprendizagem. Isto significa que n£o
há exemplos rotuladas da fun^áo a ser aprendida pela rede. Neste segundo paradigma, sao
identificadas duas subdivisocs:
1, Aprendizagem por refor^o/ProgramaQáo neurodlnámica
Na aprendizagem por reforjo * o aprendizado de um mapcamenio de cntrada-saida c realizado
através da mtera^áo continua com o ambiento, \ isando a mi tuto i zar um indico escalar de desempe-
nho. A Figura 2.7 apresenta o diagrama em hlocos de uma forma de sistema de aprendizagem por
reforjo construido em lomo de um critico que comerte um sinal de vejarlo primario rccebido do
ambiente em um sinal de refoofo de mcihor qualidade, denominado j/no/ de reforjo heurístico,
sendo ambos entradas escalares (Baño et al.. 1983}. O sistema é projeiado para aprender por refonco
atrasado, o que signi líica que o sistema observa uma scqücncia temporal de estímulos (i.e., vetores
de estado) tambem rcccbidos do ambiente, que eventualmenle resultam na geranio do sinal de
reforjo heurístico. O objetivo da aprendizagem é minimizar urna fitn^áo de custo para avanzar,
definida como a expectativa do custo cumuladvo de a^oes tomadas ao longo de uma seqüéncia de
passos, em vez simplesmente do custo i medíalo. Pode acontecer que certas aqoes tomadas anterior-
FIGURA s.7 Diagrama «m Wkcs
da aprendizagem púr retaría
Trente naqucla scqücncia de pasaos de tempo sejani de falo os mclhorcs determinante!; do compor-
tomento global do sistema. A fungSo da matutina de uprvndizqgem, que constituí o Segundo compo-
nente do sistema, é descobrir estas a^oes e real intenta- Las para o ambiente.
A aprendizagem por referió atrasado c dilícil de ser realizada por duas razocs. básicas:
• Nao existe um professor para femecer uma resposto desejada em cada passo do processo de
aprendí zagem.
• Ü atraso incorrido na geranio do sinal de reforjo primário implica que a maquina de aprendí-
zagem deve resolver um pmblemu de utrihui^üa de crédito temporal. Com isso, queremos
dizer que a máquina de aprendizagem deve ser capaz de atribuir crédito ou culpa individual-
mente a cada aijáo na soqüemoa de passos de lempo que Levam ao resultado final, enquanto
que o reforjo primário é capaz apenas de avallare resultado.
Apesar dcstas dificuidados, a aprendizagem por reforjo atrasado e muito atraente. Fia fornece a
base para O sistema inleragir com o seu ambiente, desenvolvendo com ¡SSO a hábil idade de aprender
a realizar uma torcía predeterminada Cüm base apenas nos resultados de sua experiencia, que rcsul-
tam da interacáo.
A aprendizagem por nsfor^u está intimamente relacionada com aprogramada dinámica, que
foi desenvolvida por Bel Imán (1957) no contexto da icoria de controle óiimo. A programado diná-
mica fomccco formalismo matemático para a tomada de decisáoseqDcncial. Enquadrando a apren-
dizagem por refago dentro da abordagem da programado dinámica, o assunto se torna bastante
ríce, como demonstrado em Bertsekas e 1 sitsilílis (1996), Um tratamunto introdutério sobre pro-
grama^áo dinámica e sua relajo coma aprendizagem por reforjo é apresentado no Capítulo 12.
2. Aprendizagem náo-supervisionada
Na aprendizagem nao-supe tcisionada ou íiitlíi-argünízadSt nád llá um professor extemo ou um
crítico para supervisionar o processo de aprendizado, como indicado na Fig. 2.8. Em vez disso, sao
dadas condifSes para realizar uma medida independente da tarefa da qualidade da representado
que a rcdc deve aprender, e os parámetros livrc da rede sao otimizados em relajo a esta medida.
L'ma vez que a rede tenha se ;i justado ás regularidades cstaLÍsticas dos dados de entrada, ela desen-
volve ;i habilidad^ de formar representares intemas para codificar as características da entrada e,
desse modo, de criar automáticamente DOVU elasses (Bccker, 1991).
rgrCEJKB M ApHUNDIZaGEM 91
vetar
dése ns venda
a estado do
FIGU H A 2. B Diagrama fim biOCos da
aprendizagem rtaQ-eupervisipnMia
Para realizarmosaaprendizagem. nao-supervisionada, podemos utilizara regra de aprendiza-
gem compelí ti va. Pedemos utilizar, por exemplo, urna rede neural de ditas camadas - uma camada
de entrada e uma camada competitiva. A camada de entrada recebe os dados dispon (veis. A camada
competitiva consiste de neurónios que compclcm entre si (de aconta com uma regra de aprendíza-
gem) pela “oportunidade’1 de responder ás características comidas nos dados de entrada. Na sua
forma mais simples, a rede opera de acardo com uma estrategia do tipo "o vencedor leva tudo"1.
Como descrito na Se^áo 2.5, nesla estrategia o ncurór.m cpm a maior entrada total "ganha" a com-
petido etc coma ligado; lodos os o ul ros neurAníos, eniáo, se tornara desligados.
Nos Capítulos de 8 a 1 L sao descritos diferentes algoritmos para aprendizagem nao-supervisio-
nadL
2.10 TAREFAS DE APRENDIZAGEM
Ñas socóos anteriores dcstc capitulo, discutimos di 1 érenles algoritmos de aprend' zagem e paradigmas
de aprendizagem. Ñusca sefáo, descrecemos al gamas tardas básicas de aprendizagem. A eswllia
de um algoritmo de aprendizagem particular é influenciada pela tarefa de aprendizagem que uma
rede neural deve cxccutar. Ncstc contexto, identificamos seis tárelas de aprendizagem que se apli-
cara ao uso de redes neurais de uma forma ou de outra.
Associaqáo de Padrees
L'ma memoria avíoeiativu é urna memón;ndistribuida inspirada no cerebro, que aprende por r/x»-
Desde Aristóteles, sabe-se que a associacáo c uma característica preeminente da memoria
humana, e todos os modelos de enguiño ulilfram usocMffo de uma forma ou de outra como a
operarán básica {A nderson, 1995).
A associap^ü assume luna de duíis formas: ¿níta-m.* atracó oí* heterww¡&eís$So. Na auto-
associapao, uma rede neural deve armuztmar um con i unto de padrees (vetares), que sao aprésenla -
dos repetidamente á rede. Subsequenlemente. apiesenta-se a rede urna describan parcial ou distorcida
(ruidosa) de um padrao original armazenade c a laretá é recuperar {recordar} aquclc padrao partí
Guiar. A heleroasttacia^iío difenda auto-a^ocia^Aorelo fatn de um conjunto arbitrario de padróe^
de entrada ser as sodado a um oulru conjunto arbilrdriü de padrees de salda. A auto-assoeiaQao
envol veo uso de aprendizagem náa-supcR-ísionada, enquanto que. na hctcroassociacao, a aprendi-
zagem é supervisionada.
Considere que i, represente umpa<hao-chave (vetar) aplicado a uma memoria associaliva e J
represente um padrao memorízado{vtíXiT}. A assoeiacao de padrees realizada pela rede c descrita
por
i. k = 1.2..... (2.18)
onde 7 é o número de padrees armazenades na rede. O padreo-chave x, age como um estímulo que
nio apenas determina a local iza?ao de irmazcoaíoeoto do padreo memorizado y., mas lambem c a
chave para sua recupcracao.
Em uma memoria auto-<issocia(iva. y = \, c assim os esparcís (de dados! de entrada e de saida
da rede tem a mesma dimensionalidade. Em urna memoria hetereassoeiativap yÁ * xA¡. perianto, a
diniensiüiialidadc do espado desdida oeste segundo caso pode ou nao ser igual a dimensional i dade
do espado de entrada.
H;i duas Pases envolvidas naoperagáo de uma memoria associaliva:
• A jase de armazenameniot que se refere ao treinainento da rede de acordo com a Eq. (248).
• A fase de recarda^cln. que cnvolve a recupera?aci de urn padreo memorizado cm desposta á
aprcscntaqáo á rede de uma verseo ruidosa ou distorcida de um padráo-chavc.
Suponha que o estimulo (entrada) x represente uma versáo ruidosa ou distorcida de um padrao-
chave i. Este estimule produz uma resposta (salda) y, como indicado na Fig. 2,9. Para a recordado
perlería, nos devenamos obter y = yr onde vio padrSo memorizado íissociado ao padráo-chave 1.
Quando y y|V para * - a . diz-se que a meniória assnciativa fez um errar de recordado.
Vl'Inr a
kTlIrjlliii
X
xj Amciadar
de padrees
Veior de
salda
FIGURA 2.9 A raíalo d& entrada- sa ida
de um aswciadar de padreas
[
O número q de padrees armazenades em uma memoria asociativa forncee uma medida di reía
da capncítíide de armace na mentó da rede. No prtijeCo de UiTia memótia usctiuti^a, o desafio é
tomar a capacidade de armazenamento g (exprcssa como uma pareen tagcin do número total Ardc
neurónios utilizados para construir a rede) cao grande quanto pcssivel e aínda assim conseguir que
urna grande fiaban dos padrees memorizados sejam recordados conctamcntc.
R&conhecimenlo de Padrees
Os seres humanos sio bons no rcconhccimentó de padrees. Recebemos dados do mundo á nossa
volts através dos nossos sentidos e somos capazes de reconhecer a fonte dos dados. Freqúentcmente,
somos capazes de tazar isso quasc que ¡medíala montee pralicamente sem esfoc^o, Podemos, por
exemplu, reconhecer um rosco familiar de uma pessoa muito embota esta pessoa Icnha cnvclhocido
desde a nosso último encontró. identificar uma pessaa familiar pela sua voz ao telefone, apesar de
uma conexao ruim, e distinguir um ovo férvido que é bom de um ruim pelo seu chciro. Os humanos
rcalizamo retanheu¡meneo depadrues alravés de um processo de aprendizagem; c assini acontece
com ss redes neurais.
O rvconhccimenfo de padrne.t é formalmente definido como Gprocessopeto tfual wmpodran/
sinal recebúto é ítíribuido a uma dasse denire um número predeterminado de ctasses (catenariasf
Uma rede neural realiza o recoidieclmenlci de padrucs passundo inicial mente por uma secan de
treinamcnio, durante a qual se aprésenla repetidamente á rede um conjunto de padnDes de entrada
Junto com a ¿alegoría á qual cada padreo particular pencncc. Mais tarde, apresenta-se á rede um
novo padreo que nao foi visto antes, mas que perience á mesma populado de padrees utilizada para
trclnar a rede. A rede ¿ capaz de identificar a classe daquele padrao particular por causa da informa-
Q3O que ola cxlreiu dos dados de treinamenta. O recrnihecimencu de padrees realizado par uma rede
neural é de naturezn eslatística, com os padrucs sendo representados par pontos cm um espado de
PtonrBnane tw Appfk iw.ru 93
í/htísuo niullidmiensionaL O espayo de dccisáo é dividido em regióos, cada Lima das quais asocia-
da a uma classc. As fronte i ras de dccisao sao determinadas pelo processo de ireinamento. A cons-
truyan dessas fnmtciras é lomada estatísliua pela vari ah i 1 ¡dade inórente que existe dentro das clas-
ses e entre as dasses.
Em termos genéricos, as máquinas de reeonhcciniento de padrúes que utilizan) redes neurais
podem assumir uma das duas formas seguimos:
• A máquina é dividida em duas partes,.uma rede iián-supervisinnada para extraídodecaraca-
riaticéis e uma rede supervisionáda para (Vaw/farttió, como mostrado na l'ig. 2.10a. Este
método segué a ábordagcm tradicional de recunhccimunlo estatfelico de padrdes (Duda e Haci,
FIGURA 2.10 lluSln^So da
abondagem cl¿5$k» para
ctessificapáo da pútirifes
ih]
] 973; Fukunaga, 1990). Em tcmros concciluais, um padráo é representado por um conjunlo de
irj observa veis, que pode ser v isto como um ponto x de um espada de observa^ aa {de dadas)
"¡-dimensional, A extraen de características é descrita por uma transformado que nupeia o
ponto x para um ponió intermediario y cm um espado de características ^-dimensional, com
y < ni. como indicado na Fig. 2.1 Oh. Fsta transformado pode ser vi si a como uma red uy So de
d¡metí!iion¿ilidade ( ..e., cnrppreMSO de dados), CUja utilizayáo é justificada por cía simplificar
a larela de classifica^áo. A própria classificapfo é descrila como uma transforniaySo quema peí a
o pomo intermediario y para uma das elasses cm um espayo de dccisáo x'-dimensional, onde r
é o número de clMBCS a ser distinguidas.
* A máquina é projetada como uma única rede de múlunlds camadas alimentada adi ante, utili-
zando um algoritmo de aprendizagem supervisiúiiada. Ncata segunda abordagem. a tarefa de
extrayáo de características c realizada pelas uu ¡dades computaciones da(s) camada(s) oculta(s)
da rede.
A escüllia de qual dcstas duas abordagens deve ser adotada na pratiea depende da aplicayáo de
uitcresüc.
Aproximado de Fun^oes
A terecina tarefa de aprendizagem de ínteresK é a aproxímalo de fiuidSw- Considere um
mapeamento de entrada-saida n&o-l mear descrito pela rtlaqáo funcional
(2.19)
onde o vetor x é a entrada c o vetor dea saida. Supdose que a fun0o de valer vetorial f{-} sega
desennhccida. Para compensar a falta de conhecimento sobre a fun?ao lí L é fomcuido um conjunto
de excmplos rotulados:
={(*.<>.)}' (2»>)
ü objetivo é projetar uma rede neural que aproxime a funcao deseonhccidd f( ) de forma que a
funpáo F( ) que dcscrcve o mapeamcnlo tic entrada-saida realmente realizado pela rede esteja sufi-
cientemente próxima a t'l-1. em um sentido euclidiano, sobre todas as entradas, como mostrado por
| F(x) - f(x) | < t para todo x (2.21)
onde E é um número positivo pequeño. Conlanto que o lamanho .Vdo conjunto de ircinamcnto seja
sulkicntomcnto grande eque a rede estoja equipada com um número adequado de parámetros 1i-
vres, entáo pode-se fazer o erro aprox-.mativoc suficientemente pequeño para a tarefa.
O problema de aproximado descrito aquí é um candidato per l'cito para a aprendizagem super-
visionada, com x desempenhande u papel do vetar de entrada e d desempenhando o papel da
resposta desejada. Pedemos cntSo invertir esta questáoe vera aprendizaje un supervisionada como
um problema de aproximado,
A habí li dad e de urna rede neural de aproximar um mapeamento de entrada-saida desconhecí-
do poete ser explorada de duas formas importantes:
* kteniificatflQ jírtoW- Suponha que a cq. (2.19) descreía a relajan de entrada-sai da de um
sistema de m¡tipias entradas—múltiplas saldas (MíMQt mitiiiple iirpifi-muitipie ontpui} sem
memoria, desconhccido; emendemos por sistema "sem memoria11 um sistema que sega invariante
no tempo. Podemos cntáo ulili¿ar o conjunto doexemplos rotulados da Eq. (2.20) para tremar
uma rede neural como um modelo do sistema. Suponha que y represente a saida da rede
neural producida cm cesposla a um vetor de trnl rada jt. A di lerenda entre d. (associado com x 1
e a saida da rede y fomecc o vetorde sinal de erro e . como representado na f íg. 2.11, Este
sinal de erro, por sua vez, é usado para ajustaros parámetros livras da rede de loma a minimizar
a diferenfaquadrar.ca entre as suidas do sistema deseenliecido e a rede neural cm um sentido
csiatísiicü, c é calculado sobre o conjunto de t reina mente inteiro.
* 57.sfúnia /fhítod. Suponha a seguir que nos seja fomccido um sistema MIMO cotillee i do, sem
inemónn, cuja relajan de entrada-saida ¿ descrita pela Eq. (2.19). O cbjistivo oeste caso c
construir um ¿frtaina rnvíFyo que produza o vetor x em resposta ao vetor d. O sistema inverso
pode, assim, ser descrito por
x = f'(dl (2.22)
FIGURA 2.11 Diagrama em btocos
da ¡JHiiitifKá^áo da sislama
ande a fijnflo de valor vctonal f ’() representa a inversa de f( X Note, entretanto» que fl(}
nao é a reciproca de f(’); cm vez disso, o uso do indico -I é meramente para indicar uma
lUvúrsáo. Em nmitu situares encontradas na priiica, a funfilo de valor veto ría [ f() ¿ por
demais complexa para que se possa formular di netamente a fun0o inversa f '(). Dado o con-
junto de exemplos rotulados da Eq. (2.2G)„ podemos construir uma aproxima^ao por rede
neural de r'(<), utilizando o esquema mostrado na Fig. 2.12. Na situando aquí descrita, os
papéis de x, e d fbram trocados: o vetar d é uri liizado como a entrada c x c tratado como a
reaposta desdada. SupOnha que o vetar de sinal de cito c represente a di 1'erenfa entre X? e a
saída real yr da rede neural, producida em resposta a d.. Como no problema de identifícagao de
sistemas, este vetor de sinal de erro c utilizada para ajustar os parámetros Ih res da rede neural»
de modo a minimizara diferenca quadrática cutre as saldas do sistema inverso desconhecido e
da rede neural em um sentido estalíslico. e é calculado sobre o conjunto de treinamento com-
pleto.
Erro
*r
FIGURA 3.12 Diagrama em Mocos da modalagam do sistemas inversas
Controle
O controle de uma planta é uma cutra tarefa de aprendizagem que pode ser feita por uma rede
neural; aquí, “planta" significa um processo ou uma parte crítica de um sistema que deve ser man-
tido cm uma CfiffldífSo controlada. A relevancia da aprendizagem para o controle nao deveri a ser
surpreendente porque, afinaI, o cerebro humano é um computador (i.e., um processador de informa-
fao), quct visto como um sistema» preduz saldas que sao opoes. No contexto de controle, o cerebro
¿ a pro va viva de que é possívcl construir um controlador genérico que lira total vantagem da
¡inplementa^ao física paralelamente distribuida, que pode controlar rauitos mi Ih ares de atuadores
(fibras musculares) em paralelo, que pode tratar náo-linearidades e ruido e que pode realizar
otimizayáo sobre um horizonte de pl aneja mentó muito ampio (Werbos. 1992).
Considere o júre/Mí? de controle ivaiimentado da Fig. 2.13, Q sistema envolve o uso de reali-
mcntai^ao unitaria cm tomo de uma planta a ser controlada; isto é. a saída da planta ó realimentada
di netamente para a entrada? Com isso. a saída da planta y é subtraída de um xínuí de referencia d
tornee ido por uma fontc ostenta. O sinal de erro o assim produzido c aplicado a um ctmfmiador
neural com o propósito de ajustar os seus parámetros livres. O objetivo principal do controlador é
fomecer entradas apropnadas para a planta, fazendo com que a sua saída y siga o sinal de referencia
d. Em outras palavras, o controlador deve inverter o comportamento de cntrada-saída da planta.
Notamos que na Fig. 2.13 o sinal de erro e dcve-sc propagar atraves do controle neural antes
de alcanzar a planta. Conseqüeruemente, para realizar ajustes nos parámetros livres da planta de
acordo com um algoritmo de aprendizagem por correcto de erros. precisamos conhecer a matriz
jacobiana
díí
L '
Sinal Efflnifa
Rü;iIi iii<r,nljiip\H-i unLl-iiniJ
FIGURA 2.13 Diagrama em blocos de um sistema Jo controle realimentado
ondej^ ¿ um elemento da saída da planta ycu.c um el emento da entrada da planta u. Infelizmente,
as derivadas parciais ytf u para varios ley dependen; do pomo de operacáo da planta e, púnanlo,
nao sao conliecidas. Podemos adotar urna de duas abordagens para tratar este problema:
• idpreMrfzqgejh iik/irtfa. Utilizando medidas de cntrada-saída rcais da planta, é construido ini-
cial ni ente wn modelo bascado cm rede neural para producir uma copia da plañía. Por sua vez,
este modele c utilizado para fomecer uma estimativa da matriz jacobiana J. As derivadas
parejais que consütucm esta matriz jacobiana sao utilizadas subsecuentemente no algoritmo
de aprendizagem por corrugo de erro para calcular os ajustes dos parámetros livres do
controlador neural (Nguyen c Widruw, 1989; Suykcns ctaL, 1996; Widrow e Walach, 1996)+
• rftreta. Os sin ais das derivadas parciais sao feralmente conhecidos e
normalmente se mantcm constantes ao longo do intervalo dinámico da plañía. Islo sugere que
podemos aproximar estas derivadas parciais pelos seus Bináis individuáis. Os seus valores
absolutos recebem uma representatíto distribuida nos parámetros livres do controlador neural
(Sacrens e Soquet, 1991; Schiffman e Geffers, 1993). Com isso, o controlador neural se torna
capacitado a aprender os ajustes de seus parámetros livres diretamente da planta.
Phocukcs dk Ame97
Fittragem
O termo filtro se refere frequenteraente a um dispositivo ou algoritmo utilizado para extrair infcr-
Tna^ao sobre uma determinada grandeza de inieresse a partir de um conjunto de dados ruidosos. O
ruido pode surgir de uma varicdadcdc fontcs. Os dados podem tersido medidos pormeiode sensores
ruidosos, por exemplo, ou podem representar um sinal portador de informado que foi corrompido
pela transmissao através de um canal de comunicaban. Como outro exemplo, poderse ter uma com-
ponente de sinal útil, corrompida por um sinal de interferencia captado do meio ambiente. Podemos
utilizar um filtro para realzar trés tárelas básicas de processamenlo de informado:
1. Fiitragcm. Esta tarefa se refere á extrafáo de informacao sobre uma quantidadc de interesse no
tempo discreto a, utilizando dados medidos até o tempo w, inclusive.
2. Esta segunda tarefa difere da filtragem pelo fato de que nao c ncccssário que a
infórmalo sobre a grandeza de interesse es teja disponivcl no tempo n c de que os dados medi-
dos após o lempo « podem ser usados para obter esta informarse, Isto significa que, na suavizado,
há um atraso na predu^ao do resultado de interese. Ja que no processo de suavizapáo podemos
usar dados obtidos nao apenas até □ tempo n mas também após o tempo w, podemos esperar que
a suavizado seja mais precisa que a filtragem em um sentido estatistieo.
PrwLitio. Esta tareiacorresponde ao lado predítivo do processamento de informando. O objetivo
aquí ¿ derivar informa^ao sobre como sera a grandeza de interesse cm um determinado tempo n
+ no futuro, para alguna > 0T utilizando os dados medidos até o tempo n inclusive,
Um problema de filtragetn com o qual os seres humanos estilo familiarizados é o prvblama da festa
¿te coqueieL10 Temos uma hábilidade nolável para nos concentramos em um locutor dentro de um
ambiente ruidoso de uma festa de coquetel, apesar de o sinal de voz originario daquele locutor estar
envolvido por um fundo extremamente ruidoso devído á inierferéncia de outras conversas na sala.
Presume-se que alguma forma de análise pré-atentiva, pné-conscienfe deve estar envolvida na reso-
luto do problema da festa de coquetel (Vblmans, 1995). No contexto das redes neurais (artificiáis),
um problema similar de íiltragem ocorre na chamada vejicnufai) de sinal (Comon, 1994; Bel[
c Sejnowski. 1995; Aman c al. 1996). Para formular o problema da separado ccga de sinal, consi-
dere um conjunto de sinais de fonte desconhecidos Que 5*° mutuamente independentes
entre si. Estes sinrus sao misturados linearmente por um sensor desconhecido para produzir o vetor
de observado m-por-1 (veja a Fig. 2,14)
x(/i) = A ii(rj) (2.24)
onde
u(fl) = !«,(«), ura(n)]r (2 25)
jt(«) fr, («T X- J (2.26}
Ui(n) o
MiFlunufor
Icwonhw .! I
SqwiwJcir
o V|(n)
AGURA 2.14 Diagrama $rn blucos
da separaQfio cegs de fonle
ArtlhiciLie
dreconhccidio
9S REOS NEukais
c A é tuna matriz demistura náo-s inguiar, desconhecida, de dimcnsocs m-por-m. Dado o vetor do
observado i(n), o objetivo é recuperar os sinais origináis íj,(n),..., wjn) de uma maneira nao-
supera isii.inada.
Voltando-se agora ao problema da previsto, o objetivo é prever o valor presente x(m) de um
processo. dados valores passados dexte processo, que sao uniformemente espadados no tempo 1 como
mostrado porj(n — 7}t.vir¡ — 27),,.., xf« — m7), onde 7'éo periodo deamostragememe aordem da
previsto. A previsto pode ser resolví da utilizando-se aprendizagem por corracao de cno de uma
mane ira nao-super\ isionada, já que os exemplos de Ir enlámenlo sSo reí ¡mitos d ¡relamen te do pró-
prio processo. como representado na Fig. 2.I5. onde x(w) ama como resposta desejada. Suponha
que X («) represente a previsác de um passo produzkla pela rede neural no tempo n. O sinal de erro
ú(n) c definido como a diferente entre x(n) e ¡¡ (jiX que é usada para ajustar OS parámetros 1 ¡VTM da
rede neural. Com isso, a previsáo pode ser vista como uma forma de consfrufdo de modelo, signi-
ficando que quanio menor ícr o erro de previsáo em um sentido eslatistico, meihor será o desempe-
rno da rede como um modelo do processo físico básico que c responsável pela geracao dos dados.
Quando este processo é nün-íinear, O USO de urna rede neural fomece um método poderoso para
resolver o problema de previsáo, dev.do as unidades de procos sámente nao-linearas que podem ser
usadas nesta construyo. Entretanto, a única excedió possível para o uso de unidades de processamento
nao-linearas c a uriidadc de salda da rede; se o intervalo dinámico da serie temporal {x(n)} for
deseenhecido. a utilízalo de uma unidade de salda linear c a cscolha mais razoável.
FIGURA 2-15 Diagrama em blocos
da p<w¡5áe rutodinear
Formado de feixe
A formado de fcixc c urna forma de filtragem espacial c c utilizada para distinguir entre as
propriedades espaciáis de um sinabalvo e o ruido de fundo, O dispositivo usado para realizar a
formaban de fcixc c chamado deformador de feixe.
A larefa de formaíáo de feixe é compal ivel com o uso de uma rede neural, para o que temos
indi calóes i importantes de estados da ps ico -acústica das rcsposlas auditivas humanas (Bregman,
1990) e de estados do mapeamenlo de características ñas camadas cortical dos sistemas auditivos
de mercegos ccolocalizadorcs (Suga, 1990a; Si inmons e Sailant, 1992)i O moncego eco localizador
irradia o meio ambiente transanIlindo sinais de freqiiÉncia modulada (FM) de curta durare e entáo
utiliza o seu BÍatona auditivo (¡neluindo um par de oral has) para focar a atencáo na sua presa (p.ex.,
um inseto voador). As oral has fomcccm ao morccgo uma forma de filtragem espacial (interferometria,
para sermos exatos). que c cntáo explorada pelo sistema auditivo para produzir untaaelcrMade
por atenido.
A formaban do fei ve é normal mente utilizada cm sistemas de radar e sonar nos quais a tarefa
principal é detectar e perseguir um alvo de interesse na presenta combinada de ruido do receptor c
sinal de interferencia (p.ex., ohstrulores). Esta larda c complicada por dois falore^.
• O sinal-alvo se origina em urna dire^áo dcsccmhccida.
* Náo há mformapáo apríorí disponível sobre os sinais de interferencia.
Uma forma de lidar com situafóes deste tipo é utilizando um canceladbr de lóbulo lateralgenera-
lizado (CLLG), cujo diagrama em blocos está mostrado na Fig. 2.16. O sistema consiste dos se-
guintes componentes (Griffiths c Jim, I9S2; Van Vccn, 1992; Haykint 1996);
FIGURA J.16 □¡agrume em Mecos do can«lador de lóbulo lateral generalizado
• Um arranjo de elementos de antenas, que fomece um meio de amostrar o sinal observado em
pontos discretos do espado.
• Um combinador linear definido por um conjunto de pesos fixes Cuja saída c uma
resposia desejada. Este combinador linear age como um “filtro espacial”, sendo caracterizado
por um padrio de radiado (i.e., um gráfico polar da ampliiude da saída da antena em fün^áo
do ángulo de incidencia de um sinal incidente). O lóbulo principal deste padreo de radia^áo
está aportado ao longo de uma directo predeterminada, para a qual o CLLG deve ser restríto
para produzir uma respnsta sem distendeos. A saída do combinador linear, representada por
d(n)t fomece uma resposta desojada para o formador de fcixc.
• Uma matriz btoqueadora de sinal C . cuj a fun^áo c cancelar a i nterferénc ia que escapa atreves
dos lóbulos laten» do padreo de radiado do filtro espacial que representa o combinador
linear.
• Urna raefe neuralcom parámetros ajusláveis, que é projetada para acomodar variares esiatis-
ticas nos sinais de interferencia.
Os ajustes dos parámetros livres da rede neural sao realizados por um algoritmo de aprendizagem
por coire^áo de erro que opera sobre o smal de erro ¿(ji), definido como a diferen^a entre a saída do
combinador linear d(n) e a saída real j(n) da rede neural. Assim, o CLLG opera sob a supervisáo do
combinador linear que assume o papel de um “professorComo na aprendizagem supervisionada
usual, note que ú combinador linear está fóra do lapo de reakmenta^áo que age sobre a rede neural.
Um formador de feíxe que uti liza uma rede neural para a aprendizagem ó chamado de formador de
100 RfiDfiS NftJHAIh
J&íxe? tieuml- Esta elasse de máquinas de aprendizagem se enquadra sob o título gcral de
ncw&campniadorex atencionaií (Hecht-Níelsen, 1990).
A divcrskladc das seis tarefas de aprendizagem discutidas aquí serve de tcstcmunho para a
universalidade das redes neurais como sistemas de processamento de informasáo. Em um sentido
fundamental, todas estas tarólas de aprendizagem sao problemas relativos a aprender um mapeametita
a partir de cxcmpkis (possivelmente ruidosos) de mapeamenlcs, Sem a imposiQáo de conhecimento
previo, cada uma destas tarefas c na verdade mal-formalada, no sentido da náo-unic idade das pos-
siveis soIuqocs de mapeamento. Um método de tomar a sülu^áo bcm-formulada é utilizara teoría
da regularizado, pomo descrito no Capitulo 5.
2.11 MEMÓRIA
A discussüo de tarefas de aprendizagem. particularmente a tarefa de associa£áo de padrees .nos. leva
naturalmente a refletir sobre a memoria. Em um contexto ncurobiológico, memoria se refere as
altcracóes neurais relativamente duradouras inducidas pela luterano de um organismo com o seu
ambiente (Teyler, 1986). Sem esta alteraban nao pode haver memoria. Além disso, para que a me-
moria seja útil, ela deve ser acessívcl ao sistema nervoso para poder influenciar o com porta menta
futuro. Entretanto, um padrao de aliv idade deve ser inicialmcnte armazenado na memoria através
de um procesan de aprefidizagL'm. Memoria e aprendizagem estilo conectadas de forma intrincada.
Quando um padrao de al i v idade particular é aprendido, ele é armazenado no cerebro, de onde pode
ser recuperado maia tarde, quando exigido. A memoria se divide cm memoria de "curio prazo** e de
"longo prazo”, dependendo do tempo de retengo (Arbih, 19R9). Memoria de curía pruno se refere
a uma compilado de conhecimento que representa o estado "corrente” do ambiente. Quaisquer
discrepancias entre o conhecimento armazenado na memoria de curto prazo e um "novo” estado sio
usadas para alúaIizar ir memoria de curto prazo. Memoria da tongo pnX20f por outro lado, K refere
ao conhecimento armazenado por um longo período ou permanentemente.
Nestíi se0ü. estudamos uma memoria associativa que oferece as seguí ntes características:
• A memoria é distribuida.
* Tanto os padrees de estímulo (chave) como os padrees de rcsposla (armazenados) de uma
memoria assoclativa cansiatem de vetares de dados.
* A informaban ó armazenada na memoria cstabcleccndo-sc um padrao espacial de atividades
neurais atmvés de um grande número de neunOnios.
* A informacáo cuntida em um estímulo nao apenas determina o seu local de armazenamento
mas tamhcm o enderezo para a sua rceuperacáo.
* Embora os neurónios n«io representen! célula^ compuiaciunais eonfiúveis e de bu.ixo ruido, a
memoria exibe um alta greu de resistencia a ruido c a falhas, de uma forma difusa.
• Pode haver intcra^ocs entre padrees individuáis armazenados. na memona. (De outra forma, a
memoria Ócveria ser excepcional mente grande para acomodar o armazenamento de um gran-
de número de padrñes em perfeito isolamenta entre SÍ.) Existe, portanto, a possibilidade de a
memoria comecer errw durante o pruccsso de recordando,
Em urna di.tlríbuída. a questúo básica de intcressc sfio as ativ idades simultáneas ou quase
simultáneas de mui tos neurónios diferentes, que sao o resultado de estímulos externos ou internos.
As atividades neurais formam um padreo espacial dentro da memoria que contém ínformafúo sobre
os eslímulos. Diz-se, portanto, que a memória realiza um mapeamente distribuido que transforma
um padreo de atividade no espado de entrada em um outrü padrño de atividade no espado de salda.
Podemos ilustrar algumas propriedades importantes do um mapeamento do memoria distribuida
considerando uma rede neural idealizada que consiste de duas cantadas de neurónios. A Figura
2.17a ilustra uma rede que podo .ser vista como um LftmptMenit! rntufela de um tíaiemu MiMan
(Coopcrt 1973; Scoíield e C o oper. 1985). Cada neurónio da camada de entrada está conectado a
todos os neurónios da camada de Mída. Asconcxóes sin&pticu reais entre os neurónios sSo comple-
xas e redundantes. No modelo da Fig. 2.1 7a. uma única jun^áo ideal c utilizada para representar o
cfcito integrado de todos os contatos sinópticos entre os dendrilos de um neurónio da camada do
entrada e os ramos do axónio de um neurónio da camada de salda. O nivel de atividade de um
neurónio da camada de entrada pode afolar o nivel de ath idade de todos os ottlros neurónios da
camada de salda.
Ciimiidn 4tcni rodil Junpflcs Canuda de salda
dcncuidnÍDS EÍnápticis de n«jj¿ni-DE
(□| Ccxinpimünl^ inchdtsk' da rnerTiArui -¡ixxiil-ilsI iv;l
ik um stslemn ncrra»
{ 'unudd. du Lnlrad:i
íLl ik'kí du ÍliciElt
Cíirn:i4ldeHÍ(h
de ntiiTÍciiúfl
FIGURA 217 Modelos
de mamória associaliva
(b) Múdelo de nicíinirii acocili i w uLil izando
hL-UTLihlrikC rftflffaül
A situa^áo correspondente para uma rede neural artificial está representada na Fig. 2.17b.
Aquí temos uma camada de entrada de nós de le mu e uma camada de salda de neurónios al;indo
como nós computan.enais. Nestc caso, os pesos sinópticos da rede cstáo incluido? como partes
integrantes dos neurónios da camada de salda. Os dos de concxao entre as duas camadas da rede
sao simplesmente iros.
Na análise matemática segumte, sup3e-se que ambas as redes neurais das Figs. 2.17a c 2.17b
sao ?/ffenre.r. A impheacao desta suposiqáo é que cada neurónio age como um combinador linear,
como representado no grato dt? Auto de sinal da Fig. 2.18. Para prosscguircom a análisc, suponha
que um padráo de atividade v ocorra na camada de entrada da rede c que um padrüo de atividade j
AGUA A 2 J 8 Muíalo do gralo da
flux? de ginaI de um neurona line-ar
r&luladü /
ocurra simultáneamente na camada de saída. A questáo que desojamos considerar aquí é a aprendi-
zagem da associafüío entre os padrees \ e y Os padrees x c y,. sao representadas por vetares,
escritos ñas suas formas expandidas como:
'i "
e
y* ' Li'Ai'-víi.yjr
Por conveniencia de apresentacao, suponías que a dimató ¡=malí dade do espada de entrada (i.e., a
dimensao do vetor x.) c a mesma que a dimensional idade do espado de saída (i.c,, a dimensao do
vetar yA i v igual a jh. De agora em ।liante, nós nos referimos a m coma a dimijnsíonüliíífide da rede
ou simplesntente dinwixíonaiidvde. Note que ftr é igual ao número de nós de fonte na camada de
entrada ou de neurónios na camada de saída. Para urna rede neural com um grande número de
neurónios, que é o caso típico, a dimensionalidade m pode ser grande.
Os elementos tanto de x. como de y. podem assumir valores positivas c negativos. Esta é urna
pruposi^áo válida em uma rede neural artificial. Isto também pode ocorrer em um sistema nervoso,
considerando que a variávcl fisiológica relevante seja a diferencia entre um nivel de aüvidade real
(p.ex., a laxa de disparo de um neurórt-iü) e um nivel de ai i v ¡ dade espontaneo diferente de zcro.
Supondo que as redes da Fig. 2.17 scjatti lineares, a assocÍLi^ao do vetor'chave x com o vetar
ineinor izado y, pode ser descrita na forma matricial como:
yt=W(^ i=L2,...,« (2.27)
onde W(A) cuma matriz de pesos determinada apenas pelo par de entrada-saida (lr y()
Para desenvolvamos uma describo detalhada da matriz de pesos W(¿), considere a Fig, 2.18,
que m os ira um aíran ¡o dctalhado do neurónio i da carnada de saída. A saída do ncuronio i devi do
a a$to combinada dos elementos do padrao-chavc \ aplicada comn estimulo á camada de entrada,
é dada por
II
-h- (2.28)
j-i
onde os h r^( Aj, j 1.2...jw. sao os pesos sinápticos do neurón io t correspondentes ao A-é&imo par
de padrócsassccjatlos. Utilizando a notado matricial, podemos exprussar v. na forma equivalente
ti
12
J’=
(2 29)
Reoonhecemos o vetar colima no lado d ircito da Eq. (2.29) como o vctor-chavc i, Substituindo a
Eq. (2.29) na definirán do vetor m-por-1 armazcnado y,h oblemos
>« ^h(A) wli(A)
ÍCJ2I(A) WkÍA) »!„(*) -^.2
¡ — - - - -
J w.i(fr) W^(A) - wm(A).
(2.30)
A Equa^ao (2.30) é a forma expandida da transformaban matricial ou mapeamento descrito na Eq.
(2.27). Em particular, a matriz de pesos m-por-m W(A) c definida por
w(í(¿) m?Iw(A)‘
«a(¿) Wj-Í*)
^2<*) »„(*)_
(2-31)
As apresenta^Qes individuáis dos q panes de padrees associados -> y., A = 1T 2,.. T q, produzem
valores correspondentes da matriz. individual, ou scja, W(1), W(2), ...T W(<j), Reconhecendo que
esta associa^ao de padrees é representada pela matriz de pesos WfÁ), podemos definir uma matriz
de memoria m-per-m que descreve a soma das matrizes de pesos para o conjunto Intel no de associ-
aíóes de padrees como segue:
M = ¿W(k)
J- -1
(2-32)
A matriz de memória M define a conectividade global entre as camadas de entrada e de salda da
memoria associativa. Na vendade, ela representa a experiencia total ganha pela memória como
resultado das apresentaqóes de q padrdes de entrada-saída. Dito de ouira forma, a matriz de mentó-
ría M conté™ uma parte de cada par de entrada-saída dos padrees de atividade apresentados á
memória.
A definido da matriz de memória dada pela Eq. (2.32) pode ser rccstru turada em forma recursíva
como mostrado por
+ W(*), k~\,2r.,q
(2.33)
onde o valor inicial é zcro (i^h| os pesos sinópticos da memoria sao inicialmente todos zero), e
o valor final é idénticamente igual a M como definido na Eq. (2.32). De acordo com a fórmula
recursíva da Eq. (2.33), o termo M^1 é o valor antigo da matriz de memória resultante das assccia'
^ócs de padroes (A - Ib e M* é o valor atualizado devido ao incremento W(A) produzido pela k-
ésima associa^áo. Note, entretanto, quequande W(k) c adicionado a M. p o incremento W(A) pende
Hidden page
Hidden page
cride, na segunda linha^roconhcccmos que ijx. é um escalar igual ao produjo internados veto-res-
chave xÁ e n Podemos rescrever a Eq. {¿.40) romo
y = t s %) v + £ (x[i, )y, (2.41)
1 = L
Suponha que cada um dos padroes-chave xp x , x. seja normalizado para ter energía unitaria; isto
é,
= ¿Vr
ÍI42)
— Sj.
= 1, k = 1,2,...^
Conseqiienicmcntc. podemos simplificar a resposla da memoria ao estimulo (padráo-chave) y como
y=y/*. <2-43}
onde
v^^fx^Jy,
t-i
»*>
(2.44)
O primeiro termo no lado direito da Eq. (2.43} representa a rtspGsta “desojada" y(; ele pode ser
visto, portanto, como a componente do ”si-iaF da resposta real y. O segundo termo v é um "vetar de
ruido11 que surge devido á iuterfenincia trazada entre o vctor-chavc x c todos os outros vetares-
chave armazenados na memoria. O vetor de ruido V.éresponsávcl pelos erres de recordado.
No contexto de um espado de sinal I mear, podemos definir o conseno do ángulo entre um par
de vetares x c y como o produto interno de x_ o xr dividido pelo produto do suas Hfwma.i cuc]¡dianas
ou «w^rtiFionías, como mostrado por
(245)
O símbolo x.¡| significa a norma cuclidiana do vetor x , definida como a raíz quadrada da energía de
V
h2
(246)
Retomando a si tua^ao cm questita, note que os veto res-chave sáo normalizados para terem energía
unitaria dcaconlo com a Eq. {2.42). Podemos, portanto, reduzira definido da Eq. (2.45) a
COÍ^.lJ - IjX,
(2-47)
Podemos entáo redcfuúi o vetor de ruido da Eq. {2.44) como
t-l
(2.48)
Vcroos agora que se os vetores-chave forem ortogonaLi (ixu, perpendiculares entre si no sentido
euchdiano), entilo
eos (sjT ) = 0,
(2.49)
e, portante, o vetor de ruido v é igual a zeno* Nesie caso, a resposta y iguala y. A memoria (¡asocia
perfectamente se os vetores-cnave pertencerem a um conjunta orinnormal', isto é, se el es satisfíze-
rum o segumLe par de condif des:
(2.50)
Suponía agora que os vetores-chave formam um conjunto ortononnal, como descrito pela Eq. (2.50).
Qual ó entao o limite da capacidad? de armarenamento da memoria associativa? Dito de outra
forma, qual é o maior número de padróes que podem ser armazenados de forma confíávcl? A res-
posta a esta quesfóo fundamental se encontra no posto da matriz de memoria M. O posto de uma
matriz é definido como o número de col unas (linhas) independentes da matriz. Tsto é, se r é o posto
de uma matriz retangularde dimensftes Apor-m, temos entilo que r < rainf/, m). No caso da memória
por correlato, a matriz de memória M é uma matriz nt-por-m, onde m é a dimensionalidade do
espado de entrada. Assiui, o posto da matriz de memória M é limitado pela dimensional i dade m.
Podemos endfo formalmente afirmar que o número de padrees que podem ser armazenados de
forma confiável em uma memoria por matriz de correla^áo nunca pode cxccdcr a dimensional i dade
do espado de entrada.
Em sitúameles do mundo real, freqüentemente observamos que os padróes-chave apresentados
a uma memória associativa nao s3o nem ortogonais nem estilo muito separados entre si. Conseqüen-
tcmcnic, urna memória por matriz de correlato caracterizada pela matriz de memória da Eq. (2.34)
pode algumas vezes se confundir e ocasionar erroa. Isto e, a memoria ocasionalmente reconhecc c
associa padrees que antes nunca foram vistos ou assoctados. Para ilustrar esta propriedade de uma
memória associativa, considere um conjunto de padróes-chave.
{»*-}: «i.V-*,
e um conjunto correspondente de padróes memorizados,
(y—}:y,-y3--y.
Para expressar a presimidade dos padroes-cbave em um espado de sinais linearas, introducimos o
oonCcito de comunidad?. Definimos a común idade do con ¡unto de padrees jx k ! como o limito
inferior dos produtos internos de dois padrees quaisquer x e i¿do conjunto. Suponha que M
represente a matriz de memória resultante do treinamento da memória associativa com um conjunto
de padróes-chave representado por o um conjunto correspondente de padróes memorizados
{yiiriii}l de acorde com a Eq. (2.34). A resposta da memória, y, a um estimulo i selecionadc do
IOS IÍ FPFS Nl-11 HAIh
conjunto {x.¡ é dada pela Eq. (2.39}» onde supernas que cada padrao do conjunto {x ! c um
vetor uniiário (i.c., um vetor com energía unitaria), Suponhamos aínda que
x'*j > Y para 4*7
<2.511
Se o limite inferior y for suficientemente grande, a memoria pode falhar cm distinguir a resposta y
daquela de quaiquer nutro padrao-chavc comido no conjunto |xvXrti}- Se os pádrócs-chavc dcstc
conjunto tiverem a forma
x — Jt + V
. II
(2.52)
onde v ó um vetor cstocástico, c provável que a memúria neconhcqa i(l e o associe a um vetor y cm
vez de associá-lo a quaiquer um dos pare* de padrees reais utilizados intalmente para Lreiná-la;
e y,, representara um par de padrees nunca vistos anteriormente. Este fenómeno pode scr chamado
de lógica animai^ apesar de nfro ser nada lógico (Coopcr, 1971).
2J2 ADAPTAQÁO
Na realizarán de uma tarefa de interessu, frcqüentcmcnlc constatamos que o espado c uma dimen-
sao fundamental do precesw de aprendizagem: o íe/npo é a outra. A natureza &¡t*w>-temporal da
aprendizagem é ejemplificada por muñas das tarefas de aprendizagem (p.cx., controle, forma^áo
de feote) discutidas na Segio 2.10. Todas as espides» desde insetos até os humanos, tém uma
capacidade incrcntc d? representar a estrutura Cempcnil da experiencia. Urna represenla^ici asaim
toma possivel para um animal adaptar seu comportamento á estrulura temporal de um evento cm
seu espado de ccmportamcntos (Gallistel, 1990).
Quando uma rede neural opera em um ambiente estacionária (i e.. um ambiente cujas caracte-
rísticas estatificas nao mudara com o lempo), as cstalísticas csscnciais do ambiente podem ser, em
teoría, pela rede, sob supervivió de um pnofessor Em particulados pesosuiipticos da
rede podem ser calculados submetondo-se a rede a uma ícSiio de tremamentn com um conjunto de
dados que é representativo do ambiente. Uma vez que o processo de Ireinamcnto esteja completo,
os pesos sinópticos da rede capturanam a cstrutura cstatística subjaccntc do ambiente, o que justifi-
caría o “ccngel amento" de seus valores depois disso. Assim, o sistema de aprendizagem se baseia
de urna forma ou de outra na memáritit para recordar e explorar experiencias pascadas.
Frcqücnicracntc, entretanto, o ambiente de interesse c nao-£.staci<inárío,t o que significa que
os parámetros estaListicos dos si mus portadores de i n formado, gerados pelo ambiente variam com
o lempo. Em situares dcstc ?po, os métodos tradic ionais de aprendizagem supervisi onada podem
se mostrar inadequados, pois a rede náo está equipada com os meios necesarios para seguir as
variares estatfcticas do ambiente no qual opera. Para superar esta dificuidade, é desejávd que uma
rede neural possa aítaptor continuamente seus parámetros livrea ás vari atoes do sinal incidente em
¡c/npa reai. As^im, um sistema atiaptativu responde a toda entrada distinta como sendo uma entrada
nova. Em outras palavnas, n processo de aprendizagem encontrado em um sistema adápiativc nunca
para, com a aprendizagem sendo realizada enquanto o processqmento de sinal está sendo ejecutado
pelo sistema. Esta, rorrea de aprendizagem é chamada de optendizagem cümífiuu ou upretidizagem
em tempo real {on-the-fly}.
lJmOCI:5M>5 Pl: ApIÍEÍNUIZAGUM 1D9
Os fiitottGíÍGptíilivüslimares, construidos em tomo deum CombinadorLinear(i.e,. um único
neurónio operando em seu modo linear), sáo proj ciados para realizar aprendizagem continua. Apc-
sar da sua estretura simples (c talvcz por causa dissn). cíes sao ui ¡fizados largamente em aplicares
láo diversas como radar, sanar, oormim calóes, sismología c processamento de sinal biomedioo. A
teoría dos filtros adaptados lineares atingí u um esiágio de desenvolv ¡mentó de elevada maturidade
(Hdykitt, 1996; Widrow e Sitaras. 19S5). Entretanto. o mesmo nao pode scr dUo sobre os filtros
adaptalivns náo-lineares.11
Considerando (juca aprendizagem continua scja a propiricdadcde intcrcsscc uma redoneural
o vcículo para a sua implcmcnlaíáo, a questáo que devemos abordar c: como uma rede neural pode
adaptar seu comportamento á estrutura temporal variávcl dos sinais incidentes na espado de com-
portamantas? Lima forma de abordar esta questáo fundamental c rcconhcccndo que as característi-
cas estatísticas de um processo nao-estacionario normalmente variara de forra a suficientemente
lenta para que o processo scja considerada pxeudo-estacwmirio cm uma jancla de tempo com dura-
qáo suficientemente curta. Incluera-se como exemplos:
• O mecanismo responsável pela produjo de um sinal de voz pode scr considerado cssimcial-
mente estacionario durante um periodo de 10 a 30 milis segur dos.
• Ondas de radar retomadas de urna superficie da océano permanecerá esseneialmcnlc estacio-
narias por um período de varios segundas.
• Considerando-se a previsto do tempo a longo prazo, os dados meteorológicos podem ser
vistos comu cssencial mente estacionarios durante um período de minutos.
• No contexto de tendénci as a longo prazo, estendendo-se por meses e a nos, os dados do merca-
do de Bodes podem ser considerados como essencialuiente estacional ios por um periodo de
di as.
Desta forma, podemos explorar a propríedade pseudü-estacionáriade um processo estocástico para
cstendera utilidade de uma rede neural, refreinando-a cm determinados micrvalos regulares, levan-
do em corita assim as flutua^fies estatísticas dos dados incidentes. Esta abordagenn pode, porcxeni-
plo, ser adequada para pracessar dados do mercado de a^ocs.
Para uma abordagem dinámica mais refinada, pwle-se proceder como segue:
• Selecione uma janela suficientemente estrena para que os dadas de entrada pessam ser consi-
derados pscudo-cstacionárias c use as dados para trv:nar a rudc.
• Quando íbr recebida uma nova amostra dos dados, atualize a janela eliminando a amostra de
dado mais amiga c destocando as amostras restantes para tras, cm uma ur.idadc de tempo,
para fazer espado para a nova amostra.
• Utilizo a janela do dados atualizados para tremar uovamentc a rede.
• Repita o proccdimcnta de forma continua.
Podemos, assira, incorporara estmtura temporal no projeto de uma rede neural fozendo com que a
rede safra treinamerito continuado cara no tempe?. De acardo com esta aborda-
gem dinámica, uma rede neural 4 (ista como um Jífrm adaptativo nao-fínear que representa uma
gcncraliza^áu dos filtros adaplatívos lineares. Entretanto, para que esta abordagem dinámica para
til tras adaptativos nao-lineares scja rcabzávcl, os recursos dispontvciis devem sct suficientemente
rápidos para completar todos os cálculos descritos durante um periodo de amostragem. Somente
entáo o filtro accmpanhara as varia^ucs na entrada.
2.13 NATUREZA ESTATÍSTICA DO PROCESSO DE APRENDIZAGEM
A última parte de capitulo traía dos aspectos eslatisticos da aprendí /^gem. N'este con texto, nío
estamos interessados na evolu^áo do vetor de peso;; w enguanto a rede neural passa por um algoritmo
de aprendizagem.. Em vez disso, conccntramo-nos no desvio entre uma fun^áo "alvo'-./Cx) c a fun-
ií3o "real” J'lx.w), realizada pela rede neural, ondeo vetor x representa o sinal de enlrada. Odes\ io
é expresso em termos estatisticcs.
Urna rede neural é meramente uma forma pela qual cnuhccinrenlü empírico sobre um fenóme-
no físico ou ambiente de interesse pode ser codificado através de treinamento. Por conhecimenlo
"empírico” emendemos um conjunto de medidas que caracterizam o fenómeno. Para sermos mais
específicos, considere o cxcmplo de um fenómeno estocástico descrito por um vetor aleatorio X
consislindo de um conjunto de vurithvú ind^pend&tícx, C um escalar aleatorio D que representa
uma vuriável dependente Üs elementos do vetoraleatorio X podem ter significados físicos particti*
lares d i furentes. A suposif&o de que a vanável dependente D é escalar foi leita siinplesmentu para
simplificar a expósito. sem perda de generalidade. Suponha também que tenhamos N realizaQoes do
vetor aleatorio X representadas por {x ] pe um conjunto correspondente de realizares do escalar
aleatorio D representado por ' , Estas reali zapees (med i das) conslitucm a amostra de treinamento
representada por
?={<I,4C, (253)
Normalmente, ndo conltecemos a relajo funcional exala entre X e í> e assim prosseguimos pro-
pendo o modelo (Whitc, l9R9a)
D-/(X)+e (154)
onde /() c uma fundan determinixtíca do seu argumenio vetorial. e t é uní em de expeciotiva
aleatorio que représenla a nossa "ignorancia11 sobre a dependencia de D e X. O modelo eslatfstico
descrito pela Eq, (2.54) é denominado um modelo r^gpetfivtx, ele está representado na Fig. 2.20a. O
erro de expectativa e é, em geral„uma vanável aleatoria com media nula e probabilidade de ocurren-
cia positiva. Bascado ni seo, o modelo regresivo da Fig. 2.2Qa aprésenla duas propriedades úteis:
F1GUHA SJ2Q (a) Modelo
(matemático) rÉ^réssiwo.
(ti) MOtfelO (Pinico} de rede
neural
LO valor medio do erro de expectativa £, dada qualquer realízatelo x. ¿ zerv\ isto c+
E[e|x] = 0 (2,55)
onde E é o operador estatístkc do valor esperada (esperanza matemática). Como um corolario
desta propriedade, podemos a firmar que ayunado de regressdo é a media condicional da
saida do modela D, dado que a entrada X = x, como mostrado por
/(x)-E[^x] (2.56)
Esta propricdade segue direlamente da Eq. (2.54), considcrando-sc a Eq. (2.55).
2. O er/o de expectativa € ftao é correlacionado com a Junado de tegressdojty.)',, isto é
^X)] = 0 (2.57)
Esta propricdade ó o bem ccnhecido principio da ortogonafidade, que afirma que toda a infor-
mado sobre D que nos ó disponíbi lirada através da entrada X está codificada na fun^fio de
rcgrcsMoj(X). Podc-sc demonstrar a Equa^áo (2.57) cscrcvcndo:
4v(x)]-f[4«fíX)iKi]
-4/pt)4t|xj
=4fPt)o]
= 0
O modelo regressivo da Fig, 2.20a é uma describo “matemática" de um ambiente estocástico. O
seu propósito é utilizar o vetor X para explicar ou prever a variável dependente D. A Figura 2.20b é
o modelo "físico" correspondente do ambiente. O propósito deste segundo modelo, bascado em
uma rede neural, é codificar o conhecimento empírico, representado pela amostra de trciinacncnto 3"
em um conjunto correspondente de vetores de pesos sinópticos, w, como mostrado por
ST -> w (2.58)
Na vendade, a rede neural fomece uma ktaproKimapao'' para o modelo regressivo da Fig 2.20a,
Suponha que a resposta real da rede neural, produzida cm respecta ao vetor de entrada x, se ¡a
representada pela variávcl alcaLóriu
K=F(X.w) (2.59)
onde H sw| é a fun^áo de entrada-saida realizada pela rede neural. Condecidos os dados de treiñá-
mente ¡7 da Eq, (2,55)t O vetor de peso W é cbtiilo pela mimmiza^áo da fun^ao de custo
.-II
onde o fator 1/2 foi usado para ser consistente com as notajes anteriores e com agüelas usadas nos
capítulos subscqucntcs. Com cxcc^ao do fator de escala 1/2, a fundió de custo T€(w) é a diferen^a
quadráticn entre a resposta desojada íi c a resposla real y da rede neural, catediada con» a média
sobre todo o conjunto de dados de trei ñámenlo "J. ü uso da Eq. (2.60) como fun^ü de CUSIO
implica a niilizáfelo do modo de treinamento porlote", pelo qual os ajustes dos pesos sinópticos da
rede sfo realizados sobro o conjunto intci.ro de exemplos de ircinamcnto, cm vez de o serení sobre
cada cxcmplo Individual
Suponha que o símbolo E represente o opeurdor tüédiu tomado sobre todo o conjunto de
treinamcTUO 3". As variáveis ou suas funffrcs sobre as quais age o operador media £T sáo represen-
tada* por x c J; o par (x, ti} representa um cxcmplo na amostra de trei namente de íf. Por culto lado,
o operador cstalíslico de valor esperado £ age sobre todo ü en semble de variáveis aleatorias X cD,
o que incluí ? como um subconjunto. A d I feren^a entre os operadores E e Ex será cuidadosa ir ente
identificada a seguir.
Considerando-se a transformado descrita pela Eq. (2.58), podemos usar alternativamente Fíx,
w) e A'(x, y)e assim rescrever a Eq. (2.60) na forma equivalente
«(w) = | £,[(<(-fU,?»1] (2 61)
Adicionando e suhtraindn /(x) ao argumento (rf- F(x, í71) o cntáo uti lizando a F.qP (2.54). podemos
esc rever
d - F(x, = (<7 - f(i)) + (/(i) - F(x, ;/))
= e+(/(x)- F^gj)
SubslUuirtdo esta Cxpressáo na Eq. (2.61) e entáo Cxpandindo os termos, podemos re formular a
funfiri de custo í(w) na forma equivalente
«<») = J£j[6¡] + |M-f(!l)-f(’L'7>']+ £,[</(’)-(r(x.9’»l (2«2)
Entretanto, o último termo do valor esperado no lado dire ¡lo da Eq. (2,62) é zcro por duas razoes:
• O cito de expectativa e c nao-correlacionado com a funfao de regressáo7(x) devido á Eq.
(2.57), interpretada etn termos do operador E¡r
• O erro de expectativa e c relativo ao modelo de regressao da Fig. 2.20a, enquanto que a funt-áo
aproximaliva F(x, w) é relativa ao modelo de rede neural da Fig. 2_20h.
Conscqíicntcmcntc, a Eq. (2.62) se reduz a
+ (263)
dL- jL.
O primeiro termo no lado direilo da Eq. (2.63) e a variare i a do erro de expectativa (do modelo
regressivn) e, calculado sobre o conjunto de treirtamento 3". Estu termo représenla o erm inínn.secoi
porque ele ¿ indcpcndcntc do vetor de pesos w. Ele pode ser ignorado, na medida em que seja
considerada a minimizado da fuñólo de cnstoí(w) cm reíanlo a w. Assim, o valor particular do
vetor de pesos w* que minimiza a fun^áo de custo í(w) Lamben ira minimizar a media de ensamble
da distancia quadrática entre a funcáoderegressáojfx) ea íunfáo aproxima ti va F(x, w). Em outras
paliaras, a meiiidn naíurai da eficiencia de F(x, w) cm prever a resposta desojada d ó definida por
¿^(/(x), F(x, w)) = E.KAD-Fíx, (2.64)
Este resultado c de f undamental importancia, país fomccc a base matemática para o oompromisso
entre o tifas e a variáncia resultantes da utilizacáo de F(x, wj como a aprdximabáo dcj?x) (Germán
el al., 1992).
Dilema Bias / Varíancía
Invocando o uso da Eq. (2,56), podemos redefinír a dist&ncia quadrálica entreV(x) eF(x,w) como:
- £t[(¿[D|X -- x] - H*. W1 (2.65)
Esta cxprcs&ao pode também ser vista como o valor médio do env estimativo entre a funqáo de
regr-essao/fx) = £[Z)|X = xj e a fun^o aproximauva F(x, w), calculada sobre toda a amostra de
treinamento Note que a média condicional £[D|X = i] tem um valor esperado constante em
rela^áo ao conjunto de dados de treinamento 9". A seguir, constatamos que
£[D|X = x] - F(x, S") = (£[D|X = x] - [Hx, ?)J) + £)] - S-)}
onde simplesmente adicionamos e subtraimos a media í’JFfx, 9")]. Procedendo de uma maneira
similar áqucla descrita para derivar a Eq. (2.62) da Eq. (2.61 )t podemos reformular a Eq. (2.65)
como a soma de dois termos (veja o Problema 2.22):
Mx> ^)) = + P(w) (2.66)
onde Mw) O l'(w) sao, por sua vez, definidas por
5íw)-£f[flis 9D1 -£[D|X - x] (2.67)
e
H«)= JÍ-KjCHx. ST)])1] (2.63}
Agora fazemos duas observables importantes:
1. O termo £(w) é o trias do valor médio da funqáo aptos imatíva F(it 5), medido em relajan á
fcnq&o de regressáoJíx) = £[D|X = x]. Este termo representa a ineapacidadc da rede neural
dcñnida pela fongáo F(x, w) de aproximar com preciso a fiin^áo de regressao/i) = £[D|X =
]. Dcstc modo, podemos ver o bias 2¡(w) como um erra dpmwmafjvo.
2+ O termo ^(w) é a varíáncia da fun^ác aproximativa F(xt w), medida sobre leda a amostra de
treinamcnio ff. Esle segundo termo representa a rtóo-adequai?áoda informaban comida na amostra
de treinamento Sf acerca da fiinqao de regressao/(x). Podemos, portante, ver a variáncia P(w)
como a manifestacac de um erro estimativo.
A Figura 2.21 ilustra as relaces entre as fonjes objetivo e aproximativa e mostra como os erros
estimativos, islo é, o bias e a variareia, se acumulara. Para se obter bcra desempenho global, tanto
o bias Zf(w) como a variáncia F(w) da fun^áo aproximativa F(x, w) = F(x, 3") devem ser pequeños.
FIG URA 2.21 llutttáC&> dáG váriáS fOrtl&i MFO rti SüluCte dC ptiftfeffM de f&grosiiú
hiel límente, constatamos que em uma rede neural que aprende por ejemplos utilizando para
isso uma amostra de treinamento de tamanho fixcr, o preqo para se obten um bias pequeño c uma
vuriáneia grande Para uma rede neural única, comente quando o tamanho da amostra de treinamen-
to se Loma i n fin llámenlo grande ¿ que podemos esperar eliminar lanío o bias como a wilncÍB, ao
mestno tempo- Tornos entáo um dilema bias/varíánciOf e a conscqüéncia é uma convergencia CXCCS-
sivamentc lenta (Germán el al.» ¡992). O dilema bkis/variíncia pode ser evitado se cstivermes dis-
postos a incluir iniencicnaímente um bias, o que enláo toma possivel eliminar a variáncia ou reduzi-
la significativamente- F dcsnccessário se dizer que devemes assegurar que o bias incluido no proje-
to da rede seja inofensivo. No contexto de clasificado de padroes, por exemplo, dizemos que o
bias é “inofensivo” quando ele contribuir significanvamente para o erro médio quadratico ¿órnente
se tentamos inferir regrcssccs que nao estejam na elasse prevista. Em gcral, o bias deve ser cohcc-
hido para cada aplicado especifica de irteresse. Um modo prático de se conseguir este objetivo í
utilizando uma arqiiitclura restríia de rede, que normalmente lem desempenho melhor do que uma
arquitelura de propósito geral. As restribes e portante o bias podem, por exemplo. ¿¿sumir a forma
de conhecimento previo incorporado no projclo da rede utilizando (1 1 compatiiitiumento de pesos
onde varias sinapses da rede sao controladas por um único peso, e/ou (2) campos receptivos locáis
atribuidos a neurónios individuáis da rede, como demonstrado na aplicado de um pcrccptron de
múltiplas camadas no problema do reconhec¡mentó de um caractcr óptico (LeCun et al., 1990a).
Eslfti queslóes de prejeto de rede foram discutidas brevemente na $ef3o 1-7,
2.14 TEORIA ESTADÍSTICA DA APRENDIZAGEM
Ncsta so^áo, continuamos a caractcriza^áci cstatíslica das redes neurais descreyendo uma teoría da
aprendizagem que trata da questao fundamental de como controlar a hábilidade de generalizado de
uma rede neural em termos matemáticos, A discussfo é ¿presentada no contexto da aprendizagem
superví sionada.
Um modelo de aprendizagem supereisiuñada consiste do tres componentes interrel alionados,
ilustrados na Fig. 2.22 e descritos cm termos matemáticos como segué (Vapnik, 1992. I99S):
1. Ambiente. O ambiente é estacionario, fcmcccndo um vetor x com uma fim^áo de dislribui^áo
(de probabilidade) cumulativa fíxa, mas dcsconhecida 7'^x).
FIGURA 2.22 Modelo do procos» de
aprendizagem superviskinadH
2, Professor O professor fornece uma resposta desejada cf para cada vetor de entrada i recebido do
ambicnlc, de acorde com uma fundan de dístrihuicáo cumulativa condicional íf) que é tam-
bém fixa mas dcsconhccida. A resposta desojada ¿co vetar de entrada x estáo relacionados por
<f“jU,v) (2 69)
onde v é um termo de ruido, que permite que o professor seja “ruidoso14.
3. Máquina (algoritmo) de aprendizagem. A máquina de aprendizagem (rede neural) é capaz de
implementar um conjunto de funfdes de mapeamento de entrada-saida descritas por
(2 70)
onde .y é a resposta real producida pela máquina de aprendizagem em resposta á entrada x, e w
é um conjunto de parámetros livres (pesos sinápticos) selecionados do espado de paramemos
(pesos) TK
As Equa^oes (2.69) e (2,70) eslío escritas em termos dos ejemplos utilizados pare realizar o trema-
mentó.
O problema da aprendizagem superviví onada é selec tonara fundió particular F(x,w) que apro-
xima a resposta desejada ¿f de uma forma ólima, sendo “ótimo" definido cm um sentido estatistico.
A própria seltcáoébaseada no conjunto dos A exemplos de tretnamenlo independentes, idénticamente
distribuidos (iid) descritos pela Eq, (2,53) e reproduzidos aquí por conveniencia de apresentaqáo:
»#*,<
Cada par de cxcmplos é retirado de £7 pela máquina de aprendizagem com uma funcao de distribui-
qío (de probabilidade) cumulad va conjunta FK jX d), que, como as nutras ftm^&es de distribuido,
c também fixa mas dcseoithecida. A viabilidade da aprendizagem supervisionada depende desta
quesillo: os exemplos de treinamento {(jt/R d)} contar informaqío suficiente para construir uma
máquina de aprendizagem capaz de ter bom desempenho de general izacáo? Uma resposta para esta
questío fundamental está na utilizado de ferramentas desenvolvidas por Vapnik e Chervonenkis
(1971). Específicamente, procedemos vendo o problema da aprendizagem supervisionada como
um problema de üproximafdo, que envolve encontrar a fun^o F(x, w) que é a melhor aproximado
possívcl para a fundió desejadaj(x).
Suponha que F(x, w)) represente uma medida da perda ou dlserepáncia entre a resposta
dcsejada rf correspondente a um vetor de entrada x e a respusta real F(x, w) preduzida pela máquina
de aprendizagem. Uma definido popular para a perda t(rf, F(x,w)) é ajun^Ho deperda quwlráiica
definida como a dista neta quadralica entre d =flx) ca aproximado F(k, w) como mostrado por12
L(d, w)) - (d- F(x, w)):
(2-71)
A distancia quadrálica da Eq. (2.64) c a extensáo de L(dt F(x,w)) para a media de ensemble, com a
media sendo realizada sobre todos os pares de exemplos (x, d).
A maior pane da literatura sobre a teoría estatística da aprendizagem lida com uma perda
especifica, O ponto forte da teoría estatifica da aprendizagem ¿presentada aquí c que ela nda de-
pende criticamente da forma da fiin^áo dependa í{r¿ f^x, w)). Mais adían te nesta se^áo, restringi-
remos a discussao a urna fim^áo de perda especifica.
O valor esperado da penda ó definido pelo funcionaí de tinco
A(W)=
(2 72)
onde a integral é uma integral múltipla sobre todos os valores possíveis do par de exemplo (x, d). O
objetivo da aprendizagem supervisionada c minimizar o Funcional de risco J?(w) sobre a dasse de
íuncües aproximativas (F(x, w), w € W). Entretanto, o cálculo do funcional de risco /í(w) é com-
plicado porque a ftin^ao de distribuido cumulaba conjunta ,i x, tí) é normalmente desconheci-
da. Na aprendizagem supervisionada. a única informarse disponlvel está contida no conjunto de
treinamento J. Para superar esta diñculd&dc matemática, ui i hitamos o principio indutivo da
minimimeao do riscti empírica (Vapnik, 1982). Este principio se barcia inceiramcnte na disponíbi-
lidadc do conjunto de dados de Ireinamcnto 9", o que o toma perfei (ámente adequado ú filosofía de
projeío de redes neurais.
Alg urnas Def ¡nlgóes Básicas
Antes de prossegmnnos, introduzirnos algumas definiffes básicas que usaremos no material que se
segue.
Convergencia. em probabilidade. Considere uma seqü encía de variáveis aleatorias cr <av
Dizemos que esta seqücncia de varia veis aleatorias converge em probabi iidade para uma variável
u if se para qualqucr fi >0 for valida a retafSo probabIIEstica
- d„| > & A I) quando .V »
(2.73)
Supremo e ínfimo. U supremo de um conjunto náo^vazto ¿4 de escalares^ representado por sup ,?í,
é definido como o menor escalar x tal que x > _r para todo > e si. Se tal escalar náo existe, dizemos
que o supremo do conjunto nao-vazio ¿4 c «. Análogamente, o infimo do conjunto .íí, representado
por inf ri.é definido como o maior escalar t tal que a s v para todoy e ¿4. Se tal escalar nác existe,
dizemos que o ínfimo do conjunto náo-vazio .si é «.
Función al de risco empírico. Dada a amostra de ircinamcnto 7 = {(x,,t/.)}L |? o funcional de
risco empírico é definido em termos da funijao de perda L(d. . w)} como
J’ r-r
(2.74)
Cn nsí sténci a Eütrita. Considere o conjunto I#- de funpoes ¿(í/, F(x, w)) cuja distribuido funda-
mental é definida pela funpao de distribuidlo cumulativa conjunta ..{x, d). Suponha que 1T(c)
soja um subconjunlc náo-vazio qualqucr dcsic com¡unió de funq&cs, tal que
W)= w: £(rf,fXx,w))¿c
(2.75)
onde ce (-»,»). O funcional de risco empírico ¿ dito ser estritamente (nao irívialmcntc) caisi^
tente se para qualquer su be o nj unto W(¿) seja válida a seguí rite convergencia em probabilidade
inf > inf i?(w) quando N—>« (2.76)
Com estas definieres, podemos retomara discussáo da teoría deaprendizagem cstatística de Vapnik,
Principio da Minimizaba da Risco Empírico
A idéia básica do principio da minimizaban dn risco empírico é trábalhar com o funcional de risco
empírico Jf^w) definido pcia Eq. (2.74). Este novo funciona] diferc do funcional de risco J?(w) da
Eq. (2.72) em dois aspectos desejáveis:
1. Ele nao depende de forma explícita da fun^o de distribuido desconhecida Fx D(x, tí}.
2« Em teoría, ele pode ser minimizado em relajo ao vetor de peso w.
Suponha que w e F(x, wj representen! o velen de peso e o mapeamento correspondente que
minimiza o funcional de risco empírico /?<111.,(w) da Eq. (2.74). Análogamente^ suponha que w c
/|(x, vfj representem o vetor de peso e o mapeamento correspondenie que minimizan! o funcional
rea] de risco fl(w) da Eq. 2.72. Tanto como w _ pcrtcnccm ao espado de pesos V. O problema
que devemos considerar agora sSo as conduces sob as quais o mapeamento aproximado w mp)
está “próximo" do mapeamento desojado F(x, wj, como medido pelo deseosamente entre ^(w^ )
c R (w?).
Para um w - w*, o funcional de risco í(w*) determina a esperanza matemática de uma vari*
ável aleatoria definida por
Z_+=¿(¿, F(it w*)) (2-77)
O funcional de risco empírico /^(w *), ao conlrário, é a media (aritmética) empírica da variável
aleatoria Z^,. De acordó Cüm a ¡ei dos grandes números, que c um dos principáis teoremas da teoría
das probabilidades, em casos gerais constatamos que. quando o lamanho N da amostra de treina-
mento -7 c feito infinitamente grande, a media empírica da vartável aleatoria converge para o
seu valor esperado. Esta observado fomece uma ¡ustificaciva teórica para o uso do funcional de
risco empírico ^^(w) no lugar do funcional de risco A(w). Entretanto, apenas porque a media
empírica de Zw, converge para o seu valor esperado, nAc há razAo para se esperar que o vetor de
pesos waii que minimiza o funcional de risco empírico fftmp(w) tambem minimizc o funcional de
risco /í(w).
Podemos satisfazer estes requisitos de unía forma aproximada procodendo como descrito a
seguir. Se o funcional de risco empírico A. (w) aproxima o funcional de risco original fl(w) tífíifor-
memenfí.' em w com uma prvcisatj t, cnlao o mínimo de .<w) se desvia do mínimo de Á(w) por
um valor que nao excede 2e. Formal mente, isto significa que devemos impor uma cundido resentí va,
Lal que para qualquer w e :.í e e >0. valha a rela^ño probabilístlcíi (Vapnik. 1982)
Ffsunl^"^w)l>t)->ri quando V« {2-78)
Mi
Quando a Eq. (2.78) c satisfeita, diremos que ocurre unra rortVttjéiffleró uniforme no valor depeno
w da risa? empír ico medio, paco o sen valorespetveio. De forma equivalente, desde que, para uma
prwis&o predeterminada e qualquer. possanios afirmar que val ha a desígualdade
P(sup|fl(w)-/f(mp(w)l>e)<tt (2.79)
para algum íX >0. cntáo, como eonscqücncia. vale a seguí ule desigualdadc:
P(A(w ) - JffwJ > 2e) < nt (2.80)
fim outras palavras, se valer a condi^áo (2,79), eniáo com probabilidade de no mínimo (1 - a), a
soluto A(x, w 1 que minimiza o funcional de risco empírico (w) resultará em um risco real
j?(w .. i que se desvia do verdadeiro risco real mínimo possívcl J?(wJ por um valor que nao excede
2e. Dl* falo, a condi^Ao (2.79) implica que, com probabilidade (1 — ct), as duas desigualdades se-
guí ntes sOo satis feiitas simultáneamente (Vapn-.k, 1982).
(2.81)
(2.82)
Estas duas equaf&es definem as diferen^as entre os funcionáis de risco real ü de risco empírico em
w = wrm e w = w , respectivamente. A Lém disso, como w c w: san os pomos mínimos de
e Af(w), respectivamente, segue que
R (w ) < R (w )
rT?:p- QTipr rmpT .-H
(2.83)
Somando as desigualdades (2.8l)e(2.S2)e entáo utilizando (2.83), podemos cscrcvcr a seguí nte
desígualdade
(2.84)
Além disso, romo as desigualdades (2.81) e (2.82) sáo &ansfcitas simultáneamente com probabili-
dade (I - a), cntáo a desígualdade (2.84) também o será. Podemos, portanto, afirmar que com
probabilidade a vale a desigualdadc
que c uma reformula^do de (2.80).
Estarnos agora preparados para formalizar o principio da minimizando do risco empírico em
tres partes inter-relacionadas (Vapnik, 1982, 1998):
I, No lugar do risco funcional A|*ó, conslraa 0 ftinc fonal de risco empírico
^,(W) = ^X«rf.,F(l,.W))
A I.
bastado no tonj unto de treinamentu de exemplos i.i .d
(' 11 2,.. l, A
2, Suponha que w represente o vetar de pesos que minimiza o funcional de risco enpiriuo
sobre o espado de pesos V. Entác fl(w ) converge em pnobabilidade para o mínimo
valor possivcl do risco real A(w). w £ V, quando o lamanho A' da amostra de tronamenta ó
frito infinitamente grande, desde que o funcional de risco empírico convirja uniforme-
mente para o funcional de risco real,/?(w).
3. A convergencia uniforme como deñmda por
Pfsup1 - W<mp(w)|>e) -* 0 quando A —> «
é i.rn4 IttCCflítlS V suficiente para ¿i <zonH¡HlcnLÍsi do principio da <Lo
nsco eoipirico-
Para uma interpretado física dcstc importante principio, eferceemos a seguinte observado. Antes
dü tteiDMDcnto de uma máquina de aprendizagem, todas as fiin^es aproxima ti vas &3o igualmente
prováveis. Na medida cm que avanza o l reina mentó da máquma de aprend i zagetn, aumenta a proba-
bilidade daquelas fuñones aproxicnativas F(x ,w) que sáo consistentes com o conjunto de dados de
treinamcnlo {(i. rf) I 1 r Quando o tamanho A' do conjunto de dados de ireinamento crcsee e canse-
qüentemente o espado de entrada se torna "densamente?’ povoadn, o ponto mínimo do funcional de
risco empírico A1 (w) converge cm probabilidade para o ponto mínimo do funcional de risco ver-
dadeiro Á(wX
Dlmensao V-C
A (cariada convergencia uniforme do funcional de risco empírico A. iw) para o funcional deriüCO
real /i(w) incluí limiers na (axa de convergencia, que sao bascados cm um importante parametro
denominado a di mansito Vapnik-Chervfmenkisfc\u siinplcsincntc dimenstio P’-C denomnada assim
cm homenagem a scus criadores, Vapnik c Chcrvoncnkis (197 i). A dimensao V-C é urna medida da
capacidade ou poder de* expresa ció da familia de fundóos de clarificado realizadas pela máquina
de aprendizagem.
Para descrecer n conceito da djinen^o V<em uma forma adequada para os nossoa propósi-
tos, considere um problema de classitlca^áo de padrocs bínários, para o qual a resposta desejada é
escrita como de 10, I}. Usamos o termo dicoiomtu para no* referínnos a uma futuro de clasüi flea-
fáo hmária ou regra de decisáo. Suponha que £> represente o conjunto de dicotomías implcmcntadas
por uma máquina de aprendizagem, ou soja,
i? - wg W, M (0,1}}
(2-85)
Suponha que 'd represente o conjunte de jV pontos no espado m-dimensional Sf de vetores de entra-
da, ou seja.
íf = {M,€ %\i = l»2,...tM
(2.86)
Uma dicotomía i mp (ementada pela máquina de aprendizagem partí cierna ¿t em dois subconjuntos
disjuntos^, e ££,. de tal forma que nos podemos escrever
Í0
F(a,w) = J
para i
para x e ££,
(2.87)
Considere que represente o número de dicotomías distintas implementadas pela máquina de
aprendizagem, e Aj(J) represente o máximo de A^íf) sobre rodo !£ com |íf| = l, onde |íf| é o
número de elementos de Dizcmos que c particionado por í? se A . (if) = 2|5a, isto é, se todas as
dicotomías possi veis dcJf puderem ser inducidas por fun^Ces em Referí momos a AF(0 como a
fuñada de ciescimcfíto.
Exemplo 2.1
A Figura 2.23 ilustra um cspatjo de entrada tridimensional «msislindc de quatro pontos i|t x,, x} c xr A*
froniciras de ¡Ik isto das fundes F1( eFr indicadas na figura, eomespondem ás cIbsüch (hípúieses) O c I sendo
verdaderas, respectivamente. Da Fig. 2.23 vemos que a fun^áo Ffl indnz a dicotomía
- (^n * {XpX^Xj,^- (X,n
FIGURA 2.23 Diag'ama para
O Exemplo 2.1
Por mitro lado, a func¿o induz a dicoíoinia
Com o conjunta .fí consistmdo de quatro panto*, a cardinalidade |¿/| 4. Assim,
Af(SP) = 21= 16
PMOCESSGS TE APRENDIZAGEM 121
Retomando á discussAo geral delineada pelo ensemble & de dicotomías na Eq. <2.85) e o conjunto
correspondente de pontos íf' na Eq. (2.86). podemos agora definir formalmente a dimensáo V-C
como (Vapnik eCbervonenkis, 1971; Keams c Vazirani, 1994; Vidyasagar, l997;Vapnik, 1998)
A dimensao VCde um conjunto de dicotomias f? é acardinalidade do maiorconjunioíí particionado
por í?,
Em outras palavras, a dimensao V-C de í?. escrita como VCdim(5í)> é o maior /V tal que A/jV) = 2\
Dito cm termos mais familiares, a dimensao V-C do conjunto do ñin^óes de classifica^ao {^(x, w);
w e W} £ o número máximo de exemplos de treinamento que podem ser aprendidos pela máquina
sem erroh para todas as rotuladora possiveis das íuncocs de classificafño.
Exemplo 2.2
Considere uma regra de dccisio simples em um espado fft"dimensional de vetares de entrada, que é descrito
por
y = <p(wrx 4- fe)
(2.8B)
onde a £ um vetorde pesos Jn-dimensiorial eí é un bias. A fun^áo da alivio ip c uma ñm^ao de limiar; isto é.
p(u) -
i1 >0
t! <0
A dimensao V-C da negra de dccisao na Eq. (2.88) é dada por
VCdim(í') - mi - ]
(2.89)
Para demonstrároste resultado, considere as s^ua^ocs descritas na Fig. 2.24 relativas a um espado de entrada
bidimensional (i.e., m 2). Na Eje. 2.24a, temos tres pontos xr x, e xy Tres diferentes posibilidades de
rotulaba destes pontos est&c incluidas tu Fig. 2.24a, da qual vemos fácilmente que um máximo de trés linhas
podem squrar estes pontos. Na Fig. 2.24b, lemas os pontos xp xi; e x4, com os pontos x, e x} rotulados
comoO c os pontos x e i. rotulados como 1. Desta vti, entretanto, vemos que os pontos x l nSc podem ser
Fl G Ll RA íM Um par dp dretribuiptea de dados bkfcrnerisionals pana o examplo 2.2
separado» de x. c xk por uma linha. A dirncnsaxi V-C da regra de dccisao descrita na Eq. (2.88) com m = 2 c
portante 3, o que está de acordo com a fórmula da Eq. (2.89).
Exemplo 2.3
Como a dimensao V-C íorned: uma medida da capacidade de um conjunio de fun^oes (indicadoras) de classi-
ficaeáo. podemos ser levados a esperar que uma máquina de aprendizagem com muilos parametros hvres tena
uma alia dimensáo V-C, enquanto que uma máquina de aprendizagem com poneos parámetros livrcs teria uma
dimensSo V-C baixa. Agora apreveníamos um contra-cxcmplc11 para esta afirmado.
Considere a familia de f aniñes indicadoras de um único parámetro, definida por
- smal(seij(tu)), uc R
onde smal(') c a fun^ao sinal. Suponha que cscolhemos um número qualqucr A1 c o objd ivo soja encontrar .V
pontos que possam ser separados. Esta exigencia é saltsfeita pelo conjunto de funches /(i, ¿r) escolhendu-se
.1,-10', É— V
Para separar estes pontos de dados em duas classes determinadas pela seqüáncia
é suficiente que o parámetro a seja cscolhidn de acordo com a fórmula:
Concluimos^ assim, que 3 dimcnsñn V-C da familia de fungues indicadorasy(.rh a) cim urn única parámetro
livjvdié infinita.
Importúnela da d¡mensao V-C e da sua Estima<?áo
A diinensao V-C é um conceito pwamente combifítitório que náo tem conexau com a no^ao geomé-
trica de dimcnsác. Ela desempenha um pape] central na teoría de aprendizagem estatixtica como
será mostrado no material apresentado ñas próximas duas subsepóes. A dimensáo V-C v também
importante do ponto de vista de pro;efe. Grosso modo, o número de exemplo» necessános para se
aprender de manen ¡i confiávd unta elasse de interesse é proporciona] á dímensúo V-C daquda
elasse. Conscqüeniemente, urna estimativa da cümen»»o V-C ¿de fundamental importancia.
Emalgún» casos, a dimensao V-C ¿determinada pelos parámetros lívres de uma rede neuralL
Na maioria dos casos práticos, entretanto, é difícil calcular a ditriens&j V-C por meios analíticos.
Apesar disao^ os limites da dimcnsáo V-C de redes neurais sao frcqüenLemenijc traláveis- Neste
contexto, os dois resultados wguintes sáode especial ioteresse14:
1. ¿Sjjpri/?Jrlf fue Jf repmsi'irte unja nUnientuda adiuntü arbttn&ria COftStttutds de neiit&ttüS
com ima fim^áo de ütivüf&Ci de iimiur (ffeavixide^
i
0.
V >0
4J<0
A r/írtfífljtfO J ’f1 í tJfBVpgFf^ nrtrfí JKé númiu intaf de paramerm.i livrex da rede.
Este primeiro resultado se deve a Cover (1968} e Baum e Haussler (1989).
1 ¿taponta que A represen fe urna rede de múltiplas camadas alimentada odiante cujas neurónios
uliliLam uma/i/fifan de ativafdo xigmáide
, ।
<P(v)-t--------—7
l + cxp(-t')
✓4 dimenaao fzC de S é OfW*}. tmde W7 é O número lolai de parámetma tivrea da rede.
Este segundo resultado se deve a Koüran c Sontag (1996). Eles chcgaram a este resultado primeiro
mostrando que as redes que consiste™ de dois tipos de neurónios, um linear e o entro utilizando
uma fim^ao de ativa^ao de lim!^ já lem urna dimensao V-C propon? i cmal a W1. Este resultado é
surpreendente, pois uma rede pinamente linear tem uma dimensao V-C proporcional a W como
mostrado no Excmplo 2.2, enquanto que uma rede neural puramente de limiai tem uma dimensao
V-C proporcional a KíoglTem virtude do resultado 1. O resultado desejade relativo á rede neural
sigmóide é entao obtido invocando-se duas aproximadles. Primeiro, os neurónios com funpóes de
at ivacio de lindar sio aproximados pelos neurónios siigmóides com pesos sinópticos grandes. Se-
gundo, os neurónios lineares sio aprox uñados por neurónios ligmóides com pesos si ñipe icos pe-
queños.
O ponto importante a notar aquí é que as redes de múltiplas camadas alimentadas adianle tem
uma dimensao V-C fin ita.
Limites Construí i vos Independ entes de Distribuirse
para a Habilidad^ de Generalizadlo de Máquinas de Aprendizagem
blcste ponto da diseussio» achamos instruíivo considerar o caso especifico da classifica^o de pa-
drees binArios, para o qual a resposta desejada é definida por d t {CL 1!. De uma forma correspon-
dente, a fiinpao de perda tem apenas dois valores possívcis como mostrado por
ÍO
se F(i, w} = d
caso contrario
(2.90)
Sob estas condi^ócs, o funcional de risco Jí(w) c o funcional de risco empírico 7?(w) definidos
pelas Eqs. (2.72) e (2.74)» respectivamente, assumem as seguintes interpretares:
* O funcional de risco J?(w) c a probabilidadc de erro de classificacáo (i.e., a taxa de erro),
representada por P(w).
• O funcional de rÍBCO empírico /? iiip(w) c o erro de tninanmlo (i.e., a freqücncia de erres feitos
durante a sessao de treinamento), representado por
Agora, de acorde com a lei don gmnd&> números (Cray e Davisson, 1986), a freqüéncia empírica
de ocurrencia de um evento converge quase ceriamente para a probabilidade real daquele evento
quando o número de tentativas (supostamenDc i independen tes c idénticamente distribuidas) é feito
infinitamente grande. No contento desta discussáo, este resultado significa que pana qualqucr vetor
de peso w, que rufo dependa da conjunto de treinamento, c para uma prccisáo e > 0+ vale a seguíate
condi^áo (Vapnik, 1982);
H|nw) - v(w)| >()-»(} quando A1'—► «
(2.91)
onde Neo tamanho do conjunto de treinamento. Note, entretanto, que a cond\áo (2.91) nao impli-
ca que a regra de classifica^n (i.e., um vetor de peso particular w) que minimiza o erro de traína-
mentó v(w) também minimiza a probabilidade de erro de dassificaQio /Xw)- Para 11111 conjunto de
treinamento de tamanho N suficientemente grande, a proxímidade entre v(w) e P(w) é conseqüén-
cia de uma condi cao mais forte, que estipula que vale a seguinle condicac para qualqucr e > 0
(Vapnik, 1982);
F(sup|Hw) - v(w)| > í) -* 0 quando V —► ™
(2.92)
Neste caso, falamos de convergencia unt/árme dafreqüéncia de erres detreinamentopara o proba-
bilidad? que v(w) = P(w).
A no^áo de dimensao V-C fomeccum limite para a laxa de convergencia uniforme. Espccjfi-
cálmenle, para o conjunto de fun^oes de elassifica^ao com di incnsao V-C A, vale a seguínte desigual-
dade (Vapnik 1982, 1998):
J’bup! F(w) - v(i*)| > e) <
cxp(-t’N)
(293)
onde N o o tamanho da amostra de treinamento créa base do logaritmo natural. Queremos tomar
o lado ¿írrito da desiguíddade (2,93) pequeño para N grande de modo a obter convergencia unifor-
me. O fator cxpt-tW) c útil neste sentido, pois ele decaí exponencial mente com o aumento de .V. D
fator reslanle (2eWA)A representa um limite para a fun^áo de crescimento Af(0 para a familia de
fungues í? - {Hk w)í w € W’} para fS. h £ I como oblido pelo lema deSauer.** Desde que esta
fun^áo nao crespa rápido demais, o lado dircito irá a zcro quando N vai a infinito; esta exigencia é
salisfeita se a dimensfo VC h for finita. Hm outras palavras. uma dimensBc V-C finita cuma condi-
£áo neccssária o suficiente para a convergencia uniforme do principio da minimizado do risco
empírico. Se o espado de entrada íf i iver cardinal! dade finita, qualquer familia de dicotomias íf terá
dimensao VC finila cm rcla^áo a \ embora o inverso nao seja ncccssariamcnte verdadeiro.
Suponha que a represente a probabilidade de ocorréncia do evento
sup|F{w}- v(w)| > e
Entáo, com probabi kdade I — a, podemos afirmar que, para todos OS vetores de pesos w e *W, vale
a seguinte desigualdade:
P(w) < v(w) + c
(2.S4)
Utilizando o limite descrito pela Eq. (2,93) c a dcíini^áo para a probabilidade a, devemos cntáo
lixar
(2-95)
Suponha que eu(M h, a) represente o valor especial de t que satisfaz a Eq. (2.95). Dessa forma,
fácilmente oblemos o seguínte resultado importante (Vapnik11992):
SÍMA,«)=
^lüga
(2.96)
Referimo-nos a eJ^V, A, a) como um úrtervaJo de cuenca, cujo valor depende do tamanho jV da
amostra de treinamento, da dimensáo V-C A e da probabilidadc a.
0 ¡imite descrito em (2,93) com t = A, a) é alcanzado no pior caso P(w) = mas nao,
infelizmente, para F(w) pequeño, que na prática c o caso de interesse. Para Pfw) pequeño, um limite
mais útil é obtido considerando-se urna modificado da desigualdadc (2.93) como segue (Vapnik,
1982, 1998):
Jn.fIAw)-Kw)l
(2.97)
Na literatura, sm reportados diferentes resultados para o limite cm (2,97), dependendo de qual
forma particular de desigualdade é utilizada para a sua derivado. Apesar disso, todos cíes tem uma
forma similar. De (2.97) segué que com probabilidade I - Ot e simultáneamente para todo w € W'
(Vapnik, 1992,1998),
P(w) < v(w) 4- e/A1', A, tt, v)
(2.98)
onde í,(V, A, a, v) é um novo intervalo de órenla definido como segue, cm termos do intervalo de
creída anterior, ^(N, A, a) (veja o Problema 2.25):
tl(N,A1a,^ = 2E¿(.V,A1a) 1 +
L v(w)
JI+ j ,—
V <(A'Aa) J
(2.99)
Este segundo intervalo de cren^a depende do erro de Lreinamenlc v(w). Para v(w) - 0 ele se reduz á
forma especial
€1(^,ft,a,0)=i4ei¡(JV,A,tt)
(2.100)
Podemos agora resumir os dois limites que derivamos para a taxa de convergencia uniforme:
I, Em geral. temos o seguínte limite para a laxa de convergencia uniforme:
P(w) í v(w) + ej/V, ht ot, v)
onde e,(M A, ot. v) c definido como na Eq. (2.99).
2. Para um pequeño erro de treinamento i(w) próximo a zcro, temos
v(w)+ 4tn(.V,A,Ct)
que fomece um Limite razoavclmcntc preciso para o caso real de aprendízagem.
3+ Para um cito de treinamento v (w) grande próximo á unidade, temos o limite
Píw'l £ v(w) - t/M A, a)
Minimizado E&trutural de Risco
O erra de treinamento é a freqüéncia de Ciros cometidos por urna máquina de aprendizagem com
um vetor de peso w durante a sessáo de treinamento. Análogamente, o erni de genemltzapto é
definido como a freqücncia de erros cometidos pela máquina quando c testada com cxcmplos nao
vistos antcriormcnic. Assume-se aquí que os dados de teste sAo retirados da mesma populado de
onde foram retirados os dados de treinamento. Considere que estes dois erres sAo representados por
v,icmJw} e v (w), respectivamente. Note que v|ciib,(w) é o wesntoque t<w) utilizado na subsefáo
anterior; usamos ilw) ¡iqui para simplificar a nota^ao. Soja h a dimensao V-C de uma familia de
fimeócs de classificacao ¡ F(x, w): w e W} cm relamió ao espado de entrada X. Entao, levando cm
consideradlo a teoría sobre a laxa de convergencia uniforme, podemos afirmar que com probabilh
dade 1 - a para um número de cxcmplus de treinamento JV> A c simultáneamente para todas as
fun^des de classifica^áo /^x, w), o erro de ¡Mineralizado é menor que um rato garantido
definido pela soma de um par de termos antagónicos (Vapnik. 1992, 1998)
v (w}=v (w) + fc(.'VtA,ft, L' 1
¿vyi' r IrEin.P * p IPJIFh'
(2.101)
onde o intervalo de trenca eJA'. A, a, vhlllH1) ó definido pela Eq. (2.99). Para um número fixo Ade
exetnplos de treinamento, o erro de treinamento decresce monótonamente com o aumento da capa-
cidade ou da dimensao V-C /i. enguanto que o intervalo de cren^a aumenta monótonamente. Consc'
qüenlcmenk-, Unto o risco garantido como o erro de generalizado passam por um mínimo. Estas
tendencias sao ilustradas de modo genérico na Fig. 2.25. Antes de alcanzar o ponto mínimo, o
problema de aprendizagem c supgndeterrninadf^ significando que a capacidade da máquina h é
pequeña detnais para ¡i quantidade de detalhrs de treinamento. Alcm do ponto mínimo, o prchiema
de aprendizagem é aubdffermtnado porque a capacidade da máquina é grande domáis para a quam
ti dade de dados de 1 reí lamento.
AGURA 2 J5 UuSlragán da
f¡l.i C¡10 antfV úrrfl de traína-
menta, intervalo de cranga a
risco garantido
O desafio ao se resolver um problema de aprendizagem supervisionada é, portante, realizar
o melhor desempenho de generalizado adequandose a capacidad? da máquina com a quantida-
de disponível de dados de ireinamento para o problema em questáo. O método de minimizado
estrutur&i de risco forrtece um procedimiento indutivo para alcanzar este objetivo tomando a
dimensao V-C da máquina de aprendizagem em uma variavcl de controle (Vapnik, 1992, 1998).
Para serums mais específicos, considere um conjunto de classificadores de padroes {^(x1 w): w
e 'W} e defina uma estrutura aninhada de h dcstas máquinas
- (F(x, w): w e Wj, ft = l, 2„-, Ji (2-102)
tal que tentamos (veja a Fig. ¿25)
(2.103)
onde o símbolo c significa “esta contido em-'. Correspondientemente, as dimenwes V-C dos clari-
ficadores de padrees individuáis satisfazcm a ccndicáo
VM (2 -104)
O que implica que a dimensao V-C de cada clarificador de padrees c finita. Encao, o método de
minimizado estrutura! de risco pode proceder como segue.
* O risco empírico (i ,e„ o erro de treinamento) para cada class iffcador da padrües é mi ni mi zado,
* O clarificador de padróes J* com o menor risco garantido é identificado; esta máquina par-
ticular fbmece o melhor compromisso entre erro de treinamento (i.e., a qualidade de aproxi-
mado dos dados de treinamento) c o intervalo de érenla (i.c., a complcxidadc da fúndan
aproxima! iva) que competcm entre si.
O nesso objetivo é encontrar uma estrutura de rede tal que o decresciino da dimensao V-C ocorra as
cusías do menor aumento possívcl no erro de treinamento.
O principio da minimizado estruturaI de risco pode ser implementado de varias formas. Po-
demos variar a dimensáo V-C A, por exemplo, variando o numere de neurónios ocultos. Específica-
mente, avallamos um cnscmblc de redes de múltiplas camadas totalmente conectadas para frente,
ñas quais o número de neurónios cm urna das camadas ocultas é incrementado monótonamente. O
principio da minimizado estruturaI de risco afirma que a melhor rede desre conjunto é aqueta para
a qual o risco garantido é □ mínimo.
A ti imensao V*C n&' ó apenas central para o principio da mini mizafao cstrulural do risco, mas
também para um modelo igualmente poderoso, chamado de provavclmente aproximadamente cór-
relo (PAC), tiste modelo, discutido na próxima sepilo, completa a última parte deste capítulo que
trata dos aspectos probabilisticos e estatíslicos da aprendizagem.
2.15 MODELO DE APRENDIZAGEM PROVAVELMENTE
APROXIMADAMENTE CORRETO
O modelo de aprendizagem provavebneHie aproximadamente eomlo (PAC) é crediiado a Vahant
(1984). Como o nome implica, o modelo PAC é uma estrutura probabílistIca para o estudo de
aprendizagem e generalizadlo «ni pístenlas de classificacáo binaria. Ele está intimamente relacio-
nado á aprendizagem supervisionada.
Coine^amos com um ambiente ró Um conjunto de SE é chamado de um coneefftj e um conjun-
to do subcon ¡untos de si7 c chamado de uma cZíiWtf deenmeltos. Um exempínde um conccito c um
objeto do dominio de interesse junio mente com um rótulo de elasse. Se o cxcmplo tur um membro
do COneeilO, referimo-nos a ele como um exempte positiva-. se o objeto nao tbr um memhro do
conceito, referimo-nos a ele como um exvmpin negativo. Um canee.Lo pira o qua'. sjc: fómcüidos
exemplos c chamado de um concedo ít/víj. Podemos adquirir uma seqü^neia de dados de treiñámen-
lo de compri mentó Ar para um conce ¡lo alvo e como mostrado por
= {(«„<«,)}« (2.105)
a qual pude conler exemplos repetidos. Os exemplos xp x,,..., xv sáo retirados aleatoriamente do
ambiente í. de acor do com uma dislri buifáo de probaklidade fixa mas descemhecida. Os seg a untes
ponías sito tamhéin dignos de nota na Eq. {2.105):
» Ocaacciio-alvo c(x) e tratado como uma fiinfto de 3? para JO, 1}. Além disso, assume-se que
c(xj seja. desconheeido.
• Normalmente, assumosc que os exemplos sejam estilísticamente mdependentes, o que signi-
fica que a densidade de próbahil dade Conjunta dé quaisquer deis exemplos, digamos, x c i. c
igual ao pruduto de suas fungues de densidade de probabilidad? individuáis,
So contexto de nossa terminología precedente; o ambiente pode ser identificado como o espado
de entrada de uma rede neural co cenceño-alvo pode ser ídcniiflesdo enmo a resposta desejada da
rede.
O conjunto de ooocejics derivados do ambiente áf c denominado espado de conocí ton O
espado de cunee tus pode cunlcr, portxcmplo, ”a letra A", Lla letra B” c assim pordianlc. Cada um
desses conceitos pode scr codificado diferentemente para gerar um. conjunto de exemplos positivos
c um conjunto de exemplos negativos. Na cstnjtura de aprendizagem supervisionada, cornudo, te-
mos um nutro conjunto de conceitos. Uma máquina de aprendizagem típicamente représenla um
conjunto de fuiiQÓcs. com cada fun^áo corrcspondcndo a um estado específico. Por excmplo^ a
máquina pude serprojetadn para reconhecer "a letra A”, “a letra li" e assim por di ante, ü conjunto
de todas as fun^ocs (i.e., conceitos) determinados pela máquina de aprendizagem ó denominado
(yt/Wfo de hipáleses <8. o espago de hipóteses pode ou nao ser igual ao espado de conceitos. De
certa forma, as no^fies de espado de cunceitus e CSpaqO de /iipólcsCs sáo análogas á funoáo /(x) c á
tun^áo apruximaliva/F~(ji, w), respectivamente, que foram utilizadas na se^áo anterior
Suponha cntáo que nos é dado um conccito-allvo cfi) £ que assumc apenas o valor 0 ou ].
Desojamos aprender este conccito por mcio de uma rede neural, tremando-a com o conjunto de
dados J definido pela Fq. (2 105). Suponha que qO) e represente a hipótese correspondente ao
mapeamento de entrada-salda que resulta do scu treinsmento. Uma forrnn de avallar o sucesso do
processo de aprendizagem é medindo-M o quito perto a hipótese ^x) está do cunccito-alvo cfx).
Naturalmente scráo cometidos erras, fazcndo-scg(x) t?(x). A razio para a ocnrréncia de éreos c
que estamos lentaJido aprender urna funqío com base em informando limitada disponivel sobre
aqucla fiinnáo. A probahilidade de erro de treinamento ¿ definida por
vilcl,«,= e * cfr» (2.106)
PrüCLSSíJS- UE. A IfLEMDtZAGEM 129
A distribuK’ao de probabil idade resta cquaqao deve ser a mesma que c rcsponsávcl pela geracáo dos
cxcmplos. O objetive da aprendizagem PAC £ asegurar que VHrtB soja normalmentepequato. O
dominio que está dispo nivel para o algoritmo de aprendí/.agerú é Pont rolado pelo tamanho A da
amostra de treinamento ?. Adictonaimcnle, Ibmece-scao algoritmo de aprendizagem dois parametros
de controle:
• Farámetm Je ¿m, t e (0,1 ]. tiste parámetro especifica o erro permitido em uma boa aproxi-
mafáo do ecnecito-alvo c(x) pela hipótesc g(x).
• Parámetrv deemtfa Ó e (0,1 ], Este segundo parámetro controla a probabilidade de se cons-
truir uma boa aproximado.
Podemos assim visualizare modelo de aprendizagem PAC como representado na Fig. 2.26,
Com esta fundamcntaqáo, podemos agora formalmente formular o modelo de aprendizagem
PAC (Valiant, 1984: Keams e Vazirani, 1994; Vidyasagar, 1997):
PirdrnLlriTj ifc-LunlrulL
A. fi
í lipíXCEC
FIGURA 2.26 Diagrama em
Moco ilustrando o modato üc
apreriditagfim PAC
Considere que % seja uma elasse de conceitoü sobre o jimbicntc . Diz-sc que a elasse de conccilos
'< pode ser aprendida por TAC se existir um algor ;mo ¿í com a seguinte propriedade: para todo
coneeito-alvo c € para toda distribuido de probabil idade cm X c para todo 0 < t < 1/2 e 0 <5
< 1/2, se for fcimecido ao algoritmo de aprendizagem /. o cnryunln de exemplos de ireiciainentt.1
3" = {(x,, f. ( v, )} , e os parámetros c c 3. cntáo, com pnobabil idade de no mi n i mo 1 - o, o al gor¡ tino
de aprend-^Hgpm jc praduzirú uma HipótCSC g COffl emi v ^e. Esta probabilidad? engloba 05
exemplos aléalo nos retirados do con.'unto 3 c quüiqucr alcalorudadc interna que possa existir no
algoritmo de aprendizagem 2L O tamarilla da amostra A'deve ser maior que uma funcio de 8 t e.
Em nutras palavras, de.'uie que o tamanho ,V da amostra de treinamento ST seja suficientemente
grande, após a rede neural [cr sido tremada com aquele comunto de dados, c "provável1' que o
mapeamento de entrada-saida calculado pela rede seja “aproximadamente córrelo’1. Note que, em-
bora haja uma dependencia cm 3 c e, o número de excmplos, -V, nao c ncccssariamcnlc dependente
do conceito-alvo c ou da distrihuiqáo de probahi Edade retal iva a T.
Complexldade da Amostra
Na teoría de aprendizagem PAC, uma questáo de particular interesseccm impl¡calóes práticas é a
questao da compfexidade da amostra, O enfoque nesta queslao está sobre quantos exemplos aleató-
ríos de\ cm ser apresentados ao algoritmo de aprendizagem para que ele adquira intbrmafáo sufici-
ente para aprender um ccnccito^alvc deseo nhccido c cscolhido da elasse de cancel los S6. Ou aínda,
quáo grande deve ser o tamanho Ar do conjunto de trcLiiamenlO 3^7
A questáo da complcxidade da amustia está intimamente ligada á ti imen sao V-C. Entretanto,
antes de prosseguirmos sobre esta questlo, precisamos definir a noqáo de um conccito consistente.
Seja íf = {(x,,¿f,)} ^. um conjunto qualquerde exemplus rotulados, onde cada x. s 3?e cada d¡ e (0,
1). Seja í? um conccito alvo sobre o ambiente cJ . Enláo, dizemos que o centello t ó consistente com
o conjunto de treinamento rJ (cu, de forma equivalente* í7 c consistente com c) se para todo l < í <
;V tiramos e(x ) (Kearns c Vazarini. 1994). Por outro lado, contante que a aprendizagem PAC
seja considerada, nao ú o tamanho do conjunto de fundes de entrada-salda calculável por uma rede
neural que c crucial, mas sim a dimensáo V-C da rede. Mais examínente, podemos formular um
resultado fundamental, em duas partes (Blumcr c al., 1 989; Anthony c Biggs, 1992; Vidyasagar,
i 997);
Conviden uma rede neural com uma dimensao V-C finita > I.
1, Qualquer algoritmo <lc aprendizagem l\h)j-¡siente para aqueta rede neural é um algoritmo de
apretLilbzagcm PAC.
2. Existe uma constante f tal que um tanuinho sulkieiüu da conjunto de tr^inameniíi 3* para,
qualquer algoritmo deste tipo c calculado por
KLi P'l i .'l
—I ólogl - 1+
(2.107)
ondef é o paramcim de erro e 6 é o parámetro de cnen^a.
A genera lidade dcstc resultado c impressi únanle: c aplicável a um processo de aprendizagem super-
vi^ionada independen teniente do tipo de algoritmo de aprcndi/agcm uli Izado c da ¿islribuifáo de
probabilidade responsávd. pela geraffio dos cxcmplos rotulados. É a grande generalidade dcstc
resultado que o loman um loma de ¡menso interesse cien tí íleo na literatura de redes neurais. A
comparado de resultados provistos para limites de medidas bascadas na dimensao V-C com resul-
tados experimentáis rcvelam uma grande discrepancia numérica.14 De certo mudo, isto nao deveria
surprccndcr. pois a discKpáncút é apenas um reflexo da natureza buiependente de distnbuican c
piar case das medidas teóricas e, em ntédia. sempre podemos obler mcihores resultados.
Complexidad^ Ccmputacional
UrnaouLra questfio de interesseprimordial na aprendizagem PAC ¿a cumplo;idade computacionaL
Esta questao se refere á eficiencia computad un al deum algoritmo de aprcnd:/agciin. Mais precisa-
mente* a cwtidü.íitiutfe ctrinpuííh-'itrfíailida eoin o pior caso de '‘tempe de proccssamcnto" ncccssá-
rio para iruinar uma rede neural (máquina de aprendízagem), dado um conjunto de exemplos rotu-
lados de lamarillo finito JV.
Em uma siluacáo prática, o tempe de processiunento de um algoritmo depende naturalmente
da veloddade com a qual os cólcukis envolvidos sao realizados. De uma perspectiva teórica, entre-
tanto, a intcncao c obter urna definióle de teinpn de processamentó que Seja indcpcndcntc do dispo-
sitivo utilizado para realizar os cálculos. Tendo em mente esta considerado, o lempo de
processamente, e conseqüentemcntc a cumplexiJadc computacional, é medido normalmente em
ferinos do número de operares (adiQ3c&* multiplicacóes c armazenamentos) necessártas para reali-
zar a computacáo.
Estimando a complcxidade cumputacional de um algoritmo de aprcndizagcin, queremos saber
como tía varia com o lamanhc m do excrnplo (i.?., o tamanho da camada de entrada da rede ncural
trcinada). Para que, neste contexto, o algoritmo seja eficiente do ponfo de vista eomputacional, o
tempo de processamento deve ser O(mr) para um inteiro fixo r > L Neste caso, diz-se que o tempo
de processamento crosee de forma pol i non i i al com mt Jo próprio algoritmo c denominado algoritmo
de tempo polinomio!. Tarefas de aprendizagem realizadas por um algoritmo de lempo pol momia!
sáo normalmente consideradas "fácei/’ (Anthony c Biggs, 1992).
O outro parámetro que requer atenqto é o parámetro de em e. Enquanto que, no caso da
complexidade da amostra, o parámetro € o fixo mas arbitrario, para estimar a complexidad^
computacicnal de um algoritmo de aprendizagem queremos saber Como da varia com e. Intuitiva’
mente, esperamos que quando e é reduzido, a tarefa de aprendizagem estudada se tome mais difícil.
Consoqücntcmcntc,, devose imper alguna condiqáo para o tempo que o algoritmo leva para prudu-
zir uma salda provavelmente aproximadamente correta. A condiqto apropriada para uma computa-
pao eficiente é que o tempo de processamento seja polinomial em 1/t.
Juntando estas considerares, podemos fazer a seguí nte afirmado formal sobre a complexi-
dade compulaciOnal (Anthony c Eliggs, 1992);
Um algoritmo de aprenii-zagcm é eficiente, do ponto de vista compulacionakcm rda^toao parámetro
de erro e, ao tamanho m do exemplo e ao tamanho jVdn conjunto de treinamento, se o seu tempo de
prrKcss^T'nÉrihj ir polirtomial érti JVe Sí CXÍSLif uní vdlcr de .V fS, eJ SuíiciúrtCt parí a aptttkLzagem
PAC que scja polinptnial tanto em m como em e —L
2/16 RESUMO E DISCUSSAO
Neste capitulo, discutimos aIgumas questSes importantes relativas ás muitas facetas do processo de
aprendizagem no contexto de redes neurais. Com isso, cstabclecemos os fundamentos para grande
parte do material restante dcstc livro. As cinco negras de aprendizagem, aprendizagem por correado
de erro, aprendizagem boxeada em memoria, apteadizugem hebbiana. aprendizagem competitiva e
aprendizagem de Boltzmann sáo básicas para o projeto de redes neurais. Alguns destes algoritmos
requerem a utilizante de um professor c outros nao. O ponto importante c que estas regras nos
permitem ir mui te além do alcancé vel por filtros adaplativa lineares, tanto em termos de capacidad?
como em universalidadc.
No cstudo da aprendizagem supervisionada, uma conducto fundamental é a existencia de um
“professor" capaz de fornecer corre^oes exatas para as saidas da rede quando um erro ocorrcr, como
na aprendizagem por correcto deem; ou de "liixar” em rela^to ao ambiente as unidades de entrada
e de saída livres da rede, como na aprendizagem de Boltzmann. Ncnhum dcstcs modelos c possivcl
cm organismos biológicos, que náo possuem as conexóes nervosas reciprocas exatas necessárias
para a retropropaga^to das correqdes de erro {em uma rede de múltiplas camadas alimentada adían-
te), nem os meios nervosos para imposicáo de comportamcnto pelo mundo exterior. Apcsar disso, a
aprendizagem supervisionada cstabclceeu’sc como um paradigma poderoso para O projeto de rede
neurais artificiáis, entino é demonstrado nos Capítulos de S a 7.
Por cutro lado, regras de aprendizagem auto-organizada (nau-supen isionadM)> tais como a
aprendizagem hebbiana e a aprendizagem compelitlva, sáo motivadas por considerares
ncuiobiológicas. Entretanto, para aperfei^oar o nosso entendí monto sobre a aprendizagem auto-
organizada, precisamos também buscar idéias relevantes na teoria da de Shannon. De-
vemos menci uñar aquí o principio da máxima ñfórmafw mutua (íu/bmax) de Linskcrf 1988a, b),
que fomccc o formalismo matemático para o processamento de informado em urna rede neural
auto-organizada, de uma forma ate certo ponto análoga á transmissáo de informando em um canal
de comunicado. O principio Infomax e suas variantes sáo discutidos no Capitulo 10.
Uma discussáa dos métodos de aprendizagem seria incompleta K rtáo mencionás&emüs 0
modela lie aprendizagem seietiva darwlniaw (Edelman, 1987; Reeke el al-, 1990). A je/efío é um
principio biológico poderoso com aplicantes tanto na evcli^ao como no desenvehi mentó. Ela
ocupa uma posifáo central no sistema imunológkc (Edelman. 1973), que é o sistema de recen tieci-
menlc biológico mais bem entendido. O modelo de aprendizagem seletiv? darviniano é baseado na
teoría da sele^ao de grupo neural. Ele prcssupdc que o sistema nervoso opera por unta forma de
sele^áo similar ;i sele^^o natural evolutiva, mas que isto acontece dentro do cerebro durante o
periodo de vida de cada ammal. De aconto com esta teoría, as unidades opcncionaÍB básicas do
sistema nervoso nio sao os neurónios i sol ados, mas sim grupos localizados de células fort emente
interligadas. A pertinencia de neurónios em um grupo é modificada pela alterabas dos pesos sináptico*
dos neurónios. A competido local e a cooperando entre células sáo claramente necessárias para
produzir ordenado local na rede. Uma cole^áo de grupos neurona! s é denominada repertóriQ. Gru-
pos cm um repertório respondem methor a padrees de entrada superpostos mas similares, devido á
natureza aleatoria do crescimento neural. Um ou mais grupos neuronais cm um repertório respon-
den! a iodo padreo de entrada, assegurando assim que h aja uma resposta a padróes de entrada itáo-
esperados, que podem scr importantes. A aprendizagem seletiva daiwinkinac diferente dos algoritmos
de aprendizagem normalmente utilizados no projeto de redes neurais, porque ela assume que, por
projeto, baja mui las subredes c que sumen le aquetas Com a resposta desejada sao sclccionadas
durante o procedo de treinamento.
Completamos esta discussao com alguns comentarios fináis sobre os aspectos cstatístícos e
probabil!slicos da aprendizagem. A dimensáo V-C se eslabeleceu como um parámetro central na
teoría estatistica da aprendizagem. Ela c básica para a minimizado estrutnral de risco e para o
modelo de aprendizagem provavclmcntc aproximadamente correto (PAC). A dimensao V-C é urna
parte integrante da teoría relativa is chamadas máquinas de vetor de suporte, discutidas no Capitulo
6- No Capítulo 7, discutimos uma elasse de máquinas de comité bascadas em reforjo, cuja teoría
está fundamentada na aprendizagem PAC.
A medida que avan^armos ueste livro, haverá mudas ocasiñcs c boas razocs para revisita! o
material neslc capitulo sobre os fundamentos dos proccssos de aprendizagem.
NOTAS E REFERÉNCIAS
1. O Icmui '‘algoritmo" é derivado dn irae do malemáiicn pena Mohammcd a I -Kcwí rtsini i,
que vjvcu durante o sáculo IX c a quera se atribuí o desenvolví mentó das regras passo a
posso para a adiQáo, subüacáo, multiplicadlo e d ¡visto de números decimai.H ordinarios.
Qijundc) Sen nómt ll'ri escri Id em Istim, tofIMU-SC A Igorismus, do qual algoritmo C deriva-
do (Harel, 1987).
2. A regra do vízinho mais próximo envolve urna ¡mensa Literatura; veja a colecto de artigas
editados por Dasarathy (] w 1}. Este livro incluí o trahaihooriginal dt Fíx e Rndges (1951)
c mu i tos outros arigot importantes sobre técnicas de cías*, i (icario de padriie? por vízinho
mais próximo.
3. Para uma revisto detallada sobre sinapse* hebbianas, incluindo um reíala histórico, veja
Bmwn «I al. (1990) e Frégnac e Schuiz (1994). Para maierial de revisto adiciona!, veja
Constanlinc-faton et al. (1990).
4. Polencia^üjj de Longo Prazo — Evidencia FímdIógica para a Sinjpsc Hebbiima
Hebb {1949) nos fnmeceuvtn modo de rcflctir sóbreos mecanismos de memoria sinópticos,
mu futo ocurren quasc um quarto de socolo antes que fbsseobtida evidencia experimenta]
que sustentarse suas proposlas. Em 1973. Blissc Lomo publicaran) utn artigo descreyendo
uma forma de modificadlo sináplica induzida por rtivwffo em uma área do cerebro cha-
ni ada hipocampo. Eles aplicaran) pulsos de estimulado elétrica na maiar parte das vías
que entram nesta estrutura, enguanta registravam as res.po$tas evocadas sinópticamente,
Após se certificarem de (erem caracterizado urna morfología de raposea básica estável,
cíes aphearam trena de pulsos breves, de alta íreqü&ncia. nestes mesmas vías. Quando
retomaram a aplicad0 de pulsos de teste, canstalaram que as respn$ta$ eram muito malo-
tes em ampl ilude, O mais interessante para os pesquisadores da memória foi o tato de que
este efeito era de longa durad0- Eles chamaram este fenómeno de püleiKiu^au Je longo
prüzO (PLP).
Existen) agora centenas de artigos publicados anualmente sobre o fenómeno PLP» e
sabemos muito sobre os mecanismos envolvidos. Sabemos, porexempla, que ofl efeftoe da
potenciaría eslió restritas ás vías que sao ativadas. Sabemos também que a PLP aprésenla
vanas propiedades assccialivas. Por propiedades associativas queremos dizer que ex És-
ten) efeitos iterativas entre vías co-nrivaí- Em particular se uma entrada traca que nor-
malmente nío induziria um afeito PLP cslivcr casada com uma entrada forte, a entrada
fraca podará ser potencial izada. Isto é denominado urna proprieJaJe ítrípcíatrixi, pois é
similar As propriedades associalivas dos sistemas de aprendizagem. Nos experimentos de
condicLonamcnto de Plavlov, por exemplo, utn estimulo auditivo neutra (fraca) era disoci-
ado a um estimulo forte (alimenta)- A MMCtado resulta va no aparcei menta de uma rer-
posta condicionda^ salivad0 em resposla ao estimulo auditiva.
Muito do trabalho experimental ne$ta ireu enfocan as propriedades associativas da
PLP, A maioria das sinapses que demonstraran! suportar a PLP utiliza o glutaraato como
neuroíransmissor. Ocorre, entretanta, que existen» virios receptara diferentes no neurónio
pós-sináptica que respndcm ao glulamata- Todos osles receptares lem propriedades dife-
rentes, mas nós consideraremos apenas dois deles. A resposta >máptica principal é induzida
pela ativacáo do receptor AMPA (estes receptores sáo denominadas de acardo Cóm as
drogas te quais cíes responden) mais fortcmcntc, mas sáo todos receptores de glutamato).
Quando uma resposla é registrada em um experimento PLP, ela é atribuivel primariamente
i ativado de receptores AMPA. Após a ativacao sinóptica, o glulamata c liberado e se liga
aos receptores na membrana pós-sináptica. Abrem-se, entío, canais iónicos, que sáo parte
dos receptores AMPA, resultando em um ílujto de córtente que é a base da resposta sináptics.
O segunda tipo de receptar de gluiamato, o receptor NMDA, tem algumas proprieda-
des interessantes. A liga^áo do glutamato com o receptor NMDA nóo é suficiente para
abrir o canal iónico associado. Este canal se manten» bloqueada ate que uma diferente de
tcns&o suficientemente grande lenha sido produzida pela alividade sináplica (cnvolvendo
receptores AMPA). Conseqüememente, enguanto que os receptores AMPA sinquim tea-
mente dependentes, os receptores NMDA sao tanta químicamente dependentes como tam-
bán dependentes detensóo. Ncccssitamos de mais uma informafáo para enlendermos a
importancia desta diíetenga. O canal iónico associada com o receptor AMPA está ligado á
mov i i ttertíá£3o de íonsde sódia (que prUduz uscortentes sináptiCaS). O canal iónico ligado
nr receptor NMDA permite que o cálete se mava para dentro da célula. Enguanta que o
movimenta de cále ¡o também contribuí para as correntes da membranah a sua fun^o prin-
cipa] é de um sinal que dispara uma cadeiade eventos que resulta em um aumento de tonga
duraría na fün,a da respasm asociada com o receptar AMPA.
Temos agora o nosso mecanismo para a sinapse hebbiana. O receptor NMDA requer
lanío atrv idade pré-sináptica (liberado de glutamato) armu ativ idade pós-sináptica. Cama
isto nonnalmente acorrería? Assegurando-se que baja urna entrada suficientemente forte.
Assim, quando associamas uma entrada Traca a uma entrada forte, a entrada fraca libera
seu próprio glulamata, enguanto que a entrada forte assegura que haja urna diferente de
potencial suficientemente grande para ai i varos receptora NMDA asociados com asinapse
fraca.
Apcsar de a proposta origina] de Hebb ter sida para urna regra de aprendizagem em
uma única directo, as redes neurais sáo muito mais ílexíveis se urna regra de aprendiza-
gern bidincional fjirussda. F. v¡inLü¡LiM < se icr sinapses nas quaiso peso sinóptico possa ser
tanto diminuido como aumentado. É tranquiltz&dcr ¡saber que existe i:irnhérn evidencia
experimental para uní mecanisrnu de depressito sinóptica. Se entradas iracas sáo air adas
sem a ativa^áo combinada de entradas fortes, o peso sinóptico é frrqüenttmerue en Fraque-
cid», Esto é típicamente observado na resposla á aiiva^óo de baixa freqüéncia de sistemas
sinópticos, e o fenómeno ó chamado de depressav de i/mgí>prüzü (PI.P'l, Existe lambérn
alguma evidencia para o que se chama de um efeibo de deprassóo heterossináptico. En'
quinto que a DLI1 é urna depressao que é rcstrila á entrada ativada. a depreasáo
heteriíssiuáptica é reslrita á entrada náo-alivada.
5, A idéi a de aprendiz?gem competí liva remonta aos trabaIlíos pioneircis de von der Malsbu^g
(1973) sobre a auto-organizaijáo de células nervosas sensíveis á oritriiatfáo no uórtice
estriado, de Fukushinia (1975) sobro umti rede neural de múltiplas camadas auto-organíkivel
conhccida como neocognitivri, de Willshaw e von der Maisburg C197ó) sobre a forma^ao
ile padróes de conexiies neurais por auto-orgaiiizaijáo e de ürossberg (1972,1976a,b) so-
bre dasMÍLca^áo adaptativa de padrocs. Tatnbém luí substancial evidencia de que a apren-
tl /agem uomper.iiva desempenhe um papel importante na tórma^áo de mapas liípográtí-
cos no cerebro (üurtinet al.. 1989}c o trahalho experimental recente de Ambros-lngcrson
et al, (1990) fcirneee i.¡>uficat!va fisiológicaadicional para a aprendizagem competitiva.
6. A utilizado de inibÍQáü lateral, como indicado na Fig. 2.4, c adaptada dos sistemas
nrijrobiol¿>jtco&. A maior i a dos tecidos sensoriais, como a retina do olho, a cóclea di?
ouvido e os nonos sensiveis á prcssáo da pele, c organizada de tal forma que a estimulado
de qualquer Local prinluz inihi^áú fias células iWWM M:/irtha¡» (Arhib. 1939; FiSCHer c
Firochcin. 1937}. Na pereep^á» humana, a iiiibicau lateral se man:fcsla atraves de um
fenómeno chamado dentaos de Mari), denominado assim cm referencia a Emesi MacLi
11865). Se olhurncd, por exemplo. para uma lolha de papel metade branca e melado preui,
veremos paralelamente i fronleira unía fui xa '‘mais clara que O claro’" nci lado branco c
urna faixa “mais escura que o escuro*1 no lado preto. embota, na realidade. ambas lenliarti
urna dens Liarle unifórme. A fainas ¿e Mach nao ex i s tem Físicamente; na verdaJc cías sao
urna i I lisio de ótica, representando "sobrdevafócsH c "subclcvafócs" causadas pela afilo
dent al iva da inibifáfl lateral.
7. A importancia da termodinámica eslatlhlica no «luda (los mecanismos cumputaeíonais
fot rcccinhccida por John von Ncumann. Isto fica evidenciado pclatcrccira das suas cinco
palestras sobre a Teoría c Orgait/za^t de AuHmiafus Compítanlos ji.l Un i veraily of I llinoi 5
cm 1949. Na sua fenecí ra palestra. Kíibre’T'eorias Estatistieas da Informafáo”. von Neumann
disse:
Conceitos termodinámicos prova vilmente entrarüo rusta nova teciriu da infonnufáo,
Elá lurtes indica^lies de que a iiilbnnafái? é similar á enlmpí» e de que OS procesaos
degeneratívcis d¡> entropía se cranpüram aos proccsws degenerativos no processamento
da tnformafáo. Éprovávcl que nao se possa definirá fijt^áodé um sulAnnat». ou a sua
eiic éjlc:;i, sem caracterizur o ambiente no qual irle [rahidhn pin mcío do traeos CStatís-
ticos cinTiL» aqueles utilizados para caracterizar um ambiento na icrmcdinátirica. As
variñveis cxtaúsiicas di? ambiente do tmtómalo serijo; c claro, um pouco mais compli-
cad jsque .i víiriávd de temperatura da termodinámicapadtüo, itijs sera» similares cm
carúlei.
8. Aparentemente, o termo "apTCIld¡zagüin jXir refir^íf" fo¡ cunhadn por Mtnsky (1961) írtl
Muí estados iniciáis sobre : niel igfnc ar:i¡fi. ¡.il c entilo, deforma independente, pnr Wdltz
c Fu {1965), na looria de coninile. Entretanto, a idcia básica de “reibr^cf1 tem Sun origen
nolestudihs experiineniáis de aprendizagem anímahia psitolüyia (Hampwm, 1990). Ncste
conlexin, i: pfírticul ármente csclarecedor recordarmos a clássica /« rfo efrjfrídc Thomdike
(Thomdikc, 191 ]«p244):
Das d¡verana mpostes á mesma situado, aquelas que sao acompanhadus ou seguida*
de porto pela salisft^íte ilr animal seriio, x o t estante tói igual. mais fbrtcnicntc
conectadas com a situado, de forma que, quando a situante ticurrer novameiite, elas
torio maitir pnvbíibilidade de ocorrcrem] aquetas que sao acompanTiíidas ou seguida*
de perto por dexconforto para <i animal, se o reste for igual. [crio menor probabilidade
de úcorrercm. Quanto maior foru *atisfacao ou o desccinforto, maior será o reforjo ou
o eijíraqueclmenlo da ligado.
Apesar de uño ser posslvcl afirmar que este principio fámula um modelo complete de
cumpurtamente biológico. sua slmplicídadc e sua abonfagem de sonso comum o lewani
a ser uma regra de apnendi/agem influente na abordagem elástica da írjwTwc/izffgcwpw
reforja.
9. A saida da planta c típicamente uma variávcl física. Para controlar a plañía, precisamos
evidentemente conhcce? o valor dcste variívd; isto é, devemos medir a laida da planta. O
sistema utilizado para medir uma variivel tísica ó chamado de .verdor Por este motivo,
para sentios preciaos, o diagrama em blocos da Fig. 2.13 deveria incluir um sensor no seu
la^o de rcalimcnte^áo. Nós omn irnos o sensor, o que. por implica^ao. significa que aií-u-
mimos que a tunero de transferencia do sensor é unitáru.
lll. O ''fenómeno da festa de coqueteF1 w refere ¿ notávcl habihdade humana de atentar
selelivamente para uma tonta de entrada auditiva c seguí-la, cm um ambiente ruidoso
(Chcrry. l953;Cheny eTaylin. 1954). Esta hábil idade se man i festa cm urna combinado
de tnés procesaos realizados no sistema auditivo:
• íte^meniu^. O sinal auditivo incidente é segmentado cm canais individuáis com
c.iiki canal pruvendo iufbrmsignificativa sobre un: ambiente do OUViilte. Dentro
as heurislicas ur.lizadas polo ouvifllc para realizar esta segritenlacio. a
espacial talvcí 5cja a mais importante (Moray, 1995).
• Aten^üí). Diz respe i to ¿i habi.idailc de o om inte focalizar a ateneo cm um canal,
enquanto bloqueia a atendió em cunáis i 11 elevantes (Chcrry, 1953).
• Desvio. O tercciro proccsso envolve a hab lidadu de desviara atChfSo de um canul
para outro. o que c provavclmente mediado de urna forma de cima para baixo pdo
“Lhaveamertto'1 ¿o sinal auditivo incidente (Wood c Cowan, 1995).
A conclusáo que se 1 ira dcsies ponfos é que o pniccssamento real Izado sobre o si 1 ia| juidi-
tivo Incidente é realmente do tipo espado-temporal.
11. O problema de prújetar um í¡ I tro 1 inear Mimo que tornera a eslrutu ra teórica pata os filtros
adaplfitivns lineare* foi concebido :iTÍmi-mínente por KobnOpOTOV (1942) e rcsoh ido um
pouco depois de forma independente por Wiener (1949). Por ouiro ludo, uma soluto
formal para o problema da filtragcm ido-linear ólimo c matemáticamente inlratávcl. Apo
sar diüjío, noí (chis L95Ü foram. zc.ikziidos ijubaHios bi ¡Ltiaiiies na área por Zadeh (1953),
Wiener e seus colaboradores (Wiener, 1958), c cutres que multo fizeram para esclarecer a
naturcjzít do problema.
Uabor foi o primeiro a conecte? ¡i idéta de um tlltro adaptar.vo nao-1mear cm 1954 e
continúen] a trabalhar para construi-lo com ;i ajuda de colaboradores (Gabor el a]r| 1960).
H.i'ii .luiente, Gabor prn-pó* .i .superávit) das i! .rlculdadc* matemálitas da Fillra^em
adaptan va nao-linear con&truindo um t-ltro que olí miza sita resposta alravcs de aprcud i za
gcm. A saida do filtro é cxprcs&a na forma
fl N X
onde.r(O), jc(í), .,„ x(.V) sfc anuisiras dii entrada do filtro. (Este polinomio é agora
re ferenc i: ido ctimo o pofiníimin de Gnhrn-Knlmogomv OU féHir de ) O primeiro
termo do polinomio representa um fillro 11near curacterizado por um conjunto de coelici-
entes jwj. O segundo termo caraclerizado par uní conjunto de coeficientes di índicos {u'n, f
é nio- Linear: este termo contcm os produtos de duas amostro de entrada do filtro, C #Mim
por di ¡inte, para oa leimos de ordem mais elevada. Os coeficientes do filtro sdo ajustados
vía desdida do gradiente para minimizar o valor medio quadratico da diteren^a entre uma
resposlaolvo (desejada) ¿/(A1) c a salda real do filtro jX-V).
11. A furwján de cusió /.(J, A{ i, w)) definida na Eq. (2.71) se api ica a uní escalar ¿ No caso de
um vetor d como nesposta desejada. a fimflft aproximativa usfiume u forma de valor veioriaL
F(x, w). Neste caso, utilizamos a distáncu cuclidiana ao quadrado
£(d. F(i.w))=||d-F(s.w)|:
como a fun^ao de penda. A fun^ao F(-. J éUma foníáo de valor vetori al de mus argumen-
EOS.
13. De acorde com BltrgCS (1998), O Ejemplo 2,3 que aparecen primeiRímente ern Vapntk
(1995) se deve a E. Leviti e J.S. Deriker.
] 4, O lim ile superior da ondem de HlogJF para a di mtnsw V-C de uma rede neural ali mentada
odiante construida com unidades de Inniar I- -reares (pcrccptrons) foi o b ti Ja por Baum e
HaUMler{I9R9). SuhüeqüiMlemenie, Maass (199J) mostrou que existe um limite inferior
também da ordem de HlogíF para esta classe de redes.
O primeino limite superior para a dimensao V-C de uma rede neural sigmóide foi
derivado porMacintyre e 5ontag( 1993). Subseqüenlemenle, Koiran e Sontag{ 1996} abor-
daran! umu queslao abena levantada por Maass (199,3);
"A dimensio V-C de redes neurais analógicas com funcAo de aliva^ta u« J/J + « ' é
limitada por um polinomio no número de parámetros prKigramávuis'?Lt
Koiran c Sonlag responderán! afirmativamcnlc S esta questao no seu artigo do 1996, como
descrito no texto.
Esta questáo foi também respondida afirmativamente por Karpinski c Macintyrc
(1997). Nlesle último artigo, tbi utilizado um método complicado bascado em topología
diferencial para mostrar que a dimensao V-C de uma rede neural sigmúide usada como
classificador de padrees é limitada acirna por O(K*). Existe um grande intervalo entre
este limite superior c o limite inferior deduzido por Koiran e Sonlag (1996). Em Kaqpinski
e Macintyre (1997) cnnjcftura-sf que aqucle I i mile superior pedería ser reducido.
15. O tonto tic Satter pode scr fbrmu lado como (Sauer, 1972; Anthony e B iggs, 1992; Vidvnsagar,
1997}:
Considere que í? represente o oonj unto de dicotomías i mplementadas por uma máqui-
na de aprendizagem. Se VCdiin(r?) — ir ctim h finito e l & lt S 1. cntáo a limeño de
CTOKiment» i F(/) é limitada acima par (g//A)* onde cía base do logaritmo natural.
16. Nesta nota, apresentamüs o resumo de qualre importantes cstudos relatados na Literatura
sobre a complexidade da amostra e as questfcs relacionadas A general iza^au.
Prlmeim, Cobo e Tesauro (1992) ípresentam um cstudo ex per1 mental detalliado so-
bre o valer pratico dos ¡imites da complexidad? da amostra bascado na dímeruiáo V-C
como uma fcTramenta de projetó para clabsiñeadorex de padrees. Em particular, os experi-
mentos ióram coocebidt^ para testar a relajo entre o desempenho de genenliziifSo de
uma rede neural c q limíte de pifíf COJO. rrtJe^WrÑ/crtft' tfc distrif^ii^áfj derivado pela tcoria
estaiística da aprcncnzagcm de Vapnik. O limite considerado é definido por Vapnik (IOS2)
°U0íI.Ár,J (l)
onde é o erro de generalizadlo, A c a dimcnsao V-C c jYÍ o lamanho do arquivo de
treinamento. Os resultados apresentados por Cohn c Tesauro mosttam que a desempeoro
medio de generalizado í significativamente meltar do que aquele previsto pela Eq. (I).
Segundo, Molden e Niranjan (1995) estenderam o cstudo anterior de Cohn e Tesauro
abordando uma questáo similar. Entretanto, existem tres diferen^as importantes que de-
vem ser destacadas:
• Todos os experimentos foram realizados com redes neurais com resultados exalos
conhccidos ou cun limites muito tans da dimensSo V-C.
• Foram feitas cansidera(óes especificas com relaja au algoritmo de Aprendizagem.
• Os experimentos foram bascados em dados reais.
tiritara os resultados relatados lenham tornee ido prcv i ^ocs sobre a complexidad^ da amostra
muito mais valiosas do ponto de V i sta próliuo do que aquelas íomecidas por teorías mais
antigás, aínda ttá deficiencias significativas na teoría que neoessitam ser superadas.
Tercdro, Baum e Haussler (1989) relataram sobre o tamanho .Vda amostra de tn:ina-
mento ncccssario para (reinar uma rede de camada única al ¡ mentada adíame com neurón i os
de limiar linear, obtendo boa genera. iza?ao. Supoc-sc que os exemplos de treinamento sSo
cscolhidoS de vma distribuido de probabilidade arbitraria c que os exemplos de teste para
avallar o desempenta de generalizado sao também retirados da mesma distribuirse. En-
tao, de acordó com Baum e Haussler, a rede quase scmpnc aprcscntara boa gcncraliza^ao,
desde que sejam saitisfciüis duas cundi^tas:
(1)0 número de crios comeados sobre o conjunto de treinamento ¿ menor que c/2.
{2) O número de exemplos, N, utilizado no treinamento é
( Hr f
jV>Í?| —lúd — 11 (2)
onde FFé o número de pesos sinápticos da rede. A Equa^fln (2) fornece para o tamanho TV
um limite depior cwoi índependente de distribuífíiü. Tauibém aquí pode haverum^ enor-
me diferen^a numérica entre o tamanho real da amostra de rreiriamento necessária e aque-
le calculado pelo limite da Eq. (2).
Finalmente, Bartlcit (1997) ahordou a questáo de que em tarefas de ciassificaQáo de
padrees utilizando redes ncurms grandes, freqüentemente constatamos que uma rede é
capaz de operar com sucesso com exemplos de treinamento que sao significativamente
menores em tamanho que o número de pesos da rede, como relatado por Cohn e Tesauro
(1992), No artigo de Barlett, mostra-se que naquelas tardas cm que redes neurais genera-
lizan! bem e se os pesos s ¡nápi i eos nao forem muito grandes, é o tamanho dos pesos em
vez do número de pesos que determina o desempenta de general i za^ao da rede.
PROBLEMAS
Regras de Aprendizagem
2.1 A regra delta descrita na Eq. (2.5) c a regra de Hcbb descrita na Eq. (2.9) representan! dois
métodos diferentes de aprendizagem. Liste as características que distinguen! estas duas
regras entre si.
2.2 A regra de aprend í zagem por correteo de cito pode ser implementada uti tizaodo-se in ibi-
para subtrair a resposta desejada (valor-aho) da salda, c cntáo aplicando a regra anti-
hebbiana (Mitthison, 1989). Discuta esta interprelaQSo da aprendizagem por correcto de
erro,
2.3 A Figura P23 tnostra um conjunto bidimenstonal de pontos de dados. Parte dos pontos de
dados pertence i classe ’É, e a outra parte pertence j classe Construa a fronteira de
deciñ&j producida pela regra do vizinho mais próximo aplicada a esta amostra de dados.
14 Considere um grupo de pessoas cuja opiniio coleüva sobre um tópico de interesse é Reti-
ñida como a media ponderada das opiniocs individuáis de MUS uiembros. Suponha que se,
no decorrer do tempo, a opiniáo de um membro do grupo tender a concordar com a opi-
niño eoleliva do grupo, a opinido diquele membro ganhará inais peso. Se. por outro lado,
aquel c membro part 11 uLar disoendar de tbrm.i ¿ r i i s i '.lente da opi i niío cold iva do grupo, a
opinifiQ daquele membro rcccbcra um peso menor, Esta forma de pondenacáo é equivalen-
te ao controle uoiti leatinKntBQfio positiva, que produz um consenso de cpiiriio no grupo
(Llnskcr. 198fia).
Di-.cuín a analogía entre a situa^ño descrita e o postulado de Hebb de aprendizagem.
2.5 Uma forma generalizada da regra de Hebb édescrita pda relajo
AwJít) = aFO'JJi)X?(ij(Fr)) -
onde .v(n) c ,r.(nj sao es sinais pné’sináplicü e pós-sináptico. respeelicántenle; /() e <?()
sao1 funfoci de scus résped i vos afúmenlos; e Aw^/n) é a variacñn producida no peso
sináptico no tempo n cm ncsposla aos sinais .Y(n) Encontré (a) o pomo de
equilibrio e (b) a dcprcssáo máxima, que sáo definidas por esta regra.
2.6 Um Sinal de entrada de umplilude unitaria c aplicado rupel idamente a uma coUCXÍO sinápl ica
CUj4 valer inicial é também unitario. Calcóle a vnri¿i^áo nn tempo do pCbO sináptico Utili-
zando as duas regras seguintes:
(a) A forma simples da regra de Hebb descrita na Eq. (2.91 ass-umindú o parimetro de
tana de aprendiz ¡ido F| w 0,1,
(b) A regra da covariancia descrita na Eq. (2.1D}. assunnndo que a ativIdade pré-sináptica
í = 0 e a atividade pós^sinápi ica r = 1.0.
2.7 A .íinapse hebbiana descrita na Eq. (2,9) cnvülvc o uso de retíItmcntaíáo positiva. Justifi-
que a validarle tienta afínna^áo.
2,8 Considere a / pótese da covariancia para a aprendiziigem auto-oigan i/ada descrita na Hq.
(2. W). Assunitndú a ergodicidade (i .e„ medias temporais pndem ser substituidas por medias
de etisemble), mosire que o vakrresperado dedw(i na Eq. (2. lü) pode ser expresan como
ElAWjJ - - V * }
Como vocfi interpretaría este resultado?
2,9 De acordo com Linskcr (198ó), o postulado de Hcbb de aprendizagem pode ser formulado
como:
AwJf-tiO; _rXx-ij + fl.
onde j ir s3ooh tiñáisprt-sinápticoepós^sináptico,respectivamentee o hT[4x.ey. sSo
lodos constantes. Assuma que o neurónio i í linear, como mostrado por
=XW^Tr + “j
onde n, é uma outra constante. Assuma a mesma distribuida o de probabilidade para todos
os sinais de entrada, isto é, E]xJ = £"[x'| p. Suponha que a matriz C represente a matriz de
covariancia dos sitiáis de entrada com o seo y-ésimo elemento definido por
cf = ¿1(1, - - |1J]
Determine
1.10 Formule a expressáo para a saída i do ncurór a j na rede da Fig. 2-4. Vpce pode uti liw as
seguintes representares:
X, = r-csimo sinal de entrada
w.. peso s mápl i co da entrada j para o neurónio j
eÁ. peso da conexáo lateral do neurónio k para o neurónio j
ü campo local induzido do neurónio j
v = <?(».)
Qual é a candido que deve ser satisfcita para que o neurónio j seja o neurónio vencedor?
2.11 Repita o Problema 2-10. assumindo que cada neurón lo de saída i ncLua auto-reíi I miéntatelo.
2.12 O padrflo de conex&o para a inibif 3o lateral, ou scj a "cxcita^ao próxima c üübíflo alta-
da11, pode ser modelado como a difcrenfa entre duas curvas gaussianas. As duas curvas
tcm a mesma árcah mas a curva positiva pira ;i excita^So tcm um pico mais alto e mais
estrello do que a curva negativa para a inibi^ao. Isto í, podemos expresar o padr&) de
conexao coma
onde xí a distancia a partir do neurónio responsável pela in i b i f áo lateral. O padreo JP(.r j c
utilizado para varreruma pagina, sendo que metadedeh é branca e a OUlta metade é prefa;
a fronteira entre as ditas metades é perpendicular ao cixox.
Trate a laida que resulta deste processo de varredura com l c o, = 2.
Paradigmas de Aprendizagem
2.13 A Fig. P2-13 mostra O diagrama cm hincos de um aialema adaptalivo tiv aqui.iifáo de
tingHügem (Goniu 1992). As concxocs s:náplicas na parte da rede neural do sistema sao
fortalecidas ou enfraquecidas, dependendo da reallmenlaQfo relativa á adequa^áo da res*
posta da máquina a estímulos de entrada. Irsle sistema pode üervisLu Como um exemplo de
aprendizagem por reforjo. Rcflita sobre a val ¡dude desta ¿firma$í¡o.
FIGURA P2.13
2.14 A qual dos dois paradigmas aprendizagem com uro professor c aprendizagem sem um
professor, pertence cada din dos segu le i tes algoritmos? Justifique as sius respostas.
(a) rt^ra dts vizinho mais próximo
(t>> regra dos k vizinhos mais próximos
(c) aprendizagem hebbiana
id} regra de aprendizagem de Bol tzmann
2,15 A aprendizagem nito-fiupervisiórtada pode ser implcmcntada em ama forma “cm tempo de
cxccu^o" (onJíne) ou “fóra do tempo de cxccufáo“ (aff'iiné), Discuta as implicat;ócs
físicas desías duas posibilidades.
2.16 Considere £H difículdades que uma máquina de aprendizagem enfrenta un atribuir crédito
para o resollado (ganho, penda ou empale) de um jogo de xadrez, Discuta as noyóes de
atribuirán de crédito temporal e atribuLfiio de crédito estrutural no contexto deste jogo.
2x17 Urna tarefa de aprendizagem supervisionada pode ser vista como uma tarefa de aprendiza-
gem por nfitaQO utilizando como sinal de reforjo urna medida da proxltn idade da resposta
atual do sistema cm relajan a resposLa desrjada. Discuta esta rela^ao entre aprendizagem
supervisionjda e aprendizagem por rcfDT$D,
Memária
2,18 Considere os scgumtes conj untos ortonormais de padrocs^chavc. aplicados á memoria por
matriz de correlajáo:
s,—[1,0.0,0]r
x,-(Ú, 1,0,0f
xj-[0, 0, hD]r
Os respectivos puchóos armazenados sao
y, - [-2, l,ftjr
(a) Calcule a man :/ de memoria M.
(b) Mostré que a memória assoeia perfeiiamente.
2.19 Considere novamente a memória por matriz de correlato do Problema 2J R. O estimulo
aplicado A memória é uma verafo ruidosa do padrio-chave t, como mostrado por
t‘-[0.Rt-0,l51 0,15> -0,2Ü|r
(a) Cakulc a rcsposla da memoria y.
(b) Mostre que a resposía y é a mais próximo do padráo yL no sentido euclidiana.
1.10 Uma memória auto-associativa é tremada com os seguintes vctores-chavc;
la
t] = i[l,-L V&]
(a) Calcule os ángulos entre estes vclorcs. Quáo próximos esláo da situado de
orlagonalidadc cnlre cks?
(b) Utilizando a generalizado da regra de Hcbb(i,e., a negra do produto externo), calcule
a matriz de memória da rede. Investigue o quáo próximo da perfei^áa está a auto-
aasocia^áo da memória.
(c) Uma versáo mascarada do vetor-chave x . isto é„
i-[D-3j3]r
é aplicada á memória. Calcule a resposta da memória e compare o seu resultado com
a resposía desejada I .
Adaptarse
2.21 A Figura P2.21 mostreo diagrama em blocas de um sistema adaptativo. O sinal de entrada
pera o mídete previsor £ definido pelos ralores. pasados de um procera), como mostrado
por
l(B - 1) - Mjt - I), .r(/r - 2),4» -
A saida do modelo, tío), representa uma estimativa do valor presente, x(n), do processo.
O comparador calcula o sinal de erro
-Xrr) - í(n)
que, por sua vez, aplica uma cocregSo aos parímetms ajustareis do modelo- Ele lambón
fomece um sinal de salda para transferencia para o próximo nivel de processamento neural,
para fíns de inlcrpreta^So. Repetí odo esla operario cm uma íonna nivel pornirel, a iníbr-
mac&o proce&sada pelo sistema (ende a ser de qualidade progresslvamente melhar (Mead,
1990).
Prwncha m s delalheü du nivel seguinle de processarnento de sinal bo descrita na Fig-
P2.2I.
Teoría de aprendizagem eetatística
2.22 Segulodo um proeedimento similar áquele descrito na derivaría da Eq. (2.62) a partir de
(2.61), derive a fórmula para a fimofin de méd.ia de enstmble /Hx, T)) definida
naEq. (2-66).
2.23 Nestc problema, desejamos calcular a dimensáo V-C de urna regiflo retangular alinhada
com um dos eixos no plano. Mostré que a dimcnsao V-C destr enneeilo ó quatro. Vocc
pode íazer ísso considerando o seguirte:
(a) Quatm pontos em um plano c uma dicotomía realizada por um retangulo al inhado
cam um cixo.
Sitial de uida
FIGURA P2.21
i h j Quatrc> potitos em udti plano, para os qua i s nao existe uma dicotomía realizavcl por um
rclangulo alinhado a um eíw.
(c) Cinco ponfos cm um plano, para os quais tambúm nao existe uma dicotomía rcalizá-
vi;l por um retinyulo al inhado a um eixo.
1.24 Considere um classitícador linear de padrees binarios cuja vetar de entrada x tcm dimen-
sao ffj. O primeiro elemento do velnr I t constante e fixo em urna unidad?, de Forma que ti
pesa correspondente do clasificador introduz um bias. Qual é a d metisáo V-C do classiti-
elido? cm relajan eio espado de entrada?
2,25 A des: juaklade (2,97) definí u m. |l i ffliie para a laxa de Cilnvergéi)C i a uní forme, que é Risica
para o principio da minimizacio de risco empírico.
(a) Justifique a validade da Eq. (2.9S). assumindo que valha a desiguaIdade (2.97).
(h) DerívC ¿i Fiq. (2,99) qilC define o intervalo de cíenla *
2.26 Continuando com o Excmplo 23, mostre que os qualro pontos uniformemente espadados
da Fie. F2.26 nüo podem ser separados pela tamiliade fundes indicadoras de um parámetro
/{X.tí}. d € R.
2.27 Discuta a relajo entre o dilema bias-variáncia e a minimizado estrutura! de risco nn
Contexto da regressiio niu-lineur.
2,2$ ( ü) Um algoritmo ui i liado pitra ireínar uma rede de múltfpl afi camadas a I .mentada ad i an-
te cujos neurónios utilizam uma tunQáo sigmóide pode ser aprendido por PAC. Justi-
ilque a val¡dade desta afirmaba».
(b) Voce pode Inzer uma afinria^áo si m ¡lar para uma rede neural arbitraria cujos neurónios
utilizam uma fnneao de ativa^an de Iiiniar^' Justifique a sua nesposta.
12 3 4
I---0--0--*--O
x-0
AGURA P2-26
CAPÍTULO 3
Perceptrons de Camada Única
3.1 INTRODUQÁO
Nos ariús fórmativos das redes neurais (l 943-1958)+ virios pesquisidores se sohressafram por suas
conTribuÍQóes pioneiras:
• McCulloch e Pius (1943) por introduzirem a idéia de redes neurais como máquinas
cocnputacionais.
• Hebb (1949) por postular a primetra regra de aprendizagem auto-organizada.
* Roscnblatt (1958} por propor o pcrccptron como o pnmeiro modelo para aprendizagem com
um professor (i.t,. aprendizagem supervisionada),
Ü impacto do artigo de McCulloch-PittS sobre redes neurais foi realzado no Capitulo I. A idéia da
aprendizagem hebbiana foi discutida com alguma extensao no Capítulo 2. Neste capítulo, discuti-
mos o perceptmn de Rosenhlatt.
O pcrccptron c a forma mais simples de uma rede neural usada para a ciassitica^ao de padrees
ditos ibuanwtíeseparáveis (i.e., padrees que se encontram em lados opostos deum hipcrplano).
Básicamente, ele consiste deum único neurónio com pesos sinópticos ajusta veis e bias. O algoritmo
usado para ajustares parámetros livncs dcsta rede neural aparcccu prime i ro cm um procedimento de
aprendizagem desenvolvido por Rosenblatt 1962) para o seu modelo cerebral do perceptrcn.1
De fato. Roscnblatt provou que se os padrees (vclorcs) usados para tremar o pcrccptron sao retira-
dos de duas classes I ¡Reármente separáveis, enláo o algoritmo do perceptron converge e posiciona a
superficie de deciisao na forma de um hiperplano entre as duas classes. A prova de convergéncia do
algoritmo c conhccida como o teorema de convergencia da perceptron. O pcrccptron construido em
tomo de um único tteumnio ó limitado a realizar dasnificatfo de padrdes com apenas duas classes
(hipóteses). Expandíndo a camada do (Computaijao) saida do pcrccptron para incluir mais de um
neurónio, podemos correspondentemente realizar classilicafáo com mais de duas classes. Entretan-
to, as classes devem ser Imearmcntc separaveis para que o pcrccptron funciono adequadamento. O
ponto importante ¿ que. na medida em que consideramos a teoría básica do perccptron como um
clarificador de padrees, ncccss Llamos considerar apenas o caso de um único neurónio. A extensfio
da teoría para o caso de mais de um neurónio é trivial.
O neurónio único também forma a base de um filtro adaptativa, um bloca fuñe i anal que é
básico para o tema do prncexnamento de sinais.. que está scmprc cm expansáo. O desenvolví mentó
da fíltragem adaptad va deve muito ao ciánico artigo de Widrow e Hoff i I 960), por criar o chamado
algoritmo do quadrado medio {LMS, temt-mean-xquare),. também confíen i do como a regra
delta. O algoritmo LMS é simples de implcmentar c no cntanto muito efetivo cm rclaqáo á sua
aplica^áo- Realmente, ele é o carro efíefeda fíltragem adaptativa tincar, linear nc sentido de que o
neurónio opera no seu modo linear. Os filtros adaptad vos tém sido aplicados com sucesso em cam-
pos filo diversos como amenas, sistemas de comunicasáo, sistemas de controle, radar, sonar,
sismología e engenharia biomédica (Widrow c Stearns, 1985; Haykin, 1996),
O algoritmo LMS c o perccptron sao naturalmente inter-rclacicnadüs. Por ¡Sso, éapropríado
que os csludcmos juntos cm um capítulo.
Organizado do Capítulo
O capítulo está organizado em duas panes. A priincita pane, que consiste das Sc^ocs 3,2 a 3.7, trata
dos filtros adaptalivus lineares c do algoritmo LMS. A segunda parte, que consiste das Se^cs 3.8 a
3 JO, trata do pcrceptron de Resentíate. Do ponto de vista de apresenta^o, acharaos mais conveni-
ente discutir primeiro os filtros adaptativas lineares e depois o perceptron de Rosenfílatt, invertendo
a ordem histórica de como surgí ram.
Na Seqáo 3.2, abordamos o problema da fíltragem adaptativa, seguida da Se^ao 3.3, uma
revisto de tres técnicas de otimiza^o irrestrita: o método da descida mais ingreine, o método de
Newton e o método de Gauss-Newton, que sáo particularmente relevantes ao estudo dos fillros
adaptativos. Na Scqáo 3.4, discutimos um filtro linear de mínimos quadrados, que se aproxima de
forma assin[ótica do filtro de Wiener, qnandú o tamañito dos dados aumenta. O filtro de Wiener
torneee uma estrutura ideal para o desempenho de filtros lineares adaptativos operando cm ambien-
tes estBcionáriios. Na Seqáo 3.5, descrevemos o algomtmo LMS, incluirido uma discussáo de suas
virtudes c limitafocs. Na Sc^áo 3.5, exploramos a ideia de curvas de aprendizagem, utilizadas
normalmente para avqliar o desempenho de filtros adapiativcs. Seguc entáo uma discussáo sobre
esquemas de rceozimento (fánnAiíing^) para o algoritmo LMS, na Sccáo 3.7.
A seguir, passando para o perceptron de Ro&enblalt, a Se?3o 3,8 apresenta algumas considcra-
fSes básicas envolvidas na sua opera^áo. Na Sc^ao 3.9, dcscrcvcmos o algoritmo para ajustar □
vetor de pesos sinápticos do pcrccptron para a classificaqáo de classes linearmente separáveis e
demonstramos a convergencia da algorr me. Na 3.11),consideramos a relaQáo entro o percepción
c o clasüificador bayesiano para um ambiente gau.uiano.
O capitulo é concluido com um resuma e uma dtKUMSo final na Sc^ao 3.11.
3.2 O PROBLEMA DA FILTRAGEM ADAPTATIVA
Considero um inferna dinámico cuja caracterizado malemática c descanhecida. ludo do que dis-
paraos sobre o sistema c um conjunto do dados de entrada-saida gerados pelo sistema cm instantes
de lempo diséñelos a uma taxa uniforme. Especiticamente, quando um estímulo m-dimensional x(f)
é aplicada através das m nós de entrada do sistema, o sistema responde produzinde urna salda
Entrada
Salda
JV)
FIGURA 3 J ( h} Sistema dinámi-
co descoiNccidü. (bj Grafo d& lloxo
de sinal do nwdaío adaplativo para
o sistema
escalar<^(0- onde í 1,2,.,., «T... coma representado na Fig. 3. la. Assim, o ccmportamento extemo
do sistema é deserto pelo conjunto de dados
J: {x(0,
(3.1)
onde
xjj)]r
As amostras compreendidas em ÍJ pan idénticamente distribuidas de acardo com uma leí de proba-
bilidade desconhccida. A dimensáo m relativa ao vetar de entrada x(r) é referida como a
dimensionalidade do espado de entrada ou ^mpl estríenle dimensionülidade.
O estímulo Wj pode aparecer em uma de duas formas fundamentalmente diferentes, urna
espacial e a outra temporal:
• Os m elementos de i(í) se originam em diferentes pomos do espado; neste caso, Talamos de
he(í) como um instantáneo de dados.
• Os m elementos de x(j) representara o conjunto do valer presente c dos (m - I) valoras passa-
dos de uma excitado, que sfio uniformemente espadados no tempo.
O problema que abordamos £ o de como projetar um modelo de múltiplas entradas-única salda do
sistema dinámico desconhecídoT construíndo-o em tomo de um único neurónio linear. O modelo
neuronal opera sob a influencia de um algoritmo que controla os ajustes neccSsários dos pesos
sinápticos do neurónio, considerando os seguintes pontos:
• O algoritmo inicia com uma configurando arbitraría para os pesos sináplicos do neurónio.
• Os ajustes dos pesos si nápt i eos, em resposta a varia^des estatlsticas do comportamento do
sistema, sao Jeitos de uma Forma continua (i.fc, o tempo c incorporado na constituicáo do
algoritmo).
* Os cálculos dos ajustes dos pesos si nápticos sáo completados dentro de um intervalo de tempo
que c igual a um periodo de amoEtragem.
O modelo neurona] descrito é conheiido temo um filtm adapiat Iva. Apesar da describan ser apre-
sentada no contexto de urna tarefa claramente reconhecida como de identificaban de sistema* a
caracterizado do Rltro adaptativo é suficientemente genérica para ter ampia api ¡cacao.
A Figura 3.1b apmcnra um grato de íluxo de .a i nal do filtro adaptativo. A sua operacSo consiste de
dois procesaos continuos:
I. ftiK££ft» defitragem, que envolive a computacao de doi.s sinais:
• Uma saida, representada porv(í)P que é producida em nesposta aos m elementos do vetor de
estimulo je(í), isto é. x/í), r/Ov-T
• Um sinal de erro, representado por é obtido comparando-se a saida y(0 com a saida
correspondente d(f) produzida pelo sistema desconhecido. Na verdade, cí(j) age como uma
nrupasta defcfada ou ainai-alvo.
2. Prvcessü adaptativo* que envolve o ajuste automático dos pesos sináplicos do neurónio, de
acorde com o sinal de erro ¿(í).
Assim, a combinado destes dois procesaos amando juntos constituí um laca de reídiinentabíio que
age cm tomo do neurónio.
Como o neurónio ó linear, a saida _iVi c chatamente a mesma que o campo local induzido ®(j);
isto é,
JK
iV) = »!(O = ^^(j}rt(0 (3.2)
i-i
onde W^r),lt\(0 sao os m pesos sinápticos do neurónio, medidos no tempo i. Na forma
matridal podemos expreiMr.HO como um produto interno dos velares x(r) ewfl) como segue:
*V)= x'ÜXO (3.3)
onde
w(r) = [w HJa(rV+ WJOF
Note que a notaeáo para um peso sináptico tbi simpl ifícada aq;n. nUn Liicluindo um índice adicional
para identificar o neurónio, p^is Iidamos com apenas um único neurónio. Fsta notafao será seguida
em Lodo o capitulo. A saida do neurónio v(i) é comparada com a saida correspondente d(i} rebebida
do sistema desconhueido no tempo <. Típicamente^ i^j) é diferente dt ¿Acom isso* esta compara-
do resulta no sinal de erro:
(3.4)
A mancira pela qual o smal de erro <(j) é utadn para controlar os ajustes dos pesos sináptieos do
neurónio é determinada pela fundió decusto utilizada para derivar o algoritmo de filtragem adaptativo
de mlcresse. Esta quesffin está ¡intimamente relacionada com a da utimizacáo. É, portante, apropi-
ado ¿presentar uma revi sao dos métodos irresiritos do otimiza^áo. Este material é aplicável nao
somente aos filtros li meares adaptativos, mas também as redes neurai.s em geral.
3.3 TÉCNICAS DE OTIMIZAQÁO IRRESTRITAS
Considere uma fuñado de custo ^(w) que su a uma fon^áo continuamente diferenciávei de um vetor
de peso (parámetro) doconhccido w. A fun^áo í (w) mapeia os elementos de w em números reais.
Ela é uma medida de como escolher o vetor de peso (parámetro) w de um algoritmo de filtragem
adaptativa de modo que ele se comporte de urna mancira ótiina. Queremos encontrar a solu^áo
ólima w* que satisfaz a condigno
«{»*)< '«(w)
0-5)
Isto é, precisamos resolver um problema irrestrito de ottouzai¡áü, formulado como segue:
Minimiza afumado de custo ^(w) em retando ao vetor de pesos w (5.6)
A condifáo necessária para a otimiza^áo é
W<w*)-0
onde V é o operador gradiente:
(3.7)
¿) ¿
¿íir. 1 ¿nú,1
e V^6(w) é o vetor gradiente da fortQáo de custo:
(3.8)
(3.9)
Urna classe de algor i irnos de oiimizacao irrestritos que c particularmente adequada para o projeto
de filtros adaptativos é baseada na idéia da descida Iterativa local:
Iniciando com uma su/xmi^afi inicia! mpresemuda por w(0), gerg u?jjít seqüéncfa de vetares de
pesa w(I}, w(2)r.demadaqucafuncüúde cusíaí(w)seja redmidúúcadaiterandodo algoritmo,
coma mostrado por
fá(w(jT+l)) <«(»(«)) (3.10)
onde w(rt) <? o valor anligo do vetar de pesa e wín + 1) i a sea valor canalizado.
Esperamos que este algoritmo eventualmente conviija para a solucao ótima w*. Dizemos “espera-
mos” porque há uma nítida possibilidadede o algoritmo divergir (i.e.t se tornar insiávcl) a menos
que sejam tornadas prccaucccs especiáis.
Ncsta scvaob descrecemos tres métodos irrestritos de climiza^áo que se basciam na idéia da
desoída iterativa de uma forma ou de outra (8ertsekast 1995a).
Método da Desoída mais íngreme
No método da desoída mais íngreme. oí ajustes sucesivos aplicados ao vetor de peso w sao na
diredáo da dése ida mais íngreme. isto é, em uma dirc$ao oposta ao vetar da gradiente V¥(w). Por
conveniencia de apre&entefao. escrevemos
K-W(w) (3.1l)
Corrcspondentemente, o algoritmo da desoída mais íngreme é descrito formalmente por
w(n + |) = w(ff) - qg(a) (3.12)
onde T] c uma consume positiva chamada de tamanho da pa.v.w ou parámeiro de tara de uprendíza-
gem¡, e g(/r) é o vetor do gradiente calculado no ponto w(n). Passando da itera^ao n para n + I, o
algoritmo aplica a carreado
Aw(n) = w(h +1) - w(/r)
-W-0 ,5,3)
A Equa^áo (3.13) é na verdade uma describo formal da regra de correQác de erro descrita no
Capítulo 2.
Para mostramos que a fomula?ao do algoritmo da dése ida mais íngreme satisfaz a conditfo
de (3.10) para a desoída iterativa, utilizamos uma expansao cm serie de Taylorde pnmcira ordem
cm Como de w(n) para ápróxirnar - I)) como
< 1}) -¥(w(rt}) + fiWw(rt)
cujo uso é justificado para T] pequeño. Substituirá Eq. (3.13) nesta rclacáo aproximada praduz
í. (w(n + L)) = (w (»)) - Hg' (« )g(")
= ^(w(ft))-r|||g(f0||í
a qual mostra que, para um paramclro de laxa de aprendizagem positivo T), a luncáo de custo decres-
ce quando o algoritmo evolui de uma Uera^o para a próxima. O raciocinio apresentado aquí é
aproximado, pois este resultado final só é verdadeiro para taxas de aprendizagem suficientemente
pequeñas.
O método da dése ida mais íngreme converge lentamente para a solu^ao ótima w*. Além disso,
o parámetro de caxa de aprendizagem p tem uma influencia profunda no seu comportamento quanto
á convergencia:
« Quando q é pequeño, a resposla transitoria do algoritmo é Sahreamortecida, sendo que a
[rajclória Hadada por w(/i) segué um caminho suave no plano ¡V, como i lustrado na Fig. 3.2 a.
• Quando T] c grande, a resposta transitoria do al goritmo é muiutrnt¡rteeidu, sendo que a Irajctória
de w(¿r) seguc um caminho ziguczagucantc (oscilatorio), como ilustrado na Fig. 3.2 b
• Quando r, excede um valor critico, o algoritmo se toma instavcl (i.c.t diverge).
i . i1 _ 1 ! L t b J . -J
|l 1 II 1 I- : \ 1 fe ü'3 L fi=Ü\//^ ft= 1 ff - ?
4.CJ Ü “l (l Jfl 4.Q («) a)
i ! Jr'TrTJÍX I I I J I 1
r l i 1 1 F e e ll F O — ÍN ir - t t K ' 1 1^——
Método de Newtcrn
A idéia básica do método de Nwtfm c minimizar a aproximado quadrática da fundo de custo
fí(w) em torno do ponte córreme w(w); esta nunimizagáo é realizada a cada iterad^ do algoritmo.
Específicamente, usando a expansaü de Taylor de segunda ordent da fundo de cusió cm torno do
ponto «00, podemos escrever
tf(wOO) = $ (»'('»* l»-l(w(n)J
— gr(/i)¿w(N) + —Aw7(.rr)H(n)Aw(n) í$.14)
Como anteriormente, g(fl) é um vetor gradiente m-por-l da fundo de custo ig(w) calculada no
ponto w(rt). A matriz EI(n) é a matriz htnsiana nt-por-M de ^(w). tamben) calculada no ponto w(n).
A hcssrina dc%(w) é definida por
H = VJ£(w)
... 1
— 1 iT!
íhi.yhr. fhlMíhí! - m
y*
r?JÍ‘ ííw. í)w JiC, m x
(3.15)
A Equa^áo (3.15) requer que a fundo de custo ^(w) seja duas vezes continuamente difcrenciável
em relacáo aos elementos de w Diferenciando2 a Eq. (3.14) cm rolado a A", a variac^u Afí{w) é
minimizada quando
g(n) - H(n)AwQr) = 0
Resolver esta equacüo para Aw(n) resulta
Isto ó,
Aw(n)--H -0?te(n)
w(rt + l) = w(rt) i Aw(jt)
= wW-ií'i{'0s('0
(3 16)
onde H-'(n) é a inversa da hessiana de 'tf(w).
Genéricamente la lando, o método de Newton converge tapidamente de modo assintótico e
ndo exibe o comportamcnto ziguczagucantc que algumas veres caracteriza o método da desoída
mais ingreme. Entretanto, para que o método de Ncwton funcione, a hessiana H(n) deve scr uma
matriz definida pw i fívamenié* para lodo ji. Infelizmente, em gura!, nao :iá garantía de que H(w) seja
definida positivamente para toda ¡teracao do algoritmo. Seabessiana Húi) náo é definida positiva-
mente. é necessária uma modificado no método de Ncwton (Powcll, 1987; Bcrtsckas, 1995a),
Método de Gauss-Newton
O método de Gauss-Newton é aplicável a uma fun^ao de cusió que é expressa como a soma de arros
quadradas. Seja
= (3J7)
¿ í=i
onde o fator de escala 1/2 ¿ incluido para simplificar a análise subseqüente. Todos os termos de erro
nesta fórmula sao calculados com base no vetor de peso w que é fixo dentro de todo o intervalo de
observado l á íí n.
O sinal de erro efí) c uma fun^ao do vetor de peso ajustávcl w. Dado um ponto de operaban
w(n), lincanzamos a dependencia de e(t) em relajo a w escrevendo
—— (w-w(n))P
. tfw Jn-KIIT)
( = L2.n
(3.18)
Equivalentemente, utilizando a notado matricial, podemos escrever
e'fff, w) = e(n) + J(«) (w - w(n)}
(3.19)
onde e(jt) é o vetor de erro
eW = k(M).
e J(fl ) c a matriz jacobiana n-por-m de e(n):
de(0 3K1) ÜWj Se(2) jte(D a*(2)
J(n) = dw. dw2 ¿hrm
de(g) defrr) de(ff)
thi)2 " =*< n |
(3.20)
e*(Aw) - e( j ) +
A jacobiana J(/r) é a transposta da matriz de gradiente m-por-w Ve(n)P onde
Ve(n) = [Ve( I), Ve(2).W(«)]
O vetor de peso alual ¡izado w(n + 1) Ó assim definido por
w(fl + l) = argmin
L
0.21)
Usando a Eq. (3.19) para calcular a norma eucltdiana quadrática de c ía, w), oblemos
| t' (^wJll1 = +ír(ff)J(jr)(w - w(íi))
+ l(w - w(jr))r Jr(fl)J(fl)(w - w(rt))
Assim, diferenciando esta expressáo em rela^ao a w c igualando o resultado azeto, abtemos
Jr(w)e(n) + Jr(n)J(rf)(w - w(n)) = 0
Resol vendo esta equa^ao para w, podemos cntáo cscncvcr a partir da Eq. (3.2l)t
w(f? + I) ’ Win) - (3.22)
que dcscrcvc a forma pura do método de Gauss-Nwton.
Diferentemente do mclodo do Ncwton, que requer o conhecimento da matriz hessiana da
fun^ao de cusió ^(fi), o método de Gauss-Newton requer apenas a mafriz.iacobmna do vetor de erro
«00- Entretanto, para que a iterado de Ciausü-Newton seja cotí puta vel, a matriz produto Jr(tt)J(w)
deve ser náosingular.
Com rda^áo a este último ponto, reccnhecemcs que Jr(fl)J(H) é sempre definida nBo negativa-
mente. Para assegurar que ela sqa náo-singular, a jacobiana J(rt) deve ler jéws^j ¿r, em relajo ás
linhas; isto c, as n linhas de J(n) na Eq. (3.20} devem ser lincarmcntc indcpendcntcs. infelizmente,
nao há garantía de que esta cóndilo seja sempre satisfeita. Para nos resguardáronos contra a possi-
bil idade de que J(fí) seja deficiente em posto, a plática habí mal é adicionar a matriz diagonal Si á
matriz Jr(fl ),J(n). O parámetro 6 ó uma constante positiva pequeña escribida para assegurar que
Jr(jT)J(rt) । bl. definida positivamente para lodo n
Bascado nisto^ o método de Gauss-hlcwton c implcmcntado na forma ligci remonte modificada;
w(« ♦ l) - w(/f) -(JWfo + 51) TbiJeOr) (3.23)
O efe i lo desta modificacáo c reduzido progressivamente á medida que o número de itera^oes, w, é
aumentado. Note também que a equa^So recursiva (3.23) éa soluto da fun^ao de cusió modifica-
da:
&|w - w(0)||J + - (3.24)
1 I
onde w(0) ó o valor inicia/ do vetor de peso w(¡).
Estamos agora equipados com as ferramentas de olimiza^áo de que ncccssi tamos para abor-
darmos as quesiocs específicas que en volvere a filtragem adaplaiiva linear,
3.4 FILTRO LINEAR DE MÍNIMOS CUADRADOS
Como o nome implica, umJiürtt limar de mínimos tfum/rados lem duas características distintivas.
Prime]ro. o único neurónio cm lomo do qual c construido é linear, como mostrado no modelo da
Fig. 3.1b. Segundo, a fún0o de custo $(w) usada para projetar o filtro consiste da soma de erros
quadrados, como definido na Eq. (3.17). Bascado nislo, utilizando as Eqs. (3.3) c (3.4)t podemos
capncssar o vetor de cito e(rf) como segue;
e(«) = d(n) -1 i(l), x(2) l(n)]rw(n)
= d(fl)- X(n)w(fí)
*(«)=!
ende d(ff) é O tx’tór da reapaata de.iejada n-por-1:
e X(fl) é a matriz de dados n-por-m:
M2X . sW
Di Per ene jando a Eq. (3.25) em telaraña w(jt), obtemos a matriz do gradiente
Ve(n)--Xr(r;}
Corrcspondcnlcmenle. a jacobiana de «(«) é
J(n)=-X(n) (3.26)
Como a equa^Sc do erra (3.19) já é Linear cm rclacao ao vetor de peso wfw), □ método de Gauss-
Newtpn converge em uma única iterado, como mostrado aquí Substiluindoas Eqs. (3.25) c(3.2ó)
na Eq. (3.22\ oblemos
w(n 11) = w(») + (X’,(»)X{1>))“1 Xr(n)(d(ii)- X(n)w(»))
= (X»X« Xr(»)d(n)
Rcconhcccmos o termo (Xr(ff)X(rt)) X (jf) tomo a pyeudolttverxa da matriz de dados X(jp) como
mostrado em Golub e Van Loan (1996), e Haykin (1996)1 isto ó,
X» (Xr0F)XH)lXT0í) (3.28)
Com isso, podemos rcscrcvcra Eq. (3.27) na forma compacta
w(w + l) = X (n)d(n) (3.29)
Esta fórmula representa um modo conveniente de dizer: LlO vetor de peso w(n +• 1) resol ve o problo
ma linear dos mínimos quadrados definido sobre um intervalo de observado de durado rt,• **
Filtro de Wiener: Forma Limite do Filtro Linear dos Mínimos
Cuadrados para um Ambiente Ergódico
Um caso de particular interesse é quando o vetor de entrada x(¿) c a rcsposla desejada </(rl sao
retirados de una ambiente e^ór/rieoqueé também estacimário. Podemos entfto substituir as medias
de amostras de longo prazo, ou medias tempnrais, por expeciativas ou medias de ensemble (Gray e
Davisson. 1986). Um ambiente assim é parcialmente descrito por cstalísticas de segunda ordem:
• A matriz de correlata do vetor de entrada k( l ela é representada p<?r
* O vetor de wwfaqütj eruzada entre o vetor de entrada x(0 c a rcspcsta desejada rf(i); ele ó
representado por ri,
Estas duas quantidadcs sao definidas, respetivamente, como segue:
R, = éfj¡(í)sr(O|
= litn-¿K(a)ir(0
= lim-Xr(rt)X(rt)
i,-,w n
{3.30)
^ = £IK(M0]
= lim - ¿ x(0¿0)
" *""7T
= lim —Xr(n)d(n)
II—
0-31)
onde £ représenla o operador estaiíslico do valor esperado. ConseqúenieirienLe, podemos reformular
a solu^áo linear dos mínimos quadradusda EqJJ.Z?) como segué:
ivi:, = lim w(n + I)
= 1iin(Xr(n)X(«)) 'Xr(n)d(w)
H—P»
= lim-(Xr{M)X{a)) 1 lim-Xr(w)d(fl)
= «Air
(3-32)
onde Ra: é a inversa da malri?. de correlato O vetor de peso wn é denominado a jctapcfo de
Hfc/rarpara d problema da filtragem linear clima, cm reconhtei mérito ás contribuyes de Nurbert
Wiener para este problema (Widrow c StcamsT 1985; Hay km, 1996). ConsDqilentemente, podemos
fazer a seguirte afírmalo:
Pura umpnxxsxo iT^ódifü, v filtro iiftL'arde mirtim&S qUMlradüS M ¿ipr&xitnu deforma usxirittjtíLa
do filtro i!, Miañar quando O jjJ¡ntFnJde ob.iervafíes xe apíiouma dn mftniKr.
□ projeto do filtro de Wiener requer o conhecimento das estalísticas de segunda ordem: a matriz de
correlafáo Rt do vetor de entrada í(n) c c vetor de oorrclacáo cruzada entre x(tt) e a resposta
desejada rAn). Entretanto^ esta informado ndo está disponivel em muitas situares importantes
encontradas na pratica. Podemos 1 idar com um ambiente dcsconheetdo utilizando um filtru linear
u<fapitiiiv.‘. adaptativo no sentido de o filtro ser capaz de ajustaros seus parámetros bvrcs em res-
pecta a varíSQfcB cslaCíslicas no ambiente, Um algoritmo mui 1o popular para fazer este tipo de
ajuste de forma Limiínua é u algoritmo do miuimo quadrade medio, que está intimamente relaciona-
do com o Til tro de Wiener.
3.5 ALGORITMO DO MÍNIMO CUADRADO MEDIO
O algoritmo do mínimo guadnado medio (LMS) é baseadn na utilizado de valores instantáneos
para a fuuf So de cusía, ou seja,
(3.31)
onde e(rt) é o sinal de erro medido no tempo jv. Diferenciando ré(w) cm rcla^áo ao vetar de peso w,
o bienios
^>-e(„)^!> 0.34)
dw
Como no caso do filtre dos mínimos quadrados, o algoritmo LMS opera com um neurónio linear de
forma que podemos expressar o sinal de erro como
-?(«)- ¿Vi) -x»w(n)
(3-35)
Com isso,
tteQili
dw(n)
5w(n)
Utilizando este último resultado como uma e.flfnurlimj para o vetar do gradiente, podemos escrever
¡H"-x0i)e0i) (3.36)
Finalmente, usando a Eq. (3.36) para o vetar do gradiente na Eq. (3.12) para, o método da dcscida
mais íngreme, podemos formulare algoritmo LMS como segué;
w (n + t) = w(n) + (3.37)
onde T| é □ paramcuo da taxa de aprendizagem. O lapo de real ¡mentado em tomo do vetor de peso
w (fi) no algoritmo LMS se comporta como um jft/ro /wxrrr-bíriras, de ix and o pausaras componen-
tes de baixa fteqiténcia do sinal de erro e atenuando suas componentes de alta freqüencia (Haykin,
1996). A constante de lempo media dcsta acáo de filtragcm c inversamente proporcional ao parámetro
de laxa de aprendizagem q. Conseqüeniemente, atrihuindo-se um valor pequeño a q, o processo
adaptativo progredirá lentamente. Um número maior de dados paseados sera enlác recordado pelo
al&cntmo LMS, resultando em uma a^lo de fillragem mais precisa, Em outras palavras, o inverso
do parámetro da taxa de aprendizagem T| c uma medida da memoria do algoritmo LMS.
Na Eq, (3-37), utilizamos w(n) em lugarde w(it) pare enfatizar o fata de que o algoritmo LMS
preduz uma estimativa do vetor de peso que resultaría da utilizarán do método da desoída mais
íngreme. Conseqüentemente, utilizando o algoritmo LMS sacrificamos uma característica distinti-
va do algoritmo da descida mais íngreme. No algoritmo da dcscida mais ingreme, o vetor de peso
w(tt) segue uma trajetória bem-defínida no espado de pesos para um determinado q. Por outro lado.
no algoritmo LMS o vetor de peso w(n) traca urna trajetória aleatoria. Por essa razao, o algoritmo
LMS é algumas vezes denominado "algoritmo do gradiente estocástico". Conforme o número de
itcrapoes no algoritmo LMS se aproxima do infinito, w(n) real iza uma caminhada aleatoria (movi-
mento browniano) em tomo da solupao de Wiener w O ponto importante o o lato de que, di feren-
tementc do método da dcscida mais íngreme, o algoritmo LMS nao requer o conhecimento das
cstatísticas du ambiente.
Um resumo do algoritmo LMS é aprcscnEado na Tabcla 3.1, que ilustra claramente a simplici*
dade do algoritmo. Como indicado nesta labela, para a iHfcftrtzatfo do algoritmo, normalmente se
Pazo valor do vetor de peso no algoritmo :gual a zero.
TASELA 3.1 Resuma do Algoritmo LMS
Jjflrt.vrrrt cf? Vetor da sinM de entrada = i(fl)
Rcsposla desejada = dVú
Píirfliuftit) sefecíovnidb peto tísuáríb: h
inicia!Supunha que w (0) ~ 0.
CíifnpHia^uc. Pañi n ~ 1.2, :...,tümpuUir
efnf J/ítJ - w
Representado por Grafo de Fluxo de Sinal do Algoritmo LMS
Combinando as Eqs. (3.35) c (3.37), podemos cxprcssar a cvolu^án do vetor de peso no algoritmo
LMS como segue:
w(n +1) = w(«) + t[i(n)p(ft}- Mr(rt)w(n)J
= [1 -qi(n)xr(n)]w(ji)+ ni(n)d(«)
onde I é a matriz identidade. Utilizando o algoritmo LMS, rcconhcccmos que
w(n) + I)]
(3.39)
onde Z 1 é o operador atraso unitário^ implicando armazenamento, Usando as Eqs. (3.38) e (3,39),
podemos cnlao representar o algoritmo LMS pelo grafo de fluxo de sinal representado na Fig. 3.3.
Este grafo de fluxo de sinal revela que o algoritmo LMS é um exemplo de um sistema realimenttHto
cstocásiia). A presenta de realimcnta^áo tcm um impacto profundo no comportamento cm rcla^ao
á convergencia do algoritmo LMS,
Considerat;oes sobre a Convergencia do Algoritmo LMS
Da leuria de controle sabemos que a estábilidade de um sistema neahmentado e determinado pelos
parámetros que con se iluem seu lago derealimcnta(ao. Da Fig. 3.3 vemos que éo la^o de rcalimcn-
tapao inferior que conten? variabilídfide ao comportanicnto do algoritmo I.MS. Em particular, há
duas quantldades distintas, o parámetro da taxa de aprendizagem q e o vetor de entrada x(rf), que
FIGU RA ReprcseniaQáa por gi?.fa
de fluxc. de sinal do alQGritmo LMS
detemiinam a transmi tanda deste ¡390 de realimentafao, Portanto, deduzimos que o comportanjen-
to em relajo á coirvErgcncia (i.e., estábilidade) do algoritmo LMS c influenciado pelas caracterís-
ticas cstatísticas do vetor de entrada x(n) c pelo valor atribuido ao parámetro taxa de aprendizagem
11, Formulando esta observado de uma outra forma, podemos afirmar que para um determinado
ambiente que fomece o vetor de entrada i(njt devemos ter cuidado na sele^áo do parámetro da laxa
de aprendizagem T] para que o algoritmo LMS sc ja convergente.
O primeiro critéric para cctivergéncia do algoritmo LMS é a convergéncia da media* descrita
por
w quando a —> «>
(3,40)
onde w é a solu^ao de Wiener. Infelizmente» este criterio de convergencia c de pouco valor prático»
pois uma seqüéncia de vetores aleatorios de media zero, mas de cutre modo arbitráriaT converge por
este criterio.
Do ponto de vista pratico, a questáo da convergencia que realmente importa é a convergencia
do quadradt) media, descrita por
-> constante quando n —+ >-'
(3.41)
Infelizmente, uma análisc detalhada da convergencia do algoritmo LMS cm relajeo ao quadrado
médio ¿ bastante complicada. Para tomar esta análise matemáticamente tratáveE, sáo feitas normal-
mente as seguí ntes suposifdes:
L Os vetores de entrada sucessivos i( 1 )T x(2X- sáo estilísticamente independentes entre si.
2. No passo de tempo n» o vetor de entrada x(n) c cstatisticamcntc independente de todas as amos-
tras anteriores da resposta desejada, isto é, cflj), ;/(2)>...> JO - I}.
3, No passo de tempo nt a resposta desejada d(n) é dependente de x(n)» mas eslatisticamente
independente de todos os valores anteriores da resposta desejada.
4. D vetor de entrada x{ n) e a resposta desejada ) sao rcti rados de popula^oes com distribuid Oes
gaussianas.
Uma análisc estatística do algoritmo LMS assim fundamentado é denominada a teoría da indepen-
dencia (Widrow et al., 1976),
Invocando os elementos da teoría da independencia e assumindci que o parametro da taxa de
aprendizagem r| seja suficientemente pequeño, í laykin (1996) mostea que n algoritmo LMS é con-
vergente em relajo ao quadrado médiii desde que t] satisfaga a condi^te
0 < p < (3.42)
onde Ari.h]h éo fíiaiürímfovíiíar da matriz de concíacáo Ri. Em aplicares típicas do algoritmo LMS+
contudo,nao é conhceido. Para superar esta diificuIdade. o fungo de Rt pode ser útil izado como
uma estimativa conservadora para a ,i(h e ueste caso a condiQÍo da Eq. (3.42) pode ser reformulada
como
0< ” * (3'43)
onde tr[RJ representa o traqo da matriz Rl. Por definÍQáo, o tra^o de urna matriz quadrada é igual á
soma de seus elementos na diagonal principal. Como cada elemento na diagonal da matriz de corre-
lacñc R c igual ao valor medí.iquadrado da entrada sensoria! correspondente, podemos reformular
a cundido para convergencia do algoritmo LMS pelo quadrado medio como segue:
i
0 < 1) <------------------------------------------------------- (344)
soma dos valores medios quadrados das entradas sensoria i s f
Desde que o parámetro da taxa de aprendizagem satisíaca esta condi^ao, asscgura-sc também a
convergencia do algoritmo LMS pela media, Lalo e, a convergencia pelo qu adrado medio implican
convergencia pela media, mas o contrario n5o é necessar ¡ámenle vertí aduno.
Virtudes e Llmita^óee do Algoritmo LMS
Uma virtude niportaniedoalgorilmo LMS é a sua simplictd&de, como exempi i litado pelo resumo
do algoritmo, apresentado na Tabela 3.1. Além disso, o algoritmo LMS é independente de modelo e
conscqücncemente roAttt/O, o que significa que pequeñas incertezas do modelo c pequeñas pertur-
bantes (i.c., perturbantes com pequeña encrgia) resultam apenas em (xcquenos erres de estimativa
(sinais de erro). Em termos matemáticos precisos, o algoritmo LMS c ótimo de acordo com o
criláña H" (ou wtenímtci) (Hassibi el al., 1993, 1996). A filosofía bási¿ade otinúzalo no sentido de
7C é pro ver subsidios para O cenar io de pior caso’;
Se rrdo xtntber o que ini enfrcttitif, plaitiyí- pura rt pior comí í' tj/intize.
Por muito tempo, o algoritmo LMS foi visto como uma aproximado instantánea pam o algoritmo
da descida do gradiente. Entretanto, a otimiza^áo por ?/' do algoritmo LMS fomeec urna base
rigorosa para este algoritmo largamente utilizado. Particularmente, da explica a sua hábil dado para
funcionar satisfatociamente tanto em um ambiente estacionario como cm um ambiente náo-estaci-
onário. Poruni ambiente "náo-estacionário"entende-se aquele cmqucas cstatísticas variam com o
tempo. Em um ambiente assim, a sotuváo ÓC ina do Wiener assume urna forma vari&vel no tempo, c
o algoritmo LMS tcm agora a tarefa adicional de .ycgríir as varia^óes dos parámetros do filtro de
Wiener.
As Limitantes principáis do algoritmo LMS stea sua taxu de convergencia lenta c a sen sibil E-
dadea variantes naauio-cstruiura da entrada (Haykin. 1996). O algoritmo LMS típicamente requer
um número de üera^óes igual a cerca de 10 vczcs a dimcnsionalidade do espado de entrada para ele
alcanzar uma condiqao de estábilidade. A lenta taxa de convergencia se Loma particularmente séria
quando a dimensionalidade do espado de entrada se toma alta. Assim como em relajo á sensibili-
dade a variaf3es ñas condiqdes do ambiente, o algoritmo LMS c particularmente sensível a varia-
9óes no número condicionante ou intervalo do autovaior da matriz de correlato Rl do vetor de
entrada x. O número condicionante da matriz de currela^So R. representado por XíRs). é definido
como
Z(Rj = T-fc (3,4$)
min
onde X e X sao os autoralores máximo e mínimo da matriz R » respectivamente. A sensibilida-
de do algoritmo LMS a variares no número condicionante x(RJ sé toma particularmente aguda
quando a amostra de treinamento A qual pertence o vetor de entrada x(n) é mol condicionada, isto é,
quando o número condicionante z(RJ é alto - Note que no algoritmo LMS a matriz hessiana,
definida como a derivada segunda da fiinfáo de custo £(w) em relajo a w, é igual á matriz de
correla^ao R,; veja o Problema 3.8. Assim, na discussSo aquí apresentada, poderíamos ter talado
tanto em termos da hessiana como da matriz de coracla^áo R..
3.6 CURVAS DE APRENDIZAGEM
Uma mancira informativa de examinar o comportamento de convergencia do algoritmo LMS, ou de
um filtro adaptativo em geral. é trabar a curva de aprendizagem do filtro sob condi^oes ambientáis
varia veis. A curva de aprendizagem c um gráfico do valor medio quadrado do erro de estimando,
7 em /iíJifao do número de iteracoes. n.
Imagine um experimento envolvendo um ensembtede filtros adaptatívos, com cada filtro ope-
rando sob o controle de um algoritmo especifico. Assumc-sc que os detalhes do algoritmo, indura-
do a inicializa^o, sao os mesmos para todos os filtros. As di ferrabas entre os tritios surgem da
maneira aleatoria pela qual o vetor de entrada r(n) e a resposta desejada ¿f(n) s3o retirados da
amostra de treinamento disponivel. Para cada filtro, trabamos o valor do quadrado do erro de csti-
macáo (i.e., a diferenca entre a resposlñ desejada e a saída real do filtro) em fim$3o do número de
iterares. Uma curva de aprendizagem da amostra assim oblida consiste de exponencia i s ruidosas,
sendo o ruido causado pela natureza inerentemente estocástica do filtro adaptad ve. Para calcular a
curva deaprendizagem media do ensembfe (i e., o gráfico de em fun^ao de n), calculamos a
media destas curvas de aprendizagem das amostras sobre o enscmblc de filtros adaptad vos utiliza-
dos no experimento, suavizando com isso os efeitos do ruido.
Assumindo que o filtro adaptativo seja estávcl, constatamos que a curva de aprendizagem
media do cnsemblc cometa com um valor grande de determinado pelas condicocs iniciáis»
entSo decresce a urna laxa que depende do filtro utilizado e finalmente converge para um valor
estávcl j(“)+ como ilustrado na Fig, 3.4. Com base nesta curva de aprendizagem» podemos defi-
nir a taza de convergéneia do filtro adaptativo como o número de itera^óes n, necessárias para
rediizir V-.. / /f) a um valor escolhido arbitrariamente, tal como LO por cento do valor inicial r4mc,(Ú)r
Urna outra característica útil de um filtro adaptativo que é deduzida da curva de aprendizagem
múdia do cnsemble é ó dcsajustamento, representado por M. Suponha que ¿.represente o erro
medio quadrado mínimo producido pelo filtro de Wiener, projetado com base nos valores conheci-
dos da matriz de correlato Rc e do vetor de oorrela^So cruzada Podemos definir o desajustamento
para o filtro adaptativo como segue (Widrow e Stearns» 19E5; Hay km» 1996):
Número de ikinedcs
Tana de
t(in^r^CTii;¡í
FIGURA 3.4 Curva de aprendizagem idealizada do algoritmo LMS.
^ = -L¿------
i®1 npn
(5.46)
O desaj ustamentr) ,.lt é uma quantidade adimcnsiOrhal, que fomccc uma medida de quáo porto do
étimo está o filtro adaptaíivo, no sencido do erro medio quadrada Quanto menor for comparado
com a unídade, mais precisa será a a^áo de fíltragem adaptativa dn algoritmo. Normalmente, .« é
expresso como uma porccnlagcm. Assim, por cxcmplo, um desaj ustamento de LO por ccnLo signifi-
ca que 0 filtro adaptativo produz um erro medio quadrado (após completar a adaptado) que é 10
por ccnlo maior que o erro medio quadrado mín: me r .produzido pelo filtro de Wiener correspon-
den te. Tal desempenho é normalmente considerado na prática como sarisfatório,
Uma outra característica importante do algoritmo LMS c o tempo dmcfímtida^df}^ Entretanto,
nao há uma definigáo única para o tempo de acomodafáo. Podemos, por cxcmplo, aproximar a
curva de aprendizagem por uma exponencial única com constante </e tempo media i v, e assira usar
". f como urna medida grosseira do tempo de acomoda^áo. Quanto menor for o valor de t . mais
rápido será o tempo de acomadacáo (Le., a algoritmo LMS convergirá mais rápidamente para a
cundido "eslávei”),
O desaj usía mentó U do algoritmo LMS ú, dentro de um bom grau de aproximaban, dirctamcnte
proporcional ao parámetro da laxa de aprendizagem q. enquanlc que a constante de lempo media
: ^ ¿ invcTsamcnlc proporcional ao parámetro da taxa de aprendizagem r| (Widrow c Stearns, 1985;
Haykin, 1996). Conseqüentemente, temos resultados concitantes no sentido deque seo parametro
da taxa de aprendizagem íbr reduzido para reduzir o desajustamenlo, enláu o lempo de acomodaban
do algoríimo LMS é aumentado. De forma inversa, se o parámetro da taxa de aprendizagem fbr
aumentado para acelerare processo de aprendizagem, cntáo o desaj estamento é aumentado. Deve-
se dar multa atengan á cscolha dü parámetro da taxa de aprendizagem Q no projeto do algoritmo
LMS para produzirum desempenho global saLisfalório.
3.7 ESTRATEGIAS DE VARIAQÁO DA TAXA DE APRENDIZAGEM
As dificuldades encontradas com o algoritmo LMS podem ser atribuidas ao fato de o parámetro da
toca de aprendizagem ser mantido constante durante toda a computado, como mostrado por
T](n) = para lodo n {3.47}
Esta é a forma mais simples possível que o parámetro da taza de aprendizagem pode assumir. Por
outro lado, na aprnúmagao estocas tica. que se baseia no artigo ciánico de Robbtns e Monto (1951),
o parámetro da taxa de aprendizagem c variável no tempo. A forma particular de variando temporal
mais comum na literatura sobre aproximarán cstocástica c descrita por
H(n) = - (3,48)
n
onde c e uma constante. Uma escplha assim é realmente suficiente para garantir a convergencia do
algoritmo de aproximarán eatocástica |Ljiing+ 1977; Kushncr c Clark, 197S). Entretanto, quando a
constante c é grande, há o perigo de o parámetro disparar para n pequeño.
Como uma alternativa para as Eqs. (3.47) e podemos utilizar a e.rfnatégw procwia-eHtdo-
eonverget definida por Darken e Moody (1992)
<3-49’
onde T)n ex sáo constantes definidas pelo usuário. Nos estágios iniciáis de adaptado cnvol vendo um
número de iterantes n pequeño comparado com a constade de lempo de busca t, o parámetro da
taxa de aprendizagem q(n) é aproximadamente igual ae o algoritmo opera esencial mente como
uma algoritmo LMS "padrifo”, como indicado na Fig. 15, Assim, escolhendo um valor alto para
dentro do intervalo permitido, esperamos que os pesos ajtistávcis do filtro encontrara e permane^am
em torno de um “bom” conjunto de valones. Entáo, para um número de iterantes o grande compara-
do com a constante de tempo de busca x, o parámetro taxa de aprendizagem T](n) se aproxima de cf
rt, onde c como ilustrado na Fig. 3.5.0 algoritmo opera agora como um algoritmo de apren-
dizagem estocástica tradicional, e os pesos convergen para seus valores ótimos, Assim, a estratégia
de busca-cntáo-cOnvcrge tem o potencial de combinar as características dcsijávcis do algoritmo
LMS padreo com a teoría de aproximado estocástica tradicional.
3.B O PERCEPTRON
Chegamos agora á segunda parte do capitulo que trata do perceptron de Rcsenblatt, daqui cm diante
denominado simplesmente deperceptron. Enquanto que o algoritmo LMS descrito ñas seqdes ante-
riores é construido em tomo de um neurbnio linear, o pcrccptron c construido em tomo de um
neurónio náo-lmear, isla ét o modelo de McCidlock-Pitts de um neurónio. Do Capítulo I lembra-
mos que este modelo de neurónio oonniste de um combinador linear seguido por um limitador
abrupto (realizando a funcáo sinal}T como representado na Fig. 3A O nó aditivo do modelo neurcnal
calcula uma cpmbinaqáo linear das entradas aplicadas as suas sinapses e também incorpora um bias
FIGURA 3.5 Estrategias tjs varia^áa da laxa da aprandiEagam
FIGURA 3.6 Gfflfc da fluxy
dfi sinal do peiceptron
aplicado externamente. A soma resollante. isto é, o campo Iota! induzido, c aplicado ao limitador
abrupto. Corresponden!emente, o neurónio produz uma saída igual a +1 se a entrada do limitador
abrupto for positiva c -1 so cía fer negativa.
No modelo de grafo de ÍIuko de sinal da Fig. 3.6, os pesos sinápticos do percepiron sáo repre-
sentados por wp w, Wm- Correspondcntemcntc, as entradas aplicadas ao perccptron sao represen-
tadas por -V , A'p... a . O bias aplicado externamente ¿ representado por 5. Do modulo constatamos
que a entrada do limitador abrupto ou o campo 1 ocal inducido do neurónio é
h
j = (3.50)
O objetivo do perccptron é clas^ificarcorrctamcntc o conjunto de estímulos aplicados externamente
Jr jrr... cm uma de duas clames í(?| ou £,. A regra de decido paffi a cías»i!iua?ao c atribuir o
ponto representado pelas entradas á dañese ;i saída do pcrccplron v fior+1 c á elasse
se eh for-1.
Para compreender melhor o comportamento de um classificadoc de padróes, norma Imente se
tra^a um mapa das regifies de decido nn espumo de .sinal m-dimensiona¡ abrangido pelas m varíá-
veis de entrada xr x>t... xw, Na forma mais simples do pcrccptron, existen duas rcgiccs separadas
por um hiperptano definido por
!*
£^ + 6 = 0 (3.51)
j-i
Isto está ¡lustrad» na Fig. 3 7 para o case de duas variáveisjL c jt.. para O qual a fronteira de decisMo
toma a forma de urna liriha reta. Um ponto (xr .v, 1 que se encentra acima da linha de frunlcira é
atribuido á classe e um ponto (xr x,) que está abaiv> da Linha de fronteira é atribuido á classe £C,
Note tambora que o efeito do bias h c meramente de destocar a fronteira de dccisao em rela^ao á
origem.
FIGURA 3,7 Irustra^ao do
biperplano (nasbe aa&rnpfra,
urna linhh neta) como framteira
(Je decisáo para um problema
i:$ das$if»ca?áiQ de padrees
bidimensionai de duas classes
Os pesos sinópticos u’1twa4... u1 do pcrceptron |»odem ser adaptados de iterado para itera0o.
Para a adapla^áo podemos utilizar uma regra de corrcqáo de erro conhccida como o algoritmo de
convergencia do pereeplron.
3.9 TEOREMA DE CONVERGÉNCIA DO PERCETRON
Para derivar o algoritmo de aprendizagem por corrcíáo de erro para o pereeptron, achumos mais
conveniente trabalhar com o modelo modificado do grafo de fluxo de sinal da Fig. 3.8. Ncstc segun^
do modelo, que é equivalente áquele da Fig. 3.6, o hias hpí) c tratado como um peso sinóptico
acionado por uma entrada liza igual a -1. Podemos assim del inir o velor de entrada (n; + I )-por-1
• t+t JTa(fl}................-íJ'OF
onde w representa o passo de iterado na aphea^áo du algorilmu. Corrcspondcnlemente, definimos
o vetar de peso (m + I J-poM como
w(m) = WíJfOr
Ehcradj ifl
ti XA
FWURAJ-8 GrfllacieHuM
rtfl cirial equivÉlenlé dó
porcflptífln; por da reja 5
dapandénc a dú terTipO 1u
prnilida
C\imhi-i^ir
linear
0 *rCt'5 Saida
j--------►--------
Limitador
diik’il
E>1 HldiLt -4
Conrapondenlerrienle, a saida do combinador linear pode &er estrila na forma compacta
íJ(«) = Xw.trtJjtX»)
= v ''(fl)x(fl)
(3.52)
onde Wfl(rt) representa o bias h(fl). Para n fixo. a cquaijao w'x = 0. trabada cm um espado rft-
dimcnsional (trabada para um bias prcdcLcminado} com coordenadas .y , ,v„... xm, delire um Ilipcrplano
como a superficie de detisáo entre duas classes diferentes de entradas.
Para o perceptron funcionar adequattarnenie, as duas classes ’í e Íí1 devem ser /reármente
scparáwis. Por sua vez. isto significa que os padrees a serem clarificados devem estar suficiente-
mente separados entre si para assegurar que a superficie de docisáo consista de um hiperplano. Esta
exigencia e ¡lustrada na Fig. 3.9 para o caso de um perceptron b¡ dimensional. Na Fig. 3.9atasduas
classes e *6 están suficientemente separadas entre si para que desenliemos um hiperplano (oeste
caso uma linha reta) como ffonicira de decían. Entretanto, se permúirmos que as duas classes <. e
'í, se aproximem demais.como na Fig. 3.9b, elas se lomam oto I i ncarmente separé veis, uma situ-
a^áo que está alcm da capacidade do pcrccptron.
Froreteini de
decían
Cías» f
Cl£55C<£
CLjssc 1
AGURA 3.9 (a) Um par da padrñes linaarrnenle sapar^veia. (b) Um per de padr&es
náo iinearmenlQ separáveis.
Suponha eni^oqueas. variávtis de entrada do pcrccptron seoriginem de duas classes linearmertte
separáveis. Sen 3E, o suhconiuniode vetar» de trciTiamentc ), qucpcrtcnccm á elasse e
seja Jt;, o subconjuiUo de veletes de treinamento 1^1). x/2),... que pcrtcnccm á elasse A uniáo de SC
! e é o conjunto de ircinamento completo SE. Dados os conjuntos de vetores 9? e SE, para (reinare
classiftcador, o proccsso de tre namcntci envolve o ajuste do vetor de peso w de tal forma que as duus
classcs c % scjam lincarmcntc separarais. Isto ¿\ existe um vetor de peso w para o qual podemos
afirmar
wTx > 0 para todo vetor de entrada x pertencente a classe
wrx í 0 para todo vetor de entrada x pcrtcnecntc á elasse Ms,
(3.53)
Na segunda linha da Eq. (3,53), escolhemos arbitrariamente que o vetor de entrada i pertence á
clasae <6, se wri = 0. Dados os suhconj untos. de vetores de treinamenio ,. e o problema de
treinamento para n perccptron elementar c, cntáo. encontrar um vetar de peso w tal que as duas
desigualdades da Eq. (3.53) sejam satisfeilas.
U algoritmo para adaptar o vetor de peso do perccptron elementar pode agora scr formulado
como segué;
I. Se o H-ésimo membro do conjunto de treinamento, x(¿r), c cornetamente classillcado pelo vetar
de peso w(n) calculado na /r-ésima iterado dü algoritmo, entila o vetor de peso do perceptron
náo é corrí gldo de acordo com a regra:
w(fl +1) se wri(ji) > 0 e je(n) pertence á elasse^,
w(n +1) = w(r) se wri{n) < 0 e je(m) pertence á classcr€. (3.54)
2. Caso contrario, o vetor de peso do perccptron c alual izado de acorde com a regra
w(n + i) = w(rt) - r|(j¡Ji(n) se Wr (/r)x(«J > 0 e x (n) pertence á elasse ,
(3.5 5)
w(n + I) = w(n) + T](n)x(ji) se w (n)?í(n) < 0 e x (n) pertence á elasse céL
onde o parámetro da ¿oro t/e aprendizagem H|0i) cnuirnla o ajuste aplicado ao vetor de peso na
iterado n.
Se T](s) - T| > 0. onde i] é uma constante independen te do número da ilcra^ao «, temos urna regra de
adaptando com irtctvrnenlo fizo para O percepirürt-
No que segué, primeiro provamos a convergencia de uma regra de adaptarán com incremento
fixo para a qual T| = 1. Claramente, o valor de t] nSo é importante, desde que seja positivo. Um valor
deT| * 1 meramente escala os velones de padrees sera afetar a sua sepa rabil idade. O caso de um r|(¿r)
varió vd será considerado mais tarde.
A prava é apresentada para a condi cao inicial w{0) * Ú. Suponha que wr(n)x(tt) < 0 para n=1,
2...., e que o vetor de entrada x(w) pórtenla ao subcon-unto 3 . Isto é, o perceptron classiiica
incorrctamente os vetores x(lX ’t^),..., jó que a segunda condifóo da Eq (3 J3) é violada. Entóo,
com a constante Ttfn) = L podemos usar a segunda linha da Eq. (3.55) para cscrcvcr
+• l) = i*(n) x(n) para sOr) pertencente á elasse (3.56)
Dada a condipao inicial w(0) = 0, podemos resolver iterativamente esta cquapao para w(n + I)
oblendo o resultado
w(n + l) = x( I) + x(2) + x(n)
(3.57)
Hidden page
M* + 1 IIP - II w(t)||2 < ||x(ó)||2t k = 1, ... n (3.64)
Samando oslas desigualdades para k = 1ji, c invocando a condifáo inicial assumida w(0) “ 0,
obternt» a seguirte desigualdades
|w<n * 1J|; < ¿IWtJ2
S (1.65)
< Jlp
onde P é um número positiva definido por
0= mas ||x(*)||2 (3,66)
ifJS 1CJ |
A Equa^au (3.65) afirma que o a norma euclidiana quadrátiea do vetor de peso w(h + 1) cresce no
máximo lineannente com o numero de iteratfjes ff.
O segundo resultado da Eq. (3.65) está claramente cm conflito com o resultado anterior da Eq.
(3.61) para valores suficientemente grandes de m De Tato, podemos afirmar que n náo pode ser
maior que um valor para o qual as Eqs. (3.61) c (3.65) sao ambas satisfeitas com o sinal de
igualdade. Isto é, é a soluto da equafáo
= h fl
|| |J
FJ
Resolviendo para dada uma solu^áo Wfl, obtemos que
Provamcs assim que para rtffl) 1 para toda r, e w(C) = 0, e desde que exista um vetar soluto wúT
a regia para adaptar os pesos sinópticos do perúeptroii deve terminar após no máximo n .ix iteraqdes.
Note também das Eqs (3.58), (3.66) e (3.67) que nüü existe uma soluto única para wa ou
Podemos agora formular o teorema da convergencia com incremento Jixo para o pcrccptron
como segue (Rosenblatu 1962):
Scjam os subcmijunrttt de vetores de treinamento T(e íí 3 linearmenle separáveis. Suponha que as
entrados apresentadas ao pcrccptron se oí i<iLnem destes defis subconjuntos. O pcrccptron converge
apis % Significando que
W(J1Ü) - W(nn I|)" w(nD < 2) •
é uma solucio para .
Considere a seguir o prucedimento absoluto de correado de erro para a adaptado de um
perceptron de camada única, para o qual r|(n) é varíavd Em particular, suponha que q(jr) scja o
menor inteiro para o qual
n(/T)xr{n)x(n) > |wr(ff)x(n)|
Hidden page
Note que o vetor de entrada x(n) é um vetor (m + 1 )-púr-1 cujo primeiro elemento é fixo em +I
durante todos os cálculos. Correspondentemento» o vetor de peso w(n) é um vetor (m + l)-por-1
cujo primeiro elemento é igual ao bias b(n). Um outro ponto importante na Tabeia 3.2 é' inlroduzi-
mos & resposta desejada quantizada d(jr), definida por
+1 se x(n) pertence ú dasse ’<,
-I $c x(/t) pertence á elasse
(3.70)
Assim, a adaptado do vetor de peso w(a) pode ser resumida adequadamente na forma da rcgra de
aprendizagem por correado de erro'.
wfn + 1) = w(«) + nm (3.71)
onde t| é o parámetro da taxa de aprendizagem e a diferenfa d(n) — y(n) assumc o papel de um
sinai de erro. O parámetro da taxa de aprendizagem é uma constante positiva restrita ao intervalo 0
< r) < 1. Ao atribuir um valor dentro des le intervalo, devemos considerar dois requisitos confitantes
(Lippmann, 19R7):
* Obtenido da media das entradas passadas para f&mecer estimativas estáveis para o peso, o
que requer um Y] pequeño
• Adaptando rápida em retaco a varia^fles reais das distribuidos relacionadas ao procesan
responsável pela geranio do vetor de entrada x, o que requer um T| grande
3.10 RELAQÁO ENTRE O PERCEPTRON E O CLASSIFICADOR BAYESIANO
PARA UM AMBIENTE GAUSSIANO
O perceptron mantém uma certa relajo com o clasificador de padrees clássico condecido como o
classificador bayesiano. Quando o ambiente é gaussiano, o classificador bayesiano se reduz a um
elassificadar linear. Esta éa mesma forma assumida pelo pcnceptron. Entretanto» a natureza linear
do perceptron nao depende da suposiqáo que as distribu i coes sejam gau$<¡iana$. Nesta seqáo, eslu-
damos esta rclacao c desse modo desenvolvemos uma visáo mais apro fundada da operado do
perceptron. Iniciamos a discuss^o com uma breve revi sao do classificador bayesiano
Classificador Bayesiano
No classificador bayesiano ouprtteedimento de texlepela hipótese de Sayes, minimizamos o risco
medio, representado por Para um problema de duas elasses, representado pelas elasses SÉ e
o risco médio ó definido por Van Trees (1968):
(3.72}
onde os vários termos sáo definidos como segue:
/j = pmbabiiidade a piiori que o vetor de observado x {representando uma realiza-
do do vetoraleatório X) seja relindo de subespa^o 8f., com Z“ 1,2 e p, +
l.
r = cusió de decidir em la ver da elasse (éíP representada pelo subespa^o \ quando
a elasse <S for verdadeira (i.e.T o vetor de observado x é retirado do subespa^o
si ), com(t ;) 1, 2.
/^{x|'€ ) = l’jnpáo de densidade de probabilidade condicional do vetor aleatorio X, dado
que o vetor de observado x seja retirado do subespa^o 9C, com /“ h 2.
Os prime i ros deis termos do lado direito da F.q. (3-72) representan decisdes ooríWaj (i.e., classi-
ffca^oes co rectas), enguanto que os últimos dais lomos representan! dccisdes ittconniltis (i.e,t
dessificafóes i acometas). Cada decisáo c ponderada pelo produto de deis fatores: o custo envol-
vido na tomada de decisao c a frequcncia relativa (i.e.T probabilidade u priori) com a qual ela
ocorrc.
A intenso é determinar uma estrategia para o riten media mínimo. Como exigimos que uma
decisao deva ser tomada, cada vetor de observacao x deve ser atribuido no espado de observado
global St, ou a 3C, ou a Assim,
(3.73)
Correspondentemente, podemos rescrever a Eq. (3.72) na forma equivalente
J '. J । i.
+c'2iA JldífQífc + qjp,
J r-e
(374)
onde cH < c2| c t'„ < r.Observamos agora o lato de que
fK (xffipdx = I
J ।
(3.75)
Assim, a Eq. (3.74) se reduz a
= CjiP, + Cnft
+J [a (C|I - C22 )14 (*1^ )“ Pi (Cjl - Cii),^ (x|(É , )ífx
(3.76)
Os primeiros dois termos no lado direito da Eq. (3.7b) representan! um cusió fixo. Coma o objetivo
o minimizaría risco médioR, podemos portante, deduzir da Eq. (1.76) a seguinte estratógia para a
c I assi fica^ao óti ma:
1. Iodos es valores do vetor de observado x para os quaix o integrando (i.e., a expressá(> dentro
dos cólcheles) é negativo devem ser atribuido* ao subespa^o 3t1 (ix„ a classe . j para que a
integral de uma contribuido negativa ao risüO 3t.
2. lodos os valores do vetor de observado x para os quais o integrando é positivo devem ser
excluidos do sube&papn f (i.e. atribuidos a classe para que a integral de uma contribuí pao
positiva ao risco 31.
3, Os valores de x para os quaís o integrando for ?.ero nao tem efeilo sobre o risco medio J? e
podem ser atribuidos arbitrariamente. A ssum iremos que estes pontos scráo atribuidos ao
subespa^o , (i.e., á classe
A partir desta fundamentado, podemos formulare classificador hay estaño como segué:
& a candicáo
PSciI - r. x(* > * A11 “ cnVk<“ í
/¡W trfrr&riir O irJAT x/f x dü .T N-C.. ¿ Tí J. Cíesí) tíwi/FVjrd'fl.
aJr¿^ÉZ Ifl T, f¿e.. ¡’i ¿Yoí.tí 7 ./
Para simplificar 0 desenvolví mentes defina
A(I) = 0”)
e
A quanudade A(x), a razfo de duas fun?oes de densidade de probabilidade condicional, é chamada
de razaa de verossimiíhan^a. A quantidade £, ó chamada de lindar do teste. Note que ambos A(x) c
t, sáo sempre positivos. Lm termos desias duas quantidades. podemos agora re formular o clarifica-
dor bayesiano afirmando:
Se. para um velar de observadla x. a ftS&O de verütir«í{h(¡nt;i¡ >\(\} [nr matar que O fimiar
atribtííi x á dasse Caso contrario. atribua x a dasse
A Figura 3.10a mostra uma representaqao cm diagrama cm blocos do classificador bayesiano. Os
dois pontos importantes ueste diagrama em blocos sio:
1. O processamento de dados envolvido no projeto do classificador bayesiano está nestrito inteira-
meóte á compulacáo da razao de vcrossinjlhanca A(x).
2. E sla computado c totalmente i nvariante aos va lores atribuidos ás probabi lidadcs a prian c aos
cusios envolvidos no processo de tomada de decisáo. Estas quanpdades afetam meramente o
valor do 1 imiar
Do ponto de vista computacional, é muís conveniente se trabalhar con) o logaritmo da razdü de
verossimilhanfa em vez da própria razao de vtressimilhanca. Isto c permitido por duas razñes.
Pi imc:rat o logaritmo c uma funcao monótona. Segundo, a nz3o de verossimilhan^d A(x) c o limiar
c. sáo ambos positivos. Conscqiientemente. o classificador bayesiano pode ser implementado na
forma equivalente mostrada na Fig. 3.1 Ob. Por raztes obvias, o leste: ncorporado resta úh ima figu-
ra c chamada de teste do log da mzda de verosisifíidflatida.
ÁlribuLk x á ctaMc^l
se A{x) > £
CíiíZh l-mi iribú,
acriba x i c-Ijííc^.
Alnhu;i; X ú ¿fase 'ftl
K Lí'E A(üi > lofv
CáHü-cürtEI-il-rfi,
aliibua x á rlassí 41.
(b)
FIGURA 3JD Duas implamfirthac&es éCfuivalerbles do dlassilicador bayesiarw:
{a) leste da razáo da vergssimilhfln^ (WTflsls do log da razáo de
v*rMs.¡rnilhani;a
Classificador Bayesiano para uma Distribuidas Gaussiana
Considere agora o caso especial de um problema de duas dasses, para o qual a distribuirás sub| aconto
é gaussiana. O vetor aleatorio X tem um valor medio que depende de se ele pertence á classe f€, ou
á elasse<¡É,, mas a matriz de covariancia de X c a mesma para ambas as elasses. Isso o equivalente a
se dizer:
Classe'^: £[X|-ji.
fRX-im-ll/l-C
Classe^: £[X) = |1,
£[(X-njtX-gJ3- C
A matriz de covariánc i a C é nao-diagonal , o que signi fica que as amostras retiradas das classes .
e^-', s5o carretaci^nadeu. Assuzne-se que C seja náo-singulan para que exista a sua inversa C_|.
Com esta rundamenta^áo, podemos expressar a fun^áo de densidade de probabilidade condi-
ciona] de X como segue:
A(I|C^j)=------FT--------FTcrpÍ- Pr)rC"'(> ” K )1 J “
/K 1 J (del{C)) J ^2 7
(3-79)
onde m é a dimensionalidade do vetor de observado x.
Assume-se ainda que
1. As duas elasses e sfo eqQipiwáveis:
I
/> = r: = i
(3.80)
2, Classilica^ñes mcorrctas acarrciam o mesmo cusió e classifica^oes carretas nSo incorretn em
cusios:
t'ji" t'ij e tu ca 0 {3.81}
Temos agora a mfbnna^áo necessária para pro-elar um classificador bayesiano para o problema de
duas classes. Específicamente, subsiituindo a Eq. (3.79) em (3.77) c efetuando o logaritmo natural,
oblemos (após simplificadles):
logA(x) = -i(x-|il)!FC (i-fkj + ifx-mfc-(a-gj) 1, x <3 j32) =(Pi - mj'c-i+- iíc-x)
Substituido as Eqs. (3.80) e (3.81) na Eq. (3.78) c cfctuajido o logaritmo natural, oblemos
kjg^ = o (3.83)
As Equadxs (3.82) e (3.83) expressam que o clarificador bayesiano para o problema especificado
é um dassificador linear, como descrito pela rela^ao
onde y = wri + Z> (3.84) y = logA(x) (3^85) w = C’di,-pj) (3 87)
Mais específicamente, o classificador consiste de um combinador linear com vetor de peso w e bias
b, como mostrado na Fig. 3.11.
FIGURA 3.11 Grafo de iluxp fifi
sinal do classllieadaf gausslano
Com base na Eq. (3.84), podemos agora descrever o leste do Log da razio de verossimilhaufa para
o nosso problema de duas classes, como segue:
Se a saida > da eombinadar fincar (¡ncluintfo a bias b) fbr positiva, alribua o velar de observafdú
I ¿¡ dasse Caso contrario. atribua este vetor ¿i ciasse '-ff
A operadlo do classificador bayesiano para o ambiente gaussiano descrito aquí é análoga
aqueta do pcrccplron, na medida em que ambos sito classifícadores lineares; veja as Eqs. (3.71) c
(3.84). Entretanto, existem algumas diferenca* SUtis e importantes entre eles, que devem ser exami-
nadas cuidadosamente (Lippmann, 1987):
• O perccptron opera sob a premi ssa de que os padrdes a ser clasificados sejam linearmente
¿eparáveís. As distribuidles gaussianas dos dais padrees assumidas na dcnvapá.o do classili-
cador bayesiano ccrtamcnto se superpoem c, portante, sio Jrüo-separávcis. A extensá-o da
supu-rpositae é determinada pelos velares medios p( e g,, e pela matriz de covariancia C. A
natureza desta superposi^áo está ilustrada na Fig, 3.12 para o caso especial de uma variávcl
aleatoria escalar (i.e., dimensional idade jw = 1). Quando as entradas s3c náo-scparávuis e as
suas distribuicocs se superpoem como ilustrado, o algoritmo de convergencia do perceptron
aprésenla um problema porque as fronteiras dedecisio entre as ch ferenies elasses podem osci-
lar continuamente.
• O el assifi cador bayesiano m । n । m i /a a probabi I idade de erro de class i fica^áo. Esta m i n i m iza^áo
é independente da superposi^áo entre as distribuidles galicianas relativas as duas classes. No
caso especial ilustrado na Fie. 3.12. por excwplo, o classificador bayesiano somprc posiciona
a fronte! ra de de<: । sáo no ponto onde as disti ¡ bu tfdes gau ssianas para as d uas dasses e , se
cruzam.
AGURA 3.12 Duas distribulcófifi
gaussianas unicJimensionais
E-uperpostas
• O algoritmo de convergencia do perceptron é nño-puiíttfíétríco, significando que ele nao faz
suposicocs a nespeito da forma das dislrjbuicbes envolvidas. Ele opera concentrando-se nos
erros que ocorran onde ás disttibui^oes se superpoem. Pode, portante, funcionar bem quando
as entradas Ibrem geradas por mecanismos físicos nao-lineares e quando as suas distribuidles
forcm muito inclinadas c náo-gaussianas. O chssi ricador bayesiano, ao contrario, cpfji-nméirico\
a sua derivado ó dependente da suposicao que as distribuifñe$ envolvidas sejam galicianas, o
que pode limitara sua área de aplicagSo.
• O algoritmo de convergencia do perccptron c adaptativo e simples de implementar; a sua
exigencia de armazenamentn é restritB ao conjunto de pesos sinápticos cbias. Por outro lado,
o projeto do classificador bayesiano é fixo; pode ser feito adaptativo» mas á custa do aumento
das exigencias de armazenaracnto c de cálculos mais complexos.
3.11 RESUMO E DISCUSSAO
O perceptron e um filtro adaptativo utilizando o algoritmo LMS sáo naturalmente ínter-relaciona’
dos» como evidenciado pela atualizaqáa de seus pesos. Na verdade, representar» diferentes
impletnentacAes de um perreptrvn de camada única bascado em aprendizagem por corneado de
erro. O termo “camada única" é usado aquí para significar que em ambos os casos a camada
computadora] consiste de um único neurónio - daí o titulo do capitulo. Entretanto, o perceptron e
o algoritmo LMS dtferem entre si em alguns aspectos fundamentáis;
• O algoritmo LMS utiliza um neurónio Imear, enquanto que o perceptron usa o modelo formal
deum neurónio de McCull&ch'Pitts.
• O processo de aprendizagem no perceptron c realizado para um número finito de itcrapocs e
entáo é encerrado. No algoritmo LMS, ao contrario, ocorre aprendizagem continua, signifi-
cando que a aprendizagem acontece enquanto o processamento do sinal está sendo realizado,
de uma forma que nunca acaba.
Um limitador abrupto constituí o elemento nao-li reardo neurónio de McCulloch-Pilis, É tentador
se colocar a questio: o perceptron feria melhordesempenho se ele utilizaste uma rufo-linearidade
sígmóide em vez do limitador abrupto? Ocorrc que as características de regime permanente de
tomada de dccis&c, de estado estávcl do perceptron sáo básicamente as mesmas, nao importando se
utilizamos um limitador abrupto ou um limitador suave como fonte de náo-lmearidade no modelo
neural (Shynk, i990; Shynk e Bcrshad, 1991}. Podemos^ portanto, afirmar formalmente que, desde
que nos limitemos ao modelo de um neurónio que consista de um combinador linear seguido de um
elemento nao-linear, enlao, independent emente da formada nao-lincaridadc útil izada, um perceptron
de camada única pode realizar classificafflo de padróes apenas sobre padróes I i reármente separá-
veiü.
Encerramos esta discussao sobre perceptrons de camada única com uma nota histórica. O
perceptron e o algoritmo LMS surgíram aproximadamente ao mesmo tempo, durante o final dos
anos 1950.0 algoritmo LMS realmente sobreviven an teste do tempo. Na verdade, ele se estabele-
ceu como o carro-chefe do processamento adaptarivo de sinal devido ll sua simplicidade de
impl ementarlo e á sua efetividade cm api i calóes. A importancia do perceptron de Rosen b latt é
principalmente histórica.
A primeira chuca real ao perceptron de Roscnblact foi apresentada por Minsky c Sellridge
(1961), Minsky e Selfridge mostraram que o perceptron como definido por Rosenblatt náo pedería
generalizar ncm cm rcla^áo ¿ nocáo de paridade, muito menos fazer abstra^óes genéricas. As limi-
ta^óes computaciioníiis do perceptron de Roscnblatt foram subseqüentemente enquadradas em urna
fundamentado matemática sólida no famoso livro, Perccplrons, de Minsky e Papen (1969, 1988).
Após a aprcscnlfifáo de uma análíse matemática brilhantc c bem-detalhada do perceptron, Minsky
e Papen provaram que o perceptron como definido por Rosenblalt é inerentemente incapaz de íazer
algumas gencralizacoes globais baseadas em exemplos aprendidos localmente- No último capitulo
do seu livroT Minsky e PapeTt fazem a conjectura de que as limitafoes que dcscobriram para o
perceptron de Rosenblalt também scriam válidas para suas variantes, mais específicamente, as re-
des neurais de múltiplas camadas. Extramdc da Se^áo 13.2 do seu livro (1969):
O perceptron mostrou-se merecedor de cstudo apesar de (c mesmo por causa del) suas severas
limita^ocs. Ele tem muitas caracterisricas que alraerti a ateiigáo: sua lineandade; seu teorema de
aprendizagem intrigante; sua clara MmpX idadc paradigmál^a como uma forma de compulsan
paralela. N3o há raz3o para se supar que qualquer uma dcssas virtudes persista na versan de mullí-
pías camadas. Apenar diuo, cotuidcniniM que é um importante problema a ser pesquisado para
elucidar (ou reje i lar) nosso julgamento intuitiro de que a sua exlcrisáo para mí temas de múltiplas
camadas c estéril.
Esta concluso foi largamente responsávd por lanzar serias dúvidas sobre as capacidades
cnmputacninais nao apenas do perceptron mas das redes neurais cm gcral ate meados dos anos í>0.
Entretanto, a histeria mostruu que a conjuelura feita por Minsky e Papert parece ser injustificada,
pois lemas agora varias formas avanzadas de redes neurais que sao mais poderosas, do ponto de
vista computaciuna]h que o pcrccplion de Roscnblatt Por exemplo, os peraeptrons de múltiplas
camadas, tremados com o algoritmo de retropropaga^o discutido na Capitulo 4, as redes de fun^o
de base radial discutidas no Capitulo 5 c as máquinas de velar de suporte discutidas no Capítulo 6,
superan as limítameles computacionais do perceptron de camada única, cada um á sua mancira
individual.
NOTAS E REFERENCIAS
L A orgam/afao ilc rede na versáo original do perceptron como considerada por Rosenblltt
(1962) tcm irés tipos de unidades; unidades sensoriais, unidades associativas e unidades
de resposta. As conexfies das unidades sensorial s para as unidades assoeiativas tÉm pesos
fixoí, c as ecmcxács das unidades as&ocialivas para as unidades de resposta tcm pesos
varia veis. As unidades asociativas aluam como pré-processadores projetados para exltair
um padrao da entrada do ambiente. No que 4ÍZ respeito aos pcw$ v^riaveis, 3 operarán do
perceptron de Rosenblatt original é «scnciatmenlc a mesma que aqueta para o caso de
urna única un idade de resposta (i.e.. ún i ¿ir neurónio).
2. Diícrcncia^in «m itIj^üo a um vefOF
Suponlta que/(TV) represente uma fun^ita de valor Tea] do vetar de parámetros w. A deriva-
da de fivt)rm rda^ao a w é definida pelo velar;
y _ di jf_____________
dw Su1! ’ Su1. ’
onde rtr é a dírnensio do vetar w. Os dois casos seguinies sáü de mltresse especial;
CASO 1 A ñinc3o./(w} é definida pelo produto ¡memo:
/(★)= tr*
=
1-1
Assim,
— =a,. j = l,X-^ifi
thítr
outta forma matricial equivalente:
w
(l)
CASO 2 A funeao /"(w) c definida pela forma quadrática:
Hidden page
1 > l ,
ondc tJ2, r c r sao constantes.
1 I J
3.2 Considere a fun^áo de rusto
¿ííw) = -a: -r’.w + -w'R.w
2 2
onde n3 é urna constante c
r,
R.-
_ "0,SIR2
í=[ (1,354
] 0,8182”
asi 82 I
{a} Encentro o valar óiitíw w* para D Qual'í (Wi alcanza o sen valor mínimo.
(b) Use o método da dcscida mais íngreme para calcular w* para os dois valores seguin-
res de parámetro de taxa de aprendizagem:
li) n=o,3
(11} n - lo
Para cada caso, dcscntic a trajetória trabada pela cvoluijáo do valor de peso wpj} no plano
W.
Nota: as trajetórias obtidas para os casos _ i) e l ii i da parte (b) deveni corresponder ás
imjgens, ^presentadas rm Fig. 3.2.
3.3 Considere i funijáü de costo da Eq. (3.24) que representa uma forma modificada da soma
de erras quadrátieos. definida na Eq. (3.17). Musiré que :i aplica^áo do método de Gauss-
l^cwton á j-i: (3.24) produz a alualiza^áo de peso descrita na Eq. (3.23).
Algoritmo LMS
3.4 A matriz de conela^Ao Ri de vetor de entrada k(m) no algoritmo- LMS é defienda por
Defina o intervalo de valones para o parámetro tasa de aprendizagem q do algoritmo l.MS
para que seja convergente pelo qu&drado médio.
3.5 O aigariímo LMS ntirmateutto é descrito pela seguinte recursáo para o vetor de peso:
w(i| + i) = w(fi)4 n
II» M
onde r] é uina constante po.HÍtiva e | M^Jil é a norma euclidiana di? velor de entrada i(m), O
tmal de em? £{n) é definido jwir
e(fl) - d(/r)- wJ (h)x(a)
onde íf(rt} é a resposta desejada. Para que o algoritmo LMS normal izado seja convergente
pelo quadrada medio, mostré q UC
0 < F|< 2
J .6 O algoritmo LMS é usado para mplcmcntar o canceladcr de lóbulo lateral mostrado na
Fig. 2.16. Estabeleca as equa^ies que define m a operario destc sistema, assumindo a
utilizado de um único neurónio para a rede neural.
3.7 Considere um previsor linear com seu vetar de entrada constituido das amostras i(n - 1),
jt(n - 2) x{n - ai), onde mea ordem da previsto. O objetivo é utilizar o algoritmo LMS
para fazer urna predi^to i í/i} da amostra de entrada xl>). Estabclc?a as rcCuraóes que
podem ser usadas pera calcular o peso derivativo w|h w^.. to„do previsor.
3.8 A contrapartida etn termos de média de ensemble para a soma de erro* quadrálicos vista
como uma funi^to de Gusto é O valor mérito quadrado do ¡.mal de erro:
J(w)-y£(e:(n}]
{a) Assurnindo que o vetar de entrada x(n) c a resposta desejada sejam retirados de
um ambiente esiacionário, mostré que
“ Twn + tw^w
xi X
onde
(ti) Para esta funqtode cuito, mostré que o vetor gradiente e a matnz hessiana de J(w) sto
expresaos como segué, respectivamente;
g = -ru+Rl*
H = R.
(t) No úigúritma LMSWewtan, o vetor gradiente £ é substituido pelo seu valar instantá-
neo (Widrow e Stearns, 1986}. Mostré que este algoritmo, incorporando um parámetro
de taxa de aprendizagem TJ, é descrito por
W<H + I) = W<«) + T]Rjl(H)(íí(ffl) -1'
A inversa da matriz de corrclafáo Ra, assumida como sendo definida positivamente, é
calculada ú frente no tempo.
3.9 Ncste problema, revisitamos a memoria por matriz de concia?30 discutida na 3e?to 2.11.
Uma deficiencia desta memoria é que quando um padrao-cliavc nf í apresentado a ela, a
resposta real y produzida pela memúria pode uto ser próxima o suficiente (no sentido
ruclidiano) da resposía dt?$ejad^ (padrao memorizado) y, para que a memoria Msocie per-
feitamente. Esta deficiencia é inerente ao uso da aprendizagem hebbiana, que nto possui
realimenta^to da saida para a entrada. Como sulufáú para esta deíici&ncia, podemos in-
corporar um mecanismo de conecto de erm nu prujeto da memória, foreando-a a associar
adequadamente (Anderson, 1983).
Suponha que M(jt) represente a matriz de memoria aprendida na itera?to rt do pnv
cesso de aprendizagem por correcto de erro. A matriz de memória M(n) aprende a iníor-
ma?to representada pelas associa0ea:
x, -> yb, A = 1.2......q
(a} Adaptando o ulgoriimo LMS pata este problema. m<witrie que ti votar a&mtiudo da
nutriz de memória e den rudo por
M(n + l) = M(it)+ ilfjj -M(h)k4})e^
onde TJ í ti parámetro da kix;i de aprefldizjgein.
Ib} Fara au(o-as»ocía<3o. y, - \ Para este cuoespecial, mesue qoc quando o número
de urra^óes, ir. k aproa jin¡i do infinito, n memória iiuto-asHOcia perfen ámenle, como
mostrado par
M(“) 1^-^, k = L 2.....q
(ci O resultado mostrado na parte (b> pode ser visto como um/JJriMewj rfe UMfrwa¿v.
Neste contexto, representa um auiovalor de M(wj. Quais sáo os atitovalores de
Mi-)0
3.10 Neste problema. Investí gamos o efeito do bias sobre o número cond ¡clonante de u ma ma-
triz de coítcIíkjüo c ccinscqiicrUcmcntc KbR o desempenht] dt> algoritmo LMS.
Considere um vetor aleatório X com a matriz de covariancia
t o vetor media
(«} Calcule o número condicionante da matriz de covariancia C.
i b i Calcule o numero condicionante da matriz de Lürrelix,a*j R.
Comente o efeito do bifes p sobre o desempenho do algoritmo LMS.
0 Perceptron de Rosen blatt
3.11 Neste problema, consideramos um outro método para derivar a equa^u de iCutlizafSp
para o perceptron de Roscnblaft- Defina aJiwpúd do critéri&tfoprnxptnm (Duda c Hart.
197?):
Aí*>= E
f- lí“
isniltí !?(¿oLunjunlo-ik-amostrastlassifiLiiidattinLhHTtljmeTil-r pelacswlhado vcEorde
peso w. NoEe que J lwj u definida cníDO zerci :héJ nfio huuver AftMMtTM CiUfciñCA&U
incorretamenic. e a siflda é dosificada iiicDnetamenlE se -í 0_
(m h Demoutn gccmcCircainentcque J.(w)é propone i< mal i soma dudutíDcuaeodidiinK
entre as amostras claísitkadas iiiéorretauietite e a fnníeira de deciskh
ib} DelerminE d pr^dienle de J -íw) cm leLs^ño Jo vetor de ptW w.
(c) LJ han do orcsultüLln <-h:ido na parte (b|, mostré qucaftfuAÜZ&pSodos pQÜfi do ptiCcptim
e:
*(«» 1}= w(rt) 4-nW X *
ilí !' IIF
onde SEO(fl)) ¿oconjunto das amostras classificadas incorretamente pelo uso do vetor de
peso W(n), e T|(n) éo pSiirtiClnj da taxa de Spcendizágem. Mostrt qut: ujile resultado, para
o caso de uma correoso para amostra única, c básicamente o mesmo que agüete descrito
pelas Eqs. (3.54) e (3.55).
3.12 Verifique que as Eqs. (3.68) - (3.71), que rcsurncm o algoritmo de convergencia do
perceptron, sáo consistentes com as Eqs. (3.54) e (3.55).
3,13 Considere duas clas&es unidimensionaís, com distribuidles gaussiaius r&( e r(. que tíre
uma variáncia comum igual a I. Os seus valones médios sño
H, = -10
n, =+ 10
Estas duas dasses sto esencialmente líricamente separáveis. Projete um clarificador
que separe estas duas classes.
3.14 Suponha que no grifo de fluxo de sinal do percepción mostrado na Fig. 3.6 o limitador
abrupto seja substituido pela náo-linearidade sigmóide:
<p(r) - lanh^}
onde v é o campo local Musido. As dccisftcs de classifíca^So íeitas pelo perccptron sSo
definidas como segué;
O vetor de observando x pertence a ciasse :r se a saída y > 6 onde 6 é um AMv?
curo conlrária, I pertence á ciaste *í£_
Mostré que a fronteiia de decisio assim construida é um h^perplano.
3,15 (a) O perceptron pode ser usado para realizar numerosas fun^des lógicas. Demonstre a
implementa^áo das fuñí oes lógic as binarias E, OU e COMPLEMENTO.
(ti) Unta limitado básica do perceptron é que ele nao pode iinplementar a futido OU
EXCLUSIVO. Esplique a razáo pam ela limitacáo.
3.16 As Equa^Ses (3.86) e (3.^7) definem o vetor de peso e o bias do classificador bayesiano
para um ambiente gaussiano. Determine a eomposiffo dcste classificadorpara o caso em
que a matriz de covariancia C é definida por
C-<fI
onde u2 v uma constante.
cu
Hidden page
CAPÍTULO 4
Perceptrons de Múltiplas Camadas
4.1 INTRODUCTO
Ncstc capitulo, cstudamOx as redes de múltiplas camadas a] i meneadas adi ante, uma importante elas-
se de redes neurais. Típicamente, a rede consiste de um conjunto de unidades sensorial (nós de
fonte) que constituem a camada defíiírada, uma ou mais camadas ocultas de nós computacionais
e uma camada desoída de nós ccmputacLonais. O sinal de entrada se propaga para frente através da
rede, camada por camada. Estas redes neurais s3o normalmente chamadas de perceptrons de múlti-
plas camadas (MLP, multilayer perceptron), as quaís representara uma generalizado do perceptron
de camada única considerado no Capitulo 3.
Os perceptrons de múltiplas camadas tém sido aplicados com sucesso para resolver diversos
problemas di ficéis, através do seu treinamento de forma supervisi imada com um algoritmo muito
popular conhccido como algoritmo de retmpropagacáo de erro (error back-propagation). Este
algoritmo é bascado na regra de aprendiíagem por correada de erro, Como tal, pode ser visto como
uma gen eral izac&o de um algoritmo de filtra geni adaptativa igualmente popular: o on ¡presente
algoritmo do mínimo quadrado médio (LMS) descrito no Capitulo 3 para o caso especial de um
único neurónio linear.
Básicamente, a aprendizagem por rctropropagado de erro consiste de dois pasaos atravós das
diferentes camadas da rede: um passo para frente, a propagando, e um passo para tras, a
retmpmpagacao, No passo para frente, um padreo de atividade (velor de entrada) c aplicado aos
nós sensoriais da rede e seu efeito se propaga através da rede, camada por camada. Finalmente, um
conjunto de saldas é producido como a resposta real da rede. Durante o passo de propagado, os
pesos sinópticos da rede s£o todos/tav, Durante o passo para tras, por outro lado, os pesos sinópticos
sao todos ajustados de acorde com uma regra de corrc^ao de erro. Especifica mente, a re&posta real
da rede é subtraída de uma resposta desejada (alvo) para produzir um sinaf de erro. Este sinal de
erro é entilo propagado para irás através da rede, contra a direí 3o das conexóes sinópticas - vindo
dai o nome de “retropropagafao de eno" (error back-propagatian), Os pesos sinópticos sáo ajusta-
dos para fazcr com que a resposta real da rede se mova para mais perto da resposta desejada, cm um
sentido estatifico, O algoritmo de retropropagatf o de erro é fambém referido na literatura como
algoritmo de r^tropropaga^áo (back-pr&pagatiori). 0 processo de aprendizagem realizado com o
algoritmo ó chamado de aprendisagem pur retTvprupaga$ito.
Um perceptron de múltiplas camadas tem trÉs características distintivas:
1. O modelo de cada neurónio da rede incluí urna fuñado de ativa^ao nao-linear. O ponto impor-
tante a se enfatizar aquí é que a náo-linearidade ó jumw(i.e.* diferenclável em qualquer ponto),
ao contrario da Limitado abrupta utilizada no perceptron de Rosenblatt. Urna forma normal'
mente mi liizada de nlo-hitearidade que satisfaz esta cxigéncuii c uma nao-Iinearidadg slgmáide'
definida pcla/imfJo logística.
I
7 l+opf-uj
onde ico campo local induzido ( i .e., a soma ponderada de todas as entradas sinópticas acres-
cidas cío bias) do neurónioj. ey é a salda do neurónio. A presenta de nio-linearidBdes é impor-
tante porque, do contrario, a relamió de enlrada-saEda da rede pedería ser reduzida íiquela de um
perceptron de camada única. Além diSSO, a utilizando dú fúnffo logística tem motivarse bioló-
gica* pois procura levar em conta a fase refratária de neurónios reais.
2. A rede contérn uma ou mais camadas de neurunios acuitas* que nao sao parte da entrada ou da
saida da rede. Estes neurónios ocultos capacitan) a rede a aprender tarefas complexas exiraindo
progressiKámente as características mais significativas dos padróes (vetores) de entrada
3. A rede exibe um alto grao de cunectividade^ determinado pelas sinlpscs da rede. Uma modríi-
caí^o na conectividade da rede requer uma mudanza na populado das conexóes sinópticas ou
de scus pesos.
1 através da combinado destas características, juntamente com a hahdidade de aprender da expe-
riencia atraves de treinamento* que o perceptron de múltiplas camadas deriva seu poder
computantonal. Estas mesmas características, entretanto, sto lambém responsáveis pelas deficien-
cias no estado atual de nosso conhceimcnto sobre o comportamcnto da rede. Primero* a presenta
de uma forma distribuida de nJo-l i nearidade e a alta conectividade da redetornam difícil a análise
teórica de um perceptron de múltiplas camadas. Segundo, a utilizado de neurónios ocultos torna o
processo de aprendizagem mais difícil de ser visualizado. Em um sentido implícito* o processo de
aprendizagem deve decidir quais características do padrao de entrada devem ser representadas pe-
los neurónios ocultos. O processo de aprendizagem, conseqüenlemenle* torna-sc mais dificil por-
que a busca deve ser conduzida cm um espaco muito maior de fun^óes possiveisT c deve ser feita
urna escolha entre representares alternativas do padreo de entrada (Hinton, 1989).
O emprego do termo ^rctropropaga^áo" (back-pmpagatian) parece ter sido desenvolvido após
i 985, quando seu uso foi popularizado pela publicado do livro seminal, intitulado Pamllei
DairilMed Processing^ (Rumclhart c McClelland, 1986). Veja a Se^3o 1.9 sobre notas históricas
acerca do algoritmo de reinypropagafdo.
O desenvolv ¡mentó do algoritmo de retrapropaga^o representa um marco ñas redes neurais,
pois fomece um método computacianai eficiente para o treinamento de perceptrons de múltiplas
camadas. Apcsar de nao podemos afirmar que o algoritmn de retrapropagafSo feme^a uma solu-
cao ótima para todos os problemas resol□ veis, ele acabou com o pessimismo sobre a aprendizagem
cm máquinas de múltiplas camadas que ttavia sido causado pelo livro de Minsky e Papen (1969).
Organizabas do Capítulo
Nesle capitulo^ estudamcs os aspectos básicos do perceptron de múltiplas camadas, bem como a
aprendizagem por retropropaga^áo. O capitulo está organizado em sel? partes. Na primetra parte,
ahrangendo as Se^oes de 4.2 a 4 6, discutimos assuntos relacionados á aprendizagem por
rclropropaga^áo. Cometamos com algumas tons idcrafBtfl prclirr-inarcs na Sc^áo 4,2 para preparar
o caminho para a derivafáo do algoritmo de retropropaga?áo Na Se?ác 4.3. ^presentamos uma
derivado detalhada do algoritmo , útil izando a regra da cadeia do cálculo; seguimos uma aborda-
gem tradicional na deriva^io aquí apresentada. Uin resumo do algoritmo de retropropagaqáo í
apresentado na Sc^áo 4.4. Na Sc^áo 4.5, ilustramos o uso do algoritmo de rctroprcpagafáo resol-
vendo o problema do XOR, um problema interessAnlc que nSo pode ser resolví do por um perccptron
de camada única. Na Se^áo 4.0, apreveníamos algumas regias pláticas ou heurísticas para fazer com
que o algoritmo de retropropaga^áo lenha melhor desempenho,
A segunda parte, ahrangendo as Sebees de 4.7 a 4.9, explora o uso de perceptron? de múltiplas
camadas para O rcconhecimenlc de padrdes. Na Se^áu 4.7, abordamos o desenvoh imento de uma
regra para a utilizado de um perceptron de múltiplas camadas para resolver o problema estatíslico
de reconhecimentó depadróes. Na Serian 4.8, utilizamos um experimento computacional para ilus-
trar a aplicaqao da aprendizagem per rclnopropuga^áo pata distinguir entre duas elasses de distri-
buí fíes gaussianas, bullí mensionats superponías. Na Se^áo 4.9, é discutido o papel importante dos
rculorjos ocultos.
A terceira parte do capitulo, abrangendo a? Se^óes de 4.10 a 4.12, trata da superficie de erro.
Na Sc^áo 4,10, discutimos o papel fundamental da aprendizagem por retropropagaqao no cálculo
das derivadas paresis de uma fun(áo aproximada. Discutimos cntáo, na Sc^áo 4.1 I, questftes
computa? ionais relativa? a matriz hessiana da superficie de erro.
A quarta parte do capitulo trata de vários assunlos relacionados com o desempenho de um
perccptron de múltiplas camadas [reinado com o algoritmo de rctropropaga^ao. Na Se^áo 4.12,
discutimos a questáo da general i za^áo, a csscn<ia fundamental da aprendizagem. A Scfáo 4.13
discute a aproMtnafáo de fundes continuas por meio de perceptrons de múltiplas camadas. O uso
de validado cruzada como uma fcrramcnta cstatística de projeto é discutido na Se^áo 4.14. Na
Sccao 4.15, dcscrcvemos procctLimenlos para “podar” ordenadamente um perccptron de múltiplas
camadas, maniendo (e freqüentemente melhorando) o desempenho global. A poda de redes é dese-
jável quando a complexidad? compuiacicmal é a preocupado fundamental.
A quinta parte do capítulo completa o cstudo da aprendizagem por rctropropaga^áo. Na Sefáo
4.16, resumimos as importantes vantagens e limitares da aprendizagem por reiropropagafao. Na
Sc^ao 4.17, investigamos heurísticas que fomeccm normas sobre como acelerar a taxa de conver-
gencia da aprendizagem por retropropaga^áo.
Na sexta parte do capitulo, seguíinos. um ponto de vista diferente sobre h aprendizagem.
Tendo como objetivo a melhoriada aprendizagem. discutimos aquesto da aprendizagem super-
visionada como um problema de otimiza^áo numérica na Se^áo 4.18. F’m particular, dcscrevc-
mos o algoritmo do gradiente conjugado e o método quase-Newton pára a aprendizagem supervi-
5íi muda.
A última parte do capítulo, a Secan 4.19, trata do perceptron de múltiplas camadas propia-
mente dito. Lá. descrevemos uma estrutura interessante de rede ncurah o perceptmn de múltiplas
camadas de c&nvahtQÁa. Esta rede tcm s;do usada com sucesso na soIn^io de problemas diRceis de
reconheci mentó de padróes.
O capitulo concluí oom uma discussác gcral na Sc^ao 4.20.
4,2 ALGUNAS CONSIDERALES PRELIMINARES
A Figura 4.1 tncstra o grato arquitetura! de um perceptron de múltiplas camadas com duas camadas
ocultas e uma camada se saida. Para preparar o terreno para uma describan do pcrccptron de múlti -
pías camadas na sua forma geral, a rede aquí mostrada é fatalmente enneciada. Isto significa que
um neurónio ern qualquer carnada da rede está conectado a todos os nós/ncuronios. da camada
anterior. O fluxo de sinal atreves da rede progride pare frente., da esquerda para a direita c decantada
cm camada.
Fl G U RA 4,1 g ralo arquiielural de um percepinon [fe múltiplas camadas com duas camadas ocultas
A Fig. 4.2 representa uma por^ao do pcrccptron de múltiplas camadas. Dou tipos de sinais súo
identificados nesta rede (Parker, 19B7):
—'--► Si nais ruiKzinnaiK
*-----Simis de erro
FIGURA 4.2 Elustra^áo tías dita^Ses de dais
IluXOS. tfe Sinal básicas am um perceptron efe
múltiplas camadas: a propagado para fwitá
da S¡03)S tlrncionais & a rSt/Oprúpagaijáo de
sinais ds erro
1. Sitiáis Funefdnaís. Um sinal funcional c um smal de entrada (estímulo) que incide no terminal
de entrada da redeh propaga-se para frente (nuurunió por neurónio) através da rede e emerge no
terminal de saida da rede como um sinal de saida. Rcfcrimo-nos a este sinal como um ^sinal
funcional” por duas razóes. Prime i nx presume-se que ele realizo uma funfáu útil na saida da
rede. Segundo, em cada neurónio da rede através do qual um sinal funcional passa, o sinal e
calculado como uma Punteo de suas entradas c pesos associgdos, aplicados áquele neurónio.
O sinal funcional é também denominado sinal de entrada.
2. Sinais de Erro. Um sinal de cito se origina cm um neurónio de salda da rodo c se propaga para
tras (camada por camada) através da rede. Referí mo-nos a ele como um “sinal de erro" porque
sua computado por cada neurónio da rede envolve uma fun0o dependente do erro, de utna
forma ou de outra.
Os neurónios de salda (nós computacionais) consiituem a camada de saída da rede. Os neurónios
restantes (nós computacionais) constituem as camadas ocultas da rede. Assim, as unidades ocultas
nao sao parte da saída ou da entrada da rede — daí a sua designado como “ocultas". A prime ira
camada oculta é alimentada pela camada de entrada, constituida de unidades sensoriais (nós de
fonte); as saldas resultantes da pnmeira camada oculta s&o por sua vez aplicadas á próxima camada
oculta; e assim por diante para o resto da rede.
Cada neurónio oculto ou de salda de um perceptron de múltiplas camadas é projeiado para realizar
dois cálculos:
1. O cálculo do sinal funcional que aparece na saída de um neurónio* que c expresso como uma
turneo náo-linear do sinal de entrada e dos pesos sinápticos as sociados com aquele neurónio.
2, O cálculo de uma estimativa do vetor gradiente (i.e., os gradientes da superficie de erro em
relapso aos pesos conectados as entradas de um neurónio), que é ncccssáric para a retropropaga^áo
atreves da rede.
A derivacáo do algoritmo de retropropagafáo c bastante envolvente. Para aliviara carga matemática
envolvida na sua derivado, primeiro apresentamos um resumo das notajes utilizadas na deriva-
^áo.
Notado
* Os Indices i, j e k se referem a neurónios diferentes na rede; com os sinais se propagando
airavés da rede da esquerda para a direita, o neurónio j se encontra em uma camada á direita do
neurónio r, e o neurónio k se encontra cm uma camada á direita do neurónio /, quando o
neurónio j i uma unidade oculta.
• Na itera^ao (passo de tempo) n, o n-ésimo padrao de treinamento (exemplo) é apreseniado á
rede.
• O símbolo ¥(n) se refere á soma instantánea dos ortos quadrátioos ou energía do erro na
ilcracáo n. A média de ‘Sfn) sobretodos os valores den (i.e., o conjunto inteiro detreinamento)
produz a energía media do erro media
• O símbolo c (jv) se refere ao sinal de erro na saída do neurónio j, para a iterado n.
♦ O símbolo dt.H) se refere á resposta desejada para o neurónio j e é usada para calcular ept).
• O símbolo ^(rf) se refere ao sinal funcional que aparece na saída do neurónio/* na íteraQao n.
• O símbolo w.pr) representa o peso sinóptico conectando a salda do neurónio i á entrada do
neurónio j, na iterado n. A oorre^áo aplicada a este peso na iterapao n c representada por
• O campo local induzido (i.e., a soma ponderada de todas as entradas sinápricas acrescida do
bias) do neurónio/ na iteracao n é representado por t'fn); constituí o sinal aplicado á fun^áo de
ativa^áo associada com o neurónioj.
• A fun^áo de ativa^áo* que descreve a relajo funcional de entrada-salda da náo-Iíncaridadc
associada ao neurónio jt é representada por q>(-).
• O bias aplicado ao neurónio j c representado por 6; o seu efeito é representado por uma
sinapse de peso w?dl = b. conectada a uma entrada Asta igual a +1.
• O í-ésime elemento do vetor (padrao) de entrada é representado por xfri).
* O A-csimo elemento de vetor (padráo) de saida global c representado por oXn).
* O parámetro da taxa de aprendizagem é representado por T|.
• O símbolo representa o tamanho (íjCl, ° número de nós) da camada / do perceptron de
múltiplas camadas; i = 0, I,. .... £, onde £ é a "pnofund idade1' da rede. Assim, oi0 representa o
tamanho da camada de entrada, m, representa o tamanho da pnmeira camada oculta e fri.
representa o tamanho da camada de saida. A notado - M também c usada.
4,3 ALGORITMO DE RETRO PRORAS A£ÁO
O sinal de erro na saida do neurónio j, na iterado n (Le., a ¿presentará# do n-ésimo exemplo de
treinamento), ó definido por
<?(n) - dfn)-y(n}, o neur&nic J é um no de saida (4.1)
Definimos o valor instantáneo da energía do erro para o neurónio/ como j ^(n).
Corrcspcndcntcmcnte, o valor instantáneo ^(fl) da energía total do erro éobtido samándose
os termes f c (w) de todos oa neurónios da camada de saida; sáó OS únicos neurónios **vi.síveis”
para os quais os sinais de erro podem ser calculados dirctamcntc. Podemos assim escrever
(4.2)
* MC
onde o conjunto C incluí todos os neurónios da camada de saida da rede. Considere que j¥represen-
te o número total de padrees (exemplos) comidos no conjunto de treinamento. A energía média do
em quadrudo é obtlda somando-se os ^E(n) para todos os c cnlao normalizando cm rela^au ao
tamanho do conjunto A, como mostrado por
A energía instantánea do erroíft(tt), e conscqiientemcnte a energía média do erro c uma tunca#
de todos os parámetros livres (i.e., pesos sinópticos e nivels de biu) da rede. Para um dado conjunto
de treinamento, % representa a junado de cusía como uma medida do descmpentio de aprendiza-
gem. O obietivc do processo de aprendizagem é ajustar os parámetros livres da rede para minimizar
V Para fazer esta minimiza^ao, utilizamos uma aproximadlo similar em raciocinio áqucla usada
para a derivado do algoritmo LMS no Capítulo 3. Específicamente, consideramos um método
simples de treinamento no qual OS pesos SóO atualizados de padrao em padrao ¿té formar uma
época, isto c, uma apresentacao completa do conjunto de treinamento inteiro que está sendo proces-
sado. Os ajustes dos pesos slo realizados de accrdo com os respectivos erras calculados para cada
padrao ¿presentado á rede. A media aritmética destas alterares Individuáis de peso sobre o conjun-
to de treinamento é, perianto, uma estimativa da alterado real que resultaría da modificaba# dos
pesos bascada na minimizafáo da firncáo de cuito sobre o conjunto de treinamento inteiro.
Abordaremos a quabdade desta estimativa posteriormente nesta seqao.
Considere cntáo a Fig. 4.3, que représenla o neurónio j sendo alimentado por um conjunto de
sinais funcionáis produzidos por uma camada de neurónios á sua esquerda- O campo local induzido
v (n) produzido na entrada da furifáo do ativa^áo associada ao neurónio j é perianto
Ncurünki j
V,(n)= Ew/WftOO
i = n
(4,4)
onde m é o número total de entradas (excluindo o bias) aplicadas ao neurónio/ O peso sináptico w.,,
(correspondiendo a entrada fíxajp, = +1) é igual ao bias /i aplicado ao neurónio/. Assim, o sinal
funcional que aparece na salda do neurónio./ na iterado n é
y/") = ’P/V/'O)
(4-5)
De uma forma similar ao algoritmo LMS, o algoritmo de reiropropagafJo aplica uma conejo
AWjjOr) ao peso sináptico u’./r), que é proporcional á derivada parcial De acorde
com a mgra da cadmía do calculo, podemos expressar este gradiente como:
cfé(jt) _ dft(w) ¿teja) fy(ff) dtt/rt)
du^(fl) Se/») 3y;(n) ¿b;(n) ^(n)
(4.6)
A derivada parcial d^f^ydw tn) representa um faiorde sensibilidades determinando a dirrgáo de
busca no espado de pesos, para o peso sináptico w^,.
Diferenciando ambos os lados da Eq. (4.2) cm rcla?ao a obtemos
= e/rt)
cte/rt)
(4.7)
Diferenciando ambos os lados da Eq. (4.1) em rela^áo a i i n), oblemos
(tyte)
(4.8)
A seguirT diferenciando a Eq. (4.5) em rela^ao a rte), oblemos
fyte)
d»/n)
fjte/n))
(4.9)
onde o uso do apostrofe (no lado dimito) significa a diícrencisfáo em relapso ao argumento. Final*
mente, diferenciara Eq, (4 4) cm relajan a Wjj(n) produz
fyte)
^.(fl)
r.te)
(4.10)
O uso das F.qs. de (4.7) a (4.10) cm (4.6) ptüduK
•OOM'O
(4.11)
A corrc^áo áto^F?) aplicada a w (i) é definida pela negra dclfá,
d%(jr)
d'UP^j^Jr)
(4.12)
onde T) é o panirttetm da laxa de opiendizagem do algoritmo de retropropagafáo. O uso do sinal
negativo na Eq. (4.12) indica a descida do podiente no espado de pesos (i.c.T busca uma dire^ao
para a mudanza de peso que reduza o valor de '£(n)). Coiruspondentememe, o uso da Eq. (4.11) em
(4.12) produz
(4.13)
onde o gradiente local 8 (a) é definido por
s- , , ^í(rt)
dr.(fl)
¿fa(tf) ¿te, te) di, te)
de:(ít) ¿te.te) ¿h-'.te)
-Cj tejóte,(")}
(4.14)
D gradiente Local aponía para as modificares necessárms nos pesos sinápticos. De acordo com a
Eq+ (4.14)t o gradiente local &(n} para o neurónio de saída j c igual ao produlo do sinal de erro tf.te)
currcspondente para aquele neurónio peta derivada <p 7 te)) da lüncáo de ativacáo associada.
Das Eqs. (4.13) c (4.14) notamos que um fatoi'chavc envolvido no cálculo do ajuste de peso
A tí.'.(n) é o sinal de erro e i n) na saída de neurónio j. Ncslo contexto, podemos identificar dois casos
A?t1,1(tt) = ’]
distintos, dcpcndcndo de onde na rede o neurónio j está localizado. No caso o neurónio/ é um nó
de saida. Este caso é simples de se tratar, porque cada nó de saida da rede é suprido com uma
resposta de&ejada particular, fazendo com que o cálculo do sinal de erro assocíado seta direto. No
caso 2, o neurónio/éum nó oculto. Apesar de os neurónios ocultos nao serem aocssívcis dirctamcntc,
cíes compartilham a responsabilidad^ por qualqucr erro cometido na saida da rede. A questáo,
entretanto, é saber conno penalizar ou recompensar os neurónios ocultos pela sua parcela de respon-
sabilidade. Este problema e o problema de atribuida de crédito considerado na Sc^ác 2.7. Ele é
rcsolvido de forma elegante retropropagando-se os sinais de erro através da rede.
Caso 1 O Neurónio j é um Nó de Saida
Quando o neurónio j está localizado na camada de saida da rede, ele é suprido com uma resposla
desejada particular. Podemos utilizar a Eq. (4.1} para calcular o sinal de erro eín) associado com
este neurónio; veja a Fig. 4.3. Tendo-se determinado calcula-sc dirctamcntc o gradiente local
6,( fl)T usando a Eq. (4.14).
Caso 2 O Neurónio Jé um Nó Oculto
Quando O neurónio j está localizado em uma camada oculta da rede, nao existe uma resposta deso-
jada especificada para aquele neurónin. Correspondentemente, o sinal de erro para um neurónio
oculto deve ser determinado recursivamente, cm termos dos sinais de erro de todos os neurónios aos
quais o neurónio oculto está dirctamcntc conectado; aquí c onde o desenvolví mentó do algoritmo de
rctioprüpagaqáo se toma complicado. Considere a situado apresentada na Fig. 4.4T que representa
o neurónioJ como um nó oculto da rede. De acordo com a Eq. (4.14), podemos redefinir o gradiente
local 0 ín) para o neurónio oculto / como
fyOrJdv/ir) (4 >15j
- - - - ,
= - ip (u (nj), o neuronio / e oculto
d>;(n) >
onde na segunda linha utilizamos a Eq. (4.9). Para calcular a derivada parcial d^(ff)/5>’(fl), pode-
mos proceder como segue. Da Fig, 4.4 vemos que
2 íbC
o ncuróniit k é um nó de saida
(4.16)
que é a Eq. (4.2) com o indice k utilizado no lugar do índicej. Fizcmos isso para evitar a confusáo com
o uso do índice j, que se refere ao neurónio oculto no caso 2. Diferenciando a Eq. (4.16) em relaoao ao
sinal funcional yfp). obtemos
d^(n) _ y1 ttef(n)
j * djr/rf)
(4.17)
A seguir, utilizamos a regra da cadeia para a derivada parcial e rescrevemos a Eq.
(4.17) na forma equivalente
yX«)
FIGU R A 4.4 G rato dt¡ IIlixú da sin^l kl daialhes do nfttirónk} de so ida conectado
aa nsurQniú úcxjNq j
í^(«) _ v r i ^Et!ül
í4 [8>
Entretanto. da Fig. 4.4 notamos que
£>(«) = (ít)
= d¿ (ni - <ph í fé ( ji )), o neurónio £ é um nó de saída
Assim,
t¡S= *<•’*<'*» H-M)
Também notamos da Fig. 4.4 que para o neurónio k o campo loca] induzido c
n
B X’M'fo'jW (4J1)
onde mée número letal de entradas (cxcluindo o bias) aplicadas ao neurónio k. Aquí novainente. o
peso sináptÍLio é igual ao bias fi/n) aplicado ao neurónio k, c a entrada correspondente e$l¿
fixa no valor fr I, Diferenciar a Eq. (4.21) cm relacáo a pin) produz
(«)
= W^(")
(4.22)
Utilizando as Eqs, (4.20) o (4,22) em (4.18), oblemos a derivada parcial desejada:
y;-~ =
CfV 1 rt ?
; (4.23)
= -£&i («)*»<(*)
t
onde, na segunda linha, utilizamos a defini^iio do gradiente local Ó^fl) dada na Eq, (4,14), com o
índice Á‘ substituido por J.
Finalmente, utilizando a Eq. (4,23) em (4.15), oblemos a fórmula de retropropaga^áo para o
gradiente local Í5 {/]) como descrito:
S/fl) = O neurónio j é oculto {4 24)
A Figura 4,5 mostra a representado por grafo de íluxo de sinal da Eq. (4.24), assumindo que a
camada de salda consista de neurónios w,
Mrt)
FIGURA 4.5 Grato da fluw
da sinal d» uma pan» de
sistema ad.unta pGrtenwnfe
á refroprapagaQ&o dos sinais
de-ama
O
* ^(*)
o M")
O fater <p'(fl(n)) envolvido no cálculo do gradiente local 6 (n) na Eq. (4.24) depende únicamente da
fun^ao de ativa^áo associada ao neurónio ocultoj. O fator restante envolvido neste cálculo, ou seja,
o somaíório sobre Á\ depende de dois conjuntos de Leimos. O pnmeiro conjunto de termos, os
requer conhecimento dos sinais de erro ejit), para lodos os neurónios que se encontram na camada
iiTLcdiatamcnte á direita do neurónio oculto j e que están directamente conectados ao neurónio/: veja
a Fig. 4.4. O segundo conjunto deteneos, os tc^íw), consiste dos pesos sinápticos asociados com
estas conexóes.
Agora resumimos as rcla(Óes que derivamos para o algoritmo de retropropaga^áo. Frimeiro, a
correrán AW?..(ji) aplicada ao peso sináptlco conectandc o neurónio í ao neurónio/ ó definida pela regra
delta:
Cojrefdo
de peso
Parámetro da
laxa de aprendizagem
Gradiente'
focal
' sinal deenlrada'
do neurónio j
(4.25)
Segundo,o gradiente local 5 (>r) depende de se o neurónjej c um nóde saída ou seé um nóoculto:
L Se o neurónio / ó um rió de aaida. Spj) é igual ao produto da derivada w j.pelo sinal de erro
ambos sendo associados ao neurónioJ; veja a Eq. (4.14).
2. Se o neurónio./ é um nó oculto, &.(«) é igual ao produto da derivada associada cp i r íj)) pela
soma ponderada dos Ss calculados para os neurónios na próxima camada oculta ou camada de
saída que cstáo conectados ao neurónioj; veja a Eq. (4.24).
Os Dois Passos da Compute?»
Na aplicaban do algoritmo de recropropagaqáo, d^tinguem-sc deis passos distintos de computado.
O primeiro passo é conhecido como passo para frente, ou propagado, e o segundo como passo para
Irás, ou retropropagacao.
No passo pura frente, os pesos sinápticos se manteen inalterados cm toda a rede e os sinais
funcionáis da rede sao calculados individualmente, neurónio per neurónio. O sinal funcional que
aparece na saída do neurónio /¿calculado como
J'pr)- <PU'/h}) (4.26)
onde t-'.OO ó o campo local induzidodo neurónm j, definido por
?-. («)£ ’<1., (»W «) (4.27)
L-ll
onde nr é o número total de entradas (cxcluindo o bias) aplicadas ao neurónio/T c w («) é o peso
sináptico que conecta o neurónio í ao neurónio,/. e v.(it) é o sinal de entrada do neurónio j ou
equivalentemente, o sinal funcional que aparece na suida do neurónio í. Se o neurónio j estiver na
primara camada oculta da rede, nr = mi; e o índice i se refere ao í-ésimo termina] de entrada da redeT
para o qual esenevemos
i^n) - jc/fl) (4.2 8)
onde r(n) éo í-ésimo elemento de vetor (padrao) de entrada. Se, por outrO lado, u neurónio j cstivtr
na camada de saída da rede, m = ms c o índice,/ se refere au j-ésimo terminal de saída da rede, para
o qual escrevemos
o/Jt) (4.29)
onde o 00 c o/-étimo elemento do vetor (padrao) de saída. Esta saída c comparada com a rcsposta
desejada ohtendo-se o sinal de erro e/n) para o./-ésitno neurónio de saída. Assim, a fase de
propagando da computado cometa na primeira camada oculta, com b apresentacSci do vetor de
entrada, c termina na camada de saída calculando □ sinal de erro de cada neurónio desta camada.
O puso de retrepropagaflo, por outro lado, cometa na cantada de saída passando-sc os simáis
de erro para a esquenda através da rede, camada por camada, e recursiva mente ealculando-se o €
(i.e., o gradiente Local) de cada neurónio. Este processo tecursivo pcrmiic que os pesos sinápticos
sofram modifícacñcs de acorda cent a regra delta da Eq. (4.25), Para um neurónio localizado na
camada de Mída, o S é simplesmerile iyual ao sinal de erro daquele neurónio multiplicado pela
primcini derivada da sua náo-linearidade. Assim, utilizamos a Eq. (4.25) para calcularas modifica-
cocs dos pesos de todas as concxócs que alimentam a camada de saída. liados os 3s para os neurónios
da camada de saída, utilizamos, a seguir, a Eq. (4.24) para calcular os ó-, para todos os neurónios na
Pj-RCEITEinfJS. DE MüLTTnAS CAMADAS 195
penúltima carnada, e conseqüentemente as modificares des pesos de todas as conanoes que a
alimentan!, A computaba recursiva continua, camada por camada, propagando as modificabas
para todos os pesos sinópticos da rede.
Note que para a aprésenla^ de cada exemplo de treinamento, o padrto de entrada está fixc (“pre-
so”) durante todo o ciclo, englobando o passo de propagado seguido pelo passo de retropropegabo.
Fundan de Ativa^ao
O cálculo do & para cada neurónio do perceptron de múltiplas camadas requer o conhecimento da
derivada da fúnbo de ativabo p() óswciada aquel c neurónio. Para esta derivado existir, ncccssi-
lamos que a funbc <p(-) seja continua, Em termos básicos, a difcrendubilüiatie é a única exigencia
que a ftin^o de ativabo deve satisfazer. Um exemplo de uma fun^o de aiivat’áo nao-linear, conti-
nuamente difcrcnciávcl normalmente utilizada nos perceptrons de múltiplas camadas é a nao-
íineañdade sigmoidea desbrevemos duas formas desla funqáo:
L Fuhgüü Logística. Esta forma de nác-linearidade sigmóide na sua forma geral é definida por
l»,(tí?00)“7-------7----— «>0 e (4.30)
1 + exfX-ev/fl))
onde t? (n) é o campo local induzido do neurónioj. De acardo com esta nác-Linearidade, a ampl ilude
da saida se encontra dentro do intervalo Ü <_i <1. Diferenciando a Eq. (4.30) em relajo a
obtemos
tp/TJ; (*)) =
fl expí-m?, (w))
[l + expf-ía'/fl))]*
(4.31)
Comy^/r) “ V/v/n}). podemos eliminar o termo exponencial eKp(-du?(w)) da Eq. (4.31)* e assim
expressar a derivada ipJ U' (rf)) como
(p;(^))-í _y/«)[l -y/n)]
(4.32)
Para urn neurónio j localizado na camada de saida,
gradiente local para o neurónio j como
y.(n} = o,(n). Assim, podemos expressar o
(¥,(«)}
= Op/ff) - Of (rt)[l - <?.(«)],
(4,33)
o neurónio j é um nó de saida
onde o (n) é o sinal funcional na saida do neurónio/, c rf(«) c a resposta desejáda para ele. Por OUtro
lado» para um neurónio oculto arbitrario j, podemos expressar o gradiente local como
8,(«) -
= ay ( f; /1 - 7 (a i ] y, 5, (jt{ir), o neurónio J é oculto
(4,34)
Note da Eq. (4.32) que a derivada vr/v.(n)) alcanza o seu valor máximo emj/;(fl) 0,5, e o seu valor
mínimo (zcro) cm j> l u) = 0, ou j <n) = I »0. Como o valor da modificaba do peso sináptico da rede
é proporcional á derivada íp/v.t'i)), resulta que para uma íun^So de atlvng&o sigmóMe, es pesos
sinápticos sao modificados mais intensamente para aqueles neurónios da rede onde os sinais
funcionáis estáo no meio do seu intervalo. De acorde com Ruinelhart el al. i i QSGa)* é esta caracte-
rística da aprendizagem por retropropaga^ao que contribuí para a sua estábilidade como um algoritmo
de aprendizagem.
2. Fundió tangente hiperbólica. Uma outra forma normalmente utilizada de rtáo-línearidade
sigmóídce a futi^-o tangente hiperbólica, que na sua forma mai'i gcral é definida por
Ip.fv/*)) a lanh(¿?j,(n)), (o. 6) > 0
(4J5)
onde tí e b silo constantes. Na realídade, a fundan tangente hiperbólica c a funqao logística reescalada
e modificada por um bias. A sua derivada em relajo a v(,i) é dada por
<p' (t:. (ni) = । .'¿> scch" l.M-1 l n))
= - tanh2 (óu . (/r)i ¡i (4_ 3
= -|ú^v/n)JiJ+^(jFl]
Para um neurónio/localizado na camada de saída. o gradiente local é
ül
(4.37)
Para um neurónio /' cm uma camada oculta, temos
3 J (íí) = <P; (l?j ((rtJWx, t rt 1
Jt
= ^Li -}•,(#» )J« 5,. úrk o neurónio./c oculto
a 1
(4.38)
Utilizando as Eqs. (4.33) e (4.34) para a funqao logística e as Eqs. (4.37) e (4.38) para a fundió
tángeme hiperbólica, podemos calcular o gradiente local o. sem a ncccssidade do conhecimentó
explícito da fun^áo de alivacáo.
ATaxa de Aprendizagem
O algoritmo de netnopropagacáo fnmece uma "aproximadlo" para a trajelória no espado de pesos
calculada pelo método da desoída mais íngrcmc. Quantc menor for o parametro da laxa de aprendí-
zagem q, menor serle as varia^óes dos pesos sinápticos da rede, de uma ítera^ao para a outra, e
mais suave será a trajetóría no espaqo de pesos. Esta melhoria, entretanto. é obtída á custa de uma
taxa de aprendizagem lenta. Par outra lado, se fizermes o parámetro da tasa de aprendizagem 1]
mu i lo grande, para acelerar a taxa de aprendizagem, as grandes modificadora nos pesos sinápticos
resultantes podem tomar a rede instóvel 1 i.e., oscihicna). Um método simples de aumentara laxa
de aprendizagem, evitando no entantn o perjgo de instabilidadc, é modificar a regra delta da Eq.
(4.13) incluí indo um termo de momento.' como mostrado por (Rumelhart et al, 1986a)
Aw/fl) = oAu^m -1) +
(4.39)
onde a é usualmente um número positivo chamado de constante efe momento. Ele controla o lapo de
realimentacáo que age em tomo de como ilustrado na Fig. 4.6, onde z_| é o operador atraso
unítário. A EquavÜo (4.39) c chamada de regra delta generalizada*, ela incluí a regra delta da Eq.
(4.13) como um caso especial (i.e., a = 0).
FIGURA 4.6 Grato da fluxo da
sinal ¡lustrando o eteito da «n$-
ante üh mámente a
Para ver o efeito da seqüéncia de apresentasoes de padrees sobre os pesos sinápticos divido á
constante de momento a, rcscrevcmos a Eq. (4.39) como uma séric temporal com Indice f. O Índice
t vai do tempo inicial 0 ao tempo comente n. A Equaqáo (439) pode ser vista como uma equa^^o de
diferenbasde primeira crdem para a Gorrero de peso ÁWr(/tX Resol vendo esta equa^ao para Aíc (ji),
temos
rl
Aw1|(F?) = n^an’r6J(f)yí(0
(4.40)
que representa urna série temporal de comprimento fl * 1 - Das Eqs. (4JI) e (4.14) notamos que o
produto é igual a Conseqúentemente, podernos rescrever a Eq. (4.40) na
forma equivalente
Aw/)(n) = -q^a
!=0
W0
(441)
dw/r)
Com base nesta retalio, podemos fazcr as scguinccs observables (Watrous, 1987; Jacobs, 1988);
1. O ajuste córtenle Auy rt) representa a soma de uma serie temporal ponderada cxponencialmente.
Para que a serie temporal seja cwnwgiMtei a constante de momento deve ser restrita ao intervalo 0
£ |a| < 1. Quando (X é zero, o algoritmo de rctropropagapSo opera sem c momento. A constante de
momento a também pode ser positiva ou negativa, apesar de ser improvável que um ot negativo seja
usado na prática.
2. Quando a derivada parcial tem o mesmo sinal algébrico em iteraqpes consecuti-
vas, a soma ponderada exponencial mente, Aw.,(fl), cresce em magnitudc, e assim o peso ur(n) é
ajustado por um valor grande. A inclusao do momento no algoritmo de retropropagafSo rende a
oce/erar a descida em dire^tes com declividade constante.
3* Quando a derivada parcial 3^(r)/^w.L(r) tcm sinais opostas em iterantes consecutivas, a soma
ponderada exponencialmente, Aw..(fl), diminui em magnitude, de modo que o peso wj» é ajustado
por urna quantidade menor. A inclusño do momento no algoritmo de retropropagaf^ü tem um efeíto
estabilizador ñas dlre^cíes que oscilam cm sinal.
A incorporabáo do momento no algoritmo de retropropagab^o representa uma modifícabáq
pequeña na atualiza£io dos pesos, contudo ela pode ter alguns efe i tos benéficos sobre o comporta-
mentó de aprendizagem do algoritmo. O termo de momento pode também tero beneficio de evitar
que o processo de aprendizagem termine em um mínimo local raso na superficie de erro.
Na derivarán do algoritmo de rctropropagafáo, assumiu-sc que o parámetro da taxa de apren-
dizagem é uma constante representada por rj. Na realidade, entretanto, ele deveria ser definido
como n ; isto é, o parámetro da laxa de aprendizagem deveria ser dependente da eanBcaa. De falo,
muitas en isas intenessantcs podem ser lenas seo parámetro da taxa de aprendizagem for diferente,
cm diferentes panes da rede. Fomecemos mais déla Ules sobre esta questáoein seises subsequentes.
L também digno de nota que na aplicaban do algoritmo de retropropagacao podemos escolher
que lodos os pesos sináptiros das rede sejam amslávcis, ou podemos restringir qualquer número de
posos da rede a permanecerem íixos durante o processo de adaptado, Neste último caso, os sitiáis
de erro sao retropropagados através da rede na forma usual; entretanto, os pesos sináptieos súo
deixados inalterados. Isto pode ser realizado simplemente fazendo-se o parámetro da taxa de apren-
dizagem n para o peso sináptico igual a zcro.
Modos de Treinamento Seqüendal e por Lote
Em uma aplicado prática do algoritmo de retropropaga^áo, o aprendizado resulta das muñas apre-
sentaqoes de um determinado conjunto de exemplos de treinamento para o pcrccptron de múltiplas
camadas. Como mencionado anteriormente, uma apresen ta^ao completa do conjunto de Inri ñámen-
lo inteiro é denominada uma época. ü processo de aprendizagem é mantido em urna base de época
em época até os pesos sináplicos e os níveis de bias se estabilizaren! e o erro medio quadrado sobre
todo o conjunto de treinamento convergir para um valor mínimo. É uma boa prática tomar atectfó-
ría a ordem de apeeaenta^do dea exemplos de ríe mámenlo. de uma época para a seguí nte, Esta
alcHtoriedade tendí a tornar a busca no espado de pesos estocástica sobre os ciclos de aprendí za-
gem, e1. । lando assim a pnssihilidade de ciclos limitados, na evolu^áo. dos vítores de pesos sináptieos;
os ciclos limitados sao discutidos no Capitulo 14.
Para um dado conjunto de treinamento, a aprendizagem por relropropaga^áo pode entao pro-
ceder de urna entre duas formas básicas:
L Modo SetpieríeiaL O modo seqüeiiciat da aprendizagem por retropropaga^áo é também cha-
mado de modo an-fine, moda padrao ou moda csrocásliea. Ncstc modo de epenaqáo, a atual izarán
dos peses í realizada após a Bpresentaffio de cada exemplo de treinamento; este é o modo de apre-
scotacao para o qual se aplica a derivado do algoritmo de rctropropaga^áo apresentado. Para ser-
mos específicas, considere uma época con -¡i si indo de >V exemplos (vetares) de treinamento arranja-
dos na ordem (x(1}, d{ i)), {x(,V), di'A1)). O priniciro par de exemplo (x(l}. d( I)) da época é
aprcscnlado á rede, c a sequen cía de computa^ oes para frente epara irás, descritas anteriormente, é
realizada, resultando cm certos ¿i .tistes dos pesos, sináplicos e níveis de bias da rede. Enláo, o segun-
do par de exemplo (x(2), d(2}) da época é apreseniadu c a scqúcni ¡a de compulafdes para frente e
para Irás ú repetida,, resultando cm nevos ajustes dos pesos sináptieos c ni veis de bias. E<l processo
continua até que o último par de exemplo (x(.'V), d(/Ó) ¿poca seja considerado.
1. Modo par Late. No modo par totean aprendizagem por relr&propaga?áo, o ajuste dos pesos é
realizado e^ós a apresema^áo de tírdea os cxcmplüs de treinamento que cansíituem uma época.
Para uma época particular, definimos a funqáo de custo como o erro medio quadrado das Eqs. (4.2}
e (4.3), reproducidos aquí na forma composia:
। *
«...... -—LS») <4-42>
2jV ffri .rr
PtRCEITEDtNS DE MÍILTTTI AS CAMADAS 199
onde G sinal de erro e(n) ó relativo ao neurónio de saidaj do cxemplo dn treinamento w, o qual c
definido pela Eq. (4.I). O erro e(n) ó igual á diferen^a entre ü'(h) e v l ;i), que representara o y-ésimo
elemento do vetor resposta desejada d(n) e o valor correspondente da saída da rede, respectivamen-
te. Na Eq. (4.42), o soraatório interno cm rela^ao aj c realizado sobre todos os neurónios da camada
de saida da rede, enquanto que o somatón o externo cm rela^áo a n é realizado sobre todo o conjunto
de treinamento da época considerada. Para um parámetro da taxa de aprendizagem q+ o ajuste
aplicado ao peso sinóptico wj|T conectando o neurónio iao neurónio j\ édefinido pela regra delta
a»
(4.43)
Para calcular a derivada parcial dej(jr)/dWJ|r procedemos da mesma forma como antenonmente. De
acordo com a Eq. (4.43}, no modo por lote, o ajuste de peso ¿iüH/t) c feito sementé após o conjunto
de treinamento inleiro ter sido apresentado á rede.
Do ponto de vista operacíonal "fín-line", o modo seqüenctal de treinamento é preferível em
relapso ao modo por lote, porque requer menos armazenamento local para cada concxao sináptica.
Alénn desso, dado que os parámetros sáo apresentados i rede de uma forma aleatoria, o uso de ajuste
de pesos de podrán em padreo toma a busca no espado de pesos de natureza estocástiea. Por sua
vez, isto toma menos prnvávcl que o algoritmo de retropropaga^áo fique preso em um mínimo
local.
Da mesma forma, a natureza estocástica do modo seqñencial toma mais difícil de estabelecer
as condicoes teóricas para a Convcrgenúi.:i do algoritmo. Comparativamente, o uso do modo de
treinamento por lote fomece uma estimativa precisa do velor de gradiente; a convergencia para um
mínimo local é assim garantida sob condbdes simples. A compasillo do modo por ble também o
toma mais fácil de ser paralelizado que o modo seqiiencial,
Quando os dados de treinamento sao redundantes (i.e., o conjunto de dados contení varías
copias exatas dos mesmos padróes), constatamos que. diferentemente do modo por lote, o modo
seqüencial é capaz de tirar vantagem de sua redundancia porque os exemplos sáo apresentados um
de cada vez. lato ocorre particularmente quando o conjunto de dados c grande c altamente redun-
darte.
Em resumo, apcsai do falo de que ú modo seqüeneinE da aprendizagem por retropropaga^io
tem várias desvantagens, ele é muito popular (panicu[ármente para resolver problemas de classifi-
GBfáo de padróes) por duas razoes praticas importantes:
• O algoriimo é simples de implementar.
* Ele fomece sclufóes efelivas a problemas grandes e di ficéis.
Critérios de Parada
Em gcral, náo se pode demonstrar que o algoritmo de retropropagefáo convergiu e nio existem
criterios bem-definidos para encerrar a sua operado. Em vez disso, liá alguns criterios razoáveis,
cada um com o seu mérito práticc particular, que podem ser usados para encerrar o ajuste dos pesos.
Para formular um criterio assim, ó lógico se pensar cm termos das propriedades únicas de um
mínimo local ou global da superficie de erroí Suponha que o vetor de peso w* represente um
mínimo, seja ele Cocal ou global. Uma condi^áo necessária para que w* scia um mínimo é que O
vetor gradiente g(w) (i.c.h a derivada parcial de primeira crdem) da superficie de erro em relajo ao
vetor de peso w seja zero em w w*. Ccriseqüenlemente, podemos formular um criterio de conver-
gencia scnsívcl para a aprendizagem por retropropagafáo como segué (Kramer e Sangiovanni-
Vinccntelli, 1989);
Cc*í5rrfffV-xe <J¡iP V algn/itntfj de netmpnyuigogiio ¡enfta ^anv^rgielet quundo e¡ rutrma ettciidiunu
dú vetar gradiente üieam;ar um fimiar suficientemente pequenü.
O problema deste criterio de convergencia é que, para se obter tentativas bem-sucedidas, os tempos
de aprendizagem podem ser longos. Ele requer também o cálculo do vetor gradiente g(w).
Urna outra propriedade únüca de um mínimo que podemos utilizar é o fato de que a fun<;áo de
custo ou medida de erro í^fw) é estacionaria no ponto w = w*. Conscqücntcmcntc, podemos
sugerir um criterio diferente de ccnveigénuia:
Considera-.<,e tpw o algoritmo de retropropaga^do teehü convergido tjutmdo o teuta absoluta de
vtrriafáo da erro media taladrado por época for suficientemente pettwtta.
A Laxa de variado do erro tnédio quadrade é típicamente considerada suficientemente pequeña se
ela se encontrar no intervalo de 0,1 a l por cento, por época. Algumas vezes. um valor láo pequeño
quanto 0,01 por centcT por época é uti Iizado. Infelizmente, este criterio pode resultar em um encer-
ramerrto prematuro do processo de aprendizagem.
Há um outro crítério de convergétiuia útil e teóricamente fundamentado. A pos cada iteraqio de
aprendizagem, a rede é testada pelo seu desempenho de general i zaqao. D processo de aprendiza-
gem é encerrado quando o desempenho de general i¿aq^o for adequado, ou quando ficar aparente
que o desempenho de generalizaqáo alingiu o máximo; veja a Sesjáo 4.14 para nuda detalhes.
4.4 RESUMO DO ALGORITMO DE RETRO PRO PAG AQÁO
A Fig. 4.1 aprésenla a planta anquí tetur al de um perceptron de múltiplas camadas. O grafo de fluxo
de sinal correspondente para a aprendizagem por retropropaga^áo, incorporando ambas as fases,
pera frmte c para tria, das compuiaf&es envolvidas no processo de aprendizagem, ¿ apresentado na
Fig. 4.7t para o caso de L = 2 e m = m, = = 3. A parte superior do grafo de fluxo de sinal
corresponde ao passo para frente. A parte inferior do grafo de fluxo de sinal se refere ao passo para
iras, que é referido como o grafo desensibífidade para o cálculo dos gradientes lócate do algoritmo
de rctropropagacáo (Narcndra c Parthasarathy, 1990).
Anteriormente, mencionamos que a atuatizafáo scqücncial dos pesos c o método preferido
para a implcmenta^áo cm tempo de cxccuqao (on-fru?) do algoritmo de relropropaga^o. Para este
modo de operarán, o algoritmo circula através da amostra de treinamento dOOlí-j como
segue:
L fniciaiizacáo. Assumindo que nenhuma infoma?3o prévia csteja disponivcl, retire os pesos
sinápticos e limiares de uma distribuido uniforme cuja media é zero e cuja variflneia c escolhida
para que o desvio padrito dos campos locáis induzidos dos neurónios se encontré na transipáo entre
M partes linear e saturada da fun^áo de ativa^áo sigmóide.
PERCErTRDHS DE MÚLITIUS CAMADAS 201
Ó ÓÓ ó O O
F| G U RA 4.7 Resumo gráfico do fluro cc sinal da aprendizaje m por reíropropagafáo.
Parla $up$riOr do grafi>: pasM parU líenle. Parte inferior do ^afci: pflBW par^ Irás
2. jipresenta^ao dos Exemplos de Treinamenla. Aprésenle uma época de exemplo® de treina-
mtntó á rede. Para cada exemplo do conjunto, ordenado de alguma forma, realizo a scqüñncia de
computantes para frente e para tras descritas nos pontos 3 e 4, respectivamente.
3. Computff^ao para Frente (Propaga^ao). Suponha que um exemplo de treinamento da época
seja representado por com o vetor de entrada i(ji) aplicado a camada de entrada de nós
sensorial e o vetor resposta desejada d(n) apresentado á camada de saida de nós computacionais.
Calcule os campos focáis induzidos c os sinais funcionáis da rede prosseguindo para líente através
da rede, camada por camada, O campo local iitduzido para o neurónio j na camada t é
<(") - ¿wK’(»br,'W (4A4)
1=41
onde é o sinal (fun^áo) de saida do neurónio j na camada anterior 1 - lh na iterado «, e
é o peso sináptico do neurónio J da camada /, que é alimentado pelo neurónio i da camada I
- 1. Para r = 0T temosyU "(n) = +1 e = /?' ''(**) é o bias aplicado ao neurónio j na camada /.
Assumindo-se o uso de uma fundió sigmóide, o sinal de saida do neurónio j na. camada i é
y^O/v/jr))
Se o neurónio j eslá na prímeira camada oculta (i c.t / = I )T fapa
^0,(rt) = jt/w)
onde jr(fl) c o j-csimo elemento Jd vetor de entrada i(íí). Se o neurenio./ está na camada de saida
(Le., / = £, onde ¿ é denominado a pnifundidade da rede), fa(?a
Calcule o sinal de erro
-o(i0
(4.45)
onde </(*)) é oj-ésimo elemento do vetnr resposta desejada d(n).
4. Computacao para Tras (Reimpropaga^ao). Calculo os 5s (i.e., gradientes locáis) da rede,
definidos por
«“(»)=
I
para o neurónioj da camada de saida L
(4.46)
para o neurónio j na camada oculta f
onde o apóstrofo em tp ’(•) representa a diferenciado em relajo ao argumento. Ajusfe os pesos
sinápticos da rede na camada i de acorde com a regra delta generalizada:
+ O = u’J’(n) + 'fw - 11] + «).r/ :'(«)
(4.47)
onde T]co parámetro da laxa de aprendizagem eaí a constante de momento.
5. /feracíip Itere as computares para frente e para tras dos pontos 3 e 4. apresentó ndo novas
épocu de exemplos de treinamento para a rede, ate que seja satisfeito o cri térro de parada.
A;ufas: a ordem da ¿presentado dos exemplos de treinamento deve ser aleatória, de ¿poca para
época. Os parámetros de momento e da laxa de aprendizagem típicamente sáo ajustados (e normal-
mente reduzidos) quando o número de iteracóes de treinamento aumenta. A justificativa para estes
pontos sera «presentada mais tarde.
4.5 O PROBLEMA DO XOR
No perceptron elementar (de camada única), náo há neurónios ocultos. Consequcntemcntc, ele nao
pode classifí car padróes de entrada que sejam nao Imparmente separa veis. Entretanto, padróes nío
lincarmcntc separa veis ocomcm frcqüenlcmcntc. Esta situacáo surge, por exemplo, no problema do
OU Exclusivo iXOfi. Exclusive OR), que pode ser visto como um caso especial de um problema
mais gcraL que c o de classilicar pontos no hípercubo unitario. Cada ponto no hipcrcubo pertence
ou á classe 0 ou á classe 1. Entretanto, no caso especial do problema XOR, ntxessi tamos considerar
apenas osquatm vértices da tp¡atirmfo ¡tfiU&foque correspondem aos padróes de entrada (0,0), (0,1 \
(I, l) c (1,0). O primeirc e o tercciro padróes de entrada pertencem á classe 0, como mostrado por
o ©o-o
e
I ® I = 0
onde ® representa o operador da fonoSo bodeana OU Exclusivo Os padroes de entrada (0,0) e
(1,1) csláo cm vértices opostes do quadrado unitario; apesar disso, produzcm a mesma saída 0. Por
outro lado, os púdróes de entrada (0J) e (1,0) esláo também em vértices apostes do quadrado, mas
pertenecí!] á elasse 1 , como mostrado por
Ü © l - ]
e
1 ©0=1
Constatamos. primeiro, que o Uso de um Único neurónio com duas entradas resulta cm uma
linha reta como uma fronteira de decisáo no espado de entrada. Rara todos os pomos de um lado
desta linha, o neurónio coloca I na saída; para lodos Os pontos do outro lado da ii nhaT coloca U na
saída. A pos¡0oe a orientado da linha no espado de entrada s3o determinadas pelos pesos sinápticos
do neurónio conectados aos nós de entrada c pelo tías aplicado ao neurónio. Com os padrees de
entrada (0,0) c (1,1) localizados cm vértices opo$tO$ do quadrado unilário, c igualmente para os
outros dois padróes de entrada (0,1) e (1,0), está claro que náo podemos construir uma Linha neta
como uma frenu-ira de decisao de forma que (0,0) e (I. I) estejam em uma regiao de devi sao e (0,1)
c (L ,0) estejam na outra regiáo de dccisáo. Em nutras palabras, um perceptron elementar nao pode
resolver o problema do XOR.
Podemos resolvere problema do XOR utili/ando uma única camada oculta com dmsneurónios.,
como na Fig. 4.8a (Touretzky e Fomerleau, I9S9)l O grato de fluxo de sinat da rede está mostrado na Fig.
4.8b Sao (citas aquí as segeintes supositóes:
Cnmiuh Camada Camada
de wSra.líi rttutiá de saída
(b)
FIGURA 4.B (a) Qrafo arquilctural
da rodo para a r&solu^üú do proble-
ma do JtQR. (D) Grato da HuxO de
sinal da rede
* Cada neurónio é representado per um modelo de McCulloch-Pitts, que usa uma fiingfo de
limiar para a sua fun^áo de atm a^o,
* Os bits D c 1 sao representados pelos ni veis 0 e +1, respectivamente.
O neurónio dectina, rotulado como 1 na camada oculta, ¿caracterizado como:
u?n = «íp = +1
4-2
1 y
A inclina^ao da fronteira de dcci sao construida por este neurónio oculto c igual a -1 e pos! Clonada
como na Fig. 4.9a. O neurónio de baixo, rotulado como 2 na camada oculta, é caracterizado como:
= ídE = +]
(•I
FIGURA 4_& ja} Fronltira da dacisáo
cüri&tKuida palo n&uFónin kuHp i da
rtda da Fig. 4.8. (b) Frangirá de deo-
Sáú CürtSlrukla pele neun&nfcQ oculto £
da rada- (e) Fr^nielras de d&asio
continidu pala reda cúmplala
le)
A orientacao e a post^ao da fronteira de decisáa construida por este segundo neurónio oculto sáo como
mostrados na Fig. 4.9b.
D neurónio de salda, rotulado como 3 na Fig. 4.Xa, é caracterizado como:
?t'j| = -2
wn = +;
^4
A fuñado do neurónio de saída c construir uma combinacáo linear das fronieiras de decisáo forma-
das pelos dais neurónios ocultas, O resultado desta computado está mostrado na Hit 4,9c, O
neurónio oculto inferior tem uma conexáo excitatória (positiva) para o neurónio de saida, enquanto
que o neurónio oculto superior tem uma conexáo inibitória (negativa) mais forte para o neurónio de
saída. Quando os dois neurónios ocultos cslao desligados, que ocorrc quando o padreo de entrada c
(0,0), o neurónio de saída permanece desligado, Quando ambos os neurónios ocultos estflo ligados,
que ocorre quando o padreo de entrada é (1,1), o neurónio de salda é desligado notamente porque o
efeito iuibitório do pese negativo maior conectado ao neurónio oculto superior sobrepuja o efeito
excitatório do peso positivo conectado ao neurónio ocullo inferior, Quando a neurónio acuito supe-
rior está desligado e o neurónio oculta inferior está ligado, que acorre quando o padráo de entrada
é (0,1) ou (1,0), o neurónio de saída ¿ligado devido ao afeito excitatório do peso positivo conectado
ao neurónio oculto inferior, Desta forma, a rede da Fig. 4.Sa rcsolve de (ato o problema do XÜR.
4.6 HEURÍSTICAS PARA MELHORAR O DESEMPENHO
DO ALGORITMO DE RETROPROPAGAQÁO
Freqüentemente, é dito que o projeto de uma rede neural utilizando o algoritmo de retroprapaga^o
c mais uma arle do que uma ciencia, significando que mullos dos numerosos fatores envolvidos no
projeto sao o resultado da experiencia particular de cada um. H<i alguma verdade nesta afirmado.
Entretanto^ exislem métodos que melharam significativamente o desempenho do algoritmo de
retropropagacao+ como descrito aquí.
1. Atuafisaf ao seqüenciai comparada á atualiza^aopor lote. Como mencionado anteriormente,
□ modo seqüencial da aprendizagem por reltopropaga^áo (envolvendo atualriza^áo de padrio em
padrau) é computacionalmente mais rápido que o modo por lote. Isto é verdadeiro especialmente
quando o conjunto de dados de treinamento for grande e altamente redundante. (Dados altamente
redundantes causam problemas computacionais para a estimativa da jacobiana requerida para a
atualizflf ío por lolej.
2, Mítximiiafüo da conteúdo de informaban. Como regra geral, todo exemplo de treinamento
apresentado ao algoritmo de rctropropagacáo deve ser cscolhido de forma que o seu contcúdo de
informaqáo seja o maior pcssfvel para a tarefa considerada (LeCun, 1993). Dois modos de alcanzar
este objetivo síar
• O uso de um exemplo que resulte no maior erro de Ireinamenlo.
• O uso de um cxcmplc que scja radicalmente diferente de todos os outros usados anteriormen-
te.
Estas duas heurísticas sao motivadas por um desejo de ampliar a busca no espado de pesos.
Ñas tarefas de classiiicaqa.0 de padrees usando a aprendizagem par rctropropagacáo scqücncia],
urna técnica simples bastante ui ilizada c tomar aleatoria (i.cM embaralhar) a ordem cm que os cxcm-
plos sao apresentados ao perccptron de múltiplas camadas de urna época para a seguinte. Idealmente,
a aleatoriedade garante que os exemplos sucessivos apresentados á rede em uma época raramente
pcrteiujam á mesma elasse.
Para uma técnica mais retinada, podemos usar um esquema deénfaie, que envolvr a apresen-
taijáo á rede do um número maiorde padrees d [ficéis do que facéis (LcCun, 1993). Podemos iden-
tificar se um padráo particular é fácil ou difícil examinando-se o erro que ele produz, comparado
com as itera^ñes anteriores do algoritmo. Entretanto, há dot'i problemas cm se usar um esquema de
enfase, que devem ser examinados cuidadosamente:
* A distribuhjao dos cxcmplos dentro de uiTiá época apresentada á rede c distorcida.
• A presenta de itm exemplo estranho ou mal-rotulada pede (er uma conseqüéneia catastrófica
no desempenho do algoritmo: aprender este exemplos eatranhos compromete a hábilidade de
generalizado da rede sobre regí oes mais prováveis do espado de entrada.
3. Fuñido de ativagao. Um perceptron de múltiplas camadas I reí nado com o algoritmo de
retropropagarán pode, em geral, aprender mais rápido (em termos do número de ileraíóes de treina-
mento ncccssárias) quando a funcáo de alnado sigmóide incorporada no modelo do neurónio da
rede for antissiinétrica do que quando ela for náo-slmétrica; veja a Sedo 4.11 para detalhcs. Dézc-
mos que uma fun^ao de ativa^áo é auti-aimétiica (i ?, fun^ao impar de seu argumento) se
<p( -4?) “ ^<P<t')
como representado na Fig. 4.10a. Esta cundido nao é satisfcila pela fun^áo logística padrao, repre-
sentada na Fig. 4.10b.
Uin exemplo popular de uma fursqJo de ativaéioanti-simétricac uma náu-lincaridadc siigmóide
na forma de urna tangente hiperbólica^ definida por
tpfu) = a tanh(/?0
onde a e ft sao constantes. Valores adequadas para as constantes « e b silo (LeCun, 1989, 1993)
a-- 1,7159
e
A tangente hiperbólica as&itn definida tcm as seguíntes propiedades úteis:
• cp(l)- I eq<-[)- -l
Na origein, a inclinado (i .e.t o ganho efetive) da fun^áo de ativa^áo fíca próxima da unidade,
Como mostrado por
ip(0) = ab
= 1,7159x2/3
= 1,1424
FIGURA 4.10 (&) FunQSQ de atrvaijáa anti^imétridÉ. (b) Fun^áD de aliváCáú náO^Simátrica
• A derivada segunda de (píl1) atinge seu valor máximo em r 1.
4. Valones-alvo. É importante que os valorcs-al vo (resposta drsejada) scj am cscolhi dos dentro do
intervalo da fúnfáode ativa^ao sigmoide. Mais específicamente^ a respastadesejadad para o neurónio
j na camada de saida do perceptron de múltiplas camadas deve ser destocada por uma quanlidadc E
afastada do valor limite da fundan de ativa^áo sígmóide, dependende se o valor limite c positivo ou
negativo. Cuso centrino, oaigorilma de relropropaga^o (ende a levar os parámetros livre da rede
para o infinito c dcssa forma reduzir a ve loe idade do processo de treinamento, levando os neurónios
ocultos á saturado. Para sermos específicos, considere a fun^áo de ativa(aü anti simétrica da Fig.
4.10a. Para o valor limite fazemos
J,= a f
e para o valor limite - a, fazemos
J - CJ * €
onde e é urna constante positiva apropriada. Para a escolha de a w 1,7159 referida anteriormente^
podemos fazer t = 0,7159; neste caso, o valor-alvo (resposta desejada) pode ser convenientemen-
te cscolhido como ± 1, como indicado na Fig. 4.10a.
5* Normalizar as entradas. Cada variável de entrada deve ser pré-processadu de modo que o seu
valor medio, calculado sobre todo o conjunto de treinamento ou seja próximo de zero. ou seja
pequeño comparado com o desvio padrao (LeCun, 1993). Para avahar o significado pratico desta
regra, considere o caso extremo, ende as vari ¿veis de entrada sáo positivas de modo consistente.
Ncsta situado, os pesos sinápticos de um neurónio na pruneira camada oculta podem apenas cres-
cerjuntos ou decresccr juntos. Conscqücntcmcntc, se o vetor peso daquele neurónio deve mudar de
direcáo. ele só pode lázer isso ziguezagueando seu caminho através da supcriicic de creo, o que c
típicamente lento e deve ser evitado.
Para acelerar o processo de aprendizagem por relropropaga^áo, a normal izaqáo das entradas
deve incluir lambón! duas medidas (LeCun, 1993):
* As variaseis de entrada cuntidas no conjunto de treinamento devem ser ndn-cfírrelacHifíadax'
isto pede ser feito utilizando-so anáhse de componentes principáis, como dctalhado no Capi-
tulo R.
As variáveis de entrada dcscorrelactonadas devem ser escaladas para que suas covariándíis
tejam aproximadamente iguais, assegurando-se com isso que os diferentes pesos sinápticos
da rede aprendam aproximadamente com a mesma velocidade.
A Figura 4.11 ilustra os resultados de tres passos de normalizadlo: remocho da media, dcscorrelacac
c cqualizarán da covariancia, aplicados ncsta ordem.
6. inicializa^So. Uma boa escolta para os valores iniciáis dos pesos sinápticos c limiares da rede
pode ser de tremenda ajuda para um prpjeta de rede ser bem-üucedido. A pergunta Chave é: O que ú
uma boa escolha?
Quando sáo atribuidos valores iniciáis grandes aos pesos sinápticos, é muito provável que os
neurónios da rede sejam levados á saturaqáo. Se isto acontecer, os gradientes locáis no algoritmo de
retrepropagacáo assumem valores pequeños, o que por sua vez ocasionará uma diminuido da vclo-
cidadcdo processo de aprendizagem. Entretanto, se forera atribuidos valores iniciáis pequeños aos
pesos sinápticos, o algoritmo de retropropagatfo pode operar em uma área muito plana em tomo da
origem da superficie de erro; isto é particularmente verdade no caso de Eimfóes de ativa^áo
antissimétricas, como a fiin^áo tangente hiperbólica. Infelizmente, a origem é um pontu de sela,
que corresponde a um ponto estacionario onde a curvatura da superficie de erro através da sela é
negativa c a curvatura ao longo da sela é positiva. Por estas razóes, o uso tanto de valores grandes
como de valores pequeños para a m cializafáo dos pesos sinápticos dev? ser evitado. A cscolha
adequada para a in¡cíaíikh?ao se encontra em albura lugar entre estes dois casos extremos.
Rjcnwifio
1$ iricilu
C<iitjn«iio otí^iii jL cié
pontos de dadas
Equal ¡zafio ik
covHriárwia
FIGU R A 4J i ilustrando da upecagáa de ramojo da média. descofretacáo e equalizar-Éc
da «variártela para, um espado de entrada bidimensiocial
Para serraos específicos, considere um perceptron de múltiplas camadas que usa a fundió
tangente hiperbólica para suas fun^ocs de ativacao. Considere o bias aplicado a cada neurónio da
rede fixo em zero. Podemos entilo expnessar o campo local mduzido do neurónio/ como
H
v, =
MI
Assuma que as entradas aplicadas a cada neurónio da rede tenham media zero e variáncia unitaria,
como mostrado por
K “ ¿"[y,] “ 0 para lodo i
e
Assuma aínda que as entradas sáo náo-correlacionadast como mostrado por
, I p;iru k — i
0 parajtrí
e que os pesos sinápticos sao retirados de um conjunto uniformemente distribuido de números com
media zero
- á|u:a] = 0 para lodos os parcsO',/)
e variáncia
a; = fjfic.: - gh.):] = í[ wj ] para todos os pares (¿j)
Correspondeniemcntc, podemos expressara media e a variáncia do campo local tnduzido como
M. = M Uj] = E £«>.,y, = £' I= 0
=>i
-i i-
= fffC
(4.48}
onde é o número de concxóes sinópticas de um neurónio.
Com base neste resultado, podemos agora descrecer uma boa estrategia para inicial izar os
pesos sinápticos de modo que o desvio padrao do campo local induzido de um neurónio caía na área
de transifao entre as partes lineare saturada da sua lun^áo de aliva^Ao sigmúide. Para o caso de uma
futlfcío tangente hiperbólica com seus parámetros a e freomo previamente especificado, por ejem-
plo, este objetivo ó salisfeito fazendo on 1 na Eq. (4.48X ueste caso, oblemos (LeCun, 1993)
O . = nflfl (4,49)
Assim, é desejável que a distribuido uniforme, da qual os pesos sinápticos silo selecionados, tenha
uma media zero e uma variáncia igual ao reciproco do número de concxocs sinópticas de um neurónio.
7. Aprendieron por indicios. A aprenth zagem a pan ir de um conjunto de ejemplos de treí ñá-
menlo lida com uma funfáo de mapeamento de entrada^áida dcsconhccida y(-). Na verdade, o
processo de aprendizagem explora a informado contida nos exemplos sobre a íún^áu J[-) para
inferir uma implcmcnra^áo aproximada para da. O processo de aprendizagem por cxcmplos pode
ser generalizado para incúr/r aprendizagem por indicias-, o que é obtido permitindo'sc que a infor-
ma^au prévia que tenhamos sobre a funesto^-) seja incluida no processo de aprendizagem (Abu-
Mcstafa, 1995), Tal informaban pode incluir propiedades invariantes, simetrias, ou qualquer outro
conhecimento sobre a lun^üo /(-) que pode ser usado para acelerar a busca por sua reab zapito apro-
ximada e, mais importante que isto, melharar a qualidade da estimativa fina!. O uso da Eq, (4.49) é
um exemplo de como isto pode ser obtido.
X. Tincar de aprendizagem. Todos os neurónios do perceptron de múltiplas camadas devem aprender
com a mesma taxa. As últimas camadas normalmente tém gradientes locáis maiores do que as
camadas anteriores da rede. Assim, devose atribuir ao parámetro da taxa de aprendizagem T| vala-
res menores ñas últimas camadas do que nas camadas anteriores. Neurónios com muiías entradas
devem ter um parámetro da laxa de aprendizagem menor do que neurónios com menos entradas,
para manter um lempo de aprendizagem similar a todos os neurónios da rede. Em LeCun (1993), é
sugerido que, para um determinado neurónio, a taxa de aprendizagem deve ser inversamente pro-
porcional ¿i raiz quadrada dasconexóes sinópticas fritas com aquele neurónio. Discutimos as laxas
de aprendíragem mais extensamente na Se?ao 4.17.
4.7 REP RESENTAQAO DA SAÍDA E REG RA DE DEC ISAO
Em teoría, para um prvbiema de ciassifica^ao de Af classes, no qual a unido das \f classes distintas
forma o espado de entrada inteiro, necessitamos de um total de M saldas para representar todas as
dccisocs de classificacfo possíveis, como representado na Fig. 4.12. Ncsla figura, o vetor x_ repre-
senta oJ-éslmopn>wWíW (i.e,t amostra única) de um vetor aleatorio x de dimensáo /n, a ser dosifi-
cado por um perceptron de múltiplas camadas. A fr-csima das \f classes possiveis ás quais o vetor x
pode pertencer é representada por 'í.. Suponha que seja a A-ésima saida da rede produzida em
resposta ao protótipo i., como mostrado por
*=1.2..M
(4.50)
FIGURA 4,12 Diagrama cm hoces
de um dassir¡cador de nadrñfis
PetceptrcKi de b
múltiplas cantadas
onde a fundan F*(-) define o mapeamento da entrada para a A-ésima saida, aprendido pola rede. Por
conveniencia de apresentacac, suponha que
(4.51)
onde F() ¿ uma fuñado de valor vetorial. Uma quesláo básica que desciamos abordar nesta sc^ao c:
Após um perceptmn de múftiptas camadas ser minado, quai deve ser a regra de decisan ¿tima
para ctassificar as M saldas da rede?
Claramente, qualquer regra de decisáo razoávcl de saida deve ser bascada no conhecimento da
fim^ao de valor vetorial;
Fí ft“ 5 x -* y G R-w
(4.52)
Fm geral, rudo o que c ceno sobre a Fundo de valor vetorial F() é que ela é uma fundo continua
que minimiza o JitnciGnal de risco empírica:
(4.53)
onde d c o padreo de saida desojado (alvo) para □ prototipo i| || ¿ a norma euclidiana do vetor ai
compreendido c .Ve o número total de exemplos apresentados ú rede no treinamento. A oaÉncia do
Criterio da Eq. (4.53) é a mesma que a da fundo de custo da Eq. (4.3). A futifáü de valor velaría]
HJ é fonemenle dependente da esc o] ha dos exemplos (Jyd ) usados para Lrcinar a rede, de forma
que valores diferentes de (x,d i levare de Tato a di ferentes funvocs de valor vetorial F( ). Note que a
terminología (x,,d;) usada aquí é a mesma daquela de (x0),d(7)) usada anteriormente.
Suponha agora que a rede é treinada com val o res-alvo binarios (que eventual mente
corresponden) aos limites superior e inferior das saidas da rede, quando a Fun^ao logística é usada),
escritos como;
l quandooprotótico i pórtente ¿i classe 7 (
íl quandoo prolclico x nao pcrtcnce á classe
(4-54)
Com base nesta nota^áo, a classe _ ¿ representada por um velar alvo de dimensio M
t— A-ésinnc elemento
1 tentador se supor que um classi tkador por perceptron de múltiplas camadas (reinado com o
algoritmo de retropropagarán, enm um conjunto finito de exemplos independentemente e
idénticamente distribuidos (i id.), pode levara urna aproximado assintática das probabilidades de
classe ¿i fifis teriori subyacentes. Esta propriedade pode ser justificada pelas seguí otes razóos (Whi te,
1989a; Richard c Lippmann. 1991):
• A leí das grandes números é invocada para mostrar que, quando o tamanho do conjunto de
treinamento A' se aproxima do infinito, o vetor de peso w que minimiza o funcional de custo R
da Eq. (4.53) se aproxima do vetor de peso ólimo w* que minimiza o valor esperado da quan-
1 idade aleatoria y||d - F(w,x)|| . onde d é c vetor resposta dese ada o F(w,x) é a aproximadlo
realizada por um perceptron de múltiplas camadas com vetor de peso w e vetor x como entra-
da (Wliite, ] 989a). A fun^áo F(w,x), que aprésenla dependencia explícita do velar de peso w,
c a mesma que a Fundo F(x) usada anteriormente.
• ü vetor de peso ólimo w* Icm a propriedade que o veior correspondente das saidas rcais da
rede, F(w*, x). é uma aproximado por minimizado de erro medio quadrado do valor espera-
Hidden page
das relaces dos pesos sinápticos conectados a eles (Luí, 1990}. Tai análise, entretanto, náo é npli-
cável a uma fronteim de decido formada de acordo com a regra de decisáo de saída da Eq. (4.55),
Urna abordagcm mais apropriada ¿ considerar os neurónios ocultos como detectores n¿ío~iifieares
de características que procuran mapear classes do espado de entrada original DS"^ onde as cla&es
podem nao ser lin carmen te separáveis, para o espaqo de aliva^ccs da camada oculta, onde é mais
provávcl que sejam lincarmcnte separa veis.
4.8 EXPERIMENTO COMPUTACIONAL
Nesca setfo, usamos um experimento computacional para ilustrar o comporta mentó da aprendiza-
gem de um perceptron de múltiplas camadas usado como classificador de padrees. O objetivo do
experimento é distlngu:i entre duas classes de padrees Ndimensioiials “superáoslas’1. com distri-
buidlo gaussiana, rotuladas como I c 2. Suponha que reprcseniem o conjunto de eventos
para os quais um vetor aleatorio x pertence aos padróes I e 2, respectivamente. Podemos cntáo
uxpressar as funQdes de densidade de probabilidade condicional para as duas dasses como:
Classe'í :
onde
(4.56)
Classe'í
p, = vetormédia = (ü.l)f
a' = variáncia = 1
Aí*FM = ¿»«xp[HzH=
2 2OZ
(4.57)
onde
Hz=|2.O]r
ct2: = 4
Assume-se que as duas classcs sejam cqüiprcvávcis; isto éT
1
Pt = Pi = -
A Figura 4.13a movtra gráficos tridimensionais das duas distribuicóes gaussianas definidas polas
Eqs. (4,56) e (4.57). O vetor de entrada c 1 = [xr jc^K e a dimensional i dade do espado de entrada é
m., = 2h A Figura 4.14 mostra diagramas de espalhamcnto individuáis para as classus c e o
diagrama de espalhamunto conjunto, representando a superposicao dos gráficos de espalhamcnto
de 500 pontos tomados de cada um dos dois proccssos. Este último diagrama mostra claramente
que as duas distribuyóos se sobrepóem significativamente, indicando que existe inevitavclmcnte
uma probabilidade significaiiva de classificafáo incorreca.
PeKCEFTRDNS DE MÚLTIPLASCAMADAS 215
FIGURA 4.13 (a) Fu€i;&ü de densidads da probabilidad^ y«hí(bj Fundió da deneidada da profiabilidads Jfjilíj
Fronte ira de Decisáo Bayesíana
O criterio bayesiano para classifica^o ¿tima c discutido no Capitulo 3. Assumindo que para um
problema de duas classes (1) as classes e sejam eqñipnováveis, (2) os cusios para classiñea-
C$es corretas sejam jeto e(3) os cusios para claási ficantes incometas sejam íguais, constatamos que
a fronteira de decisáo ólima é enconirada aplicando-se o leste da razáo de verossimillanca:
A(i)f£
I
(4.58)
onde A(x) e a ruzüu tie vt'rvssirniííian^a, definida por
(4.59)
onde é o limiar dt> teste., definido por
A
(4.60)
Para o exemplo considerado» temos
FIGURA 4.14 (a} Gráfica de aspalhamonto da classe ib) Gráfico de aspalhamentú da Clásüu 4S.
fe) Gráfico do espalhamento combinado do ambas as classas.
“ LO J w
Conseqü ente trióme. a fronfcira dedecisáo (baycsiana) ¿tima c definida por
?exp ’
°i <
2{j]
2<>:
ou de forma equivalente.
-U-M1 --U-d!=4iO8H
ua Ui \aí7
(4.61)
Usando manipulares diretas, podemos redefinir a frcnteira de decisáo ólima da Eq. (4.61) sim-
plesmente como
n nd ü
II* - X, Jl- I*
-gfa
* i
ci-g?L °i-°T "°J
(4.62)
(4.63)
(4,64)
e
A F.quacán (4 62) representa um circulo wm centro x e mío r. Suponha que £1, defina a regi&O
comprendida dentro dcstc círculo. A regra de classifica^áo bayesiana para o problema considerado
pode ser formulada como segue:
Clas.iifique o velor de nfaerva^da x como /jev-fencenfe a clase ¥., je □ mzáo de verossimi/hanfa
A(>) far maior qw o limiarE, e á classe caso contrario.
Para os parámetros particulares deste experimento» temos uma fronte ira de dccisáü circular cujo
centro está localizado em
e cujo rato é
r^ 2J4
Considere que c represente o conjunto de resultados cornetos de clastificapeo e e o conjunto de
resultados ineoíretos de classifica^do. A probabilidad^ de erro (classificacác incorre la), Pe, de um
clarificador operando de acardo com a regra de decisáo bayesiana é
F, - F.W,) t-p/W
(4.65)
onde é a probabilidade condicional de erro, dado que o velar de entrada do clasificador
tenha sido retirado da distribuido de classe r e similarmente para p1 ep£ alo as probabi-
lidades a priori das classes c í-.,. respectivamente. Para o nqsso problema, podemos estimar
numéricamente as integráis de probabilidade para oblcr
“ 0,1056
e
Piefy =- 0,2642
Cortiji'.1. - ¡y = 1/2, a probabil idade de classiPtca^o ¡acórrela, consecuentemente, é
P 0,1849
r
De forma cquivaJcnic. a probabilidad# da carreta é
P¡ = ]-Pc
= 0¿l5J
Determinado Experimental do Perceptron Ótimo de Múltiplas Camadas
A Tabel a 4.1 Li sta os parámetros variáveis de um pcrccptron de múltipl as camadas (M LP, m uítifayer
perveptmn) que envolve uma única camada de neurónios ocultos e que é Irtinado com o algoritmo
de retropropaga^áo operando no modo MqQcDcial. Como ó objetivo último de um classificador de
padrees c alcanzar uma taxa aceita ve] de classifLca^áo correta, este criterio é usado para julgar
quando os parámetros variáveis do MLP (usado como um clarificador de padrfia) sfo olimos.
TABE LA 4j Parámetros Variáveis do Perceptron de Múltiplas Camadas
Parámetro SiiTiboln lltHMkl Tipian
Número de nftndúiM muJioh C2,«)
Paramdru da Lixli de apréridizigéiTL ’l (0. 1)
Cerneante de momento a (0, 1)
Número Ótimo de Neurónios Ocultos. Rcfletindo as abordagens práticas para o problema da
dcEcrmina^ao do número ótimo de neurónios ocultos, hj . o criterio utilizado c o menor número de
neurónios ocultos que produz um desempenho “próximo” ao do clarificador bayesiano - nor-
malmenle dentro de I por cento. Assim, o estudo experimental cometa com dais neurónios ocul-
tos como ponto de partida para os resultados de simulado resumidos na Jabela 4.2.
JABELA 4.2 Resultados da £imulai¿ao para Dais Neurónios Ocultas*
Numero du Radüda Tamanho do (. .ir. iiiüú de TreinamerLlc XiirTieru dti Épocas Erro Métlki Quadradu Prubab: 1 idade de CIU*ÍfÍC3Q3n Carreta, P
50ft 320 O,2??5 80.36%
2 2000 so 0.2341 80,33%
3 JWJOü 20 0.2244 80,47%
"Pajuineini d.i |K4 de jprL’iLdi/jgLTTl T[ — il, I Lr nkum^nh? / - IJ.
Como o propósito do primeiro conjunto de simulafdes é meramente verificar a suficiencia cm náo
dos di - is neurónios ocultos, o parámetro da laxa de aprendizagem Y} c a constante de momento a sao
filados arbitrariamente cm um valor nominal. Para cada rodada de simulado, ucn conjunto de
treinamento de exemplos, geradns aleatoriamente das distribuifoca gaussianas para as classes e
corti igual probabilidade, é repetidamente circulado através da rede, com cada cielo de treina-
mentó representando uma época. O número de épocas ó cscolhido de modo que o número total de
exemplosde treinamento utilizados em cada rodada constante. Farendo assim, qualquer efeito po-
tencial surgido pelas variaí^es dos lamentas do conjunto de treinamento sao compensados pela
média.
Na Tahcla 4.2 e ñas tabel&s sutaeqüentes, o erro medio quadrada é calculado precisamente
como o funcional de cric d clin ido na Eq. (4.5 3). Enfatizamos que 0 erro medio quadrado é incluido
nestas (abelas sámente para efeito de registro, uma vez que um emt wMo quadrado pequeño nao
implica necesariamente boa generaHracao (1,0-, tara desempenho com dados nlo-vistos anterior-
mente).
Após a convergencia de uma rede treinada com um número total de N padrees, a probabilidade de
classi fiea$3o carreta pode ser calculada, teóricamente, como segue:
M WJ (466)
onde pt pt 1 /2t e
Pk.VN,)- Ádl'Q*
J El.í.Vl
J O I.M
(4.67)
(4.68)
e O,(N) é a regido no espado de decisáo sobre a qual o perceptron de múltiplas camadas ((reinado
com N padrees) classifica o vetor x (representando uma realizado do vetor aleatorio X) como
pertencente á classe Esta regido é usualmenle encontrada expelí mental mente pela estimativa da
fan^o de mapeamento aprendida pela rede e entáo aplicando-se a regra de dccisáo da saída da Eq.
(4.55). Infelizmente, a estimativa numérica de /^c^Vfft]) c ¿ problemática porque nao
podem ser encontradas fácilmente expressfies fechadas descreyendo a frenteira Í2(A).
Conseqüentemente, recorremos ao uso de uma ahordagem experimental que envolve testar o
perceptron de múltiplas camadas cm rcla^áo a ouiio conjunto independíenle de cxcmplos que sáo
novamente retirados aleatoriamente das distribuyes para as classes f6( e^, com igual probabilida-
de. Suporta que A seja uma variável aleatoria que conte o numere de padrees retirados dos N
padrees de teste que sao classificados corretamcntc. Eniao, a razao
A
é uma variável aleatoria que fomece a estimativa scin bilis por máxima vcrossimilhan^a do desem-
penho de classiñcafáo real ? da rede. Assumindo que p seja constante sobre os N pares de entrada*
saída, podemos apU i car o /uwjís de C^rnf>ffiÜí\myc, 1991) para o estimador /\.de/>+ obtendo
” J3! e) < cxp(-2ti?V) = o
A aplicado do limite de ClicmoíTproduz N ™ 26.500 para e = 0,01 c 3 = 0,01 (i.c,t 99 por ccnto de
certeza que a estimativa/» techa a tolerancia dada). Tomamos, entáo, utm conjunto de teste de tama-
nho 32.000. A última col una da Tabela 4.2 aprésenla a probabilidade de classifica0p correta
estimada para este tamanho de conjunto de leste, com cada resultado sendo a médía de 10 tentativas
independentes do experimento.
O desempenho de classiñca^áo apresentado na Tabch 4.2 para um perccptron de múltiplas
camadas usando deis neurónios Ocultes já í razoavetmente próximo ao desempenho bayesiano =
H] .51 por cent O- Com ¡sso, podemos concluir que para o problema de elassificaffio de padróes
descrito aquí □ uso de dois neurónios ocultos é adequado, Para ení alizar esta concluí sáo, na Tabela
4.3 aprescnlamos os resultados de simula^ocs repelidas para o caso de qualro neurónios ocultos,
com todos os cultos parámetros mantidoa constantes. Apesar de o erro medio quadrado na Tabela
43 para quatro neurónios ocultos ser um pouco mais baixo que aquele da Tabela 4.2 para deis
neurónios ocullos, a taxa inedia de classificagoes córrelas nao inostra mclhoria; de fato, ela c um
pouco pior. Para o resto do experi mentó compuiacional descrito aquí, o número de neurónios ocul-
tos ó mentido cm dois. * L
TASELA 4,3 Resultados da Simulado para o Perceptron de Múltiplas Camadas
Usando Qualro Neurónios Ocultos'
Número da Rodada Tamanho do Conjunto de Treinamento Número de F.pocss Etto Medio Quadrado Probabilidad? de Clarificado Correta,
] 500 320 0.2 IW 80.íí0%
1 2ü(J:i RO 0,2 LM (Q.R|%
1 HOÚfl 2Ú 0,2142 80,19%
PiTiimclnj da. tul de iiprendizii^m T] - IL | e cwstícitiJ Je momento <i 0.
Aprendizagem Olí ni a c Consta n tes de Mom en hi. Para os valores LLóti mos** do parámetro da laxa
de aprendizagem p e constante de momento ft, pedemos usar uma das tres defini^es:
L Os n e ft. que em media produzem convergencia para um mínimo local na superficie de erro da
rede com o menor número de épocas.
2, Os p e oc que, para o pior caso ou em media, produzem convergencia para o mínimo global na
superficie de erro com o menor número de épocas.
3. Os T] c a que cm media produzem convergencia para a configurado de rede que lem a mcitior
generalizafáo sobre todo o espado de entrada, com o menor número de épocas.
Os termos “média“ c "piorcaso" usados aquí se referem á distribuiqao dos pares de enlrada-saida de
treinamento, A definirán 3 c ideal na pratica; entretanto, c difícil aplicada, pois minimizar o erro
medio quadrado é normalmente □ criterio matemático para a otimi/a^áo durante O treinamento da
rede, e, como afirmado anteriormente, um baixo erro medio quadrado sobre um con]unió de treina-
mento nao implica necesariamente boa generalizaba. Do ponto de vista de pesquisa, a definífáo 2
ú mais mteressanie que a definían I, Em l.uo (1991), por exemplc, sáo apresentados resultados
rigorosos para a adapia^áo otima do parámetro da taxa de aprendizagem r[, de modo que o menor
número de épocas seja necesario para o perceptron de múltiplas camadas aproximar a matriz de
pesos sinápticCK globalmcnle ólima com uma prceisáo desejada, embora para o caso especial de
neurónios lineares. Em geral, entretanto, procedimentcs heurísticos e experimentáis dominare a
sele^áo ói: ma de tj e íi quando se usa a definido I. Para o experimento descrito aquí, consideramos,
perianto, a otimizafáo no sentido da definifáo I.
Util izando um perceptron de múltiplas camadas com dois neurónios ocultos, sao simuladas
corebinaqocs do parámetro da taxa de aprendizagem r| e {0,01. OJ, 0,5, 0,9J e da constante de
momento a g {0,0, 0.1.0,5. 0,9* para observar seu efeito sobre a convergencia da rede. Cada
oombina^áo'é trenada com o mesmo conjunto de pesos alealórios iniciáis e o mes ni o conjunto de
500 exemplos, de modo que o$ resultado* do experimento possare ser comparados diretamenfe. O
Copyrighted m aterí
proccsso de aprendizagem foi continuado para 700 épocas, após o que ele foi encerrado; esta exten-
s3c de treinamento foi considerada adequada para o algoritmo de roiropropas^i^áü alcanzar um
mínimo local na superficie de erro. As curvas de aprendizagem médias de ensemble assim calcula-
das eslío trepadas ñas Fígs. 4,15a - 4.1 5d, que estío agrupadas por t|.
As curvas de aprendizagem experimentáis mostradas aquí sugerem as seguinies tendencias:
FIGURA 4.15 Cunes tfs aprendizajem medias de ensarnóte para momentos n va’ iáv&¡s
e os seguíntes wateres efe parAmelroe da laxa de aprendizagem: (ai n - 0,01, (b) q = 0,1,
(c) n = 05 e (d) n = 0,9
(<}
Ejbo
quádcadn
FlGUHA 4.1 &
* Enquanio que, cm geral, um pequeño parámetro da taxa de aprendizagem T] resulta cm uma
convergencia ¡neis lenta, ele pode loeali¡car mínimos Locáis “mais profundos" na superficie de
erro do que um rj grande.
• Para r, 0, o uso de a —> 1 produz um aumento da veiocidadc de convergencia. Por oulro
lado. para q —> I, o uso de a —> 0 é ncccssário para asegurar a eslabilidade da aprendizagem.
• O uso das constantes iq = {0,5,0,9 | cCH 0,9 causa oscilares no erro módio quadrado durante
a aprendízagem e um valor mais alio para o erro medio quadrado na convergencia, sendo
ambos efciios tndcseiávcis.
Na Fig. 4.16, mostramos gráficos das “melhorcs” curvas de aprendizagem para cada grupo das
curvas de aprendizagem trabado na Fig. 4.15, para determinar a melhor curva de aprendizagem
^global”; "melhor" sendo definido no sentido do ponto 1 descrito anteriormente. Da Fig. 4.16. é
aparente que o parámetro da laxa de aprendizagem étimo T|i(l é cerca de 0.1 e a constante de
momento ótima a . mii écerca de 0,5. Assim, a Tabela 4.4 resume os valores “étimos” dos parámetros
da rede usados no restante do experimento. O falo de que o erro medio quadrado final de cada curva
na Fig. 4.16 nao varia significativamente no intervalo de T] C ffl sugere uma superficie de erro "bem
comportada” (i.e., relativamente suave) para o problema.
Erro
midió
quadrado
FIGURA 4.16 Melhtwes torvas da aprandiíagem seleoonades das qualro partes da Fig. 4.15
TASELA 4.4 Conligurafáo do Perceptron de Múltiplas
Camadas Otimizado-
Parámetro Símbolo Valor
Número olimo de ncurñ:jos ocultos m.í.rio 2
Farimelrü ülirnfl da casa de nprendizagcm 0,1
Constante de momento ólima a iRinr 0,5
A% aliacán do Projeto Otinm de Rede. Dado o perceptron de múltiplas camadas “oti ni izado” com
os parámetros resumidos na Tabela 4.4, a rede final é avallada para determinar a sua fronteira de
decisao, a curva de aprendizagem media de ensamble c a prohabíIidade de clarificadlo córrela.
Com conjuntos de treinamento com tamanho finito, a funQáo aprendida pela rede com os parámetros
olimos é “estocas!ica” por natureza. Conscqücnlcmcjuc, estas medidas de desemperlbo sao medias
de ensemble sobre 20 redes tremadas indcpcndcntcmcntc. Cada conjunto de treinamento consiste
de 1000 exemplos. retirados das distribuíqocs para as classes^ e^com igual probabilidade eqüfi
sáo apresentados á rede em ordem aleatéria. Como anteriormente, o treinamcnic se estendeu por
7Q0 épocas. Para a determinado experimenta] das probabilidades de classilicacáo córrela, o mes-
m conjunto de teste com 32.000 exemplos usado anteriormente é utilizado novamente.
A Fig. 4.17a mostra tres das "melhores*' fronteras de deci&fo piara tres redes do ensemble de
20. A Figura 4. i 7h mostra tres das ''piores" frente i ras de dccisáo para tres cunas redes do mesmo
ensemble. A fronte ira dcdccisao bayesiana (circular) sombreada está incluida cm ambas as ti guras
FIGURA 4,17A 'Irártco das trés ‘malhorM'fronfalrai de declsáo para as sa^uintes precitífes
re classiticaf£o: 80,39.60,40 e 90.43%
FIGURA 4.17E Gráfico das tr^s ‘piares" IrpnleirflS de cfecisád para a& soguirttee
precisara efe cl&ssificajpáo: 77.24. 73.01 a 71,59%
como referencia. Destas figuras observamos que as fronte! ras dedeo sao construidas peto algoritmo
de retropropaga?áo sao convexas em relaqao á regiao onde elas classiñtam o vetor de observapño x
como pertcnccntc i classe ou i classe %..
As estatificas dccostmblc das medidas de dcscmptnho, prúbáti i I idade decías* ¡.ficaqio CürTCta
e erro medio quadrado final+ calculadas sobre a amostra de treinamento, etóo Lisiadas na Tabela
4.5. A probabilidade de classcíicafáo córela para o classificador bayesiano étimo é 81,51 %.
TASELA 4.5 Estatística& de Ensamble de Medidas de Desempenho (Tamanho da Amostra = 20}
Medida de Desempenho Múdia Desvio Padrio
Probabilidade de dassificacáo correta Erro médio quadrado final 79,70% 0,2277 0,44% 0,0118
4.9 DETECQÁO DE CARACTERÍSTICAS
Os neuranias ocultos desempenham um papel crucial na operacao de um perceptron de múltiplas
carnadas com aprendizagem por retropropaga^do porque agem como detectara c/¿ características.
Conforme o processo de aprendizagem avanza, os neurónios ocultos come^am gradualmente a
“descobrif' as características salientes que caracterizan] os dados de treinamento. Eles lazem isso
realizando uma transformado nao-linear dos dados de entrada para um novo espado chamado de
espado oculto* ou espado de características; estas duas terminologías sáo usadas alternadamente
em lodo o livro. Neste novo espado, as dasses de interesse em uma tarefa de classifica^ao de pa-
dróes, por exemplo, podem ser mais fácilmente separadas entre si do que no espado original de
entrada. Esta afirmafao é bem ilustrada pelo problema do XOR considerado na Se^áo 4.5.
Colocando a questao cm um contexto matemático, considere um perceptron de múltiplas ca-
madas com uma única camada nio-linearcom m! neurónios ocultos, e uma camada i inear detn,~ Af
neurónios de salda. A escolha de neurónios lineares na camada de saída é motivada pelo desojo de
concentrar a aten^ao sobre o papel dos neurónios ocultos na operaifSo do perceptron de múltiplas
camadas. Suponha que os pesos sinápticos da rede sejam ajustados para minimizar o erro médio
quadrado entre a saída-aIvo (resposta desejada) c a saída real da rede, produzida cm resposta a um
vetor (padrao) de entrada de dimensao m . com a media de Cnscmble calculada sobre um total de N
padróes, Suponha quei^fl) represente a saída do neurónio ocultoJ devido á apresentai^o do padróo
de entrada n. z(ff) c uma ñir^áo nao-tincar do padrao (vetor) de entrada aplicada a camada de
entrada da rede em virtude da funche de ativafdo sigmóide incorporada em cada neurónio oculto.
A saída do neurónio k na camada de saída é
„ = l2..w (4.®)
onde wh1 representa o bias aplicado ao neurónio k. A fun^ao de custo a ser minimizada c
Jf M
« ™> = W») - Ai"»’ (4.70)
Note que assumirnos aqui o uso do modo de operafao por lote. Usando as Eqs. (4.69) e (4.70), é
fácil reformular a funf áo de custo na forma matricial compacta:
í - — IId-wzI?
2 A,'II
(4.71)
onde W é a matriz Af-por-m de pesos sinápticos relativos á camada de salda da rede. A matriz ¿ é
u matriz nq-por-.W das; saldas dos neurónios ocultos (subtraidos os seos valores medios), que sSo
producidas pelos ,V padrñes individual?, de entrada aplicados á camada de entrada da rede; isto é.
Z - {(z, (w)- p. ); y = 1,2,...,™,: h = Lt2.............Ar]
onde p, c o valor medio de z(jt), Crmseqüentenneiite, □ matriz Dea matriz .W-por-.V dos padróes-
alvo (respostas desejadas) apresentados á camada de entrada da rede; isto é.
D = {«(fr)-nJj); í-l,2...,W: fl-l,2...Ar}
onde ó o valor medio de A minimizado de fím . definida pela Eq, (4.70) c rcconhccida
como um problema linear de mínimos quadrados, cuja soluto é dada por
w = b¿*
(4.72)
onde Z' é a pseudo-inversa da matriz Z. O valor mínimo de ¥n o dado por (veja o Problema 4,7)
= ^1r[ññ'ñ7/(7,Zr)-¿D']
(4.73)
onde tr[-] representa o operador tra^o. Como os padróes-alvo represen lados pela matriz D sao todos
fixos, minimizar a funijao de citóte em relajan aos pesos sinápticos do perceptron de múltiplas
camadas ¿equivalente a maximi/ara fiin^aa discriminarte (Webb c I.qwc„ 1990)
a = n[ctc;]
(4.74)
onde as matrizes C. cC, sao definidas como:
E> 1
• A matriz C. rn -por-m(é a matriz de (Watiánefo total das saidas dos neurónios oc ul tos devido
á apresen ta^áo dos .V padróes de entrada-
(4.75)
A matriz C ' é a pseudn-inversa da matriz C.
• A matriz CA m ^pOr-WFj ¿ definida como:
Ct^ZDr DZ'
(4-76)
Nole que a fucilo d-acriminante01 definida na Eq., (4.74) c determinada totalmente pelos neurónios
ocuIfos do perceptron de múltiplas camadas. Também náu há rcstrifao no número de camadas ocul-
tas que couNlnuem a transformacáo nfo-linear responsávcl por gerar a turneo discriminante S&. Em
□m pcrccptron de múltiplas camadas com mis de uma camada oculta, a matriz Z se refere ao
conjunto inteiro de padróes no espado definido pela camada final de neurónios ocultos.
Para urna interpretafao da matriz C(, considere a escolha específica de um esquema de
codificando um-de^M (Webb e Lowt, 1990), Isto é, □ valor-alvo (resposta desejada) em um padrea
particular ¿ a unidadc se o padreo escolhido pertence áquela classe, e zero caso contrario, como
mostrado em (veja página 210)
ü
0
¿(n) =
<- ¿-ésimo elementa, ¿(a) e
0
Assim, se houver Ai classes, A: = 1,2,,..t Af com A; padróes na classe e
J- = I
podemos cnlao expandirá matriz C, pare este esquema particular de codificaba na forma
c, = - HJK, -Hj (4.77)
>1
onde o vetor [1 A, m -por-l, é o valor médio do vetor das saidas dos neurónios ocultos calculado
sobretodos es A’. padróes na classe<É1, e o vetorg, é o valor médio do vetor das saldas dos neurónios
ocultas sobre todas as Arapresenti^oes de entrada. De acorde com a Eq. (4.77), podemos interpretar
C , como a matriz de covariancia ponder ada entre cfasses ñas saidas da camada oculta.
Assim, para um esquema de codificaba 1-de-jtf, a perceptron de múltiplas camadas maximiza
uma funbo1 discriminante que é o tra$o do produto de duas matrizea: a matriz de covariancia pon-
derada entre classes e a pseuda-ínversa da matriz de covariancia total. Este resultado é interessante
parque ilustra como um perceptron de múltiplas camadas com aprendizagem por rctropropagabo
incorpora prioriiariamente as propor^óes das amostras dentro das classes individuáis.
A Rela^áo com o Discriminante Linear de Fisher
A fim^ao discriminante definida na Eq. (4.74) c única para os perceptrons de múltiplas camadas.
Ela tem uma grande scmclhan^a com o discriminante linear de fisher, que dcscrcvc uma transfor-
mado linear de um problema mullidimenslonal em um problema unidimensional. Considere uma
variivclv formada como urna combinaba linear dos elementos de um vCtcr de entrada x; isto c, cía
é definida como o produto interno de x e um vetor de parámetros ajustáveis^ w (que inclui um bias
como o sen primeiro elemento), como mostrado por
V = wrx
O vetor x c retirado de uma de duas populares, e t/. , que diferem entre si pelos seus vetores
médios g, e respectivamente. O critérío de Fisher para discriminar entre estas duas classes é
definido por
onde Cea matriz de covariancia entreciaiica (^intcrclasscs') definida por
e C é a matriz de covariancia no interior das elams (“intraclasse") total definida por
c, = X (*, -1¿1 Xwn - Jl| )f + £ - M1- - Hj)'
ricf| **^1
A matriz de covariancia intraclassc C, c proporcional á matriz de covariancia do conjunto de tre i ñá-
mente. Ha é s¡métrica c defimda nao negativamente c normalmente nao-singular se o tamanho do
conjunto de treinamento for grande. A matriz de covariancia ínter dasses CA é também simétrica e
definida nao negativamente, mas singular. Uma propriedade particularmente interessante é que o
produto matricial C ,w está sempre na direcáo do vetor diferen^a de medias - p.r Esta proprioda-
de segué diretamente da definiese de C#.
A expressao que define J(w) c conhccida como o quntíenle Rayteigh generalizado. O vetor w
que maximiza J(w) deve salisfazer a cóndilo
Qw - XCw <4.76)
A Equa^áo (4.76) é um problema de a uto valor generalizado, Reconhecendu que no nosso caso o
produce matricial t:_ w está sempre na directo do vetor dlferen^a p1 - p constatamos que a soluto
para a Eq. (4.76) é simplesmenie
w = C;1(gl-pí) (4.77)
que é referido como o discriminante linear de Fixher (Duda c Kart, 1973).
Retomando A questáo da delecto de características, lembre-se de que a fuñólo discriminante
j da Eq. (4.74) relaciona a matriz de covariancia intraelasscs c a matriz de covariancia total dos
padrees transformados para o espado oculto da rede. A fiinpao discriminante ffl desempeora um
papel sirni lar aquel c do discriminante linear de Fisher. Esta é exatamente a razáo por que estas redes
neurais sao capazcs de realizar cao bem a larcfa de classiñca^ao de padrees.
4.10 RETRO PRO PAG A^ÁO E DIFERENC1AQÁO
A reiropropagacac (back'propagarían) c uma técnica especifica para implementar a debida do
gradiente no espado de pesos para uma rede de múltiplas camadas alimentada adiarte. A idéia
básica é calcular eficientemente as derivadas partíais de uma fiinqao aproximaba Hw^x) realizada
pela rede em relajo a todos os elementos do vetor a justável de peso w para um dado valor de vetor
de entrada i. Aquí se cncontra o poder computación?! do algoritmo de retropropaga^ao?
Para serraos específicos, considere um perccptron de múltiplas camadas com uma camada de
entrada de nós. duas camadas ocultas e um único neurónio de saída. como representado na Fig.
4.18. Os elementos do vetor de peso w sáo ordenados por camada (comc^ando da primeira camada
oculta), a seguir per neurónios em uma camada, e entao pelo número de uma sinapse dentro do
neurónio, Suponha que wj'1 represente o peso sinóptico do neurónio i para o neurónio j na camada
1=0,1,2.....Para / = 1, correspondendo a primeíra camada oculta, o índice i se refere a um nó de
fonte em vez de um neurónio. Para f= 3, correspondiendo á camada de saída na Fig. 4.1E5 temos/ =
1. Desojamos estimar as derivadas da fun^áo Ffw.i) cm relapso a todos os elementos do vetor de
peso w, para um vetor de entrada específico, x = . Noto que, para ! = 2 (i.e.» uma
única camada oculta), a funfáo F(wj) tem uma forma similar ¿quela do lado di re i lo da Eq. (4.69).
Incluimos o vetor de peso w como um argumento da fuñado F para concentrar a atembo sobre ele.
O perceptron de múltiplas camadas da Fig. 4,18 é parametrizado por uma arqtt ¡tetara (re-
presentando um parámetro discreto) c um vetar de peso w (constituido de elementos continuos).
Suponha que represente a parte da arquitetura que se estende da camada de entrada (/ = 0) até o
nó j na camada l 1,2,3, Consecuentemente. podemos escrever
F(w,x)=q»(.í4í|31)
(4.80)
frimeiií
camada
Mulla
CirtiLkL
de «¡da
Sígutids
carnada
oculta
Camad¿
devnirtdfi
FIGURA 4J B PMMptr&fl dfi miiItiftóG
camadas oom duas camada» ocultas 6
um MLKÓfiio d& saida
ende tp é a fundió de ativa-pao. Entretanto, eleve ser interpretado meramente como um símbo-
lo arquitetural em vez de uma variavcl. Assimh adaptando ás Eqs. (4.1}> (4.2), (4J 1) o (4.23) para □
uso ncsia situarStb oblemos os seguintes resultados
^¡I' )<•
<3F(W, i)
”^r
= q>'(jg.*n hp'Gtfj11 )W,
, i
(4 81)
C*82)
(4.83)
onde «(Té a di vivada parcial da nao-lineartdade u em relapáo á sua entrada, e j é o i-ésimo elemento
do vetar de entrada je. De modo similar, podemos derivar as cqua^ocs para as derivadas pare tais de
uma rede genérica com mais n turónos ocultos e mais neur&nios na camada de salda.
As Equafdes de (4.81} a (4.83) fomecem a base para calcular a scnsibilidade da fúnfác de
rede cm rcla^ao a varia^oes nos elementos do vetor de peso wr Suponha que o represente um
clemente do vetor de peso w. A sensibitidüde de F(w,x} cm rcla^áo amé definida formalmente por
sí —
" <Wté
(Ufe w
É por esta razan que nos referimos á parte inferior do grafo de fluxo de sinal da Fig. 4.7 como um
"grato de sen sibil idade
A Matriz Jacobiana
Suponhaque H' represente o número total de parámetros Irire (i.c., pesos sinópticos o bias) de um
perceptron de múltiplas camadas, que están ordenados da maneira descrita para formar o vetor de
peso w. Suponha que A' represente o número total de exemplos usados para tremar a rede. Utilizan-
do a retropropagaíán, podemos calcular um conjunto de W derivadas partíais da fun^oaproximo-
tiva F]w, x(n)J cm rclacao aos elementos do vetor de peso w para um exemplo especifico x(rt) do
conjunto de treinamento. Repetíndo estes cálculos para a 1» terminamos com uma matriz
/V-por- JFde derivadas paro i ais. Esta matriz c denominada a jacobiana J do perceptron de múltiplas
camadas calculada cm x(u). Cada 1 inha da jacobiana corresponde a um exemplo particular do con-
junto de (reina metilo.
Há evidencia experimental para sugerir que muitos problemas de treinamento de redes neurais
bSo intrínsecamente njul-condicionados,levando a umajacobiana J que é quase deficiente em posto
(Saariocn et al., l991). O/nu/ir de uma matriz é igual ao número de coluros ou linhas linuarmente
independentes da matriz, aquelc que lor o menor. Diz-sc que a jacobiana ú deficiente em posto se o
seu posto for menor que irinf.V, IK). Qualquer deficiencia em posto na jacobiana leva o algoritmo de
rctroprüpagd^o a obter apenas informado parcial das direí oes de busca possiveis, e causa também
longos tempos de treinamento,
4.11 A MATRIZ HESSIANA
A matriz hessiana da fundió de custo 7 iw), representada por H, é definida como a derivada
segunda de em relaíúo ao vetor de peso w, como mostrado por
&wJ
(4.84)
A matriz hessiana desempenha um papel importante no escuda das redes neurais; específicamente,
podemos mencionar o negó inte i6
I. Os auiovalorcs da matriz hessiana (ém uma influencia profunda na dinámica da aprendizagem
por retrepropaga^áo.
2. A inversa da matr.z hessiana fomece uma base para podar (i.e., excluir) pesos sinópticos insig-
mücantes de um perceptron de múltiplas camadas, como discutido na Se^o 4.15.
3. A matriz bcssiana c básica para a formulado de métodos de otimizacao de segunda ordem
come uma alternativa para a aprendizagem par retropropagacao, como discutido na Se$áo 4.18.
Um procedimenlo iterativo para o cálculo7 da matriz hessiana é apreseniado na Seqiio 4.15, Nesta
sepilo, restringimos nasaa aten^ao ao ponto 1.
No Capítulo 3, indicamos que a auto-estruiura da matriz hessiana tem uma influencia profun-
da ñas propiedades da convergencia do algoritmo LMS. Isto também acontece com o algoritmo de
retropropaga^áo, mas em urna forma muito mais complicada. Típicamente, a matriz hessiana da
superficie de erro relativa a um perceptron de múltiplas camadas tremada com o algoritmo de
retropropaga$£o tem a seguí nte compos i^io de auto valores (LeCun, et al-, 1991: LeCun, 1993):
• Um pequeño número de autpvalares pequeños.
• Um grande número de autovalOrúS médiOs.
• Um pequeño número de autovalores grandes.
Os fatores que afetam esta composiqito podem ser agrupados como segue:
• Sinais de entrada com media diferente de zero ou sinais neuronais de salda induzidos com
media diferente de zcro.
• Corrcla^óes entre os elementos do vetor sinal de entrada e correla^óes entre síullls neuronais
de saida induzidos.
• Grandes variares ñas derivadas segundas da fun(3o de custo em relajo aos pesos sinápticos
dos neurónios da rede, quando prosseguirnos de uma carnada para a próxima. As derivadas
segundas sáo freqúen temen te menores ñas camadas mais baixas, com os pesos sinápticos na
pe imeira camada oculta aprendendo lentamente e aqueles na última camada aprendendo rápi-
damente.
Do Capítulo 3 recordamos que o tempa de aprendizagem do algoritmo LMS c scnsivcl a vartaqacs
no número condicionante X /X.., onde X é o maior auto valor da hessiana e ¡1 . é o seo menor
auto valor diferente de zero. Resultados experimentáis mosiram que um resultado similar vale para
o algoritmo de retropropaga^ao, que é uma generalizado do algoritmo LMS. Para entradas com
media diferente de zero, a razio Xiui \ é maior que o seu valor correspondente para entradas com
media zero: quanto maior for a media das entradas, maior sera a razao X.m (veja o Problema
3.10). Esta observa^áo tcm uma séria implioafáo para a dinámica da aprendizagem por
retropropaga^áo.
Para minimizar o tempo de aprendizagem, deve-se evitare uso de entradas com media dife-
rente de zcro. Agora, considerando-se o vetor de sinal i aplicado a um neurónio na primeira camada
oculta de um pcrccpitron de múltiplas camadas (Le., o vetor sinal aplicado á camada de entrada), é
fácil remover a media de cada elemento de i antes de aplica-Lo á rede. Mas o que dizer dos sinais
aplicados aos neurónios das camadas ocultas restantes e da camada de saída? A resposla a esta
questao se encontra no tipo de fun^ao de ativacao usada na rede. Se a ñin^ác de ativafáo for n^o-
Siin-étrica, como no caso da fun^áo logísúca, a saida de cada neurónio está restrita ao intervalo [0.1 ].
Uma escolha assim introduz uma fonte de bias listemótico para aqueles neurónios localizados além
da primeira camada oculta da rede. Para superar este problema, precisamos usar uma fúnfáo de
ativacao anti-simétrica tal como a fúnfáo tangente hiperbólica. Com esta escolha, permítele que a
salda de cada neurónio assuma valores tanto positivos como negativos no intervalo [-1, 1], e neste
caso é prOvável que a sua media seja zcro. Se a ccnectb idade da rede for grande, a aprendizagem
por retropropagafáo com fún^óes de aiiva^áo anti-simétricas pode produziruma convergencia mais
Hidden page
íb)
FIGURA 4.19 {a) Dados ajustados adequadanwnte (Coa gefisraltwfáo)
(b) DódúÉ ajustados om oxcasso fáanéraliza^o pobro)
procurar um mapramcnio nao-linear suave: para retardé* de cntrada^saídii mal-fcrmula<lasT de modo
que a rede seja capaz de clarificar coritamente rovos padrees em rela^ao aos padróes de treina-
mento (Wieland e Leighton, 1987),
Tamanho Suficiente do Conjunto de Treinamento para uma Generalizarán Válida
A general i za^íi o ¿ influenciada por i rés fátores: (I) o tamanho do conjunto de treinamento* e o quito
representativo do ambiente de íntenesse ele é* (2) a arqunetura da rede neural e (3) a complcxidadc
física do problema em questáo. Evidentemente, náo temos controle sobre o último fator. No contex-
to dos nutras dois fatores, podemos ver a questáo da general ¡zapito St>b duas perspectivas diferentes
(Hushe Home, 1993):
A anqu 11 etu ra da rede é fixa (provavelinentc de acorde com a compl ex i dade fia i ca do problema
relacionado^ c a questáo a ser resol vida é determinar o tamanho do conjunto de Ireinamento
neccssário para que acorra nina boa generaliza^-
• O tamanho do conjunto de treinamento é fixo, e a questáo de intenesse c determinar a mclhor
arquitetura para alcanzar boa generalizacáo.
Estes deis pontos de visia s3o válidos em seus aspecto'; individuáis. Na presente discussáo, nós nos
concentramos no prime i ro ponto de vista.
A adequafáo do tamanho da amostra de treinamento ou o problema da complcxi Jade da amostra
é discutido no Capitulo 2. Como rcssaltado naquele capítulo» a dimunsáo V-C fornece a base teórica
para uma solu^áo bem-fundamentada para este importante problema. Em particular, temos fórmu-
las independente/i íitfdiatribui$¿ú e de piur claro para estimar o tamanho da amostra de treinamento
que é suficiente para um bom desempenho de generalizacao; veja a $D?ao 2.14. Infelizmente» cons-
tatamos com freqücncia que existe uma difcrcntja numérica intensa entre o tamanho da amostra de
treinamento realmente nceessária e aqueta prevista por estas fórmulas. É esta diferenp que tem
lomado O problema da complexidad? da amostra urna área de pesquisa em aherto.
Na prática, parece que tudo de que precisamos para uma boa generalizado é que o tamanho
do conjunto de treinamento A' satisfaga a condifáo
nn
A-' = o — (4.85)
\ € /
onde W é o número total de parámetros livres (Le-, pesos sinápticos e niveis de bias) da rede c £
representa a fra^áo de erres de elassi fica^áo permitida sobre os dados de teste (como na clarifica-
do <le padrees) e representa a ordem da quantidade entre parénteses. Por exemplo, com um
erro de IG por cento, o número de exemplos de treinamento necessários deve ser cerca de 10 vezes
maior que d número -dos parámetros livres da rede.
A Equacáo (4.85) está de acordo com a negra empírica de Jfíc/rnw para o algoritmo LMS, que
afirma que o tempo de acomodado para a adaptado na filtrasen! temporal linear adaptar iva é
aproximadamente igual á extensáo temporal de memoria de um filtro de linha de atraso com deriva-
^Ses dividido pelo desajuste (Widtw e Stearns, 1985). U desajuste no algoritmo LMS desempenha
um papel até certo ponto análogo ao erro e na Eq. (4.85). Ouiras justificativas para esta negra empírica
sBo a presentadas na próxima setfo.
4.13 APROXIMADO DE FUNQÓES
Um pcrccptron de múltiplas camadas trcinado com o algoritmo de retropropaga<;áo pode ser visto
como ura vciculo prático para realizar um ifítipcíimenin nan-Iifiear de entruda-naída de natureza
geral. Para sermos espccifíeos, considere que represente o número de nós (de forte) de entrada
de um perceptron de múltiplas camadas e \f = ms represente o número de neurónios na camada de
saida da rede. A rclacáo de entrada-saida da rede define uin mapeamento de um espado de entrada
eudidiano de dunensáo para um espado de saida euclidiano de dimensáo Af. que é infinitamente
continuamente diferenciável quando a fun^áode ativa^ño também o for. Para estimar a capacidad?
do perceptron de múltiplas camadas deste ponto de vista do mapeamento de entrada-salda, surge a
seguí nte quest^n fundameni:il
Qitüt i O fíUfítem ntiníato de tamadu.t ftcidsux em ttm perceptmt de fnídtipkis cumadux enm um
rtuipeumenle de ftUrudu-xtjjda que fondee \»ma reaJüapw apneiimudti de qifíriquw mapenmetttn
euntiriuti /
Hidden page
Hidden page
Hidden page
dcslas tundes. O uso de um perceptron de múltiplas camadas para aproxima^ de fundes parece
que oferece uma vantagcm sobre as fúnqócs suaves tradicional;; esta vantagem está, entretanto,
sujciia á condi^áo de que o pnmeiio momento absoluto C, pcrmanc^a Imito; esta é uma restribo de
suavidad?.
A maldigan da dimensinfíülidadc foi iritroduzida por Richard lie liman cm scus cstudos sobre
processos de controle adaptad vos (Bel Imam 1961). Para uma mierpretapáo geométrica desta notfo,
suponha que x represente um velar de entrada de dimensáo mn e {(ju ¿í)|, i = l„ 2,..., .V, represente
a amostra de treinamento. A densidade de urnostruf^em é proporcional a A"m'. Suponha que uma
fur>?fo /{K) represente uma superficie contida no espado de entrada de dimensao mn, que passa
próximo aos pontos de dados _ Agora, se a funfjo/(M íbr arbitrariamente complexa e
(cm grande parte) totalmente desconhecida^ precisamos de pontos de amostras (dados) densos para
aprendedla bem. Infelizmente, amostras densas sao di ficéis de se encontrar cm “dimcnsócs eleva-
das11, daí a maldigo da dimensional idade. Em particular, há um cresc i mentó exponerieiid na com-
plexidad? como resultado do aumento na dimensionalidade, que, por sua vez, leva á deteriorarán
das propiedades de preenchimento do espado para pontos distribuidos aleatoriamente em espatos
de dinicnsóes mais elevadas. A razao básica para a maldigo da dimensionalidade é (Friodman,
1995):
Uma r u n< :¡n definida em um lS|’.i v de ulLt dimenHÚmahdade é provavelnicntr muito mais comple-
xa do que unía tucuso definida cm um espiten de tai xa dimcníionalidadc, c estas compl1 calóes sáo
mais di ticéis de se perceber.
O único modo prático de quebrara maldi^áo da dmnensionalidadeé incorporar con hecimento pre-
vio sobre a fundan, além dos dados de treinamento, que sabidamente seja correto.
Na prátLca, podc-sc argumentar lambcm que para se ter alguma esperanza de boa estimativa
cm um espaqo de alta dimensionalidade, devenios assegurar que a suavidad? da funi;áo dcsconhcci-
da seja crescent? com o aumento da dimensional idade do espaqo de entrada (Niyogi e Giro si, 1996).
Este ponto de vísta édesenvolvido mais delñlhadamente no Capítulo 5.
Considerandos Prátlcas
O ten rema da aprox imaqao universal é importante do ponto de vista teórico, porque fomece a ferrü-
mcfíta maifiMlica nec'í'-asáiía para á viahilidade das redes alimentadas adianlc com uma única
camada acullá como uma classe de solufóes aproximadla?. Sem este teorema, poderiam.es estar
procurando por uma solupao que nao pode existir. Entretanto, o teorema nao ó construtivo, ¡sto é.
niki especi tica realmente como determinar um perceptron de múltiplas camadas com as propieda-
des aproximafivas formuladas.
O teorema da aproximado universal assumc que a funqáo continua a ser aproximada ¿ dada e
que está dispon ível uma camada oculta de tamanho i lim i cada para a apraxima^do. Estas duas supo-
siróes slo v icladas na maniría das aplicares práticas de pereeptrons de múltiplas camadas.
O problema com pereeptrons de múltiplas camadas que usam uma única camada oculta e
que os neurónios nesta camada tcndcmaintcragir entre si glohalmente. Em S¡tuavóescomplcxast
esta interapán toma difícil de melhorar a aproximado em um ponto sem piorá-la em algum outro
ponto. Por outro lado, com duas camadas oculta? o processo de aproximacáo (ajuste de curva) se
tonta mais gereoL«aveI. Em particular, podemos proceder como segue (Funahashi. 1989; Chester,
1990):
1. As características locáis sao extraídas na primcira camada oculta- Específicamente, alguns
neurónios da primcira camada oculta sao usados para dividir □ espado de entrada em regíóes e
outros neurónios naquela camada aprendcrn as características Locáis Jaquel as regióos.
2. As carne tcríst icos givhaix sjí o extraídas na segunda cantada oculta. Específicamente; una neurón lo
na segunda camada ocuita combina as saldas de neurónios da primcira camada oculta operando
em uma reglan particular do espada de entrada, e com ísso aprende ds características global 5
para aquel a regiáo e i omece zero como saída ñas mitras negiues.
Este processo de aproximado de dois eslágios é similar cm filoso Fia á técnica spfine para ajuste de
curvas. no sentido de que os efeitos dos neurónios sao i sol ados o as aproximares cm regióes
diTerentes do espado de entrada podem ser ajustadas individualmente, Um jp/úte é um exemplo de
um? aproximarán pohrjomjal por partes.
Sontag (1992) fomcce urna justificativa adicional para a utilizado de duas camadas ocultas
no contexto dos problemas ítweram. Específicamente, o seguíate problema inverso é considerado:
Dada uma fun^aci continua de valor Vitoria] fi R” -> R'í um subconjunto compacto f<! c que
eslá incluido na imagem def, c um í > Ü, encontré uma fun^áo de valor vetoríal tp; —► R* tal que
3. seguirte candólo seja gatislleita:
|!tp(f(uii - u| < e para u E
Este problema surge na cinemática j/jverw {(linámica), onde o estado observado x(n) de um sistema
é uma ñuiQÍo das tildes conenles u(n) e do estado anterior x(i? — 1) do sistema, corno mostrado por
x(jr) = f(x(íj- 1 ),□(»))
Assumosc que f pode ser invertida, de modo que podemos resolver para u(u) cotno uma fuñico de
xOj) para qualquer x(/i - 1). A fundo f representa a cinemática direta, enquanto que a fundan <p
representa a cinemática inversa. Em termos prábeos. a motivado é encontrar urna fundo cp que seja
computável por um perceptron de múltiplas camadas. Em gcralr para resolver o problema da
cinemática inversa sao ncccssárias l'un^ocs (¡> descontinuas. E interessante que mesmu su for
permitido o uso de modelos neurais com fun^Óes de aiiva^áo descontinuas, uma única camada
oculta nao é suficiente para garantir a soluto de todos esleí» problemas inversos, enquanlu que
pcrccpirons de múltiplas camadas com duas camadas ocultas s^o suficientes para todo f, e í
(Sontag, 1992),
4.14 VALtDAQAO CRUZADA
A csscncia da aprendizagem por retropropagacao é codificar um mapeamento de entrada-saíde
(representado por um cor ¡unto de cxcmplos rotulados) nos pesos sinápticos c 1 i miares de um
perccptron de múltiplas camadas. Esperamos é que a rede se tome bem-treinada de modo que
aprenda o suficiente sobre o passado para generalizar no futuro. Desta perspectiva, o processo de
aprendí/agem se transforma em uma cscollta du parametriza^áo da rede para este conjunto de da-
dos. Mais específicamente, podemos ver o problema de ¡&eletfSo da rede como a escolha, dentre um
conjunto de estruturas de modelo candi datas (paramclri zacóes), a “mclhof1 de acordo com um
ccrto criterio.
Neste contexto, uma fcrramcnid padrao da estatísl ica conhevida como vailda^áo cruzada fbr-
necc um principio orientador atraente9 (Stone. 1974, 1978). Prinfieiramente. o conjunto de dados
disponívd ó dividido aleatoriamente em um conjunto de treinamento e em um conjunto de teste. O
conjunto de treinamento é dividido adicionalmcntc cm deis subconjunto disjuntos:
• Subcanjtifílo de en¡ma(i¡o, usado para sclccionar o modelo.
Subconjunto de vcíficia^do, usado para testar ou validar o modelo.
A motivado aquí é validar o modelo com um conjunto de dados diferente daquele usado para
estimar os parámetros. Desta forma, podemos usar o conjunto de treinamento para avaliar o desem-
penho de varios modelos candidatos c, assim, escolher o “melhor \ Ha, entretanto, uma possibil i da-
do consideravel de que o modelo assim selecionado, com os valores de parametros com melhor
desempenho. possa acabar ajustando excesivamente o subconjunto de validado. Para nos resguar-
damos desta poshibilidade, o desempenho de general iza^áo do modelo selecionado é medido sobre
o conjunto de teste, que o di Iérente do subcunjunto de validacáo.
O uso de validado cruzada c atrativo particularmente quando temos que projelar uma rede
neural grandecuja objetivo seja uma boa generalizadlo- Podemos, porexemplo, utilizar a val idafáo
cruzada para determinar o perceptron de múltiplas camadas com o melhor número de neurónios
ocultos e quando c mclhor parar o treinamento, como descrito ñas próximas duas subsc^ocs.
Selefao do Modelo
A ideia de sciccionar um modelo de acorde com a validado cruzada segué uma filosofía similar a
da minimizarán cstrutural do risco, descrita no Capítulo 2. Considere cntáo uma estnitura an inhada
de classes de funcóes bordearías representadas por
iT I_ J -i L
^={^1
(4.91)
= {F(in w);WÍ= Wb},
t = 1,
Eím palavras, a A-ésima elasse de fun^6es j-, abrange uma familia de perceptrons de múltiplas
camadas com arquitetura similar c vetores de peso w retirados de um espado de pesos
muli ¡dimensional V,. Um membro desta elasse, caracterizado pela fundió ou hipótese F = F(itw),
w t W4+ mapcia o vetor de entrada x era {0,1¡, onde x é retirado de um espado de entrada <j£ com
uma probabilidade desconhecida /* Cada perceptron de múltiplas camadas da estrulura descrita é
(reinado com o algoritmo de rctroprop3ga^áoT que c rcspcnsável pelo treinamento dos parámetros
dü perceptron de múltiplas camadas. O problema da sclcfáo do modelo c csscncialmcntc o de
escolher o perceptron de múltiplas camadas com o melhor valor de W, o número de parámetros
livres (¡.C..J pesos sináplicos c níveis de bias). Mais precisamente, dado que a resposU escalar deso-
jada para um vetor de entrada x é J » {ÜJ h definimos o erro de generalizado como
= paraxeSC
Recebemos um conjunto de treinamento com exemplos rotulados
O objetivo é seledonar a hipótese que minimiza o erro de generalizado que resulta
quando sáo fomeeidas entradas do conjunto de leste.
No desenvolvimenta a seguir as su ni irnos que a estrutnra descrita pela Eq. (4.91) tem a
propricdadede que para qualquer tamanho de amostra Ai sempre podemos encontrar um perceptron
de múltiplas camadas com um número suficiícntemtnie grande de parámetros livres W^.tL(A0, tal
que o conjunto de dados de treinamento J possa ser ajustado adequadamente. isto equivale sim-
plesmente a refórmala! o teorema da aproximado universal da sc^áo 4J 3. Nós nos referimos a
H m Jft} como o numen) de ajuste. A importancia de B m jjV) é que um procedí mentó razoável de
selepáo de modelo escolheria uma hipótese Ffx.w) que requeira Ji' ¿ caso contrario, a
complexidade da rede seria aumentada.
Suponha que um parámetro r, no intervalo entre 0 e l, determine a partifao do conjunto de
treinamento & entre o subconjunto de estimare e o subconjunto de validado. Com ST consistindo
de Ar exemplos, (1 - r)N exemplos sáo destinados ao subconjunlo de estimado e os nV exemplos
restantes sáo alocados para o subconjunto de validado. O subconjunto de estimafáo, representado
por 3" \ é usado para tremar uma seqúéncia aninhada de percEptrons de múltiplas camadas, resul-
tando ñas hipóteses .rii de complexidade crescenle. Com -7 compcsto de (I - r)Nexem-
plos, consideramos valores de W menores que ou iguais ao número de ajuste correspondente JF ((1
-r)2V).
O uso de validado cruzada resulla na escclha
ffff= min {e/fSFj)} (4 92)
í . H|T
onde v corresponde a Ffr < lfr_. {(I - r)V), e ^."(S') ° eiTO classiñca^áo producido pela hipótese
3^ quando c testada sobre o subconjunlo de validado ÍT*, consistíndo de rNexemplos.
A quesíáo-chave é como especificar o parámetro r que determina a partido do conjunto de
treinamento 9" entre o subconjunlo de esiimasáo T e o subconjunto de valida^io Em um
estudo descrito por Keams (1996) envolvendo um tratamenfo analítico desta questáo utilizando a
dimensáo VC c suportado por simulantes computacionais detalhadas, varias propn edades qualita-
tivaa do r étimo sáo identificadas:
• Quando a complcxidade da funfáo-alvo, que define a resposia desejada d em lermos do vetor
de entrada x, é pequeña comparada com o tamanho da amostra A¿, o desempenho da validadlo
cruzada é relativamente msensivel á escolha de r.
* Quando a funcáo-alvo se toma mais complexa cm rclacáo ao lamanhc da amostra N. a escolha
do r étimo tem um efeito mais pronunciado no desempenho da vatida^áo cruzada, e seu valor
dccrescc.
• Um único valorfixo de r funciona de forma e ótima para um grande i ntervalo de comple-
x idade da fun^So-alvo.
Com base oestes resultados relatados por Kcarns (1996), um valcr ñxo de r igual a 0,2 parece ser
uma escolha sensata, significando que 80 por cento do conjunto de treinamento ? sáo atribuidos
ao subconjunto de estimarán e es 20 per cento restantes sao atribuidos ao subconjunta de valida-
0&O.
Anteriormente, falamos de uma seqücncia aninhada de pcrccplrons de múltiplas camadas de
complcxidade crescente. Para camadas de entrada e de saida predeterminadas, esta seqüéncia pode
ser criada, por «templa, tendo v - p + perceptrons de múltiplas camadas totalmente conectados,
estruturados como segue:
* p pcrccptruns de múltiplas mamadas com uma única camada oculta de tamanto crescente
A, < 7rn <.. .A„.
* 9 pcrccptruns de múltiplas camadas com duas camadas ocultas; a primara camada oculta tcm
tamanho <' e a segunda canuda oculta tem tamaidio crescente ft," < A," <.. . Aj.
Quando passamos de um perceptron de múltiplas camadas para o seguíate, há um aumento corres-
pondente do número de parámetros livres ¡V- O procedimento de selecáo de modele bascado na
valida^áo cruzada como aquí descrito nos ibrnccc uma abordagem bem-fundamentada para deter-
minar o número do neurónio* ocultos de um perceptron de múltiplas camadas. Apesar de o procedi-
mento tersído descrito no contexto de classificafáo hmária, ele se aplica igualmente bem a cultas
aplicadnos do perccptron de múltiplas camadas.
Método de Treinamento com Parada Anticipada
Normal mente, um perccptron de múltiplas camadas trenado com o algoritmo de relropropaga^áo
aprendo cm estágiot partindo da realizando de fuñídes de mapeamento razoavelmenie simples para
fiutiQdes mais complexas, conforme a sessao de treinamento avanza. isto c ejemplificado pcio fato
de que, cm urna situado típica, o erro medio quadrado decresce com o aumento do número de
épocas durante o treánamenfo: cíe cometa com um valor grande, decresce rápidamente e cntáo
conllliua di mi mundo lentamente conforme a rede segué seu caminho em dire^áo a um míl-imo local
na superficie de erro. Tendo como objetivo uma boa generalizado, c muito difícil perccbcr quando
é o melhor momento para encerrar o treinamento, se olharmos apenas para a curva de aprendiza-
gem. Em perticuldi L-tmi base no que foi dito na Se^Ko 4.12 sobre general iza^So, é possivel que a
rede acabe sendo exccssivameateajustada aos dados de treinamento, .se a sesxao de treinamento nao
for encerrada no ponto ccrto.
Podemos identificar O inicio do CxCcsso de IrtinamcnlO dlravés do uso da validado cruzada,
pela qual os dados de treinamento sao divididos em um subconjunto de estimafáo e em um
subconjunto de validadlo. O subconjunto de cxcmplos de estimado c usado para treinar a rede na
maneira usual, excelo por unía pequeña modificado: a sessao de treinamento c interrumpida peri-
ódicamente! i c- aP°5 um número determinado de épocas), c a rede c testada com o subconjunto de
validado após cada periodo de treinamento. Mais específicamente, n processo periódico de estima-
uáe seguida de validado pHHsegue comu segué:
• Após um periodo de estimado (tre mámenlo), os pesos sinápticos e os ni veis de bias do
perccptron de múltiplas camadas sao todos ftxos^ c a rede opera no scu modo díñelo, para
frente, ü erro de validado é entáu medido para cada exemplo do subeanjunto de valida^ao.
• Quando a fase de v;dida0o é completada, a estimafáo (treinamento) é reinieiada para um
novo periodo, e o processo é repetido.
Este procedimcnto é referido como o de ireinafnenttf corn parada arttecipada.n
A Figura 4.20 mostra formus eoncuiluais de duas curvas de aprendizagem, uma relativa ás
medidas sobre o subconjunlo de estimaban e a outra relativa ao subconjunto de validaqáo. Típica-
mente, o modelo náo funciona tio bem iiobre o subCOnjunto de validado do que sobre o conjunto de
sobre c qual o projeto foi bueado. A c'ímtw ríe aprendizagem de estima^ao decresce
monolonamcnlc para um número cresccnlc de épocas, da mancira usual. Diferentemente, acwvd
de aprendizagem de vatída^aa decresce monótonamente para um mínimo e entilo cometa a crescer
FIGURA 4.20 llUSlrafio da
regra cte parada ¡intacipada
oa seada na v^lida^ú cruzada.
Env
média
quid rodo
conforme o treinamento continua. Quando oIhamos para a curva de aprendizagem de estima-
?So pode parecer que pederíamos melhorar o desempenho indo além do ponto mínimo da curva de
sprendizagem de validado. Na icalidadc, entretanto^ o que a rede aprende após este ponto c essen-
cial mente o ruido comido nos dados de treinamento Esta heurística sugere que o ponto mínimo na
curva de aprendizagem de validado seja usado como criterio sensato para encerrar a sessao de
treinamento.
O que acontece se os dados de treinamento nao llverem ruido? Como pederíamos entilo
justificar a parada anticipada para um cenani> determi nistico? Parte da resposta ueste caso ó que se
ambos os erres du estimadlo e de validado nSo podem ser levados a zero simultáneamente, isto
implica que a rede nSo tem a capacidade de modelar ratamente a tunero O melhor que podemos
fazer resta situado é tentar minimizar, por exemplo, o erro quadrado integrado, o que c equivalente
(grosseiramente) a minimizar o erro medio quadrado global usual com uma densidade de entrada
uniforme.
A teoría estatifica do fenómeno do excesso de ajuste apresentada em Aman el al. (19%)
sugere precau^o na utilizadlo do método de treinamento com parada antecipada. A teoría é basca-
da na aprendizagem por lote e apoiada por simula^des computacionais detalhadas envol vendo um
classificador por pcrccptron de múltiplas camadas com uma única camada oculta. Foram identifica-
dos deis modos de comporiamento, dependendo do tamanho do conjunto de treinamento:
Modo náo-assintó¡icQ, para o qual N< JK, onde Vio tamanho do conjunto de treinamento e w
ó o número de parámetros livres da rede. Para este modo de comportamento, o método de treina-
mento com parada antecipada melliora o desempenho de genera! :zafac da rede em relajan ao trei-
namento exauslivo (i.c., quando o conjunto completo de exemplos é usado para o treinamento c a
sessao de treinamento nSo é inlerrompida). Este resultado sugere que pode ocorrer «cesan de ajus-
te quando N < 30IK e que existe um mérito prática na usa de validadlo cruzada para parar o treina-
mento. O valor ótimo do parámetro rque determina a partidlo dos dados de treinamento entre o
conjunto de estimado e o conjunto de treinamento é definido por
, 72íF^T-i
" I---------
20K-1)
Para H''grande, esta fórmula é aproximada por
244 Rfr.Ufrí IXkÜkAlS
Para IF“ 100. por exemplo, r = 0,07, o que significa que 93 por ccnlo dos dados de tre i namcnlo
sao alocados para o subconjunlo de esti ma0o e 7 per cento sáo alocados para o subconjunto de
validado.
Aítxto assinfótica, para o qual Ar> 30 JE. Para este modo de comportamento, a mclhona no
desempenho de general tza^ao produzida pelo uso do méiodc de treinamento com parada antee i pa-
da em rclatf o ao treinamento exaustivo é pequeña. Em cutías pala vías, a aprendizagem exautiiva é
sahsfatória quando o tamanho da amostra de ireinamento c grande Comparado com o número de
parámetros da rede.
Variantes de Validando Cruzada
A abordagem de validado cruzada descrita ate aquí ¿ referida como o melada de resistencia. Exis-
te™ oulras varianies de valida^ cruzada que enccntram seu próprio caminho ría prátiea, particu-
larmente quando há uma cscasscz de exemplos rotulados. Nesla situando, podemos usar a validado
cruzada múltipla dividindo o conJiUrlo dispon i vcl de A/ exemplos cm K subconj unios» K > I; isto
presume que Ké dlvisivel por Ai O modelo é treinado com todos os subconjuntos, exceto um, e o
erro de validado é medido trslando-o com este subconjunto drixadode lado no treinamento. Este
procedí mentó é repetido para um total de K tentativas, cada vez usando um subconjunlo diferente
para a validado, como ¡lustrado na Fig. 4.21 para K = 4. O desempenho do modele é avallado pela
media do erró quadrado obtido na vaJidBffio sobre todas as tentativas do experimento. Há urna
desvantagem na validado cruzada múltipla: ela requer uma quantidade «cessiva de cálculos, país
o modelo deve ser Lrcinado K vezes, onde l < Á" < .V.
FIGURA 4 lluslra^-áo
do método da validado
cruzaos múltipla Rara
uma dada tsnlafiva, o
subcunjunto oe dadas
SCimbr^BtJo é usado para
validar o modelo ireinado
óam os dados restantes
TtncBiiva l
1 cnlai iva Z
I«iIb: .va 3
Quando o número de exemplos rotulados dispon i veis, A', fbr severamente limitado, podemos
usar a forma extrema de validarán cruzada múltipla conhecida como o méiwh deixe um dejara.
Neslc caso, A’- l exemplos sáo usados para [reinar o modelo, e o modelo é validado testandü-o
sobre o cxcmplo dcixado de fora. O experimento é repetido para um total de Ar vezes, cada vez
deixando de fora um cxcmplo diferente para a valida^áo. O erro quadrado na validado é entelo a
media sobre as Ar tentativas do experimento.
4.1 S TÉCNICAS DE PODA DE REDE
Para resolver problemas do mundo real com redes neurais, normalmente é necessário o uso de redes
de tamanho bastante grande, altamente cstruturadas. Uma questáo préiica que surge ueste contexto
é a da minimizacáo do tamanho da rede manteada bom dtsempenho. É menos provável que urna
rede neural com tamanho mínimo aprenda as diossiñerasias ou ruido dos dados de Iruinamcnto, c
pode assím generalizar melhor sobre novos dados. Podemos alcafar este objetivo de projeto de
duas formas:
* Pelo crescimento da rede, enmelando com um perceptron de múltiplas camadas pequeño,
pequeño para realizar a tarefa em quesillo, e enláo adicionando um novo neurónio ou uma
nova camada de neurónios ocultos sonriente quando formos incapazes de satisfazer as
especificares de projeto?1
• Pela poda da rede, come^ando com um perceptron de múltiplas camadas grande, com um
desempenho adequado para o problema em questio, e entáo podando-o pela redujo ou elimi-
na^áo de certas pesos sinápticos de uma forma setetiva e ordenada.
Nesta se$aoT enfocamos a poda da rede, Em particular, descrevemos duas abordagens, uma baseada
cm urna forma de “rcgulaiiza^ao^ e outra bascada na 4'elimina^ao" de certas conexoes sinópticas
da rede.
Regularizado da Compiexidade
No projeto de um perceptron de múltiplas camadas por qualquer método que seja, estamos de fato
construindo um modela nao-linear do fenómeno físico responsávet pela geraplo dos exemplos de
entrada-saída usados para treinar a rede. Na medida em que o projeto da rede é de natureza estatís-
tica, precisamos de um compromisso adequado entre confiabilidade dos dados de treinamento e a
qual idade do modelo (ie, um método para resolver o dilema bias-vamáiicia). No contexto da apren-
d i zagem por retropropaga^áo, ou cm qualquer outro procedimento de aprendizagem superáis i ona-
da para aqucíc problema, podemos realizar este compromisso minimizando o risco total, cxprcsso
güftlü:
S(W) + Xtc(w) (4 94)
O primeiro termo, é a medida de desempenho, que depende tanto da rede (modelo) como dos
dados de entrada. Na aprendizagem por retropropaga^áo, ela c típicamente definida como um erro
médio quadrado cujo cálculo se estende sobre os neurónios de saída da rede e que é realizado para
todos OS ejemplos de treinamento, de época em época. O segundo termo, S (w), é a punido da
compfexidade., que depende apenas da rede (modelo), a sua inclusáo impoc á solu^áú conhecimento
prévio que possamos ter sobre os modelos que estdo sendo considerados. Na verdade, a forma do
risco total definida na Eq. (4.04) é simplesmente uma formulado da íeoria da n¡guiuriza<íá<) de
Tikhonov; este assunto é detalhado no Capítulo 5. Para a presente discussáo, é suficiente considc-
rarmos X como um parámetro de reguíariza^áo, que representa a importancia relativa do termo de
punt^áo da complexidad^ em relajo ao termo de medida de desempenho. Quando X é zero, o
processo de aprendizagem porretropropagacao é inestrito, com a rede sendo totalmente determina-
da pelos exemplos de treinamento. Quando A. é infinitamente grande, por outro lado, a implicado é
que a restribo imposta pela punirán da complexidad^ é por si só suficiente para especificar a rede,
o que é uma outra forma de dizer que os exemplos de treinamento nao sao confiávcis. Em aplica-
ífies prá ticas do procedimento de dccaimcnto de peso, atribuí-se ao parámetro de regularizado X
um valor entre estes dois casos limites. 0 ponto de vista aqui descrito para a utilizacao da regulari-
zado da compleíxiidade para melhcrar a general izaqác é iníciramente consistente com o prqcedi-
mento de minimizaíáo cstrutural de risco, discutido no Capitulo 2.
Kih unía situatáo genérica, unía esecilla do (.enrío de puní cito da complcxidade €((w) é a integral
desuavizafffo de Jc-ésima erdein
(4.95)
onde Hvwj é o mapeamento de entrada-saida realizado pelo modelo^ c )i(x) é uma luirlo de
ponderado que determina a regiáo do espado de entrada sobre ;i qual Hx.w) deve ser suave. O
objetivo c tomar pequeña a ¿-¿sima derivada de Z'(x,w) em relaja ao vetor de entrada x. Quanto
maior for o valor escolhido para (. mais suave (i.e., menos complexa) se tomará a fun^ác F(x,w).
A seguir, descreveinos tres diferentes rcgularizajocsdc complcxidade (com cre&cenle sofisti-
ca j tío) para perccptrcms de múltiplas camadas.
Decaí moni o de Pesos. No prncedimento de tkanmenfü tiepestrt (Clinton, 1989), o lermo de puni-
oáo da complraidade 4 definido como a norma quadrada do vetor do peso w (i.e., todos os parámetros
livres) da rede, como mostrado por
<(*)=M
= L «í
(4.96)
onde o conjuntose refere a lodos os pesos sinópticos da rede. Este procedñnenlo opera forjan-
do alguns dos pesos sinópticos da rede a assumir valores próximos a zcro. enquanto permite que
[nitro® pesos retenliani. seus valores relativamente elevados. Conscqücntcmcnlc. os pesos da rede
sao agrupados grosseiramenle em duas categorías: aqueles que tem uma grande influencia sobre a
redo {modelo), c aqueles que tém pequeña ou nenhuma influencia sobre ela. Os pesos desta última
categoría sao referidos como ;wrw «'rce.wlMM, Na ausencia de regularizase da complexidade,
estes pesos resultam em uma generalizarán pobre, em virtudeda sua alia prohabi 1 idade de as sumir
valores totalmente arbitrarios ou causar o ajuste extensivo dos dados pela rede, para produzir uma
pequeña redujo no erro de treinamento (Hush e Home, 1993). 0 uso de regularizado deeomple-
xidade encoraja os pesos cxccssivos a assumircm valores próximos a zcro, mclhorando assim a
generalizadlo.
No procedí monto ÓC decaí mentó de pesos, lodos Os pesüs do perceptron de múltiplas camadas
sáo tratados igualmente. Isto é, assume-se que a distrihuifáo previa no espado de pesos esteja centrada
na oiigcm. Eslri rímente fa lando, o dccai mcnio de pasos nao éa forma córrete de regular i zajáo da
complcxidade para um pcrccptron de múltiplas camadas» pois nao se enquadra no raciocinio descri-
to na Eq. (4.95). Apesar dis^o. deé simples e parece que funciona bem em certas aplicajdes.
Eli minado de Pesos. Ncste segundo prnccdimcnto de regularizarán de complexidade, a punijáo
da complexidad^ é definida por (Wcigcnd el al.» 1991)
onde w( é um parámetro prccstabelecldo ew. se refere ao peso de uma sinapse j da rede. O conjunto
*4|AI1| se refere a todas as concxAes sinópticas da rede. Um termo de punido individual varia com «y
¡r,. em uma forma simétrica, como mostrado na Fig. 4.22. Quando |icj <= ?p{|, a punijáo (custo) da
FIGURA 422 O i&htkj de puní?Ao da ccxnplewtd&da 1 + (w/w ’J1) ira?ado em Funffio de w/wn.
complexidad? para aquele peso se aproxima de zero. A implicado desta cóndilo é que, na medida
cm que se considere a aprendizagem por exemplos, o f-csimo peso sinóptico nao c confiável c
deveria ser eliminado da rede. Por outro lado, quando |ir| ?> ir,., a punido (cusió) da eomplexidade
para aquele peso se aproxima do seu valar máximo, a unidade, o que significa que w é importante
para o processo de aprendizagem por retrepropaga^ác. Vemos entilo que o termo de puní cao da
complexidad?da Eq. (4.97) serve ao propósito desojado de identificaros pesos sinópticos da rede
que tem influencia significativa. Note lambóm que o proccdimenlo de eliminado de pesos incluí o
procedimentc de decaí mentó de pesos coma um caso especial; especi ricamente, para w (grande, a
Eq. (4.97) se rcduz á forma mostrada na Eq. (4.96) excelo por um falor de escala,
A rigor, o procedimenio de eliminado de pesos tambera nao é a forma cometa de regulariza-
cao da complexidad? para pereeplrocis de múltiplas camadas porque náo se ajusta a describo
especificada na Eq. (4.95). Apesar disso, com a cscolha apropriada do parámetro Wj, ele permite que
alguns pesos da rede assumam valores que s3o tria lores que aqueles com decalmento de peso (HushT
1997).
Suavizador Aprpximativo. Em Moody e Rógnvaldsson (1997), é proposto o seguí nte termo de
punifáo da complexidad? para um perceptron de múltiplas camadas com uma única camada oculta
e um único neurónio na camada de saida:
«,cwi=ixii*, ir
J-t
(4.98)
onde os w sSo os pesos da camada de saida, e v ¿ o vetor de peso para o/-¿simo neurónio da
camada oculta; a potenciap é definida por
para um suavizador global
2i para um suavizador local
(4r99)
Hidden page
Oprocedimento do daño cerebral átima (DCO) (l.eCun et aL, 1990b) simplifica os cálculos fazen-
do uma suposi^áo adicional; a matriz hessiana II í uma matriz diagonal. Entretanto, tal suposi^áo
n3o é feita noprocedimentodocirurgiaocerebral ótímo (CCO) (HassiSi et al., 1992); conseqüente-
mente, ele cantero o procedimenia DCO como um caso especial. De agora em diante, nos seguimos
a estrategia CCO.
O objetivo do CCO é fixar um dos pesos sinápticos em zero para minimizar o aumento
incremenlal de $ , dado na Eq. (4.101). Supnnha que U’/n) represento este peso sináptico particu-
lar. A eliminarán deste peso c equivalente á conch^áo
Air + ir i = 0
ou
1’Aw + m^Ü (4.102)
onde Ico vetar unitario cujos elementos sao todos zcro. cxcClO O /-¿simo elemento, que é igual á
unidade. Podemos agora refbrmular o objetivo do CCO como (liassibi et ai., 1992):
Minimize a fanna quadiática |Aw Hiw em rcía^w á variadlo incremcuial do vetor peso, Aw,
sujeita á restriego que l iw +seja zero, c cnláo nnnimize o resultado cm relajo ao índice ¿
Há dois nfvcis de minimizafáo oconcndo neslc caso, Ima minirniza^áü acOntcCc sobre os vetares
de pesas sinápticos, que pennanecem depois que o í-csimo vetor de peso é colocado cm zcro. A
segunda minimizado é sobre aquele vetor particular que é podada.
Para resolver este problema de olimizafSo com restribóos, primeiro construimos o
tagrcingianíi
$ — Aw1 11Aw - Aw+ U1,) (4.103)
onde A é o multiplicador de Langruge. Entáo, calculando a derivada do lagrangiano 5, com respeita
a Awp aplicando a restrifáo da Eq. (4.102) c usando a inversáo matriiial, constatamos que a racditl-
cado ólima do vetar peso w é
AW="[H^] H 1 (4.104)
e o valor ótímo correspondente do Lagrangiano 5 para o elemento W(c
s- «’
'"2[¡rí[ <«l0S)
onde H 1 c a inversa da matriz hessiana II. c [H ] d c o elemento desta matriz Inversa. O
lagrangiano Sr otimizado em relajo a Aw, sujeito á reslri^áo que o É-csimo peso sináptico u seja
eliminado, c denominado a safiéncia de ir. Na verdade, a saliéncia 5. representa o aumento no erra
médio quadrado (medida de desempenho), que resulta da eliminado de ul Note que a sal ¡encía 5
é proporcional a t/;,!. Assim, pequeños peses tém um cfciio pequeño no erro médio quadrada. Entre-
tanto, da Eq. (4.105) c possívcl constatar que a salí encía 5 é também inversamente proporcional aos
elementos da diagonal da inversa da hessiana. Desta forma, se [H '],, for pequeño, entlo mesma
pesos pequeños deverao lct um afeito substancia] no erro múdio quadrada
No procedimenic CCO, o peso correspondente á menor sal ¡encía é aquele selecianado para a
elinunaíjáo. Além disso, as modificalóes chimas correspondentes nos pesos restantes sao dadas pela
Eq. (4.104), que mestra que deven am ser atualizados ao Longo da dire^o da r-ésima caluña da
inversa da hessiana.
Em sen artigo, 1 lassibi et aL relatam que, em alguns problemas padreo o proce-
dí menta CCO resultan em redes menores que aquetas obtidas utilizando o procedí mentó de
decaimiento de peso. Foi tamhcm relatado que, como resultado da aplicadlo do proccdimcnto de
CCO ao pcrccptron de múltiplas camadas do NETtalk, cnvolvcndo uma única carnada oculta c
I 8.000 pesos, a rede tora podada a nlc mais que 1560 pesas, uma reduelo drástica no tamanho da
rede. O NETtalk, de Sejnawski e RoseJiberg(l9?7), é descrito no Capitulo 13.
Computando a inversa da matriz hessiana. A matriz inversa da hessiana H1 c fundamental á
formuladlo do proccdimcnto CCO. Quando o número de parámetros livres da rede, c grande, o
problema de computar H 1 pode ser intratase l. A seguir, descrevemos um procedimcnto Lraiável
para compul ar H'1, assumindo que o perceptron de múltiplas cunadas estoja totalmente treinado
para um mínimo local na superficie de ene (HasRÍbi ct al., 1992).
Para simplificar a apreveníanlo, suponha que o perceptron de múltiplas camadas possua um
único neurónio de saida. Hntlo, para um dado conjunto de treinamenio, podemos expresar a fuñ-
ase de custo como
2A TÍ
onde «(rt) é a saida real da rede durante a apresenta^o do n-éatmo exemplo, ¿(n) á a respasta
desejada correspondente, c jV é o número total de exemplos do conjunto de treinannento. A saida
afn) pode ser expressa coma
"(ff) * K)
onde Fea tiin^ao do mapeamento de entrada-saida realizado pelo pcrccptron de múltiplas Mina-
das, * é O vetor de entrada, e w é o vetor de pesos sinópticos da rede. A derivada primeira dc^mn| cm
reíanlo a w e portante
e a derivada segunda de ®mr. em rela^áo a w ou a matriz hessiana ó
Hidden page
Hidden page
Estas duas propiedades da aprendizagem por retropropagacAo no contexto de um perceptron de
múltiplas camadas sáo rcspcnsávcis por suas vanlagcns c dcsvantagcns.
Conexlonismo
O algoritmo de retropropaga^áo c um exemplo de um /xznuf/gmd c&texionislü que se baséis em
calcufos Locáis para descobrir as capacidades de processamento de informaban das redes neurais.
Esta forma de reslri^áo ccmputacional c referida como a neítrifdo de localidades no sentido de que
a computado realizada pelo neurónio c influenciada apenas por aqueles neurónios que están cm
contato físico com ele. O uso de compulso local no projeto de redes neurais artificiáis é normal-
mente defendido por tres razccs principáis:
1. As redes neurais artificiiais que reah/am computado local sáo freqüen temen te tidas como me-
táforas para as redes neurais biológicas.
2. O uso de coraputa^ao Loca] permite uma degradado suave no desempenho de vi do a erres dos
componentes físicos c, perianto, fomcec a base para um projeto do rede tolerante a tal has,
3. A computapáo loca] favorece a ulilizapáo de arquiteturas paralelas como método eficiente para
a impl ementado de redes neurais artificiáis.
Considerando estes tres pontos cm ordem inversa, o ponto 3 c iriteiramente justificável no caso da
aprendizagem por retropropaga^áo Em particular, o algoritmo de retrapropagapdo tem sido
implemenlado com succsso em computadores paralelos por muitos pesquisadores, e arquiteturas
VLSI tem sido desenvolvidas para a realizado lisies de perceptrons de múltiplas carnadas
(Hammerstrom, 1992a, 1992b). O ponto 2 c justifica ve] desde que certas precauteles sejam tomadas
na aplicado do algoritmo de retropropaga£íta, como descrito em Kerlirzin e Vailet (1993). No que
diz respecto ao ponto I, em relajo á plausibilidade biológica da aprendizagem por retropropagapáo,
isto tem sido seriamente qucu i orlado pelas següintes razocs (Shcphcrd, 1990b; Crick, ]989; Stork,
1989):
1. As concxdcs si réplicas recíprocas entre os neurónios de um perceptron de múlliplas camadas
podem assumír pesos que sáo excitatór i os ou inibilórios. No sistema nervoso real, cornudo, os
neurónios normalmente aparecen como sendo de um tipo ou de outro. Essa c uma das mais
sirias suposiíóes nao-realisticas feitas em modelos de redes neurais.
2. Era um perceptron de múltiplas camadas, as comunicacócs hormonals ou nutras tipos de ccmu-
nicabóes globals sáo ignoradas. Em sistemas nervosos reais, estes tipos de comunicado global
sáo cruciais para as fundóos de ajuste de estado, como o despertar, a atengan e o aprendizado.
3, Na aprendizagem por retroprupagabAo. um peso siináptico é modificado por uma atividade prc-
sináptica c um sinal de erro (de aprendizagem), independentemente da atividade pós-siiiáptica.
I l:i evidencias da neurübiologia que sugercm o contrario.
4. Era um sentido neurnbíclógico, a implcmentapáo da aprendizagem por retropropagaílo requer
a rápida retropropagaído da informado ao longo de um axónio. Parece altamente improvávcl
que uma operacáo deslc tipo realmente ocorra no cerebro.
5. A aprendizagem por rctropropagaQac implica a existencia de um "professor”, que no contexto
do cérebra seria presumivdmente um outro conjunto de neurónios com propr ¡edades i ínsita’
das. A existencia de tais neurónios é biológicamente implausívcl.
Entretanto, estes recelos neurobiológicos náo depreciara a importancia técnica da aprendizagem
por nctropropagacao como tarramenta para processamento de informado, como evidenciado por
sua aplícalo bcm-isucedida cm numerosos campos a Llámente diversi litados. incl unido a simulado
de fenómenos neurobiológicos (veja, por exemplo, RobiriKin (1992)).
Detecqao de Características
Como discutido na Sc^áo 4.9» os neurónios ocultos de um perceptron de múltiplas camadas trc i na-
do com o algoritmo de retropropagafáo desempernam um papel crucial como detectores de carac-
terísticas. Urna forma ¡novadora na qual esta propriedade importante do perccptron de múltiplas
camadas podo ser explorada ó o seu uso como um replicador ou mapa de Ident idade (Rumclhart et
al.» 1986h; Cottrel el al., 1 987), A Figura 4,23 ilustra como islo pode ser realizado para o caso de um
perceptron de múltiplas camadas utilizando uma única camada oculta. A plañía da rede satis faz as
seguíntes exigencias eslroturáis, como ilustrado na Fig. 4.23b:
• As camadas de entrada e de saída tcm o mesmo tamanho, zn.
« O tamanho da camada oculta» .1/» c menor que m.
* A rede é totalmenle conectada.
Um dado padrúo, x, é aplicada simultáneamente á camada de entrada como o estimulo e á camada
de saida como a respnsta desejada. Prctendc-se que a resposta real da camada de saida, x, seja uma
'estimativa** de x, A rede é tremada usando-se o algoritmo de refropropagai;Jo na forma usual» com
o vetor erro estima:ivo (x - x) tratado como o sinal de erro, como ilustrado na Fig. 4,23b, O Ireina-
mento é realizado de unía man eirá níto^upervlsioitada (i.e., sem a necessidade de um profesor).
Em v iñude da estrutura especial incorporada no projeto do perccptron de múltiplas camadas, a rede
c abrigada a realizar o mapeamentü de identidade através da sua camada oculta. Uma ver sao codi-
ficada do padrao de entrada, representada por s, ó produzida na saida da camada oculta, como
representado na Fig. 4.23a. Na verdade, o perceptron de múltiplas camadas total mente tremado
desempenha o papel de um “codificador". Para reconstruir uma estimativa X do vetor de entrada
original x {i.e., realizar a decfydificasdd'}, aplicamos o sinal codificado ;i camada oculta da rede
replicadora, como ilustrado na Fig. 4.23c. Na verdade, esta úl:ima rede desempenha o papel de um
“dccoditiuador". Quanto menor Por fui tu o tamanho Af da camada oculta comparado com o tamanho
m da camada de entrada/sahla. mais efetiva será a configurado da Fig. 4.23a como um sistema de
cumpressdo de dados. -
Aproximaban de Fun^ao
Um perccptron de múltiplas camadas tremado com o algoritmo de rttropropagaqáo- se manifcsta
como um evtfxrt'nrcr uninfimfo signtóide^ escrito na seguíate forma compacta para o caso de mna
única saida:
(4 113)
onde <p(*) é uina futifáo de atívaQáo sigmóide enmuro, é o peso sináptico do neurónio Jt na
última camada oculta para o único iteuróiúo de saída o, c assiffl por diantc para os outros pesos
sinápticos, e ,v, ó o t-ési mo elemento do vetor de entrada x. O vetar de peso w representa o conjunto
inteiro de pesos sinápticos ordenadas por camada, por neurónios cm uma camada e, entáo. por
sinapses em um neurónio. O esquema tic fun^óes nao-.incares aninhadas de&crilo n* F.q. (4,1 |J) ¿
Copyright Cu rusten al
Hidden page
Hidden page
Robustez
No Capitulo 3, resaltamos que o algoritmo LMS c robusto no sentido de que perturbadles com
pequeña energía podem causar apenas erras estimativos pequeños. Seo modelo de observacao subjaccnte
é linear, o algoritmo LMS é um filtro ff~ -óiimn (Hassibi et al., 1993. 1996). Islo significa que o
algoritmo LMS minimiza o guabo máximo de energía das perturbadles dos erres estimat¡vos.
Por outro lado, se o modelo subjacente foroto-linear, Hassibi c Küilalh (1995) mostraram que
o algoritmo de retropropaga^ao é um filtro [ocalmente H~ -ólimo. O termo “local11 usado aqui
significa que o valor inicial do vetor de peso usado no algoritmo de rctropropagapáo está suficiente-
mente próximo do valor ótimo do veior de peso w*, de modo a asegurar que o algoritmo nao fique
preso cm um mínimo local pobre. Em termos conccituais, é bom saber que o algoritmo LMS e o
algoritmo por rctropropaga^áo pcrtcnccm á mesma elasse de filtros H" 'étimos.
Convergencia
ü algoritmo de reiropropagafáo usa urna “estimativa instantánea11 para o gradiente da superficie de
erro no espado de pesos. O algoritmo c, portante, de natureza estocástiar, isto é, tem lendéncia a
ziguezaguear cm lomo da verdadeira dirc^áo que leva a um mínimo na superficie de erro. De lato,
a aprendizagem por rctropropaga^ao c uma api ¡cacao de um método estati stico couhecido como
aproximafáo esfocá-itica que foi originalmente proposito por Robbíns e Monto (1951). Conscqücn-
temente, lende a convergir lenta mente. Podemos Identificar duas causas fundamentáis para esta
proprtedade (Jacobs, 1998):
L A superficie de erro é razoavelmente plana ao longo de uma dimensáo do peso, o que significa
que a derivada da superficie de erro em rclacáo áquele peso c pequeña cm magnitude. Nesia
situado, o ajuste aplicado ao peso é pequeño, e conscquentemenle podem ser noccssárias muí-
tas itera^oes do algoritmo para produzir uma redujo significativa do índice de desempenho da
rede cm relamió ao erro. Alternativamente, a superficie de erro c muito curva ao longo de uma
dimensáo do peso; neste caso, a derivada da superficie de erro em relajo ao peso é grande cm
magnitude. Ncsta segunda situadlo, o ajuste aplicado ao peso c grande, o que pode levar o
algoritmo a exceder o mínimo da superficie de erro
2. A dirc^áo do vetor gradiente negativo (i.c., a derivada negáis a da funche de cusEo em rela^áo
ao vetor de pesos) pode náo apontar para o mínimo da superficie de erro: com isso^ os ajustes
aplicados aos pesos podem induzir o algoritmo a se mover na dire^áo errada.
Conseqüenremenie, a taxa de convergencia na aprendí¿ágem por retropropagacao leudo a ser relati-
vamente baixa, o que, por sua vez, pode tornar o algoritmo martirízame do ponto de vista
computacional. De acordó com o esludo empírico de Saarincn ct aL (1992), as tasas locáis de
convergencia do algoritmo de retropropaga^áo sao /j7tedr,£,.r, o que é justificado pelo argumento que
a matrizjacobiana é quase deficiente em posto, assim como a matriz hessiana. Eslas sao conseqüén-
cias da natureza intrínsecamente mal-condicionada dos problemas de treinamento de redes neurais.
Saarinen et al. interpretara as taxas locáis lineares de convergencia da aprendizagem por
retropropaga^áo de duas manearas:
* Fsta é uma reivindicacao do algoritmo de retropropaga^to (dcscida do gradiente), no sentido
de que métodos do ordem mais alia podem náo convergir muito mais rápidamente enquanto
que exigem maior esforzó computacional; ou
• Os problemas de tnrinamento de redes neutíiis em grande escala sao tac irjercntcmmrc di ficéis
que ñau existe luna estrategia de aprendí zagem que seja realiza ve], podendo ser ncccssárias
outras abordagens como o uso de pré-prncessamento.
Exploramos mais profundamente esta questáo da convergencia na Se^o 4.17 e exploramos a ques-
táo do prc-proccssamcnto das entradas no Capitulo 8-
Minintos Locáis
Uma outra peculiaridad^ da superficie de erro que causa impacto sobre o desempenho do algoritmo
de retropropagacao c a presenta de mínimos locáis (i.e., vales i so lados), adicionalmente aos míni-
mos globais. Como a aprendizagem por retropropagafáo é básicamente uma técnica de “escalada
de colina*, ela core o risco de ílcar presa em um mínimo local, onde toda pequeña varia^áo dos
pesos sinápticos causa aumento da fun^áo de custo. Entretanto, cm algum outro Lugar do espado de
pesos, existe um outro conjunto de pesos sinápticos para o qual a fun£áo de custo ¿ menor que o
mínimo local no qual a rede se encentra presa. E evidentemente indeseiável que o processo de
treinamento termine em um mínimo local, especialmente se ele estiver muito distante do mínimo
global
A questáo dos mínimos locáis na aprendizagem por retropropaga<;áo foi levantada no epílogo
da cdiQáo es tendida do clássico livro de Minsky c Papcrt (1988), onde a maior parte da atcn^áo está
concentrada em urna discussao do livro em deis volumes, fiarullet Díslriba^d /’wceffjOijf, de
Rumcihart c McClelland (1986), No Capítulo 8 dcstc último livro, afirma-se que fícar preso em um
mínimo local raramente é um problema prático para a aprendizagem porretropropaga^o. Minsky
c Papen opóem-se a isiu. sal ientando que toda a hiatória de reconheci mentó de padróes moslra o
contrario. Gori e Tes i (1992) descrevem um ejemplo simples onde, embora um conjunto de padróes
nao lincarmcntc separáveis pudesse ser aprendido por uma rede com uma única camada oculta, o
algor!mío de retropropa&acáo pode ficar preso em um mínimo local.11
Escalamento
A principio, os perceptron s de múltiplas camadas [reinados com o algoritmo de rctropropaga^ao
lem o potencial para agí tem como máquinas computacionais univenaís. Entretanto, para que este
potencial scja totalmente aprovcitado, tomos que superar opmhlema ¿teL^eülíintertlf!, que aborda a
questáo dequáo bem a rede se comporta (p.ex., medido pelo lempo necessário para o treinamento
ou pelo melhor desempenho de generalizarán alean^ável) quando a tarefa computacional aumenta
em tamanho e rompí ex idade. Entre as mu ¡tas manciras possívcis de se medir o tamanho ou acom-
ploxidado de uma tarefa computacional, a ordem de predicado, definida por Minsky e Paper! (1969,
1988) fomece a medida mais úül e importante.
Para esclarecemos o que queremos dlzer por um predicado, considero que ^(A) represente
uma fun^áo que pode assumir apenas duis valores. Norma!tríenle, consideramos os dois valore;;
como sendo 0 c I. Mas, considerando os valores como sendo FALSO ou VERDADEIRO, podemos
pensar em <b(A) como um preíticada^ ísio é. uma declarado variavcl cuja falsidade ou verdade
depende da escolha do argumento X. Podemos escreverk por exemplo,
[1
^CMCUL&í^l q
se a figura X for um circulo
se a figura X náo for um circulo
(4.115)
Usando a úléia de utn predicado, Tesauro e Janssens (1938) realizaran um cstudo empírico
envotvendo o uso de um perceptron de múltiplas camadas tremado com o algoritmo de
relropropagpp&o para aprender a calcular a funcáo de parídade. A fun^ao deparídadeéum predicado
booleano definido por
*4* r a h.iMM
se | áf | é um número impar
caso contrario
(4,1 J6)
e cuja crdem é igual ao número de entradas. Os experimentos realizados por Tesauro e Jansscns
parecem mostrar que o tempo necessário para a rede aprender a calcular a fungia de parldade
aumentó exponencúilmenle com o número de entradas 1 i.c., a ordem do predicado da computarse),
e que proje^Ces sobre o uso do algoritmo de rctropropagacao para aprender fun^oes complicadas
arbitrárias podem ser excesivamente oti mistas.
Existe a concordancia generalizada de que é dcsaccnsclhávcl para um perceptron de múltiplas
camadas ser totalmente conectado. Neste contexto, podemos levantar a seguíate questáo: dado que
um perceptron de múltiplas camadas nao deve ser totalmente conectada, como devem ser alocadas
as ccncxócs sinópticas da rede? Esta questao nao c importante no caso de aplícales em pequeña
escala, mas é certamente crucial para o sucesso da api i cacao da aprendizagem por repopropaga^ao
para resolver problemas em grande escala, do mundo real.
Um método efetívo de aliviar o problema do escalamento é desenvolver a compreensiio do
problema (possivdmente através de analogía ncurobiológica) c usá-la para inserir engenhosidade
no prqjeto arquitetura! do perceptron de múltiplas camadas. Específicamente, a arquitetura da rede
c as restriñes impostas aos pesos sinápticos da rede devem ser concebidas de modo a Incorporar
informacito previa sobre a tarefa durante a constituido da rede. Esta estrategia de proj etc é ilustrada
na Se^ao 4.19 para o problema do reconhecirnento de um caractere ótico.
4,17 ACELERA^ÁO DA CONVE RGÉN CIA
DA APRENDIZAGEM POR RETROPROPAGAQÁO
Na se^Bo anterior, identificamos as principáis causas para a possível taxa lenta de convergencia do
algoritmo de retropropaga^So, Nesta se^áo, descrecemos algunas Aewítffaos que fomecem nor-
mas úteis para se pensar cm como acelerar a convcrgcncii da aprendizagem per rctropropagacáo
através da adaptólo da taxa de aprendizagem. Os detal bes das heurísticas sao os segu intes (Jacobs,
1988}:
heurística i. Cada parámetro niu^tável da funcáo de custo da rede deve ter scu parámetro
individual da taxa de aprendizagem.
Notamos aquí que o algoritmo de rctropropagacúo pode ser lento para convergir porque o uso
de um parámetro fixo de taxa de aprendizagem pode náo ser adequado em todas as regióes da
superficie de erro. Em outras palavras. um parámetro de taxa de aprendizagem apropriadü para o
ajuste de um determinado peso sináptico náo é necessariamente apropriado para o ajuste de outros
pesos sinápticos da rede. A heurística I rcconhccc este Tato atrihuindo um parámetro de taxa de
aprendizagem diferente para cada peso sináptico (parámetro) ujustávcl da rede.
HEURÍSTICA 2. Cada parametro da laxa de aprendizagem deve poder variar de uma iterafáo
para a seguinte.
A superficie de erra n[Ticamente se comporta de Forma diferente ao longo de diferentes regióos de
uma única dimensao de peso. Para seguir esta variaban, a heurística 2 afirma que o parámetro de
taxa de aprendizagem neceas i La variar de itera^sopam iterado I interessante notar que esta heurística
está bcm-íundamenladíi no caso de unidades linearas (Luo, 1991).
HEURÍSTICA 3. Quando a derivada da ÍUDfiD de CuStO em rtíatáo <ió peso Sináptico tem O mes-
mo sinal algébrico para iterares consecutivas do algoritmo, o parámetro da taxa de aprendizagem
para aquele peso particular deve ser aumentado.
O ponto de operacao corrunle no espado dr peso pode se encontrar cm uma peruáo relativa-
mente plana da superficie de erro ao longo de urna dimensáo de peso particular. Por sua vez, i$to
pode ser responsável por fazer com que a derivada da fúncáo de cusco (i.c,, o gradiente da superficie
de erro) cm rclacáo ao peso, mantenha o mesinu sinal algébrico e, assim, aponte na mesma tkrecao,
para varias iteraQóes consecutivas do algoritmo. A heurística 3 afirma que, nesla situa^ao, o número
de iterares necesarias pan atravessar a pon^o plana da superficie de erro pode ser reduzida
aumentando-se adequadamente o parámetro da laxa de aprendizagem.
HEURISTICA 4. Quando o smal algébrico da derivada da fun^ao decusto em relajo ,i um peso
sináptico particular alternarse para varias itera^des consecutivas do algoritmo, o parámetro da taxa
de aprendizagem para aquele peso deve ser n duzido.
Quando o ponto de operado córrante no espado de pesos se encontra em uma por^áo da
superficie de erro ao longo de uma dimensáo de peso do interesse que exibe picos e vales (i.e., a
superficie é muito curva), entáo é possfvel que a dentada da funffto de cusid em relajo aquek peso
mude o seu sinal algébrico de uma iterado para a seguinte. Para evitar que o ajuste de peso oscile,
a heurística 4 afirma que o parámetro da taxa de aprendizagem para aquelc peso particular deve ser
reduzido adequadamenle.
Note que o uso de um parámetro da laxa de aprendizagem diferente para cada peso sináptico
e variável no tempo de acordo com estas heurísticas modifica fundamentalmente o algoritmo de
relropropaga^lo. Especifica mente, o algoritmo modificado nlo realiza mais uma busca por dcscida
mais íngreme Fm vez disso, os ajustes aplicados aos pesos sinópticos sao bascados (l) ñas deriva-
das parciuis da superficie de triTO Cm ida^&D aos pesos e (2) em cSiimativas das curvaturas da
superficie de erro no ponto de operacao coirente no espado de pesos ao longo das varias dimerisdes
dos pesos.
Alcm distas quatro heurísticas satisfazem a restribo de local i dade, que é uma caraclerislica
inerente da aprendizagem por retropropaga^áo. Infelizmente, a adcrencta á restricáo de locaiidadt
limita o dominio da ut: Iidade dcstas hcurísi ¡cas porque existem superficies de erro para as quais cías
nao fuiicionam. Apesar disso, as modificadles do algorílmo de relrOpropagacáo de acondo com
estas heurisücas tém valor prácico.4
4.18 APRENDIZAGEM SUPERVISION ADA VISTA
COMO UM PROBLEMA DE OTIMIZAQÁO
Nesta se^áo. adolamos um ponto de vista sobre aprendizagem supervisionada que é bem diferente
daquele seguido ñas se^des anteriores do capítulo. Específicamente, vemos o iTcinamenic supervi-
sionado de um pcrccptron de múltiplas camadas como um problema de atímiza^nitmé/ica. Neste
Hidden page
ordem c de ordem mais alia na Eq. (4.1l7) sáo zero), o método de Newton converge para a soluto
clima cm urna iterado. Entretanto, a aplka^fio práuca do método de Newton para o treinamento
superv is lo nado de um perceptron de múltiplas camadas ó prcjudicada pelos seguí ntcs tatures:
• Requer o cálculo da matriz hessiana inversa o 4UC pode ser computad analmente cus-
toso.
* Para ser computável, EI(ji) deve ser nác-singuiar. No caso em que H(n) é definida
positiva mente» a superficie de erro cm tomo do ponto concnte w(/r) é descrita por uma “do
pressao convexa11. Infelizmente, nao há garantía de que a matriz hessiana da superficie de erro
de um perceptron de múltiplas camadas sempre se enquadre nesia describan. Além disso, há o
problema potencial de a matriz hessiana ser dcÍLu.entc cm posto (i.e., nem todas as coiunas de
II sao lincarmentc independentes). o que resulta da natureza intrínsecamente mal-condiciona-
da dos problemas de treinamento de redes neurais (Saarinen ct al., 1992}; isto &ó toma mais
difícil a tarefa computad onal.
• Quando a fun^áo de custo ¿ nao-quadrática, nao há garanda para a convergencia do
método de Ncwton, oque o toma inadequado para o treinamento de um perccptron de múlti-
plas camadas.
Para superarrnos algunas destas difi cuidados, podemos usar um nu-iodo quw&Wewftm. que requer
apenas unta estimativa do vetor gradiente g. Fsta modi licaijáo do método de Ncwton man té m uma
estimativa definí da positivamente da matriz inversa H1 di ratamente, sem invcrsac matricial. Usan-
do esta estimativa, assegura-se que um método quase Newton percorre descendentemente a super-
ficie de erro. Entretanto, aínda temos urna complcxidade computacional que é (X onde Wé o
tamanho do vetor peso w. Os métodos quasc Newton sao, portanto, impraúcáveis. execro para o
treinamento de redes ncurais em escala muito pequeña. Uma descrifáo de métodos quasc Ncwton c
^presentada mais adianto nesta scQáo.
Uma outra classe de métodos de otiniizadlo de segunda ordem incito o método do gradiente
conjugado, que pode ser visto como sendo intermediario, entre o método da dése i da mais íngreme
e o método de Ncwton. O uso do método do gradiente conmgado é motivado pelo desojo de acelerar
a taxa de convergencia típicamente lenta experimentada com o método da desoída mais íngreme.
enquanto que evita as exigencias compulacionais associadas com o cálculo, armazenamento c in-
versad da matriz hessiana, no método de Newton. Entre os métodos de otim i za^áu de segunda
ordeno, ó aun píamente reconhecido que o método do gradiente conjugado tal vez seja o único método
que é aplicávcl a problemas de grande escala, isto é. problemas com centenas ou mí 111 a res de
parámetros ajuslávcis (Flctchcr, 1987). Podanto, é bastante adequado para o treinamento de
pcrceptr&ns de múltiplas camadas, com aplkitc^ típicas que incluem aproximitcáu de lunqucs,
controle eaoálisc de series temporals fi.c., rcgrcssáo).
Método do Gradiente Conjugado
O método do grad ante conjugado pertence a classedos métodos de oliiiuza(5o de segunda ürdem,
conhecidos culeiivamcntc ccrnu rnérodav de dife^ñt) efritjugcfíla. Cometamos a discussflo dcstcs
métodos considerando a rTiminiizafSo dA./foipcw qiwdmtica
/(xJsix^Ax-b'i + í (4.122}
onde i é um vetor de parámetros JF-por-l, A é uma matriz JT-por-W" sí métrica, definida positivamen-
te, b é um vetor FKpor-1 e c é um escalar A mininniza^n da fun^ao quadráticajfx) é alcanzada
atribuindc-sc a i o valor único
** - A’b
(4.123)
Com isso, mimtDizerJU)e resolver o sistema de equa^es lineares Ax* - b sáo problemas equivalentes.
Dada a matriz A, dizemos que um conjunto de velones nfo-nuk» 1(0), s( IV-, s^-l) é um wnju-
gadú de A (i.e., náo interferem entre si no contexto da matriz A) se a seguirte condiíte for satis leí la;
sr(ff)As(/) “ 0 pata lodo n e / tal que n^J
(4.124)
Se A for igual á matriz ¡dcntidadc, a conjiuga^ac c equivalente á no^So usual de crtogonalidadc.
EXEMPLO 4.1
Para uma interpretante de vetores conjugados de A, considere a situa^ao descrita na Fig. 4.24a, relativa a um
problema tridimensional. A locaLizafte elíptica mostrada nesta figura corresponde ao gráfico da Eq. (4. i22)
para
* = iw
para um valor consiente atribuido :i turóte quadratica/(i). A Figura 4.24» incluí também um par de vetores de
direfte que ste conjugados em reíante á matriz A. Suponha que definimos um novo vetor de parámetros v
relacionado a * pela transformante
v« A“x
onde A"44 a raizquadrada de A. Enlte, a localizante elíptica da Fig. 4.24a c transformada em uma localizante
circular, como mostrado na Fig. 4.24b. Correspondenteinente, o par de vetores de direqte conjugados de A na
Fig. 4.24a é transformado cm um par de vetares de dire^te urtogonais na Fig. 4 .24b.
FIGURA 4.24 Interprelataa de
vetores conjugad» de A. (a)
LúcatizafAO elíptica na aspado de*
pesos tridimensional, (b)Transfor-
madlo du tocallzaote elíptica em
urna localkafte circuiar
Unía i m portante pnopricdade das vetares conjugados de A é que des san linearmente indepen-
denles. Pro vamos esta propriedade por contradif’ao. Considere que um desses vetores, digamos
síD), seja expressa como uma combinacáo linear dos JF-l vetares restantes, como segué;
ii-1
s(0) = £
j-i
Multiplicar por A o cntáo efetuar o produto interno de As(0) com s(0) resulta
s' (O)As(O) = X asT(0)Ai(j) = 0
7-1
Entretanto, c impossível para a forma quadratica sr(0)As(U) ser zcro por duas razSes: a matriz A é
definida positivamente por pressuposi^áo, e o vetor s(0) é náo-nulo purdefim^áo. Com isso, segué
que os vetores conjugados de A sí Isf/F-1) n5o podem ser bnearmenie dependentes; isto
c, devem ser I (reármente indcpcndcntcs.
Para um dado conjunto de vetores conjugados de A fi(0), s( Is( IV— I )t o método da dire^So
wnjifgadíi conv.ipondtínte para minimizadlo irrestritada fun^So de erro quadrática/lx) é definido
por (Lueribcrger, 1973; Flctcher, 1987; Bcrtsckas, 1995)
zfti + l) = xOO+Tl("Mnh n-0, I.......tfP-l (4 125)
onde i(C) é um vetor inicial arbi Erario c q(rt) c um escalar definido por
/(ih} + n(«Xrt)) - mjn /(i( ir)+n s( jt) ) (4.126 J
O proccdimcnto para cscolha de r¡ de forma a minimizar a fun£áo/{x(fl) + T|s(zf]) Para um n
referido como urna busca em linha, que représenla um problema de minimizare unidimensional.
Com base ñas Eqs. (4.124), (4.125) c (4.126), podemos agora fazer algumas observares:
1. Como os vetores conjugados de A s(0}, s( ]),..., s( íí-1} sao knearmente iindependenfes, eles
tbrmam urna base que cobre o espado vetorial de w.
2, A equaijáo de atualizaglo (4-125) e a minimizarán linear da Eq, (4.126) levam a mesma fórmu-
la para o parámetro da taxa de aprendizagem, isto é,
Tlí’it = » = 0.1...fr-l (4.12?)
S (ji)As(h}
onde «00 é o em definido por
C(rt)= I(ff)-x* (4.12K)
Comeando de um ponto arbiirário z{0), o método da dire^áo conjugada garante encontrar a
solucáo ótiina x* da cqua^áo quadrática/(x) ~ 0 no máximo em IFitera^ücs.
A principal prnpriedadedo método da direito conjugada ¿descrita como (Luenberger, 1984; Fletcher,
1987; Bcrtsckas, 1995):
Em iteracüts suctsHÍvas, o método da direcáo otrn]ligada minimiza a tunero quadrática sobre
um espado vetorial linear progrcssivamenle em expansáo. queevenluahnctitc incluí o mínimo local
de/lX).
PERCEFTAObS DE MÚLTIPLAS CAMADAS 265
Em particular, para cada iterado tí, o vetor iterativo x(n + !} minimiza a funfáo Xx) sobre um
espado vetorial linear que passa através de uní panto arbitrario x(0) e é coberto pelos vetores
conjugados de A s(C), sí t(ff), Como mostrado por
t(ji +1) — argnún f(i)
onde 3¡r í definido por
9. -1 =><oj * ¿nüW)
l /-o
(4.129)
(4.130)
Para o método da dire^ao do conjugado funcionar, é necessária adispanibilidade de um conjunto de
vetores conjugados de A síO), s(l),..., s( W-1). Em uma forma especial deste método, conhecida
corno método do gradiente conjugado,'^ os vetores de dire^áo sucessivos sáo gerados como versfles
conjugadas de A dos vetores de gradiente sucessivos da futido quadráticaXx), conforme o método
avanza, vindo dai O nome do método- Assim, excelo para n = D, O conjunto de vetares da dire^ao
(í(n)) nao é especificado previamente, sendo determinado de forma scqücncijil nOfi pASscs sucessi-
vos do método
Definimos o residual como a dire^áo descendente mais ingreme:
rffl}-=b-Ai(fl} (4.131)
Ent&o, para prosseguirmos, usamos uma combinacao linear de f(ji) c s(rr — I), como mostrado por
sU) - Krt)4 - l). «= 1,2,- ., H^-l (4.132)
onde pírf) é um fatorde escala a ser determinado. Multiplicando esla equA^So por A, efetuando o
produto intemo da expressáo resultante com 5(»- l)( invocando a pmpnedadedos vetores de dirc^ao
do conjugado de A e entáo resolvendo a expressao resultante para (i(w), oblemos
, sr(fl-l)Ar(ff)
Ph)=- r, / / ' (4,133)
s (n - l)As(n- I)
Usando as Eqs. (4.132) e (4.133), constatamos que os vetores s(0), s(l),.,., s(H—1) assim gerados
sao de fato conjugados de A.
A gerap&o dos vetares de direí3o de acardo com a cquaf áo recursíva (4.132) depende do
coeficiente 000- A formula da Eq. (4.133) para calcular p(w j. como está atualmente escrita, requer
o conhceimcnto da matriz A. PorrazOes compuiacionais, seria desejávcl calcular fX^) sem o conhc-
cimento explícito de A, Este cálculo pode ser obtido usándole uma das duas fórmulas seguí otes
(Fletcher, 1987):
I. fórmuta de ñriakdlibiérg, para a qual é definido por
rtn )) (41M)
r («- l)rvt-1)
2. Formula de Ftelcfter-Reeves, para a qual f){n} é definido por
Pí«)=-
rr(« - l)r(/t ])
(4.135)
Para usarmos o método do gradiente conjugado para atacar a mi! imnii/a^o irreslríia da funféo de
cuito % i*1). relativa ao tn.-:namento supervisíonado de perceptrons de múltiplas camadas, faje-
mos duas coisas:
• Aproximamos a fiioffio de custé ’S^w) por uma funcáo quadrática. Isto éh os termos de
terceira ordem e de ordem mais alta na Eq. (4.11 7) sáo inorados. o que significa que estamos
operando próximos a um mínimo local da superficie de erro. Assim, comparando as Eqs.
(4.117) o (4 122), podemos fazer as associaedes indicadas na Tabela 4.7.
TABELA 4,7 Corrospondéncia entre í(k) o '^(w)
Funcáo <iund ral ica/C j¡ j Futifáci de cuMc íímcd{’*l
Vetor de pubmetn» i(fl) Vfetnr gradiente i)/\i rTlx Malríz A Vplor pcw sináptico w(n) Velar ^radienle- g “ íT# . áw Matriz btttfanL H
• Formulamos a computado dos coeficientes fl(rf) e H(rt) no algoritmo do gradiente conjugado
de modo a ncccssirar apenas da informapao do grádente.
O último ponto é particularmente importante no contexto de perceptrons de múltiplas camadas,
porque evita o uso da matriz hessiana H(n), cujo cálculo envolve dificuldades computan ionais.
Para calcularlos o coeficiente 3(«) que determina a dire^ao de busca s(n) sem conhecimento
explícito da matriz hessiana H(h}, podemos usar a formula de Polak-Ribicrc da Eq. (4.134) ou a
fórmula de Flctehcr-Rccvcs da Eq. (4.135). Ambas as fórmulas envolvem apenas o uso de residuais.
Na forma linear do método do gradiente conjugado, assumindo uma fun^áo quadrática, as fórmulas
de Polak-Ribitn: e de Fletcher-Reeves sio equivalentes. Por outro lado, no caso de uma fungió de
custo náo-quadrática, cías nao sao mais equivalentes.
Para problemas de ntimizagÍQ náo-quadráticos, & forma de Polak-Kibiére do algoritmo do
gradiente conjugado ó típicamente superior á forma de Fletcher-Reeves desle algoritmo, para o que
damos a seguinte explicado heurística (Bertsekas. 1995). Devido á presenta de termas de tcrccira.
ordem o de ordem m;ds alta na fun^no de custo ^w) c a possi veis iinpmc isoes na busca em linha,
a conjugado das diretes de busca geradas é perdida progressivamenlc. Por sua vez, isto pode
causar a tLobstrucáo“ do algoritmo, no sentido de que o vetor de dire^áo gerado SÍ/lj é aproximada-
mente ortogonal ao residual í(n). Quando este fenómeno ocorrc, temos que r(rt) = r{>r — 1), e ueste
caso o escalar j3(«) «rt aproximadamente zero. Corresponden!emente, o vetor de direpac s(n) será
próximo a r(/r), destazando a$Mim a obstruyan. DilcnrnLcracntc, quando a fórmula de Fletcher-Reeves
é usada, o algoritmo do gradiente conjugado típicamente continua obstruido sob condi pocs simila-
res.
Em casos raros, entretanto, o método de Polak-Ribicrc pode rodar i ndefi ni llámente sem con-
vergir. Felizmente, a convergencia do método de Polak-Ribiére pode ser assegurada escolhcndo-sc
(Shcwchuk, 1994)
0*= roaxip^Q! (4.B6)
onde 0HK é o valor definido pela formula de Polak-Rihiiire da Eq, (4.134). Usar o valor de [J definido
na Eq. (4.136) c equivalente a recomcqar o algoritmo do gradiente conjugado se 0PR. < 0. Reeomcfar
o algoritmo ¿ equivalente a esquecer a úllmna direvio de busca e combar novamente na direfao da
deseida mais íngreme (Shewchuk, 1994),
Considero a seguir a quesiao do cálculo de ¡1(4), que determina a laxa de aprendizagem do
algoritmo do gradiente conjugado. Como no caso de p(fl), o método prcfcrívcl para calcular ó
aquele que evita utilizar a matriz hessiana Lcmbramos aqi; i que a minimiza^áo linear bascada
na Eq. (4.126) leva á mesma fórmula pam t|(fl) como aquela derivada da cquaq^o de atualizagio
(4.125). Perianto, precisamos de uma ftusca em finita,14 cojo propósito ó minimizar a fundan ,(w
- t)s) em rela^ao a p. Isto é, dados valores tixes dos velares w e s, o problema c variar r| de l'orma
a minimizar esta fun^ao. Conforme q varia, o argumente w > qs traqa uma linha no espado vetorial
de dimensio W de w. por isso o nomo "busca cm Linha". Um aigarittno de busca em finita c um
procedí mentó iterativo quegera uma scqüéneia de estimativas {r(/j)) para cada iterado do algoritmo
do gradiente conjugado. A busca em linha leonina quando uma solucáo satisfatóra ó encontrada.
Deve ser realizada urna busca em linha ao longo de cada directo de busca.
Varios algoritmos de busca cm linha fontm propostos na literatura, eé importante se fazer unta
boa escolta porque ele tem um impacto profundo sobre o desempenho do algoritmo do gradiente
conjugado no qual está inserido, Qualquer algoritmo de tasca cm linha opera cm duas fases (FIctchcr,
1987):
• Fase de segmenfaído, que procura por lint ftgffirtuto, isto é. um intervalo nfc-trivial que con-
tení um mínimo.
* Fase de xetionamento, na qual o segmento é secfcmodo (i.e., dividido), gerando assim uma
seqüéncia de segmentos cujo comprimento ó progresivamente reduzido.
Descrevemos agora um procedimenío de afuste de curva que considera estas duas fases de uma
forma direta.
Considere que :áBiiil(ri) represente a fum;áo de cusco do perceptron de múltiplas camadas, ex-
presa como uma funcáo de 1^. Assumt>se que ,(1)) seja cstrilamcnte tutimodai (í.c., tem um
único míni mo na vízinhan^a do ponto torrente w(jt)} e é duas vezes continuamente diferenciávet.
Iniciamos o procedimcnki de busca procurando ao lotign da linha alé enconirarmos ote pontos T|r
q . e rL tal que a seguirte cóndilo seja sarisfci'js:
*,Jn । >s - s_A) p«» ti . < nj < n, <4137)
como ilustrado na Fig. 4,25. Como '£ i% ¡q) c uma funcáo continua de r|, a escolta descrita na Eq.
(4.137) assegura que o segmento [q , q.] contení uin mínimo da funcáo (Ti). Desde que a fun^n
^mnl(ri) suficientemente suave, podemos considerar que esta funqfto seja parabólica na v¡z¡-
nhanca :i medí ata do mínimo. CorrespondcnlcmenLc, podemos utilizar a inlcrpota^díi parabólica
inversa para realizar o secionainento (Press et al., 1988), Especifeamente, uma funqáo parabólica é
ajustada atravea dos tres pontos origináisnrn,cn-,.como i lustrado na Fig. 4.26, onde a linha sólida
corresponde a míd(r|) ® a linha tracejada corresponde á primeira iterado do proccdimcnto de
secíonamento. Considere que o mínimo da parábola passando pelos tres pomos T| , t| e n . seja
representado por r|4. No exemplo ilustrado na Fig. 4.26, temos J ®
^nwdtni) ponto é substituido por na, faaendo com que (qp r| J seja o novo segmento. O proccs-
AGURA 4.26 llusUfifáo da
busca em tinlia
figura 4.26 Interpaia$ao
parabólica inversa
so é repetido construindo-se uma nova parábola através dos pontos i] p T| r e r^. O procedimento de
segmenta¡;ao seguida de sccionamcnto, como ilustrado, é repelido varías veas ate que um ponto
suficientemente próximo ao mínimo de seja localizado, quando enrao a busca em linha é
terminada.
0 método de Brent Constituí uma versao mulo retinada do procedí mentó de ajuste de curva
por tres pontos aquí descrito (Press et dL, 1988). Em qualquer estágio particular da computa^áo, o
método de Bren! segue seis pontos da fui^aó ¥ „ ,(qj. que nSo necesariamente precisam ser todos
distintos. Como anteriormente, tentarse aplicar a interpniacao parabólica através destes pontos.
Para que a intcrpolaqáo scja acci[ávcl¡, corto criterio cnvolvcndo os tres pontos restantes deve ser
salisfeilo. Obtém-se como resultado um algoritmo de busca em linha robusto.
Resumo do Algoritmo do Gradiente Conjugado Nao-Linear
I ndos os ingredientes de que necesitamos para dcscrcvcr formalmente a forma nao-linear (náo-
quadratica) do algoritmo do gradiente conjugado para a aprendizagem supervisionada de um
perceptron demúliiplas camadas están agora definidos. Um resumo do algoritmo é apresentado na
Tabula 4.8.
TABELA 4.0 Resumo do Algoritmo do Gradiente Conjugado Nao-Linear para o Tre ¡ñame nto do um
Perccptron de Múltiplas Camadas
Inicializafao
A menos qué esteja dispMível conhecimento pré1- to sobre u vetor peso w, escolha o valor inicial w(0] usando un
procedimento similar ¿quele descrito para o algoritmo de retroprepaga^io.
Coifípuía^ao
I. Pura w(Ü), ose relrnpfupagaqso pare calcular o vetor grad ¡ente g(í J).
3. Faía^0)-H0)--g(0)
3. No ínstenle de tempo w, use uma busca cm linha para cnconlrar r|Ot) que minimiza suficientemente
representando a tun^áo de custo exprese como uma fifflfiú de i] para valores ííxm de w ? x.
4. Teste para determinar M a norma cuc I ¡diana do residual n| ri) rain ahai xa de um valar cspec iíicada, isto é, uma
fra^fto do valor inicial ||r( |.
5. Atualize a vetor pesa:
w(rt + i) *</r} +
h. Pare wfo + I ), use reiiftpnspag&fio para calcular d vetor gradiente alcalizado g(jr + i).
7. Faga rl'.1? + 1} = -g^rr + l).
fl. Use a método de Polak-Ribiére para calcular p(n i i):
|J(*i + I) = max-
r'i'j 1 l)(Kn+ li_rrJ;}j ()
r\n)r(n)
9. Atualíze o vetor de d IrecSo:
sín + n-rtfl i- L}+ (Krít DsW
IO. Fa?a ft = tt + i e volte para o passo 3.
Criíério de parada- Encerré o algoolmo quando a seguinte cundid for saiisíeíta!
Hn¡>rjM <dlr(0)H
onde e é um número pequeño pncdelcnninado.
Métodos Ouase Newton
Rjesumindo a discussáo sobre mélodús qliase Newton, constatemos que des s^o básicamente méto-
dos de gradiente dése ritos pela equa^ao de atualiza^áo:
w(w - 11 = w(rt) + r| (ff)s(r}
onde o vetor de dirof ao s(r) ¿ definido cm termos do vclor gradiente g(/r) por
s(ff)= -S(nlgíff)
(4.1381
(4 139)
A matriz S(jt) é urna matriz definida posilivamente que c ajustada de uma iteradlo para a seguinte.
Isto é feite de modo que o vetor de directo s(n) aproxime a direfíio de Ne^rtoft, ou seja
> mciF * ' mnJ
Os métodos quase-Neu'ton utilizam i n formado de segunda ordem (curvatura) acerca da su-
perficie de erro, sem realmente requerer ccuihecimento da mati iz hessiana H. El es conseguem fazer
isto utilizando dois vetores iterativos sucessivos wfri) e w(n + l}s juntamente ccun os respectivos
vetares de gradiente g(n) e r(h । 1). Considere que
q(w) = gpí + 1) - g(w) (4.140)
c
Aw(n) = w(tf + 1) w(jf) (4.141)
Podemos entao derivar a infiorma^áo de curvatura usando a fórmula aproximada:
q('í)“¡ “ (?(«}] Aw(n) l cJW J (4.142)
Em particular, dado JFincrementos de peso linearmente independentes Aw(O). Aw( 1) Aw( W-1)
e os respectivos incrementos de gradiente q(0), q( IX q( W'-l), podemos aproximar a matriz hessiana
II como:
H - [q(OX q( 1} q( WM)] [Aw(0), Aw( 1V-, Aw( W- 1)] (4.143)
Podemes tambem aproximar a matriz hessiana inversa como;
H 1 =* [Aw(0), Aw(l) Aw(F-4)] [q(0k q(l) qíFT-l)]-1 (4.144)
Quando a funtjáo de custo 7 íw) c quadrática. as Eqs. (4.143) c (4.144) sáo exatas.
Na classe mais popular de métodos quase Ne^ton, a matriz S(/r +1)6 obtida a partir do scu
valor pné\ ¡o S(«) c dos vetores Aw(h) e q(w), utilizando a recursáo (hlelcher, 1987; Bertsekas,
]O9S>:
X n - w»u AwQj)Awr(jr) S(n)q(/r)q'(j?)S(n) ' 1 -1 F + L J — ot " f + r r qf(n)q(n) q (n)S(?i)q(j?) + l5(w)[qr(íi)S('0Q(n)][v(n)vr(?;)¡ (4.145)
onde
. _ Aw(rf) S(n)q(jT) Awt(jí)Aw(hj) qJ’(d)S(n)q(jj) c i1 < ^(/r) £ l para todo n (4.146) (4J47)
O algoritmo é iniciado com uma matriz definida positivamente arbitraria S(0). A forma particular
do método quase Newton é paramelrizada de acordo com a definido de qO.'l, como indicado a
Seguir (Flctohcr, 1987):
• Para “ O para todo fl, oblemos o fl/gw/fffffl ¿te Davldan Ficicher- PtrwcU (DFP>. que é
históricamente o primeina algoritmo quase-Newtcm.
• Para !^(n) = l para tódo n* oblemos o afgcN limo Bnmfen - Fietcher- Guliifarb—HifarifiQ, que
é considerado a melhor torna de método quase-Ncwton, conhoctda atualmcnlc.
Comparando entre os Métodos Qua se- Newto n
e os Métodos do Gradiente Conjugado
Concluimos esta breve di se tissáo dos melados quasC’Ncwton comparando-os Caín métodos do gra-
diente conjugado, no contexto dos problemas de olimíza^So n<io-quadráticos (Bertsekas, 1995):
• Tamo os métodos quasc-Ncwion como os métodos do gradiente conjugado evilam a neceas i-
dade do se usar a matriz hessiana. Entretanto, os métodos qliase-Newton v3o um passo odiante
gerando uma aproximado para a matriz hessiana inversa. Conespondentementci quando a
busca em linha é precisa e estamos próximos de um mínimo local com uma hessiana definida
positivamente, um método quase-Newton (ende a aproximar o método de Newtón. alcanzando
com isso uma convergencia mais rápida do que seria pussível com o método do gradiente
conjugado.
• Os métodos quasc-Newton náo sáo táo sensiveís a precisilo no estáglo da busca cm linha da
ntimizazáo quanto o método do gradiente conjligado.
Os métodos quasc-Ncwton requervm armazenamento da matriz sl£m do cusió da mullí-
plícafáo matriz-vetor associadn com a compulazáo do vclor de diic^ao s(fl). O resultado disso
é que a complexidad^ computactonal dos métodos quase-Ncwlün é CJfH*), Diferentemente, a
complcxidadc ccmputactonal do método do gradiente conjugado é (X^O- Assim. quando a
dimensiln IF(i.e., a tamanho dn vetor peso w) c grande, os métodos do gradiente conjugado
san preferiréis aos métodos quasc-Ne^tón em termos ccmputac ionais,
É por causa destó último ponto que n uso de métodos quasc-Ncwton é rcstrilo, na pralica, ao projeto
de redes neurais de pequeña escala.
4.19 REDES CONVQLUTIVAS
Até este ponto, esti vemos preocupados com o projeto algorítmico de purceptrens de mullí pías ca-
madas e com questücs relacionadas. Nesia se^áo. enfocamos a planta estrutural do perceptron de
múltiplas camadas propiamente dita. Em particular, dcscrcvcmos uma elasse especial de pcTccptrons
de múltiplas camadas conhccidas colctlvamcnlc como fvites ctmw/iííivas; a idéia por tras deslas
rede» foi apresentada brevemente no Capitulo I.
Uma rfftia cfinwiiulivii é um perceptron de múltiplas camadas projetada específicamente para
rcconheccr formas bidimcnsiortaLs com um aleo grau de invari áncia quanto a iranslaz^o. esca lamento,
inclinazáa e outra» formas de distcrqaa. Esta dificil tarefa é aprendida de uma forma supervisionada
por meló de uma rede cuja estrutura incluí as seguintes formas de (LeCun e Bengio,
1995):
1, Extra^at) de características. Cada neu ron ¡o recebe -leus $ । nais de ent rada deum campo recep-
local na camada anterior, O que o forQá a extra ir características loes is. Uma vez que uma earac-
terística seja extraída, sua local i zac 3o exata se toma menos importante desde que a sua posi^o em
relajo a outras características seja aproximadamente preservada.
2, Mapeamento de camcterí.'iticQX. Cada camada computacional da rede c composta de múlti-
plos mapas de características, sendo cada mapa de características na forma de um plano dentro do
qual os neuronios individuáis estilo restritos a compartilhar o mesmo conjunto de pesos sinápticos.
Esta segunda forma de restribo esirutural tem os seguíntes efeitos benéficos:
• Invariáncia a d&iocam&tlo, introducida na operado de um mapa de características atreves
do uso de ctMno/ufdü com um núcleo (terne!) de pequeño tamanho, seguido por uma fun^«¡o
sigmóide (limitadora).
• Redundo do número de parámetros ilvres, obtida através do uso de compariilhamento de pe-
sos.
3. Subamostragem. Cada camada convolutiva é seguida por uma camada computacional que
calcula a média local e realiza UTna.wfram¿MZrflg£ffl, raduzindo desta forma a resolupao do mapa de
características. Esta opera^áo tcm o efeito de reduzir a sensibilidade da saída do mapa de caracterís-
ticas cm rcld^ao a dcslocamentos e outras formas de distor^áo.
O desenvolvimcjito de redes convolutivas, como descrito acima, tcm motivado neurobidógioa.
com origen no trabalho pioneiro de Hubel c Wiesel (1962,1977) sobre scnsibil idade local c neurónios
seletivos á orientado no córtex visual deum gato.
Enfati zainos que lodos os pesos cm todas as camadas de uma rede convolutiva sao aprendidos
por treinamento. Além disso, a rede aprende a extrair suas próprias características automáticamen-
te.
A Figura 4.27 mostra a planta arquitetura! por uma rede convolutiva constituida de uma cama-
da de entrada, quatru camadas ocultas e uma camada de salda. Esta rede é projetada para realizar
pmees.tamenro de ¡magas (p.cx., rcconhccimcnlo de caracteres manuscritos). A camada de entra-
da, constituida de 28 x 28 nós senscriaís, recebe a imagem de diferentes caracteres que foram
aproximadamente centrados c normalizados cm tamanho. Dcpois disso, as plantas eomputacfonais
se altcmam entre convolu^áo e subamostragem, como aquí descrito:
FIGURA 4.27 Rede canvctutiva pera o priwgggamefltu de ¡rnagem cama por exemplo, a rattOTtaCrnenlQ
de caradoras «nanusentos. (Reproduitda com parmissáo da HIT Pro»)
• A primeini camada oculta realiza convoluqáo. Consiste de quatro mapas de características,
com cada mapa conestí indo de 24 x 24 neurónios. A cada neurónio é atribuido um campo
receptivo de tamanho 5 x 5.
* A segunda camada oculta reali za subamostragem e ca Lcula a méd ia local. Consiste tambem de
quatro mapas de características, mas cada mapa c constituido agora de 12 x 12 neurónios.
Cada neurónio tem um campo receptivo de tamanho 2 x 2, um coeficiente ticinávcl, um bias
treinável e uma fun^áo de ativa^áo sigmóide. O coeficiente trchiável e o bias controlara o
ponto de operado do neurónio; por exemplo. se o coeficiente c pequeño, o neurónio opera cm
um modo quasc I incar.
• A terueira camada oculta realiza uma segunda convelido. Consiste de 12 mapas de caracte-
rísticas, com cada mapa consi'¡i indo de 8 X R neurónios. Cada neurónio nesta camada Oculta
pode tcrccncxocs sináplicas com varios mapas de características da camada oculta anteceden-
te. De resto. ela opera de forma similar a primeira camada convolutiva.
• A quarta camada oculta realiza uma segunda subamostragem c cálculo da méd i a local. Con-
siste de 12 mapas de características, mas cada mapa consiste de 4 x 4 neurónios. De resto,
opera de forma similar á pn metra camada de subamostragem.
A camada de saída realiza um cstágio final de convoluíáo. Consiste de 26 neurónios. sendo
que a cada neurónio é atribuido um carácter de 26 caracteres possíveis. Como anteriormente,
a cada neurónio c atribuido um campo receptivo de tamanho 4x4,
Com lis camadas ccmputacionais sucessivas se alterando entre convolu^ao e subamostragem, obre*
mos um efeito “bipiramidar. Isto é, em cada camada comolutiva ou de subamostragern^o número
de mapas de características c aumentado, enquanto que a resolufáo espacial é reduzida quando
comparada cora a camada antecedente. A idéia de convolufáo seguida de suhamostragem é inspira-
da pela ntx;áo de células “simples" seguidas de células “complexas” que foi descrita pela primeira
vez por Hubel c Wicscl (1962).
O perceptron de múltiplas camada* descrito na Fig. 4.27 cerniera aproximadamente lüO.üOO
conexoes sinaplicas, mas apenas cerca de 2600 parámetros livres. Esta draraái ica redujo do núme-
ro de parámetros livres é oblida pelo uso de compartilhamcnto de pesos. A capacidade da máquina
de aprendizagem (medida cm termos da dimensáo V-C) é. desta forma, reducida, o que por sua vez
mel hora a sua hábil xlade de generaliza^áo (LeCun, 1989). O que c a inda mais notávcl é Que os
ajustes dns parámetros livres sáo feitos a partir da forma estocástica (seqñencial) da aprendizagem
por retroprüpagafáo.
Um outro ponto importante c que o uso de compartíIhamento de pesos toma possível a
implcmcntacáo da rede convolutiva de forma paralela. Esta éuma outra vantagem da rede con volitiva
sobre um perceptron de múltiplas camadas totalmente conectado.
A licáo a aprender da redeeonvolutiva da Fig. 4.27 tem dois aspectos. Primeiro, um perceptron
de múltiplas camadas de tamanho mancjavcl c capaz de aprender um mapeamento náo-l inear com-
plexo. de alta dimensional idade, tvatríHffittcio seu projeto alravésda incorporado de conheci mentó
previo sobre ;i [arela consi deracLi. Segundo, os pesos sinápticos e ni veis de bias podem scr aprendí -
dos circulando-se o algoritmo de retropropagaíáo através do conjunto de treinamento.
4.20 RESUMO E DISCUSSAO
A aprendizagem por retropropaga^o emergíu como o algoritmo padraa para o treinamento de
perceptrons de múltiplas camadas, com o qual outros algoritmos de aprendizagem sáo comparados.
O algoritmo de retropropaga^áo deriva seu nome do Taio de que as derivadas parciais da funfác de
custo (medida de desempenho) em rclafáo aos parámetros livres (pesos sinápticos c ni veis de bias)
da rede sao determinados por retropropaga^áo dos sinais de erro (calculados pelos neurónios de
saída) através da rede, camada por camada. Fazendo isso, ele resolved problema de acribui^áo de
crédito de uma forma muito elegante. A for^a computan i anal do algoritmo advém dos seus dois
principáis atributos:
• Utiliza um método foco/ para atuallzar os pesca sinópticos e niveis de bias do perceptron de
múltiplas camadas.
• F.mprega um método ejicicnre para calcular todas as derivadas parciais da lun^ao de custo cm
relapso a estes parámetros livres.
Para uma determinada época de dados de treinamento, o algoritmo de rctrepropaga^áo opera em
um modo dentro dois modos possí veis: stqücnckil ou por lote. No modo scqücncial, os pesos
sinópticos de todos os neurónios da rede sfo ajustados para cada padreo. Conseqüentemente, a
estimativa do vetor gradiente da superficie de erro usado na computapao c de natureza cstocástica
(al catón a), por isso o nome “retropropagafOo estocástica", que é também usado para denominar o
modo scqücncial da aprendizagem por retreprepuga^áo. Por outro lado» no modo por lote, os ajus-
tes de todos os pesos sinópticos e niveis de bias sao feitos para cada época, resultando que uma
estimativa mais precisa do vetor gradiente ¿usada na computacac. Apcsar das suas desvantagens, a
forma scqucncial (cstocástica) da aprendizagem por rctropropaga^áo é a mais frcqücntemcntc utili-
zada para projetar redes neurais, particularmente em grandes problemas. Pitra alcanzar me Hieres
resultados, é necessária uma sintonía cuidadosa do algoritmo.
Os dcialhcs específicos envolvidos no prejslo de um perceptron de múltiplas camadas depen-
de naturalmente da aplicado de interesse. Podemos, entretanto, fazer duas dlstinpoesi
L Na Classificacáo de padrees cnvolvcndo padrees nao lincarmcntc separaveis, lodos os neurónios
da rede sao nao-lineares. A náo-linearidade é ohiIda pelo uso de uma funche sigmóide, cujas duas
formas típicamente utilizadas sao (a) a fúnpac logística, náo-s i métrica c (b) a fúnpáo tangente
hiperbólica, anti-simétrica. Cada neurónio é respcmsável por producir um hiperphno particular no
espado de decisóo. A través de um processo de aprendizagem superví donada, a combmacao dos
hiperplanos formados por todos os neurónios da rede c ajustada iterativamente de modo a separaros
padróes retirados de classes diferentes e náo vistos anteriormente, com o menor número de emos de
clas^ificacáo, cm media. Para a classificaqao de padrees, □ algoritmo de rclrepropagacao cstccástico
é o algoritmo malí; ampíamente utilizado para realizar o treinamento, particularmente em grandes
problemas (p.ex., reoonhccimenlo de caracteres óticos).
2, Na regressáo I i near, o intervalo de saida do perceptron de mú If ¡pías ca m adas de ve ser su Pici en-
temente grande para eonter os valores do processo; se esta infermacao nao esl i ver dispon ívcl, cntáo
O mais razoável é a ultlizacáo de neurónios lineares. Como no caso dos algoritmos de aprendiza.-
gem, I aremos as segu intes observables:
• O modo seqüene iál (tstocáslico) da aprendizagem por rctrepropaga^áo c muiio mai s lento que
o modo por lote.
• O modo por lote da aprendizagem por retropropagaoao c mais lento que □ método do gradiente
conjugado. Note, entretanto, que o último método pode apenas ser utilizado no mudo por lote.
Concluimos esta diseuss^ü com algumas obscrvapccs fináis sobre medidas de desempenho. A deri-
vafáo do algoritmo de rctropropagapáo apresentada neste capítulo está baseada na miniraizapao da
ñinqáo de custo ., definida, de uma forma ou de outra, tumo a media sobre o conjunto de treiñá-
menlo mteiro da soma de erros quadrados. A mais importante virtudc dcste critério é a sua genera-
lidade c mancabilidadc matemática. Entretanto, cm muitas situares encontradas na prática,
ni mu mazar a fun^áo de custo V corresponde a otim izar una quantidade iiitcrmodiária que nao é o
objetivo último do sistema e que, por isso, pode levar a um desempenha abaixo do ¿timo. Em
sistemas comerciáis para o mercado de espitáis. por exemplú, o objetivo principa] do imestidor ou
de um negociante c maxitnizar o retomo esperado com risco mínimo (Choey e Weigend, 1996;
Moody e Wu, 1996J. A ra~an Sharpe ou nzzób de recómpensa pw vvfutilitkidtí como uma medida
de desempenho do retomo ajustado a risco é intuitivamente unáis atraente que^^.
NOTAS E REFERENCIAS
1. As fúmjóes sigmóides bSo chamadas assim porque seus gradeos apresentam a forma de
Hs". Menon et al. (1996) apnesentam um escudo dcialhado de duas clanes de sigmóides:
• &gnnWej .ijjnpfef, definidas como sendo tuneóos do uma variávd, impares* limitadas
assiiitoticamcmc c completamente monótonas.
• SriprtóÁíw Aj/xtÍu/ícím. representando um subconjunlo adequaiio de sigmóides sim-
ples e uma generalizarán natural da tunQáo tangente hiperbólica.
2. Para o caso especial do algoritmo LMS, foi mostrado que o uso da constante de inomento
a reduz o intervalo cstável do parámetro da taxa de aprendizagem q e pode levar á
instabi Iidade se t| nao for ajusiado adecuadamente. ALéni disso, o desajuste aumenta
com o aumente de a; para ddalhcs. veja Roy e Shynk (1991)).
3. Para uma deriva^-au do algoritmo de relropropagacáo incluindo a constante de momento
nos scus principios básicos, vqa I logizara (1992).
4. Diz-se que um vetor *’ e um ojóróno foca! de urna fundió de entrada^saida F se cíe nao
for pior que seus vízínAas, isto c. se existir um £ tal que (Bertsekas, 1995)
F[w*) £ F(w) para todo «r com ||w - w* || < <
Diz-se que o vetor w* ¿ um nrúuinv gfohtil da fundió F se ele n5o for pior que todos os
outnos vetores; istoé,
F(w*) < F[w) para todo w ti R"
onde J? C a dimensáo de w.
5. A primcira dcscricáo documentada do uso de rtítropropagaclo para o cálculo eficiente do
gradiente foi aprcscnladx por Warbos (1974). O material apresentado na Sepilo 4.1 Ü
segué o tratamento dado em Saarinen et al. (i 992); uma discussao mais gcral deste
tópico é xpresentada por Werbon (J 990).
6. Güiros aspectos do piojero de redes neurais que se benefic ¡am do conhecimento da matriz
heuiana incluem (Bishop, 199 5):
(1) A hessiana forma a base de um procedimiento para o retreinamente de um perceptron
de múltiplas camadas após ter sido realizada uma pequeña mudanza nos dados de
trei ñámente.
(2) No contexto da apreiidizagem bayestaña,
• a invmá da matriz hessiana pode ser usada para atribuir bandas de erro á predico
nao-linear teita por uiha rede neural treinada, e
• o( autovalores da matriz hessiuna podem ser usados para determinar valores adequa-
dos para os parámetros de regularizadlo.
7, Bunr.ne e Weigcnd (1994) apresenlam uma revtsao sobre algoritmos exatOS e aproxima-
dos para calculara matriz hessiana, com referencia particular ás redes ncuraig; veja tam-
bém o artigo de Battih (1992).
O teorema da aproximado universal pode ser v i sto como uma exlensáo natural do
fti’tewrrasj (Wcierstrass, 1885). Este teorema afirma que quelquar futi^do conlimia
sabré um intervalo fechada na fixQ real pode ser ÉXpriSSü HúQli€fe iñlervafü eúfttO UtntI
serie de polinomios absolutamente e uniformemente convergente.
O interesse na pesquisa sobre as virtudes dos perceptrons de múltiplas camadas como
dispositivos para a representará*) de fundóos continuas- arbitrarias lalvcz tenha sido pri-
meiramente colocado no centro das atcn^ocs por Hccht-Nielsen (1987), que iarocoD uma
versanmclhiirada pnr Spnchcr (1 965)do teorema da superposi^áo-de Kolomogorov. Mais
tarde. Qallant c Whitc (1988) mostraran! que um perceptron de múltiplas camadas Com
uma única camada oculta com limlta^ilo monótona "co-scnoidal" na camada oculta c sem
limiia^So na saida se enquadra como um caso especial de uma "rede de Founer” que
produz como sua saida uma aproximando por série de Ftjurier pan uma dada fun^áo.
Entretanto, no contexto dos perceptrons de múltiplas camadas (radiciraiaisk foi Cybcnko
quem demorislnw rigorosamente, pela primeira vez, que uma única camada oculta é sufi-
ciente para aproximar unilbimcmcntc qualqucr furnjáo continua com suporte cm um
hipercubn uniiino, este trabalho foi publicado como um Relaíót io Técn ico da Universuy
oí Illinois cm 1988, c republicado como um artigo um ano dcpois (Cybmku, 1988.1989).
Em 1989, dois quitos artigas foram publicados indcpcndcntcmcntc sobre perceptrons de
múltipla*» camadas como a próxima dores universais, um por Funabasl» eo outro por Homik,
Stinchcombc c Whitc. Para contribuidles subseqüentes sobre <i problema de aproximado,
veja Light (1992b).
9. A históri.i do desenvulvimenio da validado cruzada está documentada em Stone (1974).
A idíia da valid.i^ao creaada tcm estado presente pelo cnenos desde os anos 30, mas um
refinamente da técnica foi realizado nos anos 60 c 70. Dois artigas importantes daqucla
era súo Stone (1974) e Geisser (197$)» que a propuseram independen: emente e quase si-
multáneamente. A técnica foi denominada "método de validaca» cruzada1' por Stone c
"método de reutiliza^áo prcvisivcl de amostras" por Géttter.
Ifl. As referencias mais antigas sobre métodos de treinamento de patada antecipada incluem
Morgan c Bourlard (1990) c Wcigcnd ct al. (1990). Talvcz a análise estatística mais déla-
Lhada do método de parada antecipada para perceptrons de múltiplas camadas esleja apre-
sentada cm Aman d al. (1996a). O mudo é sustentado por simula^oes computacionais de
um clasificador 8-8-4 com 108 parametros austáveis cum conjunto de dados muito gran-
de ($0.000 exem píos).
II. A de aprendizagem por eorrelat;do em cascata (Fahlman c bebiere, L 9901 c
um exemplo da abordagem de crescimento de rede. O procedimento cometa com uma
rede mínima que tem alguns nós de entradas e um ou mais nós de salda, como indicado
pelas conjideracocs de cutredíL?5aida1 mas nSo posaui nns ocultos. O algoritmo LMS, por
exemplo. pode ser usado para tremar a rede. Os neurónios ocultos sáo adicionados á rede,
um por um, obtendo desta forma uma estrutura de múltiplas camadas. Cada novo neurónio
oculto recebe uma concxáo smápl¡ca de cada um dos nós de entrada c também de cada
neurónio oculto já existente Quando um novo neurónio oculto ó adicionado, os pesos
sinápticos do lado da entrada daquele neurónio sáo congelados: apenas os pesos sinápticom
no lado da >aida sáo trentados repetidamente. O neurónio oculto adicionado cniao se toma
um detector de características permanente da rede. O procedimcnlo de adicionar novos
ncucunins ocultos c continuado da maricira descrita, até que se obtenha um desempenho
satisfatórip.
Em uma outra atwrdagem de descimentó de rede descrita cm Lee et al. (I99ü), um
tercxito nivel computacional, denoruinado adapla^ao a nivel eslntíuntk é acrescentado ao
passo de propaga^ (adaptado a nivel funcional) c ao passo de retropropaga^ti (adapta-
do a nivel paramétricn). Ncstc icrociro nivel computacional, a estniturt da rede é adapta-
da modiíicandCFse o número de ncurón ios c a relacSo estrutura! entre os neuroniüs da rede.
O critério usado é que, quandp o ctto estimativo (após a convergencia) for muiur que um
valor desejado, um novo neurónio é adicionado ú rede em uma jKisí^áo onde ele seja mais
necesario. A posi^áo desejada para o novo neurónio é determinada monÍTorando-sc o
Hidden page
Hidden page
Aprendizagem por retnppropagafáo
43 A inclus&o de um termg de momenii) na ¡Ltualiza^ú dos pesos pode ser vista como um
mecanismo para satisfazer as heurísticas 3 c 4, que fomcccm normas para acelerar a COrt-
VNftacifl do algoritmo de retropropaga^So, o que foi discutido na Se^to 4.17. Demonstre
a validada desta afirmado.
44 Atribui-se, normalmente, á constante de momentii o um valor positivo no i Hiérvalo Ú S ú
< 1. Investigue a difcrcr^a que faria no componamentc da Eq. (4.41} em relajo ao tempo
t, se fbsse atribuido a a um valor negativa no intervalo -I < Ct £ 0-
4-5 Considere o ejemplo Simples de uma rede envolvendo um único peso, para a qual a timólo
de custo é
,é(ui) = ^(w-w^+Aj
onde A, e A, sio constantes. Usa-so um algoritmo de retropropagaíao para minimizar
'¡fi(w).
Explore o modo como a inciusáo da conslante de momento Ct influencia o processo de
aprendizagem, rom referencia particular ao número de épocas necessárias para a conver-
gene i a cm fum;áo de <L
4.6 Na Se$3o 4.7, apresentamos argumentos qual ilativos para a propriedade de um classifíca-
dor por perceptron de múltiplas camadas (usando uma fun;£o logística como a náo-
lincaridadc) de que as suas saidas fornecem estimativas das probabilidades de elasse tí
püsteriari. Esta propriedade assumc que o tamanho do conjunto de treinamento d suficien-
temente grande e que o algoritmo por retropropagaf 3o usado para (reinar a rede nüo fica
preso em um mínimo local. Completa os detalhes matemáticos desta propriedade.
4.7 Combando com a funcáo de costo definida na Eq. (4.70), derive a soluto que minimiza
a Eq. (4.72} e o valor mínimo da fún^ao de custo definida na Eq. (4,73).
43 As Equa^ocs de (4.81) a (4.S3) definem as derivadas parciais da funcSo aproxímaliva
F(w,x) realizada pelo pcrccptron de míitriplas camadas da l'ig. 4.1S. Derive eslas equa^íes
a partir do seguirte cenário!
(a) Fun^ao de Cailü:
(b) Sa¡de do neurónio/„
y,
onde tü„éum peso sináptico do Ticunonto (pura o nmrtfnio/e^ é a safda do neurónio j;
(c) f'iáü-iitKarjdaíie;
1 +e)tp(-ti}
Validado cruzada
4.4 Pode .‘¡er argumentado que a validarán cruzada é um estudo de caso da minimizaQSc estru-
tural de risco que ü discutida nq Capitulo 2. De$crev& um exemplo de rede neural utilizan-
do valida^So cruzada que sustente este argumenta-
4. til Na valida^áo cruzada múltipla, náo há uma separa^úo dara entre os dados de treinamento
e os dados de teste (validado)» como no caso do método de resistencia. É possívcl que a
validado cruzada múltipla producá, urna estimaciva tendenciosa? Justifique □ sua resposta.
Técnicas de poda da rede
4J1 Ch critérios estatísticcis para, selecto de mode lo. como o criterio do mínimo comprimento
de describas (AdCD} de R fcsanen e jííw criterio teórica do informando (CTt) de Aku ¡ke.
compartilham uma forma comutn de comporto:
'Critério por complexidades í Fun^áo
,, do modelo J vercissimilhanya
Ponido da
complexidade da modelo
Discuta como os métodos de dcc^imcnto de peso c de climinn^ao de peso usados para
podar a rede se ajuslam oeste formalismo.
4J 2 (al Derive a fórmula para a saliendo S dada na Eq. (4105).
(b) A ssuma que a matri z hessiana do emi médio quadrado de um perceptron de múltiplas
camadas em relajo a seus pesos pode ser aproximado por uma matriz diagonal como
segue;
]{ diag[fr:Ph;3..frIHI. |
onde 4Fc o número total de pesos da rede. Determine a sal ¡encía 5 do peso W da rede.
Acelerado da convergencia da aprendizagem par retropropagafáo
4,13 A negra de aprendizagem delta-barna-deka (Jacübü, US SI representa urna forma modífi-
cada do algoritmo de retnopropagat;do que se baseia ñas heurísticas descritas na Se^áo
4.17, Nesta regra, alribui-sc u cada pew sinóptico da rede um parámetro da taxa de aprcri'
dizagem particular A funijáo de custo, E[n), d perianto, modificada de uma forma cofres*
pándente, Em entras palabras, apesar de F(jt) ser maiEmaticamtntc similar á fun^áo de
cu Ato í(«) na Fq.(4 21. o espafo de parámetros relativo á nova ñineSn de custo eovol-
ve diferentes tasas de aprendi¿agcin.
(a) Derive uma expresado para a derivada patCud d£(n)/<)r|^; t), onde q (h) ¿ o parámetro
da taxa da aprendizagem associado ao peso siníptico w jyr).
(b) Com isso, demonstra que os ajustes feitos nos parámetros da taxa de aprendizagem
bureóos rn> resultado da pane (a) estBo perfeítamentc de acardo com as heurísticas 3
c 4 da Sc^áo 4.1 7.
Métodos de otimiza^BO de segunda ordem
4,14 O uso de um termo de momento na atualizaqáo dos pesos descrito na Eq. (4.39) pode set
considerada como uma aprorimafáo do método do gradiente conjugado (Battiti, 1992).
Discuta a validado desta afírmalo.
4.15 CoflOAfandc cmm a fórmula pura p(rr| n4 Eq. (4.133), derive a fórmula de Hesfeness-Siicfef'.
rr(,r)(iVi)- r(ff-]))
ir(« - 1M* -11
onde s(jt) é o vetar diretácj e r{n) é o residual no método do gradiente conjugado. Use este
resultado para derivar a fórmula de Folak-Ribiére da Eq. (4.134) t a fámula de Flclchen
Rccvcs da Eq. {4.I35X
Experimentos compulse ¡onais
4.16 [nvEüiigue o uso da aprendizagem por retroprepagacáo usando uma náo-linearidade
siguió ide para realizar os mapeamentos um-para-um, descritos abaixo;
Hidden page
Hidden page
CAPÍTULO 5
Redes de Fun$áo de Base Radial
5.1 INTRODUQÁO
ü pro jeto de uma rede neural supervisionada pude ser ejecutado de varias formas. O algoritmo de
retropropagac^o útil izado para o prajcto de um perceptron de múltiplas camadas (sob supcrvisao),
como descrito no capítulo anterior, pode ser visto como a aplicado de uma técnica recursiva confio
cida na estatistica como aproximaran extocástica. Neste capitulo, tomamos um enfoque totalmente
diferente ao vero prajeto de uma rede neural como umpmbtcma de ajuste de curva (aproximarán)
em um espado de alia dimensional i dade. De acorde com este ponto de vista, aprender c equivalente
a encontrar uma superficie, em um espado mult i dimensional, que fbrne^a o melhor ajuste para os
dados de treinamento, com o criterio de "melhor ajuste*' sendo medido em um sentido estatistico.
Cornespcndentcmcnte, general i za^áo c equivalente ao uso desta superficie muí (^dimensional para
interpelaros dados de teste. Tal ponto de vista é a motivado per tras do método das íuncocs de base
radial, no sentido de que isto o aproxima dos trahalhc» de pesquisa em interpolaíSoestrii i tradici-
onal em um espado multidimcnsional. No contexto de uma rede neural, as unidades ocultas fome-
cem um conjunto de “fundes” que constituem uma “base” arbitraria para os padrees (velores) de
entrada, quando eles silo expandidos sobre o espado oculto: estas fun^oes. sáo chamadas de Jun$óe3
de base radia/.' As fun^óes de base radial foram primcira mente inLroduzidas na sqlufño do proble-
ma de interpolado multivariada real. 0 trabalho inicial nesteassunto é detalhado em Powdl (1985),
e um irabalho mais recente é examinado em Light (1992b). Este é atualmente um dos campos
principáis de pesquisa em análise numérica.
A construyo de um rede deftmráo de base radial (R8F> raditd-busisjunctíon), em sua forma
mais básica, envolve tres camadas com papéis totalmente diferentes. A camada de entrada é consti-
tuida por nós de fonle (unidades sensorials) que concctam a rede ao seu ambiente. A segunda cama-
da, a única camada oculta da rede, aplica uma transfarmapáo nao-linear do espado de entrada para
o espapo oculto; na maioria das aplícales, o espado oculto é de alta dimensionalidade. A camada
de saída c linear, fomecendo a resposta da rede ao padreo (sinal) de aiivaqáo aplicado á camada de
entrada. Uma justificativa matemática para a estrategia de uma transforma^áo nao-linear seguida de
Hidden page
Um problema complexo de classifica^Sn de psdrdes disposio itio tacamente em um espade de alta
dimens^o tem maior piuhabilidade de ser linearmente separtvel do que em um espade de taita
dimensionalidade.
Do traba! ho que desenvolvemos sobre percepirons de camada única no Capitulo 3, sabemos que,
urna vez que tentamos padrees linearmente separáveis, o problema de classiííca^ao c relativa-
mente fácil de ser resolvido. Ccmseqlientemente, podemos desenvolverá nossa compreensáo so-
bre a operado de uma rede RBF como um clarificador de padrees estudando a separabilidade de
padrees
Considere uma familia de superficies onde cada uma divide natura]mente um espado de
entrada em duas regí des. Considere que represente um conjunto de N padrees (vetores} x,,
ip..., ijp cada um dos quais é atribuido a uma de duas classes #,?<?.. Dizemos que esta dícolomia
(panifáo binaria) dos pontos c separável em rcla^áo á familia de superficies, se existir uma super-
ficie da familia que separe o pontos da elasse Jaqueles da elasse i 2. Para cada padrao i €
defina um vetor constituido de um conjunto de fundes de valor rea] l<Pi(x)b’ 1,m,¡, como
mostrado por
#>) = (q>!<ic\q»2(xK.. hq>ra (i)f
(5 1)
Suponha que o padreo x é um vetor em um espado de entrada de dirnensao O vetor <p(x), entilo,
mapeia pontos no espado de entrada de dimensao wj para pontos cm um novo espado de dimensáo
rrtr Referimo-nos a <p.{x) como uma fungue vertirá, porque ela desempenta um papel similar ao de
uma unidade oculta em uma rede neural alimentada adrante. Correspondentemenie, o espado abran-
gido pelo conjunto de funqdes ocultas {tp/x)}^ é referido como o espado oculto ou espado de
características.
Uma dicotomía {3* . 9,} de S é dita ser separáveipor tp, se existir um vetor w de dimensáo n\ (
para o qual podemos escrever {Cover, 1965)
*r<p(ií }> 0. x^S;,
wTqi(x)<0J xeSfj
(5-2)
O hiperplano definido pela equaqáo
wrqi(x) = <)
descreve a superficie de separaf3o no espado tp (i e T espado oculto). A imagem inversa deste
hiperplano, isto é.
Xt 0
(5.3}
define a superficie de separando no espado de entrada.
Considere uma elasse natural de mapeamentos ubi idos utilizándose uma combina^áo linear
de produtos de r coordenadas veíoriais do padrao. As superficies de separado correspondentes a
estes mapeamentos s3o referidas como variedades racionáis de ordem r. Uma variedade racional de
Hidden page
Hidden page
1X3 '
0.3 -
<Pí
ÍJÁ -
FTDntei ni
' s de dk'tisin
0,4
(0,1)
II.i!)
(Olí)
(11)
• (0.0)
oa
_L_
0,4
Oj6
<Pi
OJS
IX)
M
0
u
(a)
<b)
Fl GU RA 5.2 {a! Q; quatro pudrías dú prtMfiiTiá do XOH; (b) Diagrama da tomada
de dOcisáü
TABELA 5.1 Especlbcacáo das Fuñadas Ocultas para o Problema
do XOR do Exemplo 5.1
Padreo de Üntreda, X Pnmc:ri Fundan Oculta, Segunda Funfan Oculta,
(1,1) 1 n, 1353
(ti. 11 (>.3678 0i367ti
(0.0) 0,1353 1
(1.0) 0367 B 03678
entrada, (l, l) e (ü, ü). Por conseguintc, o problema do XOR pode ser fácil mente nsolvido usándose as
fungues (p (k) e ip^fr) como as entradas de um classificador linear como o perceptron.
Neste exetnplo, nao h:i aumento da dimensional ¡darle do espado oculto, comparado ao espapo de
entrada. Em outra!» palavras, a naodincaridadc ejemplificada pelo uso de funcocs ocultas gaussianas é
suficiente transformare problema do XOR em um problema lineármele scparável.
Capacidad o de Separado de uma Superficie
A Equaqáo (5.5) tem um significado importante para o número máximo de padrees aleatoriamente
distribuidos que súo linearmente sepa reveis cm um espado mui [¡dimensional. Para explorar esta
questáo, considere que xr x1T..., seja uma seqüéncia de padrees (vetores) «ricatorios como descri-
to previamente. Considere que V seja uma variávcl aleatoria definida COHio o maior intriro tal que
esta seqüéncia seja separável per onde rp tem m1 graus de liberdade. EnUo, da Eq, (5.5) deduzi-
mos que a probabilidade que N = n é dada por
ProbfA1’ “ n) = P(/r,m() - P(n + 1,m,)
(IW n-1>
(56)
n = 0,1,2,
ffli-lj
Para umti interpretado deste resultado, recordamos a definido de uma disfríbuiqdo binomio/nega-
tiva, Esta distribuidlo ¿ ’S'34’ » probabilidade que £ falhas precedam o r-ésimo sucesso em uma
langa seqücncia repetida de ¡emotivas de Benioui/i. Ncstc experimento probabilístico, há apenas
dais resultados possiveis para cada tentativa, sucesso ou falha, c suas probabilidades permanecen!
as mesmas cm todo o experimento. Considere que y? c q representen as probabilidades de sucesso c
falha, respectivamente, com p + q 1. A distribuido binomial negativa é definida por (Feller, 1968)
f(ktrtp) = pfq*
r + k -1
k
Para o caso especial dep - q - Iti (Le„ sucesso e falha sito eqüiprováveis) e i + r= fj, a distribuido
binomial negativa se reduz a
Com esta definí^,. vemos agora que o resultado descrito na Eq. (5.6) é apenas a distribuido
binomial negativa, dcslncada de m unidades para a dimita, c com parámetros ?tf. c 1/2. Assim, N
corresponde ao “tempo de espera" até a nt, ¿sima falha cm uma sDqüéntia de lan^amcntos de uma
moeda honesta. O valor esperado da variAvel aleatoria N e sua mediana silo, respectivamente:
jEJAQ = 2/71,
McdianafA1] = 2m.
(5.7)
(5.8)
Portanto, temos um corolario para o teorema de Cover na forma de um resultado assintótico célebre
que pode ser formulado como (Cover, 1965);
O número máximo esperado de padrees (vetores) atribuidos aleatoriamente que sSo linearmente se-
paráveis em um espado de dimensáo jm, é igual a 2mr
Este resultado sugere que 2ml é uma definí natural para a capacidode de separando de uma
familia de superficies de decisao tendo m, gnus de liberdade. De uma certa forma, a capacidade de
separa^to de uma superficie está intimamente relacionada com a nopáo de dimensio V-C, que é
discutida no Capitulo 2.
5.3 O PROBLEMA DE INTERPOLAQÁO
O ponto importante que emerge do teorema de Cover sobre a separabilidade de padrees é que,
resolvendo um problema de classifica^áo de padrees nao-Linearmente separável, há normalmente
um beneficio prática ganho pelo mapeamento do espado de entrada em um novo espada de dimen-
sáo suficientemente alia. Básicamente, um mapeamento náo-líncar c usado para transformar um
problema de classificacao nio-1 inearmente separável em um problema jnearmente separávd. De
urna mar eirá similar, podemos usar um mapeamento nao-linear para transformar um problema de
filtragem niío-linear difícil em um problema mais fácil que envolve filtragem linear.
Considere cntáo urna rede alimentada adianlc com uma camada de entrada, uma única camada
oculta c urna camada de salda consistindo de uma única unidade. A escolha de uma única unidade
de saída foi proposita! para simplificar a exposi^áo sem penda de generalidade. A rede c projetada
para realizar um mapeamento nao'linear do espaqo de entrada para O espado OCullO, seguido de um
mapeamento linear do espado oculto para o espado de saida. Considere que m,, represente a dimen-
sac do espado de entrada. Entilo, de uma mane ira global, a rede representa um mapa do espado de
entrada de djmensinnalidade w em um capado de salda unidimensional, escrito como
j:R’’ii->[Ri (5,9)
Podemos considerar o mapas como umahipersuperfíaie (gráfico) Tc IftY1, assimcomo considc'
ramos o mapa elementar .v: R1 —> IR:. onde 4*) Jt5» corno uma parábola no espado R:. A superficie
r c um gráfico muí [¡dimensional da salda como fundan da entrada. F.rr. uma situado prática. a
superficie T édesconhccida c os dados de treinamento estao normalmente contaminados com ruido.
A fase de treinamento e a fase de generalizado do procesan de aprendizagem podem scr respectiva-
mente vistas como segue (Broomhcad c Lowc, 19&8):
» A fase de treinamento constituí a otimizarán de um proccdimcnto de ajuste para a superfi-
cie T, bascada nos puntos dos dadus conducidos aprcscntados á rede na forma de exemplos
(padrees) de entrada-salida.
• A fase de generalizaqáo e sinónimo de interpolado entre os pontos de dados, com a
i।iterpolatáo sendo formada ao longo da superficie resf ita gerada pelo proccdimcnto de
ajuste, como a aproximapáo óttma á superficie verdadera T.
Assim, somos levados á teoría da ¡nterpolapao muhivariada cn)Um espado de alta dimensional idade,
que tem urna Innga histeria (Davis, 1963). O problema de interpolado, no seu sentido estrito, pode
scr lormulado como:
Ducííj rrnz A'púñUtí diferente* {i. e R "111 = A -.jV} .- um conjunto OTiTC&pcHidcnle de
.Vtiúmerivi rtais JJ.e R11 i = JV), cncnntrcuma funcáo» Rv-> R1 que satisfaga a cóndilo
de iilterpída^an:
i-1,2....N (S.W)
Para a interpolado estrila como aquí especificada, a superficie de interpolado (i.e., a fun^áoF) c
«brigada a passar por iodos os pontos dos dados do Ircinamcnto.
Hidden page
Hidden page
Hidden page
Se qualqucr uma destas candiles náo for sati.ifci.ta, dizentos que o problema é maiformtifado.
Básicamente um problema malfcrmulado significa que grandes conjuntos de dadas podem contar
urna quanhdade surpreendentemente pequeña de informa^áo acerca da soluyo desejada.
No contexto da nossa situará o atuaLo fenómeno físico responsável pela gerayode dados de
treinamento (p.ex., voz, imagens, sinais de radar, sinais de sonar, dados sísmicos) é um problema
direto bem-fónnulado. Entretanto, aprender a partir destas formas físicas de dados, visto como um
problema de reconstruyo de hipcrsupcrficic, c um problema inverso mal formulado pelas seguintes
razdes. Primeiro, o criterio de existencia pode ser violado na medida que para toda a entrada pode
nao existir uma saida distinta. Segundo, pode nao haver tanta informado na amostra da tre i ñámen-
lo quanto realmente necessilamos para reconstruir únicamente o mapeamenlo de cntrada-saída,
sendo, dessa forma, provável que o criterio deunicidade seja violado. Terecina, a inevitávcl presen-
ta de ruido ou impreu sao nos dados do treinamento reais adiciona incerteza ao inaptamente de
entrada-saida reconstruido. Em particular, se o nivel de ruido na entrada for muito grande, é pqssí-
vcl que a rede neural produza uma saída fora do intervalo para uma entrada específica x do
dominio if; cm outras palavras, há uma probabilidade de que o criterio de continu idade seja viola-
do. Se um problema de aprendizagem náo possui a prepriedade da continuidade, emito o rnapeamento
de enlrada-saida computado nao tem nada a ver com a verdadeira soluyo para o problema de
aprendizagem. Nao há como superar esta dificuldadc a menos que alguma informayo previa sobre
o mapeamcnio de entrada-saida esteia disponiveL Neste contexto, c bastante apropriadn que nos
lembremos de uma afinnayo de Lanczos sobre operadores diferenciáis lineares (Lanczos, 1964):
"Urna falta de infnrmaya nao pode ser remediada pornenhum truque matemático."
A importante questáo de como transformar um problema mal formulado cm um problema
bem-formulado vía regularizayo é discutida na próxima Seqito?
5.5 A TEORIA DA REGULARIZADO
Em 1963, Tikhonov propos um novo método chamado regtdartza$ík> para resolver problemas
mal formulados.'1 No contexto de um problema de reconstruyo do hipcrsuperficie, a idéia básica de
regularizarán $ estabilizar a soluyo por meto de algum funcional náo-negativo auxiliar que incor-
poro informa^áo previ a sobre a su luyo. A forma mais comum de informayo previa envolvc a
suposiyo de que a fun^ao do mapeamento de cntrada-saida (i.c., a solucáo do problema de recons-
truyo) sejaáiíuvt', no sentido de que entradas similares correspondan] a saldas similares.
Para sexmos específicos, considere que o conjunto de dados de entrada-saída (i.e„ amostra de
treinamento) dispon i vel para a aproximayo seja descrito por
Sinal de entrada: x, s D?”', j = I, 2.jV
(5.20)
Resposta desejada: rf, g R\ j = 1,2,....N
Note que se assumc que a saida seja unidimensional. Esta supes i yo náo limita de forma alguma a
aplicabdidade geral da teoría da regularizayo aquí desenvolvida. Considere que a fuñí3o aproxi-
maliva seja representada porEYx), onde {por conveniencia de represenlayo) omitimos o vetor de
peso w da rede do argumento da fun^ao F. Básicamente, a teoría de regularizayo de Tikhonov
unvolvc dois termos;
1. Termo do Erro fiodm. Este pnmeiro termo, representado por^FX mede o erro (distancia)
padrao entre a respusta desejada (alvo) d¡ c a rcspnsta real v, para o exemplo de treinamcnio i =
I, 2,..., A'. Específicamente, definimos
d-l
(5.21)
onde mtroduzimcs o fatcr de escala! para mantera consistencia com o material aprcscntado
nos capítulos anteriores.
2. Termo de Regularizando. Este segundo termo representado per ^/F), depende das proprieda-
dcs ^geométricas" da lun^ao aprpximativa F(i). Específicamente, podemos escrever
(5-22)
onde D é um operador diferencial linear. A i n formado previa sobre a forma da soluto [i.e., a
fun^ao de entrada-saida F(i)] é incorporada no operador D, o que toma naturalmente a selecSo
de D dependente da problema. Tambem nos referimos a D como um estabilizador porque ele
estabiliza a soluto para o problema de regularizáoste, fazecido-a suave e desta fomn satisfa-
zendo a propriedade de COntinuidade. Entretanto, suavidade implica continuidade, mas o inver-
so náo é necessariamente verdadeiro.
A abordagem analítica usada para tratar a situado descrita na Eq. (5 >22} se apóia no conccito de um
espado de fundan,1 que se refere a um espado normalizado*' de funches. Neste espado de várias
(cstnlamente talando, infinitas) dimcnsocs, uma fun^áo continua ó representada por um vetar. Usando
esta imagem geométrica, estabelece-se uma ligado entre matrízes e operadores diferenciáis linea-
res. A anal ¡se de sistemas lineares se tema com i sao traduzível para a anábse de equa^óes diferenci-
áis lineares (Lanczos, 1964).
Assim, o símbolo I II na Eq. (5.22) representa uma norma imposta ao espado de fun^áo ao qual
DRx) pertence. Normalmente, o espado de fundan usado aquí éo espado L . que consiste de todas as
funpdes de valor realpara ”ri quais ||Xx)lIIa é íntegrável por Lebesguc. A fun(ác /(i)
usada aquí representa a funqáo real que define o processo físico responsável pela gerapáo do con-
junto de pares de dados de entrada-salda j| ; veja a nota 7 para maiones deíalhes.
A quantidade a ser minimizada na teoría de regulariza^ao c
«(F) = st(F) +Aíjf)
(5.23)
¿ j.i 2
onde A. é um número real positivo chamado de parame tro de rcguiarizaeao e ¥ (F) é denominado o
funcional de 7Uta)Fwvr Um funcional mapvia fundes (definidas em um espado de funedes adequa-
do) para a linha dos reais. O mmimizador do funcional de Tikhonov %(F) (i.e., a soluto para o
problema de regularizante) é representado por FL(x).
Ncstc sentido, podemos considerar o parámetro de regularizado A, como um indicador da
suficiencia do conjunte de dado& fomecido como ejemplos que especifican) a sol uceo F^x). Em
particular, o caso límite 1 -> 0 implica que o problema é irrestrito> com a solutfo FJx) sendo
totalmente determinada petes exemplos. O outro caso I imite, X —*», por outro lado, implica que a
restribo pré\ ia de suavidade imposta pelo operador diferencial D c por si só suficiente para espect-
Óopvrlqhted mater
ficar a soluto F^x). que é unía outra forma de dizer que os exemplos nao sao confi ¿veris. Em
api¡calóes práticas, atribuirse ao parámetro de regularizado X um valor entre estas duas cotidifdcs
limites, de forma que tanto os dados da amostra como a informado prévia contribuem para a solii-
do F.(x). Assim, o termo de regularizado t (F) representa uma JttngSo twdefo deputii^uu Je
complexidades cuja influencia sobre a soluto final é controlada pelo parámetro de regularizado X.
Uma outra forma de se interpretar a regularizado é considerando que ela fomece uma soludo
prática para o dilema Hias-variancia que é discutido no Capítulo 2. Específicamente, a escolta
ótima do parámetro de regularizado X é prejetada para conduztr a saludo do problema de aprend>
zagem para um balando salísfatório entro bias modelo r variancia modelo, pela izicorpora^aci da
quantidade certa de informado previa.
Diferencial de Fréchet do Funcional deTikhonov
O principie da Kgi¡lai-¡Ztí$áa pode ser agora formulada como:
FfrííW.nt' a/rTiXíSíJ F. (X) que minimiza afitncíunaf t!e TtkhoUüv definida pt>r
S(F) «{F> + 1$ ,(F)
í í é ü IWMfl íit? QJVD püdrüü. ?! (F) ¿ t> ter/rw de naitlariíO^da ü X é a parámalm de regnfa-
fízqgííq .
Para prosseguirmos com a minimizado do funcional de custo '&{/’), precisamos de uma negra para
avahara diferencial de$(F). Podemos considerar esta questáo usando o diferencial de Fi-échet. No
cálculo elementar, a tangente de uma curva é uma linha reta que fomece a melhor aproximado da
curva na vizinhanija do ponto de tangencia. Similarmcnlc, o diferene ¡al de Frcchcl de um funcional
pode ser interpretado como a melhor aproximado linear local. Assim, o diferencial de Fréchet do
funcional '€(/') é formalmente definido pür(Domy, 1975; Dcbnath e Míkusi liski, 1990; de Fígueiredo
cChen, 1993):
J^(F,/f) =
X-U
(5.24)
ande á(x) é uma futido flxa da vetar x. Na Eq. (5.24), sáo usadas as negras ordinarias da difcrenci-
aqáo. Uma condigno necesMria para a fundan F(x) ser um extremo relativo do funcional ^(F) é que
o diferencial de Fréchet ¡fi£(F,^) deve ser zcro cm FTx) para todo h e como mostrado por
h) - d :£(F, h) + AJ^_(F, Á) = 0
(5.25)
onde d%t(F\ h) c J? (Ft A) sao os diferencíala de Fréchet dos funcionáis íF) c respectiva-
mente.
Calculando o diferencial de Fréehct do termo de erro padreo SSjfF, A) da Eq. (5.2l), temos
= —S,{F + 0A)
-t-o
¿ «P !-|
(5.26)
=-£k-íxx()-wx,)]*(x,)U.
I n |
= -Ék-f(x,)]A(x.)
r=[
Neste ponto da discussao, consideramos instruí ¡vo invocar o teorema da repnsfintíqxfo de Riesz,
que pode serexpresso como segue (Debnath e Niikusióski, 1990; Kirsh, 1996):
Considere que / seja um funcional linear limitado etn um espado de 1 [liben (Le., um espado do
produto interno que é completo)" representado por X. Existe um An e tal que
/= (/r, para lodo/r e W
Além disso, temos que
I.ZIk = IAX
onde e o dual ou conjugado do espado de Hilbcrt ¿C.
O símbolo (vjr usado aquí representa o produto interno (escalar) de duas funpñes no espado 3t.
Assim, com base no teorema da iepncEcnta(fo de Ricsz, podemos rescre^ cr o diferencial de Fréchct
tíf® JF» A) da Eq. (5-26) na forma equivalente
h 1 = 1
(5.27)
onde fiurepresenta a disiríbuieao delta de Dirae de x, centrada ere x.; isto é.
B.JiJ-Síi-i,)
(5.28)
Considere a seguir o cálculo do diferencial de Frichet do termo de regularizado '£ (F) da Eq.
(5.22). Procedendo de uma forma similar aquel a recém-descrita, temos
= í Op^D**^
Jtr*
= | DFDAdx
Jfi*
(5.29)
onde (HA, 1>F)^ é o produto interno das duas fun^ócs DA(x) c DF(x) que resultara da a^ao do
operador diferencial D sobre A(x) e F(x)h respectivamente.
Eqna^áo de Euler-Lflg ranga
Dado um operador diferencial linear i>. podemos encontrar uin openubr adjunto únicamente deter-
minado, representado por f>, tal que para qualquer par de fuñones w(x) e i(x) que sao su fiel ente-
mente diferencia veis e que satisfazcm condt^ocs de contorna adequadas, podemos escreverf Lanczos,
1964)
n(.r )t>u (x }d x = u( x )Dw( x} di
Jr’ Jr"
(5.30)
A Equapáu (5.30) é denominada idenfidadede Green; ela fomcee uma base matemática para definir
o operador adjunto D cm termos do diferencial D dado. Vendo D como uma matriz, o operador
adjunto l> desempenha um papel simi lar ao de uma matriz transporta.
Comparando o Lado esquerdo da Eq. (5.30) com a quana linha da Eq. (5.29), podemos fazeras
seguíates identificares:
w(x> = DF(M
Dv(x) = DA(x)
Usando □ Jentidade deGreen. podemos rescrever a Eq. (5-29) na forma equivalente
A) - A(x)DD/Ȓ/x
Jr-'
= (ah puf]
x nt
(5.31)
onde D c o adjunto de l>
Retomando ¿ condip&o extrema descrita na Eq. (5.25) e subslituindD as diferenciáis de Fréchet
das Eqs. (5.27) e (5.31) naquela equapao, podemos agora expressar o diferencial de Fréchet J5£(F,
/i) como
( K i *
z«(F,*)= * DDF--X(4--PX (5 32)
k L AJ-I J7x
Como normalmente atribui-se ao parámetro de regularizacáo X, um valor dentro do intervalo aberto
{0„«), o diferencial de Fréchet </?(/’, fij é zero para todo h{x) no espado se e somente se a seguíate
condi^ao for satisfeita no sentido distributivo:
l-l
ou equivalentemente,
ñDF^i) -J ¿p - F|i,)]5(x - xj (5.33)
A l-l
A cqua^áo (5.33) é a equa^ao de Eufer-Lagrunge para o funcional de Tikhcnov %(F); da define
uma cóndilo necessária para o funcional de Tikhoncv %(f) ter um extremo em A (x) (Dcbnath c
MikusiiEki, 1990).
Fun^áo de Green
A Equa^ao (5.33) representa uma equa^So diferencial parcial para a funfdo aproximativa F. Sabc-sc
que a soIuqSo desea equa^o consiste da transformado integral do lado directa da equa^So.
Considere que <7(i, represente uma fiinf ao na qual ambos os velones x e £ aparecem em pé
de igualdadct mas para propósitos diferentes: x como um parámetro e como um argumento. Para
um dado operador diferencial linear L, estipulamos que a fundan <7(i, £) satisfaga as seguintes
condi^oes (Courant e Hilbert, 1970):
1. Para um fixo, G(x, c uma fun^ao de x c satisfaz as condi^ocs de contorno prescritas.
2. Exccto no ponto x = as derivadas de G(i+ em relajo a x sao todas continuas; o número de
derivadas é determinado pela ordem do operador L.
3. Com G(x. considerada como uma funffo de x, cía satisfaz a equa^So diferencial parcial
LG(i, ’ 0 (5.34)
em todos os lugares exceto no ponto x - onde ela tem uma singularidade. Isto é, a fun^^o G(x, ^)
satisfaz a seguirte equa^ao diferencial parcial (no sentido das distrihui^des):
LG(x,É) = 3(x-S)
(5.35)
onde, como definido anteriormente, 6(x - é a fun^áo delta de Dírac posícionada no ponto x =
Copyrighted material
Hidden page
Enlito, podemos usar a Eq. (5.36) para escrever
^W = [ G(i^|l¿[rf1-F(x,)]8U-i1)l^
J R- LA 1-1
A M J»*'
onde na última linha trocamos a ordem da integrado e do somatório. Finalmenle, usando a propri-
edade de filtragem da fiin^ao delta de Dirac, obtonw a solu^ao desejada da equaqlo de Euler-
Lagrange (5.33) como segue:
(5.41)
4-1
A Equa$&> (5.41) afirma que a soluto A(x) de minimizado para o problema de regularizado é
uma auperposifao linear de Nfundes de Grccn. Os x representara os ceñiros da expansáa, e os
pesos [J - F(x.)]/X representara os coeficientes da expansáo. Em cultas palavras, a solicito para o
problema de regularizado se encentra em um subespa^o y-dlmensional do espado de funches sua-
ves, e O conjunto de fun^oes de Green {Gfx, x)} centradas em x . i = 1,2,..., constituí uma base
para este subespafo (Poggio e Girosi. 1990a). Note que os coeficientes de expansáo na Eq. (5.41)
sSo, primero, ¿meares em relapso ao erro de csLtma^áo, definido como a diferen^a entre a resposta
desejada d. c a saída correspondente F(i) calculada pela rcdc+ c segundo, inversamente proporcio-
náis ao parámetro de regularizado X.
Determina^ño dos Coeficientes da Expansáo
A próxima questáo a ser resolvida é a determinadlo dos coeficientes dcsccmhccidos na expansao da
Eq. (5.4 L). Considere
tt; = -Ffx.)]. j = 1. A. Com isso, podemos dispar a soluto de mn n i mi zapito da 1 y l-l Calculando a Eq. (5,43) em j,/= 1,2».-, obremos /UG=2>g(i,'1.)' r"L Lntroduzunos agora as segu Entes defíni^ctos: ( X Af (5,42) q. (5.41) simplesmente como: ) (J«) i = l. 2,., .V (5.44) Gopyrlghted maten
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
functas de
base radial
HGURA 5 J Rada de furxjflu c c base radial
3» A solufáo calculada pela rede de regularizado ó ófima. Ótimo aquí significa que a rede de
regularizado minimiza um funcional que mede o quanto a soludo se desvia de seu valor real
como representado pelos dados de treinamenlo-
5.7 REDES DE FUNQÁQ DE BASE RADIAL GENERALIZADAS
A correspondéncia de um-para-um entre os dados de entrada de treinamento x e a funqfo de Green
G(xn x ) para 1=1, 2*»-» ATpraduz urna rede de rcguEanza^ao que pode scr algunas vezes considera-
da proibitivanicnlccustDsapflra ser implcmcntada cm tennos computacionais, para N grande. Espe-
cíficamente, o cálculo dos pesos lineares da rede [i.e., os coeficientes da expansfo na Eq. (5.55}]
requer a inversSo de uma matriz A^por-M que por sua vez cresce de modo polinomial com N (apro-
ximadamente com jV5). Além dissot a probabilidade de ntau candicionamentG é maiorpara matrizes
tnaiores; o número tondictortañle de urna matriz é definido como a razáo entre o maíor aulovalor e
o menor autovalor da matriz. Para superar estas di Acuidades computaciones, a compitaidade da
rede deve ser reduzida, o que requer uma aproximado para a solu^ac regularizada.
A abordagem seguida envolve a procura por uma soluto subólima em um espado de menor
dimcnsionalidadc que aproxime a salu^ác regularizada da Eq. (5.55). Isto é feito usando-se uma
técnica padreo conhecida era problemas variacionais como método de Gaterkin. De acordó com
esta técnicat a soluto aproximada F*(x) é expandida em uma base finita, como mostrado por
(Poggio eGirosi, 1990a)
F»(x) = ¿w,<p,(x) (5.67}
r-l
onde {(p/.xJk = l, 2,.~t m,I é um novo conjunto de fun^ocs débase que ¿asumirnos serrín lincannen-
te independentes sem penda de generalidad#. Típicamente, o número de funfftes de base ¿ menor
que o número de pontos de dados (i.e., S c os tí? constituem um novo conjunto de pesos.
Tendo cm mente as fuogSes de base radial, facemos
ip/X) = G(|1>t-tJ|)s i* 1,2........m,
(5,68)
onde o conjunto de centros !t('r 1,2..nrj deve ser determinado. Esta cscolha particular de
fungóos de base é a única que garante que no caso de m, " A', e
t - ir,, i l,. 2 JV
a solugan cometa da Eq. (5,58) é recuperada de forma consistente. Assim, usando a Eq. (5.68) em
(5.67X podemos rcddmir F*(x) como
l-l
l-l
(5.69)
Dada a expansan da F.q. (5.69) para a fungáo aproximativa F“(x)h o problema que enfrentamos
agora é a determinagáo do novo conjunto de pesos ( Jüjj = I, 2h...,m } que minimiza o novo funcio-
nad Je custo '£(?*) definido por
(5.70)
O primeiro termo no lado direito da Eq. (5.70) pode serexpresso como a norma euclidiana quadrada
í|d- Cw|onde
...
’GfXpt,} G(x,.t2) G(x„ t„)
G(s;.t,} í7(xS1t2) - <7{x21t^)
G =
_G(Vv>t.) G(xA,t,j G(xv,TWi)
(5.71)
(5-72)
(5-73)
O vetor KSposta desejada d c ..V-dimcnsional como anteriormente. Entretanto* a matriz G de fuñ-
idos de Groen c o vetor de peso w tem dimensoes diferentes* □ matriz G é agora e portan to
nán é mais simétrica, e o vetor w ém^por-l. Da Eqr(S.69) notamos que a fungió aproximativa F*
é uma combina^ao linear das fun^Ses de Green para o estabilizador D Conseqüentemente, pode-
mos expressar o segundo termo no lado dicoito da Eq. (5.70) como
||DF1|í=(DÍ',DF*)1,
X . t,), í> l> X v>,Gi i; t,)
r-i
j-i
, j-i Jit
W| W|
-£Ew/wMtr,1)
y-i i-i
= wrGow
(5.74)
onde na segunda e na tere eirá linhas fizamos uso da definido de um operador adjunto e da Eq.
(5.35), respectivamente. A matriz G ¿-urna matriz simétrica m,-por-m(, definida por
G(t|,t|) G(tptj) G(t,,tMi)
Gd^tJ G(L.t3) G(tIstra)
(575)
Assim, a minimiza^áp da Eq. (5.70) em rcla^áo ao vetor de peso w produz o resultado (veja o
Problema 5.5)
(GTG + XG,>' = GTd
(5.76)
Quando o parámetro de regularizaban X se aproxima de zcro, o vetor de peso w converge para a
sclu^áo da pseudo-iuveraa (norma mínima) do problema indeterminado de ajusle de dados por
quadrados mínimos para m( < AfT como mostrado por (Broomtread e Lowe, 1988)
w G d, X = 0
(577)
onde G+ é a pseudo-im/ersa da matriz G; isto é,
G*=(GrG)-|Gr
(5-78)
Norma Ponderada
A norma na solu^ao aproximada da Eq. (5.69) c normalmente subentendida como uma norma
euclidiana. Quando^ entretanto, os elementos individuáis do velor de entrada x pertencem a classes
diferentes é mais aproprlado considerar uma norma ponderada genérica, cuja forma quadrática é
definida pür(P0g£ni e Girosi, 1990a)
.^(Cx/fCs)
= irCrCl
(5.79}
onde C c uma matriz de ponderabau de norma % -por- e ffl, é a dimensao do velor de entrada i.
Usando a definido de norma ponderada, podemos rescrever a aproxima^ao para a solupao
regularizada na Eq. (5.69) cm uma forma mais generalizada (Lowc1 1989: Poggio c Girnsit 1990a)
F*(l)=£ttlG(|x-t,||¡.)
(5.80)
O uso de uma norma ponderada pode ser interpretado de duas formas. Podemos simplesmente vé-
le como a aplicando de uma transformando ajan sobre o espado de entrada original. A principio,
uma transforrnacáo como cssa nao pode degradaros resultados do caso originaL já que ela realmen-
te corresponde a uma matrá ídemidade de ponderafáo de norma. Por outro lado> a norma pondera-
da resulta adianle de uma pequeña general iza^áo do Laplaciano de dimensáo na defmifáo do
operador pscudc-difcnmcial D na Eq. (5.63); veja o Problema 5.6. O uso de uma norma ponderada
pode também ser justificado no contexto das fun^ocs de base radial gausstanas pelas seguimos
razóos. Uma fun^áo de base radial gaussiana G'(||x- tj|f) centrada em t. c com a matriz de pondera-
do de norma C pode ser expressa como
-t,lí.)=«r( (»-t,rcrc(*- •,)]
-exJ
(S.S1)
onde a nutrí? inversa Z é definida por
ÍS =CrC
(5.82)
A Equino (5.8I) representa uma distribuido gaussiana muhivariada com vetor média t. e matriz
de covariancia S. Como laL cía representa uma general i za^áo da distribuido descrita na Eq. (5.59).
A soludo para o problema de aproximado dado na Eq. (5.70) fomecea fundamentaQáopara
a rede de fuñado de base radial {RBÍf generalizada lendo a estrulura mostrada na Fig. 5.5. Ncsta
rede, prevé-se o uso de um bias (i.e., uma varifitvel ^dependente dos dados) aplicado a unidade de
saida. Isto é feito simplesmente igualando-se um dos pesos lineares da camada de saida da rede ao
bias c tratando a fun^áo de base radial associada como uma constante igual a +1.
Em termos es. tinturáis, a rede RBF generalizada da Fig. 5.5 é similar á rede RBF de regulari-
zado da Fig. 5.4. Entretanto, elas diferem entra si cm dois aspectos importantes:
L O número de nós na camada oculta da rede RBF generalizada da Fig. 5.5 c onde ai, é
normalmente menor que o número Ade exemplos dispon i veis para treinamento. Por cutio lado,
o número de nós ocultos na rede RBF de regularizaQáo da Fig. 5.4 cegatamente .V.
2. Na rede RBF generalizada da Fig. 5.5, os pesos lineares associados com a camada de saída e as
posic&es dos centros das funodes de base radial e a matriz de pondera^ de norma sssooiada
com a camada oculta sáo lodos parametras desccnhecidos que devem ser aprendidos- Entretan-
to, as fiinfdes de alivag&C da camada oculta na rede RBF de rcgularizacao da Fig. 5.4 sao
conhecidas, sendo definidas por um conjunto de fun^óes de Green centradas nos pontos de
dados de treinamento; os pesos lineares da camada de salda s¿o os únicos parámetros dcsconhc-
cidos da rede.
Campo Receptivo
A matriz de covariancia Z determina o campo receptiva da fuñólo de base radial gaussiana G(||i -
t |]r) dada na Eq (5.81). Para um centro predeterminado tl+ o campo receptivo de <?(||x - tj|c) é
definido formalmente como o suporte da fun^So
(5.83}
onde ú é uma constante positiva (Xu et aL 1994). Em outras palavras, o campo receptivo de Gf|x -
tj[f) é aquele subconjunto particular do dominio do vetor de entrada x para o qual G(]x - tj|f.)
assume valores suficientemente grandes, maiores que o nivel prescrito a.
Em uma forma correspondente ao modo como a matriz de ponderado de nertna C foi defini-
da, podemos identificar tres cenirios diferentes relativos a matriz de covariancia E e sua influencia
na forma, tamanho e orientaba do campo receptivo:
1. E = o1!, onde lea matriz identidade e é uma variáncia comum, Neste caso, o campo recep-
tivo de G(||i — 11 (1 consiste de urna hipcrcsfcra centrada cm t c com ra i o determinado por O.
2* E = diag(G| ,<j;..), ondea* é a variáncia doy-¿sime elemento do vetor de entrada i cj = 1,
2,..., jnn. Ncstc segundo caso, o campo receptivo de G(|| x - 11 .} consiste de uma h i per-elipse
cujos eíxos individuáis coinciden) com aqueles do espado de entrada e com a sua exíensáo ao
longo do eixo J sendo determinada por a.,
3+ E é uma matriz nao-diagonal - Por definirán, E é uma matriz definida positivamente. Portanto,
podemos usar a transforniafáo de similaridade da álgebra matricial para decompor E como
segue:
E=QrAQ
(5.84)
onde Ac uma matriz diagonal e Q é uma matriz de rota^áo ortonormaL A matriz A determina a
forma e o tamanho do campo receptivo, enguanto que a matriz Q determina a sua orientadlo.
5.8 O PROBLEMA DO XOR (REVISITADO)
Considere novamente o problema do XOR (OU Exclusivo), que resolvemos no Capitulo 4 usando
um perceptron de múltiplas camadas com uma única camada oculta. Aquí apresentaremos uma
soluto para o mesmo problema usando uma rede RBF.
A rede RBF a ser investigada consiste de um par de fiin^oes gaussianax, definidas como:
Hidden page
ende x c um vcior de entrada c d c o valor enrrespondente da salda desciada. Seja
^-6(111,-1,11). j-1.2,3,4, ¡=1,2
(5.88)
Entla, usando ús valores da Tabela 5.2 na Eq. (5.88), obtemes o seguí inte conjunto de equafoes
escritas na forma matricial:
d
(589)
onde
1 1 0,3678 0.1353 T 0,3678 l (5.90)
G =
0,1353 1 1
[o, 3678 0,3678 1_
d= [0 1 0 l]f <5.91}
w = [tí1 Té.i 'r (5.92)
O problema descrito aquí é supenieterminado no sentido de que temos mais pontos de dados que
parámetros livres. Isto explica por que a matriz G nao é quadrada. Conseqüencemenle, nao existe
uma inversa única para a malriz G. Para superarmos esta difieuldadc, usamos a soluqao de norma
mínima da Eq. (5.78), c assim escrevemofi
w = G+d
= (GrG) Vrf
(5.93)
Note que GTG é uma matriz quadrada com uma inversa única. Subslituindo a Eq. (5.90) cm (5.93),
obtemos
F 1,8292
G' = 0,6727
-0,9202
-1,2509 0,6727 -1,2509
-1,2509 1,8292 -1,2509
1,4202 —0,9202 1,4202
(5.94)
Finalmente, substituindo as Eqs. (5.91) e (5.94) em (5.93), ohtemos
-2n5O¡K
-2,5OÍ8
+2,8404
que completa a espceifica^ao da rede RBF.
Hidden page
(5.W)
O X óttmo é o valor particular de X que minimiza /¡(X).
Considere que FJi*) seja expressc come uma combinado linear do conjunto de observáveis
cspccificado+ como segué:
J=l
(5.100)
Na forma matricial, podemos escrever de forma equivalente
F, = A(l)y
(5.101)
onde
(5.102)
A matriz A-pop/V A(X) é chamada de matriz de influencia.
Usando esta notado matricial, podemos rescrever a Eq. (5.99) na forma
7 aun)
jt
onde o vetor f Mpor-1 é
f-ÜW’J.A3K
Podemos avanzar um passo na nossa formulando matricial rescrcvendo a Eq. (5.95) na forma
y = f + e
(5.104)
onde
Hidden page
O erra medio quadrado sobre um conjunto específico de dados, ^(X), entretanto, n3o é uma
medida prática porque requer o conbecimento da fun?ao de regressao fií), que é a fuñí So a ser
reconstruida. Como uma estimado de £[F(X}], tntroduzi mos a seguirte defínifdo (Graven e Wahba,
1979)
¿(X.) = l||(l - A(X)Jy|‘ + £tr[ A2 (X)) - lr[(l - A(X))2]
(5.1101
Esta estimaban nio tem bias, na medida em que podemos mostrar (seguirdo um procedimento
similar ao descrito na derivado da Eq. (5.109)) que
£1R (X)] = E[£(1)j
(5.111)
Conscqücnncmcntc^ o valor que minimiza a estimadlo F (X) pode ser tomado como uma boa esco-
lta para o parámetro de regularizado X.
Validado Cruzada Generalizada
Uma desvantagem da estuuaifáo R(X) é queela requer o conheci mentó da variáncia do ruido tr2. Em
situa^oes encontradas na pratica, <r3 e normalmente desconhecída. Para tratamos de situares desta
natureza, podemos usar o core cito da valida^ao cruzada generalizada que foi proposta por Graven e
Wahba(1979).
Cometamos adaptando a forma usual de "deixar um de fbra” da validado cruzada {descrita
no Capítulo 4) ao problema em questáo. Específicamente, seja FX1*^) a fundad que minimiza o
funcional
w>=?¿í>i - wi:+
(5.112)
onde o A-ésimo termo [y. - F:(jíx)J foi dei íado de fbra do termo de erro padráo. Dcixando este termo
de fbra, podemos utilizar a habilidade de de '"prever" o ponto de dado ausente como uma
medida da qualidadc de X. Conscqücntcmcnlc, podemos introduzir a seguinte medida de qual idade
(5.113)
que depende apenas dos dados. A estíma^áo de valida^aij cruzada ordinaria de X é, ponanio, defi-
nida como o valor que minimiza K0(X) (Wahba, 1990).
Uma propriedade útil de F. ^(jQ é que, se o ponto de dado y. for substituido pela previsto
F/*^} c o funcional de Tikhonov original da Eq. (5.98) for minimizado utilizando os pontos
de dados/pjj....*/*» oblemos Fa|í|(k1) como soluto. Esta propriedade, juntamente
com o futo de que para cada vetor de entrada x o FJx) que minimiza depende 1 i Reármenle de
permite-nos escrever:
Hidden page
que, para sua computa^áo, depende apenas de quantidades relacionadas caen os dadas.
Uma Propriedade Ótima da Fun$áo de Validagáo Cruzada Generalizada V(X)
Considere que X minimizc o valor esperado da luinjáo de validafáo cruzada l'(X)- A incficiéncia da
va for esperado do método de validado cruzada generalizada é definida por
,,=
min £[/?(X)j
(5.122)
onde 7?(X) ¿o erro mediu quadrado sobré o conjunto de dados dado na Eq.(5.99). Naturalmente, o
valor assintótico de 7* satisfaz a condiíáo
Emoutras palavras, para Ar grande. a erro medio quadrado K(X) com X estimado pela minimizado
da fundan P(X) deve ser próximo do menor valor possfvel de A(X), 0 que toma H /-) um bom método
para estimar X.
Resumindo os Comenta ríos
A idéia geral é escolher o parámetro de regularizado X de forma a minimizar o erro médio quadra-
do sobre o conjunto de dados, J?(X). Infelizmente; isto nao pode ser realizada adiarte, pois Jí(l)
envolve a fun^áo de regresado deseonhecida^x). Com isso, hA duas posibilidades que podem ser
seguidas na prática:
• Se a variáncia do ruido G2 for conhedda, podemos usar o valor que minimiza a estimado
R (X) da Eq. (5.110) como a cscolha ótima de X, ótima nn sentido de que ela também
minimiza 7?(X).
• Se n^ for wnhec ida, podemos u $ar o valor que min i mi za a fuñeAo de val idas ao cruzada
generalizada P(X) da Eq. (5.121) como urna boa escolha de X»que produz um erro médio
quadrado esperado que se aproxima do menor erro médio quadrado possívcl quando Ar —*
O ponto importante a notar aquí é que a leerle que Justifica o uso da validado cruzada generalizada
para estimar X c uma teoría assinlótica. Por isso. só podem ser esperados bons resultados quando o
conjunto de dados disponível for suficientemente grande para que o sinal possa ser distinguido do
ruido.
A experiencia pratica com a validado cruzada generalizada parece mostrar que ela o robusta
em relajo A ndo-homogeneidade de variáncias c a ruido náo-gaussiano (Wahba, 1990). Entretanto,
é bastante provável que o método produza estimativas insatisfalórias do parámetro de regularizadlo
X se o processo de ruido for altamente corre! ac i miado.
Fmalmcnlc, faremos alguns comentarios a respeito do cálculo da lun^fio de validado cruzada
generalizada í,r(X}, Para determinados valores experimentan do parámetro de regular izarán X, en-
contrai o termo do denominador [tr(I-A(X)]/Ar']1 na fórmula da Eq. (5.121) é a parte mais cuitosa do
opyrÍQhtcd mHterisI
Hidden page
Hidden page
Hidden page
5.11 COMPARADO ENTRE REDES RBF E PERCEPTRONS
DE MÚLTIPLAS CAMADAS
As redes de fundo de base radia! (RBF) e os perceptrons de múltiplas camadas {MLP) site cxcm-
plos de redes em camadas alimentadas adi ante, naol meares. Ambos sáo aproxi madores uni versáis.
Portante, náo causa surpresa a constatado de que sempre existe uma rede RBF capaz de imitar
precisamente um MLP específico, ou vico versa. Entretanto, estas duas redes diferem entre si em
vários aspectos importantes,
1. Uma rede RBF (na sua forma mais básica) tem uma única camada oculta, enguanto que um
MLP pode ter uma ou mais camadas ocultas.
2, Típicamente, os nós computacionais de um MLR localizados em uma camada oculta cu em
urna camada de saida, compartilham um modelo ncuronal comum. Por curro lado, os nós
computan ionais na camada oculta de uma rede RBF site bastante diferentes c servem a um
propósito diferente daqueles da camada de salda da rede.
3. A camada oculta de uma rede RBF é náo-linear, enguanto que a camada de sarda c linear.
Entretanto, as camadas ocultas e de salda de um MLP usado como classificador de padrftes site
normalmente todas na o- lineares. Quando o MLP c usado para resolver problemas de regrésate
nfio-linear, uma camada linear para a saida é normalmente a escolha preferida.
4. O argumento da fundo de atívaqáo de cada untdade oculta em tima rede RBF calcula a norma
{distancia) cuciidiana entre o vetor de entrada c o centro daquela unidade. Enquantc isso, a
fundo de ativado de cada untdade oculta em um MLP calcula o produto interno do vetor de
entrada pelo vetor de peso sináptico daquela unidade.
5+ Os MLP? constroem aprex ima^óes gfobafo de um mapeamento de entrada-saida náo- li near. Por
□litro lado, as redes RBF utilizando rnte-linearidadcs localizadas com docairncnto exponencial
(p.ex., fundes gaussianas) constroem aproximares foozfe para mapeamentos de entrada-saida
nlc-lineares-
Por sua vez, isto significa que para a aproximado de um mapeamento de enirada-saida nao-linear,
o MLP requer um número menor de parámetros que a rede RBF para o mesmo grau de precls3o.
As características lineares da camada de saida da rede RBF indicam que esta rede está mais
próximamente relacionada com o perceptron de Rosenblatt do que com o perceptron de múltiplas
camadas. Entretanto, a rede RBF difere do perceptron pela capacidade de implementar transforma-
res náo-lineares arbínárías do espado de entrada. Isto é bem ilustrado pelo problema do XOR, que
nSo pode ser resolvido por nenhum perceptron linear, mas que pode ser resolvido por uma rede RBF.
5J2 REGRESSÁO DE NÚCLEO E SUA RELAtJÁO
COM AS REDES RBF
A teoría das redes RBF apresenlada até agora está haseada na nc^áo de Interpolado. Nesta se^áo,
consideramos um outro ponto de vista, o da regressao de núcleo fundamentada na nodo de estima-
do de densidadr.
Para sermos especlíleos, considere nevamente o modelo de rcgres&ite náo-lincar da Eq. (5.95)
reproduzido aquí por conveniencia de apresenta^áo:
^-Xl.)+t., í-1,2...N
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
tí Uma scqücncia de vetores {ij ó chamada uma fñ/aenejú de Caudty se para todo e >
0 cuitir um número M tal que (Dcbnaih e Mikusinski, 1990)
|Xn -1 ! < e para lodo (m. n) > M
9. Em Giioti el al. (1995), um método diferente para derivar a Eq- (5-55) c apresentado
rclacionando-sc o termo de regulan zapito ^(F) achante á suavidade da aproHimali-
vaF^iJu
A suavidade é vista como medida da natureza oscilatória de uma ñin^áo. Em particu-
lar diz-seque uma fuñólo c mais suave que uma outra funqáo se ela for metra oscilatoria.
Em outras palavras, quanlo mais suave for uma furnjio, menor será o seu contcúdo de alta
freqüéncia. Tonda em mente esta medida de suavidade, suponha que seja a transfor-
mada de Fourier multidimensional de F(x), com s representando uma varié vd da transfor-
mada multidimensional. Considere que H{i} represente uma fungto positiva que (ende a
zero quando |¡s|| se aproxima do infinito, islo é, I¿H(b) representa a a?3o de um "filtro
passa-aitas . Entilo, de acorde com Girasi el ai. í 1995), portentos definir um funcional de
suavízalo nepuesentflndo o termo de regularizado como;
onde mi} é a dimensáo de x. Em virtude do teorema de Parecvai da teoría de Fourier, este
funcional c uma medida da potencia contida na saida do filtra passa-altas l///(t). Assim,
dispondoo problema de regularizadlo no dominio de Fourier e usando as propriedades da
transformad? de Fourier, a solucao da Eq. (5.55) b derivada.
1<L A forma mais gura I de um operador di fcrcncral linear c
D= j?(jL,1^,...rxM ?——j-, a+í>+ + £ = «
1 J ftcfarf
onde xt, JEj.sáo os elementos do vetor x, e p(jrp jt»..t^) é uma fim^So desse*
elementos. O operador adjunto de D é (Morse e Feshbadc, 1953)
6”H)"’**........................x'‘“+A+'"+*=n
IL. Pata obler a validaría cruzad? generalizada a partir de v?]i>da(?5o cruzada oniinária, pode-
mos considerar um problema de regressao efe aresfa descrito cm Wahba (1990):
y-Xa + t (l)
onde X é uma matriz V -por- N de entradas, e o vetor ruido < tem um vetor média nulo e
uma matriz de covariancia igual a o-[. Usando a deeomposicito d? valor singular de X,
podemos escrever
X-UDV
pndu U e V sio matrize!; oitogonaig c [i c uma matriz d¡agonal. Seja
y=Ury
P=VT«
Hidden page
Hidden page
Hidden page
lx||;.=x'C'Cx
5.? Considere um termo de regularizado definido por
| pF(xtf¿x = ¿n> í
Ja* t>« J<t-“
onde
.
'«21
e o operador diferencial linear D é definido em termos do operador gradiente V e do
operador Lapl aciano V1 como segué;
£jií=(Vjr
e
Mostré que
wto-Ét-^W
IlH
5.S Na Sef&o 5,5t derivamos a funfSc aproximativa F^i) da Eq. (5.66) usando a relajo da
Eq. (5.65). Neste problema, desojamos carrejar com a relapso da Eq. (5.65)c usar a trans-
formado mullidimensLonal de Fourier para derivar a Eq. (5.66). Rcaiizc esta derivado
usando a segurare definidlo da transformada muliidímensionel de Foutllt da fundió de
Gteen Gfi):
| G(x)exp(-ísri}íá[
onder = <-í e j í a variível transformada de dimensionalidade
5.9 Considere o problema de regrosar nao-linear descrito na Eq. (5-95). Considere que
represente o lí-ésimo elemento da matriz inversa (G + XI) '. Com isso, comeando com a
Eq. (5.58), mostre que a cslimafSo da fon^áo de tegress9o /(x) pode ser expresas como
7(x) = b*
>1
onde i , é a saída do modele para a entrada xd, e
+(x>ij=¿ü(|l»-xl||)íTlt, * = i,2..y
l-l
onde G(| í) ó a runfio de Groen.
5.1( 1 As spiine slo cxcmplos de aproximadores polinomiais por partes (Schumaker;
1981). A idéia básica por tris do método de splines é a seguinte. Uma r^gtlo de aproxima-
do de interesse é dividida em um número finito de subregióes usando nós; os nós podem
ser fixos, e nesle caso os aproximadores s3o tinearntMte parametrizados, ou eles podem
ser variíveis, c neste caso os aproximadores sáo uno iitfearrwKte parametrizados. Em
Hidden page
Hidden page
(i) Considere urna setenio aleatoria de centros usando irt = 20 centros. Calcule j média,
o desvio padrao e ou valores mínimo e máximo da prebabilidade de classificacdo
cometa P para diferentes valores de páramenos de regulariza^io Á • Ot 0,1, l, 10,
LOO, L 000. Para o cálculo das estatificas dos conjuntos, use 50 tentativas independen-
íes. de redes por eiisemble, com cada urna testada em relajo a um conjunto de rete-
rene?.! com 100(1 padrees.
(b) Constma a frontina de decisáíi calculada para a ccnfiguracjilo descrita na parte (a),
para o parámetro de regulan¿0930 k = L
(c) Repita os cá leu Los descritos na pane (a1 para m, -10 centres (sclec ¡onados a I caloría’
mente).
(ti) Com base nos scus resultados, discuta o mérito da sclc^áo al calón a de centres como
um método para o prejetn óe redes RBF e o papel da regularizacSq no desempenho da
rede como um classiiicador de padrñes.
(e) Compare scus resultados com aqueles «presentados na Sefio 3.13 que foram calcula-
da usando o método da interpolacáo estrila. Em particular, confirme que a selecta
aleatoria de centros i relativamente insensivcl ao parámetro de rcgularizíi^áo.
5,15 Pode-se argumentar que no can do experimento descrito na Setfo 5,13 errvolvendo a
cln^ificaijao de um par de classes com distribuieán gaus-:i:ina. a rede RBF lá considerada
tem um bom desempeño porque usa fundóos de base radial gaussianas para aproximar as
distribui^ues ctmd icioriai ü gflUSKÍanas de tldSíé subjauérttes. Neste problema, utilizamos
um experimento computacional pera explorar o projelo de unía rede RBF gaussiana para
iníerpolafdü estrita para distribuÍQóes condicionáis de elasse distintamente deseortlfriLuis.
Fspeciticamente, considere duas classes eqüipro v¿vcis m c ¥ cuj.15 distribuidora
• ¿'{<onde '< - íl, c uní circulo de ralo r - 2,34 centrado em x [-2* 30]7
* Mpt .X onde :£, C R! é urna regían quud: ud.i centrada cm x. corrí compranen(o de lado
Aquí r.l(ÍJl representa uma distr ¡1 Ju.i; ü. ¡ uniforme -obre Í2 C F£\ Estes parámetros 530
escollados de modo que a regido de dccisáo para a elasse^, soja a mesma que no caso da
üistTibuiqáo gau5si¿na con-idcrada na Sc^ao 5.13. investigue o uso de regularizado como
um meló de melhorar o desempenho de classifica^áo de uma rede RBF gaussiana usando
¡nterpi>la^3o estrila.
CAPÍTULO 6
Máquinas de Vetor de Suporte
6.1 IMTRODUQÁO
No Capitulo 4, cstudamos os perceptruns de múltiplas camadas tremados com o algoritmo de
retruprepaga^áo. No Capitulo 5, escudamos uma outra classe de redes em camadas alimentadas
adi ante, as redes de fundan de base radial. Ambas estas redes ncurais sao aprox i madores universa i s
a scu próprici modo. Nesto capitulo, discutimos uma outra categoría de redes alimentadas adianto
uní versáis, conhecidas como máquinas de vetor de suporte (MVS), propastas por Vapntk (Boscr,
Guyon c Vapnik. 1992; Cortes c Vapnik, 1995; Vapnik, 1995,1998). Como os perceptrons de múl-
úplas camadas c as redes de fiincáo base radial, as máquinas de vetor de suporte podem ser usadas
para clasificado depadrdes e regressáo linear.
Básicamente, a máquina de vetor de suporte é unta máquina ¡intuir com al guiñas propiedades
muito inleressantes. Para explicar como cía funciona, (a i vez seja mais fácil comccarcom o caso de
padrees separáveis que podem surgir no contexto de classificacáu de padrües. Neste Contexto, a
idéia principal de uma máquina de vetor de suporte é construir um hiperplano como superficie de
decisáo de tal forma que a margem de separado entre cxcmplos positivos c negativos seja máxima.
A máquina aprésenla esta propriedade dcsejável seguí ndo uma abardagem fundamentada na teona
da aprendizagem cstalística que c discutida no Capítulo 2. Mais precisamente, a máquina de vetor
de suporte c uma implementado do método de rninimixaf&i estrutura! de risco. Este principio
indutivQ é haseado no falo de que a laxa de erro de uma máquina de aprendizagem sobre dados de
teste (i.e,. a laxa de erro de generalizadlo) é limitada pela soma da taxa de ero de treinamento e por
um tormo que depende da d/me/isdó cíe Vapni^Citervaneakis no caso de padnocs separaveis.
uma máquina de vetor de suporte prnduz um valor de zera para o primeiro termo e minimiza o
segundo termo. Conseqüentemenieh a máquina de vetor de suporte pode fomoccr um bom desempe-
nho de gcncralizafáo cm problemas do elassifícacáo de padrocs, apesar do falo de que ela náo
incorpora conhecimento do dominio do problema. E7ste atributo é único das máquinas de vetor de
suporte.
Uma no0o que c central á construcáo do algoritmo de aprendizagem por vetor de suporte é o
núcleo do produto ¡memo entre um “vetor de suporte11 xr c o vetor x retirado do espado de entrada.
Os vetares de suporte consistem de um pequeño subconjunto dos dadas de treinamento extraído
pelo algoritmo. Dependendo de como este núcleo de produto interno é gerado, pódennos construir
diferentes máquinas de aprendizagem. caracterizadas per superficies de dccisáo nao-]incares, pró-
prias. Em pamcular, podemos usar o algoritmo de aprendizagem por vetor de suporte para construir
os tres seguíntcs tipos de máquinas de aprendizagem (entre outros):
• Máquinas de aprendizagem polinoin tal
• Redes de fun^áo de base radial
• Perceptrons de duas camadas (i.e.. com uma única camada oculta)
Isto c, para cada urna deesas redes alimentadas adiante podemos usar o algoritmo de aprendizagem
por vetor de suporte para implementar o processo de aprendizagem, usando um determinado con-
junto de dados de treinamento, determinando automáticamente o número neecssário de unidades
ocultas. Dito de outra forma: enquanto que o algoritmo de reiropropaga^oéplanejado específica-
mente para treinar um perceptron de múltiplas camadas, o algoritmo de aprendizagem por vetor de
suporte c de natureza mais genérica, porque tem uma aplicabilidadc mais ampia.
Organizarás do Capítulo
O corpo principal do capítulo está organizado em tres partes. Na prime ira parte, descrecemos as
idéias básicas por tras de uma máquina de vetar de supone. Especiticamente, na Se^áo 6,2 discuti-
mos a cnnstruqáo do hipcrplanos ót irnos para o caso simples de padrees lincamnente separáveis. A
seguir, na Su^áo 6.3. considera-seo caso mais difícil de padróes nác-separaveis.
Dessa forma, preparamos o caminlio para a segunda parte do capítulo, que aprésenla uma
discussao detalhada da máquina de vetor de suporte para resolver tarefas de reconhec¡mente de
padróes. Isso c feito na Sccáo 6.4. Na Secáa 6.5, revi sitamos o problema do XDR para ilustrar a
constru^áo de urna máquina de vetor de suporte. Na Se<;3o 6.6, revisitames o experimento
computacional sobre classificacáo de padróes que foi cstudado nos Capítulos 4 c 5, fomecendc
assim uma avalia-^o comparativa das máquinas de vetor de suporte com os pcrecptrnns de múlti
pías camadas tremados com o algoritmo de retropropaga?So e com as redes de funffio de base
radial.
A última parte do capitulo tratado problema da regressáo náo-linear. Na Seqáo 6.7 descreve-
mos uma funqáo de perda que é bem adequada para este problema. Entao, na Sccáa 6.8, discutimos
a construyo de uma máquina de vetor de suporte para regressáo náo-linear.
O capitulo concluí com algumas considentfdes fináis na Sefáo 6.9.
6.2 HIPERPLANO ÓTIMO PARA PADRÓES
LINEARMENTE SEPARAREIS
Considere urna amostra de treinamento onde x é o padráo de entrada para o í-ésimo
cxcmplo e ¿í é a resposta desejada correspondente (saida-alvo). Para come^ar, assum irnos que o
padrao {classe] representado pelo subconjunto J, +1 e o padráo representado pelo subconjunto d
=-] sáo “íincarmcntc separáveis‘h. A equa^áo de uma superficie dedoclsáo na forma de um hiperplano
que realiza esta separaban é
onde x c um vetor de en irada. w é um vetor peso ajustávcl c b é um bias. Podemos assim escrever
pairad = + l
wrxr + R0 para 4 = "I
(62)
A pressupcbiyác de padtáes linearmenle separáveis ú (cita aquí para explicar a idéia básica par tras
de uma máquina de vetar de suporte em um ceoário bastante simples; esta pressupnsiyáo sera rela-
xada na Scyao 6.3.
Para um dado vetar peso de w e bias b, a seporayáo entre o hiperplano definido na Eq. (6.1) e
o ponto de dado mais próximo é denominada a margem de separarepresentada por p. O objetivo
de uma máquina de vetor de suporte c encontrar o hipcrplana particular para o qual a margem de
separaba# p é máxima. Sob esta condiyáo, a superficie de decisáo é referida como o hiperplano
ótimo. A Figura 6.1 ilustra a construyan geométrica de uin hiperplano ótimo para um espayo de
entrada bidimcnsional.
Vclorts
dC SAJpKlt
FIGURA 6.1 Ilustradla da. Idéia
de um hiperplano ótimo para
padtóes lirtearmentó separáis
Considere que w c b _ represen tem os valores étimos do vetor peso e dobias, respectivamente.
Con sequen (emente, o hiperplano ótimo, representando uma superficie de decisao linear
multidimensional no espayo de entrada, é definida por
w[x + b0 = 0
(63)
a que e a Eq. (6.1) rescrita. A fiinyio discriminante
£<x)=w^+/ro
(6.4)
fomece uma medida algébrica da distancia de x até o hiperplano (Duda c Hart, 1973). Tal vez a
modo mais fácil de ver arto seja expressar x coma
onde y c a proic^ao normal de i sobre o hifierplano étiuno, e r é a distancia algébrica dcsqada; r é
positivo se x estiver no lado positivo do hiperplano étimo e negativo se x estiver no lado negativo.
Como, por definí;ao. = C, resulta que
SÍ») = + i, = r||w,||
ou
£íij
Hl
(6-5)
Em particular, a distancia da 01 igem (i.e., x = 0) até o hiperplano étimo é dada por t/|| wj|. Se >
0, a orígem está no lado positivo do hiperplano étimo; se bti < 0, cía está no lado negativo. Se ó _ 0,
o hiperplano étimo ptissa pela origem. Uma inttrpreta;áo geométrica destes resultados algébricos ó
dada na Fig. 6.2.
FIGURA a.2 Interpretado
geométrica das distancias
algébricas de pontos até o
hiperplano étimo para um
caso bidimenslonal
A questáo a resolver é encontrar os parámetros e £?., para o hiperplano étimo, dado o conjun-
to de treinamento 9" {(x, tí)}. Com base nos resultados retratados na Fig. 6k2, vemos que o par
(v. . bt) deve satisfazera restriban:
+ b,, > 1 para d1 =+1
+ bt <—1 para = -1
(66)
Note que se a Eq. (6.2) for válida, isto c, os padrees fbrem Hnearmente su-paraveis, podemos sempre
escalar c bn de modo que a Eq. (6.6) seja válida; esta operagao de cscalamentn náo afela a Eq. (6.3).
Os pontos de dados particulares (X, d) para os quais a prime.ra ou a segunda linha da Eq. (6.6)
c satisfeita com o sinal de igualdade sáo chamados de veioivs de suparie, por isso o nome “máquina
MAQUINAS DE VETÜftnR Surt>RTE 353
de vetor de suporte11. Estes vetares dcsempenham um papel preeminente na operario desta elasse
de máquinas de aprendizagem. Em termos conceituais, os vetares de suporte sao aqueles pontos de
dados que se encontratn mais próximos da superficie de dccisao c sao, portanto, os mais di ficéis de
classificar. Dessa forma, tém urna influencia direta na localizado ótima da superficie de decisao.
Considere um vetor de suporte xÍJ- para o qual J° = +1. Entilo, por definido, temos
g(ió1) = wjx"1 T ba T1 para</l’l=Tl
(6.7)
Da Eq. (6.5) a Jrstóncúr aígébríca do vetor de suporte x(í) até o hiperplano ótimo é
se Jüí = +l
se = -l
(68)
onde o sinal positivo indica que x1^ se encontra no lado positivo do hiperplano ótimo e o sinal
negativo indica que xÍJ¡l está no lado negativo do hiperplano ótimo. Considere que p represente o
valor ótimo da morgem Je separando entre as duas classes que constituem o conjunto de treinamen-
to ST, EntSo, da Eq, (6.8) resulta que
(6.9)
A Equa^ao (6.9) afirma que maximizaramargem de separa^áo entre classes é equivalente a minimizar
a norma euctidiana do vetor peso w.
Em resumo, o hiperplano ótimo definido pela Eq. (6.3) é único no sentido de que o vetor peso
fomece a máxima separado possível entre exemplos positivos c negativos. Esta condi^ao ótima
é alcanzada minimizándose a norma euel¡diana do vetor peso w.
Otimizaqao Cuadrática para Encontrar o Hiperplano Ótimo
Nosso objetivo é desenvolver um proccdimcnto eficiente do ponto de vista computacional para,
utilizando a amostra de treinamento 9" = {(x., )}* , encontrar o hiperplano ótimo, sujeito á restri-
d1(WrX. + b) > l para i = 1,2,.*., Air
(6 10)
Esta rcstri^áo combina as duas linhas da Eq. (6.6) com w usado no lugar de w.
O problema de olimizaban restribo que temos que resolver pode agora ser formulado como;
>'}-.i-i j a amostra tte mánamenta {(!_,;()} .. fWíwr/re os wrZores JírMíM tfo vetor peso w e bias b de
modo que saiisfaqum as resina tres
dfivd* - 6) > L para i = 1P 2..A'
e O vefür ptSO W minimite 0 fiin^aíf tfe Luxlti.
{b(yt) =
O tator de escala JZ2 ¿ incluido aquí por conveniencia de aprcscnia^áo.. Este problema de otimiza^ao
restrito é chamado de problemaprimoidiaí Ele é caracterizado tomo segue;
• A íijrujáo de cusió <D(w) é uma fun^áo convexa de w.
• As restrictos sác lineares em relajo a w.
Conscquenlemente, podemos resolver o problema de olimizaqao restrito usando o método dos
muitindicadores de Lagrange (Bert&ekas, 1995).
Prime i ro, construimos a/wrt<íir lagrangiana:
J(w, 6,ü) = — w7 w
-^ajrf.íw1».+/>)-]]
d-l
(6.11)
onde as variáveis aumliares nJü-nej¡alivas s3o chamadas de rtidiiplicadores de Lagrangc. A
solu^áo para o problema de otimiza^ao restrito é determinada pelo ponto désela da funfSo lagrangian.i
J(w, b, a), que deve ser mmfraizada em relajo íl w c a b-, ela lambem tem que ser maximizada cm
rclaifao él a. Assim, diferenciando J(w, h, ot) em rela^áo aweaíc igualando os resollados a zero,
oblemos as duas seguintes condifdesde
_ . ¿tZ(w,6,ot)
Cono i cao t: --------= 0
. . ¿E/(w,6,a)
Cundí cao 2: ---------= 0
A aplicado da cóndilo de ocimiza^áu 1 á tün^ao lagrangiana da Eq. (6.11) produz (após
remanejamento de termos)
V
w = Xff.4K. (6.12)
A aplicacáo da condi^áo de olimizacao 2 á fiin^aa Lagrangiana da Eq. (6.11) produz
¿«4 = o
I" I
(6-13)
O vetorsolutfo w ¿definido em termos de uma cxpuisio que cnvolve os JVexemplos de tiernamen-
te. Note, entretanto» que, embora esta soluqao seja única em vi mide da convexidade da lagrangiana,
o mesmc nao pode ser dito sobre os coeficientes de l jgrange, a
Tambcra c importante notar que no ponto de sola, para cada multiplicador de Lagrange a , o
produto daquele multiplicador pela sua restribo correspondente desaparece» como mostrado por
a. [rfíwri. + b) - I ] = 0 para i = 1» 2,—» )V
(6 14)
Dessa forma, apenas aqueles multiplicadores que satisfazem examínente a Eq. (6.14) podem assu-
rn ir valores nan-nulos. Esta propnedade resulta das connota de Kuhn-Tucktr da teoría da oliin ¡izando
(Flelcher, 1987; Bertsekas» 1995).
Como notado anteriormente, o problema primordial i i da com uma fundan de custo convexa e
cora rcstrÍQocs lineares. Dado um problema de oliinizaqéo rusirito como esle» é possivcl construir
um outro problema chamado de problema duaf. Este segundo problema tem o mesmo valor ótimo
do problema primordial, mas cora os muí dpi icadorcs de Lagrangc fomcccndo a sclu^áo ótima. Em
particular, podemos formular o seguinte teorema tía dualidad# (Bertsekas, 1995):
(a) Se o problema primordial tem uma soluQáo ótima, cntáo o problema dual também tem uma
soluto ótima, c os valores ótimos cocrespondentea sio iguais.
(b) Para que wn seja urna soluto primordial ótima e o.u seja urna soIuqóo dual ótima» é necessár» e
suficiente que wn seje realizável para o problema primordial, e
w J = J( wp, , fín) = rriin J( w» b,, )
Para postular o problema dua! para o nosso problema primordial, primeiro expandimos a Eq. (6.11),
termo a termo» como segue;
। X ff .V
J(nr>bta) = — wrw - tfdwrx, -í’Xce4 + (6.15)
2 i-i í-i i-i
O terceiro termo no lado direito da Eq. (6.15) c zcro cm vinudc da condifáo de otimiza^áo da Eq.
(6.13). Alcm disso, da Eq. (6.12) temos
M ,v .v
WfW= Tí?/?7!, = fi^^íTíÍZ/JJJXir]£y
l-l 1=1
Ccnseqüentemente, fazendo a fün^o objetivo 7(w, b. á) £?(«), podemos reformular a Eq. (6.15)
como
¿r | 9 .*
2(ff) =
i-i ¿ i-i ;-i
(6.16)
onde es a.sfio nao negativos.
Podemos agora formular o problema dual:
Dutki ii amostra de fftifíamctttü {(* s 4)}._r cumbre W muiiiptitíidoW ift LftffWiige {<*.}._, ¡fue
urntímam aftmcaa objetivo
& ti) - ¿ X -1 ¿ ¿ x>.
jx^ccAa ái nsfrifw?
(]) ¿aA-0
{2} u > 0 pura i = Z, 2,,,,rN
Note que o problema dual é formulado inTeiramente em termos dos dados de treinamento. Além
disso, a fcntQÍfo (J(a) a ser maximizada depende apenas dos padrees de entrada na forma de um
conjunto de produl os escalares, {ij x.} _ .
lia vende determinado os multiplicadores de Lagrangc étimos, representados por a , pode-
mos calcular o vetor peso étimo wm usando a Eq, (6.12) e assim cscrever
V
w,=y X. jx
> .I I >
(617)
Para calculare bias étimo podemos usaro v* assim obrido c tirar vaniagcm da Eq. (6.7) relativa
ao vetor de suporte positivo, c assim esenver
= parat^' sl
(6.18)
Propiedades Estatístícas do Hiperplano Ótímo
Da teoría csíatíst ca da aprendizagem aprcscnlada no Capítulo relembrames que a dimensao V-C
de uma máquina de aprendizagem determina o modo como uma estrutura aninhada de funfócs
aproximar ivas deve ser usada. Também relemhramos que a dimensfo V-C de um conjunto de
hiperplanos de separado em um espado de dimensional i dade m ó igual a jft - I. Entretanto, para
aplicarmos o método da minimizacáo esrrutural de risco, descrito no Capitulo 2, precisamos cons-
truir um conjunto de hiperplanos de separado de dimensao V-C variavel tal que o risco empírico
(i.e., o erro de classifica?áo de treinamento) e a dintensáo V-C sejam minimizados ao mesmo tem-
po. Em uma máquina de vetor do suporte c imposta uma estrutura sobre O conjunto de hiperplanos
de separado rcsLrinyindo a norma cud'-diana do vetor peso w. Específicamente, pedemos formular
o seguirte teorema (Vapnik, 1995,1998):
Considere que D represente o diámetro Ja menor esfera cnntendn todos M velares de entrada x|4 x,,...,
K.. O conjunto de liipcrp]anus ciliniüs descrito pr .i equa^áo
tem uma dimensáo V-C A limitada acima por
(6 19}
onde o sinal de máximo FJ1 representa o menor mteiro maior que ou igual ao número abnangido por ele, p i a
margcm de separado igual a 2/||wj| cmüca dimensionalidade do espado de entrada.
Este teorema nos diz que pedemos exercer controle sobre a dimensáo VC (i.e, a complexidade) do
hiperplano étimo, independentemente da dimensional idade m( do espado de entrada, escolhendo
adecuadamente a margem de separado p.
Suponha entío que temos uma estrutura aninhada descola em termos dos hipeiplanos de sepa-
racáo como segue:
5t = {wrx + fc ||w|'.r < cj, k = 1,2,...
(6.20)
Em vjrtude do limite superior h da dimensáo VC definido na Eq. (6.19), a estrutura aninhada descri-
ta na Eq. (6.20) pode ser icformulada cm termos das margens de scpaia^ao na forma equivalente
+ l:p1>úé
k = 1,2,*..
(62!)
Os a, e ct sao constantes.
Do Capitulo 2 também relembramos que. para obler urna boa capacidade de generalizadle,
devemos selecionar a estrutura pan acular com a menor dimensáo V-C e erro de treinamento, de
acorde com o principio da mmimizagao estrutura! de risco. Das Eqs. (6.19) c (6.21) vemos que esta
exigencia pode ser satis feita usándole o hiperplano étimo (i.e., o hiperplano de separafáo com a
maior margem de separado p). Equivalentemente, considerando a Eq. (6.9), devenios usar o vetor
peso étimo wd tendo a norma euclidiana mínima. Assim. a escolha do hiperplano étimo como a
superficie de decisáo para um conjunto de padróes linearmente separareis nao c apenas intuitiva-
mente satisfatório, mas tambem está em completo cumplimento do principio de minimizafáo estru-
tural de risco de uma máquina de vetor de suporte-
6.3 HIPERPLANO ÓTIMQ PARA PADRÓES NÁO-SEPARÁVEIS
A discusslc até agora enfocou padróes linearmente separáveis. Nesta segáo, consideramos o caso
mais difícil de padróes náo-separáveis. Dado um conjunto de dados de treinamento como este, náo
é possírel construir um hiperplano de separarse sem nos defrontarmos com erres de classifícacac.
Apesar disso, desojamos encontrar um hiperplano étimo que mlnimize a probabilidade de erro de
classifica^áo, calculada como a média sobre o conjunto de treinamento.
Diz'sc que a margan de separa^áo entre classes é strtiv se um ponto de dado (ip 4) violar a
seguinte condigno (veja a Eq. (6.1D));
í/XwTl+¿)>+], /-],2...W
Esta violadlo pode surgir de duas formas;
• O ponto de dado (s. d) se encontra dentro da ref.iao de separado, mas de todo córrete da
superficie de dccisao, como ilustrado na Fig. 6-3a.
FIGURA 6.3 (a) O ponto da dade x {pertenoBnls ¿ classe tj se encentra dentro da rogiáo ds sspara^áo. mas ne
lado córrelo da superficie de daosao. (b) O ponlo de dado x, (pertenoente á dasw se enconlra no lado errado
da superficie de decisáo
• ü punto de dado (k , d) se encontra no Lado errado da superficie de decisfc^ como ilustrado
na F' ifi. 6.3 b.
Note que temos uma classifica^So cerrera no caso L, mas uma classiñca^áo incoireta no caso 2-
Para preparar o terreno para um tratamento formal para □ caso do pontos de dados nao-separa*
veis, introduzimos um novo conjunto de variáveis escalares nio negativas. {^,}iL_|f na dcfini^ao do
hiperplano de separado (i.e., superficie de decisio) como mostrado aquí:
¿(w\ i 6) a 1 - i - 1,2.........A' (6.22)
As £ sao chamadas de variáveis so¡¡aah medem o desvio de um ponto de dado da condi^ác ideal do
separabilidade de padrees. Para 0 £ , o ponto de dado se encontra dentro da regiáo de separa'
í¿ío. mas no lado córrete da superficie de decisto, como ilustrado na Fig. 6.3a. Para > l, ele se
encentra no Lado errado do hiperplano de separando, como ilustrado na Fig. 6.3b. Os vetores de
suporte sao aqueles pontos de dados particulares que smisfazem a Eq. (6.22) precisamente, mesmo
se > 0. Note que se um exemplo com > 0 For dejado de fura do conjunto de treinamento, a
superficie de dccisáo nao muda. Assim. os vclorcs de suporte sao definidos chatamente do mesmo
modo tanto para o caso I i ricamente scparável como para o caso nao’ scparável.
O nossa objetivo é encontrar um hiperplano de separado para o qual o erro de elassitica^áo,
como media sobre o conjunto de treinamento, c minimizado. Podemos fuer isto minimizando o
fuñe onal
<f(O=¿AC-i>
cm rclafáo ao vetor peso w, sujeito á restribo descrita na Eq. (6.22) c a restribo sobre ||w|-. A
fundan /(ti é uma futi^ao indicadora, definida por
0
se c,< 0
se £>0
Infelizmente, a minimizado de <b(á) em rela^ao a w é um problema de otimiza^áo tiáo-convexo
que é NP completo.2
Para tomar o problema matemáticamente iralávcl, aproximamos o funcional <&(£) escrevendo
*>(£) =
Além disso. simplificamos a computado formulando o funcional a ser minimizado em relajo ao
vetar peso w como segue.
wrw + C(623)
* .-i
Como anteriormente,, a minimizacáo do primeiro termo da Eq. (6.23) está relacionada com a
minimizada da dimensáo V-C da máquina de vetar de supone. Assim como para o segundo termo
ele é um limite superior para o número de erres de teste. A formuladlo da funpáa de custo <3>(w,
C,) da Eq. (6.23) cslát portante, cm pcrfcilo acordo com o principio da miniir.iza^ao estrutural de
risco.
O parámetro C controla o compromisso entre a cumple* idade da máquina e o número de
pontos nüo-separáveis; por isso. pode ser visto como uma forma de parámetro de “regularizado^
O parametro C deve ser selecionado pelo usuario. Isto pode ser feito de duas formas:
* O parámetro C é determinado experimenfabnente através do uso padrao de um conjunto de
treinamento/teste (validado), o que é unta forma grosseira de neamostragem.
• Ele Ó determinado analíticamente estimando a dimensáo V-C através da Eq. (6.19) e entáo
usando-se limites do desempenho de generalizado da máquina bascados na dimensao V-C.
De qualquer forma, o funcional <P(w, c.) é oti misado em rela^áo a w e [^]^|? sujeito á restrillo
descrita na Eq. (6.22) e £,.> 0. Fazendo isso» a norma quadrada de w e tratada como urna quanlidade
a scr minimizada simultáneamente em rela^áo aos pontos náo-separáveis, e náo como uma rcstrid°
imposta sobre a minimizado do número de pontos náo-separáveis.
O problema de otimizado para, padrocs nao-separáveis assim formulado incluí o problema de
ctimiza^o para padrifes linearmente separáveís con» um caso especial. Específicamente, fazer^, =
0 para todo í ñas Eqs. (6.22) e (6.23) as reduz ás formas correspondentes para o caso lirtearmente
separáveL
Podemos agora formalizar o problema primordial para o caso náo-separável como:
Dada í¡ mwmtra de ireinamento {( K, ,di) j * (, eftctmlre ¡>x valorea ótimav do vetar peno w e do bias b
de mt>do que sa¡ixfa$am a restricáo
diívfJxi +• 6) £ I - para i = 1.2......?V
4, í 0 para todo:
flfcltto ¿¡Tta.3 ú /WO w e 05 iwíflvrá JülftB raJFrrmrZEAj tj /Sfflrrr.?rF.£j¿ tí? CUSfD
1
-ww +
*
onde C c 11 •i jwUne/w positivo especificado pelo usuario.
Usando o método dos multiplicadores de Lagrange e prócttléndú de maneira similar á descrita na
Se?áo 6.2, podemos formular o problema dual para padróes náo-separaveis como (veja o Problema
63):
Dada a amenifttt de tfltitfümcniü -i.!..<()} - r ™cauUrt os fítultiplicadores de Lagrauge {a,} '. que
maxffítiMm a /iuii'iio objetivo
& a) = V ti, - - X £ a,aJ dtdrfxt
¿ !
.-¡jj/eífü ds F^7rrfÍ£".v
(O = °
(2} D < « < C para i 1, 2,..., Ar
nade C i' f¡in parámelntpOSflivtJ e.’.piLificadtrpelo uxliúrifi.
Note que nem as varia veis solías nem os multiplicadores de Lagrange aparecen! no problema
dual- O problema dual para o caso de padróes náo-separáveis é dessa forma similar aquele para o
caso simples de padróes linearmente separa veis excetc por urna diferente pequeña mas importante.
A fun^áo objetivo £(a) a ser maximizada c a mesma em ambos Os castos. O Caso nao-separável
diferc do caso separase! pelo falo de que a restribad a. > £l ¿ substituida pela restricáo mais rigorosa
0 < a < C. Exceto por esla modificado, a otimiza^c resfrita para o caso itáo-separável e os cálcu-
los dos valores étimos do vetor peso w e do bias b proccdem do mesmo modo como no caso
linearmente separável. Note também que os vetores de suporte s^o definidos chatamente do mesmo
modo como anteriormente.
A suturo ótima para o vetor peso w é dada por
(6-24)
J-l
onde A. c o número de vetores de suporte. A determinado dos valores étimos do bias também
segue um precedimento>:mitarao descrito anteriormente. Específicamente, as condicócs de Kuhn-
Tucker sáo agora definidas por
[rfíw7!. +6} -1 +5J = 0, t = 1,2..........N
¿’l.l..Ar
(625)
(626)
A Equa^ao (6.25) c nina forma rcscrita da Eq. (6.14), cxccto pela substitu ¡(ao de termo da unidade
por (I -1). Como na Eq. (6.26), os kl. sao multiplicadores de Lagrange que foram inlroduzidos para
forjar a náo-negatividade das variáveis solt&s para todo i. No ponte de sela, a derivada da fon$ifo
lagrang¡ana para o problema primordial cm rcla^áo á variávd solta £, ó zcro, produzmdo
(&.27)
Combinando as Eqs, (6.26) e (6.27), vemos que
0 se a < C
(6.28)
Podemos determinar o bias ótímo bu comando qualquer punco de dadu U. d) du conjunto de treina-
mentó para o qual temos 0 < aw < C e com isso 0, e usando esle ponto de dado na Eq. (6.25).
Entretanto, de uma perspectiva cm umcrica, c melhor [omar o valor media de bn resultante de todos
estes pontos de dados da amostra de treinamento (Burges, 1998).
64 COMO CONSTRUIR UMA MÁQUINA DE VETOR
DE SUPORTE PARA REO ON REGIMENTO DE PADRÓES
Tundo cm máos o mater.al sobre corno encontrare hiperplano étimo para padrees nao- separa veis,
podemos agora descrcver formal mente a construyo de uma máquina de vetor de suporte para urna
tarefa de rcconhcci mentó de padrees.
Básicamente, a ideia de uma máquina de vetar de suporte1 dependo de duas operares mate*
máticas resumidas aquí e ilustradas na Fig. 6.4:
«lirada {dados]
FIGURA 8^4 y liru rtáó-lpnear ] dn aspado
de entrada para o espada de CBracl?riEticM
L O mapeamento nán-llnear de um vetor de entrada para um espado de características de alfa
dimensionalidade, que c ocilllu da entrada c da saída.
2. A construpáo de um hiperplano ótímo para separar as caracterisl icas descobertas no passo I.
A razáu para cada uma desta s duas uperaijces ¿ explicada a seguir,
A operario 1 é realizada de acorde com □ teorema de Covcr .robre a sepa rabil ¡dado de pa-
drees, que c discutido na Capítulo 5. Considere um espado de entrada constituido dejMrfrtíes nao-
Jinearmente separáveis. O teorema de Cover afirma que este espado mu Lt ¡dimensional pode ser
transformado em um novo espado de características onde os padrees sao lineamnente separa veis
com alta probabilidade, desde que duas condi^ocs sejam satisfeitas. Primeiro, a transFormapao é
nao-linear. Segundo, a dimensionalidade do espado de características é suficientemente alta. Estas
duas condifdes sSo incorporadas na operado 1. Note, entretanto, que o teorema de Cover
discute k o l’.iperplano de separado c ótimo. É apenas pelo uso de um hiperplano de separado
ótimo que a dimensio V-C c minimizada e a generalIzafSo é alcanzada.
É nesta última questáo que entra a segunda opcraqáo. Específicamente, a operacáo 2 explora a
idéia de construir um hiperplano de separado ólmno de acorde com a teoría desea ita na Sefáo 6.3,
mas com urna diferen^a fundamental! o hiperplano de scparaqao c agora definido como uma fun^áo
linear de vetores retirados do espado de características. em vez do espado de entrada original. O mais
importante é que a construyo dcsCC hiperplano c realizada de acorde com o principio da mininiizacaa
estrutural do risco que é fundamentada na teoría da dimensao V-C. A construí depende do cálculo
do núcleo de um produto intemo.
Núcleo do Produto Interno
Considere que x represente um vetor retirado do espado de entrada, que é assumido como leudo
dimensáo m . Considere que • <pt(x)} represente um conjunto de transforma^óes nao-lmeares do
espado de entrada para o espado de características: m é a dimensáo do espado de características.
Assume-sc que ip(x) c definido a priari para todo j. Dado este conjunto de transieren aedes n«Lo-
lincarcs, podemos definir um hiperplano aluando como a superficie de dccisáo como segue:
’l]
JwJip:(i)+¿f = 0 (6.29)
.'=1
onde [w.' [ representa um conjunto de pesos lineares conectando o espado de características com
o espace de saida, c b c o bias. Podemos simplificara dcscnvolv¡mentó cscrevcndo
£u/p.(x) =0 (630)
jr II
onde foi assumido que lp„(x) = I para todo i, de modo que h . represente a bias \ A Equafáo (630)
define a superficie de decisfc calculada no espado de características em termos dos pesos lineares
da máquina. A quantidade rp,(x) representa a entrada fomecida ao peso ufravés do espado de
características. Defina o vetor
q>(x) = (q/x), q>| (k).tpm, (x)] ’
onde, por definido, temos
tp tx)= I para toda i
(631)
(632)
Na verdade. o vetor <p( x) representa a "imagem' induzida no espado de características pelo vetor de
entrada x, como ilustrado na Fig. 6.4, Assim, em tennos desta i magenta podemos definir a superficie
de decisao na forma compacta;
w’ipfx) = 0
<6-33)
Adaptando a Eq. (6.12) á nossa presente situa^So envolvendo um espado de características onde
procuramos agora a separabilidade “linear" de características, podemos escrever
.V
w =
i-l
(6.34)
onde o vetor de características qj(i) corresponde ao padráo de entrada x. no j-csimo cxcmplo.
Dessa forma1 substituindo a Eq. (6.34) cm (6.33)+ podemos definirá superficie de decisfo calculada
no espado de características como:
.V
w = £ft/,<pr(x;)<p(x) = 0
I I
<6.35}
O termo tpr(x.)q)(K) representa o produto interno de dois vetores inducidos no espado de caracterís-
ticas pelo vetor de entrada x e o padráo de entrada x relativo ao Msimc exemplo. Podemos entao
introduzir o núcleo doproduto interno representado por x) c definido por
/C(x1xe) = tpr(xMx1)
J-fl
para i = 1,2..N
(6.36)
Desta definido vemos i mediatamente que o núcleo do produto interno é urna fungao simétrica de
SCUS argumentos, como mostrado por
K(x, íj) = K(x} x) para todo i
(6.37)
Ornáis importante é que podemos usare núcleo do produto interno K(x, x) para construir o hiperplano
ótimo no espado de características sem Lcr que considerar o próprío espado de características de
forma explícita. Isto c visto fácilmente usando-se a Eq. (6.36) cm (6.35), de onde resulta que o
hiperplano é agora definido por
>
^a,</f(xTx1) = 0
=i
<6.38}
O Teorema de Me roer
A expansao da Eq. (6.36) para o núcleo do produto interno /f(x, x) c um caso especial importante do
teorema de Mercerqee aparece na anílise funcional. Este teorema pode ser formalmente formulado
como (Mcrcer, 19D8; Courant e Hilbert, 1970):
Seja £(x. x) um núcleo 'métrico e continuo quu é definido no intervalo fechado a í x í b c da
mesma forma para se'. O núcleo K(x, x') pode ser expandido na serie
A\x.x') =
(639)
com coeficientes positivos X,>11 pura iodo r. Para esta expansáo ser válida e para convergir absoluta
c uniformemente, é nccessário e suficiente que a eondi^So
X(«. x ')1K x )Ú{ x' )¿/xdx' ¿ 0
J b J h
seja válida para codo d*(*} para o qual
>
‘ (i)Jx < “
J h
As fungues tp.(x) sáo chairadasautqfimQoes da expansao c os números X sao chamados autovafores.
O fatn de que todos os aulovalorcs sao positivos significa que o núcleo K(x, x1) c definida positiva-
mente.
Com base no teorema de M creer, podemos agora fazeras seguintes obsena^oes:
* Para La j-ésima imagem ^l.tp^x) induzida no espado de características pelo vetor de
entrada x é uma autofut^fc da expansáo.
* Teori ca men te, a d i m ensioua I idade do espado de caracteristicas (Le., o número de autovalores
/ autofunfñes) pode ser fe i la infinitamente grande.
O teorema de Merca apenas nos diz se um núcleo candidato é realmente um núcleo de produto
interno em algum espado, c portante admissivel para uso em uma máquina de vetor de suporte, ou
nao. Entretanto, ele nao diz nada sobre como construir as fun^oes tp(x): nós mesmos temos que
fazer isto sozuihuí.
Da cqua^áo de defin i^áo (6.23 k ventos que a máquma do vetnr de suporte incluí uma forma de
regularizado cm um sentido impiieifa. Em particular, o uso de um núcleo Á'(x, x") definido de
aconto com o teorema de Mereer corresponde á regularizarán com um operador I) tal que o núcleo
A’(\, í é a funpfo de Grcen de f)D, onde Peo adjunto de D (Smola c Schülkopf, 1998}. A teoría
da regularizarán ó discutida no Capítulo 5.
Pro jeta Ótímo de uma Máquina de Vetar de Suporte
A expansáo do núcleo de produto intemo K(x, x) na Eq. (6.36) nos permite construir uma superficie
de decisao que ú náo-l near no espado do entrada, mas cuja imagem no espado de características ó
linear. Com base nesla expansáo. podemos agora formulara forma dual para a otiimiza^áo restrita
de uma máquina de vetor de suporte como segue:
Dada t/ iifíjosfra de ¡tvinamcnht etreúnfre or ntn/tiptfcadóres de Lqgftbigé qw
l¿ /jdrtlpA?
MÁQL JWAS VI: VeTUR DE SUPORTE 365
V | A g
Ota) = Ja - T <6,40)
r-| - i'*l /«J
iu/Éltús ás resfrifóes:
(1) j>X = o
1*1
(2) 0 Ot, £ C para r = 1T 2T..., A'
onde C i um parámetro positivo especificado pelo usuario.
No le que li restrillo (1) surge da oümizafáo do lagrangiano Q(oí) cm rela^áo ao bias b = para
<pf(x) "1.0 problema dual formulado tem a mesma forma como no caso de padróes nüo-separáveis
considerados na Sefáo 6-3, excetc pelo lato de que o produto interno x, usado lá foi substituido
pelo núcleo do produto interno K(x;h x,). Podemos ver AlXj, i) cojeo o elemento ij de uma matriz
simétrica A'-por-N K. como mostrado por
K={*<’< «/JlL. cfi4l>
Tendo encontrado os valores ¿timos dos multiplicadores de Lagrange, representados por cjt , pode*
mos determinar o valor úiimo ootrespondente do vetor linear de peso, wu, que conecta o espado de
características ao espado de saída adaptando a fórmula da Eq. (6.17) a nova situado. Específica-
mente^ reconhecendo que a imagem qMjt) desempenha o papel de entrada para o vetor peso w,
podemos definir como
.V
*,=.) (6-42>
onde qKx.) é a imagem induzida no espado de características devido a if. Note que a primeira com-
ponente de vi representa o bias óiimo b .
Exemplos de Máquina de Vetor de Suporte
A exigencia sobre o núcleo X(x, xj é que ele satisfaga o teorema de Mcrcer. Entretanto, dentro desta
exigencia existe alguma liberdade cm como ele c cscolhido. Na Tabela 6.1, apresentamos resumida-
mente os núcleos de produto intemo para tres tipos comuns de máquinas de vetor de suporte: a
máquina de aprendizagem polinomial, a rede de fun^ao de base radial c o pcrccptwn de duas carna-
das. Devemos notar os seguintes pontos:
1. Os núcleos de produto intemo puní as máquinas de vetor de supone dos tipos polinomial c
fún^áo de base radial sempre satisfazem o teorema de M creer. Em contrapartida, o núcleo de
produto interno para a máquina de vetor de suporte do tipo perceptron do duas camadas sofre
alguma restribo, como indicado na última linha da Tabela 6.1. Isto mostra que determinar se
um dado núcleo satisfaz ou náo o teorema de Mercer pode ser uma questáo difícil; veja o
Problema 6.8.
TASELA 6-.1 fieaumo dos Núcleos de Prcdulo Interno
Tipo dq máquina
de vetar de supone
Máquina de apreflctiíjifcm
poLinom ¡il
Rede de Funcáo de base radial
Pcnceptrim di duaji carnadas
Núcleo de produlo interno
i,). J = L 2........-V
Cnmentarins
(x'i * * Lf
otÍ—U-iii
\ 2<T^
Unh[|luiri *
A polénciap é especificada
a prifíri pelo usuario
A largura. 3J, ramum a todos
os núcleos, é especificada a
priori pelo usuario
O retínenla de Menccr é sa-
i isíci Lo apenas para alguns
valorea de p5e p,
2, Par«i todos os tres tipos de máquina, a dimensionalidade do espado de características é determi-
nada pela número de vetares de suporte extraídos dos dados de trei namcnlc pela solucáo de
problema de otiniizafíc restrita.
3. A teoría fundamental de unta máquina de vetor de suporte evita a neccssidade de heurísticas
freqúentemente usadas no projeta de redes de fun^ác de base radial e perceptrons de múltiplas
camadas convencional s:
• Na máquina de vetor de suporte do tipo fuñí3o de base radial, o número de lun^ocs de base
radial e seus. centros sao determinados automáticamente pelo número de vetares de suporte
e seus valores, respectivamente.
* Na máquina de vetar de suporte do tipo pcrccptron de duas camadas, o número de neurónios
ocultos e seus vetares de peso sto determinados automáticamente pelo número de vetores
de suporte e seus valores, respectivamente.
A Hgura 6.5 mostea a arquitetura de uma máquina de vetor de suporte.
Independentcmcntc de como uma máquina de vetor de suporta c i ¡nplcmenlada, ela ihiere da
abondagem convencional para o projeto de um perceptron de múltiplas camadas de uma forma
fundamental. Na abordagem convencional, a complexidadc do modelo é controlada mantendo-se O
número de características (i.e., neurónios ocultos) pequeño. Por quito lado, a máquina de vetor de
suporte nfercce uma so!u?án para o projeto de uma máquina de aprendizagem controlando a com-
ptfxidadcdo modelo independen [emente da dimcnsionalidadc, como resumido aquí (Vapnik, 1995.
199#):
• O problema conceitita!. A dimcnsionalidadc do espado (oculto) de características ¿ feito
propasi todamente muito grande para possib litar a construíáo de uma superficie de decisáo
na forma de um hiperplano naquele espado. Paraum bom desempenho de generalizadlo, a
complexidade do modelo é controlada pela imposto de certas rcstrípocs sobre a constru-
íao do hipcrplanu de separa^au, que resulta na extraían de uma fraudo dos dados de treina-
menta como velones de suporte.
• O problema eomptifacional. A otim izaban em umérica em um espado de alta
dimensional i dade sofre da ma LdifSo da dimensionalidadc. Este problema compulac tonal é
evitado usando a nocíta de um núcleo de produto interno (definido de acorde com o teorema
de Mcrccr) c rcsolvcndo-se a forma dual do problema de otimizdíáo retinta formulado no
espado de (dados) entrada.
entrada de- de ". níki™ de
tjntatihn ora prvdnta interno Inlmn»
Fl GU R A £.5 Arquiteluis da
máquina do votar do suporta
6.5 EXE M PLO: O PROB LE NI A DO XO R (REVISFTADO)
Para ilustrar o procedí menta para c prívete de uma máquina de vetor de suporte^ revi si lames o
problema de XOR (OU Exclusivo) discutido nos Capítulos 4 o 5. A1 abela 6.2 apresenta um resumo
dos vítores de entrada e resposias desejad&s para os quatro estados possí veis.
TABELA O Problema do XOR
Vetar de entrada, i
Resposla desejada. d
í-1,+1)
(+1.-1)
(+L’I)
—1
+ L
+ L
”1
Para proseguíanos, considere (Cherkassky e Mulier. 199&)
Á'(x, jQ’O + st'x )2
(6-43)
Com x “ [xp v.]1' ei ’ [x:||Fx ]. podemosassim expressaro núcleo do produto interno Á'(x, x) em
termos de monomios de vinas ordens como segue:
íú(i1 ij) = 1 + + íx^j^Xfl + JCjjrjj + SxpXjT + 2x,xJ3
A imagem do veLúr de entrada i inducida no espado de características é, portanto, deduzida como
rp( x) = [i, x V2X|X-, x Víip J7
Similarmcnlc,
cp( k ,) = [1, <1,42r, rr, J, x,<, VZr,,J 2xf, ]
i= 12,3,4
Da Eq. (6.41) tambem constatamos que
"9 I ] l"
19 11
1 l 9 1
1 1 19
A fiin^ao objetivo para a forma dual c portanlo (veja a Eq. (6.40))
¿Ha) = «! + a, + et, ± a4 -^(9aJ - 2ci|Ci: - 2aaT + 2rilcfJ
+9cg + 2íi,a. - 2Oj«4 + 9a^ - Za¿a4 + 9ot‘)
.4 otimizaijao de £7(ut> cm rcla^áo aos multiplicadores de Lagrange produZ’SC o seguirte conjunto
de eq magues si multan cas;
9a, - a, - a, + a4 = I
-a + 9a, + a, -a4 =*1
-a. h-Oj *9a? -a4 = 1
a, - a-, - a, + 9a4 = l
Assim, os valares 6tirnos dos multiplicadores de Lagtange sao
I
i = j = = -
c
Este resultado indica que nesle exemplo todos os quátró vetores de entrada .V sao vetores de
suporte. O valor ótimo de 0(a) c
a(«)=7
4
Correspondente mente, podemos escrever
ou
Da Eq. (6.42) resulta que o vetar
O primeiro elemento de w indica que o bias b c zero.
O hiperplano ótima ó definido par (veja a Eq. (6.33))
wurtp(i)=0
Isto éT
que se reduz a
- X(Xt = (J
A forma polinomio] da máquina de vetor de suporte para o problema do XOR é mostrada na Fig.
6.6a, Para x( Xj -] eXj"Xj +L a saiday* -1 ; e para x, -1, xa“+1 ex, =+1 ex2 = -1, temos
y = +1. Assim, o problema do XOR ó resolvida eemo indicado na Fig. 6.6b.
6.6 EXPERIMENTO COMPUTACIONAL
Neste experi mentó computacional, revi sitamos o problema de classifiea^áo de padrifes que cshrda-
mos nos Capítulos 4 e 5. O experimento envolveu a classifica^áo de duas di stribu ipóes gaussianas
superponías rotuladas como 1 (classe^) e 2 (Classe j. Os gráficos de espalhamento para estes
Hidden page
Hidden page
Hidden page
Hidden page
Como anteriormente, assume-se que <p .1 \) - 1. de Corma que w _ representa o bias b. A questáo a ser
resolvída c minimizara risco empírico
'* -I
(6.48}
sujeito á desigualdade
I W||J £ cü
(6.49)
onde crüé uma consiantc. A funpáo de perda insensível a t, é definida como ante nórmenle
na Eq. (6.45). Podemos reformular este problema do olim izaban restrito introduziindo dois conjun-
tos de variíhvjjsaltas náo-negativas e tlIJC s^° definidas como:
í/j-w^x) < t-r^ í»l,21...iy 16.50}
< e + i = l, 2, .... JV (6.51)
^>0, f- 1,2,...,-V (6.52)
?f>0, < = l,2 N (6.53)
As variareis soltas e descrevem a funíáú de perda insensívcl a « definida na Eq. (6.45). Este
problema de otimizacáo restrito pode ser, portantn, visto como equivalente ao da minimizado do
funcional de custo
O(w4$) = rr¿(^ + <f)
l r
+ - w w
2
(6.54)
sujeita as restribes das Eqs, (6.5C) a (h;53). Incorporando o termo wrw/2 no funcional d>(w. ^')
da Eq. (6.54), dispensamos a ncccssidadc da rcstriQáodadesigualdade da Eq.(6.49). A constante C
na Eq. (6.54) é um parámetro especificado pelo usiiArio. Conscqiicntcmcnte^ podemos definir a
fun^áo lagrangiana:
jr | *
4w.^1aT0c\Y1Y') = C^(4 +^) + -wrw - Ja )_*/.+€+^.'
J-l * 1*1
.V
l-l
-I(YÁ, + ?a
í-l
(6.55)
Hidden page
Hidden page
Hidden page
ría do problema de prograjnaqáo quadrática cresce com o quadrado do tamanho da amostra de
trcinamcnio. ConscqücnicmcntCj cm aplicantes da vida real que podem envolver varios militares de
pontos de dados, o problema de programado quadrállca nío pode ser resolvido pelo uso direto de
uma biblioteca comercial para otimiza^áo. Osuna ct al. (1997) desenvolverán um algoritmo de
dccnmposiqao original que realiza a olimizaijao resol vendo uma seqüenria de subpreblcmas muito
menores. Em particular, o algoritmo dedecomposii^o lira proveito dos coeficientes dos vetores de
suporte que esláo ativos cm ambos os lados de suas froniciras definidas por a-Oea = C. Elcs
relatara que o algoritmo de decompositSa tem um desempenho satisfatórlo em aplicares com
100. WO pontos de dados.
Em termos de tempo de execu^áo, as máquinas de vetoe de suporte sao atualmcrttc mais lentas
que cutías redes neurais ip.cx., perceptrons de múltiplas camadas tremados com o algoritmo do
rctroprnpagacáo} para um desempenho de generalizado similar. Há duas razües para este compor-
tamento mais lenio:
l. Nao há controle sobre o número de pontos de dados sclccionados pelo algoritmo de aprendíza-
gem para serem usados como vetores de suporte.
2r Nao há meios para incorporar conhecimento previo sobre a larefa em questáo no projelo da
máquina de aprendizagem.
Agora discutiremos brevemente algumas modificares da máquina de vetor de suporte com o illtui-
to de tratar destas deficiencias.
A questáo de como controlar a sclctjao de vetores de suporte c difícil, particularmente quando
os padrees a scrcm elassificados sáo n3o-separáve¡s e os dados de treinamento sao ruidosos. Em
geral, as tentativas de remover erras can heridos do* dadas antes da treinamento ou de removc-las
da expansáo após o treinamento nao daráo o mesmo h pcrplano ótimo, porque os erres sao nccessá-
rio* para penalizar a nán-separabilidade. Em Osuna c Giros! (1998), fin investigado o problema da
reducto do tempo de rxucuqáo de uma máquina dt vetor de suporte para classifica^áo de padrees.
Duas aberdagens ¡novadoras para o f ralamente deste problema sáo descritas:
• A própria máquina de vetor de suporte c usada como uma ferramenta para regressiEo náo-
lincar para aproximar a superficie de dccisac (separando as classes) com uma precisan
especificada pelo usuario.
* O proccdimcnto para treinar a máquina de veEor de suporte ó rcformulado para producir
exatamente a mesma superficie de decisia, utilizando um menor número de fuñados de
base.
Na primo ira abordagetn, a soluto é simplificada aproximando-a por uma combinarán linear de um
.iubcüfijatitty das fun^ocs de base. A máquina resultante e uma extensáo natural da máquina de vetor
de suporte para aproximado de tunean. Esta extensáo c proj ciada para encontrar o mi tilmo de um
funcional de custo da seguirte formal
=¿ rf, - FM,
2L
onde F( ) é uma funcáo aproximativa, ib(')^ unfl funcional de suavizarán e|x|( é a funche de custo
instes ívcl a t definida por
Hidden page
NOTAS E REFERÉNCIAS
1, Seja (fl un subconjunft} de R’’. Diz-se que o subconjunto c comr.vo se
cít i (I - d) i' c para todo (x, 1} e *8 c ft e [0, I ]
Diz-se que urna tundióJt 't —► R é uma convexa se
/crjt - (1 -ct).r) < -ajfly) para todo (jr,F)ef¿ e ere [0,1]
2. Sendo a complcxidadc computa r.onal a quisto de interesse, podemos identificar duas
clases de algoritmos:
• Algoritmos tit- tempo polinomieth que raquercm um lempo de cxccu^ao que c uma
funcao polinomial do tamanhodo problema. Por exemplo, o algoritmo da transforma-
da rápida de Fouricr (FFL/uv íbrtrár /hon^bnnXusual mcnlc cmprcgado para análi-
se espedía L 4 um algoritmo de tempo polinomial pois reqtier um tempo de execu^áo
da ordem de wlogw, onde n c uma medida do tamanho d<i problema-
• Algoritmos lempa exponencial. que requeren] uiü tempo de ex.ee u^áo que é urna
funcáo exponencial do tamanho do problema. Por exemplo, um algoritmo de lempo
exponencial pude Levar um tempo 2', onde n é uma medida do tamanho do problema.
Com base nisso, podemos vct os algoritmos de tempo polinomial como algoriimos 'efici-
entes" o os. ai.i'üriimofi de lempo exponencial como algoritmos “ijwfic ¡entes"
Há mu । ios problemas compulacionais que aparecen] na prfttitai, para os quais nenhum
algoritmo eficiente pode ser encontrado. Diz-se que mu ¡tos. senáo lodos, estes problemas
aparcnicmcnic iírtralávtis pcrlencem a uma classette problemas referida como problemas
^completas. O termo 'NPH significa “náodctcnninisticamcnlcpolinomial”.
Para uma discussst) nu i < detalhada sobre problemas NP completos. veaConk (1971).
Garey e Johnson (1979) e Gormen el al. (1990).
3, A idcia de um núcleo de produto inlcmo foi usada primeiramente por Aizcrman ct Sil
(1964a, 19Mb) na formuladlo do método das fundóos de potencial, que é o percursor das
reden de fundarj de base radial. Ao mesmo tempo, Vapr.ik e Cheryonenkéi (19651 desen-
volveren! a ideia de um hiperplano ¿timo. O uw combinatlu destes dois poderosos concci-
tos na formuladlo da máquina de veiordc suporte foi proposto porVapmk e co autores em
1992; veja Boscr. Guyon e Vapnik (1992) eCoctes tVapnik (1995). Uma anal irse matemá-
tica completa da máquina de vetor de suporte foi pninr ramentedescritaem Vapnik (1995)
e íiubscquEntemente em uma forma n: u i $ expandida em Vapnik (199R).
4. A teoría minimax de Hubcr c bascada cm víziuhan^as que náo sao globais cm virtude de
excluirem distribui^des ass -nétricas. Apesar disso, esta tecn ia trata com sucesso de ama
grande parte da eslatisriea tradicional, particularmente a regressáo.
5- Em Sehinrnars (1997). o uso de program acáo I i ncar c explorado adotando-sc a norma £ ,
w |r no lugar da norma |*¡|,. que c usada cm máquinas de vcior de suporte. A norma
£, do vcior peso w c definida por
l*l!i = 5>r|
onde ir é o j -éslmo elemento de w. Aparentemente, a class ¡ i icario pormargem máxima
usando a norma f., lem um víéh em direcaa a hiperplanos com oricntacócs axtas, istoé, em
direcáo a vetores de peso com poucos elementos diferentes de aero.
6. Afr bibliotecas comerciáis para programacáo quadratica incluem:
• MINOS5A: i Murlagli e Saundera. 1978)
• IhSSOL (Gilí eral-, 1986)
• LOQO (Vandcrbei, 1994)
• QPOPT e 5QOPT (Gilí e Munwy; 1991)
Máquinas de V ltor de. 5.; i k i i 381
PROBLEMAS
Hiperplano de separado étimo
6.1 Considere o case de um hiperplano paro padróes Linearmente separávds, que c definido
pela cquic&)
wri +1 = 0
ande w representa O velar peso, i'? representa o hias e x representa o vetor de enlrada. Diz-
sc que o hipcrplaiKi corresponde a umjwr cofflÑiréa {w, ¿) se, para o conjunto de padróes
de entrada {i |t for satisfeita a exigencia adiciona]
min |wJx +i|= ]
J 1
Mostré que cala exigencia causa uma margem de separa^ao entre as duas classes igual a 2f
11*1 •
6.2 Ju.stifique .i wguinte afirma, .i-. । no contexto Jj padróes nao-sepa rávn i;; classi"Ica^ao
inconeia implica náti-separahil idade de pftdrúes, mas o centrino tiño é ncccssariamcntc
verdadeiro.
6.3 Come cando com o problema primordial para a o:imizafáo do hiperplano do separado
para padróes ndo-separavri!^ Tonnule o problema dual cumi) descrito na Se^au 6.3.
6.4 Méate problema, exploramos o “método dtixe um de fora"1, disculido no Capilulo 4, para
estimar o erro de teste esperado produzido por um hiperplano étimo para o caso de pa*
dróts niiT-sépa.rávéi-i. Discuta lis varias pr^sibilidadex que podem Sürg:r raí usó de Ate mé-
todo pela d un i nació de um padrau qu Jqucrdfi amostra de (n.1 inamento c construindo uma
soluto baaeada nos padróes restantes.
6-5 A lociilizí^áo do hiperplano lirmri no espado- de dados é determinada pelos pontos de
dados sclcc¡onados como vetores de suporto. Seos dados forem ruidosos, a primeira reacio
pedería ser questiiinar a mbuíílez da margem de KpWSfiO i presenta de ruido. Contudo.
um estado cuidadoso do hiperplano ót mo revela que a margem de sépamelo c realmente
robusta a ruido. Discuta a razao para este coinportamenlo robusto.
Núcleo de produto Interno
h.6 O núckxi de produto intemo K(i, i) í calculado sübte urna amostra de treinamento T de
tamanho A'", produzindo a matriz iV-por- Ni
K=U;f
ftiirig K^V -. ). A mairi/ K ¿ pMili^i. ¡:-. qui: todos OS MtiB elementos tém valores
positivos. Ufando a transformrcao de similaridadc:
KQAQr
onde A é uma mRtrfz diajpmal de auluvalores c Q c uma matriz constituida dos autovetores
correspondentes, formule uma expresslo para o núcleo de produto interno Mx., i) em
termos dos autovalorcs o dos aulovetom da mstri/- K. Que conclusoes vocc pode tirar
desta repnesentaQio?
6.7 (a) Prove a fiFüprivdadc' de inwit iátjciü uHitáriu de núcleo de produto interno A l k, x
isto é,
= A(Qk, Qi)
Hidden page
Hidden page
de base radial, constma o hiperplano ótimo c identifique os vetores de suporte para este
conjunto de dados.
fij 5 O experimento computacional descrito na Se(3o 6.6 foi para a classifícafto de duas dis-
tribuiQócs gaussianas superpostas. O seguidle pajamciru de “regularizado" foi usado na-
quele experimento: C 0,1. A largura comum das fiuiffles de base radial usadas para
construiros núcleos deproduto intemo foi o? "4. Repíta o experimento computacional
descrito naquela se^áo para os dots valores seguintes do parámetro de regularizado;
(s) C-0,05
(b) C=0,2
Comente os scus resultados com base ñas considcra^ócs relatadas na Scijao 6.í>
6.16 Ao aplicar as redes de fiintjáo de base radial a problemas de rcgressáo mío-linear,
frcqücntcmcntc constatamos que o uso de uma fundan de base nao-localizada como a
cnuliiquÁdrica resulta em uma solu^to mais precisa que o uso de uma furrio de base
localizada como a fun^áo gaussiana. Podc-sc conjeturar que uma situado similar surge no
caso das máquinas de vetor de suporte, porque o uso de uma máquina de aprendizagem
polinumial (ilimitada) pode se mostrar nute precia que uma maquina de funqao de base
radial (limitada). Usando um experimento computacional em um problema de regnessáo
náo-1 incar, explore a validado desta conjetura.
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
FIGURA 7.4 DesHinpenho da
erro conMduai do algoritmo
AdaBoost
N liiiicm <k ilrrji,vcs de rcíiH^Li
ser novamente enfatizado que a análise de margem aprcscntada cm Schapirc ct al. {1997) c especi-
fica para o AdaBoost c nao se aplica a cutres digerí Irnos de reforjo.
7.5 EXPERIMENTO COMPUTACIONAL II
Neste experimente, explorarnos o algoritmo de reforcé por fíltragem para resolver uma (arela de
dastificafflo de padrees razoavelmente difíci I. O problema de classifica^ao c bidimensionak cnvol-
vendo regióos de decisáo nao-convexas, como mostrado na Fig. 7.5. Uma elasse de padrees consisto
de ponfos de dados que se encontrara dentro da regiáo rotulada como 'í ea outra classe de padrees
consiste de pontos de dados dentro da regido rotulada como f€r Ü objetivo é projetar uma máquina
de comité que decida se um padrao de teste pertence á classe % ou a clpsse
A máqu ina de comité usada para solucionar este problema consi slc de tres especialistas. Cada
especialisla consiste de um perceptron de múltiplas camadas 2-5-2 que tem dais nós de entrada,
cinco neurónios, ocultos edois neurónios de salda. Foi usado o algoritmo de retroprapaga^áo para
realizar o treinamento. A Figura 7.6 moscra gráficos de espalhamcnto dos dados usados para treinar
Os trés especialistas. Os dados mostradas na Fig. 7.6a forani usados para treinar o especialista 1.
Os dados mostrados na Fig. 7.6b foram filtrados pelo especialista I apos seu treinamento estar
concluido; este conjunto de dados foi usado para treinar o especialista 2. Os dados mostrados na
Fig. 7.6c foram filtrados pela combinada dos especialistas I e 2; este conjunto de dados foi
usado para (reinar o especialista 3. O tamanho da amostra de treinamento para cada especialista foi
jV = 1000 padrees. Examinando estas tres figuras, observamos quci
* Os dados de treinamento para o especialista 1 na Fig. 7.6a sao uniformemente distribuidos,
• Os dados de treinamento para o espec i a 1 ista 2 na Fig. 7.6b ex ¡bem concentrares de pontos
de dados ñas áreas A e B que sao aparentemente dificcis de scrcm clarificados pelo primei-
FIGURA 7.5 ConliguraGóéS.
de padróes para q experimenta
sabré reforjo
(c)
FIGURA 7.6 Grálitos de ospalnamento pam o ireinamenio de especial, sias no experimento compulacJocal sobre
retarvü (a) Especialista 1- (b) Especialista 2. (c) Especialista 3
40Ü REOS N CURAIS
ro especialista. O número de pontos de dados fiestas duas regides é igual ao número dos
pontos dassificados carrctamcnte.
• Os dados de treinamento para o especialista 3 na Fig. 7.6c exibem uma conten tramito aínda
maior de pontos de dados aparentemente di Roéis de serem classificados por ambos os espe-
cialistas 1 c2.
As Figuras 7.7a, 7.7b e 7.7c mostram as fronteiras de deeisáo formadas pelos especialistas lt 2 c 3,
respectivamente. A Figura 7.7d mostra a fronteira de decisao global formada pela a^o combinada
de todos os tres especialistas, que c obtida simplesmente pela soma de suas saidas individuáis. Note
que a difcnznfa entre as nepiúes de decisSo das figs. 1.7a e 7.7b relativas aos especialistas I c 2
define adistribuifáo de pontos de dados da Fig. 7.6c usada para treinar o especulóla 3.
FIGURA 7.7 Franteiras de tfecisáD fermgdes pelos diferentes especialistas no 8Mp&rimentó sobre rafbe^p. (a) Espe-
cialista 1. {t>> Especialista 2. (c) Especialista 3 (d) Máquina de cemita inl&ira
As probabilidades de elassiílca^io cerreta para os tres especialistas sobre os dados de teste
foram:
Especialista 1: 75J5 pórtenlo
Especialista 2: 71,44 pórtenlo
Especialista 3; 6^ ,90 por coito
A probabi] idade global de classifieaciio córrela para a máquina de comí le intvira foi de 91,79 por
eento, que foi calculada usando 32.000 padróes de dados de teste- A frontera de decisáo global
construida pelo algoritmo de reforjo para os tres especialistas mostrada na Fig. 7.7d c uma eviden-
cia a mais dcstc bom desempenho de classi lica^áo.
7.6 MODELO DE MISTURA GAUSSIANO ASSOCIATIVO
Na segunda parte do capítulo, combando com esta ScQta, cstudamos a segunda classe de máquinas
de comité, ou seja as cstruluras dinámicas. O termo “dinámica*’ é usado aquí no sentido de que a
integrarán do conhecimonto adquirido pelos especialistas c realizada sob a aqáo do sinal de entrada.
Para comcfar a discussao, considere uma rede modular na qual o processo de aprendizagem
acontece fundindo de um modo suave as formas auto-organizada c supervisionada. Os especialistas
técnicamente realizara aprendizagem supervisionada na medida em que as suas saidas indh kluais
sáo combinadas para modelar a resposta desojada. Pcrcchc-sc. entretanto, que os especia lisias estáo
tambem realizando aprendizagem auto-organizada: isto c, cíes se auto-organizam para encontrar
um boa pariicao do espapo de entrada de modo que cada especialista modele bem seu próprio
subespapo, e como grupo modelara bom o espado de entrada.
No esquema de aprendizagem rccem-descrito, há um ponlo de afastamcnlo dos esquemas
considerados nos tres capítulos anteriores no qual se assumc um modelo específico para a gera^áo
de dados de treinamento.
Modelo Probabilísimo de Gera^fto
Para fíxaras ideias, considere um problema de regresróo no qual um velor de regressáo x pruduz
urna reposta representada pela variável aleatoria D; uma realizaqao desta variavcl aleatoria c repre-
sentada por d. Sera penda de general idade, adatamos uma furnia escalar de rugrcssáo, meramente
para simplificara apresenta^áo. Específicamente, assum irnos que a gerafáo da resposia égover-
nada pelo seguinte modelo probabilisticn (Jordán e Jacobs, 1995):
1, Um vetor de entrada x ¿ escolhidn aleatoriamente de urna distribuirán previa.
2, I Jifia regra particular, digacnos a regra A, é sel i>c Loimda de aCordo cora a probabi 1 i tladc condi-
cional F(t|x. dado i e um vetor de parámetros a101.
3. Para a regra “ 1,2,..., A’, a reí posta do modelo d é linear em x. com um erro aditivo t(
modelado como uma variávcl aleatoria com distribuíi^áo gaussiana com media zcro c variáncia
unilán:i;
Mí,] “0 para lodo A (7.17)
e
varfe¡J = 1 para todo k (7.1 &)
Em relajo ao ponto 3. a suposi^ao da variáncia unitaria ó feita apenas por simplicidade didatica.
Em geral, cada especialista tem uma variáncia de saida diferente que pode ser aprendida dos dados
de treinamento.
A geracao probabil feúca de D c determinada pela probabilidade condiciona! = d 1x, w1¡t")
dado x c um vetor de parámetros w*/", para k = 1,2,...,K. Náo exigimos que o modelo probabilistico
de gerafño aquí descrito de va ter uma correspondencia dircta com urna reali dade física. Em vez
disso, apenas exigimos que as dccisoes probabilisticas incorporadas ncle rtpresentcm um modelo
abstraía. o qual com precisan incremental especifique a localizapáo da media condicional da rrs-
pojta d em uma variedad*.' nito- linear que relaciona o vetor de entrada á saida media (Jordán, 19941.
De acardo com este modelo, a resposta Z) pode ser gerada de K diferentes modos,
corrcspündendo ás K cscolhas do rótulo A. Assim, a probabilidade condicional de gerar a resposta D
í/, dado O vetor de entrada k, ó igual a
*
P{D = d! = £/>(D = d | x, wf’) /’(*|x, a(í") {7.19}
i-l
onde G1''' é o vcior de parámetros do modelo de gemido representando a comb i i iai;áo de a'"J c {.
O índice Ü em a101 é usado para distinguir os parámetros do modelo de geracao daquclcs do
modelo de mistura de especialistas, considerado a seguir.
Modelo de Mistura de Especialistas
Considere a coniigura^ao de rede da Fig. 7.S, referida como um modelo de mistura de especialistas
Específicamente, consiste de módulos supereisionados chamados de redes de especialis-
tas ou simptesmeníe especialistas, c de uma unidade integradora chamada de rede dcpasnagcm que
desempenha a fun^áo de um mediador entre as redes de especialistas. Assume-se aqui que os dife-
rentes especialistas funcionara melhor cm regí oes ditcTcntcs do espado de entrada de acorde com O
modelo probabil i st i cü de gera^áo descrito, por isso a necessidade da rede de passagem.
Como se assum iu que o problema de regressáo é escalar, cada rede especialista consiste de um
liltro linear. A Fig. 7.9 mostra o gralo de Ouxo de sinal de um único neurónio que constituí o
especialista*. Assim, a saida produzida pelo especialista í é o produto interno do vetor de entrada x
e o vetor peso sináptico w dcstc neurénio, como mostrado por
rt=w[x, A = L2,...rX'
C7.2Ü)
A rede de passageni consiste de urna única camada de K neurónios, com cada neurónio atribuido a
um especialista especifico. A J’i gura 7.1 Oa mostra o grafo arqu iletu ral da rede de passagem c a Fig.
7.10b mostea o grafo de fluxc de si nal do neurónio A daquela rede. Ao contrario dos especialistas, os
neurónios da rede de passagem sao náo-1 incarcs, com suas funches de ativa0o definidas por
_ exp(j<)
seKpí,ip
J-1
*=1,2...K
(7-21)
FIGURA 7-9 Diagrama am blocas do modelo ME; as saídas escalares eos aspeclalistas
sSd mediadas púr uma rede de púSSagsm
FIGURA ?.& Grata de fluno de ai¡nal
de um .jn en neurónio linear que ccnell-
tu 0 especialista k
onde é o produto interno do vetor de entrada x pelo vetor peso sináplico a: isto é,
iit = Afií A = 1,2,...,K
(1.22)
A transformaqáo exponencial "normalizada11 da Eq. (7.21) pode ser vista como uma generalizado
da funqáo logística para múltiplas entradas. Ela preserva a ordem hierárquioa dos seus valores de
entrada e é uma generalizado diferenciável da opemfáo "o vencedor leva tudo” de cscolha do valor
máximo. Por esta razao, a fun^áo dcativaqáo da Eq. (7.21) ó referida como ¿¡ufimax (Bridle, 1990a).
Mole que a dependencia Linear de ut em rela^ao á entrada x toma as saldas da rede de passagem
fun^ocs nao-lineares de x.
Para uma interpretado probabitístioa do papel da rede de passagem> podemos veda como um
“classifícador” que mapeia o vetor de entrada x em probabilidades muitinomiais de modo que os
diferentes especialistas seiño capazos de encontrar a respcsla desojada (Jordán t Jacobs» 1995).
Fl G U RA 7,10 (a) Camada única dft
neurónios síiFlmax púa u rede de
passagom. (b) Grato da lluxo
(K sinal de um neurnnÍD satfrnaji
Mais importante que ¡aso é o fato de que o uso da softmax como a fundan de ativa^ao para a
rede de passagem assegura que estas proba ti kJados satislazcm as seguíales exigencias:
1 para todo A
(7-23)
(7.24)
Considere quej. represente a saida do especialista A- em respasta ao vetor de entrada x. A saida
global do modelo ME ó
K
‘ = L&Z (7.25)
i-l
onde, como sal i catado anteriormente^ k( é urna íun^áo nílo-linear de x. Dado que a regra k do
modelo prnbahi listico seja solee¡onada e que a entrada seja uma saida individual jr. é tratada
como a media condicional da variávcl aleatoria D, como mostrado por
= w(i, * =
(7.26)
Com ii. representando a média condicional de podemos esenever
LJi “ .11, ’ 2.........A'
(7.27)
A varitocia de D é a mestna de erro c. Assim» invocando o uso da Eq. (7,1 8), podemos escrever
var[D|x,*]=l, *=1,2,..,*
(7.28)
Dado o vetor de entrada k e dado que a regra k do modelo prabab dístico de gera^áo (i.e.» o especi-
alista ft) seja selecionada, a funqta de densidade de probabilidade de D pode, portante» ser descrita
como:
1 (
= -rtckP 1
M ¿71 \ ¿ /
Á—1»2, ...,*
(7.29)
onde G é um vetor parámetro que representa os parámetros tanto da rede de passagem como dos
especialistas do modelo ME. A íún^áo densidade de probabilidade de D, dado x, ¿ a mistura das
fundes de densidade de probabilidades »com os parámetros de mistura sendo as pro-
babilidades multinomiais determinadas pela rede de passagem. Podemos entao escrever
l-t
(730)
A distribuifáo de probabi! idade da Eq, (7.30) é denominada um modelo de mistura gaussiano
associaiivü. A sua contrapartida náoassociativa é o modelo de mistura gaussiano tradicional
(Titteringlon et al., 1985; McLachlan e Basford, 1988), que é descrito brevemente no Capitulo 5.
Um modelo associalivo difere de um modelo nlo-associafivo pelo Tato de que as médias condicio-
náis JJh e OS parámetros de mistura g. nao sao finos; cm vez disso» todos clcs sao fun^ocs do vetor de
entrada x. Q modelo de mistura gaussiano da Eq, (7.30) pode assim Str Visto como uma generaliza-
£ao do modelo de mistura gaussiano tradicional.
Os aspectos importantes do modelo ME mostrado na Fig, 7.8, assumindo que estoja adequa-
damenie sintonizado airavés de treinamento, sáo:
1» A saídaj do especialista í fcmccc uma estimativa da média condicional da vanável aleatóriu
que representa a resposta desejada D, dado x e dado que a regra k do modelo probabi Estico de
geragio seja válida.
2. A saída tía rede de passagem. defíne a probabilidade muliinomial que a salda do especialista
* coincida com o valor D = dt bascado no conhceimcnto ganho somente de i.
Trabalhando com a distribuido de probabilidade da Eq. (7.30) e dada a amostra de treinamen-
to {( i.flf j] , o problema c aprender as médias condicionáis J1, = vA c os parámetros de mistura
it L 2,.„t X, de um modo étimo, de forma que f^d |x,6) fome^a uma boa estimativa da
ñin£Ío de densidade de probabilidade relativa ao ambiente responsável pela gcrafác dos dados de
treinamento.
Exemplo 7.1 Superficie de Regreseáo
Considere um modelo ME com dois especialistas c uma rede de pa&sagein com duas saldas repre-
sentadas por gt eg? A saída g c definida por (veja a Eq. (7J21))
expfri)
CXp(w|) + eSpÍN.)
I________
l -i- estpí (Ni-iíj))
(7.31)
Considere que a e a representem dois veiores de pesos da rede de passagera. Podemos cntáo
cscrever
lí = s'a., Jt= l, 2
s-?
e com isso rcscrcvcr a Eq. (731) como:
_______I_________
1+expf xr(»r aJ)
(732)
A outra saída g da rede de passagem é
& =1 -a
=__________i________
l + cxp(-xr(a: -8!»
Assim, g. e g 1em a forma de uma fun^ao logística, mas com uma diferenca. A orientadlo de g c
determinada pela diregao do vetor difercnca (a, - a,). cnquanio que a orientafáo dcg} é determinada
pelo vetor di feren^a (a - n ). que é o negativo daquele para a porta g Ao longo da atvxta definida
por a, = a., temosg. = g2 = 1/2, c os dois especialistas contribucm igualmente para a saida do modelo
M E 1 .onge da aresta, um dos dois cspeci¿l islas assume o papel dominante.
7.7 MODELO DE MISTURA HIERÁRQUICA DE ESPECIALISTAS
O modelo ME da Fig. 7.8 funciona di vid indo-se o espado de entrada em diferentes subespa^os, com
uma única rcdc de passagem rcsponsável pela distribuido da informado (extraída dos dados de
treinamento) para os varios especialistas. O modelo de mistura hieriirqttica de especialistas
ilustrado na Fig. 7.1 L éuma extensáo natural do modelo ME. A ilustrado é para um modelo MHE
de quatro especialistas. A arquitetura do modelo MHE ¿similar a uma cirro re, na qual as redes de
passagem estío cm varios pontos nao-termináis da árvore e os especialistas se encontram nas folhas
da Arvore. O modelo MHE se diferencia do modelo ME na medida em que o espado de entrada ¿
dividido cm conjunte» uninitadosde subespa^os. com a informado sendo combinada eredistribuida
Hidden page
Hidden page
FIGURA 7.12 Árwre tte decsao blnárJa,
dascrila tomo eegue:
+ Nós í s sito descendentes da n6
• Nte f4« í( fifia cfescartcferttes donóle da
rnsuma toma para e /. em re^ác a t,.
• As regras para seleciunar divides em íntermed i arios (i.e,, náo-termináis) da CART desem-
penham um papel análogo ás redes de passagem do modelo MUE.
• Os nós termináis da CART desempenham um papel análogo as redes especia Lisias do mo-
delo MHE.
Comc^ando com a CART para um problema de classifica^&o ou regressáo de interesse, tiramos
vantagem da natureza diseñéis da CART para fomctxr uma busca eficiente entre árvores alternati-
vas. Usando uma árvore assim escolhida como passo de nucía tizado no algoritmo de aprendiza-
gem para estimado de paramemos tiramos vantagem da base probabil istica continua do modelo
MHE para producir urna estimativa “suave” melhorada para a resposta desojada.
O Algoritmo CART
Com base no que foi dito acima, cabe uma breve describo do algoritmo CART. A describo é
apresentada no contexto dcregrcssao. Comeando com os dados de ireinamcnto _|t pode-
mos usar CART para construir uma árvore birlária Tpara regressiü por mínimos quail nidos.. prOcc-
dendo como a seguir (Breiman et al„ 19&4):
L Seie&to de di visees. Considere que um nó t represente um suheonjunto da árvore torrente T-
Considere que </(f) represente a médi.i dos ti para todos os casos (i. d.) que se encontrara
dentro de í, islü é,
(733)
onde a soma é sobre todos os d¡ tais que 1 € t e AV) é o número total de casos em j. Defina
*W = -77X<d(734)
e
= (7.35)
icr
410
Redes Mecíais
Para o nó t, a soma £ (</, - ¡J(f )}J representa a “sonta dos quadrados dentro do nó"; isto é, cía
ó o total dos desvíos quadrados de todos os J em t em relajo ás suas medias d (r). Sainándo-
se estes desvias sobre t £ T resulta a Rama total dos quadrados do nó, e di vid indo-a por A'
produz a media.
Dado um conjunto qualquer de divisdes J de um nó carreóte i em Tt a melhor div¡sio s* é
aqucla di vi sao cm S que mais reduz %(?"). Para sermos mais precisos, supon tía que para qual-
quer divisan s do nó iem ?. (um novo nó i esquerda de f) e t/t (um outro nó novo ii dircita de f)h
íazemos
(736)
A melliar divisito s* é entao estoIh i da como a divisan particular para a qual temos
á'8(,r*,r) = max
(7.37)
Urna árvore de regres sao assim construida c proj otada para maxinuzar a redu^ao dcr£(7).
2. Dcterminítcao de um nó termina/. Um nó- t é declarado um nó terminal se esta condicáo for
salísfeita:
maxATír,#) < |.i
(738)
ande |3 é um determinado l imiar.
3. f.sfíwjíifao por mínimos quadrados dos parámetros de um uó terminal. Comidera que f repre-
sente um nó terminal na final da añore binaria Te que X(/i represente a matriz comporta de
k € t. Considere que d(r) represente o vetor correspondente composto de todos os dt em t.
Defina
w(t)-X*(í)d(0
(7.39)
onde X'{í ; ó a pseudo-inversa da matriz X(r). O usa de w(j) produz uma esli mativa por mínimos
quadrados, de dt,t) na saida do nó terminal i. Usando os pesos calculados da F.q. (739), o proble-
ma du selecto da divisáo ó resoh ido procurando-se a menor soma de residuais ferros) quadra-
dos cm rclaqao as superficies de rcgrcssáo. cm vez de fazer isso cm rclaijáo as medias.
Usando CART para Inic i alizar o Modelo MHE
Suponha que ü algoritmo CART Icnha sido aplicado para um conjunto de dados de treinamento,
resultando em uma árvore de decisáo binaria para esle problema. Podemos descrever uma divi sao
praduzida por CART como uma superficie muíndimensional definida por
+ b = 0
onde x c o vetor de entrada, a representa um vetor parámetro e b representa um bias.
Considere a seguirá siluaíiío correspondente cm um modelo MHE. Do Exemplo 7.1 notamos
que a superficie de Kgpessfio produzida por uma rede de passagem em uma árvore biriária pode ser
expressa como:
___________1________
$ I + cxp(-(arx + &))
que define uma divisáoT particularmente quando g = l.<2. Considere que o vetor peso (diferen^a) a
para esta rede de passagem particular seja escrito como
onde ||a| representa o comprímento (Le.t a norma euclidiana) de a, e a/||a|| é um vetor de compri-
mentó unitario normalizado. Usando a Eq. (7.41) em (7.40^ podemos cntao rescrever uma divisáo
parametrizada por uma rede de passagem como:
l
onde vemos que a/||t|| determina a dinepdo da divi sao e ||a|| determina a sua acuzdade. Da discussao
apresentada no Capitulo 2, observamos que o comprímento do vetor a age efectivamente como o
recíproca da temperatura. O ponto impórtame a notar da Eq. (7.42) é que uma rede de passagem
constituida de um filtro linear seguido por urna forma soñmax de náo-linearidade é capaz de imitar
uma divisáo no estilo de CART. Além disso. temos um grau de liberdade adicional, que ó o vetor
parámetro a. Em uma árvore de decisao padreo, este parametro adicional í irrelevante porque um
limiar (i.e., uma decisáo abrupta) c usado para criar uma di vi sáo. Por nutro lado, o comprímento de
a tem uma influencia profunda na acu idade da divisáo produzida por urna rede de passagem no
modelo MUE. EspcxificamcnicT para um vetor peso sináptíco a de dire0o fixa, podemos afirmar
que:
• quando a é longo (i.e., a temperatura é baixa), a divisüo é abrupta, c
• quando a é curto (i.e., a temperatura c alta), a divisao é suave.
Se no limite tivermos la|| = 0+ a divisao desapareceré e g “ 1/2 em ambos os lados da divisáo
(ficticia), O efeito de se fixar ||a|| = 0 é equivalente a podar o nó nao-terminal da árvore, porque a
rede de passagem em questáo nao divide mais. Mo caso multo extremo quando ||a|| é pequeño (i.e.,
a temperatura é alta) em todo nó nSo-tcrminal, o modelo MHE inteiro age como um único nó; isto
é, o MHE é reduzido a um modelo de regressáo linear (assumindo-se especialistas lineares). Quan-
do os vetores pesos sinápticos da rede de passagem come^am a crescer em comprímento, o MHE
cometa a fazer divisóos (suaves), aumentando com isso o número de graos de liberdade disponfvel
para o modelo.
Podemos assim inicial Izar o MHE proccdendo como mostrado a seguir:
1. Aplique CART aos dados de treinamento.
2. Iguale os vetores pesos sinápticos dos especialistas do modelo MHE as estimativas por míni-
mos quadrados dos vetores parámetros nos nós termináis correspondentes da árvore binária
resultante da aplkacáo de CART.
3. Para as redesde passagem:
(a) fixe os vetores pesos sinápticos de modo a apontarem cm di recaes que sejam ortogonais as
divísóes correspondentes na árvore binária obtida por CART, e
(b) fa^a os com pi । 'Tientos (। .e., normas eud । dianas) dos vetores pesos si nápticos iguais a vetores
aleatorios pequeños
7.9 PROBABILIDADES A PRIOR! E A POSTERIOR!
As probabilidades muJtinonJÍaisgj e g relativas ao primeiro nivel eao segundo nivel das redes de
passagem. respectivamente. podem ser vistas como probabilidades a prtor¡> no sentido de que seus
valores sao dependenles apenas do vetor de entrada (estimulo) x. Oe um modo correspondente,
pódennos definir probabilidades aposferiori Aj e cujos valores dependem tanto do vetor de entra-
da x como das respostas dos especialistas a x. Este último conjunto de probabilidades c útil no
desenvolví memo de algoritmos de aprendizagem para modelos MHE.
Com relajo ao modelo MHE da Fig. 7.11, definimos as probabilidades ap&steriori nos nós
nao-tcmi inu:s da árvorc como (Jordán c Jacobs, 1994):
= -H^r---------Mr--------------v (7-43)
(7.44)
O produla de c h define a pmhahitídpfk'canfUnM apriori para que o cspcc ¡alista fy,á) producá
a saida .v. que coincide com a resposta desejada d, contn dado por
(7.45)
i-i .-i v ¿
A probabilidad^ A satisfaz as duas condeces seguinles
Ü í A £ 1 para todo (Á £)
(7.46)
(7.47)
A implicado da Eq. (7.47) ó que a atribui^áo de crédito entre es especialistas se dá de forma
competitiva. Além disso, notamos da Eq. (7.45) que quanto mais próximo j1L estiver ded, tanto mais
provável que seja atribuida crédito ao especialista (Á i) pela sua saida ter coincidido com d, o que é
intuitivamente razoável.
Uma importante característica do modelo MHE que merece mentfo especial í irecursividade
ñas computantes envolvidas no cálculo das probabilidades apo&iertori. Examinando as Eqs, (7.43)
e (7.44), vemos que o denominador de h„. na Eq. (7.44) aparece no em umerador de h. na Eq. (7.43}.
Em um modelo MHE, desfijamos calcular a probabilidade aposterior! para todo nó nao-terminal da
árvore. É ai que a recursi vidadeé particularmente útil. Específicamente, o cálculo das probabiEda-
des aposteriori de todos os nós n&o-tcrmiríais da árvore c cxccutado em um único passo como aquí
descrito;
• Movendo'se através da árvore em diretfo ao nó raíz, nivel por nivel, a probabilidade a
posteriori em qualquer nó n^a-terminal da árvore é ahí ¡da Mtnplesmente combinándo se as
probabilidades a posteriori de seus “filtros11.
7.10 ESTÍMA$ÁO POR MÁXIMA VE ROS SI MIL HAN (JA
Voltando agora á questáo da estimado paramétrica para o modelo MHE, primeira notamos que a
sua interpretado probabilíslica c um pouco diferente daqucla do modelo ME. Com o modelo MHE
formulado como uma árvore binária, assume-se que o ambiente responsável pela gerafáo dos dados
envolve uma seqüéncia aninhada de decisaes suaves (binarias), terminando na regressao do vetar
de entrada x para a saida d. Em particular» assuni irnos que» no modeío pmbabiiistico de gera^do
para o MHE, as decistes sáo modeladas como variáveis aleatorias multinomiais (Jordán e Jacobs,
1994). Isto A para cada entrada a interpretamos g.(x,8C) como as probabilidades multínamiais as-
sociadas com a pnmeira decisáo, ) como as distribuirte? condicionáis muítinomiais aso-
ciadas com a segunda decisao. Como anteriormente., o índice 0 significa valores reáis dos parametros
do modelo de gera^áo. As decisfies formam uma árvorede decisio. Como no modele ME, útiliza-se
softmax como a funqác de ativa^a das redes de passagem em todo o modelo MHE. Em particular,
a ativaf jfo £. do neurónio de saida k na rede de passagem nomvd superior é definida por
expK)
CXp(M,)+CXp(u?)
(7 48)
onde c a soma ponderada das entradas aplicadas áquele neurómo. Similarmente, a alivafáo do
neurónio de saída/ na rede de passagem á no segundo nivel da hierarquia é definida por
x =__«^)___
Ji cxpfM.J+expfMj,)*
(7,49)
onde w* é a soma panderada das entradas aplicadas a este neurónio particular
Para facilitar a apresenia^áo, traballiarenios com um modelo MHE com apenas dois níveis de
hierarquia (i.e., duas camadas de redes de passagem), como indicado na Fig. 7.11. Como com o
image
not
a va i la ble
(7*54)
O termo ‘'estimativa por máxima verossi mil harija" com as desejadas propriedades assint óticas*
normalmente se refere a uma raíz da equacáo da verossimilhan^a que maximiza globalmcnte a
futido de verossimilhan^a /(B). A estimativa é usada na prática, entretanto, pode serna realidadc
um máximo local e náo um máximo global. De qualquer forma, a estimativa por máxima
vcrcssimilhanca, proposta por Fishcr (1925), c bascada cm uma idéim relativamente simples:
DíjfervFTtt.F papulaedes gerani diferentes anwxlrux de dadas e tjuíriquer a/matra de dados especificada
é mais ptvvávei de ter viada de uma papula^Ho do que de aún as.
Mais específicamente, o vetor parámetro desconhecido B é estimado pelo seu valor maisfilausíve!,
dado o vetor de entrada x, Em outras palavras, a estimativa de máxima verossimilhanpa B é o valor
do vetor parámetro 0 para o qual a fünvao de dengíilade de probabil idade condicional _/yd|JtT 6) é
máxima.
7.11 ESTRATÉGIAS DE APRENDIZAGEM PARA 0 MODELO MHE
A describo probabilEstica do modelo MHE na Sefáo 7.10 nos levou á ñing&o logaritmo da
verossimilhanpa £(6) como a funfáo objetivo a ser maximizada. A questáo crucial é como realizar
esta maxitmza^ac. Como em todo problema de oLimiza^áo, nao ha uma abordagem única para a
maximizafáo de ¿(B). Em vez disso, temos varias abordagens á nossa disposi^áo, duas das quais
sao resumidas aquí (Jacobs e Jordán, 1991; Jordán e Jacobs, 1994);
1. Abordagem do gradiente estocas!ico. Esta abordagem produz um algoritmo para a maximizapao
de ¿(6) em tempo de execufáo- A sua formuLa^iio para um modelo MHE de dois ni veis, como
apresentado na Fig. 7.1l, depende de fórmulas para os seguir,tes ingredientes:
• O vetor gradiente , para □ vetor de pesos sinópticos do especialista lj\ A).
» O vetor gradiente para o velor de pesos sinópticos do neurónio de salda 4 da rede de
passagem do nivel superior.
O velor gradiente 3¿/áa, para o vetor de pesos sinópticos do neurónio de saida da rede de
passagem do segundo nivel associado ao especialista (/, Á).
Podc-se mostrar adianie que (veja o Problema 7.9):
t—- = Aju(w)^(nX^J) - (7*55)
^-= (n) (7-56)
(7.57)
A Equa^ao (7.55) afirma que durante o processo de ireinamenlo os pesos sinápucos do especial ista
(/\ fr) sao ajustados para corrigir o erro entre a saida c a resposla desejada d, em propongo á
probabilidade conjunta ¿?posteriori hjt que o especialista (j, ¿) produza uma saida que coincide com
d. A Fqua<;ao (7.56) afirma que os pesos sinápticos do neurónio de saida A- na rede de passagem do
nivel superior sao ajustados de modo a forjar as probabilidades a priori gt(n) a se moverem em
dirojao as pnobabi h dados ú posteriori correspondentes Ajn), A Equa^to (7-57) afirma que os pesos
sinápticos do neurónio de saída da rede de passagem do segundo nivel associado ao especialista (/,
i) sao ajustados para corrígir o erro entre a probabi I idade apriori.s? .(<r) e a correspondente proba-
billdade upviteríori b ¿m) ein proparí ao á probabilidade aposierwri
De acardo com as Eqs. (7.55) a (7.57), os pesos sinápticos de modelo MHE sao atualizados
após a apresentaijao de cada padrao (estímulo). Samando os vetares gradiente mostrados aquí, em
n, podemos formular a versáo por lote do algoritmo da subida do gradiente para maximizara fuñido
logaritmo de verossitnilhanca /{©?
2. Abtrrdagem da maximi^a^uo do valor aperado. O algoritmo da maximizapit) do valor espera-
do (MEh proposto por Dcmpstcr et al. (1977), tornee c um procedimento iterativo para calcular a
estima0o por máxima verossimilhanca cm situa^ocs ñas quais, cxccio pela falta de alguns dados, a
questáo da estimaL¡cao por máxima Veróssimilhanía á urna questáo ¡mediata. O algoritmo ME deri-
va seu nomo do tato de que cm cada ileraváo do algoritmo há dois passos;
* Opasso do valor esperada ou passo E, que usa o conjunto de dados observados de um
pn&biema de dadas incompletos e a valor corrente do vetor parámetro para produzir dados
de forma a postular um conjunto aumentado ou conjunto de dados completos.
* O passo de mam izando ou passo M. q ue eons isle em derivar uma no va est ima ti va do vetor
parámetro mas i m izando a funjan logaritmo da verossimil lianza dos dados completos pro-
duzidos no passo E.
Assim, partindo de um valor adequáde para 0 vetar parámetro, o passo Eco passo M sao repetidos
alternadamente até a convergencia.
As situantes em que o algoritmo ME é aplicável incluem nao apenas aquelas que enval vem
naturalmente dados incompletos, mas também uma variedade de outras situares ñas quais a falta
do completcza nao ó do todo evidente ou natural para o problema de interesse. Na verdade, o cálculo
da estimativa por máxima vcrossimilhanía é freqüentemente muiitú facilitada formulancfci-o artificial-
mente como um problema de dados incompletos. Isto c feito porque o algoritmo ME é capaz de
explorar a reducida ccmplexidade da csiima^áo por máxima verossinnlhati^a, dado os dados com-
pletos (MeLachlan c Krishnan. 1997). O modelo MHE é um exemplo desse tipo de aplicado. Ncstc
caso, sao introduzidos artificialmente no modelo MHE dados ausentes na formado certas variáveis
indicadoras para facilitar a estimaba o de máxima veross.imillianfa do vetor parámetro desconhegi-
do, como descrito na Se^áo 7,12.
Uma importante característica da modelo MHE, quer ele seja projetado usando a abordagem
do gradiente estocaslico ou o algoritmo ME, aprcscnta-sc de duas formas:
* Cada nsde de passagem do modelo está comi unamente calculando a prabah 11 idade aposteriori
para todo ponto de dado do conjunto de treinamento.
• Osa¡ustesapküadosaospcsossinápticosdoespec:al:staedasredesdepassagcmdn mode-
ln, de urna iteraba para a seguintc, sao fuñados da probabilidade apuster ion assim calcu-
lada e da correspondente probabilidade a priori.
Conscqücntemente^ se urna rede especialista em um nivel mais babeo na árvore falhar em íazer um
bom ajuste dos dados de treinamento na sua vizinhanía local,a superficie de rúgrcssáo (discriminante)
Hidden page
O algoritmo é inie i alisado com um valor inicial U1 do vulor parámetro 0 O passo Eco passo M
sáo entilo repetidos alternadamente de aconto com as Eqs. (7.60) c (7,61), rcspccúvámentC, alé que
a diferenqa entre £( B(iH-l)) c £(0(n)) caía a um valor arbitrariamente pequeño; ueste ponfo a com-
putado é encerrada.
Mote que, após unta itera^áo do algoritmo ME, a Fundo logaritmo da vcrosscmilhanpa para
dados incompletos día diminuí, como mostrado por (veja o Problema 7.10)
£(0(a + l)>£Ó(w)) paran =0,1,2......... (7.62)
A ifiuaIdade normalmente significa que estamos cm um ponto estacíonáfio da funqáo logaritmo da
verossimilhaneE.
7-13 APLICAQÁO DO ALGORITMO ME AO MODELO MHE
Tendn nos familiarizado com o algoritmo ME, estamos agora prontos para resolver o problema da
esfima^áo paramctrica no modelo MHE usando o algoritmo ME.'
Considere qucgj'F cg'1^ representen! as probabilidades mullínomiais (condicionáis) associa-
das com as decisóes lomadas pela rede de passagem k do prime i ro nivel o pela rede de passagem (j.
k) do segundo nivel do modelo MHE da Fig. 7.11. rcspect vamente, quando ele opera com o ejem-
plo i do conjunto de treinamento. Entáo, da Eq. (7.51) vemos fácilmente que o valor correspondente
da fdp condiclonal da vari ¿ve] aleatoria D-, dado o cxcmplo ico vetor parametro B, é dado por
//¿I -¿¿«¡"¿¿y;
< -s* i-i /-i v 2 X
(7 63)
onde y ¡/ c a saída produzida pelo especial isla (f. A) em resposta ao exempío í do conjunto de tre i ñá-
menlo. Assumindo que lodos os A' exemplos comidos no conjunto de treinamento sao cstaiistica^
mente independeníes, podemos formular a fun^áo logaritmo da verossimilhafl^a para o problema
de dados incompletos como segue:
«oj-fog flAUM
(7.64)
Usando a Eq. (7.63) cm (7.64) c ignorando a consiantc -(I ;2)log(2n), podemos escrever
v
í(ff) = £k>g
(7.65)
Para calcular a estimativa por máxima verosslmilhanca de 0, temos que encontrar um ponfo estaci-
onario (Le, um máximo local ou global) de £(61 Infelizmente, a fun^áo logaritmo da vernssimilbanpa
£(6). como definida na Eq. (7.65), nao se presta para osle tipo de cálculo.
Hidden page
Hidden page
Hidden page
projetada para preservar a informado contida nos dados de treinamento. Entretanto, usa uma abor-
dagem de cal xa preta para ajustar urna única fun^áo aas dados, pcrdcndo com isso o cntcndimcnto
do problema. O MUE, representando um tipo dinámico de máquina de comité. é um modela que
representa um compromisso entre esteá dois casos extremos, compartíIhando características co-
muna de ambos. CART c MLP:
* A arquitetura do MU E é similar a da CART, mas difere déla pela parti^áo suave do espado
de entrada, em ve? da partido abrupta.
• O MHE usa uma forma aninhada de nao-linearidade similar a do MLP, mas náo com o
propósito de realizar o mapeamento de entrada-saida, mas sim para partictonar o espado de
entrada.
Ncslc capitulo, enfatizamos o uso de duas fcrTarncnlas para u projeto de um modelo MHE:
• CART como a base arquitctural para tratar do problema da seleQáo do modelo.
• O a I goritmo ME para resol ver o problema da estimaban paramcErica pela compútatelo i t erad va
das estimativas por máxima verossimilhanca dos parámetros do modelo.
Normalmente pode-segarani ir que o algoritmo ME se mova de forma ascendíate em vcnossimilharija.
Assim, usando CART para inicial izar o algoritmo ME na forma descrita na SeQáo 7-8, podemos
esperar que n algoritmo ME praduza um mcihordcscmpcnho do generalizaban do que seria possí-
vcl com a condicáo inicial cstabclec.Ja por CART.
O algoritmo ME é importante e fundamental se a aplicado de inieresse for de estimado por
m&xima verossimilhanía, como no caso de ffloc/efJcjgtffn- lima aplicadlo mteressanlede modelagem
c descrita cm Jacobs, lardan c Barto (1991 b), onde um modelo ME c (reinado pana realizar a tarefa
"O quefonde\ hlesta tarefa. deseja-se que o modelo determine o que um objeto c c onde cíe está no
campo visual. Dois especia listas foram usados no estudo, cada um sendo especializado cm um
aspecto da tarefa. I’ara uma entrada especifica, ambos os especialistas geram saldas. Entilo, a rede
de passagem decide a mistura aprepriada para aqueta entrada. Os bons resultados relatados por
Jacobs et al. demonstrara que e pGSSÍvel que uma atribuido de tarefa seja determinada de forma
inata, náo com base na tarefa em si. mas pela coincidencia eiure as necessidades da tarefa e as
propriedades computacional3 do modelo (Elman el al-, 1996).
Concluimos esta discussáo retomando á outra elasse de máquinas de comitc cstudada na pri-
me ira parte do capitulo. Enquanto o modelo ME ou o modelo MHE se basciam no uso de redesde
passagem ativadas pelo sinal de entrada para fundir o conhecimento adquirido pelos diversos espe-
cialistas do modelo, uma máquina de comité, bascada no uso da medía de ensamble ou, alternativa-
mente. de reforjo, se bascia no próprio algor itmo de aprendizagem para real izara integracao, como
resumido a seguir:
1. A media de cnscmblc melhora o desempenbo em relajo a enes de um modo cngcntiosc pelo
uso combinado dedoi- efeitos:
Rcducáo de erro de^ i do a bias pelo n । usté ©í cessivo propos i la I dos especia li slas ind i vidual s
d:i máquina de comité.
• Redujo de erro devído á var ilncia pelo uso de diferentes condi^bes iniciáis no tremamen-
to dos especialistas individuáis e entáo calculando a média de ensemblc de suas saidas.
1. () reforto melhora o desempenho cm rclafáo a erros de uma forma engenhosa particular. Ncstc
caso, exige-se que os especialistas individuáis tenham um desempenho um perneo melhor que a
estimativa alealúrra. A aprendizagem traca dos especialistas é convertida em aprendizagem
forte, e assim o erro da máquina de vomite loma-sc arbitrariamente pequeño. Esta notável con-
versáü é realizada pela fíltragem da distribuidlo dos dados de entrada de forma que os modelos
de aprendízagem fiaca (i.t., os especmlistas) evenlualTtienie aprendam a distribiiicfo inteira, ou
por amoxtragem repetida dos exewplos de treinamento de acardo com uma certa disti i huíalo
de probabilidade como no AdaBoost A vantagcm do AdaBoosl sobre o reforjo por filíragcm c
que ele trabalha com uma amostra de treinarrLenlo de tamanho fizo.
NOTAS E REFERENCIAS
1. Qs méludftx par media de ensembie sáo discutidos Bill Pemone {19931, onde urna estlenta
bibliografía sobre este assunto é incluida- Outras referencias sobre este assunto inclucm
Wolpen (1992) e Hashem (1997).
2. O uso da méd ia de enscmblc para o projeto de uma máquina de comité com um conjunto
de ditérenles conduces iniciáis foi sugerido por virios usuários de redes neurais. Entre-
tanto, a análise estatísdea apresentada cm NafUly ct al- (1997) c n procedimento lá
descrito para treinar uma máquina de comité projetada por media de ensembia sobre o
espado das rondices iniciáis parece ser a primtira do seu género Naquele artigo, sao
apresentados resultados experimentáis bascados nos dados de manchas solares e em
dados de competido para previ-sio de energía. Em ambos Os casos, ó demonstrada uma
redu^áo significativa da variáncia tomando a media sobre o espado de condifócs inici-
áis.
De acardo com Naftaly et al. (1997), o uso de rcstri$3es de treinamenln populares
corno o dccaimenlo de pesos e a parada anlecipada ftiíp é recomendado no pnojeto de urna
máquina de comité por média de ensembie sobre o espado de condufóci iniciáis.
3. As referencias principáis sobre a teoría de reforjo e estudos experimentáis relacionados,
mais ou menos Cm ordem cronológica, s8o: Schapire (1990), Drucker et al. (1993, 1994),
Freund( 1995), Breiman (1996b), Freund c Schapire (1996a, 1996b, 1997), Schapirc(1997)
c Schapire ct ai. (1997). As primaras referencias sobre as tris abonlagens básicas de refar-
qos3o:
• Fíltragem! Schapire (1990)
* Amostragcm repelida; Freund c Schapire (1996a)
« PonderajQáo: Freund (1995)
4 A idéia de usar uma mistura de especialistas para realizar urna fun^áo de mapearocniu
complexa foi primeiro discutida por Jacobs, Jordán, Nowlan c Hinton no seu artigo de
1991a O desenvylvimetilo deste modelo foi motivado por (i) urna preposta descrita em
Nowlan (1990), vendo a adapla^áo competitiva na aprendizagem nao-supervisionada como
uma tentativa de ajustar uma mistura de dislribui^Ses de probabilidade simples (tais como
gaussianas) a um conjunto de pontos de dado c (2) ideias desenvolvidas na tese de doutO'
rada de Jacobs (1990) usando uma arquitetura modular similar, mas com uma funcáo de
custo diferente.
5+ Os estimadores p<ir máxima vernüsimilhanca lém :dgumas prupriedades desejáveis. Soh
condi0es bastante gerais, as seguí lites propnodades assitrtóíicas podem ser provadas
(Kmenta, 1971):
(I) G.s estimadores por máxima wms!¡imifíii«u;a sao conséjenles. Considere que £(0)
represente a fun^o logaritmo de vcross::nilham?a eque 8r represente um elemento do
vetor parimetro 9 A derivada parcial Si/dfy é denominada uma cortlagem. Dizemos
que um estimador por máxima v era s símil harija é consistente no sentido de que o
valor que o valor de 0jF para o qual a coniagem e idéntica a zero, converge em
probabilidade ao valor verdadeira de & quando o tamanho da amostra usado na esti-
ma$to tende a infinito.
(¡L} Üi e.iiimtiíiores por máxima vcra>similham;a .nín axgititaticofnafe eficiente*. Isto é.
para toda i
onde freo tamanho da amustia, 0, é a estimativa por máxima verossiinilhanfa de
/ io r-ésimo elemento da diagonal da mveraa da matriz de informarán deFinher. A
matriz de informaba de Fisher é delinida por
Ü'L
düjdO,
3^.1
06* J
onde Mé a dimensáo do vetor parámetro 0
(i i i) (Jj ('TfínKKÍWH por máxima vemxximiihain’a xaa a.xxinlüt/cumioHe gMSiiantix. I Sfo é,
quando o tamanho da amostra se aproxima do infinito, cada elemento da estimativa
por máxima vcrcissimilhan^a B mumC urna ilistr/nui^ao gaiuísiana.
ha prálica, constatamos que as propiedades para grandes amostras (i.e.. assinlóticas) dos
estinuóoRS por máxima verossimil lianza sáo válidas para tamañitos de amostras Ar > 50.
6. O an i go de Ncwcomb (L 886), considerando a esl i ma^áo de parámetros de uma m i atura de
duas distribuidles gaussianas un [variadas, parece ser a primcira referencia a um processo
do tipo ME relatada na literatura.
O nomc “algoritmo ME“ foi cimbado por Dempster, l.sind c Rubín no seu artigo
fundamental de 1977. Naquele artigo, foi apresentada pela primeira vez a formulario do
algoritmo ME para calcular estimativas por máxima verossimilhan^ de dados incomple-
jas cm virios niveis de generalidad^.
O primero relato umtkado sobre a teoría, mclodologiiü c aplícameos do algoritmo
M E, sua h istoria e extensoes foi apresentado em forma de 1 i vro por McLachlan e Krishnan
(1997).
7, Sob condi^es razoavelmenlb gemís, os valores do verassimilhanca calculados pelo
algoritmo ME convergem para valores estacionarios. Wu (1983) apresenta um relato dera-
Lhado sobre as prupriedudes. de convergencia do algoritmo ME. Entretanto. O jlgrrilrno
MF tre/N .rfMjMT resulta em um máximo local ou global de funcáo de veroMimilhanfa. No
Capitulo 3 do lino de McLachlan c Krishuan (1997), sáo aprascnlados dois exemplos eni
que isto rufo acontece. Em um exemplo o algoritmo converge para um ponto de sela, e no
outro cxcmplo o algoritmo converge para um miairm? local da fundió de veros&im i Chanca.
8. O algoritmo M E pode tambem tratar a máxima estintardo u puxterían (AtA P) bayesiana
incorporando mftinnaíáci/véi'wr ao vdor parámetro: veja o Problema 7.11, Usando a regra
de Bayes. podemos expressar a fiin^io de densidade de probabilidade puní o vetar parametro
0, dado utn conj nfllci de (ih&erva^ncs X, tomo
40 .)^
Áí1)
Desta relacáo, vemos facilmenie que max¡mirar a densidade apr‘joH/ÍJ(G|x) é equivalente
a maximizar o produlo/^xIB^tflk pois.£(x) é independen te de G. A funfáo densidade de
Hidden page
Hidden page
onde
K(o10(^)=£[hSw1m]
Com isso, mostré que
i(é(n+1j) - ¿(éw)=4-1), ík» ) - c(é(» x éw)
-Ía'(í(»+!),«(-;))-x^é(»Ké(»))]
(b j A desiguafdatfe de Jensen afi rma que se /H c urna ñrngáo convexa e n é uma variável
ateatória,. etitáo
EteM]
onde £ é o operador expectativa; além disso, se ¡v j £ escritamente convexa, cnlao a
igualdade ntsra nelucáu implica que j< = A (y] com probabi hilado l (Covcr cThomas,
1991).
Usando a desígualdade de Janscn, musiré que
K(fl(n+1), é(n)) - K(éoi), fl(Fr)) < 0
Com isso, mostré que a Equa^áo (7,62) é válida para n ” Ü, 1,2,
7.11 O algor i uno ME é facJinente mod i ficíxel para acomodar a máxima escimaiiva aponigripri
(MAP) de um velor parámetro 0. Usando ¡i negra de Rayes, modifique o passo Eco passo
M do algoritmo ME para fomcccr esta estima^áo-
7,12 Para um MHE (reinado com o algoritmo ME e um MLP (reinado com o algor limo de
retroptopaga;&} para fomecer um nivel de desempenbo similar para uma dada larcfa, es-
peraríamos intuítivacnenle que a complex:i.hde do MHE superasse aquela do MLP. Argu-
mente A Pavor Ou contra a plausibilidade desta afirmp^áo-
7J3 Justifique as relajóos entre as varíávcis indicadoras c as probabilidades úposteriori des-
critas ñas Equapfes (7.66) a (7.615).
7.14 A Equa£áo(7.75) descreveos mínimos quudrados ponderados para aocÍTniza?aodas redes
especialistas do modelo MHE da Figura 7.11d assumindo que a resporta despejada d soja
um escalar. Como se modifica «¡ta relajo para o caso de uma resposta desojada
multldimensional?
Hidden page
CAPÍTULO 8
Análise de Componentes Principáis
8.1 INTRODUQÁO
Uma importante caracteríscíica das redes ncurais é a hábil idade que das tem de aprender & partir do
seu ambiente e+ através da aprendizagem, meihorar o desempenho de algum modo. Nos quatro
capitules anteriores, o enfoque foi nos algoritmos para aprendizagem supervisionada, para os quais
um conjunto de alvos de interesse é fomecido por um professor externo. Os alvos tqmam a forma de
um mapeamento de entrada-saida desejado, que a rede deve aproximar. Neste capítulo e nos próxi-
mos trés, escudamos algoritmos pan aprendizagem auto-organizada ou aprendizagem náthsaper-
visionada. O objetivo de um algoritmo para aprendizagem auto-organizada é descobrir padróes
significativos ou características nos dados de entrada c fazer esta dcscobcrta.fem um professor. Para
fazer isto, o algoritmo dispóe de um con junto de regias de natureza íocaf, que o capacitam a apren-
der a calcular um inaptamente de entrada-saida com propiedades desejáveis específicas; o termo
“local" significa que a modificadlo aplicada ao peso sináptico de um neurónio é confinada á vizi-
nhanca ¡mediata daquele neurónio, A modelagem das estruturas de rede usadas para a aprendiza-
gem auto-organizada tiende a seguir as estruturas ncurcbiológicas de uma mancira muito mais ex-
tensa do que na aprendizagem supervisionada. Isto nao deve causar sorpresa, porque o processo de
organizado de rede é fundamental para a organizado do cerebro.
A estrutura de um sistema auto-crganizável podeassumir uma variedade de formas diferentes.
Ela pode, por exemplo, consistir de uma camada de entrada (fonte) e uma camada de saida (de
representado), com conexoes alimentadas para frente da entrada para a saída c concxoes laicrais
entre neurónios na camada de saida, Um outro exemplo é uma rede alimentada adianto com múlti-
plas camadas, na qual a auto-organ izadlo procede na forma de camada por camada. Em ambos os
exemplos, o processo deaprendizagem consiste em modificar repetidamente os pesos sinápticos de
Hidden page
Hidden page
PR []M C í PIO 4. Ordem e estrutura nos padróes de i n formaba representare i nfwma^io redundante
que ó adquirida pela rede ncural na forma de conhecimento» que c um prc-requisítD ncccssArio para
a aprendizagem auto-organizada.
Parte deste conhecimento pode ser obtído por observantes dos parámetros estalístiecs como a mé-
dia* a variare i a c a matriz de corrcla^áo dos dados de entrada.
Os Principios de I a 4 sobre aprendizagem auto-organizada foroecem a base neurobiológica
para os algoritmos adaptad vos para a anal i se de componentes principáis neste capítulo e para O
mapaauto-organizávcl de Kohonen apresentade no próximo capítulo. Estes principios sáo também
incorporados em mu i tos outros modelos auto-organizados que sáo motivados por considerares
neurobiológicas. Um desses modelos que merece ser mencionado é o mrwte/fl deLinskerdv sistema
visual dos mamíferos (Linskcn 1986).
Aralise de Características Auto-Organizadas
O processamento de informapáo no sistema visual é real izado em esiágios. Em particular» caracte-
rísticas simples como contraste e oríentacao de bordas sáo analizadas nos esiágios iniciáis do siste-
ma, enquanto que características complexas. mais elaboradas sáo analisadas em esiágios mais avan-
zados. A Figura 8.1 mostra a estrutura geral de uma rede modular que se assemclha ao sistema
visual- No modelo de Linskcr os neurónios da rede na Figura 8.1 estilo organizados em camadas
bid i mencionáis, com conextes locáis para frente de uma camada para a segumte. Cada neurónio
recebe informado de um número linrtado de neurónios localizados cm uma repao correspondente
da camada anterior, que constituí o campa receptivo daquele neurónio. Ds campos receptivos da
rede desempenham um papel cruc ial no processo de desenvoh imcnto sináptico parque oles tomam
possivel para neurónios em uma camada responder a espacian das atividades neurais
na camada anterior. Sáo feitas duas prcssuposifdcs de natureza cstrutural:
l .rn:nL
Camada
B
C:rn.i.: i
c
FIGURA fl. 1 Planta de urna rede
modular auto-adaptativa
1* As posif fes das conexfes sinópticas sao fixas para todo o processo de desenvol vimcnto neuronal,
uma vez que cías tenham sido escolhidas.
2. Cada neurónio atua como um combinador linear,
O modelo combina aspectos da modificado sinóptica segundo Hebb com aprendizagem cooperati-
va e competitiva de tal forma que as sai das da rede discriminara ottmamente entre um conjunto de
entradas, com a aprendizagem auto-organizada sendo realizada cm uma forma camada por carna-
da. Isto é, o processo de aprendizagem permite que as propriedades de análise de características
auto-organizadas se desenvolvam totalmente antes de prosseguír para a próxima camada, Em Linsker
(1986);, sao apresentados resultados de simulaba quali cativamente similares as propriedades en-
contradas nos cstágios iniciáis do processamento visual em gatos c macacos. Reconhecendo a natu-
reza altamente complexa do sistema visual, c realmente notável que o modelo simples considerado
por Linsker seja capaz de desenvolver neurónios para análise de características. Nao se espera que
os neurónios para análise de características no sistema visual dos mamíferos se desenvolvam
exatamente da maneira descrita pelo modelo de Linsker. O ponto principal é que tais estruturas
podem ser producidas por urna rede em camadas relativamente simples cujas conexócs sinópticas se
desenvolvere de acordo com a forma hebbiana de aprendizagem.
Nosso interesse primordial neste capítulo, entretanto» se concentra na análise de componentes
principáis e como ela pode ser realizada usando-se sistemas auto-organizóveis bascados na aprendi-
zagem hebbiana.
8.3 ANÁLISE DE COMPONENTES PRINCIPAIS
Um problema comum em reconhecimento estatifico de padrees é a seleqáo das características ou
extra^ao de características. A jefepao de características se refere a um processo no qual um £.rp¿7^o
de dadas c transformado cm um espado de características que» em teoría, tem exatamente a mesma
dimens&c que o espado original de dados. Entretanto, a transformado é projetada de tal forma que
o conjunto de dados pode ser representado por um número reduzido de características “efetivas” e
aínda retar a maioria do conteúdc de informaqao intrínseco dos dados; em outras palavras, o con-
junto de dados sofre uma redundo dedimensionaiidade. Para sernos mais especificas, suponha que
tensarnos um vetor x de dimensáo m e desojemos transmiti-lo usando i números, onde f < m. Se
simplesmente truncamos o vetor x, causaremos um erro médio quadrado igual a soma das varíáncias
dos elementos eliminados de x. Assim, fazemos a seguínte pergunta: existe uma transformado
firíear inversiva T tal que o truncamente de Tx seja ótímo no sentido do erro médio quadrado?
Claramente, a transformado T deve ter a propriedade que aEguns de seus componentes tenham
baixa variáncia. A uriáfáe de contpanenta.'i principáis (também eonhccida como a transformacaa
de Karhunen-Loéve na teoría da comunicacáo) maximiza a laxa de redu^ao da varíáncia e é, portan-
to, a escolha coircta. Neste capítulo, derivarnos algoritmos de aprendizagem bascados na aprendí^
zagem hebbiana que podem realizar análise de componentes principáis1 sobre o vetor de dados de
interesse.
Considere que X represente um veror aleatárin de dimensao m representando o ambiente de
interesse. Assumimos que o vetor aleatórío X tem media zero;
£[X] = 0
onde £ é o operador estatistico valor esperado. Se X tiver uma media nóo-nula, subtraimos a média
antes de prosseguirmos com a análise. Considere que q represente um vetar unitariotambém de
Copyrighted material
Hidden page
Hidden page
(6q}Hq - X(6q)Tq = O
ou equivalentemente,
(WíRq-Xq) (>
Para que valha a candido da Eq. (8.12), é necessário e suficiente ter
Rq-Xq (8.13)
Esta é a equa^ao que gavenia OS vetares unitarios q para es quais a prova de variártela i|j(q} lem
valores extremos.
A Equa^áo (8.13) é reconhecida como o problema do aittovaior\ usualmcntc encontrado na
álgebra linear (Strang, 1980). O problema tem solufdes náo-trh isiii (i.e., q 0)apenas para valores
especiáis de X que sío chamados os aute^aiores da matriz de correlato IR. Os valores assoclados
de q sáo chamados auto veten#, Uma matriz de correlato é caracterizada por autovalores reais
nao-negativos. Os autovetores associados sáo únicos, assumindo que os auto val ores sáo distintos.
Considere que os auto valores da matriz R fft-por-wi sejam representados por Xr XP..,P \ e que os
autovetores associados sejam representados porq ., q,,..., q^, respectivamente. Podemos cntáo es-
OfflW
J-1.2....." (8-14)
Considere que os autovalores correspondentes eslejam afranjados em ordem deereseentc
X, >\> - - >Aiti (8,15)
de forma que X = kmix. Considere que os autovetores assocliados sejam usados para construir uma
matriz jw-por-rfr
Q = [qp q?,, q? . , qj (8 16)
Podemos entao combinar o conjunto de w equa^oes representado em (8.14) em uma única equa$5o:
RQ-QA (8.17)
onde A é uma matriz diagonal definida pelos autovalores da man iz R:
A - diag[kp Xy- , X., -. XJ (8.18)
A matriz Q c uma matriz ortogonal (unitaria) no sentido que seus vetores colana (i.e., os autovetores
de R) satisfazcm as candi^aex de orronormatitiade'.
r i'. /='
=|o, <8 I,)
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
onde > Ar
Pan a saida do neuróniotemos o valor limite
limy.(Á)=xr(/í)q. = q.ri(n)
J -
(8.95)
Considere que K(n) represente uma variável aleatória com uma realizado representada pela salda
y.(n). A correlato cruzada entre as variáveis e fyn) em equilibrio ó dada por
WnJE[r/n)rt(fl)] = 4q;X(n)Xr(fl)qJ
=
_í\f * = J
[Q, jt # y
(fc-96)
Assim, podemos afirmar que no equilibrio o algoritmo hebbiano generalizado da Eq. (8.91) atua
como um auío-analisador dos dados de entrada.
Considere que x(n) represente o valor particular do vetor de entrada x(n) para o qual as con-
di^oes limites da Eq. (8.92) sáo satisfeitas para / = i - I. Assim, da forma matricial da Eq. (8.80),
constatamos que no limite
r
i0í)=Xh0i)q(
í-l
(8.97)
Isto significa que dados dois conjuntos de quantidades, os valores limites q , q.-.-j q. dos vetores de
pesos sinápticos dos neurónios na rede alimentada adianto da Fig. 8.5 e as saidas correspondentes
y(n), podemos entáo construir urna estimativa linear de ttiínimos cuadrados i (a) do
vetor de entrada x(n). De fato, a fórmula da Eq. (8.97) pode ser vista como uma fórmula para
reconstruido de dados, como mostrado na Fig 8.8 Note que, com base na discussao apresentada
na Sefío 8.5, este método de reconstruyo de dados está su ¡cito a um vetor de erro de aproximarán
que é ortogonal á estimativa x(n).
FISURA a.S Represe nlHQáa por pala
de fluxú da sinal da coma 4 calculado o
veior rwonstmíiio i
Resumo do AHG
Os cálculos envolvidos no algoritmo hebbiano generalizado (AHG) sáo simples; podem ser resumi-
dos como segue;
z
1. Inicialíze os pesos sinápticos da rede, te , com valores pequeños no tempo n = I. Atribua um
pequeño valor positivo ao parámetro da taxa de aprendizagem q.
Hidden page
FIGURA 8.9 (a) Uma imagem de país usada no experimento de codificado de
imagom. (b) Máscaras 8x8 representando os pesos sinópticos aprendidos peta
AHG. (c) Imagem reconstruida dos pais otitida usando-se as B componentes princi-
páis dominantes som quanlizado (d) Imagem reconstruida dos país com razáo de
compressáo de 15 para 1 usando ouantiza^áo
Para uma variagáo da primcira imagem. aplicamos a seguir o algoritmo hebbiano generalizado
á imagem de uma cena de océano mostrada na Fig. 8.10a. Esta segunda imagem enfatiza a informa’
?áo textura!. A Figura 8.10b mostra as máscaras 8x8 dos pesos sinópticos aprendidos pela rede
procedendo da mesma maneira descrita acima; note a diferenca entre estas máscaras c aquetas da
Fig. 8.9b. A Figura 8.10c mostra a itnagem reconstruida da cena de océano com base ñas 8 compo-
nentes principáis dominantes sem quantiza^áo. Para esludar o efeito da quantiza^áo, as saidas das
primeiras duas máscaras foram quantizadas usando-se 5 bits cada, a tcrccira com 3 bits c as restan-
tes 5 máscaras com 2 bits cada. Assim, foi necessário um total de 23 bits para codificar cada bloco
8 x 8 de pontos, resultando em uma taxa de bits de 0,36 bits por ponto. A Figura 8. lOd mostra a
imagem reconstruida da cena de océano, usando suas próprias máscaras quantizadas na maneira
descrita acima. A razáo de compressáo desta imagem foi de 22 para 1.
Para testar o desempenho de “generalizacao” do algoritmo hebbiano generalizado, finalmente
usamos as máscaras da Fig. 8.9b para dccompor a cena de océano da Fig. 8.1 Oa c entilo aplicamos o
mesmo procedimenfo de quantiza^áo que foi usado para gerar a imagem reconstruida da Fig. 8.1 Od.
Hidden page
O resultado desta. reconstruyo de imagem c mostrado na Fig. 8. lOe com urna razio de compressio
de 22 para l, a mesma que a da Fig. 8. lüd. Enguanto que as imagens reconstruidas ñas Figuras
8. lOd e 8.10e guardam uma concordancia surprccndcntc entre si, podc-sc ver que a Fig. S.IQd
possui uma maior quantidadede informado textura! “verdadeifiT e, portanto, aparenta ser menos
“quadriculada" que a Fig. 8.1 te A razao para este comportamento está nos pesos da rede. Para o
treinamento realizado com as imagens dos país a da cena de océano, os primeiros quatro pesos xáo
muito similares. Entretanto, para a imagem dos país os quatro pesos fináis codifican) informafáo de
borda, mas no caso da cena de océano estes pesos codifican) mformacao textura!. Assim, quando
ocorre a codificado da cena de océano com os pesos do tipo de borda, a reconstruyo dos dados
textvrais é grosseira^ resultando assim uma apariencia quadriculada.
87 ANÁLISE DE COMPONENTES PRINCIPAIS
ADAPTATIVA USANDO INIBIQÁO LATERAL
O algoritmo hebbiano generalizado descrito na sccjo anterior se baseia no uso exclusivo de cone-
xóes para frente para a análise de componentes principáis. Ncsta sc^ao, descreyentes um outro
algoritmo chamado de extracao adaptativa efe? componentes principáis (APEX, adaptive pr incipal
companents extmeliori} (Kung c Diamantaras, 1990, Diamantaras e Kung, 14%), O algoritmo APEX
usa tanto conexfcs para frente como para trás.1 D algoritmo é de natureza iterativa na medida em
que, se fbmcccrmos as prime i ras (/ - I) componentes principáis, a J-ésima componente principal é
fácilmente calculada.
A Figura 8.11 mestra o modelo de rede usado para a derivarán do algoritmo APEX. Como
anteriormente, o vetor de entrada x tem dimensáo m, com suas componentes representadas por x..
x..., Jt^. Assume-se que cada neurónio da rede seja linear. Como mostrado na Fig. 8.11, há na rede
dois tipos de conexóes sinópticas:
FIGURA 8,i 1 Rede com conaxtes para
trtrtte e útnftKÓea laLerais páre a deriva-
do da elgarttmo APEX
Camada
de sai i i
• Conexoes para frente dos nós de entrada para cada neurónio 1,2,cora j < m. As cone-
xocs para frente para o neurónioj sao de particulai interesse: estas conexóes &3o represen-
tadas pelo vetor peso para frente
w.= [w ,(flK “„,(«)]r
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
FIGURA 8.13 lluelr&pgoda ACP por ni.clHo. (a) Espeje de entrada bidintgnrónaJ, mostrando um«Mijunlo<fe pontos
de dados, (b) Espado de características t dimensional, medrando as ¡magens indutidas dos pontos de dados
congregadas cm torno de um aulovstor principal. As linfas tracejadas uniformemente espadadas na parís (b) rapre-
Mntair contornos de pregóos constantes sobre o aulcwtor; os contornos correspondentes sáo nío-líneares no
espado de entrada
Para núcleos de produto interno definidos de acordo com o teorema de Mercer, estamos bási-
camente realizando ACP cm um espado de características de dimensáo onde a dimensáo c
um parámetro de projeto. Todas as propiedades da ACP ordinaria que eslió descritas na Sofito 8,3
ccrntinuam valcndo para a ACP por núcleo. Em particular, a ACP por núcleo é linear no espado de
características, mas náo-linear no espade de entrada. Assim, ela pode ser aplicada a todos aqueles
demímos onde a ACP ordinaria tem sido usada para extrajo de características ou reduqáo de da-
dos, para os quais a extensas nao-linear fafa sentido.
No Capitulo 6, apmentamos írés métodos para construir núcleos de produto interno que fo-
ram bascados no uso de polinomios, fonjes de base radial e fúnfúes hiperbólicas; veja a Tabela
6.1. A questáo de como sdccionar o núcleo mais adoquado para uma dada tarcfa (i.e., o espado de
características apropriado) é um problema em aberto(Schdlkopf, 1997).
Resumo de ACP por Núcleo
1. Dados os exemplos de treinamento {* , calcule a matriz por núc leo tf-por-N, K = {X (x.,x, 1!,
onde
X(x.,x.) -«xJfOp
2. Resol va o problema de autovalon
Ka = Xa
onde A é um autovalor da matriz de núcleo K c OI é o autovetor associado.
3+ Norraalize os autovetores assim calculados esigindo que
afo-jU k = 1,2,.-,/)
476 Redes Neurais
onde A c o menor auto valor diferente de zcro da matriz K. assitiTiindo que os autova lores
J*
estejam afranjados em ordem dccrcsccnte.
4. Para a extrajo das componentes principáis de um ponto de teste it calcule as projef fies
4t-qfc(x)
=t=i^,p
?-1
onde f é o j-ésimo elemento do autovetor a .
Exemplo 8.3
Para fomcccT um& cfmip'rwnsio intuitiva sobre a opera^íit da ACP por núcleo, mostramos na Fig. 3.14 os
resultados de utn experimento simples descrito cm Schólkopf d al. (1998). Os dados bidimensionats. consis-
tindo de componentes c.x,. usados neste experimento foram geradoi cuma segué: os valores x, tem uma
distribuido uniforme no intervalo [-1, I]. Os valores x, s3o nao linearmciite relacionados com os valores r,
pela fórmula;
x, = x|] +1?
FIGURA 6.14 Exemplo tridimensional ilustrando a ACP por núcleo. Da
esquetda para a direita, o grao polmomial do núclM é tf = 1, 2, 3. 4. tte
Cima para baixO. sáo mostrados os primeiros tres autovetores np espado
da características. A primeira coluna corresponde A ACP ordinána 0 as
Dutrus tres «lunas cornespondem a ACP por núclsc com gnu polinomial a'
i, 3. a. (FtfiprüduzidO com permissáa do Dr. Klaus-AcUerl Mbller)
onde V é um ruido aditivo gaussiano de media zeno C varidneia 0d04.
Os resultados ds ACP mostrados na Fi^ í. 11 foTftm obtidos usando-se polinomios de núd«:
í(l1Kj)=(XíX.y, ¿=1,2^4
onde d = I corresponde áACP linear, e 2, 3, 4 comeApnitde á ACP por núcleo. A ACP linear, musitada j
esquenia da Fig. 8 14, resulta em apenas dois autovalorcs, pnis a diinensíonalidade do espado de entrada é
dai$. A ACP por núcleo, bq oontrário, permite a extraído de componentes de ordem mais alta, como mostrado
pelos resultados apresentadas ñas colimas 2,3 c 4 da Fig. 8.H, correspondentes ao grau polinomul d = 2, 3,
4, respectivamente- As linfas de contorno mostradas em cada parle da figura {excelo para o auto-valor zero no
caso de ACP Linear) representamos valores principáis constantes (i.c., as proje^des constantes sobre o autovetor
associado com o autevahr cm quescáo).
Com base nos resultados mostrados tía Fig. 8.14. tasemos as seguimos obscrvav&es;
• Como esperado, a ACP linear falha cm fceneoer uma Teprcsenlacáo adecuada dos dados de entrada
n&c-lLneares.
• Em indos o* CMOS, éj prittieira componente principal varia monótonamente ao longo de uma parábola
que passa pelos dados de entrada.
• Na ACP por núcleo, a segunda e a terceira componentes principáis exibem um enmpurtamento que
aparenta ser um tanto similar para diferente-1; valores de grau$ polinomiais d.
• No caso do grao polinornia! d = 2, a tercccra componente principal da ACP por núcleo parece captar
a variáncia divido m> ruido aditivo gaussiano v, Removendo a contribuioío divido a esta componen-
te, estaríamos de futo realizando alguma lumia de redujo de niído-
8,11 RESUMO E DISCUSSÁO
Neste capitulo, apreveníamos elementos sobre a teoría da análise de componentes principáis c o use
de redes neurais para sua implementa^ao. Agora é apropriado refletinnos sobre estes elementos e
perguntarmes: qual é a utilidade da análise de componentes principáis? A resposta a esta questao
depende, é claro, da aplicado de interesse.
Se o objetivo principal c realizar boa eompressao de dados preservando o máximo possívcl de
informacáo sobre as entradas, o uso da anál se de componentes principáis oferece um procedimento
útil de aprendizagem auto-organizada. Aquí notamos do material apresentado na Se^3o 8.3 que o
uso de um método de decomposi?ao em subespa?o hateado ñas "primeiras / componentes princi-
páis” dos dados de entrada fomece um mapeamento Linear, que é ótímo no sentido de que ele
permite a reconsttu^o dos dados de entrada origináis, otimIzando em relajo ao erro médio qua-
drado. Além disso, uma representa^áo baseada ñas pi imeiras I componentes principáis é preferí ve I
frente a uma Tepresenta^ao arbitiária cm subespa^o, porque as componentes principáis dos dados
de entrada sao naturalmente ordenadas em auto valor decrescen te ou, equivalentemente, cm variáncia
deerescente. Conseqúentecnente, podemos otimizar o uso da análise de componentes principáis
para compressao de dados empreñando a maior precuKo em umérica pouhrel para codificar n pri-
mcira componente principal da enltada e progresivamente passando a empregar menor precisáo
para, codificar as / — I componentes restantes.
Urna questito relacionada a isso é a representado de um conjunto de dados constituido de uma
agrega^ao de vários agrúpamelos. Para os agruparnentos serení individualmente visiveis, a separa-
íño entre eles de ve ser maior que o espalfamenio interno dos agrúpamelos. Se acontecer de existir
apenas poucos agnipamentcs no conjunto de dados, cntáo os eixos principáis dominantes encontra-
dos usando a anáiise de componentes principáis tenderá a escolher projeqóes de agrúpamelos com
boas separares, fomecendo assim uma base efetiva para a extraído de camcleríslícas.
Neste último contexto, mencionarnos uma aplicado útil de um analizador de componentes
principáis como opré-prucessadar para uma rede neural supervisionada (p.ex., um perccptron de
múltiplas camadas tresnado com o algonlmt> de retropropagacao). Aquí a motivado ¿ acelerar a
Hidden page
2, Com base na noQito 1, a extracto de uma forma a partir de padróes de sombra é reduzicia ao
problema muito mais simples de estimarán paramétrica em um espado de baixa
dimensionalidade.
Por exempto, a estrutura grosseira da forma de uma cabera humana é invariavelmenle a mesma» no
sentido de que todas as pessoas tém narizes representando protuberancias» órbitas oculares repre-
sentando dcprcssccs, c testas ehochechas representando regí des planas. Esta invariineja sugiere que
qualquer face dada» expressa como r(G»/) cm coordenadas cilindricas, pode ser descrita como a
soma de duas componentes:
dú,/) = rHl(0,n + pte»/)
onde ro(6»0 representa uma cabera media para uma determinada categoría de pessoas (p.ex.» ho-
mens adultos ou mulheres adultas), e p(ü./) representa /wrfur£íici5eff que capturam a identídade de
uma pessoa particular. Típicamente, p(G,0 ¿ pequeño comparado com r0(9»í). Para representar p(9,/),
Atick el al. utilizare a análisc de componentes principáis, na qual as flutua0es sáo representadas
em termos de um conjunto de autcfunqdes (i.e.t a contrapartida bidimensional dos autovetores). Em
Atick et al. (199(5), sao apresenlados resultados demonstrando a hábil idade da abordagem hierar-
quica de dois estágios em recuperar a superficie tridimensional para uma dada pessoa de uma única
imagem bidimensional daquela pessoa.
NOTAS E REFERENCIAS
1. A análisc de componentes principáis (ACP) tal vez seja a técnica mais antiga e mais bem
confío,ida deanálise multivariada(Jolliffe. 1986; Preisendorfer, 1988). Ela foi introduzida
primeiro por Pearson (1901), que a u$Ou cm um contexto biológico para dispor a análise
de rcgressao linear em uma nova forma. Ela foi entáo desenvolvida por Hotelling (1993)
em um trabalho sobre psicomelria. Ela apareceu novamente c independentemente na for-
mulaffiú da teoría das probabilidades, como considerada por Karhunen (1947); e foi gene-
ralizada posteriormente por Locvc (1963).
2. As abordagens seguidas por Ljung (1977) e Kushner e Clark (1978) para cstudar o com-
píjrtamento dinámico de nm algoritmo de aproximacáo estocistica reduzem o problema
ao escudo da dinámica de uma equaeño dilérencial associada. Entretanto, estas duas abor-
dagens sáo fundamentalmente diferentes. A abordagem de Ljung envolve o uso de uma
fundió de Lyapunov, enquanto que a abordagem seguida por Kushner e Clark envolve um
processo de interpolarse linear e invoca o chamado teorema de Arzdá-Ascoli (Dunfbrd c
Schwartz» 1966). A abordagem de Kushner e Clark é seguida cm Diamantaras e Kung
(1996) para estudar a convergencia do auto filtro máximo bastado na aprendizagem
hebbiana. Ai condusóes obeidas al i sáo as mesmas que as obtidas usando a abordagem de
Ljung.
3* Foldiak (1989) expand iu a configurado de rede neural para análise de componentes prin-
cipáis incluindo conexóes real i menudas anti-hcbbianas. A motiva^áo para esta modifica*
qSo foi derivada de um trabalho anterior de Barlow e Foldiak (1989) sobre adaptarán e
eliminacáo de correlato no córtcx visuak al i foi demonstrado que se oü neurónios
interagirem de acordo com uma regra anti-hebbiacia, entilo u uidat dos ocurónios def’
nem um sistema de coordenadas no qual niu há uurrelaeoes mesmo quando os sinais inci-
dentes tenham fortes cnrrelaffies.
O uso de inibicóes lalcrais entre neurónios de saida foi (ambém propostú por Rubner
e Tavan (1989) e Rubncr c Schullen (1990). Entretanto, ao contrário do modelo proposto
4B0 Rrrwh Nfvhak
por Foldiak, a rede lateral considerada por Rubner ct al. nfo é simétricamente conectada.
Em vez di>sn, a rede lateral é hierárquica, com o neurónio i (di gamos) ínibindo tockits os
ñutiTij neurónios no modelo exceto para 1,2.i - I, onde r*= 1,2..
O modeló APEX escudado cm Kung e Diamantaras (I £?£?D) tem b mesma topología de
rede que a do modelo de Rubner ct al.. mas usa a regra de aprendizagem de neurónio único
de Dja (descrita na Se^óo 8.4) para ajustar os pesos sinópticos tanto das conexóes para
frente como das concxócs latcrais do modelo.
4. Uma prova rigorosa da convergencia do algoritmo A PEX, com todos os neurónios tendón-
do a convergir em conjunto, é dada cm Chen e Liu (1992).
5. Para uma discussao de virios modelos neurmü pora análi.He de componentes principáis e
sua comparaíéo, veja O livro do Diamantaras e Kung (1996).
6, Os métodos de ACP nao-lineares, excluindo ACP por núcleo, podem ser agrupados em
tres cImscs (Diamantaras e Kung, 1996):
* Redes hebbúmas. que sáo obtidas substiluindo-sc os ncurón ios lineares nos algoritmos
ACP fraseados na aprendizagem hebbiana por neurdmos nSo-lineares (Karhunen e
foUtKnudOi 1995).
* Redes repticadwas ou wto-codtfkadfirax, que sao construidas em tomo de perceptrons
de múltiplas camadas: as redes replicadoras s:l.t discutirki-; nn Capitulo 4.
• Gnw principad. que sáo tascadas em uma estimafáu iterativa de uma curva ou
superficie que captura a cslrvlura dos dados (Hastie c Stuelzle, 1989). Em Ritler et ai.
(1992) e Cherkasslcy e Mifier (1995), é mostrado que o mapa auto-orijamzável de
Kotanen pode ser visto como um prooedimento computacional para encontrar uma
aproximaban discreta d.js curvas principáis; ns mapas auto-orgariizávcis sao discuti-
dos no próximo capítulo.
PROBLEMAS
Autofiltro máximo fraseado na aprendizagem hebbiana
8.1 Para o filero casado considerado no Exemplo 3.2, o autovalor X, e o autovetor amociado q
sao definiJns por
X, - l4<72
q.~5
Mosto: que estes parámetros satisfazcm a relapso básica
Rq, -
onde Rea matriz de correlacáo do vetor de entrada X.
8.2 Considere o auCnHltro máximo cuide G vetorpeso w(u)cvolui de acordo com a Eq. (8.46).
Mostré que a variáncla da saida do filtro se aproxima de X|iti quando n se aproxima do
infinito, onde i o maior autovalor da matriz de correlato do vetor de entrada-
83 A íwír^ürí de cattiponentes menores (ACM) é o oposto da análise de componentes princi-
pal5- Ma ACM, procuramos encontrar aquetas dire^des que jHüiüMjfant a variáncia da
proje^áo. As diretes que s3o assim encontradas sao os auto vetaros correspondentes aos
menores (mijiimas) autovalores da matriz de oorrela^áo R da vetor de entrada X(n)
Neste problema, exploramos a fbrms de modificar o único neurtnio da Se^&o 8.4, de
modo a encontrar a comp<incnlc menor de R. Em particular, trocamos o sinal na regra de
aprendizagem da Eq. (5.40), obtendo (Xu et al., 1992)
wj(n + I) = -tv<-w}[xj(hJ
Mostré que se o menor autovalor da matriz de correlacáo R fot A, com multiplicidad? I,
entio
líjTLwfn) = ijq^
R —b"
onde qn é a autovelar associado com
Análise de componentes principáis fraseada na aprendizagem hebbiana
8.4 Canstrua um grafo de iluso de sinal para representar as Eqs. de valor vetaría] (8,87) é
(8.RS).
8.5 A abordagcm por cqua^ao diferencia] ordinaria para a análise de convergencia descrita na
Se$Ao R.4 nio se aplica adiante m algoritmo de aprendizagem bcbbiana genera I izado (AHG).
Entretanto h expressando a matriz de peso sináptico W(jt) na Eq. (8.91) como um vetor
constituido da* colima* individDua de W(íj), podemos interpretar a turneo de atualizafño
na maneira usual, e entáo aplicar o teorema da estabilidad? assinldlica. Assim, com
base no que foi dito aquí, explore o teorema da convergencia para o algoritmo de aprendi-
zagem hebbiana generalizado.
fl .6 Neste problema, exploramos o uso do algoritmo hebbiano generalizado para cstudar os
campos receptólos h id imcnr i unáis producidas por uma entrada al caló lia (Sanger, L 990). A
entrada alearán ¡a consiste de um campo b id i men&íi mal de ruido gaussiano indcpcndenie
com média zcro c variáncia unitána, que c convoluido com urna máscara (filtro) gaussiana
e entáo multiplicado por uma janela gau^isna, A máscara gaussiana tcm um desvío pa-
dreo de 2 pontos (pixeis), c a jancla gaussiana tcm um desvio padráo de 8 pontos. A entra-
da aleatoria resultante jrfo s) na posifSo (r* j) pode assim ser escrita como segue:
Xa s) - Ma í) * «Ha j)]
onde w(a j) e o campo de mido gausslacio independente e idénticamente distribuido, gfr,
j)é a máscara gaussiana e m(r,5) é a fundió da júnela g^usi-iana, A convolu^áo circular de
g(r, j) c v», j) é definida por
* -I ,v -I
f-h
onde assume-se quejar, r) e n-ifr, jj sáo periódicas.
Use 2000 ejemplos da entrada aleatoria x(r,j) para treinar uma rede alimentada para
frente de camada única utilizando a algoritmo hebbiano generalizado. A rede tcm 4096
entradas afranjadas tomo urna grade de 64 X 64 pontos, e E 6 saldas. Os píisrui 5 ínápt ¡COS
resultantes da rede [reinada sáo representados como um siranjo de 64 x 64 números. Rct-
iiae os cálculos descritos aquí c mostra 0$ 16 arranjos dos pesos rináptKDS como máscaras
bidimensionais. Comente os seus resultados.
8.7 A Equacáo (8.113) define a versSo transformada du de atualizacao 06) para
calcular o vetar de peso realimentado t^n). A transforma^íto ¿ bascada na definido do
vetar pesa sináptico wy(n) cm termos dos modos principáis da rede dada na Eq. (8.109).
Derives Eq.<8,113).
8.8 Considere a matraz da sistema da Eq. (B. 116), representada pelo grafo de fluxo de sinal da
Fig. 8.12 que corresponde a 1 £ fr £j - I.
(a) Formule a equa^áo característica desia matriz 2x2.
(b) Mostré que a rtiáLriz tcm um auto-valor duplo.
F
(c} Ju sti fique a ufi rma^io de que todos 0.4 modos prioc ipai s da rede tém o mesnio autovalor.
8.9 O A II G usa apenas conexóes para frente, enquanto que o algorilmo APEX usa tanto cono
xocs para frente como conexocs latera^. A pesar dffites difamias, O ciimpurlamcnto de
convergencia a longo pra?o do algoritmo APEX é, cm teoría, cxalamcntc o nicsmo que
aqueta de AHG. Justifique a v&lidadc desta afirmado.
ACP por núcleo
8,10 Considere que K.. represente a conirapartida centrada do y-esirno elemento K .da matriz
de núcleo K. Mostré que (Scholbcopf, ITO7)
| ' I *
a.. = x; -—£</(*., toy.1 "tS'pí1. )<**-.5
" wl A — I
+-¿r¿
Subirá uina representaban compacta desta relatácj n.i fiirma malricúil-
8.11 Mostré que a normali /af ño do autovdor a da matriz de núcleo K é equ i váleme á es ¡gÉní i a
de que a Fq. (8.15?) seja satísleiia.
8,12 Resuma as prapriedades da ACP por núclcc
CAPÍTULO 9
Mapas Auto-Organizáveis
9.1 INTRODUCTO
Nesle capí tu Lo, continuairiüs nusso cstudo dos sistemas autO'Organizávcis considerando uma elasse
especial de grades neurais conhecidas como ¡napas aiLlO’Organizáveis. Estas grades sao bascadas na
aprendizagem competitiva; os neurónios de saida da grade competem entre si para serem ativados
ou disparados, como resultado que apenas um neurónio de saida, ou uní neurónio por grupo, está
Ligado em uní instante de tempo- Um neurónio de saida que vence a competido é chamado de um
neurónio vencedor leva tuda ou simplesmente um neitninto vencedor. Urna forma de mduzlr urna
compctiglfo do tipo "o vencedor leva ludo” entre os neurónios de saida c usar conoides latcrais
inibitórias (i.e., caminhos de realiinentacao negativa) entre ules; esta idéia foli originalmente pro-
posla por Roscnblatt (. 195B).
Fin um mapa attíty-organitíivel, os neurónios estilo colocados ern nós de uma grade que c
normalmente unr ou bidiincnsional. Mapas de dimensionalidade mais alia sáo também possíveis.
mas náo sáo 15o ccmuns. üs neurónios se tornam sefesivamente sintonizados a varios padrees de
entrada (estímulos) ou classes de padrees de entrada nn decorrcr de um procedo de aprendizílgem.
As local izares dos natrón।os assim sintonizados (i-C.. 05 neurónios vencedores) se tomam ordena'
das entre si de forma que um sistema de coordenadas significativo para dübrciitcf de
entrada é criado sobre a grade (Kohonen. J99üa}. Um mapa auto-argíirtizávd é, portante, caracteri-
zado pela formadlo de um mapa topográfico dos padrees de entrada no qual as locidiza^oes espa-
ciáis (i.e.r coordenadas/ dos netiránios nu grade sito indicativas das características estatisficas
intrínsecas comidas nos padrífa de entrada, da i o nume "mapa auto-urbanizó vcl'1.
Como modelo neural, o mapa auto-organizável tornee e urna ponte enire doí s niveis de adapla-
C^o:
• Rcgras de adaptado formuladas ao nivel microscópico de um único- neurfrnio.
* Forma?5o de padróes de sel e I h i dade de caraüterísticas experi mentalmente mcl boros o fi s i -
cántente accssíveis ao nivel miefiMCópico de camadas neurais.
Devulo a um mapa auto-organizável ser inerenteincnte nao-] incar, ele pode ser visto como uma
generalizadle náo/incar da análise de componentes principáis (Ritter, 1995).
O desenvolví mentó de mapas aulo-org¡anizáveis como modelo neural c motivado por uma
característica distintiva do cerebro humano: o cércbru está organizado cm vários lugares de modo
que entradas sen sonáis diferentes sáo representadas por naipes wmputacionats ordenados
tDpologieameftfe. Em particular, entradas MMOriaiS como a táctil (Kaas eL al., 1983), a visual (Hubel
c Wiescl, 1962,1977) c a acústica (Suga, 1985) sáo mapeadas para áreas diferentes do córtcx cere-
bral de uma maneira tcpulugieamenle ordenada, Assim, o mapa computacional constituí um bloco
constnitivo básico na ii’.fra-escrutura de proccssamcnto de informaQáo do sistema nervoso. Um mapa
computacional ó delirado por um arranjo de neurónios representando praeessadores ou filtros ajus-
tados de forma um pouco diferente entre si, que operare paralelamente sobre os sinais que carregam
informafáo. Con&eqüentemenie, os neurónios transformara sinais de entrada em uma distribuido
de probabilidade codificada por JocaUxa/tfo que representa os valores calculados de parámetros
por posifóes de máxima atividade relativa dentro do mapa (Knudsen el al., 1987), A informadle
assim derivada é de uma forma que pode ser fácilmente acessada por prncessadores de ordem mais
elevada usando esquemas de concxáo relativamente simples.
Organizará o do Capítulo
O material apresentado neste capitulo sobre mapas computacianais está organizado como regué.
Na 9.2, dcscrevemos doi> modelos de mapeamento de características, que de seu modo pecu-
liar sao capazas de explicar cu capturar as características cssenciais de mapas ccmputacionais no
cerebro. Os dois modelos diferem entre si na forma das entradas utilizadas.
O resto do capitula c develado a considcra^ucs detal hadas de um desics modelos, usual mente
referido como um “mapa auto-organizável" proposto por Kohonen (1982). Na Sc^áo 93, usamos
considerables neurohiológicas para desenvolver um formalismo matemático do modelo de Kohonen.
Um resumo du modelo é apr estrilado na Se^áo 9,4. Propnedades importantes do múdelo sao descri-
tas na Se<;áo 9,5, que é seguida por simulaboes computacional na Sefáo 9.6. Finalmente, o desem-
penho do mapa de características pode ser ajustado finamente atraves de uma técnica supervisiona-
da conhecida como quantizíu^o vetorial por aprendizagem; esta técnica é descrita na 9,7, A
Sccáo 9.8 dcscrcvc um experimento computacional sobre dassilicacao adaptativa de padióes que
combina o uso de quantizabáo vctonaJ por aprendizagem e o mapa auto-organizaveL Na Sft?áo 9.9,
dcscrcvcmos a quanlizacao vctorial hicrárquica construida cm tumo do mapa auto-organízável para
compressáo de dados. A Sebáo 9.10 descreve uma outra aplicado do mapa auto-organizável para
construir mapas contextuéiis que encontrara aplicacócs cm catcgonzaqao náo-supen corada de
clasaes de fonemas a partir de texto, sensoriamente» remoto e explorado de dados. O capítulo con-
cluí core algumas considcraqocs fináis na Scyáo 9.12,
9.2 DOIS MODELOS BÁSICOS OE M APE AMENTO
DE CARACTERÍSTICAS
Qualquer um que examine um cerebro humano fica impresionado com a extensSo que o córtcx
cerebral ocupa no cerebro. O cerebro é quase totalmente envolvido pelo córtcx cerebral, que obscu-
rece as outras partes, üo ponto de vista apenas da complexidad?, o córtex cerebral pro va vel mente
supere qualquer um™ estrutura conhtcidd no universo (Hubcl c WicscL 1977). O que é igualmente
imprcssionantc c o modo como diferentes entradas sensoriak (motora, somestésica, visual, auditi-
va. etc.) sao mapeadas para áreas correspondentes do córtcx cerebral de uma forma ordenada-, para
avallar este ponto, veja os mapas cito-arqu i tetarais do córte* cerebral na Fig. 2.4. O uso de mapas
computacionais oferece as seguíntes propiedades (Knudsen et al., 1987):
* Em cada eslágio de representado. cada parte da informado incidente é mam ida no seu
próprio contexto.
• Neurónios que lidam com parten relacionadas de informado estío próximos entre si de
modo a poderem inlcragir atraveft de concxocs sinópticas curtas.
Nosso interesse se concentra na construyo de mapas topográficos artificiáis que aprenden! através
de auto-organizado tima mancira inspirada na ncurobiologia. Nestc contexto, o ponto que emer-
ge da breve discussao sobre mapas computación# is no cerebro ¿ o principia da formando de mapas
topográficos, que pode ser formulado como (Kobonen. 1990a):
A Idealizad"' espacial de um neurónio de salda tm um nutpa topográfico corresponde a um dominio
ou característica particular do dado retinado do espado de entrada.
Este principio Ibrneceu a motivado rteurobiológica para dois orw/e/o.v de otopeomertía de caracte-
rísticas* diferentes descritos aquí.
A Fig. 9.1 mostra a planta dos dois modelos. Em ambos os casos, os neurónios de saida cstao
anranjadas em uma grade bidiniensiQnal- Este tipo de topología assegura que cada neurónio tenha
um conjunto de vizinhos. Os modelos diftrcm entre si no modo como os padróes de entrada sao
especificados.
O modelo da Fig. 9.1a ibi originalmente propusto por Willshaw c von der Malsburg (1976)
sobre bases biológicas para explicar o problema do mapeamento relinotópico da retina para o córtcx
visual (nos vertebrados superiores). Específicamente, hti duas grades bidimensionais separadas de
neurónios conectadas entre si, uma délas se projeiando sobre a outra. Uma grade representa os
neurónios pré-sinápticos (de entrada) c a outra grade representa os neurónios pós-sinápticos (de
saída). A grade pós-sináptica utiliza um mecaitismo excitatórío de curto alcance bem como um
meccur ¿fino ¡nihüfiria de it>ngu ateunee- Estes dois mecanismos sí o de natureza local es£o cruciais
para a auto-organiza^aa. As duas grades sao conectadas entre si por sinapses modificavéis do tipo
hebbiano. A rigor, ponan to, os neurónios pós-sin aplicas náo sí o do tipo o vencedor leva ludo, cm
vez disso. é usado um I imiar para asegurar que apenas paucos neurónio® pós-si nápt i eos dispararlo
cm um determinado instante. Alcm disso, para evitar um constante aumento dos pesos sinápticos
que pode levar ;’i instabilidfide da grade, o peso total associado com cada neurónio pós-sináptico é
limitado por uma cundirán de limite superior? Assim, para cada neurónio, alguns pesos sinápticos
amnentam enquanto que nutras diniinucm. A idéia básica do modelo de WdLshaw-von der Mahburg
c que a proximidade geométrica de neurónios pré-sinápticos scja codificada na forma de corrch-
fócs na sua atividade elélrica, c usar estas cürrdaQ&S na grade pos-sináptica de forma a conectar
neurónios prc-sinápticos vjzinhos com neurónios pós-sináplieos vizinhos. Dessa forma, um
mapeamento lopclogicamente ordenado é produzido por auto-organizólo. Note, entretanto, que o
modelo de Willshaw-von der Malsburg ó especializado cm mapeamentos nos quais a dimensáo de
entrada é a mesma que a dimensáo de saida.
O segundo modelo da Fig. 9.1 b, introducido por Kohonen (1982), 115o pretende explicar dota-
Ihes neurobiológicos. O modelo captura as características essencíais dos mapas computacionais do
cerebro c aínda se mantera tratávcl do ponto de vista compulse i onal? O modelo de Kohonen apa-
rentemente é mais geral que o modelo de Willahaw-vofi der Malsburg na medida cm que ele c capaz
de realizar ccmpressáo de dados (i e., rcdutjáo da ¿irncnsionalidadc na entrada).
vcrnudor
Ncurórtifl
ali'pjdu
Arranjn bidimensincial de
fKurdriüE pós-sinaplicos
Peine de MMMAM uklpCtM,
(Ib um l«m tirniljrdk
WMKtal siniptkas nrigiiudn
deúiicroj nciiróriios prSsi nápticos.’
I i) M«feki de Wj I Ishiiw -víhi dirr Mu Ixbur^
(b'i MihJl*Ici de k •!:•. ’ici.
FIGURA 9.1 Dois mapas auto-
organizados en caracteríslicas
Na real idade» o modelo de Kohonen pcrtencc á elasse de algoritmos de ct>dificíi<;áf> vetorial, O
modelo produz um mapeamento [opológico que localiza üEimamcntc um número íixo de velones
(i.e., palabras de código) em um espado de entrada de diniensionalidade mais elevada» c desse modo
facilita a compressao de dados. O modelo de Kohonen pode, portanto, ser derivado de dois modos-
Podcmos utilizar as ide as básicas da aulü-Ofganiza^O. motivadas por considerares neurobiulógicas,
para derivar o modelo, que é a abordagem tradicional (Kohonen. 1982,1990a, 1997a). Alternativa
mente, podemos usar urna abordagem de quantizacao vetorial que usa um modelo en vol vendo um
codificadme um decúdificador, que é motivada por considerares da teoría de comunicado (Luttrcl I,
1989bt I99la). Neslc capítulo, consideramos ambas as abordagens.
O modelo de Kohonen receben multo mais aten^So na literatura que o modelo de Willshaw-
von der Malsburg. Ele possui certas propriedades discutidas mais adiantc no capitulo, que o tornam
particularmente interesante para a comprccníáo c a modelagem de mapas corticais no cerebro, ü
restante do capitulo disdica-se a derivante do mapa aülo-ar^M^ável^ sitas propriedades básicas e
ram¡ri calóes.
9.3 O MAPA AUTO-ORGANIZÁVEL
O principal objetivo do mapa aulo-organizável (SUM. yeij-wxanizmgmap) c transformar um pa-
dráü de sinal incidente de dimcíisáo arbitraria cm um mapa discreto uní- ou bidimenslonal e realizar
esta transformaban adaptat ivamente de uma maneira topvldgic amen te ordenada.
Copyrighted material
A Figura 9.2 mostra o diagrama esquemática de uma grade bidimcnsional de neurónios nor-
ma Imente usada come a mapa discreto. Cada neurónio da grade está totalmente conectado com
todos os nós de fontc da camada de entrada. Esta grade representa uma estrutura alimentada adianto
com urna única camada computacional cotisistindo de neurónios afranjados cm linhas e col unas.
L'ma grade unidimensional éum caso especial da configurare representada na Fig. d.2: neste caso
especial, a camada computacional consiste simplesmentc de uma única coluna ou linha de neurónios.
Cada padrao de entrada «presentado á grade consiste típicamente de uma regían localizada cu
“foco** de atividade contra um fundo em repouso. A localizacao c a natureza deslc foco usual mente
variam de uma realizado do padreo de entrada para outra. Todos os neurónios da grade devem,
portante, ser apostas a um número suficiente de diferentes realizantes do padrao de entrada para
assegurar que o processo de auto-organiza^áo ten ha uma chance de amadurecer apropriadamente.
(> algoritmo responsávcl pela formacao do mapa auto-organizávd cometa primeiramente
tnicializando os pesos sinápticos da grade, isto pode ser fciio atribu indo- lites vu/aner pegueras
AwnadcH c/e wffl gerudttr de números aleatorias] fazendo dessa forma, nenhuma organizado previa
c imposta ao mapa de características. Lima vez que a grade lenha sido apropríadamcnlc inicial izada,
há trés processos essenciais envolvidos na fonna^áo do mapa auto-organizáveU como resumido
aquí;
I. Críflijjcffofo. Para cada padrao de entrada. Ofi neurónios da grade calculara seus respectivos
valores de uma fundan discriminante. Esta tangAo discriminante Comete a base para a competi-
ese entre os neurónios. O neurónio particular com o maior valor da funijáo discriminante c
declarado vencedor da compctiijáo.
2+ Cooperaban. O neurón io vencedor determ ina a loeali zapito espacia I de uma vi ¿¡ nhanfa topol ógica
de neurónios excitados, fomcccndo assim a base para a cooperaban entre os neurónios vizinhos.
3. ^óiíí/wk'ít. Este último mecanismo permite que os neurónios excitados aumentara,
seus valores individuáis da fun^áo discriminante em relajo ao padrao de entrada atraeos de
Copvriqhted material
Hidden page
Hidden page
figura s.a Fuix^o da
vifinharipe gnussian^
onde 0 vetor discreto r define a pósito de neurónio excitado/ e r define a posado discreta do
neurónio vencedor í\ sendo ambos medidos no CSpapO de Sñidu discreto.
Uma ouira característica única do algoritmo SOM é que o tamanho da vizinhan^a tipológica
diminuí enm o tempo. Esta exigencia c salisfeita tazcndo-sc com que a Largura a da fttnfio de
vízinhanca (tipológica A . diminua com o tempo. Uma escolha popular para a dependencia de a com
O tempo discreto néo decaí mentó exponencial descrito por (Rítterct ai-, 1992; Oberrnaycr ct al.,
1991)
= O(l exp
zr = ...,
(9.M
onde o c o valor de o na inteialiafio do algoritmo SüM, eré urna constante de lentpu, Conse-
qüememenle, a vizlnhanp tipológica assume uma forma variável no tempo, como mostrado por
-
2^}}
n = 0,lt2,,..,
(97)
onde CT(h) c definido pela Eq. (9.6}. Assim, quando o lempo n (i c., o número de itcra(6cs) aumenta,
a largura a(n) decresce a uma laxa exponencial e a vúinhai^a apológica diminuí de uma maneira
correspondente. De agora cm diantc, nos referiremos a h( como a de vizinfian^a.
Um nutro modo útil de ver a varia^áo da fun^áo de x izinhanqa em torno de um
neurónio vencedor j(i) é como segue (Luttrcll, 1989a). ü prepósilo de um A (w) largo c
essenc¡almente correlacionar as dirc^óes das atualizaqóes dos pesos de um grande número de
neurónios excitados da grade. Quando a largura de hó diminuida^ também diminuí o
número de neurónios cujas di reines de atualiza^ao sao correlacionadas, Fste fenómeno se (Or-
na particularmente obvio quando o treinarnenlo de um mapa ñulo-organizávcl ¿ cxccutado cm
uma tela de computador. É um desperdicio de recursos eomputacionais mover um grande nó-
mero de graus de liberdade em tomo de um neurónio vencedor de forma correlacionada, como
no caso do agoritmo SOM padráo. Em vez disso, c muito melhnr usar urna forma de treinamen-
to SOM normalizada, na qual trahalhnmns com mn número bem menor de grma de Hheaiade
runtnaltxadím. l.-sta upera^ao é fácilmente realizada na forma discreta tcrido uma funqao de
vizinhanca Ai>Si.(n) do largura c-misturiif!, mas gradualmente aunienfando o número tolal de
neurónios, Os noves neurónios sao inseridos na mciade da distancia entre os neurónios amigos, e a
suavidade do algoritmo SOM garante que os novos neurónios se insiram na adaptado sináptica de
uma maneira suave (Lultrell, 19S9a). Um resumo do algoritmo SOM normalizado é ¿presentado no
Problema 9.13.
O Processo Adaptativo
Agora chegamos ao último processo, o processo adaptativo sináptico, na formado auto-organizada
de um mapa de características. Para que a grade seja auto-organizáveL é necessário que o vetor de
peso sináptico v do neurónio j da grade se modifique em relamió ao vetor de entrada i A questáo é
como fazer esta mcdificafio. No postulado de aprendizagem de Hebb, um peso sináptico é aumen-
tado com uma oconéncia simultánea de atividades prc-sináptica c pós-sináptica. O uso de tal negra
é muito adequado para aprendizagem assoctaliva. Entretanto, para o tipo de aprendizagem nác-
supervisionada considerado aquí a hipo tese hebbiana na sua forma básica náo é satisfatória pelas
seguintes razoes: as modificares das concciix idades ocorrcm apenas cm uma dirc^ao, o que leva
no final todos os pesos á saturado. Para superároste problema, modificamos a hipó tese hebbiana
incluindo um terma de esquepimenta— gtyjWf onde w c o vetor peso sináptico do neurónio / c
gi¡j ) é uma fun£áo escalar posiiña da resposta y. A única ex i gene.:i imposta á tunado é que o
termo constante da expansáo em série de Taylor de giv) seja zero, de modo que podemos escrever
=0 para_v“Ü (9.S)
O significado desta exigencia se tomará aparente brevemente. Dada esta funpao, podemos cntáo
expressar a modificado do vetor peso do neurónioj da grade como seguc:
A V nv/- fi0$wy (9.9}
onde q é o parámetro da (axa de aprendizagem do algoritmo. O primeiro termo do lado direito da
Eq. (9.9) í o termo hebbiano e o segundo termo é o termo de esquecimente. Para satisfazer a exigen-
cia da Eq. escoliemos uma fún^áo linear para gíj^)t como mostrado por
aio)
Podemos simplificar mais a Eq. (9.9) íazendo
= P'1)
Usando as Eqs. (9.10) e (9.11) em (9.9), oblemos
Aw; = - wj) (P-12)
Hidden page
Hidden page
Hidden page
computadonais de uma grade. Suponha que<b represente unta transformado niío-linear chamada
de mapa de caraClei'i-'cticSS, que tnapfia ín füpa^u de urllnada f para ü espj^O de saída COÍOO
mostrado per
(9.151
A Equa^áo (9.15) pode ser vista como uma abstrae; áo da Eq. (9,3) que define a IocaIizaqjiQ de um
neurónio vencedor /(x) surgido em resposia ao vetor de entrada x. Pur exemplo, em um contexto
neurobi 0 lógico, O espido de entrada ¿t pode representar o conjunto de coordenadas de receptores
somcstcsicos densamente distribuidos sobre a superficie inteira do corpo. Correspondenfemente, o
espado de saída ai representa o conjunto de neurónios localizados naqutla camada docórtex cere-
bral á qual os receptores somcstcsicos eslao confinados.
Dadoum vetor de entrada x, o algoritmo SOM primeiro ¡den tilica um neurónio com o melhor
casamento ou neurónio vencedor j(x) no espado de saida ¿-í, de acardo com o mapa de característi-
cas d>. C) vetor peso liniptico w, do neurónio r(x) pode entSo serv isto como urnpt»rferro para aquele
neurónio no espado de entrada 3?; isto c, os demonios sinápticos do vetor w podem ser vistos como
as coordenadas da tmugern de neurónio r projotada no espado de entrada. Estas duas opera^óes sao
mostradas na Fig, 9,4,
O mapa de características <P tem algumas propriedades importantes:
FIGURA 0.4 llustrecáo
da • u □una entra 0 mapa
de característica $00
vetor tfe paso w, 00
neuránin venced» i
Pmprit tladí 1 ► Aproximadlo do Espado de Entrada, O mapa de curacterislica.'i <D, representa-
do pela canjunro de ve/r>rt?.v de pesas sinópticos {w } no espado de saida .?íT ^tí®m fwa
apiTfXitnafdü pura O enpa^u de enüTlda 9f.
□objetivobásico do algoritmo SOM c armazenar um conjunto grande de vetores de entrada x
E 3t( encontrando um conjunto menor de prototipos w E SÍ, de modo a íbmuccr uma boa aproxima-
Hidden page
Hidden page
¡377 =-f ¿Vi(x)n(c-e(K))(x
(C) J *.
(9.21)
Asgnn, corrí basdí ñas Eqs¿ (9.20) e (9.21 ), as condi qócs 1 c 2 formuladas anteriormente para o
algoritmo de Lloyd generalizado devem ser modificadas con» seguc (Lutircll, 1989b):
Cufídi^aa I. Dado o vetor de entrada x. escullía o código c “ c(x) para minimizar a medida de
distor^áo
D2 - dv~(v )|s - x'(c( i) + vf
(9-22)
Candirán II. Dado ú código c, calcule o vetor reconstruido ir(c) para satisfazer a condicao
íh/^KjJtfC -C(X))X
(9.23)
A Equa^áo (9.23) c oh ti da iázcndo'Sc a derivada partía! t)P ¿)x'(c) na Eq. (9.21) igual a zero c
cniao to$alvcndo-se para x'(c).
O modelo descrito na I ig. 9.5 pode ser visto como um caso especial daquele mcslrado na Fig.
9.6. íim particular. se tlzertnosa fun0o de densidade de probabilidade jtfrjdo ruido v igual a uma
tunero delta de Di rae as condenes I e II se reduzcm as condicócs 1 c 2 para o algoritmo de
Lloyd generalizado, respectivamente.
Para simplificar a cundido I. assuminiosque n(v) é urna fun^áo suave de it. Com isso poderse
mostrar que. para unía íiproxitnasáo de segunda ordem. a medida de disto^áo />, definida na Eq.
(9,22) consi*te de duas componentes (Lutlrcll, 19S9b)t
• O termo de distarlo conreiwitfnal, definido pela disiorfáo de erro quadrado |i — xr(c)||3
* Um termo de curvatura que surge do modelo de ruido ir(t?)
Assumindo que o lomo de curvatura seja pequeño, a condi^áo I para o modelo da Fig. 9.6 pode ser
aproximada pela condi^áo i para o modelo sem ruido da Fig. 9.5. Por sua vez, htc reduz a cóndilo
I a uma regra de codifiea^áo por vizinho mais próximo, como anteriormente.
No caso da comli^Bo II, podemos realízá-la usando aprendizagem por dcscida cstocáslica. Em
particular,, cocol hemos vetores de entrada x aleatoriamente do espado de entrada ÜT usando o fator
¡í/x/K(x) c acUtilizamos o vetor reconstruido x(c)C0[rLÜ ^^gue (Lultrell, 1989b}:
(9 24)
onde neo parámetro da taxa de aprendizagem e c(x) c a aproximado da condiffto 1 por codificado
por vizinho mais próximo. A cqua^áo de atualizando (9.24) é obtidn por níspero da derivada
parcial na Fq. (9.21). Esta otualDa^Ao ¿ aplicada a todo c. para o qual temos
M a paí Auto-Okaneávf.is 499
7t(c - c(x))> D
(9-25)
Podemos considerar o procedí mentó de descida do gradiente descrito na Eq. (9.24) como um modo
de minimizar a medida de distor^ao D, da Eq. (9.19). Isto é, as Eqs. (9.23) e (9.24) sfc essenelal-
rrienle do mesmo tipo, exceto pelo fato de que (9.23) é por lote e (9,24) é continua (i.e.. na forma
fluente)
A equa^o de alualizaQüo (9.24) é idéntica ao algoritmo (continuo) SOM da Eq. (9-13), leudo
em mente as correspondencias lisiadas na Tabela 9,1, Cociseqñentemente, podemos afirmar que o
algoritmo de Lloyd generalizado para quantiza^áo vetolia! c a versan com trvii.amento por lote do
al geni mu SOM com tamanho de vizinhaoQa zctol para vizinhan^a zcro, ?c(0) “ I. Note que para
obtermos o algoritmo de Lloyd generalizado da versao por lote do algoritmo SOM, nao ncccssita-
mos fazer qualquer aproximadlo porque os termos de curvatura (c os termos de ordem mais alta)
nlo contríbuem quando a vizinhanqa tem largura rera.
TABELA 9.1 Correspondéncía errfre o Algoritmo SOM e o Modelo da Fig. 9.6
Modelo de Cedí íka^iü e Deeodificafto da Fig. 9.lí Al^ricmo SOM
Codifiodor cta} Ntürtni-u cúrti ¡re.-i:i casamento j(i)
Vetor reconsirviíli'níel FimcSri de densidade du pnsba.dude lt(t - C(.x)) Vetar peso sináplko w Futido de vizinhanca ^.kl.
Os pontos importantes a notar da discussao apresentada aquí sao:
» 0 algoritmo SOM é um algoritmo de quantizaeño vetor-al, que fomece uma boa aproxima-
dlo para o espado de entrada 3f, Este poíno de vista fomcec uma outra abordagem para
derivar o algoritmo SOM. como exemplricado pela Eq. (9.24).
• De acordo com osle ponto de vista, a fundan de v izinhanca A i i? no algoritmo SOM tem a
forma de uma funcao de densidade de probabilidade. Ein Lutlrell (199 la), um modelo
gaussiano de media zero é considerado apropnade para o ruido t no modelo da Fig. 9.6.
Temos assim tambem uma justificativa teórica para adotara fundad de t i/inhansa gaussiana
da Eq. (9.4).
O algoritmo SOM por tote* c mcramenic urna reformula^o da Eq. (9.23), com os somatónos usa-
dos para aproximar as integráis no numerador c no denominador no lado di rci lo da equaqau. Note
que nesla versáo do algoritmo SOM a ordem na qual os padróes de entrada sdo apresentados á iede
náo tem efeito sobre a forma final do mapa de características, c nao há nocessidade para uma vari-
a^fio da laxa de aprendizagem. Mas o algoritmo aínda requer o uso de uma funfáo de vizinhan^a.
Propriedade 2. Ordenarán Tipológica. O mapa de características O calculada peto ¿ligérrimo
SOM c ordenada de nwdu tipológico. no sentido de que a IvcaUsac&o espacial de ttífi rteurwvo na
grada corresponde a urn dominio parí icitiar ou curuetcrfaiica dos padrees de entrada.
A propriedade de ordenadlo topo]ógica,'c uma consequéneia dircla da cqua^ao dcatualiza-
£áo (9.13) que fnn^a o vetor poso sináprco w do ncuror.io vencedor i(x) a se mover em dire^üo ao
vetor de entrada x. Ela tambero tem o efeito de mover os veloces de pesos sinápticos w dos
neurónios mais próximos/junto com o neurónio vencedor í{x). Podemos, portante, visualizare
mapa de características <l> como uma rede elástica ou virtual com a topología de unía grade uni-
ou tridimensional como prescrito no espado de saida .4, o cujos nós tcm pesos como coordenadas
no espado de entrada (Ritter, ] 995). O objetivo global do algoritmo pode assim ser formulado
como:
Aproximar n expapade entrada jKirpnnfÉ'/m.v impnrtótifKi.'i na forma de ventrei de pt'Sos sirtáplrmv
M'. de tai forma que O mapa de carocferíslicas ferne^a uma reprexenfOfliOfal dan uaraelerixtii. aa
importantes dos vetares de entrada x e em termos de im certa critirio.
O mapa de características d> c normalmente mostrado no espado de entrada SE. Específicamente»
todos os ponteirus (i.c.„ vetares de pesos sinápticos) bío mostrados como pontos, e os ponte i ros dos
neurónios vizinhos sao conectados com 1 inhas de acorde com a lapo logia da grade. Assim, usando
uma linha para coneciar dois penteiros w c w, estamos indicando que os neurónios corresponden-
tes j cj sao neurónios vizinhns na grade.
Propriedade 3. Casamento de Deitsidade. O mapa de caracteñslicas O refale vartaifas na es*
tafistica da disfribrtiifa de entrada: regióos no espada de entrada BE de ande velares de amostra x
sw rut&ados com tana atta probabilidade de ocorréncia sao milpeadas para dominios matutes do
espado de senda ¿4, e paríanla eom melhor nesalufai que regioes em 9f das quais vetares de amos-
tra x óy/d retirados com ama baixa probabilidade de ocurrencia.
Considere que /jx) represente a fdp mullidimcnsícmal do vcior de entrada aleatorio X. Esta
fdp. integrada sobro todo o espado de mirada 3f, deve ser igual á mudado, por dcfini^áo:
| /x(í>fit=l
Considere que represente o Jalar de rnugnifieaifa do mapa, definido como o número de
neurónios cm um pequeño volume rfx do espado de entrada 3t. O fator de magnificando, integrado
sobre o espado de entrada SC deve contcr o número total Ide neurónios na rede, como mostrado por
m(x}íh=i (9.26)
T- —W
Para o algoritmo SÜM cletuar o casamenta exata com a denstdade de entrada, é necessário que
(Anuui, 1980)
rtí(x)MA(30
{W}
Esta propriedade implica que se uma regido particular du espado de entrada conté™ estímulos que
ocorrem freqüentcmentc, ela sera representada por mna área maior no mapa de características que
uma regiáo do espado de entrada onde os estímulos ocorrem menos freqüentementc.
Geralmente em mapas de características bidimensionais, o fator de magnificftfío m(x) nao
pode ser expresso como uma funcáo simples da fun^o de denudado de probabilidade \(x) do vetor
de entrada i. Apenas no caso de um mapa de características unidimensional é possívcl derivar tal
relajo. Para este caso especial, constatamos que, ao contrario da suposicao anterior (Kohonen,
1982), 4 fator de magnificado j«(x) jw é proporcional a /x(x). Dois resultados diferentes sao
relatados na literatura, depeudendo do método de codificado defendido:
1. Cüíiifi&tCüO por mínimo dis tonudo, pela qual sao maní idos os terrinos de curvatura c lodos os
termos de ordem mais alta na medida de distorpáo da Eq. (9.22) de1, ido ao modelo de ruido
fc(u). Esto método de codifícalo produz o resultado
3Í*)
(9.28)
que é o mesmo resultado obtido para o quantizador vetorial padrao (Luttrcll, 1991a).
2. Codificacaa por vizlnho mais próximo t que emerge se os termos de curvatura ferem i gnorados ,
como na forma padrao do algoritmo SOM. Este método de codificado produz o resultado
(Ritler. 1991)
’(x)
(9.29)
Ainda é válida a nessa ftfirmafto anterior que um agrupamento de estímulos de entrada
frcqücnicmcnle ooorrenlc é representado por uma área tnaior no mapa de características» embona
em uma versan distorcida da condifáo ideal descrita na Eq. (9.27).
Como regra geral (confirmada por simulaqócs computacionais), o mapa de características
calculado pelo algoritmo SOM tende a representar excessivamarte rejnftes de baixa deittidade de
entrada e a representar insuficientemente regieres de alta densidade de entrada. Em outras palavras,
o algoritmo SOM tal ha cm fcmcccruma representarán fiel da distribuido de probabil idade intrín-
seca dos dados de entrada.10
Propriedade 4, Selefio de CMaeierfctica^ A partir de dados do de entrada com uma
disiribuicao nao-linear, a mapa autO’Or^antzáveí é capaz de seccionar um conjunto das mcihores
característica* pura aproximar a dístribidcáo subyacente.
Esta propriedade é uma culnunáncia natural das propnedades 1 a 3. Ela nos faz lembrar a idéia
da analise de componentes principáis que c discutida no capitulo anterior, mas com uma diferenca
importante como ilustrado na Fig. 9.7. Na Fig. 9.7 a, mostramos uma distribuido bidimensional de
pontos com média zero resultante de um mapeamento de entrada-saida linear corrompido por ruido
aditiva Ncsta situado, a anal i se de componentes principáis funciona mu .tobera; ela nos diz que a
melhor describo da distribuido “linear” da Fig. 9.7a é definida por uma linba reta (i.e., um
"hiperplano” unidimcnüional) que pMM pela origem C com.* paralelamente a» autavetor asscciado
cora o maior auto valor de matriz de correlato dos dados. Considere a según a situado descrita na
Fig. 9.7b, que é o resultado de um mapeamento de entrada-saida nao-linear corrompido por ruido
aditivo de média zero. Nes:a segunda síluafdo, é impossível para uma aproximado por linha reta
calculada por análise de componentes principáis ibrnecer unía descrí^áo aceilável dos dados. Por
mitro lado, o uso de um mapa autn-organizável construido sobre uma rede unidimensional de
ncunonios c capaz de superar este problema de aproximado cm lirtudc de sua propriedade de
ordenacáo topológica. Esta última aproximacáo c ilustrada na Fig. 9.7b.
Enn termos precisos, podemos afirmar que mapas de características auto-organizáveis fomc-
ecm urna aproximarán ^¿vcTieifcr das auim chamadas cmívo.í principáis" ou superficies principáis
(Hastie o Stuctzlc, 1989), c podem, perianto, ser vistos como uma generalIza^áo nio-lmear da
análise de componentes principáis.
FIGURA 9.7 () Distribuid
Oidirr^nEÍDnal produzida pór um
mapeamento de entrada-saída
linear, (b) Diginbu^aü
bkÜTTienEional prcdu^ Já pór um
mapeamento de «nmfa-fiAHa
rkáü-linear
9.6 SIMULAQÓES COMPUTACIONAIS
Grade Bidimensional Aclonada por uma Distribuirán Bidimensional
llusiramos o comportamc-rtlü dü algoritmo SOM usando simulares eomputacionais para cstudar
uma rede com I0Ü neurflnios. afranjados na forma de urna grade bidimensional com 10 linhas e 10
colimas, A rede é t re i nada com um vcior de entrada bidimensional k, cujas elementos.y c.r^ cstáo
uníformvmcnie distribuidos na regiao ((-1 < ,r. < 1): (-1 <-r, < H) |. Para inicializar a rede, os
pesos Miiápiicns sáo cscol'lndos de um conjunto aleatorio.
A Fig. 9.8 mcslra tres cstágios do trci namcnlo atraves do qual a rede aprende a representar a
distribuido de entrada. A Figura 9.8a mustra a distribuirán de dados usada para treinar o inapta de
características, A Figura 9.8b mostra es valores iniciáis dos pesos sinápticos, cscoíhiJos aleatoriamen-
te. As Figuras 9.8c e 9.8d apreveníamos valores dti?i veto re h de pesos .‘iinúpticos. inundas tomo pontos
no espaqo de entrada, após a ccnclusáo das Fases de ordenarán c convergencia, respectiva mente. As
'.mitas desenbadas na I :g. 9.K concclam iieuronios viz.mhog'tatreves de liabas e colimas) da rede.
FIGURA 9.S (a) Distribui^áo dos dados de entrada, (b) Cene if üü inicial da grade bitírmensional.
(c) Condiíáo da grade no final da tase de ordenado, (d) Cond ipáo da grade no final da lasa de
oonvergéncia
Os resultados mostrados na Fig. 9.8 demonstran! a fase de ordenado e a fase de convergencia
que caracterizara o processo de aprendizagem do algoritmo SOM. Durante a fase de ordenado, o
mapa se efesdobm para formar uma i nal ha, como mostrado jia Fig. 9.8c. Os neurónios sao mapeados
na ordem correta ao final desta fase. Durante a fase de convergencia, o mapa se estende para prccn-
cher o espado de entrada, Ao final desta segunda fase, mostrada na Fig. 9.8d. a distribuido estatifi-
nca dos neurónios no mapa se aproxima daqucla dos vetares de entrada, cxccto por alguns efe i tos
de borda. Comparando o estado final do mapa de características na Fig. 9.8d com a distribuí váo
uniforme da entrada na Fig. 9.8a, vemos que o ajuste do mapa durante a fase de convergencia
capturan as irregularidades locáis que podem ser vistas na distríbuiqáo de entrada.
A propriedade de ordenado topológica do algoritmo SOM está bem ilustrada na Fig. 9,8d.
Em particular, observamos que o algoritmo (após a convergencia) captura a topología intrínseca da
distribuido uniforme na entrada. Ñas simulares computacionais apresentadas na Fig, 9.8, tanto o
espado de entrada como o espado de saída sí sao bí dimensional s..
Grade Unidimensional Acionada por uma Distribu ¡cao Bidimenslonal
Examinamos agora o caso quando a dimensao do espado de entrada é maior que a dimensáo do
espado de saida ¿í. Apesar dcstc dcscasamcnto, o mapa de características é freqüentemente capaz
Copyrighted material
Hidden page
11 LO 20 30 40 SO 60 70 80 90 100
(c)
Fl G U RA fi.l 0 (a) Dscaimenlb HKponÉncial do parámaind da runfie da vizintianpa □( n). (b) Dacaimertta expíinfincial
do parámetro da laxa de aprendizagem T|(n). (c) Forma inicial da Furtfáo de vizinhanca gaussíana. ! d! Forma da
I.jf*q3o de vizinharipH no Final da fase da onfenagSa {i. a., inicio da lase de convergencia)
uma grade unidimensional. O parámetro da ñtn^áo do vizinhan^a mostrado na Fig. 9,10a,
cometa com um valor inicial CT. = 18 c cntáo diminuí para aproximadamente I cm 1000 itera^óes
durante a fase de ordenaba Durante esta mesma fase, o parámetro da tasa de aprendizagem ti(fi)
contera com um valor inicial H,= 0,1 c cntáo dccrcscc para 0,037. A Figura 9,10c mostra a distri-
buidlo gaussiana inicial de neurónios em tomo do neurónio vencedor localizado no ponto méd lo da
grade unidimensional, A Figura 9. lOd mostra a forma da iün^áo do vizinhan^a no final da fase de
ordenado. Durante a fase de convergencia, o parámetro da taxa de aprendizagem dccrcscc linear*
nenie de 0,037 a 0,001 em 5000 itera^óes. Durante a mesma fase, a fundan de vizinhan^adecresce
esencialmente a zcro.
As cspccifícagócs da fase de ordenado e da fase de convergencia para as simulagóes,
computacionals da Fig. 9.8 envulvendo a grade bidimensional sao si mi lares aqueles usadas para a
grade unidimensional, exceio pelo fato de que a fungáo de vizinhim^a é agora bidimensional.
O parainctron(jí) cometa com um valor inicial 5 e cntáo docrcscc para D,75 em 1000 iterares.
A Figura, 9.11 mostra o valor inicial da fun?áa de vizinhan^a gaussiana bidimeriB tonal A,úi), para ah
- 3 e uin neurónio vencedor centrado no ponto (7, S) dentro da grade bidimensionaí de 10 x 10
neurónios.
Mcumnin i-enccdef
FIGURA S.11 Condlpfc inicial da Fur^áo de vifintinn^ gaussiana bidimsniÍDrál téntráda értl um PiAurórtió vénefi-
düf iccaliiaOQ no pomo (7. B) em uma grade bidimensiúr^l tfe 1ü * 10 nouiMo*
9.7 QUANTIZAQÁO VETORIAL POR APRENDIZAGEM
A qttafít izando vetorial, di se ui ida anteriormente na Se^áo 9.6, ó uma técnica que üxpicra a cstrutura
subjaccnte dos vetores de entrada para o propósito de compressáo de dados (Geraho e Cray, 1992).
Pispe ciñe;) mente, um espado de entrada c dividido cm um número de rcgiócs distintas, c para cada
rcgiáo é definido um vetor de reconsinitfo. Quando um novo vetor de entrada é aposentado ae
quantizador. c determinada inicialimente a regiáo na qual o velor se cncontra, c cía c cntáo represen-
tada pelo vetor de reprodujo paraaqueh regiáo. Com isso, utilizando unía vento codificada deste
vetor de reprodujo para armazenamento ou transmissao no lugar do vetor de entrada original,
poderse cbtcr uma considcravcl economía cm armazenagem ou Largura de banda de transmissáo. ás
cusías de algunia di store. A colecto de possiveis vetares de reprodujo ó chamada de livro de
código do quantizador, e seus niemtiros sáo denominados patarras de código.
L'm quantizador vetorial pom mínima distorqao de codificado é chamado um quantizador de
lómnol ou por vlzinko mais próximo. já que as cc/m/úi.s' de Vóronoi cm tomo de um conjunto de
pontos cm um espado de entrada coiTospcndem a uma partido daqueie esporo <le acorde com a
regia dt¡ vizinhn mais próximo bascado na métrica euclid ana (Geraho e Gray, 1992). A Figura 9,12
mostra um ejemplo de um espado de entrada dividido em qualro células de Voronoi cora seus vetares
de Vbronoi associados (i.e.» vetores de rcconstrucáo). Cada célula de Voronoi coiitém aqueles pontos
AGURA 9.12 Diagrama do Voronoi
fliwptwendp cuatro células. (Adaptado
•de R.M. tjffly, 198'1. ot m pemissáo
do IEEE.)
do espado de entrada que sfó os mais próximos do vetor de Voronoi dentre a totalidade dcstcs
pontos.
O algoritmo SOM fomece um método aprox i i nativo para calcular os vetores de Voronoi de
uma maneira nao-aupervisi onada, com a aproximado sendo especificada pelos vetares de pesos
sinápticos dos neurónios no mapa de características; isto é sitnptesinente a rcformuEacáo da pro-
priedade I do algoritmo SOM discutida na Se^áo 9.6. O cálculo do mapa de características pode,
portanto, ser visto como o primeiro de dois está&ios para resolver de forma adaptativa um proble-
ma de claSAifica^áo de padrees, como mostrado na Fig. 9.13.0 segundo cstágij c realizado pela
quantizacac vetorial por aprendizagem, que fornccc um mecanismo para ó ajuste finó de um
mapa de características.
Professor
FlüuRA 9.1 S DiagraniB am ¡Mocos da classiücaqSo adaptaEiva co
padres, usando um mapa cü caractarístoas auto-organlzáual e
CjuáMiUdOr vfilbriál por apr&ndizagairi
I Rdtntot
fdc duw
A quanti¿cfí¿av vetoriui per aprentlizagent'- (LVQ, learning vector quafitriarton) é urna técni-
ca de aprendizagem supervisionada que usa a informarán sobre as classes para mover hgeiranKnte
os vetores de Voronoi, a fim de melhórar a qualidade das regiocs de decisáo do classificador Lím
vetor de entrada x é lomado aleatoriamente do espado de entrada. Se os rótulos de classe do vetor de
entrada i e de um vetor de Voronoi w concordarem, o vetor de Voronoi w é movido em dire^áo ao
vcior de entrada x. So* por outro lado, os rótulos de elasse do vetor de entrada x c do vetor de
Voronoi w discordaren), o vcior de Voronoi w c afastado do vetor de entrada x.
Considere querepresente o conjunto de vetores de Mxonoí e que{i.}'* represente o
conjunto de vetores de entrada (de cbscrvacáo). As&unlimos que há muito man valores de entrada
da que vetares de Vorunoi, o que i típicamente o caso na prática. G algoritmo de quanti zapito
vetaría! por aprendizagem (LVQ) opera como segue;
{i) Suponha que o vetar de Varona i vi scja o mais próximo do vetor de entrada i. Considere que
:-£m represente a classe associada com o vetor de Voronoi w c c€i represente o rótulo de classe
do vetor de entrada h . O vetor de Varona i w. é ajustada como segue:
• Se = '£ , entao
w/n + l) w (n) + ot, | v - w(n)]
onde 0 < a, < 1.
* Se, por outro lado, 11 , entJo
w(n f lí-w^fll-otjx-w/n)]
(9.30
(9.31)
(¡i) Os cutros vetores de Voronoi nao sao modilicados.
F dcscjávcl que a constante de aprendizagem a dccresqa monótonamente com o número de
itcracocs ji. Perejemplo,£tqpode inieialmenteser 0,1 ou menor, eentaodecreseer linearmentecom
n. A pos varios pastos alravés dos dados de entrada, os vetores de Voronoi típicamente convergen!, e
o treinamento está completo. Entretanto, podem aparecer dificuldades se o método fer aplicado sem
o cuidado adequado.
9.8 EXPERIMENTO COMPUTACION AL:
CLASSIFICAQÁO ADAPTATIVA DE PADRÓES
Em classirLc^áo de padróes, o primeiro e mais importante passo é atetefito (extrajo) cántete-
rfclietis, que normalmente é realizada de uma mane ira nao-supon isi onada. O objetivo dcstc primei-
ro passo c sclccionar um conjunto razoavclmcnlc pequeño de padróes, no qual está concentrado o
canteüdo de informaba essencial dos dados de entrada (a ser clasificado). O mapa auto-organizável,
cm uiludo da propriedade 4 discutida na Sc^áo 9.5, c bem adequado para a tarefa de sclccao de
características, particularmente se os dados de entrada forem gerados por um processo náo-linear.
O segundo passo na clarificado de padróes é a cíassij¡cítt;ao propiamente dita, onde as
características sclccionadas dos dados de entrada sao atribuidas a classes individuáis. Etnbora um
mapa auto-organizavcl scja equipado tambem para realizar a classifica^áo, o procedimcnto reco-
mendado para se obter o melhor desempenho é acampanhá-lo com um esquema de aprendizagem
supervisión ¿nía para o segundo estágío de classi ficaqáo. A combinacáo de um mapa auto-organizávcl
e um esquema de aprendizagem supervisionada forma a base de uma cla.'iS0¡caf3o adapiativa cíe
padrón de natureza híbrida.
Esta abordagem híbrida para classifíca^áo de padróes pode tomar diferentes formas, depen-
dendo de como o esquema de aprendizagem supervisionada for implementado, Um esquema sim-
ples é usar um quantizador vetaría! por aprendizagem, que é descrito na $e0O anterior. Dessa
forma, temos o classiÍ1 rador adaplativo de padróes de dois estáglos mostrado na Fig. 9.13.
CopyrÍQhted mstensl
Neste experimento, revisilaníos a dassif¡ca?áo de padrócs bidimensionais supeipostos com
padrócs de distríbuifocs gaussianas com rótulos I (elasse 'íí () e 2 (elasse *€ que foi descrita inici-
almcnte no Capitulo 4 envolvetido o uso de um pcrccptron de múltiplas camadas [reinado com o
algoritmo de retropropagacao. Os gráficos de espal ha mentó para os dados usados no experimento
sáo mostrados na Fig, 4.13.
A Figura 9.14a mostra o mapa de características bi dimensional de 5 x 5 neurónios após o
treinamento com o algoritmo SOM estar completo. O mapa de características foi rotulado, com
cada neurónio atribuido a urna elasse ou a outra dependendo de como ele responde a dados de teste
retirados da distribuido de entrada. A Figura 9.14b mostra a fronleira de dccisáo realizada pelo
mapa de características operando sozinho.
A Figura 9.14c mostra o mapa de características modificado após ser ajustado de uma maneira
supervisionada usando LVQ. A Figura 9.l4d mostra a fronteira de decisño produzida pela a^áo
FIGURA 9.14 (a) Mapa aulMrganizável apns rotúlela ib) Fronteira
de decisáe ennetruíde pelo mapa de características da parle a.{c) Mapa
rotulada após quantlzBfAo vetonal por aprondizag&m. (di Fmnieira de
dpcisáp construida pelo mapa de caractedslicas da parle c
combinada dos algoritmos SÜM e LVQ. Comparando estas duas figuras com as su as contrapartidas
mostradas ñas Figs. 9.14a e 9.14b, vemos, de uma maneira qualitativa, o efeito benéfico oblido pelo
uso da LVQ,
A Tabcla 9.2 aprésenla um resumo dos desempenhos de classificacán do mapa de característi-
cas sozinho e do mapa de características traba Ihando junto com o quantizador vetorial por aprendí-
Hidden page
Hidden page
FIGURA 9.15 (a) Querubzadqt vetorial
de aslágia único cam entrada de
cfimMisionalidade quatro (tú Quambuador
velrxial hnrárqukxi de dois eSlágidS
usarlo quarttizadorts Miaríais de duaa
entradas. (De S R Lutireii, iW9a. direiioa
amarais de Brrtisn Crown.)
(ah
listiigici I L;5Ü|;ia3
l -l.i i-.r 2
Eblágiü I
Ib)
ía)
I------1------'-------1------1-------1-------1------f-------1------1-------1"
É I I I I
(Cj
Reconstructo
Original
(d)
FIGURA 9.1 b Resultados de oodrfHispáaMHCDdiFiwpéo em aois eslavos para entrada da nildo gauaseno
cofrelprónada Coeficiente de correlato p = 0,95 (De S.R Lutlrell. !9fí9a, direitgs hirierais de Bntah
Crown,)
onde peo coeficiente de AR e os vfrt) s3o varia veis aleatorias gaussianas indepcndentes e
idénticamente distribuidas (iid) de média aere e variáncia unitaria. Assim, podemos mostrar que
jt(«) é caracterizado como segue:
^("}]= 0
(9.33)
(9.34)
(9.35)
Assim, p pode ser visto tambem como o cfiejiciente de cnrreiaqáo da serie temporal . Para
iniciar a geranio da série temporal de acorde com a Eq. (932)t foi usada uma variável aleatória
gaussiana de media zero e variáncia 1/(1 - p-) para ri/J), e para o coeficiente de oorrelacáo, foi usado
o valor p = 0,85.
Para a quantiza^áo vetorial fbi usado um codificador hierarquico com um espado de entrada
de dimensionalidade quatroT como a árvore binária da Fig. 9.15b. Para a serie temporal AR ,
a simetría de transíanlo implica que sáo necessárias apenas í/uíu (abelas de consulta distintas. O
tamanho de cada tabela depende exponencial mente do número de bits de entrada, e depende linear^
mente do número de bits de saida. Durante o treinamento, c ncccssário um grande número de hits
para representar os números de modo a se obler uma computado carreta das atualizafdes descritas
na Eq. (9.24); por isso, as tabclas de consulta nao sao usadas durante O treinamento- Uma vez que O
treinamento estela completó,, entretanto, o número de bits pode ser reduzido ao seu nivel normal, e
as posiqdes da tabela preenchidas correspondentemente. Para o codificador mostrado na Fig. 9.15b,
as amostras de entrada foram aproximadas usando quairo bits por amostra. Para todos os estágios
do codificador, foram usados .V (= 17) vetores de código, de modo que o número de bits de salda
para cada tabela de consulta foi tambán aproximadamente quatro. Com isso, o tamanho do espapo
de endere^amento das tabclas de consulta, tanto do primeirc como do segundo estágio* é 256 (=
2***K o que significa que a exigencia de memoria global para representar as tabelas é modesta,
A Fig. 9.16 mostra os resultados de codi licaqáo^dccodificayo obtidos com jr(ff) como entra-
da, A metade inferior da Fig. 9.16a mostra os vetares de código para cada um dos dois cstágios
como uma curva inserida cm um espado de entrada bidimensional; a metade superior da Fig, 9,16a
apresenta estimativas das matri/es de co-ocom£nci¿i correspondentes usando quadrados com forma-
to 16 X 16. A Figura 9,16b apresenta, como fragmentos da serie temporal, o seguí n te:
• O vetor de código calculado pelo primeiro estágio do codificador
• O vetor de reconstruyo calculado pelo segundo estágio que minimiza a distorfáo de qua-
drados mínimos, maniendo todas as entras variéveis fixas
A Figura 9J6c apresenta 512 amostras de ambas as series temperáis uriginais (curva superior) c a
sua reconstruyo (curva inferior) na saída do último estágio do codificador; a escala horizontal na
Fig. 9J6c é a metade daqueta da Fig, 9,16b. Finalmente, a Fig. 9.16d apresenta uma matriz de
coocorréncia criada a partir de um par de amostras: urna amostra da série temporal original c a sua
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
terísticas remecer uma representado Reí da distribu ic3o de entrada. Lin et al. íI 997)
segueni um caminho similar introdu/indo duas modificares no algoritmo SOM:
• A negra de atualiza^o é modificada para extrair a dependencia direta em telar o
ao vdor de entrada i c ao vetor de peso do neurona J cm questao-
* A partujño de Voronoi c substituida por uma parido com variafáo homogénea
pmjetada especialmente para d i Htribui^oes de entrada separúvtis.
Esta segunda moditicafao permilc que o algoritmo SOM realizo uma separado sega
de fonte. {Separarán cega de fonte c discutida brevemente no Capitulo I e-¿ discutida
em jnaior dclalhe no Capítulo 10.)
As modi Eeaqóes, mencLonadas se baseisin no algoritmo SOM padrin de uma forma ou de
outra. Em Linskcr (1989b), c seguida uma abordagem total mente diferente. Específica-
mente, é derivada uma regra de aprendizagem global para a formado do mapa topográfico
maximizando-se a infonnacáo mutua entre o sinal de saida c a parle do sinal da entrada
corrompida por raido aditivo, (A nof&o de infannaqSo mutua, bascada na íeorin da infor-
macSo de Shannon, é discutida no Capitulo 10.) O modelo de Linsker produz uma dislri-
bui^áo de neunónios que coincide exatamenie com a distribuirán de entrada. O u$n de uma.
abordagem bascada na teoría da mforma^ao para a formateo do mapa topográfico cm uma
maneira auto-organizada é também seguido em Van Hulle (1996, 1997),
11, A relaqSo entre a algoritmo SOM e as curras principáis é discutida em Ritier et al. (1992)
c Chcrksssky c Mulicrf 1995). O algoritmo para encontrar uma curra principal consiste de
dois petaos (Hastie e Stueízl, I9R9):
I. Pmjefao. Para cada ponto de dado, encontré a sua proje^5o mais próxima ou o ponto
mais próximo sobre a curra.
2, I4ifc>r esperado condicional. Aplique uma suavizado dos pontos de espalhamento
aos valares projetados ao longo da extensáo da curra. O proccdimcnto rccomcndávcl
é in íci±r a su±vizac3o com urna grande extensáo e entSo decrescé-la gradualmente.
Estes dois passos sáo similares á quanfiza^ao vetorial e ao rceozimento da vizinhan^a
realizadas no algoritmo SOM.
12, A idéia da quantiza^áo vetorial por aprendizagem foi proposta por Kohonen em 1986, tnés
versees dcstc algoritmo s^o descritas em Kohonen (I99üh; 1997a). A verslo do algoritmo
discutido na Seqáo 9.7 é a primeira verseo de quantizafáo vetorial por aprendizagem,
referida como LVQI por Kohonen.
O algoritmo de quantiza^So vclorial por aprendizagem c um algoritmo de aproxima-
rán estocáslica. Saras e LaVigna (1990) discutem as propriedades de convergerá ia do
algorilmo usando a abordagem da equa^áo diferencial ordinaria (EDO) que é descrita no
Capitulo 8.
PROBLEMAS
Algoritmo SOM
9,1 A fun^&O c,rlr I represenUí uma fun^aa nao-linear da rapmSta que é usada no algoritmo
SOM como descrita na Eq. (9.9). Discuta a implicacao do que poderia acontecer 9C O
termo wmslatitc na séric de Taylor de g(v.) for diferente de zcro-
9.2 Assuma que ic(u) é uma órnelo suave do ruido u no modele da Fig. 9.6. Usando uma
expansáo de Taylor da medida de dislon^in da Eq. (9.19), determine o termo de curvatura
que Surge do modela de raido
9J Algymas veza diz-sc que o algoritmo SOM p/vscnw as rclacóes topológicas que editan
no espado de entrada. A rigor, esta propriedade pode ser garantida apenas para um espaqo
de entrada de igual ou menor dimensionalidade que aquele da grade neural. Di sema 41
validade desta afintia^áo.
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
CAPÍTULO 10
Modelos Teóricos da Informado
10.1 INTRODUCTO
Em um artigo dásstco publicado em 194fi, Claudc Shannon cstabclcccu 05 fundamentos da teoría
da informando. O trabalho original de Shannon sobre a teoría da infbnnacao1, c scu refinamente? por
mitres autores, foi urna resposta di reta ás necesidades de engenheiros eletricisus para projetar
sistemas de comunicado que sejam tanto eficientes como confiáveis. Apesar de suas origens prátí-
cas, a teoría da informado como nós a conhecemos hoje c urna teoría matemática profunda preocu-
pada com a csscncia do processo de comunicarán. A teoría fomece uma estrutura para o estudo das
questóes fundamentáis como a eficiencia da represenla^áo da informado c as lim¡tambes envolvi-
das na transmissao confiável da informado através de um cana] de comunicado, Além disso, a
teoría engloba uma pnofusáo de teoremas poderosos para calcular /imites ideáis de representa^áo
ótima e de transmissao de sinais portadores de informa^ita. Estes limites sáo importantes porque
fomecem parámetros de referencia para o projeto aperfeifoado de sistemas de processamento de
informado.
O principal objetivo dcstc capitulo é discutir modetos teóricas da informando que levem á
aulo-orgatiizaváo de uma forma fundamentada cm principios. Neste contexto, um modelo que me-
rece menino especial ó o principio da máxima informando mútuá1 formulado por Linsker (1988),
Este principio afirma que as conexdes sinópticas de uma rede neural de múltiplas camadas se desen-
volvcm de forma a marúnizara quantídade de informando que é preservada quando ocurre trans-
formando de sina'ut em cada e&tágio de processamento da rede, su/eila o certas resfrif oes. A idéia
de que a teoría da informado pode ofcreccr uma explicado para o processamento perceptivo ruto é
nova? Podemos mencionar, por exemplo, um amigo artigo de Altneave (1954), no qual é proposta a
seguirte fundió da teórica da informado para o sistema perceptivo:
Urna fundió principal da maquinaria perceptiva é retirar alguma redundancia da estimulado. para
dcscrever ou codificara ínforniacáGem urna forma mais económica queaquela com a qual ela atinge
os receptores.
A princ i pal idéia por tras do artigo de Attneave é o reconhccimcnto deque a codificado de dados de
uma cena com o proposito de redupáo de redundancia está rclac ¡orada ú identificado de caracterís-
ticas especificas na cena. Esta importante constatado está relacionada a uma visáo do cerebro
descrita em Craik (1943), no qual é construido um modelo do mundo externo que incorpora as
regularidades e restricóes do mundo.
Organizado do Capitulo
O corteado principal do capítulo está organizado cm duas panes. A primeira parte, consistíndo das
Sc^6e* 10.2 a 10-5, fomece uma revisao dos fundamentos da teoría da informapao, Na Se^ao 10.2,
discutimos o concento de entropía como uma medida quantitaliva de informado, que Leva natural-
mente ao principio da máxima entropía discutido na Se?5o 10.3. A seguir, na Sl\3o 10.4, discuti-
mos o conceilo de infonna^to mutua e sum propriedades, seguido por urna discussáo da divergen-
cia de Kullback-Lcibter na Scpao 10.5.
A segunda parte do capitulo, consistindo das SefAes 10.611Q. 14, trata de modelos teóricos da
informarán- para sistemas auto-organizáveis. A Scqáo 10.6 ressalta a ínformacáo mutua como uma
fun^áo objetivo a ser oümizada. O principio da máxima informado mutua é discutido na Sajáo
10.7, que é seguida por uma discussao da retarán entre este principio e o da redu^áo de redundancia
na Sccáo LO.S. As Sebees 10.9 c 10.10 tratara de duas variante!» du principio da máxima informaoac
mutua que sáo adequadas para diferentes aplicaqócs cm processamento de imagen*. A* Se^fies
i 0.11 a i 0.14 apresentam tris métodos diferentes para resolver o problema da separa^ao ccga de
falles.
O capítulo concluí com algumas considcraqocs fina?, na Scqáo 10.15.
10.2 ENTROPIA
Segundo a tcrmnologia normalmente utilizada na loor i a das probabli dados, usamos uma letra
maiúsculla para representar uma wiávelatetuóriu, e a letra minúscula correspondente para repre-
sentar o valor da variável aleatoria.
Considere entáo uma variável aleatoria Af, cm que cada realizarán (apresentafáo) sua pode ser
vista corno- uma nienisugern, A rigor, se a variável aleatoria X for continua cm seu intervalo de
amplitudc, entáo ela carrcga uma quantidade infinita de iuformafáo. Entretanto, do embasamento
físico e biológico reconhecemos que náo íáz sentido pensarmos cm termos de medida* de amplitu-
dc com prccisáo infinita, o que sugere que o valor de X pode ser uní formemente quantizadn cm um
número ñniíti de ni veis discretos. Conscqiicntcmcntc, podemos ver Jf como urna variável aleatoria
dhcivtíi, modelada como segue:
A - (jJA--0,± I.+ X}
(10,1}
onde é um número discreto c (2K +• I) é o número total de níveis discretos. Assumc-sc que a
scparaqáo ói entre os níveis discretos seja suficientemente pequeña para o modelo da Eq. (10.1)
fomecer urna representado adequada para a variÉvel de interesse. Podemos, c claro, passar para o
limite continuo fazendo &c se aproximar de zero e Ar tender ao infinito, e neste caso temos uma
variável alealória continua c (como veremos mais adían te ncsia sc^áo) os somatónos se tomam
integráis.
Para completar o modelo» considere que o evento A = ocorm com probabilidade
Pi=^r=^
com a cxigcncLíi que
(10 2)
*
OSp < 1 e Z A = 1
(30.3)
Suponha que o evento X=a. ocoira com probabiliiladept = l , o que por sua vez requer que= 0
para todo 11- k. Em tal situado nio há “surpresa" e, portento, nenhuma “infonuaijáo11 c transmitida
pela ocorréncia do evento X - xk, pois sabemos como a mensagem deve ser. Se, por outro lado, os
vários ni veis discretos oconerem com diferentes probabilidades e, em particular» a probabilidades
for baixa, entao há mais "impresa" c portento "infarma^áo" quando X assumir o valor .rx em vez de
um outro valor .v. com maior probabilidade p . i k. Assim, as palavras 'incerteza", “impresa" e
"informando'1 estío todas relacionadas. Antes da ocurrencia do evento X = xe há uma quantidade de
incerteza- Quando o evento X = ocorre, existe uma quantidade de surpnesa. Após a ocoméncia de
= x, há um aumento na quantidade de información Estas tres quamidadea sao obviamente a
mesma. Além disso, a quantidade de informafáo está relacionada com o inverso da probabilidade
de ocorrencia.
Definimos a quantidade de informacáo gacha após observar o evento X=j. . com probabilida-
de pt come a fundió logarítmica
I(xt) = log
= -]cSA
(104)
P*r.
onde a base do logaritmo é arbitrária. Quando o logaritmo natural é usado, as unidades de informa-
ffio sáo nals, e quando o logaritmo de base 2 é usado as unidades sao bits. Em qualquer caso, a
definido de informado dada na Eq. (10.4) ex ¡be as seguintes propriedades:
1» f(x1)= 0 para/j^ = I (10.5)
Obviamente, se esllvermos absolutamente cerros do resultado de um evento, nenhuma inferma-
cao c gacha pela sua ocórréncia,
X /(xj > 0 para 0 <pt < 1 (10.fi)
Isto é, a ocurrencia de um evento X fomece alguma informa^áo ou nenhuma informadlo,
mas nunca resulta cm uma perda de informacao.
5. i(xi)>l{x)^p,<pl (10.7)
Jslo é, quanlo menos provável for um evento, mais i:iformado é ganha através da sua ocor-
réncia.
A quantidade de informacao c uma variávcl aleatoria discreta com probabilidade p.. O
valor médio de /(*,) sobre o intervalo completo de 2K + I valores discretos é dado por
H(X) = £[/(*,)]
= X
*
--
(10.8)
A quaolidadir ff(X) ó chamada a entropía de uma variável aleatoria Xque pode assumir um conjunto
finito de valores discretos; c chamada assim cm rcconhccímentó a analogía entre a definirán dada
na Eq, (10.8) e aquela da entropía na termodinámica estatistiea4. A entropía WCY) c uma medida da
quant idade média de informaban transmitida par mensagem. Note, entretanto, que o Zem HI.X}
nao é um argumento de uma funqao, mas sim um rotulo para urna variável aleatoria. Note também
que na definidlo da Eq, (10.8) fizemos OlogO scrO.
A entropía //(Af) c limitada como segue:
log(2K+ l)
(10.9)
onde (2/í 4-1) é o número total de níveis discretos. Além disso, podemos lázcr as seguimos afirma-
fdes:
L H(X\ = D se e somonte se a probabil idade p = l para algum í, c as probabi lidades restantes no
conjunto sáo todas aro; este limite inferior da entropía corresponde a nenhuma freertteza.
2, A/(A") Jog,(2A¿ + l), se e somente se L'(2K + 1) para todo A (í.e., todos os níveis discretos
sáo cqüipnovávcis); este limite superior da entropía corresponde á incerteza mírm.
A pro va da propriedade 2 resulta do seguí nte lema (Gray, 1990);:
Dadas duas distribu¡cíes de probabilidad? quaisquer {p l e ! para urna variável aleatoria discreta Y,
cntáo
>0
(10.10)
que é satisfeita com a igualdad? se ? sementé s? para todo
A quantidade usada neste lema é de tal importancia fundamental que fazemos uma pausa para
d ispoda cm uma forma adequada para uso tic estudode sistemas cslocásticos. Considere que/\(x)
e ^(.v) representen! as probabilidades que a variável aleatoria Áresteja no estado x sob duas condi-
9fcs de opera^áo diferentes. A enrroprá rtí/úrivu ou rfveig/ftcta (Ufanera) de KidfbacA-Leibter
entre as duas¿¡es de mansa da pro/wbifidade pjx)e ?/J) é definida por (Kullback, 1968; GrayT
1990; Cover cThomas, 1991)
= S/’rWoS
r*r
c*)1
(10-11)
onde o somalório c sobre todos os estados possiveis do sistema (i.eM o alfabeto 7C da variável alea-
toria discreta X). A fun^áo de massa da probabíIidade q/.r) desempenha o papel de uma medida de
referencia.
A Entropía Diferencial de Variávels Aleatorias Continuas
A iliscussáo de concentos teóricos da informado aic agijracnvolvcu conjuntos do variávcii aleato-
rias que sáo discretas tm scus valores de amplitude. Agora estendemos alguns desses conccitos para
variáveis aleatorias continuas.
Mócelos Tbóuxs da InpoumacAo 529
Considere urna variável aleatoria continua X com a fwiqao de densidade de probabilidade
fjx}. Por analogía com a entropía de uma variável aleatória discreta, introduzimos a seguíate defi-
nfeáo:
A(A>-
/^xjlogf/jrjrfr
(30.12)
= -£| log Xrf1)^]
Nos referimos a A(A) como a entropía diferencial de X para distingui-la da entropía ordinária ou
entropía absoluta. Fazemos isso per reconhecerque, embota h{X} seja uma quantídade matemática
útil de se ccnhecer, ela nao é de forma alguma uma medida da aieatoriedade de X
Justificarnos o uso da Eq. (10J 2) como segué. Cometamos vendo a variável aleatoria conti-
nua X como a forma limite de uma variável aleatoria discreta que assume o valor e = ASi, onde k =
0¡, ±1, ±2^+., e &x se aproxima de zero. Por definirán, a variável aleatoria continua X assume um
valor no intervalo [x^ i - i&x] com probabilidadc^l.t.fe. Assim, pernri lindo que 5x se aproxime de
zero, a entropía ordinária da variável aleatória continua Xpode ser escrita no limite como
H[X) = - lim
ui —I- U ,
A(x)<ir
(10.13)
4(jr)log fx(x)dx - lim logñx
- fr(Jf)- bm logáx
Br-pfl
onde na última Linha fizemos uso da Eq. (10.12) e do fato de que a área total sob a curva da fiin^áo
de densidade de probabi i i dadt/Aíx) é unitária. No I imite quando &r se aproxima de mío, — logSx se
aproxima do infinito. Isto significa que a entropía de urna variável aleatória continua é infinitamente
grande. Intuitivamente, esperaríamos que isto fosse verdade porque uma variável aleatoria continua
pode assumir um valor qualquer no intervalo (- »,=<*) e a incerteza associada com a variável tende
ao infinito. Evitamos o problema associado com o termo lo@8x adotando como uma entropia
diferencial, com o termo - log&c servindo como referencia. Além disso, como a informado proccs-
sada pelo sistema estocástico como uma entidade de interesse é realmente a difieren?a entre dois
termos de entropía que tem urna referencia comum, a informa?áo será a mesma que a diferen?a
entre os termos de entropía diferencial correspondentes. Com issojustífícamos perfeitamente o uso
do termo Af(A'), definido na Eq. (10.13), como a entropia diferencial da variável aleatória continua A'
Quando temos um vetor aleatorio continuo X cansí si indo de n variáveis aleatorias Xp X¡v,.,
A definimos a entropía diferencial de X como a. integral fn vezes) múltiplo
*(X)=- ¿(ijlog/jx^x
<IQ.14)
= -gpog/w]
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
e o vetor aleatorio nr-por-1 X é definido em termos de U por
X-At-
onde A é uma matriz nao-diagonal. Considere que/*. (Ji) represente a íunfáo de densiíLadc de pro-
babilidade marginal de cada A que é derivada de/^x). EtiüSo, a divergencia de Kullback-Leibler
entre/j.x) c /’(x) admite a seguidle decomposiQStf por Pifágonts',
DMh (10.45)
Rcferimcbnos a esta elássna relajo como uma decomposiíSu per Pitágoras porque ela tem uma
inicrprctaQáo geométrica sobre a informado (Amaría 1985). Na nota 8 é apresentada urna prava
desta decompusieSo.
10.6 INFORMAQÁO MÚTUA COMO UMA FUNQÁO
OBJETIVO A SER OTIMIZADA
Agora que desenvolvemos uma cainpreensao adequada sobre a teoría da informacao de Shannon,
estamos prontos para discutir o seu papel no cstudo de sistemas auto-organizáveis.
Para prosseguinnos com a discussáo, considere um sistema neural com múltiplas entradas o
saldas. O ubjciivu principal aqu¡ é que o sifitenM $cja aulo-ti-Tganizável, pmjelado para uma [arela
especifica (p.cx., modclagcm, extrafao de carácter isbeas estalis ticamente salientes ou separado de
sinais). Este objetivo pude ser satisfeitu escolhendo-se a informacao mullía entre certas vana veis do
sistema como ajiimpáo a ser elimizada. Esta escolha particular éjustificévcl pelas seguía-
les coTisiidcracocv
• A informado mútua tem algumas propiedades únicas como discutido na Sc^áo 10.4.
* E la pode ser delermi nada sem a necessidade de um professor, de modo que sao natura I men-
te dadas condifSes para aulo-organiza^áo.
Com isso, o problema recaí em ajustar os parámetros livres (i-e,, pesos sinápticos) do sistema de
modo a ohmixara informarán mútua.
Dependendo da aplicado de interesse. podemos identificar quatro diferentes canarios como
ilustrado na Fig. 10,2, que podem surgir na prática. Estes cenários s3o descritos como segué;
* Mo cenarlo 1 representado na l;ig. 10.2a, o vetor de entrada X é cumposio pelos elementos
Jfp .V,....A'm, c o vetor de salda V c ccmposto pelos elementos O objetivo é
tiiíixfmizar ü infwntíwtto transmitida para a saitki V do nisientu aobrt; a en fruda X do sis te-
ma.
• Mo cenário 2 representado na Fig, 10.2b, um par de vetores de entrada X X c derivado de
regides adjíceníes, mas nSo-superpostas da imagem. As entradas X^ c X,, produzcan saidas
escalares K( e Yv respectivamente. O objetivo í maximirar a ¡nformueti^ fnnixrídJtdapara X
snh/v l^c vice-versa.
Hidden page
Hidden page
Hidden page
Hidden page
--(1 + 2m;.)
2 M
(10.53)
Assim, usando as Eqs. (10.49) e (10.53) em (10.47) e fhtio simplificando os Ltnnos, oblemos (Linskcr,
ima)
,ir:x,=HdM
Com a restricto que a vanáncia do ruido c; seja mancida constante, a informado mutua 1{Y} X) é agora
maximizada pela maximiza^3o da relajo oJ / Y W*r onde n: ú uma fundió de ir.
O que podemos deducir dos Exemplos 10.4 e 10.5? Primeiro, vemos do material apresentado
restes dois exemplos que o resultado de aplicamos o principio Infomax depende do problema. A
equivaléncia entre mas ira izar a informado mutua /(f; X) e a variáncia de salda que se aplica ao
modelo da Fig. 10.3 „ para urna variáncia de ruido predeterminada . nao se aplica ao modelo da
Fig. 10.4. Apenas quando impomcs a restricto Y wf = 1 ao modelo da Fig. 10.4 que ambos os
modelos se comportan de maneira similar.
Em gcrall, a determinaban da informaban mutua Z(¥¡X) entre o vetar de entrada X e o vetor de
saida ¥ é uma tarda difícil. Nos Exemplos 10.4 c 1Ü.\ temamos a análisc matemática tratável
assumtndo que as distribuinfles de ruido em um sistema com uma ou mais fonics de ruido sao
gaussíanas muitívariadas. Esta suposi^o precisa ser jusnlicada.
Adolando-se um modelo de ruido gaussiano, estamos esencialmente invocando uma infor-
nnacáo mutua ''substituía'1 calculada sob a premissa de que e vetor de saida ¥ de um neurónio tem
uma distribuí^ gaussiana mu Lti variada com o mesn» vetor média e a mesma matriz de covariancia
que a distribuido real. Em Linsker (1993), a divergencia de Kullback-Leibler é usada para fomecer
uma justificativa fundamentada em principios para o uso de uma tal informa^ao mutua substituía,
sob a condi^ao de que a rede tenha armazenado iriformacáo sobre o vetor média c a matriz de
covariancia do vetor de saída Y, mas náo sobre eslavísticas de ordem mais alta.
Finalmente,, a análisc apresentada nos Exemplos 10.4 c 10.5 foi realizada no contexto de um
único neurónio. Tsio foi feito de propósito com uma idéia tspécilica em mente: para o principio
Infama* ser matemáticamente tratável, a otlmiza^o deve ser realizada em um nivel neurona! local.
Este tipo de otimiza^áo é consistente com a essencia da auto-oqganizarán.
Exemplo 10.6
Nt)i Exemplos L0.4 e 10.5, consideramos neurómus ruidosos. Nesle exemplo. consideramos uma rede sem
raído que transforma um vetor alealóric X de distribuido arbitraria em utti novo vetor alealório V de distribuí'
fto diferente. Reconhecendo que /(X; V) - f(Y: X) e esiendendo a Eq. (I0.2B) á situado descrita aquí, pode-
mos CXprcssar a informa^ín mutua entre 17 vetar de entrada Xrf» ictor de saidu V como st^ur:
Hidden page
do Infomax. É ínteressante notamos que o compromisso rcdundáncia/diversidade é em parte aná-
logo (apesar de diferente) ao contpromisso viés/variáncia discutido no Capitulo 2.
Modeiagem de um Sistema Perceptivo
Desde os prímórdios da teoría da informado, tem sido sugerido que a redundancia de mensagens
sensorial s (estímulos) c importante para o entendí mentó da percepqáo (Attneave, 1954; Barlow,
1959). De falo. a redundancia de mensagens sensorials fomece o conhecimento que permite ao
cérebro construir seus “mapas cognitivos” ou “modelos de trabalho" do seu meio ambiente (Barlow,
1989). As regularidades ñas mensagens sensorlais devem ser codificadas de alguma forma pelo
cerebro para que ele saíba o que acontece normalmente. Entretanto, a reJupw Ja reJimddrtda é a
forma mais específica da Aipotósc de Büt-low. Esta hipótese diz que o objetivo do processamento
primario é transformar a entrada sensorial altamente redundante em um cDí/igA/aroría/1 mais efici-
ente. Em outras palavras, as saidas ncuronais se tomam esfatfsrteaffiente ifídependentes quando
condicionadas na entrada.
Inspirados pela hipótese de Barlow» Atick e Rediich (1990) postularam oprincipio da mínima
redundancia con» base para um modelo teórico da infortnafáo do sistema perceptivo mostrado na
Fig, 10,5. O modelo consiste de tres componentes: o cana/ Je tffl/naJa» o jijeara de codif¡ca$uo e o
canal de saída. A salda do canal de entrada é descrita por
Cajttl de entrada
Cel/iiíI Je isldj
(ftcrvi* ótico)
AGURA 10.6 Modeto Ce um sistema
p&rMptiutx O velor sirUl * e w vítores
de ruírto e sáü valores dos vetares
al&aiórios SP N, e N5, respectivamente
onde S é um sinal ideal recebrdo pelo canal de entrada e assume-se que N. seja a fonte de lodo o
ruido na entrada. O sinal X £ a seguir transformado (codificado) porum operador matricial linear A.
Ele ó cntáo transmitido através do ñervo ótico. ou canal de saída, produzindo a saida Y, como
mostrado por
Y - AX + N2
onde N. representa o ruido intrínseco após a codificado. Na abordagem seguida por Atick c Rcdlich,
observa-se que sinais de luz que incidem na retina eontém informado sensorial útil cm uma forma
altamente redundante. Além disso» levantarse a hipótese de que o propósito do processamento do
sinal da retina é reduzir ou eliminar os bits redundantes de dados devido lanío a correla^ocs como a
ruido» antes de enviar o sinal através do ñervo óptico. Para quantificar esta noQáo, é definida uma
medida de redundancia por
i i p
cñi
(10.56)
onde /(Y; S) o a i ntorma^áo mútua entre Y e S, e C(¥) é a capac i dade do cana] do itervc ói ico (canal
de saida). A Equatjau (10.56) é ¡uslí finada com base no argumento de que a informado na qual o
cérebroestá interessade é o sinal ideal S. enquanto que o canal físico atravesdo qual esta infomna-
$áo precisa passarc na realidadc o ñervo óptico. Assumc-sc que nao baja redujo de dimensionalidadr
no rnapeamenlo de entrada-saida rea lirado pelo sistema perceptivo, o que significa que C( Y) > /(Y;
S). O objetivo é encontrar um mapeamento de cntrada-saida (i.c.„ a matriz A) que minimiza a medi-
da de redundancia J?, su;e i t :í á restricáo de nao haver penda de informacao, como mostrado por
/(Y;X)-/(X; X)-t
onde í é um parametro positivo pequeño. A capac idade do canal C(Y) c definida como a taxa
máxima de fluxo de informacao possívcl afra ves do ñervo óptico, cstcndcndo-sc sobre todas as
Llistrihuicócs de probabilidade das entradas aplicadas a ele c mantendo fixa a potcncki media de
entrada.
Quando o vetor sinal Seo veior de saida Y tem a mesma dimensional i dade e há ruido no
sistema, o principio da mínima redundancia c o principio ínfbmax sao matemáticamente equivalen-
tes, desde que uma restribo similar seja imposta á capacidade computacional dos neurónios de
saída em ambos os casos. Para sermos específicos, suponha que a capacidade do canal seja medida
cm ¡termos do intervalo dinámico da saída de cada neurónio do modelo da Fig. 10-5- Entao, de
acordo com o principio da mínima redundancia, a quantidade a ser minimizada é
/(Y;S)
C(V)
para uma dada perda de informacáo pcrmissivcl, e perianto para um dado /(Y; $), Assim u quantida-
de a ser minimizada ó csscjnciiilmcnto
F^Y; $) = £(¥) -UV;S)
(10.57)
Por outro lado, de acorde com o principio Enfbmax a quantidade a ser maximizada no modelo da
Fig. 10.5 é
F/Y; S) = /(Y; S) + kC(Y)
(10.5S)
Embora as funcocs F(Y; S) e Fa(Y; Si sejam diferentes, suas otimizacóes produzcm resultados
idénticos: ambas s3o fomulaqües do método dos multiplicadores de í.agrange, com os papéis de
/(Y»S)cC{¥)simplcsmcnte trocados
O ponto importante a notar desta dlscussáo é que, apesar da diferenca ñas forrmilafóes, estes
dois principios teóricos da informarán levam a resultados similares. Em resumo» a maximiza^ao da
iníormacáo mútua entre a saida c a entrada de um sistema, iicuril Leva de falo á redu^ao da redun-
dancia. ’
10.9 CARACTERÍSTICAS ES PAC ÍALM E NTE COER ENTES
O principia Infotnax, cama postulada na Se^o 10.6, aplicMO Mmafio na qual a informadla
mutua /(Y; X) entre o vetor de saida ¥ de um sistema neural e o vetor de entrada X é a fuii^áo
objetive a ser muícnizada, como ilustrado na Fig. 10.2a. Com modiilca'^ócs apropriadas na termi-
nología, podemos estender este principio para lidar com o processamento náo-supervisionado da
imagem de uma cena natural (Bcckcr c Hinton, 1992). Um elemento fjñxeí) náo-proccssado de uma
iinagem assim eontém urna riqueza de intbrma^fies sobre a cena de interesa^ embona cm forma
complexa. Em particular, a hiten sidade de cada elemento e atetada por parámetros intrínsecos tais
como proñindidadc, rcflexibilidade c orientarán da superficie^ bem como pele ruido de fundo e
FIGURA 1Q.6 Processamento de cuas regióes vizinhas de uma imagem da
aidrdo úom a primBÍra variante cj Infama»
dumina^áo. O objetivó c projetar um sistema aulo-organizávcl que scja capaz de aprender a codifi-
car esta informaváo complexa em uma forma mais simples. Para sermos mais específicos, o objetivo
é extrair características de ordem mais alta que exibam caeréncííi simples eiravés dn espada de tal
forma que a representarán da informaeáo cm uma rugían espacial mente localizada da imagem tome
mais fácil producirá representado da informado em recibes vizinhu; uma regido se refere a uma
colccao de elementos na imagem. A siluacáo descrita aquí c relativa ao cenaría ilustrado na Fig.
10.2b
Podemos assim formular a prtmeira variante do principio Infernas19 como segue (Recker,
1996: Recker e Hinton, 1992);
A transformare de mu par de vetores Xd e X5 (representando regifcs adjacentes, náo supetpostas de
unía imuyem por um sistema neural) dirvü (ef e$C0l.n-.l¿L de muda que 3 saída escalar Y do sistema
devido i entrada Xf maxmtee a informa?So sobre s segunda suida escalar devido a Xp. A futido
objetivo a ser maxiTni/adjt é a informa?áo mutua /(í^ entre as saidas F. c Fy
Rcfcrimo-nos a este principio coma uma variante do principio Infomax no sentido de que nao é
equivalente a Infomax ou derivado dele» mas curtamente funciona de urna maneira similar
Para «emú» específicos» considere a Fig. 10-6 que mostra duas redes (módulos) neurais a c¿
recebcndc as entradas c Xhi de regí oes adj acontes nao-superpostas de urna imagem. Os escalares
f c representara as saidas destes dais módulos causadas pelos respectivos vetores de entrada X
e X1. Considere que 5 represente tima componente de sinal comura a ambos ¥u c Yhi que c represen-
tativa da cocrencia espacial atrases das duas rc^LÓes pertinentes da imagem original.
Óopyrighted inaterí
Podemos expressar 1 e 1‘. como veraces ruidosas do sinal comum S. como mostrado por
(10 59)
i;=s+n
(10.60)
N uN. sao componentes de ruido aditivo» assumidas como sendo varia ves aleatorias de distribuí’
váo gaussiana de média zero. estal isticamente independen tes, Assume-se que a componente de
sinal S c também gaussíana com uma distribuido propria. De acordo com as Eqs. (10.59) e (10.60),
os dois módulos a e b da Fig. 10.6 lomam as suposipocs consistentes entre si.
Utilizando a última Linha da Eq. (10.30). a informaQao mutua entre K c c definida por
+*(>;)-Mí;.*?
(10.61)
De acordo com a fórmula da F.q. (10.22) para a entropía diferencial de uma varié reí aleatoria
gaussiana. a entropía di ferene i al A( >’ ) de Ya c dada per
MK) = -[i + iog(¿™í)|
2
(10.62)
orden ’ é a van Oficia de K, Smiilarmenlc, a entropía diferencial de V é dada por
*01)-1(1 + 108(211^)]
(10.63)
onde o é a varilncia de F Como para o caso da entropía diferencial conjunta A() „? ), utilizamos
a fórmula da Eq. (10.24) para escrever
*( = 1 + log( 2 TI) + | log|dct( E)|
A matriz E, 2-por-2, é a matriz de covanáncid de >'u c Yb; é definida por
I=r <
_p,.^.rcíA ol
(10.64)
(10.65)
onde é o cncficicHte de correla^áo de e que c
(10 66)
□ d
Com isso, o determinante de S é
detffi) = ^(l-|¿) (10.67)
e assim podemos rescrever a Eq. (10.64) como
J*) -l + M2jt) +1 log|d;o; (I - p¿)] (10.68)
Substítuindo as Eqs. (10.62), (10,63) e(10.68) em (10.61) e entSo simplificando os termos, abre-
mos
í(Wt) = -|tag(l-p’) (10.69)
Da Eq. (10.69) deduzimos ¡mediatamente que maximizar a i n formado mutua /(K ;/^) é equivalente
a maximizar o coeficiente de correlato pJT o que é razoável intuitivamente. Note que, por defini-
íñojpjs I.
Maximizar ti informado mutua /(}' J . 'i pode ser visto como a generalizado nao-linear da
correla^áo canónica da estatística (Beckere Hintun, 1992). Dados dois vetores (estímulos) de entra-
da X^ e Xt (nio necessariamente da mesma dimensional¡dade) e dois vetores de peso corresponden-
tes* wa c wp o objetivo da análise da corretajea canónica c encontrar as combina^oes linea-
res 1 = e = w^XA que tem máxima correla^ita entre elas (Anderson, 1984}. Maximizar
/(Yj y. l £ uma gencraliza^ao náo-linear da correlato canónica cm v.rtude da náo-lineandade in-
corporada no projeto dos módulos neurais da Fig. 10.6.
Em Becker e Hinton (1992), ó demonstrado que ao se maximizar a infcrma^áo mutua /( F ; 7,1
c pcssívcl extrair a disparí dade relativa i profundidade de c¡»[crcogranias de pontos aleatorios. Este
é um problema difícil de exirado de características que nao pode ser resolviólo por uma rede neural
linear ou de uma camada.
10.10 CARACTERÍSTICAS ES PACI ALIVIENTE INCOERENTES
O pruccssamento nio-supen isionado de urna imagem considerado na sepSo anterior trata da exirado
de características espacial mente coerenies de uma imagem. Consideramos agora a situado oposta
á descrita ali. Para sernos espec ¡fíeos, considera a Fig. 10.2c, onde o objetivo é acentuaras dlferen^
jas espaciáis entre um par de rtgi-óes correspondentes derivadas de duas imagens separadas. En-
quanto que a informado mutua entre as saidas dos módulos e maximizada na Fig. 10.2b, fazemos
cxatíimciitc o aposto na Fig. 10.2c.
Podernos assim formular a segunda variante do principio Infomax como segue (Ukrainec e
Haykin* 1992, IW6):
A (ransfbnna^o de um par de vetores de entrada Xd e XM representando dados derivados de regides
correspondentes em um parda imagens separadas, por um sistema neural deve ser escolhida de modo
qi*c a suida escalar Y do sistema drvidp á entrad* x minimizc a informaijáo sobre a segunda saida
escalar devído a Xrt, A fiincSo objetivo a ser minimizada é a intbrmaQdo mutua /(entre as
aaídu V c K.
B r
Aquí, novamcnlc nos referimos a este principio como uma variante do principia Inferna* sendo que
ele nao r equivalente ao Infomax ou derivado dele, mas cortamente funciona inspirado nele."
A segunda variante do principio Infomax encentra aplicado cm polarimeíría de radar* por
exemplo. onde um sistema de vigilancia por radar preduz um par (ou mais) de imagens de um
ambiente de interesse transmiLindo cm uma pulariza^áü C reetbendo o espalfaamenlo retomado do
ambiente na mesma polarizado ou em uma polarizado diferente. A polar!za^áo pode ser vertical
ou horizontal. Podemos, por exemplo^terum par de imagens de radar, uma imagem representando
a polarizará o paralelafp. ex., horizonial-horizonLal), c a outra imagem representando a polarizado
cruzada (horizontal na transmissao c vertical na recepto). Urna aplicado assim é descrita em
Ukraincc e I laylcin (1992.1996). que se refere ao realce de um alvo por poiarizaedo cm um sistema
de radar de pnlariza^áo dual. A amostra da cena do radar usada no estudo ó descrita a seguir. Um
radar incocrcntc transmite de uma maneira polarizada horizontalmenle e recebe retornos de radar
em ambos os canaise horizontal e vertical. O alvo de interesse é um re/fetar de desvio depaisriza-
tw cooperativa prejetado para girar a polarizapáo incidente em 90 graus. Na operado normal de
um sistema de radar, a detectan de um alvo como este se toma difícil devido ás iinpcrfei^oes no
sistema bem como por rcücxocs de alvos polarimétricos indesejáveis no solo (i.e, “desoridem" de
radar). Pcreebemus que é necessário um mapeamenton^o-linearpara levar em coma a distribuidlo
nfio-gaussiana comum dos retornos de radar. O problema de realce do alvo ó formulado como um
problema van ac tonal cnvolvendo a minimizafáo de um funcional de custo quadratico com rcstri-
cccs. O resultado liquido é uma imagem com pelancruzada processada que exibe uma me-
Ihora significativa na vísíbilidade do alvo, muito mais pronunciada que aquela alcanzavel airavés do
uso de uma técnica linear como a análise de componentes principáis. O modelo usado por Ukrainec
c Haykin assumc cstatísticas gaussianas. para os dados transformados, já que uma estimativa inde*
pendente de modele da fu «cao de densidade de probabilidade é uma larefo computacionalmente
desafiadora. A inforttup&o mútua entre duas variáveis gausstanas Fue Y’, ¿definida pela Eq. (10.61).
Para aprenderos pesos sinápticos dos dois módulos, c seguidauma ahordagem variacional. O objetivo
c suprimir a dcsonlcm de radar que c comum as imagens polarizadas horizontal c vertical mente.
Para satiihfazer esta exigencia, a informare mútua j ó minimizada^ sujeiL;i a uma rcstri^áo
impasta aos pesos sinápticos como mostrado por
/’ (ir[WTWJ - 1): (10.70)
onde W é a matriz de peso global da rede, e tr[- ] é o tra^o da matriz dentro dos cólcheles. Um ponto
estacionario c alcan^düu quando temos
vw/(y;jy+xvt/ = ü (io7i)
onde X c o multiplicador de Lagrangc. Fui usada uma retina de otimizafáo quasoNcwton para
encontrar o mínimo; os métodos quasc-Ncnlon sao discutidas na Capítulo 4.
A F igura 10.7 inostra a arquitetura da rede neural usada em Ukrainec c Haykin (1992, 1996).
Uma rede de funqáo de base radial (RbF) foi escoltiida para cada um dos dois módulos porque tem
a vaniagem de fomcccr um conjunto de funcoes de base radial (t e., uma camada oculta náo-
adaplativa). Os dados de emrada s3o expandidos sobre as fuñados de base c cntáo combinados
usando camadas de pesos íjrtt'eric.v; as luí has tracejadas mostradas na Eig-10 7 representara as cone*
xoes de acopli&mentO cruzado entre os dois módulos. Os centres das fun0es gaussitinas foram
x
Efltndl i ^;'.iií l\5GT1
poLaria^ crinada
(bQffiiMiiHlAenkab
Etandl dfl radnr C<'TT1
polaH¡¿jfio paralela
(trerLZünral-liüf izontil i
IkSW
hnyarm
Ritiftei
jjaiiisimíK de
buc radial
Minimoar a
íniarniafiü
ITlÚlUiJ
FIGURA 1Ql7 Disgrama sm b+ncúí d& um pfüCttMdOr riBuraL sujo objetiva
¿r suprimir dHordam de luneta usando um par de entradas rta radar na&^M-
rén(&& polarimétriúáS; a suprtsiác du dascnfem 4 álcári^adá miftimizáftdó a
informegáQ mutua entre 53 5? líes das <Jq¡5 mMutos
cacolhidos em intervalos uní firmemente espadados para cobró todo o dominio de entrada, e suas
Larguras foram escullí idas usando uma heurística. A Fi gura L0.8a mostra as imagens brutas de radar
horizontal mente polarizada e verticalmente polarizada (ambas no receptor) de uma con figurado
semeltunte a um parque ñas margena do Lago Ontario. A coordenada do alcance está ao longo do
cíkd horizontal década .magem, aumentando da esquerda para a direita; a coordenada do azimute
está sobre o eixo vertical, aumentando para balso na imagem. A Figura 10.8b mostra a imagem
combinada obtida minimizando a informadlo mutua entre as irnagens de radar polarizadas horizon-
talmcntc c vcrticalmcntch como descrito acima. A mancha brilhantc claramente visível nesta ima-
gen corresponde ao retomo de radar de um rcflctor de desvío de polarizaba cooperativo colocado
ao longo da maigcm do lago. O desempenho de suprcssáo de desordena do modelo teórico da íllfor-
mab^ descrito aquí supera aqtiele das pmje^ñes normal mente empregadu utilizando anal ¡¡se de
componentes principáis (Ukrainec e Hayll^iin. t992, 1996).12
10.11 ANÁLISE DE COMPONENTES INDEPENDENTES
Desviunofl agora, nessa atenQSo para o último cenárío dMcrito na Fí¿s. IO.2d. Para adicionar mais
especificidade ao problema de processamento de sinal Lá formulada, considere o diagrama em blo-
cos da Fig. 10.9. A operado inicia cam um vetor fonte aleatório U(a) definido per
FIGURA 10.8a imagens
brutas de radar de valedu-
ra B (azimuto (rapado em
tunpáo do ateance) para
polanzapóes horizontal,
horizontal (acima) e hori-
zontal-vertical (abaixo)
Rellet»
Refletor
FIGURA 10.8b Imagem composta calcula-
da pela minimizado da informado múlua
entre as duas imagens de radar polarizadas
da Fig. 10.8a
Ambiente dcwunhetlda
FIGURA 10.9 Diagrama em Ñocos
de processadof tara o problaíTia de
saparaqáD cet¡a de fúnleí. 04 vetaras
ur x e y sSq valores dos vetares alea-
tót ios- respectivos U, X e V
V [V,. Vt....u„]r
onde as m componentes sáo suplidas por um coi ¡unto de fantes itidepefídiínie-i. Aquí sao considera-
das scqüéncias temperáis; de agora em diante, o argumento fl representa o tempo di soneto. O vetor
U í aplicado a ucn sistema linear cuja caractcriza^áo de cntrada-saída c definida por uma matriz m-
por-w nao-si ngutar A, chamada de matriz demistum. O resultado é um vetor de observando rtr-por-
1 X(r,l relacionado a U(n) como segue (veja a Fig. 10. IDa)
X=AU
(10.72}
la}
FtG u RA 10.10 Descripto delalhatfa da (a] matriz de mistura e (b) da matriz de separado
onde
X-[Z(,X..V
O vetor fonte V e a matriz de mistura A sáo ambos dcsconhcvidcs: a única i:ifonna^o dispnnivH
para nós é o vetnr de observado X. Dado X, o problema e encontrar uma morriz de separando W tal
que o vetor iberio original U possa ser recuperado a partir do vetor de saida ¥ definido por (veja a
Fig 10.1 Db>
V-WX
(10.7?)
onde
Y = [yl>r1...rj
Normalmente, assume-sc que es sinais de fonte £7p í . sáo smai$ de media zero, que por sua
vez significa que as observa veis A\ Xm sao também sinais de media zcro. O mesmo é verda-
deiro para as saídas do separador Y . )' .
Podemos assim formular o pmblema de separando cega deJimies como segue:
Dudas jV natizcn;ües independentes do vetar de observado X. encentre m estimativa da inversa
da matriz de mistura A.
A separaban de fontes explora fundamentalmente a divenidade capadut pela qual sensores diferen-
tes que fbmecem as real i zacees do vetor X carregam diferentes misturas de fontes, A divergí dade
espectral, se existír, pode também ser explorada^ mas a abordagem fundamental para a separa<?ao de
fontes c esscncial mente espacial, procurando por estrutura através dos sensores e nao através do
tempo (Caldoso, 1998a).
A solu^áo para o problema de separado cega de fontes érealizável, exceto para um esealamento
arbitrario de cada componente do sitial e permutado de índices, Em outras palavras, é possível
encontrar uma matriz de separa^áo W cujas 1 inhas individuáis sao escalamentos e permuia^oes da
matriz A. Isto c, a soluto pode ser exprtssa na forma
Y - WX - WAL -> DPL
onde D ó urna matriz diugonal nifo-singular ePé urna matriz de permutacAo.
O problema descrito aquí é normalmente referido como o problema de separado cega das
fontes (de sinal\13 onde o termo “ccga ' é usado para significar o Tato de que a única infotrna^áo
usada para recuperar as fontes de sinal origináis está con ti da cm uma realízalo do vetor de obser
va^áo X1 representada por i. O principio fundamental envolvido na sua soluto é chamado de
análise de componentes independeníes (ACI) (Comon, 1994), que pode ser visto como urna exten-
sa© da análise de componentes principáis (ACP). Enquanlo a ACP pode apenas impor independen^
cia até a segunda ordem resb inundo os vetores dedire^áo a serem ortogonais, a ACI impoc inde-
pendencia extatistíca sobre as componentes do vetar de saida Y e nao tem restriba de ortogonalidade.
Note também que, na prútica, uma implcmenta<¿ao algorítmica de análise de componentes indepen-
dentes pode apenas buscar as componentes “tifo eslatisticamente independentes quanlo possívcl".
A ncccssidadt para separafáo ccga de tontos surge cm diversas aplicares, indurado as se-
guí ntes:
• Separaban de voz. Ncsta aplicado, o vetor x consiste de varios sinais de voz que foram
misturados lincarmentc, e o objetivo é separá-los (Bell e Sejnowski, 1995). Uma forma
di tic ¡I desta siiua^Ao, por exemplo, aparece cm um ambiente de tclccontorcncia.
• Processamento de amnfo de antenas. Ntsta segunda aplicado, o vetor x representa a
saída de um arranjo de antenas de radar produzida por varios seríais incidentes de banda
estrena originarios de fontes de d:rendes desconhecKlas (Cardos© c Souloumia, 1993,
Swindlchursl et al., 1997). Aquí novamente o objetivo é separar os sinais de forte. (Um sinal
de banda cstreita significa um sind passa-banda cuja largura de banda é pequeña compara-
da com a frcqücncia da portadora.)
• Regis tms Immálicos midiisenswuis. Nesia terce ra api i ca^áo, o velor x cons। ste de regí sitos
constituidos por uma multidáo de sensores usados para monitorar sinais biológicos de ime-
resse, O objetivo pode ser, por exemplo. separar o batimento cardíaco tic um feto do batimento
da máe(Cardosc\ 1998b).
• Anáiij¡ede dadas da mercada finaneeira. Nesta aplicaban, o vetor x consiste de um conjun-
to de dados diferentes do mercado de a0es, c o objetivo c eximir o conjunto subjaccntc de
componentes dominantes independentes (Back e Wcigcnd, 1998).
Nestas aplica^óes^ o problema da separado cega de fontes pode aínda ser composto pela possível
presenta de atrasos de propagac^o desconhccidos, pela filtragem extensiva imposta ás fontes por
seus ambientes e pela contaminado ineviláveI do velor de observado a por ruido. Estas deteriora-
res signlficann que (infelizmente) a forma idealizada de mistura instantánea de sinais descrita na
Eq. (10.72)c raramente encontrada cm situa^óos do mundo real. No que segue, entretanto, ignora-
remos estas deteriorares para ccmpreendermos os aspectos fundamentáis do problema de separa-
do cega de fontes.
Critério para Independan da Esta List Ica
Sendo a independencia cslatistica a propriedade desojada das componentes do velor de saida ¥ para
a separado cega de fontes, qual é a medida prática que podemos usar para da"? Uma passiMidade
óbvia é escolher a informado mutua AHf) entre as varia veis aleatorias e f que constituem
quaisquer dois componentes do vetor de saida Y. Quando, no caso ideal, /(^r;^) c zcro, as ccmpo'
nenies K e Y sao cstaLislieamcntc independentes. Islo sugere minimizara itifortnafáo mutua entre
iodos os pares de varia veis aleatorias que constiiuem o velor de saida Y. Este objetivo é equivalente
a minimizar a divergencia de Kullback4_eibler entre as duas seguintes dislribuicóes: (I) a fun^ao de
densldade de probahi kdade^.(y,W) paramclrizada por W c (2) a distribuicáo fatorial corresponden-
te definida por
A (yT w)=I! 0,TW) 11 o_74)
d"k
onde , W) é u. fun^o de densidade de probahilidade marginal de K. Na verdade, a Eq. (10.74)
pode ser vista como uma restricto imposta ao algoritmo de aprendizagem, for^ando-o a contrastar
7|j(y,W) com a diBlribuifio fatorial [ L, W) Podemos assim formular a lerccira variante do prin-
cipio Infomax para a análise de componentes independenles como (Comon, 1994):
Dado um vetor m-por-1, X rcpresentHodiT umtComhinaeao linear de ni h i ruis fiuile independenles, a
cransformaedo do vetor de observado X por um sistema neural em um novo vetor ¥ deve ser realiza-
da de tal forma que a dh-crgétieia de Kullback-Leibler entre a funcáo representante da probabilidade
paramclrizada /^yfW)c a distribuido fatorial correspondente jy(v.W) «ja nunimizada cm tela-
Cío á matriz paramétrica dcsconhecida W.
A divergencia de Kullback-Loiblrr para o problema descrito aquí c considerada na Scqáo 10.5. A
fórmula que estamos procurando ó dada pela Eq. (10.44). Adaptando aquel a fórmula á nossa sdua-
Hidden page
Hidden page
560 RnniisNiLLRACs
K1 ¡MT
log/j. (y,) = tagotfy,) 4- log 1+" ^(y,) +
?! 4!
x
(10.83)
Para prosseguirmos, usamos a expansáo de um logaritmo:
!og(l + r)
V
=- v-:—
2
(10.84)
onde todo® os termos de ordem trés e de ordem mais a ka sáo ignorados.
Da nossa discussáo anterior recordamos que a fórmula para a entropía marginal de Yf é (veja a
Eq. (10.43))
.A (y,) log/r i = l,2 m
onde rfí é o número de fontes, Utilizando as aproximaQocs descritas ñas Eqs. (1 0.78), (10.83) o
(10.84) e mocando certas integráis que envolvem a densidade gaussiana normalizada ct(y) e váritra
polinomios de Hermite H i l i. oblemos a seguirte fórmula aproximada para a entropía marginal
(Madhuaranth e Haykin, 1998):
ft( l'J- - logpire) • — - —
' 2 5 12 48
1440
3 i . «í4O
h " K I 1 J "1"
8 1(3 w 24 24
+ 4^ + ioQ* + <_++ io<,)]
64 16 432
(10.85)
Substituindo as Fqs. (10.76) c (10.85) cm (10.75), oblemos a divergencia de Kullback-Leibler para
o problema considerado:
?(W)=- - A(X) - log|def(W )|+ y log(2tre)
(kiJ4 + 10^,)
1440
3 2
--K;..K,4
l"
+ K. JKc6+[^)
24 ’ 24
64 16 432
(10.86)
onde os acumuladores sáo todos fun^oes da matriz de peso W.
Hidden page
onde W"re a inversa da matriz transpasta W< As derivadas parciais dos outres termos (que depen-
den de W) na Eq. (10,86) com relajan a HL sao (Veja as Eqs. (IC.8Ü) a (10.82))
^=341^1
te,. L 1
^d-44íX]-l2mu4X-*;]
1^.
“(«,. + IO*Í.) = «[ti’Xt ] - 3Cm ,44W I
-60»^ £[ ifjrJ +180^4^ ]
Na deriva^cío de um algoritmo adaptanvo. a ahordagem usual ó substituir 0$ valores esperados por
seus valores instantáneos. Assim, Riendo esta substituirán nestas tres equa^ocs, oblemos os sc-
yw.ules resultados aproximados:
atcJ3 _ i (10.89)
T * 3r. Ti
(10. «O
ÜlFj
+ " y6^ (10.91)
Substituir as Eqs. {10.88) a (10.91) na expressio para a derivada da Eq. (10.86) em retablo a w.
produz
A íyw)-- (W\+1p(.L.}I1
(10.92)
onde <00'.) ¿ a/iwfw r/e afñwfw náo-monóluna do algoritmo de aprendizagem, definida por
(Madhuranaih c Haykin, 1998)
rfr
— I.'í + I2811’- — v"
3 ' Zí 3 J
(10.93)
A1- ligara 10.11 tra?a a fuiujáo de ativa^áo opív) para valores de v no intervalo -1 < l. Isto cobre
r> intervalo de valores da saída do separador;; para os quais a operado do algoritmo de aprendíza-
gem está normalmente confinada. É in(encasante notar que a .itcllna^áo da futifAo de alivaqáo c
pos i 1 iva no intervalo { 0É734, 0,734); esta é urna exigencia para a estábil idade do algoritmo como
discutido man adíame tiesta sc^áo.
-1 -Oí -0,6 -Ü,J -0.2 0 0,2 0,4 0j6 0,8 1
y
FIGURA 10.11 Funf&o de a!iyapfio oO) da Eq. (10.93)
Algoritmo de Aprendizagem para AGI
O objetivo do algoritmo de aprendizagem é minimizar a divergencia de KulIbackLeibler entre a
furrio de densidade de probabilidade de V e a distribuido fatorial de lepara í = 1,2,..., m. Esta
minimizado pode ser implementada usándo se o método da descida do gradiente pelo qual o ajuste
aplicado ao peso é definido por
(10.94)
onde f| é um parámetro da laxa de aprendízagem.
Esiendendo a fórmula da Eq. (10.94) para toda a matriz de peso W do separador, podemos
expresar o ajuste AW aplicado a W como segue:
AW = r|(W '-OYh'i
onde xr é o transposto de vetor de observaban m-por-1 K, c
«Pty >=190,), tpO'p,..., ipti1 j]r
(10.95)
(10.96)
A fórmula para AW dada na Eq. (10.95) pode ser rescrita notando que
Hidden page
Hidden page
W(n+ l)
FIGURA 10.12 Grato da lluxo de sinal do algoritmo de aprendizagem para separado cega do
Jantes descrita riá Eq. Í1C 13-1)
* A expando de Gram-Charlicr usada para calcular a nao-lincaridade <íH j incluí um número
suficiente de termos para produzir uma boa aproximado para a entropía marginal /i(X);
esta exigencia c satisfeita, por exemplo. pela ftincáo de ativa^áo da Eq. (10.93).
• A taxa de aprend izagem p é pequeña o sufici ente para que a s csti i nací vas dos ac umuladones
de P sejam confíáveis.
Cansidoraqoes sobre a Estabilidad?
Urna discussao do problema da separado cega de fontes seria incompleta sem a considcrapao da
estabilidade do algoritmo adaptad vo descrito na Eq. (10.104). Em Amari et al. (1997), ¿ apresenta-
da uma análisegeral da estabilidade deste algoritmo para uma funpáo de al i vacan arbiirária tp(-). A
análisc ó realizada no sentido da convergencia assintótica do algoritmo para o ponto de equilibrio
desojado onde c garantida uma separapao de fontes bem-succdida.
A Equa^ao l LO. 104) c uma describan em tempo discreto do algoritmo de separaban cega de
fontes bascado no gradiente natural. Para o propósito da análisc de estabilidad^ o algoritmo c
neformulado cm tempo continuo como segue:
W(/) = n(/)(l-íp(y(0)yrU)]W(0
(10.105)
ende / representa □ tempo continuo, c W(í)= ¿W(/ydt. O parámetro da taxa de aprendizagem F|(r)
é positivo para todo tempo f. Considere que
ai — £[.'*?]
frpCi',)
3.r.
dfe)
< = ¿
(10.106)
(10.107)
(10.108)
Entáa, de acorde com Amari et al. (1997), a sólufáo para a separado ó um ponto de equilibrio
cstávcl do algoritmo adaptativo da Eq. (10.104) para urna fun^ao de ativafdo ariritrária q>( ) se e
sementé se as seguí rites condiQdes forem satisíeilas
+1 > 0
fr. >0
>1
(10.109)
(10.110)
<10.1I1)
para todo (¡j) com i £/ As Equa^oes (10.109) a (10.111) sáo as condeces necessárias e suficientes
para a estábilidade do algoritmo adaptativo da Eq. (10.104).
Considerandos sobre a Convergencia
Dado que techamos satisfeito as exigencias de estábil idade das Eqs. (10.109) a (10.111), o que
podemos dizer sobre c comportamento da oonva^éncia do algoritmo de aprendizagem da Eq. (10.104)
bascado na futido de aliva^o da Eq. (10.93)? Com base em um estudo experimental relatada em
Madhunanath e Haykin (1998), podemos dizer, gresso modo, que há duas fases no processo de
convergencia:
• Na fase k a variánciau^(¿r) da variável aleatória X na salda do separador passa por um
periodo de ajuste» após o que ela as inge um valor razoavetmente estável. Durante esta fase,
os acumuladores K^» Ki 4 e permanecen! essenciai mente constantes.
• Na fase Il? os acumuladores K .., k . e x . passam por um periodo de ajustes específicos,
após o que atingem valores razoavel mente estáveis, Heste ponto» podemos dizer que o
algoritmo ccnvcrgiu.
Parece assim que uma estimativa da variáncia c dos acumuladores de ordem mais alta das saidas
do separador (i.e., sinais separados de fbntes) forma a base de um procedimento para estudaro
comportamento da convergencia do algoritmo de aprendizagem da Eq. (10.104). É tambem inte-
rcssantc notamos que é apenas na fase II que o algoritmo conforma-se á expansáq de Gram-
CharEier.
Hidden page
Hidden page
onde P = *p ¡' = WA. O índice de desempenho óf é uma medida da diugortuhMe da matriz P Se a
matriz P for perfeitamente diagonal J " 0. Para urna matriz P cujos elementos nao están concentra-
dos na diagonal principal, o índice de desempenho 5 será alio.
Para as formas de onda mostradas na Fig- 10.13, # 0,0606.
10.13 ESTIMAQÁO POR MAXIM A VEROSSIMILH ANQA
ü método da análise de componentes independen tes (i.e., a tercera variante do principio Infomax)
descrito na sefáo anterior é apenas um entre varios métodos que foram propostos na I ireratura para
separapáo cega de fontes. Em um contexto teórico da informacáo, entretanto» há apenas dois outros
métodos para realizara tarefa de separado de fontes de uma maneira náo-supervisi onada: a máxi-
ma verossimúhan^a e a máxima entropía. Nesta sec-ao, discutimos a máxima verossimíllianija-
A máxima vcrossimilhancacum procedimento bcm-cslabclccido para a cstimacáo cstaíistica
com algumas propiedades desejáveis; veja a nota 5 do Capítulo 7. Neste procedimento, primeiro
formulamos uma funcáo logaritmo da verossimilhanca e cntáo a otimizamos em relafáo ao vetor de
parámetros do modelo probabilísliw considerado. Da dliscussSo apresen tada no Capitulo 7, recor-
damos que a fundía de verossinnlharija éa fumjáo de densidade de probabilidade do um conjunto
de dados em um determinado modelo, mas vista como uma fuñado dos parámetros deseonhccidos
do modelo. Rcfcrindo-nos á Fig. IO.9t considere qucy’(') represente a furu^áo de densídade de
probabilidade do Vetoralcallário fontc U. Enláo. a lurn^áodeden&idadcdeprobabilidadudo vetorde
observado X » AU na saída do misturadoré definida por (Papoulis, 1984)
/x(s,A)-|det(A) /JA x) (10.112)
onde det(A) c o determinante da matriz de mistura A. Considere queJi= represente um
conjunto de Ar realizantes independentes do vetor aleatorio X. Podemos cntáo escrcver
x
(10.113)
K mais conveniente 1 rabaIliartnos com a versáo ttormalizaífa (dividida pelo tamanho da amostra A )
da funcáo Logarismo da verOssirrii 1 han^a, como mostrado por
1 1
— log/x(¿,A) - — JJog/jifXpA)
A -1
= 77S,0SÁÍA',atJ_ fog|dct(A)
'* i*l
Considere que y = A seja urna realizado do vetor aleatorio V na saida do separador c que podra-
mos assim escrever
I ] r
— A) = — X (y*) - log|dct(A)| (10.114)
A A ;.|
Considere que A"’ = W e que/^.(y, W) représenle a funpao de densidade de probabilidade de ¥
parametrizada por W. EntJoT recqnhecendo que o samatóno na Eq. (10.114) é a média da amostra
de log/L(yJ, óblennos da leí dos grandes números que» com probabilidade I, quando o tamanho da
amostra V se aproxima do infinito:
Z{ W) = Um 1 V bg Mi,) + log|det( W>
= £[1oBX(yj]+1cg|det(W)|
(10.115)
/v(y.W)log/Jy) + log|del{W)|
onde o valor esperado na segunda linha é em relajo a Y- A quantidade £(W) é a fun?3o logaritmo
da veras si mil han qa desejada. Escrevcndo
podemos expressar £(W) na forma equivalente
£(W) =
f" f / (y)
Á(y-w)ioe ¿y+
J - A.My-W))
Á(y1W)log/v(y»W)rfy + log|dct(W)|
= D,J/l - A(¥,W) + log|del(W)|
(10.116)
onde A(¥,W) é a entropía diferencial do vetor aleatorio ¥ parametrizado por W, e í é a diver-
gencia de Kullback-Leibler entre y^(yT W) e(y), Usando a Eq. (10.76) em (10.116). podemos
simplificar a expressáo para a funq^o logaritmo da verossimilhanpa £(W) como seguc (Cardoso,
1098a):
£(W) = -DJs|íi -A(X}
(10.117)
onde A(X) é a entropía diferencial do vetor aleatorio X na entrada do separador. A única quantidade
na Eq. (10.117) que depende do vetor de peso W do separador c a divergencia de Kullback-
LeíblerZ) . . PortantoT concluimos da Eq. (10.117) que maximizar a fun^ao logaritmo da
verassimilhahca £(W) é equivalente a minimizar a divergencia de Kullback-Leibler^. isto é,
casar a distribuido de probabilidade da saida do separador Y com aqueta do velar fonle original U,
o que é intuitivamente razoável.
Relapso entre a Máxima Vemesi mil han qu o a Análltte
de Componentes Independentea
Aplicando a dtcomposicáo de Pitágoras descrita na Eq. (10.45) ao problema considerado, podemos
expressat a divergencia de KulIback-LeibLerp ( para a máxima verossimilhanqa como segue:
(10.118)
A primeirá divergencia de Kullback’Lciblcr/^ |¡> no lado dircilo da Eq. (10.] 18) é uma medida de
dsscaxamcnin wtrufarül que caracteriza o método de análise de componentes independentes. A
segunda divergencia de Kullback-LeibterD^ «urna medida de dexeasamenta margina! entre a
distribuido marginal da salda do separador Y ca distribuicác do veto? fonte original U. Podemos
assim cxprcasar o criterio “global” de casamento da distribuida^ por máxima verossimilhanqa como
segue (Amari, 1997; Cardoso. 1998-a):
Descasamento 'j f DcscasamcntoA ^Descasarncnto
total ) l. estrutural J i margina!
total ) l
estrutura!
(LO.! 19)
O "descasamento estrutura!” se refere á estrutura de uma distribuiqáo relativa a um conjunto de
variáveis independen tes, cnquanlo que “dracasamento marginal” se refere ao descasamento entre
as distribuyes margináis individuáis.
Sob a condi cao ideal W = A (i.e., separacao ccga perfidia de fonlcs), tanto o dcscasamcntc
estrutura! como o descasamento marginal desaparece™. Neste ponto, a máxima venossimilbanca e a
análisc de componentes independemos produzem a mesma solu^áo. A rela^aci idealizada entre a
máxima verusMm.llian^a eaanilisede componentes independentes é mostrada nú Fig. ID. 14 (Car-
dóse, 1996; Amari, 1997). Nesta figura, íf é o conjunto de todas as fuñares de densidade de proba-
bilidade y) do vetor aleatorio Y na saida do separador; Jco conjunto de todas as distribuí i i^nes de
probabilidade independentes, isto é, aquelas na forma de produto. Ambos £f e & sSo de dimensáo
infinita. O conjunto & “ {/¿(y,w) r ® 0 conjunto finito de distribuyes de probabilidade medidas na
saida do separador. O co-njunUj S} tem dimensionalidade m:, onde m é a ditncnsüij de Y, e a matriz de
peso W é um sistema de coordenadas dentro dele. Da Fig. 10,14 vemos claramente que tanto £>Á o
como£)- |fi sáo minimizados cm W = A1. É interessante pravarmos que os conjuntos S) e # sao
mesma onogonais no seu ponto de interseco definido pela ftmtfci de densidade de probabilidade
/v(y).
Um algoritmo para separado cega de fonles baseado na máxima verassitni 1 hanpa deve incluir
condiqocs para estimar as dislribuicocs relativas ás tontos quando sao desconhecidas, o que é típica-
mente o caso. Os parametros para esta estimado podem ser adaptados assim como adaptamos a
matriz de peso do separador W. Era outras palavras, devemos realizar uma cstima^üo <,:tinfama da
matriz de mistura e (algumas caracterísrcas) das distribuyes das fontcs (Lardoso, 1997, 1998a);
urna ahcrdag.ein elegante e bem-desenvoh ida para esta estinHffo é apresentada cm Pham et al.
(1992, 1997).
10.14 MÉTODO DA MÁXIMA ENTROPIA
O méiwfa da máxima eníropia para a scparaqáo de fbntes foi proposto por Bell c Scjncwski (II995).
A Figura 10.15 mostra o diagrama em blocos do sistema bascado neste método. Como anteriormen'
te, o separador opera sobre ú vetor de observarán X para produzir uma saida Y = WX que é uma
estimativa do vetor fonte original U, O vetor Y ¿ transformado em um velor Z passaodü'O através de
urna nao-linearidade de múltiplas componentes representada porG(-), que c monótona e pode scr
invertida. Assim. aoconlrário de Y. garante-se que o vetor Z tenha uma entropía diferencial limitada
/?(Z) para um separador arbitrariamente grande. Para uma n3ü-]inearidadcG(-) predeterminada, o
FIGURA !(kl4 UifJraf&ú da relapso entra a máxima veroesiinilhafífa a a análise da comportantes inoe-
pendenles pana separíi^áo caga da tontos. A máxima varossimilbanca minimiza O . soquanto que a
Hná istj de compnr.Rntes independe ntEsi minimiza D
método da máxima entropía produz uma estimativa do vetor Fonle original U maximizando a entropía
A(Z) em relajan a W. Com base na Eq. (10.55) derivada no Exemplo 10 6, vemos que O método da
máxima entropía está intimamente relacionado ao principio Infbmax.
A náo-linearidade G é um mapa diagonal descrito por
r&Oi)i r^i
_ *Í
(1DJ20)
Hidden page
A(Z)^-E[log/,(z)J
- - /< log
-£-+rzi
= -D , . calculada em u = *P(z)
(10.126)
Vemos assim que maxímizar a entropía /r(Z) é equivalente a minimizar a divergencia de Kullback-
Leibler entre/Ju) e uma fun^to de densidade de probabilidade de L de funda por |det (J(u))|,
Suponha agora que a vartávcl aleatoria Z (i.c., o j-csimo demento de Z) seja uniformemente
distribuida dentro do intervalo [0„ 1] para todo í. De aconto com o Exemplo 10. lt a entropía A(Z) e
cntáo igual a zcro. CorrcspondentCmcntc, constatamos da Eq. (10.126) que
jyu) = |det (J(u))|
(10.127)
Scb a condi^áo ideal W = A-1, esta rcla^áo se reduz a
para todo í
(10.128)
í. ’fi >
De modo invcra3t podemos diaer que, se a Eq. (10.128) for saliste i la t cntáo maximizar A(Z) produz
W - A-1 e a separado cega de fonies é assim realizada.
Podemos agora resumir os resultados obtidos sobre o método da máxima entropía para a sepa*
ra^c cega de fontes como segue (Bell e Sejnowski, 1995):
Considere que a itiodifiearidade na saída do separador da Fig. 10.15 seja definida em termos da
distribuicao original das fontes como
A !.«, Je/tí, para i = 1,2,.
(10.129)
Maximizar a entropía do vcior aleatorio Z na saida da náO'linearidadc G é cntáo equivalente a
W A-1, o que produz a separarán perfeira das fonie*.
Os métodos da máxima entropía c da máxima vcrossimilhan^a para separaban cega de fontes sto
de falo equivalentes sob a condi fio de que a variável aleatoria Z seja uniformemente distribuida
dentro do intervalo [0, I] para todo i (Cantoso, 1997), Para provarmos, esta relajo, primeiro
usamos a regra da eadeia do cálculo para rcscrcvcr a Eq. (10. 125) na forma equivalente
(10.130)
A matriz jacobiana J pode assim serexpressa como
J = DWA
onde D é a matriz diagonal
/
D = diag
Sv. * Si *
I K í
"’ih'
&
Assim,
idct(j)i=|dOt(WA)in^-
J-l
(10.131)
Urna estimativa da fun^to de densidade de probabilidade./J/u) parameo izada pela matriz de peso
W e a náo-linearidade G, com base na Fq. (10.131), pode ser escrita formalmente como (Roth e
Bañara. 1996)
.4. (I1| W ,C) =|*l(WA)in
J«1 Vi
(10 132)
Vemos assim que. súb esta cóndilo, maximizar a funffio logaritmo da verossimilhaoca logyj.(u
|W,G) é uqu i váleme a maximizar a entropía A(Z) para a separado cega de fontes. lato é« ©s métodos
da máxima entropía e da máxima verossimilhanjfa sáo equivalentes.
Algoritmo de Aprendizagem para Separado Caga de Fontes
Com referencia á segunda í inha da Eq. (10.126), notamos que, como a distribuidlo das fontes c
típicamente fixa, maximizar a entropía A(z) requer maximizar o valor esperado do termo do deno-
minador log |dct(J(u))| cm relapso á matriz de peso W. Te nd o como objetivo um algoritmo adaplatívo
para realizar esta compntacño, podemos considerar a objetivo instantánea
di - log det(J)|
(10.133)
Substituir a Fq. (l Q. 131) em (10.133) produz
(10.134)
Assim, diferenciando d* cm rclaQáo á matriz de peso W do separador, oblemos (veja o Problema
10.16)
(10135)
Hidden page
¿W = Tj- -
= ihw r+(i-ii)xr)
(10137)
onde T| c o parámetro da laxa de aprendizagem. Como no caso da análise de componentes ¡ndopen-
dentes, podemos eliminar a neccssidadc de inverter a matriz de pesos transpostaVi 'usando o gra-
diente natural, o que é equivalente a multiplicar a Eq. (10.137) pelo produto matricial W^W. Este
escala mentó étimo produz a fórmula desejada para a modi Reacio dos pesos;
AW = n(W’r+(1 2z)ir)WrW
= q(t+(l-2iXWl)r)w
= níJ+(l-2z)yr)W
(10.138)
onde o vetor y c a saida do separador O algoritmo de aprendizagem para calcular a matriz de peso
W c com ¡sso
W(n + l l W(w) + T1([ + (l - 2í(pr»yT(re))W(«>
(10. B9)
O algoritmo é । nicial i ?ado com W(0) sesionado de um conjunto uniformemente di si ribo ¡ido de
números pequeños.
Considerantes teóricas o investigantes experimentan mostraram que o algoritmo de aprendi-
zagem da Eq (1 0. 139) é Limitado u separado de fontes com distribuidles supergaussianas (Bell e
Sejnowski, 1995); para a definido de distribuyes supergaussianas, veja a nota 18. Esta limitado
é urna conseqüéncia d:rcta do uso de uma fundan logística para a nao-linearidade no terminal de
saída do sistema da Fig. 10.15. Em particular, a fun^úo logística impoc euntiecimentó previo, isto c
urna forma supergaussiana, sobre a distribuido da Ponte. Entretanto, a restribo no miitcdo da má-
xima entropía á fundan logística nao representa nada a mais do que a restriban do método da máxi-
ma verofisimilhíuica a algum conhecimento prévío. A aplicado de método da máxima entropía
pode ser amp i ada para um espectro mais largo de distribuyes de fente modificando-se o algoritmo
de aprendizagem da Eq. (10.138) de modo a considerar a estimativa conjunta da distribuyo relati-
va áx fontes e A matriz de mistura. Esta exigencia c similar aquel a discutida para a máxima
vcrossimilhanca na sc?áo anterior.
10.15 RESUMO E DISCUSSÁO
Neste capítulo, eslabeleccmos a informarán mutua, fundamentada na teoría da luforma^áo de
Shan non. como ferramenta estatifica básica para a auto-organizaíáo. A informado mútua entre
um processo de entrada e um processo de iaida tem algumas propriedades únicas que sugerem sua
adn0o como a funfáo objetivo a ser otimizada para a aprendizagem auto-organizada. De fatnT
alguns principios importantes para a aula-organiza^ao emergíram da discussáo apresentada neste
capitulo;
• O principio da máxima informa^iio mutua (infomax) (L inskgr, 1988). Este principio, na sua
forma básica, é bem adequado ao desenvolví mentó de modelos auto-organizados e mapas
de características.
• A prímeira variante do infomax, de Decker e Hinton (1992), é bem adequada para o
processamento de imagens onde o objetivo é a descoberta de propiedades de uma entrada
sensorial ruidosa exibindo cocrcncia através tanto do espado como do tempo.
* A segunda variante do Infomax, de Ukraíncc e Haykin (1992), encentra aplicares no
processamento dual de imagens no qual o objetivo é maximí zar a diferenciado espacial entre
regíaos correspondentes de duas imagens separadas (vistas) de um ambiente de intere&se.
* A tcrccíra variante do Infomax para anáiise de componente^ independentes foi proposta
por Comen (1994), embora suas raizes remontem a hipótese de Barlow (Bariow, 1985,
1989). Apesar disso, em Comen (1994) foi apresentada pela primeira vez uma formulacáo
rigorosa da analise de componentes independentes.
* O método da máxima entropía de Bell e Sejnawski (1995), que está tambem relacionado
com o principio Infomax. A máxima entropía é equivalente á máxima veiossimilhanpa
(Cardóse, 1997).
A análise de componentes independentes e o método da máx ima entropía fornecem dois métodos
alternativos para a separado ccga de frutes, cada um ofcrcccndo atributos propnos. Um algoritmo
para separado cega de fontes bascado no método da máxima entropía é simples de implementar,
cnquanlo que um algoritmo correspondente bascado na anal i se de componentes iindepondentes é
mais elaborado na deriva^áo, mas pode ter uma api icabil idade mais ampia,
Uma motivado neurobiotógíca que é freqüentemente citada para a separa^áo cega de fontes é
o fenómeno da festa de coquetel. Este fenómeno se refere á notável hábilidade humana de sintoni-
zar seleti veniente e seguir uma entrada auditiva de inieresse em um ambiente ruidoso. Como expli-
cado no Capitulo 2, o modele rieurobialó¿iico envolvido na soluto deste problema muito di fie 11 de
processamento de sinal é muito mais complicado do que aquilo que está envolvido no modelo
idealizado descrito na Fig. 10-9- O modelo neurobiológico envolve as formas de processamento
tanto temporal coma espacial, que sao ncccssárias para i i dar com atrasas dcsconhccidos, reverbera-
ban e ruido. Agora que temos um entendimento razoavdmente fírme das questóes básicas envolvi-
das na solufáo neural para o problema padreo de separado cega de fontes, talvez seja oportuno
atacarmos problemas da vida real cm uma escala comparável ao fenómeno da festa de coquetel.
Uma OUtra área de pesquisa em aherto, merecedora de ateneo detalhada, é a deconvoitt^ao
cega, Deconvolufáo é urna operado de processamento de sinal que idealmente desfaz os efe i ios da
convolupáo realizada por um sistema linear invariante na tempo operando no sinal de entrada, Mais
específicamente, na deconvclu^áo ordinaria tanto o sinal de saída como o sistema sao canhecides,
c o objetiva é reconstruír aquíIo que o sinal de mirada deve ter sido. Na deeonvolucáo cega, ou em
termos mais precises, deconvolu^áo náo-supervísionada, apenas o sinal de saída é conhecido e
pode haver tambem mfrrmapao sobre as eslatisticas da fonte; o objetivo é encontrar o sinal de
entrada, o sistema, ou ambos. Claramente, a deconvolucáo ccga é uma larefa de processamento de
nial mais difícil que a decanvolu^o ordinaria. Embora a deconvolu^áo cega tenha de fato recebido
bastante ateneo na literatura (Haykin, 1994a), o nosso entendimiento de uma abordagem teórica da
informapBo para a deconvolupSo cega quando comparado ao problema da separacao ccga de fontes
está em um estágio inicial de desenvolví mente (Douglas e Haykin, 1997). Além disso, uma soluto
efetiva em termos de cusios para a equalizacáo cega de um canal hostil tai como o canal de común i-
ca^ao móvcl é Cao desafiador quanto o problema da festa de coquelel.
560 Redes Nsuraih
Em resumo, a adaptaba» cega, seja nu contexto da separaba de fo rites ou da deconvolu^ac^
tem um longo caminho a percorrer antes de alcanzar um estágio madura de desenvolví menta cora’
patfvel ao da aprendizagem superviví anacía.
NOTAS E REFERENCIAS
1. Para um traiamenio deialIrado da teoría da informado, veja o livro de Cover e TbomM
{1991); veja também Gray(199O). Para uma colecto de artigas sobre o desenvolví memo
da teoría da informado (incluindo o artigo clássróo de 1948 de Shannon), veja SLepim
{1973). O artigo de Shannon está também reproducido, com pequeñas. reviso», nos livres
de Shannon e Weaver (1949) c Sloane e Wyner (1993).
Para uma breve revi sao dos importantes principios da teoría da infornia£áci (eruto em
mente o processamenlo neural. veja Atick (1992). Paraum tratamento da teoría da infor-
de urna perapetkva biológica, vejaYockey (1992).
2. ü prme i pío da máxima informas w mutua de Lróslwr pama auto-organiza^ic nao deve ser
confundido com a regra da preservaciío do contenido de infonnasáo para lomada de deci-
sao, urna regia prática que é brevemente discutí ila nú Capítulo 7.
3, Para uma revis&o da jIit;í!ijt.i sobre a relajan entre let ria du iuforma^io e percep^io. veja
Linsker (1990c) c Atick (1992).
4. O termo "entropía”, em um contexto de teoría da informado, deriva seu nomo da analogía
com a entropía na termodinámica; esta última quantidade é definida, por (veja o Capitulo
10
onde é a constante de Boltzmann o pa é a probabil ¡dade de que o sistema esteja no
estado a. Exceiopclo fator Ar a fórmula para a entropía /fnu tenntxlinámiua tem exatamente
a mesma forma matemática da definido de entropía dada na Eq- (1 D.&)
5. Em Shore e Jotinson (1980), prni-se que o principio da máxima entropía é córrete no
seguróte sentido:
Dado fonhccimentn previo na forma de rrxtri^oc^ há apenas uma distribuirán que
satisfaz estas rcstrícocs que pode ser cscolhida por um proccdimcnto que satisfaga os
Axiomas de consistencia"; esta distribu ¡cao única c definida como a entropía de
maMmizafáo.
Sin quiltro us axiomas de COnsistincia:
L Unicidade: o resollado deve ser único.
II, linnriinci a; a escol lia de coordenadas ruto deve alelar o resultado.
III. IrtdeperidértCij do sislema: tláo deve faaéT difeninca K é levada em tonta infuma-
v :lo independente sobre siiteow ¡ndependentes separadamcnit. em termos de dcti'
sidades diferentes, ou de forma conjunto, cm tenues de uma densidade conjunta.
[V. Indepcndéncjj de subconjumo; náo deve importar se um subcoojunto- independente
de eslados do sistema é tratado ein termos de orn# densidad? condicional separada
ou em termos da densidad? total do sistema.
Em Shore e Johnson (L9R0),émnütrado que a cnlropia relativa oua divefj>jrócia de Kullback-
l.cihlcr também wtisfaz os axiomas de consistencia.
6l Para uma discussao do método dos multiplicadores de Lagrange, veja o livro de Domy
(1975).
7. O [enno /(X; F) era originalmente referido como a tara de transmissav de mformafáG por
Shannon Moje, contado, este termo ¿ nannalmcnlc referid^ como □ informaijao
mútua entre as variáveis aleatorias X e F.
8. Para pro var a dccompos^ao da Eq. (10-45). podemos proceder como segur. Pdr dcü n i<;so
temos
(I)
Das deíini0es de / í i) temos que
Considere que & represente a integral na última linha da Eq. Ü ) Podemos cnüo rscrever
(2)
onde naülLima linha usamos a definido da Eq. (10.39). A integral na Eq. (2) é a divergen-
cia de Ku!]báúk-Ltibltfr £kpara i= 1, 2...., m. Par? colocar 3 OQHUlfo psni /í na sua
ícHrna fínaL noLamos que b área sah de | i ,) é unitaria, c portanlü ncrcvcrnoH
jF=X riÁ.tTJ iog
,., ruco
-77------------
i n < w
(3)
onde na primeira linha usamos ¿1 definii,jiF til dxjttlP como descrito iki, Sc^io 10.?
Assim. substitumdo a Eq. O) cm {I}, obtemos a tiedOmpíisi^ desojada:
D . D .. + D. t
Wí
9. Nadal e Parga (1994, 1907) tambem disculcm a relajo cutre o Infomax c a redujo de
redundancia, chygando a uma concluido si nadar de que a maximiza^ü da ¡nibrma^ün
mutua entre o vetor de entrada c o velor de saida de um sistema neural leva a redujo de
dados. Huir e van Hemmen (J 99B) discutan a imple mentado de filtros Infomax para a
retina. FltS mostram que a redundancia é cssencial pitra alcanzar robustez contra ruido de
urna representado interna do ambiente como ela c producida por um sistema como a
retina.
14. Beekcr e Hincón (1992) usam a acrosscmid ]1(. para se referirem á primeira variante do
principio ínlbmax
11. E m Un I cy 11970) considera- se um cuminhn fia negativa para ot i n . izar o nega-
1ivo da informaban mútus entre Bináis na entrada e .i saida de) caminiio. Mostra-sc que
um sistema assim se adapta para se tomar um di serien inador do padráo mais freqüente que
ocurre no con ¡unto de sinais de entrada durante a adaptado. O modelo é chamado de
"informen", que se relaciona iradamente com a segunda variante do principio Infomax.
12. O sislona descrito cm Ukraineu e llaykin (1996) incluí um procesMdbr de detecto q
posterion que utiliza intorma^áo previa sobre a localizado do rcfictor ao longo da borda
entre agua e Ierra ifo cu rao d’Ayua. Uní pKKWiCitftJf tit? lógica nabuiwa (fuzzvj Combina o
desempenho da detecto primaria com a saida de um delector de borda bascado cm visño
para remover cfclivamcntc alarmes falsos, resultando assim cm uma melhoria extra do
descmpenlio do sistema.
13. A separado cega de fonl.es remonta U íirtigu fundamental de I léniuh. Jutten e Ans (19Í5).
Para Util relato hisforico <10 problema de separacao liega de fontcü, veja Nadal C Raiga
(1997); este amigo umbúm enfatizaos aspectos ncunob ^lógicos do problema. Para uma
'. isáo gcral aprofundada da separaráo cega de fontes, com ¿nfosetuH principios relaciona'
dos com o processamento de cirial, veja CardiíHo (1998ft).
14. Aprtuiniiis'áo da l-'un^áo de Densidade de Proba bi lid a de
(a) A f.r/IrTFKíJfl rfe
Considere que ’O^di) represente a fun^üít de uma vari.ivd aleatoria Ytendo
a ÑncAo de densidade de probabilidade/¡(r). Por ddiniQáo temos
<Pj (m) -
(])
onde j = e w c real. Em outras palavins, a fun\-so cSHCterística tp^co) ca transforma-
da «le Fourier da fuñólo de densidade de probahi I i da de/Ur), cxccto por uma troca de sinal
no expoente. Em. geral, a fundió auacterif nca é um número complexo cujas panes
real c imaginaria sSo imitas para todo íd. Se o t-ésimo momento da variável aleatória Y
existir, cnt&o qj,(toj podo ser expandida cm urna serie de potencias cm uma viíinhanpa de
to = 0 como segur
(2}
onde wí é O ¿-¿simó momento de Ordem da variivtl ileatónu Kh é definido por
(3)
Deriva-se a Equaqáo (2) simplesmente substituido a expansSo da fun^o exponencial e™
na Eq. (]), trocando a ordem do somatón» c da integral c cnl&o invocando a definí ^ÉSo da
Eq. (3). Se a fun^So característica tp^tu) puder ser expandida como na Eq. (2), entAo pode-
mos também expandir o logaritmo de (p/toj como segue (Willu, 1962):
log q>y (u) = Y
II-1
Cuide K_ é dtflúrTi ¡ iIímIü ü doran .VEffri-dTivíiFJM/e de urdprn uda vsripvcl aleatoria K
A Equa?ao (4) é derivada cxpandindo-sc o logaritmo de rf/.w) cm uma serie deTaylor em
yuj cm tomo de tó = 0.
Para simplificar o deseiwolvimento, a partir de agora Ruemos duas £uposi0es:
L A variável alratória Y tem média zcro. isto c. H = 0.
2. A varíincia de Y é normalizada em relamió ú unidade, iílo é,a:“ I.
Conespondcntemenle, temos kl- 0, Kj = Lea expansSo na Eq. (4} se toma
1C
lof^(m)i=-(jny + J-K/tt)"
2
Agora, considere que
(5)
Podcinos cntSn ramwv a cq. (5) como
lOg^G») = y (jd))1 + F-ÍO»
Ts.tií é, a Tundió característica tpT(to) pode ser expressa como o produto do dois termos
expone ociáis;
= EM|
(6)
Usando a expandió em sénr de potencia para o termo exponencial cxp(r<to)), temos
। x l" (í.’>)
exp(r([j») = L + Y——
í-1
o
SubstiíuíTida a Eq. (7) ein (6} c apupando os termos com potencias iguais de (/w) no
somatóno duplo resultante, obtemos novos coeficientes da expansao Je cp.tcu} tais como
estes mostrados aquí:
£
f.
= 0
= 0
—___
6
_
" 24
--S-
120
= — (k\+]0k?)
720 *
----ÍK + 35k.kJ
5040 T J 1
—-—-{k. + 56k.it, + 35kÍ
40320
c msiin por diante. Podemos agora fazer a transformada inversa de Fnuricr de para
obter uma expansáo para a fuñólo de densidade de pnihabilidade /Jp), Em particular,
podemos escrever
Z<r)’<Ky) 1 + Sc/fAv)
(8)
onde ctíj) é n fim^io de dcnsiJadc de pnihahihdadt de urna variávei uleuióriu gumíxiana
trormuli-udade média zero e variinda unitaria;
tx(.i') =
_ e*1'1
(9}
A expansao da Eq. (ft) é conhecida como a .rerfe tí? (iram-CItar-irer de uma fun^ao de
densidade de probabil idade em termos da fundió gaussiana c de suas derivadas (Síuart e
Or<k 1994), Uma cxpamSo desie tipo tem uní apelo intuitivo. Em particular, sea variável
aleatoria Y consiste da soma do um número de vari ¿veis aleatorias independen te e
idénticamente disErihuidas, entáo quando o numero dessas \-ariáveis aumenta, o teorema
do l imiic central nos diz que a variável aleatoria K éassmloticamcnlc gaus'nana. O pnmei-
ro termo da serie de tiram-CharLier é de tato gaussiann, o que significa que para e$la soma
O rosto da serie su aproxima de zcro quando o número de variáveis na soma aumenta.
O pfíUfiófítia de Henuite íf/j') que aparece na Eq. (B) c ítefinido cm termos das k~
¿simas derivadas de ab ) por
(10)
Alguns polinomios de Hermiie típicos sáo
"□Cc) = i
tíiíy) = / - 15/ -+ 4 s>7 -15
Uma relaqáo recursíva para estes poliridmlos é
(H)
Uma propriedade particularmente útil dos polinomios de H emite é que ^(j1)c a rtt-ésima
derivada da fim^So gau$siana a^r) sin binritjgwwi.'i, como mostrado por
(12)
6Am c o delta de Kroneckcr, que c igual á unidade se = m c zero caso contrario,
É importante se notar que a ordem natural dos termos náo é a melhor para a serie de
Gram-Chariicc Em vez disso. os termos listados aquí em paréntesis devem ser agrupados
(Helsirom< 196»)
i- (0), O),(4,6),(5, 7,9)
(13)
Os elementos destes grupos sáo normalmente da mesma ordem de magnitudc. Se rctrer'
tdos termos até 4 = 4, por ejemplo, devemos também incluir □ termo 6.
(b) A Expamao de Edgeworfh
Como anteriormente, considere que ra(j?) representen func&ode densidade de probabilída-
do de uma va riiávd alcotón .i normalizada para médi;s zero e variincia unilfru. A expansio
de Edgeworth da fúñelo de densidade de probabilidade de uma variável aleatória cm
tomo da aproximado gaussiana cíó) ¿ dada por (Cotnon, 1994; Stuarí e Grd, 1994)
" 1 + HM + W + w
W+«.(»+HM +
/! 9 ür N.
35*; „ t . 2IQ0KÍ^ u s . I5400KÍ „ . .
+-rtf<w ~íw^H”t-'’* —í^"'í(-’>+ •
(14)
onde te representa o acumulador de ordem í da variável aleatoria escalar padronizada K, e
fí representa o polinomio de Hermite de ordem i. A Equaijáo (14) é chamada de serie de
Ed^mrtk
A caractcri s1 i ca-chavc da expensan de Edgewórth é que KIH coeficientes d«TOceni
unirnrmemenie. Por outro lado, os termos na expansao do Gram-Charlicr da Eq. (8) nao
íendem uniforme ni ente a zcro do ponto de vísta de enos numéricos; isto é, em geral ne-
nhum termo é dcsprozfvtl comparado com um letmo precédeme. É por esta razio que o
precedimenlo recomendável para truncar a expansáo de Gram-CharlicT c seguir o agrupa-
mente de termos descrito na Eq. [13).
15. A idéia de usar V*D (VDJW'W em vez do ^radíenle usual V¿) para resolver o problema
de separado de fcmics é descrita em CSTÓOSO e Laheld (1996). Lá. V*D é referido como o
gradiente relativa. Eslc gradiente c exatamente o mesmo que o gradiente natural, cuja
definido resulta de uma perspectiva geométrica da informadlo (Aman. 1998; Amari et al.
1996). Ihn algoritmo similar foi descrito anteriormente cm Ciehocki c Moszczy iiski (1992)
e Ck-hm.ki (ti al., 1994).
16. No espado iiemanniano de dimensao d, por exemplo. a norma quadrada de um vetor a é
definida pm
IHf
(inde üüg sais fun^íieji (Luk CMFdflUUlM x., .vj dn C3pb$O ritmg.nni-ariün gL, = g, C O
Lado dircito desu eqnesslo c scniprc positivo. Eau expressto é unía generalizpflo di
fórmUila eucLidiana pura uma tIúttIU t|uadraJu:
l|a||3 = ¿^
Para ujna di&cussáo da eslnitura riemanniana, veja Amari (1987) e Murray e Rice (1993).
17. Bell c Sej nowski (I995)se referem a ¡¡cu método de separado ccga do fortes como Infomax
com base na Eq. (19.55) que define a relajo entre a entropía fl(Y) e a informado mútua
/(V; X). Entretanto, a tenninologia prcfcrivcl c “mclodo da máxima entropía" já que en-
volví a max¡m¡za(jáo da entropía A(Z), onde Z - G( Y). Urna nota de ¡.dverténuiii: o méto-
do da máxima entropía para a separado cega de fontes de Bell c Scjnowski nao deve ser
confundido com o método de máxima entropía ÍMMEj de Burg (1975) para y enálire
espectral.
18. Diz-sc que uma variável aleatória Xé fubgmmfcinu (Benvenisle ct al., 1987) se;
* ela for uniformemente dislribuida, ou
* a sua fuñí 3o de deiuidade de probabilidade /^.v) puder ser expreua na fomia exp(-
t^xjj ondear j é uma fun^jj par que é d i fcrenciávck cxcclo possívcl mente na origem
< £(r) e g '(xji'x sao csiritarncmc crcsccmcs para O < r <
Podemos tcr. por exemplo. jrf.t) com p > 2.
Entretanto, se £ ( v).'i forestriiamente dccreüccntc para O < a <*» c as demais prapri-
edades mencionadas furem válidas, a variável aleatória X c dita ser .¡nfKr}fí¡f¡.,r.,tiinta
(Beiiveniste l! al., 1987). Podemos tcr, por exemplo gf.x) = .rl* cora p < 2.
Algumas vezes (talvcz de um modo abusivo) o sinal ¿a cuitóse de uma variável alea-
tória é usado como indicador de sua sttbgauss1 an idade ou supergaussianidadt:. A curta»
de uma variável aleatoria A'é definida por
Buscado mito, a variável aleatoriaXédita serisubgau&jiami ou supcrgaussiuna se a curióse
Ajíx) fcf negativa tr.. positiva, respectivamente.,
PROBLEMAS
O Principio MaxEnt
10.1 O suporle de uma variável aleatoria JT(i.c„ 0 iutenralo de valores para os quais ela ú náo
sera ) é definido por [‘a, b]; nifo há nenhuma outra restri^ao imposta a esta variável aleato-
ria, Qual í a distribuid de entropía máxima para esta variável aleatoria? Justifique a sua
res posta.
A Irforma^áo Mútua
10.2 Derive as propriedades da informad mútua !(X; >'l entre dois valores aleatónos com
valores continuos Jl" e Y como descrito na Sepao 10.4.
10.3 Considere um vetor de entrada aleatorio X constituido de uma componente primé i ¡a X, e
de urna componente de contexto X,. Defina
X = <X,
2, = b.rX.
Como a infonnflj^ao mutua entre X{ e X, «ci relacionada com a informado mútua entre Y
e Assuma que o modelo de probabilidade de X é definido pela distribufoáo gaussiana
multivariadah
onde |1 é o vetor média de X e £ é a matriz de covat i Jncia.
10.4 Neste problema, exploramos o uso da entropía relativa ou divergencia de Kullbaek-Leibler
para derivar um algoritmo de aprendizagem supervisíonada para perceptrons de múltiplas
camadas (Hopfield, 1987b; Baum c Wilczek, 19SR). Para sermos específicos, considere
um perceptron de múltiplas camadas consistijido de uma camada de entrada, uma camada
oculta e uma camada de saida. Dado um caso ou exemplo a ^presentado na entrada, atri-
bui-se á saida do neurónio í na camada de saida uma interpretadlo probabil Istica:
-Vjtift Pt.n
+(l-g1¡1I)IO£
Cornspundeniomente, considere que y n represente o valor reai (verdadeiro) da probabili-
dade condicional que a propo^icao fr seja verdadeira, dado o caso de entrada a. A entropía
relativa para o perceptron de múltiplas camadas é definida por
D F
onde í & prcib^bil-dade ¿z prMw¿ da ococrtocU Jo cua ol
Usando como a fun?ao de custo a ser otimízadi, deríve uma regr^ ir
para treinar o pcitepífl>n de múltipla# camadas.
O Principio Infomax
litó Considere dois canais cujas saldas séo representadas pelas variúveis aleatórias X c Y. O
objet i vo ¿ maxim izar a infonTLÉnSo mútua entre JC e Y. Mostré que este objet¡vo é alcanzado
quando duas condi^oes forero utitfeitM:
Hidden page
Modelos Teórecs d a Informado 589
onde Nue Nb tfa as componentes ruido em e respectivamente.
(h) Demonstre a interpretado desta informacSo mutua como uma relajo entre sinal-
man-ruido para ruiiki.
Análise de Componentes Independentes
10. R Papa urna OCfnparaySo JcUlhaJa entre a análisc de componentes principal i s (discutirla no
Capitulo 8) e a análise de componentes independentes (discutida ueste capitule}.
10.9 A análise de componentes independen fes pode ser usada como um passo de prc-
proccssamcnto para a análisc aproximada de dados antes da detecto e da classifica^So
(Coman, 1994). Discuta a propriedade da anal i se de componentes independentes que pode
scr explorada para esta aplicando.
10.10 O ¡íímffrra de Durmoii' afirma que a soma de variáveis i ndependemes pude ter disírihuicao
gau^iana apenas se estas variáis tiverem tlasmcsmas rlisiribuyocs gaussianas (Darmois,
1953). Ut¡ 1» a analise de componentes independentes para provar este teorema.
10.11 Na prática, uma implementayáo algorítmica da análise de componentes independentes
pode apenas buscaras componentes lLt5o estilísticamente independente quanto posslvel".
Centraste a soluc^o para o problema da seperapao cega de fontes usando este algoritmo
com a soluto obtida usando um método de decorrelafio. Assuma que a matriz de
covariancia do vetor de observa;áa seja nio-singular.
10*12 Com referencia ao esquema descrito na Fig. 10.9, mostré que minimizar a informayáo
mutua entre quaisquer duas componentes da saída do separador Y é equivalente a minimizar
a divergÉnciiL de Kullback-Leíbler entre a fundió de densidade de probabi 1 idade
parametrizada^Jy, W) e a distribuiyao fatoriai correspondente í^(y, W).
10.13 O algoritmo adaptar i vq para a separado cega de fontes descrito na Eq. (10.104) tem duas
propriedades importantes; {I} a propriedade cquivariante e (2) a propriedade que a matriz
de peso W é mantida nüü'Singular. A propriedade {I) é discutida com algum delalhe na
pane final da Sc?áo 10.1II. Nesle problema, consideramos a segunda propriedade.
Desde que o valor inicial W(ü) utilizado no inicio do algoritmo da Eq. (10.104} saris-
faya a condir;ao | dcl(W(0)) | * 0, mostro que
| del(W(/r)) | £ Ü para todo a
Esta é a condiylo necesaria e suficiente para ¡asegurar que W(>¡) seja nSo-aingular para
todon.
10.14 Ncstc problema, formulamos a veraao por lote do algoritmo de scparay&o cega de fontes
descrito na Eq. (10.104). Específicamente escrevemos
AW =
rj^l-A-dKYjV'jv,r
onde
>i(l) r(2) -
Y- v,(l) r,(2) -
Ia(I) r„(2) -
Hidden page
CAPÍTULO 11
Máquinas Estocásticas
e suas Aproximares
Bascadas na Mecánica Estatística
11.1 INTRODUCTO
Para a nossa última elasse de sistemas de aprendizagem náosupcrvisionados (sistemas auto-arga-
nizados), nós nos voltamcs para a mecánica estatística como Fonle de idóias. O lema da mecánica
estatística abrange o estudo formal das propriedades macroscópicas do equilibrio de grandes siste-
mas de elementos que estío sujeiios as ieis microscópicas da mecánica. O principal objetivo da
mecánica estatística c derivar as propriedades termodinámicas de corpas macroscópicos partíndo
do movimenta de elementos microscópicos tais como átomos e détrons (Landati e Lifshitz, 1980:
Parisi, I988). O número de graus de liberdade encontrado aquí é enorme, tomando obrigatório o
uso de métodos probabilísticos. Como no caso da teoria da informacilo de Shannon, o concertó de
entropía desempenha um papel vital no estudo da mecánica estatística: quanto mais ordenado for o
sistema, ou mais concentrada for a sua distribuido de probabilidade, menor será a entropía. Do
mesmo modo, podemos dizer que quanto mais desordenado for o sistema, ou mais uniforme for a
sua distribuido de probabilidades maior será a entropía. Em 1957, Jayncs moslrou que a entropía
pode ser usada nao apenas como ponto de partida para a formulafáo da inferencia estatística como
descrito no capítulo anterior, mas também para gerar a distribuido de Gibbs que é básica para o
estudo da mecánica estatística.
O frrtCRHC na Util ¡zapito da mecánica estatística como base para o estudo de redes neurais
remonta aos trabadlos iniciáis de CraggcTcmpcrley (1954) c Ccwan (1963). A máquina de Boítzmann
(Hinton e Sejnowski, 1983,1986; Ackley el al., 1985) talvez seja a primeó-a máquina de aprendiza-
gem em múltiplas camadas inspirada pela mecánica cstatisiica. A máquina é assim denominada em
nxonhaómcntoá equivalencia. formal entre o t rabal ho original de Boltzmann sobre a termodinámica
estatística e O comportamento dinámico próprio da rede. Básicamente, a máquina de Boltzmann é
um dispositivo para, modelara disiribuifáo de densidade de probabi Iidade de um determinado con-
junto de dados, do qual as distribui^des condicionáis para uso cm tarefas como complcmcnta^áo de
padróes e classifica^áo de padrees podem ser derivadas. Infelizmente, o processo de aprendizagem
da máquina de Boitzmann é dolorosamente lento. Esta deficiencia motivan modifícacaes na máqui-
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Se a probabilidade/ for menor que 1. diz-se que o estado i é um estado transiente (León-García,
1994).
Se a cadeia de Markov camelar em um estado recórreme, aquele estado ocorrerá novanienie
um número infinito de Vczcs. Se iniciar cm um estado transiente, aquele estado ocorrerá apenas um
número finito de vezes, o que pode ser explicado como segué. Podemos ver uma nova ocorrcncia
do estado i como urna tentativa de Bemculh com uma probabilidad? de sucesso igual a/. O
número de retomos ¿assim uma variável aleatória geométrica cora uma media de (I Sc/J<
1. cutan segue que o número de um número infinito de sucessos é zero. Com isso, um estado
transiente nao pode acorrer novamente após um determinado número finito de retornos (L.eon-
Garcia. 1994).
Se uma cadera de Markov iiver alguns estados trans Lentes e alguns estados recurrentes, entáo
o processo tenderá a se mover apenas entre os estados recorrientes.
Caricias de Markov Irredutiveis
üizemos que 0 estado j de uma cadeia de Markov c acessivel a partir do estado r se houvcr uma
seqüeneia finita do transados de i para j com probabilidade positiva. Se os estados i e j forem
acesaíveis entre si., diz-se que os estados ¿ ej da cade i a do Markov se camufticarn entre si. Esta
común icaí 5o é descrita escrevendo-se i < > j. Claramente, se o estado i se comunica com o estado J
e o estado j se comunica com o estado it, isto é, r o j c f A, cntáo o estado i se comunica com o
estado A, isto
Se dois estados de urna cadeia de Markov se comunican! entre si. diz-se que eles pertencetn á
mesma clusse. Em geral. os estados de uma cadeia do Markov consistcm de uma ou mais elasses
disjuntas. Entretanto» se todos os estadas conststircm de uma única classe, diz-se que a cadeia de
Markov é índecamponive! úu imdutivel. Em üulras pala veas, iniciando rm qualqucr estado de urea
cadeia de Markov irrcdutívcL podemos alcanzar qualquer outro estado com probabilidade positiva
Cadeias redutiveis tém perneo interesse prátLeo na maioria das áreas de api ¡cacito. Conscqücntemcn-
te, restringimos a nossa atencáo as cadeias irredutíveis.
Considere uma cadeia de Markov irrcdutívcl que inicia cm um estado recorriente j no tempo n
= 0. Considere que 7 i ír) represente o tempo que decorre entre os retamos (k l) e A para o estado j.
O íejFr;w de recorrencia médio do estado j c definido como o valor esperado de sobre os
retamos A pmbahiiitiíide de esiado eítMionárift do estado i, representada por é igual ao
reciproco do tempo de recurrencia medio E[77£)], como mostrado por
1
"'“flrt*)]
Se E[Tfk)] < isto c. ft. 0T diz-se que o estado í é um enlodo newrettte Ípetaistettíe)positiva. Se
f[7j(A)J *», isto é. fij. “ (), diz-se que o estado i é um estado recwrerue (persistente) ñifla. A
Lmplicaqáo de ?t - 0 é que a cadeia de Markov eventual mente alcanza um ponto cm que um retomo
ao estado í é imposrfvel. A recorrerteia positiva e a ncocrtncia nula sao propriedades de ctasse
diferentes,, o que signiiiea que urna cadeia de Markov com estados recorrente^ positivos e estados
recorrientes nulos é redutivel.
Hidden page
Hidden page
A distribuifáo de probabilidad? é chamada de uma dialfibuiiáo invariante cu estacó
Ofíária. E chamada assim porque persiste para sempre uma vez que tenha se cstahelecido. Com base
no teorema da crgodk idade, podemos afirmar o scguinlc;
• Parí indo de urna distribui<;ao inicial arbitraria, as probabi I .dades de transí cao de uma cadcia
de Markov convergiráo para uma distribuido estacionaria desde que exista uma tal distri-
bmfáo.
* A distribuido estacionaria da cadeia de Markov ¿ [ütaímen te indcpendentc da dístribuicáo
inicial seacadeia for ergodica.
Exemplo 11,1
Considere uma cudcia de Markov cajo diagrama ¿e frfljtrifaíi rfp estado está representado rta Fig. 1 l .l. A
cadeia tem dois estados a, c xr A matriz es toe As tica da cadcia é
que satisfaz as candivóes das Eqs. ii 1.14) e (11.15),
FIGURA 11.1 Diagrama efe
tr-pnsiiy&o dn estado da oadeia
de Markiy.1 para o simplk> 11.1
Supprth^ qut a inicial stja
Da ]\:. (I ] .21) constaten»» que o vertir da JitEnhicicao de estado no tempo h = L é
.0
.24
22’
24.
3
4
2
2
tlevando a matriz cstocáslica F á potencia 2,3, 4, temos
Hidden page
Resolvendo estas equa^ftcs para ítp It, c Jt<. oblemos
1C. = 03953
1^ = 0.1395
0,4652
A cadcia de Markov dada i ergtklica C(im sua discrihui^Ao e^tacicniria definida por n , jc, e 7ry
Classifica^áo de Estados
Com base no material apresentado aquí, podemos desenvolver um resumo das classes ás quais um
estado pode pertcncer como mostrado na Fig. 113 (Fdlcr, 1950; Lcon-Garcia, 1994). Esta figura
tambem incluí o comportamcntu a longo prazó assüciado do estado.
FIGURA 11.3 ClassifrMfSo
ckiE afilados dé urna cadaia de
MarKov e mu componamento a
longo pnaw assoclado
Apmñdicn
lim nJWfl -jr
r o J
qnarvdlhj —* o*
fcríódkM
lihkp^"1 — rJJí QiElJki>
íi Jétn
¡JlhL-Ri mainri!(üe L
Principio do Balando Detal hado
As Equaqdes (11.25)e(l1 -26) meramente enfati/am o falo de que os números rt. silo probabilida-
des. A Equa^áo (11.27) é a cquapao crítica porque também deve ser satisfeita para que a cadeia de
Markov seja irredutível e, portante, para que exista uma distribuí cito estacionária. Esta última cqua'
Can é urna reformulaqáo do principio do balando dctaltiado que surge na cinética das realces de
primeira ordem. O jvfrttpúj dt> butufiw dniuJhúciú afirma que, ein equilibrio térmico, ti taxa de
ocorrízncid de qualquer transito é igual á laxa corresponden ce de ocurrencia da transmito inversa,
como mostrado por (Reif, 1965);
Pt ^¡Pj¡
(11.28)
Para derivar a relajo da Eq. (11.27), podemos manipular O SOtnatório no lado dimito desta cquafito
como segue:
l
= Étflr)^
J-l
= JT.
Na segunda linha desta expressao, utilizamos o principio do balando dctalhado, c na última Enha
usamos o lato de que as probabilidades de transige de unía cadeia de Markov satis&ZEtn a condi-
íáo (veja a Eq. (IL15) com os papes de i ej trocados):
*
S>,. = । para todo /
Note que o principio do balando dctalhado implica que a dis1 iribú iqáo i TC} se ¡a uma distribuido
estacionaria.
11A O ALGORITMO METROPOLIS
Agora que comprcendemos a composiqáo de uma cadeia de Markov» vamos usá-la para formular
um algoritmo otocistico para simular a evdijtfo de um sistema físico para o equilibrio térmico. O
algoritmo o chamado do algoritmo jUe/ro/M/if (Metrópolis ct al., 1953). Ele ó um método do Monte
Cirio modificado») ntroduzido nos primordios da ciéncia da computado para a simulado estocase ica
de uma cole^áo de átomos cm cqui I¡brío a uma dada temperatura.
Suponha que a variável aleatoria An representando uma cadeia de Markov arbitraria estoja no
estadox IW tempoH. Geramos aleatoriamenteum novo estados , representando uma realizado de
uma outra variável aleatoria 5C Assume-sequca gera^áo deste novo estado satisfaz a condi^áo de
simetría:
Pi Yr r r;) - A > - jrj Xa - x.)
Considere que AX represente a diferen^a de energía resultante da transigió do sistema dn estado
= x para o estado Z =.r, Se a dilcrcnqa de energía A£ for negativa» a transido leva a um estado com
energía mais haixa c a transirán é aceita. O novo estado é cntáo aceito como ponto inicial para o
novo passo do algoritmo, isto ó, fazemo® A^™ Se, poroutro lado, a difcrcn^a de energía A£ for
positiva, o algoritmo procede de uma mancipa probabilíslica naquetc ponto. Primeiro, selecionamos
um número alcatório C, unii urmemente distribuido no intervalo Id 1 ]. Se £< expf-AE/T), onde Fc
a temperatura de operasáo» a transí^áo c aceita o fazemos t|= F. Caso contrario, a transirán c
rej citada e fuemo& X* AJ isio é. a configuradlo antiga c reutifizada para o peóximu passo do
algoritmo.
Eacolha das Probabilidades deTransiqáo
Considere que a cadeia de Markov arbitraria tenha probabilidades de tranüifáo a prian representa-
das por t . que satisfazem tres eondi^ñes:
604 RrD£5 Metras
] h ,\riifí-negíilividade:
> 0 para todo (e\j)
2x Nornwlinit^o:
Tyj = I para todo j
3. Simetría:
para todo (i, /)
Considere que ít represente a probabil idade de estado estacionario que a cade i a de Markov esteja
no estadoxr iM 1, 2,..., Xr. Podemos eniao usar os T,, simétricos c a razáo de distribuicoes de proha*
bibJadc n/i!. a ser definida, para formular o conjunto desojado de probabilidades de transifio
como (Bcckermaik 1997)::
para
P..- =
(11.29)
para
Para asaegurar que as probabilidades de transido sejam normalizadas para a unidade, introducimos
esta definirán adicional para a probabilidade de náo-transi^áo:
onde a ó a prohabil idade de moví mentado definida por
(11.31)
A única exigtocia importante ¿como escolher a racáOTr/rr . Para satisfacer esta exigencia, escolte-
mos a distribuí vio de probabil i dade para a qual desejamos que a cadcia de Markov conviija como
sendo uma distribuiíáo de Gíbbs, como mostrado por
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Maquinas EstocA-sticas. e su *s AFKnauAQOe Basi íadas ka Mecánica EsrAiIsncA 611
complententafdo depudive*. Específicamente. quando um vetor portador de informado está preso
a um suhcnnjunto de neurónios visíveis, a rede realiza a complementaba sabré os neurónios v¡¡si-
veis restantes^ desde que ela tenha aprendido adecuadamente a distribuidlo de treinamento (Hinton,
1989).
O objetivo principa] da aprendizagem de Boltzmann c produzir uma rede neural que modelo
corretannenle padróes de entrada de acardo curo uma distrital ;0o de Boltzmann. Aplicando esta
forma de aprendizagem, sáo feitas duas suposi^óes:
• Cada vetor (padrón) de entrada do ambiente persiste lempo suficiente para permitir que a
rede alcance o equilibrio térmico.
• Nto há estrutura na ordem seqüencial na qual os vetores do ambiente estío presos ás um da-
dcs visíveis da rede.
Diz-se que um conjunto particular de pesos sinápticos constituí um modelo perfeito da estrutura do
ambiente se ele levar exatamentc á mesma distribuido de probabilidade dos estados das unidades
visíveis (quando a rede está funcionando Livremcntc) que quando estas unidades cstáo presas aos
veiores de entrada do ambiente Em geral. a menos que o número de unidades ocultas seja
exponencial mente grande comparado como número de unidades visíveis, ¿ impossivcl atingir este
modelo perlcLto. Se. contado. o ambiente tiver uma estrutura regular, e a rede utilizarsuas unidades
ocultas para capturar estas regularidades, ela pode alcanzar um bom casamento com o ambiente
com um número aeeitávcl de unidades ocultas.
Amostragem de Gibbs e Re coz i mentó Simulado para a Máquina de Boltzmann
Considere que x represente o vctOr de estado da máquina de Bollzmann, Com sua Con)ponente .v
representando o estado do neurónio i. O estado x representa nina realizado do vetar aleatorio X. A
conuxáo sinápiica do neurónio i para o neurónio j é representada por ir , com
para lodo (ij)
«^0 para todo/
(11.37)
(11.38)
A Equafáo (11.37) descreve a simetría e a Fq. (l1.38) enfatiza a ausencia de auto-realimentafáo. O
uso deum bias é permitido utilizando-seo vetor um nó ficticio mantído .i -H econeciando-o
ao neurónio Jpara todoj.
Por analügia com a termodinámica, a energía da máquina de Boltzmann é definida por
Invocando a disiribuicáa de Gibbs da Eq. (11,5), podemos definir a probabilidade de que a rede
(assumida estar em equilibrio á temperatura 7}está no estado x como segué:
Hidden page
Hidden page
Considere que .7 represente n conjunto de cxcmplos de tre mámenlo relirados da distribuido
de probabilidade de interesse. A ssume- se que os cxcmplos sao todos híñanos. E permití da a repeti-
do de cxcmplos dt treinamento na propor?So tía (reqüénciaconhecidade sua ocorréncia. Conside-
re que um subcon unto do vetor de estado x> digamos y(, représenle os neurónios visiveis. A pane
réstame do vcior de estado x, digamos representa o estado dos neurónios ocultos. Os vetores de
estado, x, xl( e silo realizares dos vetores alealórios X, Xit e X-, respectivamente. Há duas fases
para a operario da máquina de Bfiltzmann:
* Fase positiva. Nesta fose, a rede opera na sua condiqño presa i. i.e., sob a influencia do
conjunto de treinamento 33.
• Faxtí Hí^íívn. Nesta segunda fase, permite^se que a rede opere Livremente, e pártanlo sem
entradas do ambiente.
Dado o vetor de peso sináptico w para toda a rede, a probabilidad^ de que os neurónios visiveis
estejam no estado xfj é *„) Considerando os diversos valores possíveis de xn contidos no
conjunto de treinamento íí, assumidos sercm estatisticamcntc independentes^a distribuirán de pno-
bahil idade global c a distribuí cao falorial |~[. jF(X re = ia). Para formular a fun^ác logaritmo da
vcnossimilhan^íi £(>*), tome o logaritmo desta distribuido raterial e trate w como o vecor de
parámetros deseo nheci do. Podemos assim escrcvcr
¿(w) = log f[ ftX,, = xj
1.1 «J
= 2
(11.45)
Para formular a cxpressáo para a probabilidade marginal P(X x j em (erraos da fundo energía
/?(«}. utili7amos o segúrate:
• A probabilidade P(X = x) c igual a — exp(-/?(x) > T) da F.q. (11.40),
• Por definido, o vetor de estado x é a combinado conjunia de x t relativo aos ncurónms
visiveis crelativo aos neurónios ocultos. Assim, a probabilidadede encontraros neurónios
vlislveis no estado x(i com qualque: x é dada por
(11.46)
onde o veior aleatórlo X c é um subconjunto de X. A fundo de partido Z c ela mesma definida por
(veja a Eq. (11.6)):
^=¿explI
i v /
(11.47)
Assim, subsiituindo as Eqs. {11.46) e (11-47) em (ti.45), oblemos a cxprcssao desejada para a
funcáo logaritmo da verosímil fianza;
Hidden page
n = f (11.54)
A regra da subida do gradiente da Eq. (11.53) é chamada de negra de aprendizagem de Boífzmann.
A aprendizagem descrita aquí é realizada em lote; ou seja, as modificadles dos pesos sinápticos sáo
[citas após a aprésenla^5o do conjunto i metro de exemplos de treinamento.
De acardo com esta regra de aprendizagem, os pesos sináplicos de uma máquina de Boltzmarui
sáo ajustados utilizando-sc apenas observares disponíveis Iccaltnenie sob duas diferentes condi-
íjóes: (l) operando presa, t (2) operando livremcntc. Esta característica importante da aprendizagem
de Bohzmann simplifica enormemente a arquitelura da rede, em especial quando se líela com redes
grandes. Uma outra característica útil da aprendizagem de Bcltzmann, que pode parecer uma sur-
presa, é que a regra para ajustar o peso sináptico do neurónio r para o neurónioJ c independente do
Tato de estes dois neurónios serení ambos visívcis, ambos ocultos, ou um viaivcl c o culto oculto.
Todas estas características da aprendizagem de Bollzmann resultara de uma análise fundamental de
Hinton e Sejnowskl (1983, 1986), que vincula o modelo matemático abstrato da máquina de
Boltzmann ás redes neurais usando uma combinando de dois latores:
• A distribuí^áo de Gibbs para descrever o quáo eslocástioo é um neurónio.
• A funcáo de energía bascada na física estatística, dada pela Eq. (11.39), para definir a distrí-
bu ¡cito de Gibbs.
Do ponto de vista da aprendizagem, os dois termos que eonstiluem a regra de aprendizagem de
Bollzmann da Eq. (11.53) tém significados opostos. Podemos ver o primeiro termo, correspondente
:n condífáo presa da rede, como csscncia] mmlr uma regra de aprendizagem hübbLar'ui!, c Vúf O mí*
gunde termo, Qonespcndcndo á tendí vito de operado livre da rede, como um termo de
"desapnfídizagem" ou esquecimcnto. De falo, a regra do aprendizagem de Boltzmann representa
uma generaiizacáo da regra de eaquecimenio repetido e reaprendizagem descrita por Poppcl c Krey
(19g7) para o caso de redes simétricas sem neurónios ocultos.
É lambcra intcressanle notar que, como o algoritmo de aprendizagem da máquina de Bollzmann
requer que OS neurónios ocultos reconh«;am a diferen^a entre atividades estimuladas e atividades
operando livremente, e desde que haja urna rede (oculta) externa que sirializc para os neuromes
ocultos que a máquina está sendo estimulada, temos uma forma primitiva de um mecanismo de
alendad (Cowan c Sharp, 1958).
Necessldade da Fase Negativa e suas Implicadles
O uso combinado de uma fase positiva c de uma fase negativa cstabiiiza a distribuido de pesos
sinápticos na máquina de Boltzmann. Esta neceas i dade pode ser justificada de oulro modo. Intuiti-
vamente, podemos dizer que a necessidade de uma láse negativa bem como de uma fase positiva na
aprendizagem de Boltzmann surge de vi do á presenta da funqáo de particáo, Z, na expressáo para a
probabi Iidade de um vetor de estado de um neurónio. A implicado desla afirmado c que a directo
da dése ida mais ingreme no espado de cncrgia niio c a mesma que a direfáo da subida mais lógreme
no espado de probabil idade. De faro, a fase negativa no procedí mentó de aprendizagem é necessáría
para levar cm considerarán estas discrepancias (Ncal, 1992).
O uso de urna fase negativa na aprendizagem de Bollzmann (cm duas grandes desvanta-
gens:
Hidden page
Em omrsa palomas, pa(¥) ¿ n menor subconjunlo do vetor aleatorio X para o qual temos
PiXj = J |X, = jtp = vAI} - P(X, = Jfjpa(^})
(11.55)
(H-56)
Urna virtudc impórtame das reda de creída sigmóide é a sua habilidad? de ex ib ir claramente as
dependencias condicionáis do modelo probabi] istico próprio dos dados de entrada, l .in particular, a
probabilidade de que o i-ésitno neurónio seja atibado ó definida pela fuñí5c sigmóide (veja a Eq.
(11.41))
(H.5?)
onde Tí.' ó o peso sináplico do neurónio i para o neurónioy, como mostrado na Fig. 1 1.6. Ou soja, a
probabilidade condicjoml ÍVC Aj j depende de pe(J0 únicamente através de uma sema de
entradas ponderadas. Assim, a Eq. (1l.57) fomece a base para a propagado de érenlas atreves da
rede.
Realizando-sc os cálculos de probabilidade da rede de cíenla sigmóide, nclam-sc os dois
pontos seguintes:
1. ir — {J para todo ó ’ nao pertciCcntc a pa(A')
Z. ir. 0 para todo t > J
O primeiro punto segue da delinco dos país. U segundo ponto segue do fato de que uma rede de
crenifa sigmóide c um grafo acídico orientado.
Como o notnc implica, as redes de Cten$a sigmóide pcrtcncem á classe gcral das redea de
cww? cstudadfls extensivamente na literatura (Pearl, I4ÑS). A operado estocástica das redes de
crenca -¡iigmóide é algo nuil complexa que a máquina de Boltzmann. A pesar disso. olas se adaptam
ao uso de aprendizagem por subida do gradiente no espado de probabilidade, baseado na informa-
do disponivel localmente.
Aprendizagem em Redes de Crecida Sigmóide
Considere que £T represente um conjunte de exemplos retirados da distribuido de probabilidade de
micTcsse. Assumc-sc que cada cxcmplo scja binario, representando ccrtos atributos. É permitida a
repei i^áo do exemplos de tre mámenlo, na proporííío da freqüéncia de acorrencia de uma combina*
íáo particular de atributos. Para modelar a distribuido da qual '3~ c retirado, procedemos como
segué:
1. Dcc idease por um tamanho do vetor de estado, x, para a rede.
2. Scleciona-sc um subconjunto do velor de csiadu, digamos x , para representar os atributos dos
casos de treinamento; ou seja, xrd representa o vcior de estado dos neurónios vtatuéis (i.e., os nós
do evidencias).
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Quando a temperatura Jé redil/ida no per curso através do roteiro de recozi mente, o sistema
sofre urna seqüéncia de tratiB^óes de fase, que consiste de d¡visees naturais de agrupamentos ñas
quais o modelo de agrupamento crcscc cm tamanho (i.*,, número de agrupamento) (Rose et a].,
1990; Rose, 1991). Este fenómeno é significativo pelas razóos a según ;
• Forilece uma ferramqnta Útil para controlaro tamanho dn modelo de agrupamento.
• Como no necozimentó físico ordinárió, as transiges de fase sao os ponina críticos do pro-
cesan de recozimentó determi ni Etico onde se deve ter cuidado com o rccozimcnto.
• Os pontos críticos sao cafotltiveis, fomeccndo com isso .nforma^áo que pode ser usada
para acelerar o algoritmo no intervalo entre transiges de fase.
* Pode-ge identi ficar um tamañito de modelo ólimo acopl ando u m procedí mentó de valida^áo
a sequera; ia de solu0es producidas em varias fases, que representan saludes de tamanhos
de modelo crescentes.
Exemplo 11.4
As Figuras II.LOelL.LI ilusiram a evoluc Ao da soluto de agrúpamela atraes de reeazimencu detemiiTií.HlicD
cm váriiLH fases tiHifiinne a temperatura Fe rtzdivida nu a temperatura reciproca. Ü = l 'c aumentada (Rose
199]). O conjunto de dados utilizado para gerar estas figuras é unía mistura de seis distribuidles gansearas
cujos centros estío mancados com **X". Os centros dos agrupamentos calculados eslío marcados com ”cT.
Como as solucóes de agrupamento a temperaturas diferentes de zero nao sao duras, esta parti^áo aleatória c
mostrada por coiUornos do igual probabi idade - por exemplo, probabilidade b'3 de pcrtencer a um agrupu-
nicnto pan icular. Este processo inicia com um agrupamento natural contando o conjunto de treinanienEO (Fig.
L LIO»). Na primcira tranüiQáo de láse, ele se divide cm dois agrupamcnlos (Fig. ] ]. ]0b) e entilo passa por
unía scqücncia de transitóos de fase até alcanzar o comunto Natural” de SÉÍ.taijnjpaTncnE(j$r A próxima fran-
FIGURA11.1Q O processo de agrupamento
om várias fases. As linhas sáo contornas
^qúrprOvávsis, p= 1/2 em (bj e p = 1/3 nos
cutres-:
fe) i agrupamento iff«0)
(b) 2 agrupamentas íH= D.OQ49),
(C) 3 ágrupamenCDS ¿ B = Ó.OÚ66),
(d) 4 agrupamentos íB= 0,0100),
tfi) 5 agrupaméntos (0= 0,01S6),
:t; fi agrupamanlns (B = 0,0347) e
{g) 19 agrúpamenos (£? = 0,0605)
Máquinas Estocásticas r &uas AfrcwmaqGk, Babeadas na Mecánica Estatifica 639
FIGURA 11.10 (corabnuafáa)
si^ao de fase resulta cm uma “cxplpsa<jH quando todos ns agrupp.mcn!Q5 se dividen»- A Figura 11.11 aprcsenta
o diagrama de fase, que mostra a comportamcnto da distarlo media durante todo o processo de recozímento
e o número de agiupamentos naturais em cada fase. Nesta ñgurah a distonpáo média (nomalizada em relajo
ao seu valor mínimo} é trabada em fun^o do reciproco da temperatura,. ou seja £ (nunnalizado em relajo ao
seu v&lor mínimo). Ambos os rixos sao rotulados iras sitas formas logarítmicas relativas.
FIGURA 11.11 Difama [fe
fase para o exemplp da mistura
de gausslanas. O número tfe
e grupamentos etetiwe é mostra-
do para cada fase
Hidden page
Hidden page
642 RFDE3 NkURAJS
Embota enfatizamos neste capitulo o uso de técnicas de ctinl izando e máquinas estocas ticas
para resolver rarefas de aprendizagem nac-supervisicnada, das também podem ser usadas para
tarefas de aprendizagem supervisionada, se assim for desejado.
NOTAS E REFERÉNC1AS
1. O temió ''distribuidlo canónica" como uma describo da Eq. (11.3) foi cimbado por J.
Willart Gibbs (19021 Na página 33 da Parte Um (ffemeflíarr Principies fir Staris/fonl
jWecftflwcs) desta coletánea de tratoalhús. ele cscrevc
“A distribuido representada por...
*=°4V)
onde 7/ e y $*0 constantes e // é positivo, parece representar o caso mais simples
coiicebivcl, pois ela tem a propriedade de que. quando o sistema consiste de partes
com energías separadas, as leis da distribuidlo cm fase das partes separadas sáo da
mesma oalurezu — urna propriedade que simplifica enurmemenle a discussao e que
representa a fundamentado das relajees extremamente importantes da
termodinámica...
Quando um enscmhlc de sistemas í distribuido cm fase da mane ira descrita, i.e.+
quando o índice de probabilidade (P) e uma fon^áo linear da energía (t X devemos
dizer que o ensamble tem uma cnadnica e chamar o divisor da energía
(77) de módulo da distribuido
Na literatura de tísica, a Eq. (11.3) é normalmente referida como a distribuido canónica
(Reif, 1965) mi distribuida de Gibbs (Landau e Lifscliitz, 19S0). Na literatura de redes
neurais, ela é referida como a distribuido de Gibbs, distribuíyan de Bollzmann c a distri-
buido de Efoltzmann-Gibbs.
2. A idé ia de introduzir a tem peratura e o recozimento simulado em problemas de ot imizacíio
combinatoria dcvc-sc a Kirkpatrick, Gclatt c Vacchi (I983)c indcpendenlemente a Cemy
(1985).
Em um contexto físico^ recozimento é um processo delicado por natureza. Em seu
artigo de I9R3, Kíritpatrick et al- discutcm a notjao de Hfundir" um sólido, que envolve
elevar a temperatura a um valor máxime no qual todas as partículas do sólido se arninjcm
"aleatoriamente" na láse líquida. Eniáo, a temperatura é reduzi.la. perm .lindo que todas as
partículas se arranjem no estado fundamental de baíxa energía de uma estrutura cristalina
correspcndetiie. Se o resfriamento íor rápido demaiji — rttú c. nao se permite que o sólido
tenha tempo suficiente para alcanzar o equilibrio térmico a cada valor de temperatura - o
cristal resultante tena muilos defeitos, ou a substancia pode formar um vidro sem uma
ordem cnstalina c apenas cstvuturas metaestáveis locaimenie ótimas.
A no^áo de "fusáo” pode ser o caminho cúrrelo para se raciocinar sobre vidros e
tal vez sobre problemas dcotimiza^io combinatoria em um contexto computac innal cor-
respondente. Entretanto, ele é engañoso quando se discute muitos outros dominios de api i'
ea^áo (Beckermann. 1997), Em processamento de imagens, por cxcmplo, seelevarmos a
“temperatura" de mndo que as partículas se anranjem aleatoriamente, perdemos a imagem
- ela K loma uniformemente citiza. Em um sentido metalúrgico correspondente, quando
realizamos a recozimento do ferro ou do cobre, devemos manler a temperatura do
recozimento abaixo do ponto de fusáo: caso contrário, arruinamos a amostra.
Há varios parámetros importantes que govemam o recozimento metalúrgico:
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Invocando oslas duas suposivbcsh mostré que
(c) Dado que t. # (X use o resultado da parte (a} do problema para mostrar que
l
(d) Finalmente faca uma troca de varia veis:
i’, -T IcgTU. + 7*
□mié Fe F* kBd constantes arbilrárías. Com isso4 derive os seguintcs resultados;
ÍÍIl> l+eip(-AF/ T}
onde DE “ E^-E^.
(c) Quais as OQnclusóes que vocú pode tirar dcstcs rebultados?
11.10 Na Se^So । L ?, utilizamos a máxima verossimtlhan^a como crilfrio para derivar a regra de
aprendizagem de Bolizmann, descrita m Eq. (L L53). Neslc problema, rev [sitamos esta
negra de aprendizagem usando um oulro criterio. Da discurso aposentada no Capitulo
10, a divergencia de Kullback* Le. blcr entre duas dnlribu aoes de probahi. idade p'tí e pa c
definida por
k
T
onde o somarário é sobre todos os estados possKeis a. A probabilidade p~ representa a
probabilidad? d? que □» neuninioj \ isíveis. eslejam no estado CL quando a rede está na sua
condicao presí (posiliva), e# pnihabiiidsde pa representa a probabilidad? d? que os TDCS-
mos neurónios estejam no estado u quando a rede eslá na sua condifáo de operado Hvre
(negativa}. Usando D, derive novamente a regra de aprendizagem de Boltzinann.
11.11 Considere uma máquina de Bollzmann Lujos neurónios visiveis sáo dividido» em neuriinici»
de entrada e íUWCniM de saida. Os estados dcstcs neuiónios sao representados por fi c Y,
respectivamente. O estado dos neurónios ocultos c representado por p. A divergencia de
Kullbach-Lciblcr para esla máquina é definida por
onde p^ é a probabilidadc do estado a sobre os neurónios; de entrada; P.._ ¿ a probabili-
dade condicional de que os neurónios de saida estejam presos ao estado a dado um estado
de entrada a;e PTaéa probabilidade condicional deque os neurónio» de saida estejam em
Máquinas Estucásticas e su as Apeoxima^óes Babeadas na Mecánica EstatIsitca 649
equilibrio térmico no estado y, dado que apenas os neurónios de entrada esiejam presos ao
estado úl Como anteriormente, os índices superiores mais e menos representan! as condl-
?óe$ positiva {presa) e negativa (operando livre), respectivamente.
(a) Derive a fórmula de D para uma máquina de Boltzmann que incluí neurónios
de entrada, ocultos c de salda.
(b) Mostré que a regra de aprendizagem de Boltzmann para ajustar o peso sináptico uj
nesta configuTH^áo de rede pode aínda ser expressa na mesma forma como desculo na
Eq. (11.51), com novas interpretares para as correla^des e pj.
Redes de Crenga Sigmóide
11.12 Resuma as similar idades e ditéren^as entre a máquina de Boltzmann e a rede de crenqa
sigmóide.
11.13 No Problema 11.9, demonstramos que a máqu i na de Boltzmann é descrita por um modelo
de cadeia de Markov de dois passos. Uma rede de crcnga sigmóide admite um modelo de
cadeia de Markov? Justifique a sua resposta.
11.14 Considere que represente o peso sináptico do neurónio i para o neurónio j cm uma rcdc
de érenla sigmóide que utiliza +1 para o oslado ligado e -l para o estado desligado. Con-
sidere queir ' représenle o peso sináptico correspondente de unta rede de érenla sigmóide
que utiliza 1 para o oslado ligado de um neurónio c 0 para o calado desligado. Mostré que
tu. pode ser convertido em w ' utilizando a transfórmacSo:
'!
u< = —- para 0 < i < j
w’.*=h> = |L *%
A última Imha c relativa ao bias aplicado ao neurónioj.
11.15 Em uma rede de crcnija sigmóide, identificamos a probabilidade P(Xp= xj X,, = xn) como
umadi^tribui^áodc Gibbs, c a probabilidade = xn) como a fun^3o de partidlo corres-
pondente. Justifique a validado destes dois modelos.
A Máquina de Helmholtz
11 *16 A máquina de Helmholtz n&.i tem realimcnia^ao cm ambos os modelos de rcconhccimcn-
to e de gerai^o. ü que poden ¡t acontecer oom a operado desla rede se fosse permitida a
utiliza^áo de realimenlíi^ars em um dente s dois modelos?
Máquina de Boltzmann Determlnístlca
I L17 A máqu; ría de Boltzmann real 1 ¿a. desoída do gradiente {no espado de pesos) sobre o espado
de probabilidades, COMO discutido no Problema L 1.1-0. Sobre qual fuTi^aq a máquina de
Boltzmann dctcnniní&tica realiza a dcscida de gradiente? Vocfi pode se referir a Hinton
{1989) para uma discussáo desta questáo.
11.18 Considere uma rede reconcnte que c assimclrica com te # til Mostré que o algoritmo de
aprendizagem de Boltzmann detenn místico torna a rede automáticamente simétrica, des-
de que após cada alúa liza^áo de peso, cada peso decaía em dire^áo a zero em uma pequeña
quantidade ptupereional á sua magnitudefHinton, 1989).
Rede de Cren^a Sigmóide Determlnístlca
11.19 Mostré que a diferenca entre as expretS&S iWt lados csquctdo c direito da Eq. (I L.77) é
igual á divergencia de Kullhack-Leibler entre as distribuigóes ij X »i ) e í^X
Hidden page
CAPÍTULO 12
Programado Neurodinámica
12.1 INTRODUQÁO
No Capítulo 2, identificamos dois paradigmas principáis de aprendizagem: a aprendizagem com
um professor c a aprendizagem sem professor. O paradigma de aprendizagem sem professor c
subdividido em aprendizagem auto-organizada (náo-supervisionada) e aprendizagem por reforjo,
Nos Capítulos de 4 a 7, sao cobertas diferentes formas de aprendizagem com um professor ou
aprendizagem supera isinnada, e nos Capítulos de 8 a II sáo discutidas di retentes formas de apren-
dizagem náo-supervisionada. Neste capítulo, discutimos a aprendizagem par reforja.
A aprendizagem supervisionada é um problema “cognitivo” de aprendizagem realizado sob a
tutela de um professor: cía dispoc de um conjunto adequado de exemplos de cntrada-saída que sao
representativos do ambiente ope racional. A aprendizagem por reforjo, ao contrario, é um problema
de aprendizagem bascado em “comportamcnto'1: c realizada através da interacao entre o sistema de
aprendizagem e o seu ambiente, dentro do qual o sistema procura alcanzar um objetivo específico
apesar da presenta de incertezas (Barto et al., 1983; Sutton e Harto, 1998). O fato de que esta
intereso é realizada sem um professor toma a aprendizagem por reforjo particularmente atrativa
para situares dinámicas em que é custoso ou difícil (se nüo impossível} reunir um conjunto
satisfatório de exemplos de entrada-salda.
Há duas abondagens para o estudo da aprendizagem por reforjo,1 resumidas como segue:
1, A abortiagem cíassica^ na qual a aprendizagem acontece através de um processo de punfeáo o
recompensa com o objetivo de alcanzar um comparíumento ültámente t/ttalificado.
2, . ? abordagem moderna t que se fundamenta cm uma técnica matemática conhecida como pro-
gramacáo dinámica para decidir sobre o curso de a?áo considerando estágios futuros possívcis
sem realmente experimentá-los; aénfase aquí está no plonejamento.
A nossa discussao enfoca a aprendizagem por reforjo moderna.
A programando dinámica2 é uma técnica que trata de situares era que as dccisdes sáo toma-
das em eslágios. cora o resultado de cada dccisáo sendo pre\ isível até certo ponto antes que a
próxima decísáo seja tomada. L’m aspecto-chave destas situares é que nenhuma decisán pode ser
tomada i su I adamen te. Lm vez disso. deve-se ponderar o desejo de um ha i «o custo no presente em
relaqáo a altos costos indesejáveis no futuro. Este é um pmblema de atribuirán de crédito porque
deve-se ah i bu h crédito ou culpa a cada dccisao de um conjunto de dccisocs intcrativas. Para o
planejaincnto ótimo, c ncccssário se terum compromiso eficiente entre os cuscos i medíalo c futu-
ro. Tal compromissoé realizado de fato pelo formalismo da programado dinámica. Em particular,
a programarán dinámica aborda a questáo: como um sistema pode aprender a mclhorar o seu de-
sempenho a longo prazo quando istn pode raquercr o sacrificio do desempenho a curto prazo?
Seguí ndn a terminología da Bcrtsckas cTsitsiklk (1996). nós nos referimos á abordagem
moderna de aprendizagem por rtlbrco comoneuraxlinámica. Fazcmos isso principal-
mente por duas razies:
• A fiindamentaffio teórica é fomecida pela programarlo dinámica.
• A capacidade de aprendizagem é fomecida pelas redes neurais.
Podemos definir sucintamente a programado neurodinámica como (Rertseltas eTsilsiklis, 11996):
A prograinacáo neurodmáinica permite que um sistema aprenda a lomar boas decisóes observando o
scu próprio comportamcnto c a mclhoraras sufts asocs alravcsde reforvo. ulil izando um mecanismo
incorporado.
A observado do cornporíamento ó realizada fora do tempo de execiiráo {c/f'díw) atreves da técnica
de simularlo de Monte Cario. A melhot ia das apScs através de re forro é realizada atreves do uso de
um esquema iterativo de otimizB^fto.
Organizado do Capítulo
A programar áo dinámica tem duas características principáis: um sistema dinámico suhjacentc de
lempo discreto e uma funqfo de custo que é aditiva em relajo ao tempo. Estas duas características
sáo discutidas na Sc^áo Í2.2. Isto é seguido por uma formularán da cquaijáo da ctiiiuzacáo de
Be II man na Scqao 12.3, que dcscinpcnha um papel importante na programado dinámica. Mas Seques
1 2.4 e 12.5, discutimos dois métodos di Fcrentes para calcular uma política ótima para programarán
dinámica, ou seja, iterarán de política e iterarán de valor.
Na Seqáo 12.6. aprcsentamo& uma visáo gcral das questbes envolvidas na programarán
ncurodinámica. Esta visan gcral leva á discussán da iterarán aproximada de polilica e da aprtndi-
zagem Q. o que El ItimEi Etdcquada ao uso de redes neurais para aproximarlo de fundes. Estes dois
algor niños sáo discutidos ñas Seques 12.7 e 12.8. respectivamente. A Scijáo 12.9 apresenta um
experimento compuiaclonal sobre o uso da aprendizagem Q.
O capíinln concluí com algumas considerarles fináis na Serán 12.10.
12.2 PROCESSO DE DECISÁO MARKOVfANO
Considere um Jív/emú <le apKttttiza^cm ou agente que interage com seu ambiente do modo ilustra-
do nn J-jg. 12.1. Q sistema opera de acorde com um prncesao dtp decis^ü mar^oviafitf de tempo
diacreío firrito que é caraclcrizadn comn segué:
PrI ICRANAQAjO K’F.UbllllJlNÁMIl'A 653
FIGURA 12.1 Di-agrama am blocas
do um sistema da ap<endizagem
interag iido ctlm d fifiu ambiénte
* O ambiente evolui probabilistkamente ocupando um conjunto finito de celados diséñelos.
Note. enl reíanle, que o estado mío confém estilísticas passadas. embona estas estilísticas
pudessem ser úteis para o sistema de aprendizagem,
• Para cada eslado do ambiente há um conjunto finito de a^ocs possívcis que podem ser
reali¡cadas pelo sistema de aprendizagem.
* Toda vez que o sistema de aprendizagem realiza uma iujác, ele incorre etn um certo custo.
• A observarse dos estadas, a real iza?ao de a^óes e a i nc dáñe i a de custos ocorrem cm tempo
discreio.
Nc contexto da nossa presente discussáo, o do ambiente c definido como um resumo da
experiencia pomada total do sistema de aprendizagem ganha a partir da stta intera^ua cara y
ambiente, de moda qne a informaban neecssária para o sistema de apretidizagem predizer o com-
pon amentó fútum da ambiente está comida neste resuma. A variável aleatória representando o
eslado no passo de tempo n Ó A' e O estado real no passo de tempo n é representado por s(ít). O
conjunto imito de estados é representado por í.\ Um aspecto surpreendente da programado diná-
mica é que a sua api icabi] ¡dade depende muito pouco da natureza do estado. Podemos, portante,
proceder sem fazermes qualqucr supesi^áo sobre a estrulura do espado de estados.
Para o esiado f, por exempla o conjunto disponivel de a^aen (i.c.t as entradas aplicadas ao
ambiente pelo Sistema de aprendizagem) c representado por pt = |ú ¡, onde o segundo índice k na
aqao a realizada pelo sistema de aprendizagem meramente indica a dispotllbil idade de malí que
uma a^áo posslvel quando o ambiente está no estado/. A transí cao do ambiente do estado i para o
novo estado/, por exemplo, devido á a^&oa. édenfiiurczaprobabilistica. Entretanto, o inais impor-
tante é que a prerhabiiidade de tmnsigwdo estada i para o estada j depende inteiramente da estada
córvente i e da tt$t¡o correspondente u r Esta é a prapriedude de hfarkaw que é dj seu: ida no Capitu-
lo 11. Esta prupriedade e crucial porque significa que o estado comente do ambiente tbmece a
informado necessária para n sistema de aprendizagem decidir qual aqáo realizar.
A variávd alcíitória represemando a otfo realizada pelo sistema de aprendízagem no passo de
tempo n é representada por Considere que A/Vl represente a probabilidade de transijan do
estado i para o eslado _/ devido á a^au realizada ti o passo de tempo n. onde " a. Em virtude da
propriedade de Markov, temos
'W.., •'K-M. -a) (12.1)
A probahi I idade de transipñop satisfaz as duas conJ ifóes seguíntes que sao impostas pela leona
das probabilidades.
para todo r c / (12*2)
2. I para lodo i
J
(123}
Para um dado número de estados c probabilidades de transido, a scqücncia de estados do ambiente
resultante das aijtes realizadas pelo sistema de aprendizagem sobre o lempo forma uma vudeia de
Markov. As cadeias de Markov sao discutidas no Capítulo 11.
A cada transido de um estado para outro, o sistema de aprendizagem incorre em um c-terto.
Assim, na n-csima transifáo do estado i para o estado/ sob a afáo « o sistema de aprendizagem
incorre cm um custo representado por y“g(r, onde^í.......) é urna futido predeterminada, e Té
um escalar com 0 < y < 1 chamado de [atar de descanta. Ajustando y, somos capazos de controlar o
grau com que o sistema de aprendizagem está preocupado com as consecuencias a longo prazo de
suas pnóprias a$tes em relajo ás consecuencias a cuno prazo destas a^tes. No limite, quando y"
0, o sistema é miope no sentido de que está apenas preocupado com as con sequen cías ¡medíalas de
suas a^oes. No que se segue, ignoraremos este valor limite, ou scja, restringiremos a discussao a U
<y <1 Quando y se aproxima de 1, os custos futuros se tomam inais importantes na detcmiinacao
das a0es ótiroas.
O nosso inlcrcssc está na formulado de uma potinca, definida como um mapeamenta de
¿-.siadnt para ofóes, Fm cutías pala vías, urna política é uma negra usada pelo sistema de aprendiza-
gem para decidir o que Inzer, dado o conhecimentó do estado atual do ambiente. A polínea c repre-
sentada por
(12.4)
onde é uma fun^áo que mapeia o estado X ™i em uma aqáo A* = ít no passo de tempo n = 0,1,
2..Este mapeamento é tal que
pv(j) € ,7Íj para todos os estados i € at
onde £di representa o conjunto de todas as a?ocs possívcis realizadas pelo sistema de aprendizagem
no esiado i- fais políticas sáo denonlinadas üdrwXsj/MeJj.
Urna política pode ser nio-estacionária úu estacionaria. Uma política náostacionária é
variável no tempo, como indicado na Eq. (12.4). Entretanto, quando a política c independente do
tempo, oiiscia,
n - ji. ji„
diz-se que a política c esfaeionária. Em nutras palanas, uma política estacionaria especifica
exatamente a mesma a^án cada vez que um estado particular c visitado. Para uma política estseto*
noria, a cadeia de Markov relacionada pode ser estacionaria ou nao-estacionaria; é passivel utilizar
uma política estacionaria sobro uma cadeia de Markov náo-eslacionária, mas nao c recomendare!
K íhzer isso. Se uma política estacionaria Ibr empregada, cntáo a seqüéncia de estados {A'... n - 0h
], 2,...J forma uma cadeia de Markov com probabilidades detrans¡íííop..(ti(/)kondc]iO) significa
uma a^áo. É por esta razáo que o processo é referido como um prvcesxa de deciiáo de Morios
Hidden page
Hidden page
que representa a forma ótima da Eq. (12.9). Reccnhecendo que TT" = 7Cfl+:) c cxpandindo parcial-
mente o somaterio no lado direito da Eq. (12.10), podemos escrever
min
(Ki i*"1 H An
..Jx-ir
+4t(W+ I
^-rl + l
= min £{gJXn,lln(A-_).X„.1)
H, A„,
£-1
J— n-n|
= min E [g,(X„,|t„(), A,+l) + jL(-^1+i )]
JJ , J»-|L 1
(12.11)
onde na última linha usamos a definido da Equapáo (12.10) com n + 1 no lugar de n. Agora assuma
que para um dado n e para todo tenhamos
(12J2)
(12.13)
EntSo podemos rescrever a Eq. (12.11) na forma
j; (X,) = min E [g. (X,, ¡i, (X.) X,) + ✓„, (X,.,)]
1°.
Se a Eq. (12.12) for válida para todo A __ cntáo claramente a equa^áo
também é válida para todo Conseqüentemente, deducimos da Eq. (12.13) que
M. A-..'
Podemos assim formalmente formular oatgarifma dedinámica como segue (Bertsekas,
19?5b):
Para todo estado inicial o custo ótimo do problema básico de horizonte finito é igual a
OüdC A fundió J.t £ üblid¿j da último passo do sq^uintc algoritmo:
¿(X,)-min£[sia,g,(JQ),X1) + ¿.1(X.)]
qur áge pura tris no Lempo, enm
Alcm d¡55Q, 5C minimiza o Lado dinrití] da Eq. ()2J 4) pwa 0 rr, entlü a política H* [g*n,
P*!..Jéótima.
A Equafáo de OU miza cao de Batimán
Na sua temía básica, c algoritmo do programarán dinámica [rata de um problema de horizonte
finito. Etlamos interessados em estender o uso desfe algoritmo para tratar do problema descontado
de horizonte infinito descrito pela fun^áo de custo para avanzar da Eq. (12.5) sob urna política
estacionó ría Jt = (p, ¡.l. p,... j. Tcndo este objetivo cm mente, podemos lazer duas coisas:
* In verter o índice de lempo do algoritmo de modo que corresponda ao problema descendido.
• Definí r o custo U (A',.). () como
ftíY,, > (12.15)
Podemos agora neformular o algoritmo de programado dinámica como seguc (veja o Problema
12.4):
(X,) = mi n A[«(4. (i(X,). X) + yJ. (X)] <12.16)
que «meca a partir das condiqóes midáis
/.(Á) - 0 para todo -Y
O estado é o estado inicial, Af, é o novo estado que resulta da a^áo da política pt e y é o fator do
descomo.
Considere que Jé(í) represente o cusió ótímo de horizonte infinito para o estado inicial A\ = r.
Podemos cntáo ver J*(í) como o limite do custo étimo de K estágios correspondente i) quando o
horiiznnte K se apcwíma do infinito; i alo ó.
J*(i) = ]¡m JK(i) para todo í
(12.17)
l-sia reheóo c o do de contMao entre os problemas descontados de horizonte finito e de horizonte
infinito. Fazcndo n + 1 A' e f na Eq. (12.16) e entáo aplicando a Eq. (12.17), oblemos
(12.18)
Para estimar o custo ótímo de horizonte infinito J*(i\ procedemos em dois estágios;:
1, Estimamos o valor esperado docustop.(0» A'}cm rcla^áo a A^ escrevendo
), A¡ ] = É^gO’igÜ'M)
j-i
(12.19)
onde Neo número de estados do ambiente ep.. é a probabilidade de transido do estado inicial
Ar. = í para o novo estado A( = Jr A quanlidade definida na Eq. (12.19) é o cusió esperado
tmedioío incorrido no estado i por seguir a a$ao recomendada pela política p. Representando
este custo por c(¡, p(i))> podemos escrever
N
tfw)}= (12.20)
/-I
2. Estimamos o valor esperado de J*^) em relajo a A",. Aqui notamos que se conhecermos o
custo J*(X() para cada estado A' de um sistema de estados finitos, podemos determinar fácil-
mente o valor esperado de J*^) em termos das probabilidades de transido da cadeia de Markov
subyacente escrevendo
(12.21)
j-i
Assim, utilizando as Eqs. (12.19) a (12.21) na Eq. (12.16), oblemos o resultado desejado
J*(0= min c(r,p(O) +
(12 22)
para i = 1,2,...,N
A Equa^áo (12.22) é chamada a equacao de otimizafao de Be timan. Ela mío deve ser vista como
um algoritmo. Em vez disso, representa um sistema de .Vcquapccs, com uma cqua^ao por estado. A
soluto deste sistema de equa^oes define as fundes de custo para avanzar ótimas para os N estados
do ambiente.
Há dois métodos básicos para calcular uma política ótima, Bles sáo chamados de iterado de
política e iterarán de valor. Estes dois métodos sáo descritos ñas Sc^ócs 12.4 e 12.5, respectiva-
mente.
12.4 ITERAQÁO DE POLÍTICA
Para estabelecer a base para uma dcscricao do algoritmo de ítera^áu de política, cometamos intro-
duzindo um conceito chamado de fator Q por Watkins (1989). Considere uma política existente ¡u
para a qual a fun^áo de custo para avanzar 7^(0 é conhecída para todos os estados ¿ OQ para
cada estado i € SC e afáo a e ¿4. é definido como o cusío ¡mediato mais a soma dos castos descon-
tados de todos os estados sucessores que seguem a política p, como mostrado por
e’(f.a)=e<í.«)+xt/>({<i)Mn
J“l
(12.23)
onde a a^áo a = ]4(í). Note que os fatores Q, ^(L tr), contera mais informarán que a fun^áo de custo
para avanzar ^(j). As a^oes podem, por ejemplo, ser ordenadas com base apenas nos fatores Q+
enquanto que ordenadas; com base na fun^áo de cusió para avanzar rcqucr também o conhecimento
dos cusios c das probabilidades de transi^áo de estado.
Podemos ganhar um maior entendimento do significado do fator Q visual ¡ando um novo
sistema cujos estados sao constituidos dos estados origináis 1+ 2,.+M Afc de Codos os parca cstado-
acáo a) possiveis, como representado na Fig. 12.2. íl;i duas posibilidades distintas que podem
□coner:
FIGURA 12.2 IbuEtrafáD de
duas transieres possíveis: a
Irunsi^áD de estaca (j, á) para
ú estado jé probabilística. mas
a transifáo de estad? ípaia (i.
a) ó daterminísllca
• D sistema está no estado (/, «)„ onde nenhuma a0o é realizada. É feita automáticamente a
transiqáo para o estado/. digamos, com probabi I idadep (u); c incorrc-sc cm um CUSIO
tJ.y).
D sistema está no estado i, digamos, e a ai^ao a € ó í c realizada. O próximo estado é (/, a),
determini st icamente.
Diz-se que a política |1 c gu/aeo cm nclacáo á funcao de cUlsio para avancar.^fr) se* para codo» os
estados, p.(i) for uma a^ao que satisfaz a condifüo
(F ( j , p (i)) - m in (íT a) para todo r (12.24)
As duas observares seguinles sobre a Fq. (12.24) sáo dignas de nota:
• É possível que mais de uma a^ao mimniize o conjunto de falores Q para um estado, e neste
caso pode haver mais de uma política gulosa cm nclaqáo á funcao de custo para avanzar
pertinente.
* Uma política pode ser gulosa cm rda^o a mullas fungues de custo para avanzar
Alcm J'.shk o seguinlc lato c básico para todos os métodos de programaqao dinámica;
&1 '< * (0) = niin ¿TV rr)
(12.25)
onde ]4* é uma política ótima e J* é a funcao de custo para avanzar ótima correspondente.
Com as noqoes de faror Q e política gulosa á nossa disposíQáo, estamos prontos para dcscrever
o afgoritfíift de iteFift¿üu tiepolítica. Específicamente, o algoritmo opera alternando entre dois pas~
sos (Bcrtsekas. 1995b):
1. Ptf.r.ro de avafiacav da política, no qual sáo computados a lurujáo de custo para avanqar para
uma pobliua corrente e o falor (í correspondente para todos os estados c a^ñes.
Hidden page
Hidden page
ramente calculadas uti!izándose a Eq. (12,29). A seguir, uma política gulosa em relagao aquele
conjunto ótímo é obtida come unta política ótima Isto é,
p*(i)=argnjbi0*(j,ír)> j = L,2.....N (12.30)
onde
jí
0*(e'1j3)=c(jJ£T) + 7^pií(o)l J*(j) í=1,2,..mjV (12.31)
J-i
Um resumo do algoritmo de ilerafáo de valor, bascado ñas Eqs. (12.29) a (12.31), é apresentado na
Tabela 12.2. Este resuma incluí um criterio de parada para a Eq. (12.29).
TABELA 12.2 Resumo do Algoritmo da liera^ao de Valor l, 2
l, Comecc com um valor inicial arbitrario Ja(j) para o estado i “ I, 2,...,
2. Para ji = Ü, i, 2,..., calcule
¿+1(0=nrip
J-'
j = l,2,
Continué este cálculo até
K.(ü)- ¿(í)l< E pura cada estado j
onde e ll um parámetro de EolEranciaprEdeltTmLnado. Aflune-K que e su;a KiiíiciéncertltrLle pfiquCftG pata 7 (:)
ser piísimo g Kuficfeníe da de custo para a^nfar Podemos assim
J (f) = J *fi} pAffl ludoj ün. eS-Udos r
1. Calcule o Palor Q
G • íO = -i- YX * 01
j-i
Ü E5Í, C
j=L2»P..h^
Com ittg; determine ¿ política ótima como unü pdUticA gelosa J (j);
¡i * = sfxininG*(t^)
3<
Exemplo 12,1 O Problema da Diligencia
Para ilustrar a útil idade do fator £) em programaban dinámica. considerarnos <y problema da diligencia. Um
cavador de fortunas em Missouri dccidiu partir para o ocslc p^ra se juntar ú corrida do nuro nu California em
meados dn sécalo dc/enové (Hiller e Lieberman. 1995). A jornada ex iglú viajar cm diligencia atraves de
regines desocupadas, o que impói mn sério risco de ataque por saqueadores ao longo do caminho. O ponto
inicial da jomada (Missouri) e o destino (Califonda) eram fixos, mas baria uma cscoltia considcrável cnvol-
vendo nutras dito osladas que puderiam ser atravessados no roteiro, como mostrado na Fig. 12.4. Neste figura,
temos o seguidle:
FIGURA 12.4 Grata de IluxO para O prObtema da diligencia
Um total de IU estados, cada um representado por uma letra.
• A directo da viagem é da esquerda para a direita.
• Há qualn» eslágios (i.e,, COflidSS de diligencia) do pdrtEO de embarque n.¡ Catado A (Missouri) alé O
destino no estado J (California).
• Na transito de um estado para o seguróte, a a^áo realizada pelo calador de Fortuna é se mover
acima, á Frente, ou abaixo.
• 1 Li urti total de 18 rote i ros postras do estado A para o estado 7.
A Figura L2.4 incluí tambem o custo de uma apólice de seguro para lomar qualquer cánida de diligencia
bancada em uma . ivaliaijáíi cuidadosa da neguranca daquela corrida. O problema C encontrar O rolcíro do
estado A para o esludo J ccftl a OpóliCC de según» mais barata.
Para encontrar o roteiro étimo, consideramos uma scqücncia de problemas de horizonte finito, come-
bando do destino no estado Je trabalhando no sentido retrógrado. Isto está de acorde com o principio de
otimizn^So de Bellman descrito na Se^So 12.3.
Calculando os latines Q para n último estágio antes do destino, constatamos fácilmente da Fig. i2.5a
queos valores (> termináis sáo 05 seguróles:
ahaixo) “ 3
£?(/, acima) 4
Estes números cstáo indicados nos estados// e/, respectivamente, na Fig. ] 2.5a.
A seguir, movendo para Itíh um estágio c utilizando os valores Q da Fig. 12.5a. temos os seguimos
valores
FIGU R A 12.5 Pasaos envcívktos no cálculo dos la lores O para o prottema da dilkjGr: ¡a
Q(E, á frente) = 1+3=4
Q(E, abai^o} = 4+4=8
£J(F, acima) — 6+3-9
abaixo} — 3 + 4-7
@((7, acinta.) = 3 + 3=6
i frente) = 3 + 4=7
Hidden page
Hidden page
668 REDES NeUMB
Entretanto, c importante se rcconhcccr que uma vez que sejam i:itroduzidas aproxima^ocs,
nao se pode esperar que a lún^áo de escore J( „ w) convirja para a fun^aü de custo para avanzar
clima Isto se deve ao falo de que-/*<) pode nao estar den tro do conjunto de funíoes represen-
tadas estala mente pela estrutura de rede neural escolhida.
Ñas duas próximas sepóes, discutimos dois proccdi mentas de programado dinámica aproxi-
mada com aproximares da tuiisdo de cuelo para avanzar. O primeiro procedí mentó, descrito na
Scijáo 12.7, trata da ileracáo de política aproximada, assumindo que esteja disponivcl um modelo
raarkoviano do sistema. O segundo procedimento, dése rito na Sccao 12.8, trata deum procedí mem
lo chamado aprendizagem Q, que ufo faz qualqucr supositáo.
12.7 ITERAQÁO DE POLÍTICA APROXIMADA
Suponlia que tentamos um problema de programado dinámica para o qual o número de estados
possiveis e afdes admissíveis seja muito grande, tomando o uso de uma ahordagem tradicional
impraticávcL Assumimos que disponías de um modelo do sistema; isto c, as probabilidades de
transicuo pJn) e os c listos observé veis g(j, «,./) sáo todos eonhucidus. Para tratar desea situando,
proponías usar uma aproxi ma^áo para a iterarán de política, baseada na simulando de Monte Cario
c no método dos mínimos quadrados, como descrito a seguir (Bcrtsckas c Tsilsiklis, 1996).
A Figura 12.7 mostm um diagrama em blocos simplificado do (iigarUmv^mxmado tie iiera^iío
de política. Ele c sitn: larao diagrama cm blocas da Fig. 12.3 para o algoritmo tradicional de iterarán
de política, mas com uma di lerenda importante: o passo de avallado da política na Fig. 12.3 foi
substituido por um passo uproximuth. Assim, o algoritmo aproximado de iterado de política opera
alternando entre um passo de avalizo aproximada da política e um passo de mcihoria da política
como segué:
FIGURA 12.7 Diagrama
em blocD^ aimphücfido tfo
algoritmo aprodmade da
teraí-áo ds política
CuhCü para
l r PíJ.í.ío Je tiJútp^i'i.'iCúr. Dada a política corrente m calcula-si: uma fun^ao
de custo para avanzar J*(í, w), que aproxima a funíáo de custo para avanzar real ^(í) para
iodos os estados i. O vetor w é o vetor de parámetros da rede neural utilizado para realizar a
aproximado.
2+ Awa <te melhoria dapalifiija. Utilizando a funqáo de custo para avanzar aproximada
w), c gerada uma política melhorada p. Esta nova política c pnijctada para ser gulosa cm
rela^ii'i a w) para todo /.
Para que o algoritmo aproximado de ibera^áa de política produza resultados satisfatários+ c
importante escolher cuidadosamente a política utilizada para iniciar o algoritmo. Isto pode ser feito
aíravés do uso de heurísticas. Altemativamenie, podemos comear com um vetor de pesos w e
utilizá-lo para derivar uma política gulosa, que por sua vez é utilizada como política inicial.
Suponha cntáo que, além das probabilidades de transirán c cuates observados conhcridos,
tenhamos os seguí ntes jiens:
• Urna política estacionaria p como a política inicial
* Um conjunto de estados representativo do ambiente Opcraiional
• Um conjunto de MO amostras da finito de custo para avanzar >'(0 para cada estado / e Sí;
uma amostra é representada por Mj, m), onde m = 1,2...., Af(j)
Considere que j1*^, w) símbolize uma representadlo aproximada da funpao de custo para avanzar
A aproximaban c realizada por uma rede neural (p.cx., um pcrccptron de múltiplas camadas
tremado com o algoritmo de rctropropagacáo). O vetor de parámetros w da rede neural é determina'
do utilizándose o método dos mínimos quadrados, isto é+ minimizando a fuñado de custo;
Afín
*(w>= Hw,™) (12.321
rtf
Tonda determinado o vetor de peso ótimo w c portanto a íunfáo de custo para avanzar aproximada
'v). determinamos a seguir os fator» Q ulilizando a fónnula (veja as Eqs. (12.20) e (12.23))
g(í,uTw) = pv («Xg(taJ') + W)J (12.33)
jeí
ondepj,a) é a probahilidade de transiese do estado i para o estado j sob a a^áo a (conhecida), g(i,
j) é o custo observado (também conhecido) e y é um fator de descontó específico, A iterapáo é
completada utilizando-sc estes faíorcs Q aproximados para determinar urna política melhorada ba-
scada na fórmula (veja a Eq, (12,28))
p(¡)= argmingíAfljW) (12.34)
«
É importante notar que as Eqs (12.33) e (12.34) sáo utilizadas pelo simulador para gerar a^Ces
apenas nos estados que sáo realmente visitados pela siinulabáo, cm vez de gerádas cm todos os
estados. Dessa forma, estas duas equaoAes náo sofrem da maldicáo da dimensionalidade.
O diagrama em blocas da Fig, 12.8 aprésenla uma describa mais detalhada do algoritmo
aproximado de iteraban de política. Este diagrama consiste de quatro módulos conectados entre si
(Bertsekas e Tsitsiklis, 199¿):
L O timufüd&r, que utiliza as probabilidades de lransibáo de estado dadas e os cusios observados
cm um passo para construir um modelo substituto do ambiente, O simulador gera duas coisas:
(a) estados em resposta a afdes para i trinar o ambiente c (b) amostras da fun^ao de cusió para
avanzar para uma dada política.
2. O gerador de a;áo, que gera urna política melhorada (i.e.. seqüéneia de affies) de acorde com
a Eq,(l 2.34),
Hidden page
Hidden page
Hidden page
Teorema de Convergencia*
Suponha que o parámetro da taxa de aprendiiagem q/r. a) satisfaga as condifóes
XnAa)' * e P«St[itlo(M (12.4])
a vil '«n
EnJuü, a rfí^j/anerj {J ¿r.J/ ^raJxr jWrj ¿r^ürifmo de 0 converge epm
prü&cródúÁadí? / pjra a vaJor ¿íifh# £>*(jp depara fadas m poner ¿sfato-apfo f¿ a.»1 </ir¿rrttfc> ú flíjfltn?
déJfe-navfies- nj£ aproxima do úr/rnírp, desdeñeforfa? íkparar arfeadü-flfáoj^'aflf WiíadtW ífl/¡rJÍfflS
VCS.
Um exemplo de um parámetro de aprendizagem variável no tempo que garante a convergencia do
algoritmo é
n"=p7P ”'-2"" (12.42)
onde a e p sáo números positivos.
Em sumat o algoritmo de aprendizagem Q c uma forma de aproximado eslocáslica da política
de iteraofio de valor. Ele armazena o fator Q para um ¡Mico par estadoa^áo a cada iterado do
algoritmo, isto c, o estado comente c a a^ao realmente cxccutada. Mais importante é o fato de que,
no limite, o algoritmo converge para os valores Q olimos sem formar um modelo explícito dos
procesaos subjaccntes de decisño markoi ianos. Uma vez que os valores Q olimos csícjam disponí-
veis, pede-se determinar uma política ólima relativamente com pouca computado utilizando a Eq,
(12,30),
A convergencia da aprendizagem Q para uma política ólima assume o uso de uma representa-
í3o por tabela de consulta para os fatores Q Qa(lr £*) Este método de representado é direto e
computacionalmente eficiente. Entretanto, quando o espado de entrada consistindo de pares estado-
a^ao for grande ou as variáveis de entrada forcm continuas, o uso de uma tabela de consulta pode
ser proibitivamente custoso devido á neccssidadc de uma memória muito grande. Ncsla situado,
podemos recorrer ao uso de uma rede neural para fiiu de aproximado de fuñico.
Aprendizagem O Aproximada
As Equaqócs (12.38) c (1239) dcíincm as fórmulas de atualiza^ao para o fator Q para o par cstado-
a^áo corrente (<, aj. Este par de equacfcs pode ser rescrito na forma equivalente
+n„ (4 ) g< i^n JJ+Y mm Q, üB, 6) - fi. (4, a„)
- r
(12.43)
Tratando a express^o dentro-dos colchen»» no lado direita da Eq. (12,43) como o sinal de erro
envolvido na analiza^5o do fator Q corrcntc h.. ún)T podemos identificar o fator Q alvo (desoja-
do) no passo de tempo n como:
Hidden page
TASELA 12.4 Resumo do Alg Dril m d Aproximado do Aprendizagem Q
1. Comece com um vetar pesa :ntLÚal wH, que resultu nú (atíxr Q @0,,. pu« Wj; o velor peso wn se refere a uma rede
neural utilizada para realizar a aproxima^ to.
2. Puto a irera^&o ft = I, 2,,.^ faga c seguróte:
(a) Para a configurado w da rede neural, determine a a^ao ótima:
a, = imnQl(fa,an,w)
(b) Determine o faict Q alvo
Cf" «A, - S(<n, ) + Y ¿n ÜtfU*)
le) Alualize o fator Q
w) = Í?J > a,,w) + w)
onde
ÍV4^XÍZ,’(f-(^w)-£iaA^)X M =
0, caso contrario
(ó) Aplique p ) como entrada para a rede neural produzirtdo a salda Qjj*, ar, w) como uma aproximacSo
para o iator Q alvo í2^™(i,1a,hwk Modifiqué o vetar peso w levemente de modo a traztr a*, w}
para maja próximo do valor alvo í?"''(j. .¿¡.. w).
r el Volts para o passo (a) e repita a computaba.
Explora; ao
Na iterapao de política, todas as partes potencialmente importantes do espado de estado deveriam
ser exploradas. Na aprendizagem Q, temos uma exigencia adicional; todas as atftes potencial mente
vantajosas dever ¡aun lambém ser tentadas. Em particular, todos os pares cstado-acao admissíveis
deveriam sur explorados com frcqücncia suficiente para satisfacer o teorema da convergencia. Para
uma política gulosa representada por p, apenas os pares cstado-a^o 0\ p(¿)) sao explorados. Infe-
lizmente; nao há garantía de que todas as a^fies vanta josas sujam experimentadas, mesrao se o
espado de estado inteiro for explorado.
O que neceas i tamos é de unta estraté^a que expanda a aprendizagem Q fomcccndo um com-
promisse entre dois objetivos confutantes (Ttirun, 1992):
• A expiora^da, que assegura que todos os pares estado^atfo admissíveis sejam explorados
com freqü encía suficiente para sai i sfazer o teorema de convergencia da aprendizagem Q.
• O apmveiiamento, que procura minimizar a fun;3o de custo para avanzar seguindo uma
política gulosa.
Hidden page
Hidden page
A Figura 12.12 aprésenla os resuliados correspondentes obtidos utilizando um perccptron de
múltiplas camadas com dois nós de entrada. 10 neurónios ocultos o um neurónio de saida. Um dos
nós de entrada representa o estado e os outros nós representare a a^áo realizada para se mover do utn
estado para o seguinie, A saída do perceptron de múltiplas camadas représenla o valor Q calculado
pela rede. A rede foi [reinada utilizando o algoritmo de rctropropagacáo padrao. O valor O alvo
utilizado no tempo rr foi calculado ulilizando-sc a Eq. (12.44). O parámetro da laxa de aprendiza-
gem foi forado em 0,012 e n3o foi utilizado o falor de momento. A rede foi tremada com 10.000
tentativas para cada par estado-apáo. A Figura 12.12 aprésenla as historias de aprendizagem para os
valores Q 0Í/1, acima), Q(C, i frente}; á frente) c Q(I, acima). O rolciro ólimó encentrado
pela rede foi
TL-titaij'.-j (* 100)
TlilIjIÍv¡i (k |íKI)
FIGURA 12.12 Curve? es eprendizagem para o problema da diligencia utilizando uma rede neural. {a)
Curva de aprandizagam para O{A. acima}, (b) Curva de aprei’dizagem para O (C, u trente). (e) Curva de
aprendizagem pare Q (E, á frente), (d) Curva d& aprendizagem para Q (/, acim?)
o qual s.c reennhece como um dos reteiros óiimos enm um custo total de 11.
As exigencias ccmputac loriáis para os dois melados de implemenla^áo sao resumidas como
segué:
Hidden page
Na aprendizagem Q aproximada, é utilizada uma rede neural para aproximar as estimativas dos
falaces Q de modo a evitar a necessidade da exigencia cxccssiva de memoria quando o número de
estados possí veis for grande. Em resumo, a aprendizagem Q aproximada c um algoritmo fraseado
em simulado para resolver um problema de dccisao markoviano quando um modelo do sistema
náo estiver Jisponívci c a exigencia de memoria for um requisito adicional. Claro que ela pode ser
aplicada mesuro se um modelo do sistema estiver disponíveL e neste caso ela fomece uma alterna*
ti va á iterado de política aproximada.
As técnicas de programarán ncurodinámica sáo particularmente cíclic as na solufáo de pro*
hlemas de larga escala nos quais o plancjamcnto é uma preocupado importante. As abcudagens
tradicicnais para a programarán dinámica sáo difícilmente api ¡cavéis a problemas desta natureza
por causa do enorme tamanho do espado de estado que deve ser explorado. A programadlo
ncurodinámica de falo tem sido aplicada com sucesso para resolver problemas di ficéis do mundo
real cm muilos campos diferentes, que incluein o jugo de gamáo (Tesauro, 1989,1994), a otimlzacao
combinatoria (Bertsekas e I silsiklis, 1996), o controle de elevadores (Crilcs c Bario, 1996) c a
aloca^áo dinámica de canal (Suigh c Bertsekas, 1997: Nie e HaykínT 1996, 1998). A seguir, a apli-
cado ao jogo de gamáo é descrita com algum detalhe.
O desenvolví mentó de um programa de computador bascado em rede neural para jogar gamao,
primciramenle relatado cm Tesauro (19891 e mais tarde aperfei^oado em Tesauro (1994), é uma
historia de succsso particularmente impressionante que tem sido uma fonte de molivaqáo para a
pesquisa em programado neurodinámica, Gamito é um jogo amigo de tabú leí ro para dois .rogado-
res. É jogado efetivamente ao longo de um caminho unidimensional. Os jogadores re\rezam-se
j Ogando um par de dados c movendo corrcspondcntcmcnlc suas pojas cm d •.rendes opostas ao tongo
do edminho. As jugadas válidas feitas porcada rogador dependem do resultado do lance dos dados
C da confígmafáo do tabú leí rn. O primeim jngadnr a mover Indas ¿is suas pc^as para frente ate O
final do tabule i ro c o vencedor. Ojogo pode ser modelado como um processo de dccisáo maricoviano,
com um estado sendo definido por uma describo da configurado do tabuleiro. o resultado do lance
dos dados o a identidade do ¡ogadorque está fazendo a jogada. A prime ira verrio do neurogamáo
construida por Tesauro (1989) uLilizcu aprendizagem supervisionada. Ela fbi capaz de aprender em
um nivel intermediaria forte, dada apenas urna describo "grosseira11 do estado. Tal vez a dcscobcrta
mais interesante relatada ten lia sido o hont eempertamento em relajo ao esta lamento, no sentido
de que, conforme o tamanho da rede neural c a quantidade de experiencia de treinamento ¡am
crescendo, foratn observadas inelhorias substanciáis no desempenho. A rede neural utilizada no
estudo fu ¡i um perceptron de múll ¡pías camadas (MI. P) Ireinado com o algoritmo de retropropagaqán.
O mclhor desean penho foi cbtido utilizandO'Sc um MLP com 4(1 neurónios ocultas, e o treinamento
foi realizado sobre um total de 200.000 jogos. Ein um estudo subseqlíente relatado por Tesauro
(1994), urna forma de iterado de política chamada de X) fílinn'atíi foi usada para tneinar a rede
neural; DT vem da expresan (rpnntiiZitgentpoHliJmHfu Itfftp&füi, adotada porSutlon (1988). A
D I (A.) ot¡mista é um método bascado em simulado para aproximar a fun^áo de custo para avanzar
J*, no qual a política ¡i é substituida par tuna nova política p que é gulosa cm rclaqáo á aproximado
de a cada transido de estado (Bcrtsekas c Tsitsiklis, 1996). O programa de computador babeado
neste método de programado ncurodinámica é normalmente referido como gíiinao DT. Tesauro
adicLODOu fundes manipuladas do estado (Le,, feifoes) á representado da entrada da rede neural,
posibilitando que a gamáo DT jügasse em um nivel de mestre forte, extremamente próximo ao
inelhor jogador humano do mundo. Entre as indícapdes que contribuirán! para esta avallando están
cm umerosos testes do gamáo D ] jogando contra virios grandes mestres humanas de classe mundi-
al (Tesauro, 1995).
Ftoai*MAi;ÁD Meurudin amicx 681
NOTAS E REFERENCIAS
1. A abordagem cEássiea para a aprcm::/agcm por reforjo ó fundamcniadá ng psicología,
remontando ao trabalho inicial duThnmdike (|911) sobren aprendizagem animal e amuele
de PavJov (1927) sobrecondicionanientú. Conlribuijócs á aprendizagem por reforjo clás-
tico também inclucm n trabalho de Widniw ri al. (1973); naquelc artigó, foi introduzicla a
no^áo de ert/rcíí. A aprendizagem por reforjo clástica é discutida no livro de Hampson
(1990),
Contribuicóes importantes a aprendi™*gem par reforjo moderna incluem os irabalhos
de Samuel (1959) sobre O seu celebre programa de jago de damas, de Barbo el al. (1983)
sobre í-istcmas críticos adaptalivos. de Sutton (I9S8) sobre métodos dediferen^a temporal
ede Watkins (19R9) sobre a aprendizagem Q. O manual de controle inteligente de Whitc c
Soígc (1992) aprésenla tnaicrial sobre wiitrúlc ólimo por Whílc e Jordán, sobre aprendi-
zupem por refbfQOC métodos erítjcos adaptantes por Barro c sobre programado dinámica
heurística por Werbos.
Bertsekas o Tsilsiklia (1996) apresenlam o primeiro iratamcuto da aprendizagem por
TClbiyo moderna na forma de livro. Para um reí ala h i Hlónuu sobre aprendizagem porrelbr-
$o. veja Sutton c Bario (1998).
2. A prcii>ramaQáa dinámica foi desenvolvida por R. E. Bel Imán no final dos anos 50; veja
Reliman (1957), Bcllman e Drey fus (1962). Para uma expon i^áo detalhada sobre c asían-
te. veja o livro em dois vol limes de Rertsekas (1995 b).
3r A Icrajáo de política C a itflttfiO de vplor sao as dais méladoH principáis du programaban
dinámica. Há dois outros métodos de programado dinámica que merceem ser menciona-
dos: íj méfi7í/rj ¿j'é1 í ruM.xv-.StiJt'/ e aprogroma^ut? dinámica tiSSiriíTürta (BartO el aL. 19951
Bcrtsckas, 1995b). No método deGauss-Scidel, a íunfEodecuito para avanzaré ¡Mualizadá
cm um estado a cada tempo cm uma vatru Jura scqüirncial de todos os estados, com a
competijio para cada estado sendo bascada nos cusios mais recentes dos outros estados. A
programarán dinámica astinctOM di tere do método de Caiifis-Seidel na medida em que
nao é organizada em termos de varreduras sucess:vas sistemáticas do conjunto de estados.
4. Na p j i11 na 96 da sua tese de doutorado. Watkins (1989) faz as seguinles observares sobre
a aprendizagem O;
“O apéndice I apresenta uma pro^a de que este método de aprendizagem luncicma
pura os procesos de decisio markovianos finitos. A pro va também mostra que o mé-
todo de aprcnd./Jigem convergirá nipidamenle para a funG^o de valor de a^áú ótima.
Embora esta seja uma idéia muito simples, tanto quanto cu saiba, cía nao foi sugerida
antes. Entretanto, deve ser dito que os processos do dcci^áo markov lanos c a progra-
macáu dinámica cstccásücii lém sido extensivamente CStUdftdQS pm" mais de trinlu
anos para sem usados cm virios campos cifcrcntcs. e c improvávcl que nmgucm
tenha levado cm eonsideracio antcrionTieiitc o método de Monte-Cario.”
Em um cumcntária de rodapé sobre estas ObKtVAfda, Baria et aL (1995) xalientam que,
embota a idéia de alribtur valores a pares csmdo-íiíáo forme a bdsc da abordagem da
programarán dinámica cstudada cm ]>cnardn 119fi7), cíes nao encontraran; algoritmos
como o da aprendizagem Q para esl i mar estes valeres que anteccdesscni a tese de Watkins
de 1949.
5. Em Watkins {1989) foi apresontado o esbozo da uma pro va do teorema de convergencia
para a aprendizagem Q. que fei mais tarde reinada em Walkins e Gayan (1992). Em
Tsitsíklis (1994) foram apresenlados resu hados miis gerais sobre a convergéneiu do apren-
dizugem Q; Veja latilbém Bensekas e Tsitsíklis (1996).
Hidden page
Hidden page
Hidden page
CAPÍTULO 13
Processamento Temporal
Utilizando Redes Alimentadas Adiante
13.1 INTRODUJO
O lempo constituí um ingrediente essencial do processc de aprendizagem. Ele pode ser continuo ou
discreta. Independientemente da sua forma, o tempo c uma entidade ordenada que c básica para
muitas tarefas cognitivas encontradas na prática, como a visic, a tala, o processamento de sinais e o
controle motor. E atravta da incorporado do lempo na operado de uma rede neural que ela é
capacitada a seguir as variantes estadísticas em procesaos nao-estacionarios como os sinais da tala,
fiituis de radar, siria ls adv indos do motar de um autcmávcl c flutua^ocs cm presos do mercado de
apdes, apenas para mencionar alguna dcstcs procesaos. A questáo come pedemos incorporar o
tempo na opera^áo de uma rede neural? A resposta a esta questáo fundamental se encontra em uma
das duas seguintes possibil idades:
• Repnesenfítwv implícita, O tempo é representado pelo efeito que tem sobre o processamenlo
de sinais de uma maneira implícita.1 Por exemplo, o sinal de entrada c amostrado uniforme-
men¡et c a seqüénda de pesos sinópticas de cada neur&nic conectados ú camada de entrada
da rede safra urna convoiufao com uma seqüene i a diferente de amostras de entrada. Fazen-
do assim, a estrutura temporal do sinal de entrada c inserida na estrutura espacial da rede.
* Representando explícita. O tempo recebe sua prdpria representafáo particular.3 O sistema
de ecolocaliza^ao deum morcego, por exemplo, opera emi lindo um curto sinal de frcqüéncia
modulada (FM), de modo que o mesmo nivel de mtensidade é manttdo para cada canal de
freqiténcia restrilo a um periodo muito curto dentro da varredura de FM Sáo realizadas
múltiplas comparaQocs entre várias ftcqücncias diferentes codificadas por um arranjo de
receptores auditivas com a finalidade de exirair in formado precisa sobre a distancia (al-
cance) até o alvo (Suga e Kanwal, 1995), Quando um eco é recebido do alvo com um atraso
desconhecido, um neurónio (no sistema auditivo) com uma linha de atraso casada com este
sinal responde, fomecendo dessa forma uma estimativa do alcance de alvo.
Neste capitulo, estamos preocupados com a representado implícita do lempo, pela qual uma
rede neural “estática'1 (p.ex.. um perceptron de múltiplas camadas) e suprida com propiedades
rfnámkttf. Isto, por sua vez, toma a rede sensivel á estrutura temporal dos sinais portadores de
.nfomna^ao.
Para que uma rede neural seja dinámica, ela deve ter mflrrdrrcr. Como satientado no Capitulo
2, a memoria pode ser div >dida cm memoria de "curio prazo" c de “longo prazo", dependendo do
tempo de rctcncáo. A memoria de longo prazo é inserida em uma rede neural através de aprendiza-
gem supervisionada, pela qual o contcúdo de informacao do conjunto de dados de treinamento c
armazenado (parcial mente ou totalmente) nos pesos sinópticos da rede. Entretanto, sea tarefa con-
siderada ti ver uma dimensáo temporal, necessitamos de alguma forma de memória de curto prazo
para tomar a rede cinámica Uma forma simples de inserir memoria de curto prazo na estrutura de
uma rede neural é íi través de afntíós tic taftpu. que podem ser i ni pie mentados a nivel Sinóptico
dentro da rede ou na camada de entrada da rede. O uso de atrasos de tempo em redes neurais tem
motivado neurobiológica.. iú que é bem ccnhecido que atrasos de sinal sáo 0111 presentes no cércbro
edesempenham um papel importante no processamento neurobioló^codainfonnasMfBraitenberg,
1967. 1977, 1986; Miller, 3987).
Organiza;ño do Capitulo
ü material neste capitulo está organizado em trés partes. A primeira parte, consistindo das sebees
13.2 e 13.3, trata das estruturas e modelos de rede. Na Se;áo 13.2, apresentamos uma discussao das
estruturas de memoria, seguida pelaSe?áo 13-3 sobre uma descrlfáo de duas diferentes arquiteturas
de rede para o processamento temporal de sinais.
A segunda parte do capitulo, consi$Lindo das Scqócs 13.4 a 13.6, trata de uma classe de redes
ncuraiü conhecida cómo redes alimentadas adianto, focadas c atrasadas no tempo; o termo “focada"
se refere ao futo de que a memoria de curto prazo está localizada inleiramenle no terminal frontal da
rede. Um experimento computad onal sobre esta estrutura é descrito na Sepáo 13.6.
A tere eirá parte do capítulo, consi si indo das Scpocs 13.7 a 13.9, trata das redes alimentadas
adiante distribuidas, atrasadas no (empu, ñas quais 1 inhas de airase sao distribuidas alravcs da rede.
A Secan 13.7 dcscrcvc modelos espa^o-temporais de um neurónio, seguida de urna diseussáu na
Se^áo 13.8 sobre a segunda classede redes neurais mencionada acima. Na Scqáo 13.9T desenevemos
o algoritmo de rctropropagacáo "lemporal" para o treinamento supervisión ado de redes alimenta-
das adiante distribuidas, atrasadas no tempo.
O capitulo concluí com algumas obsen-a^óes fináis na Se;ác 13.10.
13.2 ESTRUTURAS DE MEMÓRIA DE CURTO PRAZO
O papel principal da memoria c transfrjt'mar1 urna rede extática em uma rede tiintimica. Em particu-
lar, incorporando memoria na estrutura de uma rede estática como um perceptron de múltiplas
camadas ordinario, a saída da rede se toma mna fun^áo do lempo. Esta abordagem para construir
ura sistema cinámico nao-linear é di reta porque fomece uma clara separaban de responsabilidades:
a rede estática é responsável pela náo-lincaridade. e a memória é responsável pelo tempo,
A memória de curto prazo’ pode ser impfomentada cm tempo continuo ou em tempo diséñelo.
O tempo continuo é representado por/, c o tempo discreto é representado por ti, O circuito resistivo-
capaciiivo da Fig. 13.1 c um cxcmplo de memória de tempo continuo, que c caracterizada por urna
Hidden page
Ulibdtde L Unidade 2
U nid-ade
Sinal de
en.1i3da
Twuniütii de flkfa
FIGURA 13r2 Memoria de linha de atraso derivada generalizada de ard&m p
De agora cm diante. gííri será referida como o núcleo gerudor da memoria de tempo discreto.
Com base na Fig. 112, podemos fonnahnente definir tima memoria de lempo discreto como
um sistema linear de única entrada c múltiplas sai das (SIMO, single tnput-nndtipleautpití} invariante
no tempo ciijo núcleo gerador satisfaz estas propriedades. Os pontos de júntelo, aos quais os termi-
náis de saida da memoria sáo conectados, sáo normalmente chamados de derivagoes. Note que para
uma memoriade ordem/', háp + l deriva^óes, com uma derivado pcrtcnccntc á entrada.
Os atributos de uma estrutura de memoria sao medidos em termos de profundidad? e resolu-
9Í0. Considere que g hi) represente a resposla global ao impulso da memoria, definida como p
convolutjdes succssivas dcgói), ou. equivalentemente, como a transformada r inversa de G^z), A
profiuididade dameniória, representada por D, é definida como □ primeiro momento temporal de
g. i n)„ Como mostrado por
0=¿í®/rt) (13.5)
i-i4
Urna memoria de baixa profundidad? D manlcm o scu contcúdo de informado so mente por um
periodo de lempo relativamente curto, enquanto que uma memória de alta pro fundí dade manlcm
seu contcúdo de informarán muito mais longc no passado. A da mefítória, representada
por R. é definida como o número de deriva^oes na estrutura de memoria por unidade de tempo. Uma
memoria de alta resoluto R é capaz de manter informado sobre a seqüéncia de entrada em um
nivel fino, cnquanle que uma memória de baixa rcsolu^ác pode fazer isso somonte cm um nivel
muito mais grosseiro. Para um número fixo de deriva^oes, o produto da prefundidade de memoria
pela resoluto da memoria é uma constante igual á ordem da memória p.
Diferentes esqnlhas do núcleo geradorg (ff'J naturalmente resultam em diferentes valores para
a profundidad? £) e resolu^áo /?, cómo ilustrado ñas duas cstruluras de memoria a seguir.
Mcttiória de linha de atraso derivada. A Figura 13.3 mostra o di agrama cm bíneos da forma
mais utilizada de memoria de curto prazo chamada de memoria de linha de atrasa derivada. Con-
siste de p operadores de atraso unitário. cada unn caracterizado por G(z) = z-1. Isto ót o núcleo
gerador ég(n) = fi(rr - I), onde &(?i) c o impulso unitario:
^P1 " = ° (13.6}
|0,
A resposla global ao impulso da linha de atraso derivada da Fig, 13.3 é g.(/j) = 5(n -p). Substituir
este L¡^(n)na Eq. (13.5) produza profoiulidAdetUmcmária D=/j, quee razoávcl Liiluitlvamentc. Da
Fig. 13.3 vemos que ha apenas uma derivado por unidade de lempo; com isso, R =• I. Assim, a
Hidden page
Hidden page
Hidden page
Hidden page
Unidades ocultos
¡ Umdndcs de saidü
L'mdaduK ck triLlrada
16 fki? de mirado
S unidades ocuILbf.
c-ada unta íúncctada a
ilhílis íta ñus de eiUrtLlu.
- unidades de salda,
cada unía conectada a
liidaM Ulm kld:kw QCLikláK
AtHMfl de Ipnpo-dv
1.13.
A|MB df 'bvmpu de
L2. J. 4.5
Cortes Lúinporais
dci especcú^rama
ibl
FIGURAIS? {a* Uma rodo cujjos nourónios ocultos o nourtmos do saida sio repli-
cados alravés do tempo. (b) RepreEantaQáo de rede neural de atrasos de tempo
(TDNN}. (Ralirado de K.J. Lang e GE. Hinton. com permissáo)
es seus estados ocultos; veja a nota 11 no Capítulo 11. Mullos sistemas híbridos de TDNN e HMM
foram estudado1; na Literatura.1
13.4 REDES ALIMENTADAS A DI ANTE
FOCADAS ATRASADAS NO TEMPO
A útil i za^ío prototípica de uma rede neural estática (p.eJt.. perceptron de múltiplas camadas e a rede
furif J-o lJu bsK radial) ó no tflruwnil pcuAifeF» O
t/c patirik'a. ao contrario, requero processamenlo de padrees que evoluem no lempo, com a resposta
em um instante particular de tempo dependendo nao apenas do valor presente da entrada, mas
também de seus valores passados. A Figura 13.8 mostea o diagrama em blocos de um filtm ndo-
linear bascado cm uma rede neural estática (Mozcr, 1994). A rede é estimulada atraves de uma
memoria de curto prazo. Especifica mente, dado um sinal de entrada consistindo do valor presente
jr(*r) c dep valores passados.rfn - 1-p) armazenadmí cm uma memória de linha de atraso de
ordem por ejemplo, os parámetros livres da rede neural sáo ajustados para minimizar o erro
médio quadrado entre a saida da nede,.i^?}T e a respusta desejada dí^).
A estrutura da I ig. 13.8 pode ser imp(ementada ao nivel de um único neurona ou de uma redo
de neurónios. Estes dois casos eslío ilustrados ñas Figuras 13.9 e 13. W, respectivamente.
FIGURA 13.8 Fillrq náD-linsar canstruidó cflrrt uma rada naural asiática
FIGURA 13.9 Filtro rwural tacado
Para simplificara aprésentelo, utilizamos unta memoria de linha de atraso derivada como a estru-
tura de memória de curto prazo ñas Figuras 13.9 e 13,10, Clanunente, untas as figuras pederíam
ser generalizadas utilizando-se uma unidade com fintfáo de transferencia G(z) no lugar de z ’.
A unidade de pfwessafnentü temporal da Fig. 13.9 é composta de uma memória de linha de
atraso derivada com suas derivares conectadas ás sinapses de um neurónio. A memória de Linha de
atraso derivada captura a informaban temporal contula no sinal de entrada e o neurónio insereesta
infbnnafáo cmscus próprios pesos sináplicos. A un idade de processamento da Fig. 13.9 é chamada
de /r/rm neural focado,, focado no sentido de que a estrutura inteira da memória e localizada no
temíLiiíil de entrada da unidad?. A saída do filtro, em resposia á entrada e aos seus valores
passados .v(;r - i).r(.n - p), é dada por
.V, (n) = <p -¡) + h¡
M-3 f
Entrada
E> -
j(n -1)
2.
f{rt - p)
Saida
y(")
Xn - Z)
FIGURA 13.10 Rede neural alimentada adianto focada atrasada no lempo (TLFN focada):
os niuei» (fe bias forarn omitidos por conveniencia de representado
onde (p(0 é a fun^Bo de ativa^Bo do neurónio y, os tul/) sao seus pesos sinópticos e b. é o bias. Note
que a entrada para a fon^ao de ativa^ao consiste de um bias mais a convolu^ao das seqúen cías de
amostras de entrada e pesos sinópticos do neurónio.
Vol lando-nos a seguir para a Fig. 13,10, referida como uma rede alimentada odiante focada
atrasada no tempo (TLFN focada,time faggedfeedforward network), temos aquí um filtro
nao-! inear mais poderoso» consistindo de urna memoria de linha de atraso derivada de ordem p c um
perceptron de múltiplas camadas. Para (reinar o filtro, pedemos útil i zar o algoritmo de retropropaga^io
padrao descrito no Capítulo 4. No tempo n, o "padrao temporal'' aplicado ó camada de entrada da
rede é o velor sinal
x(/r) = (x(n), - ।)....- p) ]r
que pode ser visto como uma describo do estado do filtro nóo-linear no tempo n. Uma época
consiste de uma seqiténcia de estados (padróes), cujo número é determinado pela ordem da memó-
ria p c o tamanho j¥ da amostra de ireinamcrUOr
A salda do filtro náo-linear, assummdo que o perceptron de múltiplas camadas tem uma única
camada oculta como mostrado na Fig. 13. 10, c dada por
" A-P \
k r=<i }
(13.12)
Hidden page
PRDCLSAaMEMTO TEMPORAL Uri1.tZAN]X> RH>Hí ALIMENTADAS ADrANTE 697
figura 1a.11 Rabilado de estporimenio «iTipuiMíortat softra previsto de um pesw. (a)
Suparposi^fiodas termas de onda real (continua) e prevista (Uace|ada). (b) Forma de onda do
erro de previsto
Banco de
núcleos de
caivolufío
(ñlirrts
Ilttk-
rJo-ltlKHT
Hlálúa
FIGURA 1315 Eetmtyre
genérica para o teorema do
mspeam&nlD miope uniwrsal
Por invariante a destacamento*' consideramos: sej(n) é a saída do mapa devido a urna entrada x(n),
entac a saída do mapa devido á entrada deslocada - h( j éjpfn - iQ onde O deslocamenlc temporal
é um inteirO. Em Sandber% e Xu (1997b), £ uinda mostrado que para qualqucr mapa por memoria
com decaimenu) uniforme, de variável única* invariante a deslocamcntos e causal* existo uma me-
mória gama e uma rede neural estática, cuja combinado aproxima o mapa uniformemente e arbi-
tranamcnic bem.
Podemos agora forma]meóle formulare teorema do mapeamenfo miope universal' como se-
gué (Sandberg e Xu, 1997a, 1997b):
Quitlquer mapa dinámico miope invariante a destacamentos. pode ser unifonnementc aproximado
arbitrariamente bem par uma cstmlura cnnyisiindo de dais hincos- luncionais: um banco de fillrus
lineares alimentando urna rede neural estática.
A estrutura incorporada neset teorema pode tomar a forma de uma TLFN focada. Deve-se notar
tambem que este teorema é válido quando osabais de entrada e de saída sao fundes de um número
finito de variáveis como no processamento de imagens» por exeimplo.
0 teorema do mapeamento miope universal tem aplicantes prát i cas profundas. Ele nao apenas
fomece fl jUfft i fi cativa matemática paran NETtalk c sua possívcl ex ten sao atraves de uma memória
gama, mas tambem eslabekce a estrutura para □ pr ojete de modeles mais elaborados de procesaos
dinámicos nao-lineares. As convolucdes múltiplas no termina! de entrada da estrutura na Fig. 13.12
podem ser impl ementadas utilizándose filtros lineares com resposta a impulso de dura^áo finita
(FIR./mjft’-í/^rdjtfofl impulse responsé) ou com resposta a impulso de dura^áo ir.finita (IIR, infinite-
durati&n impulse responve), No caso da rede neural estática, ela pode ser implementada usando-se
um perceptron de múltiplas camadas, uma rede de fun^áo de base radial ou uma máquina de vetor
de suporte (reinada pelos algoritmos descritos nos Capítulos 4» 5 e 6. Em oufras palavras, podemos
naturalmente nos bascar no material apresentado naqueles capítulos sobre aprendizagem supervisi-
onada para construir filtros nao-lineares ou modelos de processos dinámicos náo-llneares. Mais
importante que isso, a estrutura da Fig. 13.12 é ineiwitemeNtc e&távef, desde que os filtros lineares
sejam oles mesmos estáveis. Temos assim uma clara separarán de papéis cm rclafáo a como consi-
derar a memória de curto prazo e a náo-lin earidade sem memória.
13,7 MODELOS ESIRAQO-TEMPORAIS DE UM NEURÓNIO
0 filtro neural locado da Fig. 13.9 tem uma interessante inLurprctaqáo como descrito a seguir A
combinu^áo de elementos de atraso uni¡tário e pesos sinápticos disociados pode ser vista como um
filtro de respaata a impulso de durazno finita (FIR} de ordem como mostrado na Fig. 13.13a; o
filtro FIR é um dos blocos construidos básicos em processamento digital de sinal (Oppenheim e
Schafcr, 1989: Haykin c Van Vccn, 1998). Conscqücntcmcntc, o filtro neural focado da Fig. 13.9 é,
na rcalidadc. um filtro FIR n3o-1inearh como mostrado na Fig. ]3.13b. Podemos nos bascar nesta
representa^Bo e com isso estender o poder de processamento do neurónio em um sentido espacial
atraves do uso de entradas múltipias, jwh cm número» comu mostrado na Fig. 13.14. O modele
espado-temporal da Fig. 13.14c referido como um filtro neurai de mtdiiptax entradas,
Ainda um outro modo de dcscrcvcr n modelo da Fig. 13.14 é imaginá-lo como um filtro neural
distribuido, no sentido de que a a^áo de filtragem está distribuida atraves de pernios diferentes no
espado. A caracteriía^áo espado-temporal do modelo ó representada con» segue;
* (} neurónio tem jrrH sinapses "primárias '. cada uma consistindoi de um filtro linear de tempo
discreto implementada na ferina de um filtro l1’IR de ordcin p; as sinapses primarias Sáo
responsáveis pela dimensáo espacial do processamento de sinal.
• Cada sinapse primaria tem (p +• l) sinapses "’-e/iindárias11 que sao conectadas á sua respec-
tiva entrada c ás dcriva^ocs de memória de seu filtro FIR, sendo com isso responsavel pela
dimensáo temporal do processamento de sinal-
Hidden page
Hidden page
Hidden page
Hidden page
Góes do conjunto completo das stnapses representadas neste modelo (i.e., somando sobre o índi-
ce 0» nós podemos descrever a saida j4n) do neurónio j pelo seguínte par de equapócs:
+ h> = X *í M«>+ bj
1=1 1=1
(13.23)
(□24)
onde v (rt) representa o campo local induzido do neurónioj\ b c o bias aplicado externamente e (pv)
representa a fontfo de ati^So náo-linear do neurónio, Assume-se que a mesma forma de nio-
lincaridadc é usada para todos os neurónios da rede. Note que se O vetor de pews w c o vetor de
estado \(w) forem substituidos pelos escalares n e .t, respectivamente, e se, correspondentcmcntc,
a operario produto intemo for substituida pela multiplicado ordinaria, o modelo dinámico de um
neurónio descrito ñas Eqs. (13-23) e (13 24) se reduz ao modelo estáheo do perceptron de múltiplas
camadas ordiiiúrio descrito no Capítulo 4,
13.9 ALGORITMO DE RETROPROPAGAQÁO TEMPORAL
Para treinar uma rede TLFN distribuida, necessiíamos de um algoritmo de aprendizagem supervisi-
onada pelo qual a resposia real da cada neurónio na camada de saída é comparada com unta resposia
desejada (alvo) a cada instante de tempo. Assuma que o neurónio j se encontra na camada de saída
com a sua resposta real representada porrúi) c que a resposta desejada para este neurónio seja
representada por í/VrX sendo ambas medidas no tempo n. Podemos cntáo definir um valwinstantá-
nea para a soma dos erres quadrados produxidos pela rede como:
2 f
{13.25)
onde o índice / se refere a um neurónio na camada de saida apenas c e (n) c o sinal de erro definido
por
tfo*) = - vjn)
(J3J6)
O objetivo é minimizar uma fuñado de custo, definida como o valor G(/í) computado para todos os
tempos;
n
(13.27)
O algoritmo que temos em mente para computar uma estimativa do vetor de pesos étimo que alcan-
za este objetivo ó bascado cm urna aproxima^So do método da descida mais íngreme.
Um modo óbv» de prosseguir com este desenvolví mente é diferenciar a funfáo de custo da
Eq. (13.27) cm relajo ao vetor de pesos e com isso escrever
(13.28)
Hidden page
r-^---“ *=(«}
(13.31)
onde x/.n) é o vetor de entrada aplicado a sinapse i do neurónio j. A km disso, podemos definir o
gradiente local para o neurónio/ como
fiy(n) = -
dv/n)
(13.32)
Conseqüentemente, podemos rescrever a Eq. (13 30) na forma familiar
w (n + 1) = wA(n) + qfi (n)x(ff)
(1333)
Como na derivado do algoritmo de retropropagatfo padreo descrito no Capitulo 4, a forma explí-
cita do gradiente local $f(/i) depende se o neurónio j está na camada de saida ou na camada oculta da
rede.
CASO 1. O neurónio/ c uma unidade de saida
Para a camada de saida, temos simplesmente
6/n) = -
3^,
¿Fé(ff)
(1334)
onde£ 00 é o sinal de erro medido na saida do neurónio/ e ) é a derivada da fun?áo de ativa^io
ip(-) em relajo ao seu argumento.
CASO 2.0 neurónio/1 uma unidade oculta
Para o neurónio / localizado em uma camada oculta, definimos ¿’i como o conjunto de todos os
neurónios cujas entradas sáo alimentadas pelo neurónio/ de uma maneira para frente. Considere
que v/n) represente o campo local induzido do neurónio r que pertence ao conjunto jí. Podemos
entilo escrever
5?0r) = -
(13.35)
y y (^iaui
¿4 i
onde Utilizamos O índice Arrio lugar de ra niquelas posicocs que sao de particular intcrcssc. Utilizan-
do a definifáo da Eq. (1332) (com o índice r no lugar de/} na Eq, (13.35), podemos entilo escrever
Hidden page
Hidden page
MeurónLoE
r mi
conjunto ?J
FIGURA 13,17 Fteiropropag&Gáo de gradientes locáis através de
uma TLFN dislnbuida
obtida utilizando-sc o método do gradiente instantáneo, Enlodante, estas discrepancias sáo normal-
mente mínimas, Para um parámetro da taxa de aprendizagem n pequeño, as di lerendas entre as
características de aprendizagem desfes dois algoritmos sáo despreziveis para todos os Í1ns práticos.
Restribes de Causal i dade
Uin ex a me cuidadoso da Eq. (13-42) revela que a computado de S hi) c naa-cinwií porque re-
quer conhecimento de valores fui uros dos 6s e dos ws. Para tomar esta computarán causal, nota-
mos priiineiramcnEe que a referencia temporal exata usada para a adaptaban nao c importante.
Além disso, as estruturas sináptlcas empregadas na rede sáo todas filtros FIR. Conseqüenlemen-
te, a causal i dade requero uso de armazenamento adicional para guardar estados intemos da rede.
No que segué, requeremos que a adaptado de lodos os vetores de peso seja baseada apenas nos
valores correntc tpassados dos sinaís de erro. Podemos com isso imedlatamente estabelcccr6 (ff)
para o neurónio j na camada de saida e assim adaptaros pesos do filtro sináptico nesla camada.
Para a próxima camada anterior (i.e., uma camada oculta anterior á camada de saida), as restri-
fñes do causalidade implicara que, para o neurónio / Desta camada, a computado do gradiente
local
5.(« - p) -~ P))X
rUt (IJ.4/J
é haseada apenas nos valores torrente e passados do velor A; isto é,
AH[5(j¡-p), 6r(n t I -p).
(13.46)
Hidden page
* A propagado retrógrada dos fis permanece simétrica em relagSo ;i propagare di reta dos
estados.
* A ordem dos cálculos é linear em reía? áo ao número de pesos sinápticos da rede como na
abordagem do gradiente instantáneo.
A TLFN distribuida é naturalmente urna estrutura mais elaborada que a TLFN focada descrita na
Sentía 13.4. Além dissoT o algoritmo de rctropropagííáo temporal necessárxi para treinar a TLFN
distribuida c computacionalmente tnats costoso que o algoritmo de retropropaga^áo padráo que é
adequado para tremar a TLFN focada. Na análisc final, a cscolha de urna ou de outra destas duas
abordagens ó determinada pelo lato de a tarefa de processamento temporal que precisa ser solucio-
nada ser rel&liva um ambiente estacionario ou a um ambiente nao-estacionario.1
13.10 RESUMO E DISCUSSAO
A necessidade de processamento temporal surge em em umerosas aplicantes que incluem as se-
guí ntes:
* PtiSir'i.wo e modefagem de series temperáis (Box c Jcnkins, 1976; Hay km, 1996)
• Cattceíamenio de ruido, cm que o objetivo c usar um sensor primári o (fomcccndc um sinal
desejado contaminado com ruido) e um sensor de re Ter ene la (tornee en do uma versio
correlacionada do ruido) para cancelar o efeitodo mido (Widrow e Stearns, 19$5; Haykin,
1996)
• Eíftialtea^iia adaptativa de u m cana l de comu nica¡?áo dcsconbcc ido (Proaki s, 1989; Hayki n,
1996)
* Controle adaptalivo (Narcndra c Anuaswamy, 19 59)
• identificando de sixtemu» (Ljung, |9R7i
Já temos leorias hem-desenvolvidas para resolver estes problemas quando o sistema sob estudo ou
O mecanismo físico subyacente de intcrcsscc linear; veja Mlivros citados acima. Entretanto, quan-
do o sistema ou o mecanismo físico for náo-linear, temos uma tarefa mais difícil em nossas máos. É
oestas situantes que as redes neuritis tem o potencial de fomecer uma soluto viável e com isso
fazer uma di fe re no a significativa na sua api ¡cacao.
No cocne^tc das redes neurais^ remos duas redes candi datas para o processamento temporal:
• As tvdt'x tifimeniadas adiattíe atrasadas uta femptt
• As tvdes tví'anvnte-a
Nos próximos dois capítulos sáo discutidas as redes recorrentes. Neste capitulo, descrevcmcs duas
classes de redes alimentadas adiantc atrasadas no tempo (TLFNs): a focada c a distribuida, Em urna
TLFN focada, a memória de curto prazo está localizada inteiramente no terminal frontal de uma
rede estática, o que a loma simples de prnjetar. O treinamento da TLFN focada é realizado utilizan*
do-se o algoritmo de retropropagacáo padráo, assumindo que um perceptron de múltiplas camadas
seji¿ uti Iizado pana implementar a rede neural estática. No leorvnia do mapeamento mwpe universal
de Sandberg c Xu (1997a, 1997b), temos um teorema de existencia no sentido de que fomece a
jusliiicativa matemática para a aproximado de um mapa miope arbinario (i.ühl um mapa causal
com memória com decaimenco uniforme) utilizando um cncadeamento de dot'i blocos funcionáis:
um banco de filtros lineares e uma rede neural estática. Uma estrutura assim pode ser implementada
utilizándose a TLFN focada, fomecendo com isso uma realizare física deste teorema.
A outra classe de TLFNs, isto c+ as TLFNs distribuidas, se bastí am no uso de um modele
espado-temporal de um neurónio, no caso, um filtro neural de múltiplas entradas. Este modelo
utiliza filtros de resposta a impulso de durarlo finita (HR) como filtros sinápticos. Como tal, o
filtro neural de múltiplas entradas fomecc um bloco funcional poderoso a seu modo particular para
o processamento espado-temporal de sinal, construido em tomo de um único neurónio. Para treiná-
k\ podemos utilizar o algoritmo do mínimo quadrado médio (LMS) descrito no Capitulo 3. Entre-
unto, para treinar uma TLFN distribuida, precisamos de um algoritmo de aprendizagem elaborado
exernplificado pelo algoritmo de retropropaga^áo temporal descrito na Se?£o 13,9. Uma caracterís-
tica distintiva das TLFNs distribuidas é o modo pelo qual a representado implícita do tempo é
distribuida par toda a rede, advindo daí a hábil idade de 1 idar cora ambientes náo-estacionários (i.ct,
variáveis no tempo). Em uma TLFN focada^ ao contrário, a representa^i implícita do tempot por
deñniqaO', está concentrada no terminal frontal da rede, o que, púrtanto, limita 0 seu USO práti.CO para
ambientes estacionários {i.e., invariantes no tempo).
NOTAS E REFERÉNCIAS
1. Para uma diwussSo sobre o papel do tempo no process^menio neural, veja o artigo cítal-
os intitulado "Fioding Stnicturc in TimcH, de Elman (1990),
2. Em Hopfield (1995), é descrito um método para a representado explícita do tempo no
processamento neural. Em particular, a infonna^Sa analógica ó representada utilizándole
a marcad* de tempo dos potenciáis de af3o em relajo i um padrao de alividade coletrvo
oscilatório progresivo, para o qual ú citada e^idéncia neurobii. ilógica; as potencia i s de
a^Sa sao descritos no Capitula 1.
3+ Para uma revisia das estruturas de memória de curto prazo e seu papel no processamento
temporal, veja Mozcr (1994),
4. Para uma di$£U5s3o sobre sistemas híbridos de TDNN e HMM para o rcconhecimento de
voz, veja Bourlard e Moigan (1994), Kalagiri c McDcnnott (1996) c Bengiq (1996).
ALguns híbridos de TDNN-HMM combinara o uso de uma TDNN codificadora de
quadros (i.e., mapcnndo um “delctor dr atributos acéticos11 em um “código fonético”) e
um HMM roteadorde palavras/sentcn^as (¡A, mapeando "símbolos fonéticos" cm "das-
ses de palavras/sentenfas'1), onde o codificador e a toteador sdo projelados separadamen-
te. Em alguns híbridas TDNN-HMM avanzados, a runcho de penda de erro quadrado para
o sislcma inteiroé usada de modo que uma perda relativa j coniagem de envs de palavras/
senlcn^as pode ser minimizada. Um exemplo dcslc último esquema t a TDNN de múlti-
plos estados descrita em HalTner et al. (1991) e Hafíher (1994). Um híbrido simples de
módulos projetadas scparadamcnlc causa frcqücntemcnlc um dcsc&samcnto entre as de*
sempenlios de treinamento e de leste do sistema. A TDNN de múltiplas estados tem me-
lhor desempenho neste quesito.
Em um sentido fundamenta], ;ls redes recurrentes (discutidas no Capitulo 15) tem
uma capacidad^ maior para modelar a estrutura temporal de sinais de voz que as redes
'‘replicantes'* como a TDNN. Entretanto, como os sinais de voz sáa significativamente
náo-estacionários e nSa-linesre^ mesmo as redes necoirentes podem por si só ráo ser
suficientes para o roconhccimcnto preciso de voz,
S, Para uma discussío sobre as arigens do teorema do mapeamenta miope universal, veja
Sandberg(l99l).
6, Para uma derivado diagramática alternativa do algoritmo de netruprapagacSo temporal,
veja Wan a Beaufays (1996).
7, Em Wan (I 994), o algoritmo de reltciprnpagaQio temporal fo.i usado para realzar prev ¡sao
hlo-Lmear sobre uma serie temporal náo-cstacionária cxibindo pulseóos caóticas de um
láser de NH,. E-sia serie temporal particular fez parte da Competicáo de Séries Temperáis
do Santa Fe Instituto que acontecen nos Estados Unidos cm 1992. A solüflo de Watt para
esta tarefa de proccssamento temporal vencen ;i competicio entre uma lista diversa de
snbrmssfes que iiicluiam redes neurais reconcntcs c nao-recorrentcs padrao, bem como
mu i tas técnicas lineares tradicional s (Win, 1994). O caos é discutido no Capitulo 14,
PROBLEMAS
Redes alimentadas adianto focadas atrasadas no tempo (TLFH&)
13,1 Resuma os principáis atribuios de uma TLFN focada usada para modelar um procedo
dinámico nio-linear.
13,2 ATLFN focada representada na Fig. 13. IQutiliza uma cncmória de linha de atraso deriva-
da para implemcntar uma memória de curio prazo. Quais sáo os beneficios e deleites de
uma TLFN focada que utiliza uma memoria gama para implementar a memoria de curto
prazo?
113 No Capitulo 2, descrecemos qual ¡tal ivameme uma abordagem dinámica para imptemcntar
um llllro adaptalivo náo-linear. O método envolve o uso de uma rede neural estática cuja
e^iimula^áo provécti da alimentario dos dados de entrada através de uma ¡únela deslizante.
A júnela ¿movida na chcgnda de cada nova amostra de dados, com a amostra arrti.iia dentro
da janela sendo descartada para dar lugar á nova amostra. Discuta como uma TLFN focada
pode ser utilizada para implementar esta forma de aprendizagem COntinui.
Modelos espa^o-tem porais de um neurónio
13.4 Considere um filtro neural cu o campo local induzido tílr) ¿ definido pela Eq. (13.16).
Suponha que a funcáo temporal A (f) fiesta equacío seja substituida pelo impulso imiiário
deslcicadu
tyn-(5-T)
onde r é um atraso üxo. Descreva o modo pelo qual o 11 lira neural é modificado por esta
substituido.
13.5 Usando o algoritmo LMS. formule um algoritmo de aprendizagem para o filtro neural de
múltiplas entradas da Fig. 13.14.
Retropropagacao temporal
13.6 A Figura 1' 13.6 ilustra o uso de umajowífl de rempo tteformagataaiariú como um método
para o processamento temporal (Bodenhausen e Wai’nel. 1991). A jarcia do tempo assocíada
com a sinapse i do neunmifr / ¿ representada por B(ij, 1 . O i. onde t. ea sáo medidas de
mrtLta de lempa c ínj^uríT das janclas, respectivamente, como mostrado por
Com isso, a saldado neurónio./¿modelada como
Hidden page
tes nao-lineares de ordem crescente. Em gcral, a estudio dos aiefioeflte* de Val térra é
considerada difícil, principalmente por causa de sua relajo nao-linear com os dados,
Neste problema, consideramos a cxcmplo simples
r(n} i (ír) + |htrr - I — 2)
A serie temporal (cm méd i a zero, é nío-cot rcLi iionada e. portante, tem um espectro bran-
ca. Entretanto, as amostras da serie temporal nao sao independentes entre tí, e perianto
poderse construir um pre^ ¡sor de ordem mais elevada. A variáncii da saida do modelo é
dada por
o? = a' + P:a?
onde c a van ánc i n do ruido branca.
(n) Construa um perceptron de múltiplas camadas com uma camada de entrada de 6 nós,
uma camada oculta de 16 neurónios c um único neurónio de studa- Uma memória de
linha de atraso derivada é usada para alimentar a camada de entrada da rede. Qs
neurónios ocultos usam fun^óes de af.vavao sigmóides limitadas ao intervalo [0, I],
ettquanro que o neurónio de saida opera como um combinador linear. A rede é trema-
da com o algoritmo de rctropropaga^áci padreo tendn a seguinte descri?ao;
Parametrn da laxa de aprendizagem r ~ Ü?DO!
Constante de momento a = 0,6
N únten.) total de amostras procesadas 100.000
Número de amostras por época 1.000
Número total de épocas 100
A Vlri&ncia do ruido braneo cr- í ¡cita igual á un idade. Assini, com b - 0,5, constata-
mos que a variáncia do saida do provisor c C* “ L25.
Calcule a curva de aprendizagem do previsor náo-linear, com a variáncia da saida
do previsor .r( rr) trabada COflW um a fundan il r n únten» de ¿pocas de amostres de Trci-
namcnlo até 200 ¿pocas. Para a preparado de cada ¿poca utilizada para realizar o
i™ mámente, explore os Kfuinla dois modos
(i) A ordenado temporal da amostra de treinarnento ¿ mantida de uma época para a
seguinte chatamente da mesma torna como c gerada.
(¡i) A ardena^ai» da amostra de Cremamente é tomada aleatória de um púdran (estado)
para um outro.
Além disso, uliliz# a valida^ño cruzada (descrita no Capitulo 4) com um conjunto de vali-
dafáo de IW) amostres pare monitorar o comportamCTilo de aprendizagem do previsor,
(b) Repita o experimento utilizando o algor Ltnio LMS projetado para realizar uma predi-
qzajti sobre Uma entrada de seis amostras. t) paramelro da taxa de aprendizagem do
algoritmo c ajustado para f] - 10’’.
(c) Repita o experimento inteiio para P L, 2, e en tari para p¡ 2. ítJ “ 5-
Os resultados de cada experimento devem revelar que imc-llmcntc O algoritmo de
retropropaga^in c o algoritmo l-MS seguem csscnciaImente um caminho similar, e entao
o jlgontmo de retroprop^g^áo continua a mclhorar, finalmente produzlndo tuna previ>¡ao
de variáncia próxima ao valor prescrito de a!.
Hidden page
1 inri', tados (RrnganT 1985). O criterio de estábil idade BIBO c bem adequadu para um si sienta diná-
mico linear. Entretanto, c inútil aplicado as redes ncurais penque todos estes sistemas dinámicos
nao'lineares sao «táveís pelo ctitérió BIBO de v ido á saturado da náo-lineai idade incorporada na
confititui-(j5o de um neurónio.
Quando Talamos de estábil idade no contexto de um sistema dinámico liño-linear, normalmen-
te pensamos cm esfahiiidade no sentido de Lyopanov. Em uma célebre di ¿seriado datada de 1892,
Lyapunov (um matemático e erigen heirci russo) apresentou os conceitas fundamentáis da teoría da
estábilidade conhecida como o método direto de Lyapunov.' Esto método c largamente utilizado
para análise da estábilidade de sistemas lineares e nio-lineares, tanto invariantes no tempo como
variantes no lempo. Como tal, é d ¡netamente aplica ve] á análise da estábil idade de redes ncurais. De
falo, muito do material apresenlado neste capítulo diz respeito ao método direto de Lyapunov. En-
tretanto, a sua aplicado nao c uma tarefa fácil.
O estudo da neurodinámica pode seguir um entre dois cam inhos, dependendo da aplicaban de
interesse:
* A neurodinámira determinístíca^ na qual o modelo de rede neural tem um enmportamento
determi Dístico. Emtermos matemáticos» ¿descrita porum conjunto de equa^óesdiferenci-
áis nao-lineares que deíinem a evolu^áo exala do modele como uma fuñado do tempo
(Grossberg, 1967; Cohén e Grossberg, 1983; Hopfíeld, 1984).
• A neurodinámica esfatistica, na qual o modelo de rede neural c perturbado pela presenta de
ruido. Neste cajio, devemos lidar com equa^iies diferenciáis nao-lineares es tocón ticas, cx-
pressando assim a solufáo cm termos probabilisticos (Amari el al., 1972; Pcrelto» 1984;
Amari, 1990). A combinante de náo-'hnearidadecom tratamento estocástfco torna o assun-
to mais difícil de tratar.
Neste capitule, restringimn-nos á neurodlnámica determi Dística.
Organizado do Capitulo
Neste capítulo,o material está organizado em tres partes. Na primcira parte do capítulo, consistmdc
das Seríes 14.2 a 14.6, fomecemosum material introdulório. A Sepilo 14.2 introduzalguns cancel-
toa fiiodamentais sobre sistemas dinámicos, seguidos por uma discussao da cstabiliidade de pontos
de equilibrio» na Sc^ao 14.3, Na Seqao 14.4, descrevemos vários tipos de atratares que surgem no
estudo de sistemas dinámicos. Na Se^áo 14.5, rcx ¡sitamos o modelo aditivo deum neurónio que foi
derivado no Capitulo 13. Na Sc^áo 14.6, discutimos a manipulado de atratores como um paradigma
de redes neurais.
A segunda parte do capítulo, consistindo das Se^óes 14.7 a 14.11, traía das memorias
a&sociativas. A Se^áo 14,7 é devotada a uma discussao dctalhada dos modelos de Hopfíeld e do uso
de modelos de Hopfíeld discretos como uma memoria enderclavel por conteúdo. A Se^áo 14.8
apresenta um experimento computacinnal sobre esla aplicante da rede de Hopfíeld. Na Sccao 14.9,
apreveníamos o teorema de Cohcn-Grossberg para sistemas dinámicos náo-lineares que incluí a
rede de Hopfíeld c outras memorias associativas como casos especiáis. Na Semita 14.10» deseneve-
mos um outro modelo neurodinámicci conhexido como o modelo do estado cerebral em uma eaixa
que é bem adequado para a forrnapao de agrupamentos. A Sepilo 14,11 aprésenla um experimenta
computacional sobre «le segundo modelo.
A última parte do capítulo, consisliodo das Sorbes 14.12 até 14.14, traía do tópico sobre caos,
A Seqáo 14.12 discute as características invariantes de um processo caótico, seguida na Secáo 14.13
por uma discusáAo do tópico da reconstruyo dinámica de um processo caótico» que é relacionado
com o assimto da Setfo anterior. Na Se?áo 14.14, é apresentado um experimentó computacional
sobre reconstruyo dinámica,
O capitulo concluí com algumas considérameos fináis na Seqáo 14.15.
14 2 SISTEMAS DINÁMICOS
A tim de prasseguirmes com o estudo da ncurodinámica, ncccssitamos de um ihen/c/ci matemático
para descreyera dinámica de um sistema nao-linear, Um modelo naturalmente mullo adequade para
este propósito é o modelo do espado de estados. De accrdo com este modele, pensamos em termos
de um conjunto de wvtíwic de estado cujas valones (em um instante particular qualquer de tempo)
sáo assumidos como contendo informado suficiente para prever a cvolu^áo futura do sistema.
Suponha que.x|(í),.x,úL,,.,.x>(4 representen! as vari ¿veis de estado de um sistema dinámico náo-
linear, onde o tempo continuo t é a wridw/ indepéndete e Vé a do sistema. Por convenien-
cia de notadot estas variáveis de estado sao agrupadas cm um vetor A-por-1 i(f) chamado de vetar
de estada do sistema. A dinámica de uma grande elasse de sistemas náo-lineares pode entáo ser
especificada na forma de um sistema de equa^ñes diferenciáis de primeira ordem escrevendo-ae
como segué:
= j = ].2.....N (14.1)
onde a funyo FY-) é, em gera i, uma funyo nác-linear de seu argumento. Podemos por este sistema
de equafoes em uma forma compacta utilizando notacao vetorial» como mostrado por
4-3t(í)-F(i(f)) (14,2)
al
onde a ftin^áo nao-linear F tem valar vclonal. com cada um de scus elementos operando sobre um
demento correspondente do velor de estado:
i(/) = [*,(>}, x?(/)»...»x5(0]r
(14.3)
Diz-se que um sistema dinámico nao-lincar para o qual a funqáo vetorial F(i(/)) nao depende explí-
citamente do tempo í. como na Eq. (14.2), énuronomo: caso ccntrib io, ele é ndo-autónwno.1 Iremos
nos preocupar apenas com os sistemas autónomos.
[ndcpcndcnlcmcntc da forma csala da funqao nao-linear F( )» o vetor de estado x(í) deve vari-
ar com o tempo ft caso contrario» x(/) c constante c o sistema nao c mais dinámico. Podemos,
ponanlo, definir formalmente um sistema dinámico como segué:
(Att sistema dinámica é wm sis tema cuja estado varia com u lempo.
Alcm disso» podemos pensar cm diidt como um vetor “velocidade", n3o no sentido físico mas em
um sentido abstrato. Entáo, de acordo com a Eq. (14.2), podemos nos referir á fun^áo vetorial F(x)
como um campo vetorial de vclocidade ou simplesmente como campa vetoriíd.
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
A presenta de ruido demanda o uso de um tratamento probabiiístico da atividade neural, adi-
cionando um outro nivel de complcxidadc á análisc dos sistemas ncurodinámicos. Um tratamento
dctalhado da dinámica cstocástica está fora do eseopo deste livro. O efeito do ruedo é, perianto,
ignorado no material que segue.
O Modele Aditivo
Considere o modelo dinámico, sem ruido, de um neurónio mostrado na Fig. 14.7, cuja base mate-
mática foi discutida no Capítulo 13. Em termos físicos, os pesos sinápticos wt|,represen-
tara coflduftmcúu, c as entradas respectivas a\V) representan]/»teflcuzí$; Ár é o núme-
ro de entradas. Estas entradas sáo aplicadas a umaJunpdo «c/j/íw de córreme caracterizada como
segue:
Fnirtadas
sinópticas. "*
X|(0
xa(0
Saida
neural
FIGURA 1<7 O modelo aditivo de um neurónio
• Baixa resistencia de entrada
• Gan ho de corrent e uni tari o
• AI ta resi stetic ia de saida
Ela atua como um nó ad itivo para as corremos de entrada. A corrente total fluíndo enr ztifefáó ao nó
de entrada do elemento náo-linear (fun<’áodc aiiva<jao) na Fig. 14.7 c portanto
>
i-i
onde o primeiro termo (súmatorio) se deve aos estímulos x^Z), agindo sobre os pesos
sinápticos (condutáncias) w p w^.., w „ respectivamente, e o segundo termo se de ve á fonte de
córtente / rcprcscniando um bias aplicado externamente. Considere que represente o campo
local induzido na entrada da fundió de ativu^áo nao-linear <pf). Podemos entáü expressar a corrcntc
total fluindo para Jbra do nó de entrada do elemento náo-l incar como segue:
p/0, r Aj//)
/?, 1 dt
onde o primeiro termo se deve á resistencia de fuga A ec segundo termo se deve á capacitancia de
fuga C Da /cí' Jos cúrrenles de Kirchoff* sabemos que a corrcnte total entrando em qualquer nó de
um circuito elétríco é zero Aplicando a lei das correntes de Kirúhoff ao nó de entrada da náo-
Linearidade da Fig. 14.7t obtemos
SwJ.-'1W+<
í=l
(14.14)
O termo capacitivo CJv (/J/d1/ no lado esquerdo da Eq. (14.14) é o modo mais simples de acrescen-
tar dinámica (memória) ao modelo de um neurónio. Dado o campo local induzido v^í), podemos
determinar a saída do neurónio j utilizando a relajo náo-lincar
x/i) = <XP/í)) (14,15)
O modelo RCdescrito pela Eq. (14.14) é normalmente referido como o múdete aditíwt esta termi-
nología é usada para discriminar o modelo dos modelos multiplicativos (ou de derivado) onde u „
c dependente de x. (Grossberg, 1982).
Uma característica distintiva do modelo aditivo descrito pela Eq. (14.14) c que o sinal x.(r)
aplicado ao neurónio/pela conejo com o neurónio / é uma fun^áo lentamente variável do tempo r.
O modelo assim descrito constituí a base da neumdinámica dássica*
Para prossegy irmost considere uma rede recórvenle consistindo da interiiga^ao de N neurónios,
onde se as&ume que cada neurónio tem o mesmo modelo matemático descrito ñas Eqs. (14.14) e
(14,15). Entilo, ignorando o tempo de atraso de propagado entre os neurónios, podemos definir a
dinámica da rede pelo seguinte tJjímm efe prime/ra <Wem acc^Wcrs:
7 di R}
(14.16)
que tem a mesma forma matemática das equa^óes de estado (14.1) e que resulta de uma reordena^ao
simples de termos na Eq. (14.14). Assume-se que a fun^áo de attvacSo q>(-) relacionando a saídaxp)
do neurónioj com o seu campo local induzido v(/) c uma funcao continua c portanto diferenciáve!,
Uma fuiiQáo de ativafíio normalmente utilizada ó a fun^&o logística
)=----------
l + exX-i»P
/ = 12, .,„N
(14.17)
Uma condi^áo necessária para que os algoritmos de aprendizagem descritos ñas Sefóes 14,6 a
14.11 existam é que a rede recorriente descrita pelas Eqs. (14,15) e (14.16) possua pontos fixos (íe.t
atratores pontuais).
Modelos Relacionados
Para simplificar a cxposicáo, assumimos que a constante de tempo T “ /?C do neur&nio j na Eq.
(14.16) seja a mesma para todo,/. Entilo, nortina lazando o tempo t em relapáo ao valor comum desta
constante de lempo e normalizando os ir e í em rela^áo a A , podemos rcscrevcr □ modelo da Eq.
(14.16) como segue:
=-M'>+S W>»X'B+6. y - U-, *
(14.18)
onde também incorporamos a Eq. (14,15). A estrutura de atrator do sistema de equa?5es diferenci-
áis n5o-lineares de primeira ordeno acopladas (14.18) c básicamente a mesma que aqucla de um
modelo intimamente relacionado descrito por (Pineda» 1987):
(14.19)
No modelo aditivo descrito pela Eq. (14.18), os campos locáis tnduzidos t’iíf),..., t\V) dos
neurónios individuáis const iuem o vetor de estado. Por outro lado, no modelo relacionado da Eq.
(14.19), as saidas dos neurónios• j^/)* .x xjr) constituem o velor de estado.
Estes deis modelos ncurudinámicos sáo na verdade relacionados entre si por uma transforma-
do linear inversiva. Específicamente, multiplicando ambos os lados da Eq. (14.19) por u ... soman-
do em relajo aj e entao substituindo □ transformarán
i
obtemos um modelo do tipo descrito pela Eq. (14.18) e assim constatamos que os termos de bias
dos dois modelos s¿o relacionado; por
4 =
J
O ponto importante a notar aquí c que os resultados que dizcm respeito á cstahi kdade do modelo
aditivo da Eq. (14.18) sáo aplicáveis ao modelo relativo á Eq. (14.19).
A relajo intima entre os dois modelos ncurodinámicos descritos aquí c também ilustrada nos
di¡igramas cm Hocos mostrados na Fig. 14.8. As partes a c b desta figura corrcspondem ás formula-
qdes matricúle das HquaQóes (14,18) e (14.19), respectivamente; W e a matriz de pesos sináptico;,
v(í) c o vetor dos campos locáis induzidos no tempo i e x(/) é o vetor de saidas neuronais no tempo
f.A presenta do nealimMia^ao cm ambos os modelos c claramente visivel na Fig. 14.8.
14.6 MANIPULAQÁO DE ATRATORES COMO
UM PARADIGMA DE REDE RECORREME
Quando o número de neurónios, .V, é muito grande, o modelo neurodinátnico desuri lo pela Eq.
(14.16) possui, excelo peto efeito do ruido, as propriedades gerais delineadas anteriormente na
Secáo 14.5: muitos graos de liberdade, náo-lmcandadccdis^ipacao. Conseqüentemente, um mede
Hidden page
Hidden page
NhjbodnAníca 733
Para estudar a dinámica da rede de Hopficld, usamos o modelo neurodinámico descrito na Eq.
(14.16), que é bascado no modelo aditivo de um neurónio-
Reconhecendo que x/r) = podemos rescrever a Eq. (14.16) na forma
J = 1 n (14.20)
Para prosseguirmos com a discussao, fazemos as seguí ntes supo siróes::
1, A matriz de pesos sinápticos é símé/y-jeo, Como mostrado por
Ui = u;? para todo i eJ (14.21)
2. Cada neurónio tem uma ativa^So wo-Uwar particular - dai o uso de íf/-) na Eq. (14.20).
3. A inverso da fun^áo de ativa^ao nao-linear existe, e assim podemos escrever
«=<p;'(.r) (14.22)
Considere que a fun^o sigmónlle cp.(v) seja definida pela fun^áo tangente hiperbólica
. x l- exp(-tf.v) x = ip.(t) = tanh ——í— \2J 1+eTtp(-uJu) (14.23)
que tem uma inclinapao de a/2 na origem como mostrado por
d _ íícjlj 2 ¿fe «.» (14.24)
Daqui para frente^ nós nos referimos a a como o ganho do neurÓmo /.
A relajo inversa de entrada-saída da Eq. (14.22) pode assim ser rescrita na forma
v = <p/(r) = — log|-—1 at Al + KJ (14.25)
A formajPdJran da relajo inversa de entrada-saída para um neurónio de ganho unitário é definida
por
<p-’(.i) =-- JogT-J—— \1 + jc ¡ (14.26)
Podemos rescrever a Equa^ao (14.25) em termos desta relajo padráo como
<P7'U) =—ip_| (x) ¿7 (14.27)
A Figura 14.10a mostra um gráfico da náo-ltnearidade sigmóide padrao ipfvb e a Fig. 14.10b mos-
tra o gráfico correspondente da náo-linearidadc inversa tp ‘(jc),
Hidden page
Hidden page
excetc cm um ponto fíxo
(14.34)
A Equa^ao (14.34) fomecc a base para o segu inte teorema:
A f'nn¡,ui> fíi' tfWgiQ (de Lwipiinuv} E de uma nula ele ffopfieíd é ama fitn^da monatanamanle dacra*-
eente do tempo
Consecuentemente, a rede de Hopfíeld é global e assínt óticamente estavel; os pontos fixos
atratores sao os mínimos da funcáo de cncrgix c vicc-vcrsa.
Rela^áo entre as Estadas Estávels das Versees
Discreta e Continua do Modelo de Hopfíeld
A rede de Hopfíeld pode ser operada em um modo continuo ou em um modo discreto, dependendo
de modelo adotado para descreyeres neurónios. O modo continuo de operacao é bascado em um
modelo adi tivo, como descrito anteriormente. Por outro lado, o modo discreto de opera^&o ¿ basc-
ado no modelo de McCulloch-l’itts. Podemos fácilmente cstabclcccr a rclafao entre os estados
estóveis do modelo de Hopfíeld continuo e aqueles do modelo de I lopfieId discreto correspondente
redefíninde a relajad de cntrada-saída para um neurónio tal que possamos satisfazer duas caracte-
rísticas amplificadoras:
1. A Raída de um neununio tem cü valores assintóticos
para ? = »
para v - »
(14.35)
2, Q ponto medio da funcáo de ativa^áo de um neurónio $c cncontra na origem, como mostrado
por
<PíO)-O
(14.36)
Conscqücnicmcn(cL podemos focar o bias 1 igual a zcro para lodo/
Na formulario da fonp3D de energía E para um modelo de Hopfíeld continuo, permile-se que
os neurónios tenham auto-reaI intentares. Por outro lado, um modele de Hopfíeld discreto nao
deve tcr auto-real imcnta^ocs. Podemos, perianto, simplificar a nossa discussao fazende w, =*0 para
todo/ cm ambos os modelos.
Com base nestasobservadnos, podemos redefínira fundan de energía deum modelo de Hopfíeld
continuo dada na Eq. (14.28) como segue:
i * v w ।
£ = -2SÍ”j.Ví + E4-
¿ J-l >1 j-l «. j u
(14.37)
A fiin^3o inversa <¡f ( t) é definida pela Eq. (14.27). Podemos assim rescrevera fun0o de energía
da Eq, (14.37) como segué;
Hidden page
Hidden page
Hidden page
Com o modelo de Hopfield utilizando o neurónio formal de McCulloch e Pitts (1943) como a
sua unidade básica de proceramente, cada um dcstcs neurónios tem dois estados determinados
pelo nivel do campo local induzido agindo sobre ele. O estado “ligado" ou “disparando11 do neurónio
i é representado pela saida x = +1, e o estado “desligado” ou “quiescente" é representado por x -
—1. Para uma rede constituida de V neurónk>5* o ¿ufado da rede c aspira definido pelo vetor
«-[jtpA..X,.]r
Com x -11,0 estado do neurónio j representa um bit de informai?ao, c □ vetor de estado A’^por-1 x
representa uma palavra binaria de Al bits de informado.
O campo local induzido v do neurónioj é definido por
Y
i-l
(14.40)
onde £ é um bias fixo aplicado externamente ao Hurón»/ Assim, ú neurónioy modifica sen estado
.y. de acorde com a regra deierministica
+1 se Vj > 0
1-1 set'?<0
Esta relajan pode ser rescrita na forma compacta
x. si nal [r]
onde "sinal" ó a funeao sinal. O que acontece se r for exatamente zcrol Ncslc caso, a a^ao a ser
realizada pode ser arbitraria, Por exemplo, podemos fazerx "±1 se v 0. Entretanto, usaremos a
seguínte conven^ñoi se i¡? forzero, o neurónio /' permanece no estado anterior, independentemente
se utiver ligado ou desligado. O significado desta suposifáo é que o diagrama de flux o resultante ó
simétrico, como será ilustrado mais adíame.
I l.i duas fases de operaban da rede de Hopfield discreta como uma memoria enderefável por
contcúdo. a fase de armasen amento e a fase de recuperado, como aquí descrito.
L Fase de Arnua&wtmettlo. Suponha que deseje iros armazenar uní conjunto de vetores de
dimensionalidade .V(palavras biliarias), representado por | p = 1, ,A/}. Denominamos
estes ,W velones como as memúrias fundamentáis, representando os padróes a screm memoriza-
dos pela rede. Considere que ¿ f represente o t-csimo elemento da memoria fundamental
onde a elasse 2,..., ,W. De acordo com a regra de armazenamenío da produto v.'tterno, isto
c, a generalizadlo do postulado de aprendizagem de Hebb, o peso sináptico do neurónio / para
o neurónio/ c definido por
(14.41)
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
756 Redes Nfurae
íimita^ütfile arnpiititde. Consistedcum conjunto de neurónios altamente i.nterl irados que realimcntam.
a si próprios. Este modelo opera utilizando a rcalimcnlu^au positiva incorporada para ampliflcar
um padráo de entrada até que lodos os neurónios no modelo sejam levados a saturare- Desta
forma, o modelo BS B pode ser visto como um dispositivo para identificar categorías, pois, dado um
pñdróo de entrada analógico, fbrnecc uma rcprcscntacao digital definida por um estado cstávcl do
modelo.
Considere que W represente uma nrafriz de pesos simétrica cujos maiores auto valores tcm
componentes reais positivas. Considere que x(0) represente o vetar de estado iniciai do modelo,
representando um padráo de ahva^áo de entrada. Assumindn que existam Ar neurónios no modelo, o
vetor de estado do modelo tcm dimensao ,V. c a matriz de peses W ¿ uma matriz .V-por-Ai O algcri Lmo
BSB ¿eolito totalmente definido pelo seguínte par de equafóes:
y(w) = x(rt) + pWi{«) (14.63)
sfr + l)-tp(yOO) (14.64)
onde P é uma constante positiva pequeña chamada de fator de reaiimenta^aa c x(w) é o vetor de
estado do modelo no tempo discreto í?, A Figura 14.12a mostra um diagrama cm blocos da combi-
nafáo das Eqs. (14.63} e (14.64); o bloco rotulado como W representa uma rede ncural 1 incar com
uma única camada, como mostrado na Fig. 14.21b. A funqáo de alivafáo <p é uma/wfl<í7o linear par
partes que opera sobre y(n). a j-csima componente do vetor y(íi )n como segue (veja a Fig. 14.22):
FISURA 14.21 (a) Diagrama
em dimos do modelo tto estada
cerebral em uma carra i BSB).
ib) Gfb1d de fluxq de Sinal do
associador linear representado
pela matriz de pesos W
FIGURA 14,22 Fun^Ao de atlvacáo
linea r por parles uliízñPa nO mr4ekj
BSB
se
se-1 £>/„)£+]
SC v;(if)<-l
(14.65}
A Equa^üo (14.65) restringe o vetor de estado do modelo BSB a se encontrar dentro de um cubo
unitário de dimensionatidade N centrado na origem.
Dessa forma, o algoritmo age como segue. Um padráo de alivaváo i(0) é apresentado na
entrada do modelo BSB como um vetor de estado inicial, c a Eq. (14.63) c utilizada para calcular o
vetor y (Ü). A Equa^ao (14.64) c cntáo usada para truncar y(0), oblendo-se o vetor de estado atual izado
x(l). A seguir, Jt(l) é circulado através das Eqs. (14.63) e (14.64), obtendo-se com isso x(2). Este
procedímento c repetido até o modelo BSB alcanzar um estado estove! representado per um vértice
particular do hipercubo unitário. Intuitivamente, a r cali mentas So positiva no modelo BSB faz com
que o vetor de estado inicial x(0) crespa em comprímento (norma) euclidiana com o aumento do
número de iteraefies até ele atingir uma parede da caí xa (hipercubo unitário), deslizando entáo ao
longo da parede C terminando cventualmcntc em um vértice estável dacaixa, onde sc mantém sendo
“empurrado", mas nao pode sair da caixa (Kawamoto t Andcraon, 1985), viudo daí o nomc do
modelo.
A Fun^áo de Lyapunov do Modelo BSB
O modelo BSB pode ser redefinido como um caso especial do modelo ncurodinámicn descrito na
Eq. {14.16) como segue (Grossberg, 1990). Para constatamos isto, primeiro rescrevemcs a /-ésima
componente do algoritmo BSB descrito pelas Eqs. (14.63) e (14.64) na forma
Hidden page
Hidden page
Hidden page
Hidden page
762 R±uti5 Neuxais
Em um ambiente de vigilancia por radar, nao se conhccc apriori as desencóes detalhadas dos
emlssores operando no ambiente. Típicamente, centenas de milhares de pulsos de radar sao reccbi-
dos para o processamenio em fraudes de segundo. Assim nao há escuscz de dados; o desafio
como encontrar sentido nos dados. O modelo BSB é capaz de ajudar aprendendo a estrutura de
microondas do ambiente do radar através da sua propriedade incrente de formar agrúpamenos. Sáo
formados agrupamcnlos cm lomo dos atracones ponluaís do modelo BSBfi.e., vértices estáveis do
hipercubo unitario), com cada acrator pcntual representando um emissor particular. O modelo BSB
pode assim identificar pulsos recebólos como sendo producidos por um emissor particular.
14.11 EXPERIMENTO COMPUTACIONAL II
A Figura 14.25 apresenta os resultados de um experimento realizado sobre o modelo BSB contendí
dois neurónios. A matriz de pesos dcs-por-düis W é definida por
' 0,035
-0,005
-0,005
0,035
que é simétrica, positivamente definida e que satisfaz a Eq. (14.75).
As quatro partes diferentes da Fig, 14.23 corresponden! a quatro configuradles diferentes do
estado inicial s{0), como segué;
(a) k(0) = { OJ. 0¿r
(h) MGJ-I-CU. 0,3]r
íc} Mfi) ’ [ o,a. • o,4]r
(d) i(0) *L 0,1 r
As áreas sombreadas mostradas nesta figura sáo as quatro bacías de atraco que caraccerizam o
modelo. A figura ilustra claramente que quando o estado inicial do modelo se encentra em uma
bacia de atracáo particular, a dinámica Subjacenle do modelo Conduz a matriz de pesos W(n) com o
aumento do número de iterapóes w, até que o estado da rede x(n) termine no atrafor puntual fixo
(i.e., um vértice do quadrado dois-por-dois) pertcnccntc aqueta bac ¡a de atracáo. Um caso de parti-
cular inleresse é a irajetóría mostrada naFig. 14.23d: a cnndl^So inicial x(0) se encentra no primeiro
quadrantc, emboraatrajclória termine no vértice (+1, — I) no quartoquadrantcporque caí que está
o alrator pontual relativo áquela bacia de atracáo.
14,12 ATRATORES ESTRANHOS E CAOS
Até este ponto na nossa discussao sobre ncurodlnámlca, concentramos nossa alenfSo sobre o tipo
de compartimiento exibido por sistemas dinámicos náo-lineancs caracterizados como atratores pon-
: . s fixos. Nesta sc^aoT consideramos uma outra elasse de atratores chamados de atratores estra-
nhofi que caracterizan! certas sistemas dinámicos nao-lineares de ordem maior que 2.
Um atralor cstrariho exibe um comportamento caótico que é altamente complexo. O que toma
o estudo de atratores estranhos e do caos particularmente interessante c o falo de que o sistema em
questáo é tieí^rministia} no sentido de que sua eperafáo é govemada por regrasfixtut embora um
sistema dcstcs com apenas poucos grausde kherdade possa exibirum comportamenEo táo compli-
cado que parece ser aleatórío.
FIGU H A 14.23 Trailló*lac pan a &xpannwito eompulactónal sobra o modelo BSB; os resultados
mostrados ñas partes (a) até (d) corraspondam a diferentes condados inida»
De falo. a característica aleatoria é fundamenta! no sentido de que as eslatl sticas de segunda ordem
de uma serie temporal caótica parce um indicar que ela é aleatória. Entretanto, diferentemente de um
fenómeno realmente aleatorio, um sistema caótico pxibe um cnmpnrtamenia aleatória que nao de-
saparece com a coleta de mais informado! Em principio, o componamcnto futuro de um sistema
caótico é totalmente determinado pelo passado. mas na prática qualquer incerteza na escolha das
condi^ócs iniciáis, nüo importa quáo pequeña scja, crcscc exponencial mente com o tempo. Conse-
qíientemente, embora o comportamento dinámico de um sistema caótico seja previ sível a curto
prazo, é impossivel se prever o campcrtamento a longo prazo do sistema. Urna sórie temporal
caótica é, portantoT paradoxal no sentido de que a sua gera^ao é govemada por um sistema dinámico
determinístico, mas tem uma aparé neta aleatória. É este atributo de um fenómeno caótico que foi
originalmente enfatizado por Lorcnz com a descaberla de um atrator que leva seu neme (Lorení,
1963).
Em um sistema dinámico náo-linear, diz-sc que o sistema possui um atrator estranho, e neste
caso o sistema é chamado de caótica quando as órbitas em um atrator com condeces iniciáis na sua
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Alspqctor. I.. A. Jayakurnar, and S_ Luna, 1992. '"Exprr.menCaL evaluación oricaming in a fisura] fiñCrúEysiCrfi/1
rn i^irrrjJ J°Zwejy^i^ ^'.wiTt.sL vg|.4, pp.H7]-S78, San Mateo, CA: Morgan Kaufmann.
A Ispéelo?. J., R. Mcir_ B. Yultfi, A. Jayakuinar., and D. Lippc. 1993. HA parallcl gradicnt desceñí mclW for |»rning in
anaLug VLSI neural netmnkl* /uvu-tccj fri A'crira/ A^nMíftM Si-j-Jtflrj. v-ol. 5, pp.836-844. Su Mlteo,
CA: Morgan Kaufmann.
Amari, S., 199fl. "Natural ^radicnt wnrks cfticicnlly an Lraming."1 Afenra/Ccr?ipi^rj^"Lr/K Vül Wa pp’ '1 276.
Amari, £., 1997. Privan? cnmmuncalion.
Atoan. £., 1991, HA universal thcoirm on Lcaming cunes," A'frj^u/ .Vcftiorki. vol.6, pp.lói -1 b&.
AimiÍtS-, 1990. HMathcmatiea] faundaions ot' neurocomput mg.’* rracwc/úrgKifjftr J£EE( VbL "?&L pp. 1443-1463.
Arturo 5-, 19R7. '"DifTercntial gcíimciry ufa paramctric íamily oí invcrtahlc systcms-RicirLanLan melhcL dual affinc
tonncuLiorii and divergen»,” iVdrtfflflíic^ Sr^cw.í Ííecuy vol.20, pp.53-í2P
Aman. S-, 1985. Z>i,^círn/ra/-(jÍÉCTliíJraJuf Miflfedf ín fruJjyjjcs. Ni^York: Spriikgvp Verlas
AniflrL S., 1983. HFidd thwry cf selt'-firgani7ing neural neis/' iEEk' Jraíi.wcnans m ír.Tfcjnr, Afcrn, úrhrnjtffíej% rol.
SMC-i3.pp.9J 1-748
Aman, S_h 1980. "Tupti^raplik urganizaiiüfi of nene fteldli” Jhdfefiha c/Aft/r^c'rTicrríwí ™L ^2, pp.3 39*364.
Aman, S.F L977é_ "Neural thcory ttf assixiatiwi and uuncrpL-rurmillieu? tfíflAflgfai/Crívrjrrn'cj. vul. 26^ pp. 175-185.
Aman, S.. L977h. 'Dynamics ofpaticm formalion in latcral-inhibimn lypc neural ficUs,"1 Uiüíngjcaf Cvhenretícs. val. 27h
pp.77*sr
Amari, SH 1972. ,l€haracier¡sLi<t cí randúiib neti oí analog nwnm-lifce ekineíii^r ÍE£E ritmsíKift™ lmi Íi3/cr?iv. .Mcu?.
ernu1 Ci'fiL'.rrjrrícs. voí SMO2. pp.6434557.
Amari, S., 1967. **A rheury of adapte piittent dlss¡fi<Ts_lfl f££E IhMf. £ÍL<7™rk CanrprrJ'rrj. vul. EC-bó. pp.299-307.
Amari, % and M.A. Arisib, 1977. “Compefii-m nnd coopcraLiun in neural neta," in J. Mrtzler, cd., Sl'jííwtj Atwraírí-LNretf.
pp. 1L9-L65. New York: Academic Press.
Amari, S_, and J.-F. Lardosa-, 1997. "Blind source scparatinn.-Smipara.TTiclri£ statiitical anfroach,” /££"£ Dun«uc:^újr.f rwi
Síl’i'jlTj1 Pjwííijhj’. vdI.4S+ pp.1641-2700-
Amari, S_. T-P. Chen. and A. Ciehoki, 1^7. "ülability arLalysisof Icamingalgonthiiis íbrhiind snurecscparatirm"
vol. 10, pp. IJ45-1 ] 51.
Amari. S.. A- Ckhflk. and H.H. Yanc;, 1996 ’A new Icaming al_gnri1hm for hl-ind s¡£h¡d KfHHÜM” jj? Ncírref
Pmc'fíJÍni’5ysfer?i5_ val.E, ppk757-76J, Cambridge, MA: M1T Press.
Aman, s., and K-. Maginu. L9fl.fi. ”Sta1 is.1 ¡cal ncu.mdynamicx ofhsamiarive tiicmory,1" .Vc^nJ iVrr'Lfi^'. vol L pp.63-73.
Amari । SM K. Yosbidi.and K.-l. Kansiani, i 977. -’A mathcmaiical rmindatinn for statiHicaL ncurodynamicsh,15fílA/A|rjr™/
AfaíftfliMfíEl> vol,33. pp.OS'llfi.
Amari. S., N. Mutua, K.-R MÜIIíí, M. Finkí.ind H. Yangh l^96a “SMütictl ihewy ofcwlnintag k cnuss-validation
asymplülieaLLy üffitcttvt7“_4íAuñefi rn Afeunií A^rnrarfaji ^raccjjwg vq|. 8, pp_L76-182, Cambridge, MA:
MlTFrw
Anihiw-1 ngmon, J.. R. GmgerB and Cí. l.ynch» 1990. "Simulaiiníi of piloc-cortu perfonm ftiurartliial clusLenng-1'
St rcKT-L'. wl.247, pp 1344-13^8.
Amil. D -l. L9H9 .t^c^ng í'nj/n Fbrieridrtr 7S* Hbnltf t>/ A'ii'-irnTÍ iVí'fM.ünlw. Ns* York: Cambridge Univcrsily
PTess.
Aruislasio T.J., 1995. "VcilibuL-n-ócular rcflcx: Pfcrt'armancc and plasticily.'" En M.A_ Ariíih, cd.„ 7?jd« qfEwfr
AmO'Atora!A'eriwrfa. Camhndgc, MA: ME E' Press.
Anaslasio, T.J.. 1993. "Modeling vestíbulo-ocular reflex dyiLBmics: Fnom elassical indyfK m nturai MtWüridaH in F.
Eeckman, ed., AfewwJ' 4 wi/tjú .IfbJffiqg. pp.4O7-4.30, Korwcll. MA: Kluwcr.
Anutuiou T.J a 1991. L,A recurrent neural Mtwttk model of vdoctty storage in 1hc vestíbulo-ocular reilcx " rATww.c ín
Alrurii/ /j^jmrfl/rcj^r ArMtiüÑfg Ívrícmj. vol.3, pptJÍ-JÍ, Su Mateo, CA: Morgan Kauímann.
Anderson, J.A^ 1995. jl? .-Vcnaj/ .Vtfrunfkf. Cambridge. MA. M1T Pmíi
Anderson, J.A.. 1993. "The BSElmodel: A simple nnnlmearauinaRSüciarive ncuraE nelwcirk.’' in itawtatfH Aíenwrfrr
(M 1 lassoun. cd. 1 pp.77-lÜ3p Oxford: Oxford Univcrsity Press.
AndkrscTkJ.A., 1988. "Ccnera' intreducLionCAfeiírarajflvwJft^jr ííjHÑcÁTfífltii (J,A- AndefWflUHÍ E RüsCnfiílki,
cds.J, pp. xíii-xxl. Cambridge, MA: MIT Press.
Andenson. J.A., I^R.l. "Co^nirivc ifld peycholü^ietl iXmlpuliiliun i^ilh ntural modi-ls.1'' f£E£ F^njcTríj'üur eur
Afoid. izidJ Qrfwwffcj; vol. S-M( I ?, pp 799-815.
Afldctscrk J.A L 1972 "A simple neural m.1wnrk gencratmg an Interactive memory," fifarefíncej. VUÍI4.
pp.197-220.
Andcrajn, J.A.. and (i.L Murphyh !9Rfi. Toncepls ¡n CHUKCtionist modelar ¡11 Ahmí /yr Cyr?rprjJj>rg. J.S.
Dcnkcr. cd_, pp. 17-22, New York: American Ensíleme <ii'Physics
Andrrsem, LA., and t. Rnsenfcld. cds.. I9fl8. J^unKWffpufí^g.1 EnirJFü'ujjíWh.f a/’rtr.w.tot7j. Csííihridgs, MA: MIT FYkís.
Andmum J.A., A. Pcllwnisz, and E. Roscnfcld, cds.h 1990a. 2. Djjtfcrjíww,/ór Cambridge.
MA: MIT Prws,
AnderwnJ.A., J.W. Silveratrin, S.A. Ritz,and R.S. Jones, 1977. "'Dislinctlvc fcalUTCs,categ1oricíl pcrceplion, and pcobabilily
leaming: Same applicalions of a neural model,’1 ffevfw, vol,84, pp,413-451.
AndtnsíwiJ.A., and J.F. Sullcm. 1995. "A rtctmnküFnctwmfcs: Computación and neurobLcIngy,"' Fffoi¿ríOfiArnrr??¿
M-rnur+j. VüL I, pp. 561 -568..
Andemo. J.A^ M.T Gaiely, F.A. Fenz. and D.R. C ol líos, 1990b. "Radar signal calegonzaron uhíu^ a neural ntíwork"
FttMwdtagj flfrfcc /EEE. raL78a pp. I64fr-I65*t
Andense T.W., 1984, Mfrodki^M i'í-1 Mu/JjL*ciricrJeSfa/j5/k'A/ Jua/rjú, 2nd exlition, New York: Wiley.
Andreou, A.ü^ 1994. ’XDn physics! modclscf neural ccwnputalion and their analog VLSI implemertiaúün.r /7i?ccet/jj?gs a/
rAí 75W Ffonbftop m PZjvsdcs CorttpfcfdLÍcw?. 1 EEE Computer Soctety Press. pp.2S5’264, Los Alam¡los> CA.
Andrcou, A.G., K.A. Roahen. P.O. Pouüqaeín, A Puavnk* RE. Jerikins, and K Slr-ohbchn, 1991. -'Currenl-mode
KutHhrexhold MOS circuiis for analog VLSI neural s^slcms/1 fEEE rrfHwcKfiuw cw Ncwcd A'rfiiTurfo. wL 2, pp. 2Ü5-2L3.
AndreftuuA. G. ,R. CrMeil7lerhK. SlTühbelbiksiiid K A.Bwihen. 1 W5.*fcAnalog VLSI Deunomorphic Imagc acquisitionand
prc-proccssingsyitemi." .Ví’iiftrJ Mrhwrbj vq|.S, pp 1323-1347.
Andreses, Ru and J. Diedericli, edL. 1996 Enictvr/írg* q/'fíe Jhr£ífrwtfm Jíbiu 7raüieJ XrryScícr/ .VeiFruí Afeftwfc
(Juvenil? ofSusrex, Brighcun, UK.
Ansaklis, P.J.B M. Lemmon» and J A- Stiver. 1996. "Liwirmng lu be auL-unomous,'’ Jn h£D. Ciupla and N.K. Sinha, cds.,
MrMfCffl1 CúírJmJ1 StafrW, pp.28-62, Ntfw Y<ii4c; IEEE- Ptvss.
Ansari. N., and E. Hcu 1997. Jwft'ttfgtvRX'í^V^rrrdfiltMíh Nonvcll, MA: Kluwcr.
Anthony. M., and N Biggs. 1992. CoflrpNftrn&Jui/ ¿nrrnrág TTwote Cambridge: Cambridge LFnivcrsily Press.
Ainsaklls. P.J.. and K.M. Passine^eds., 1993.4n AifriNfactiajv to Hfeí/ígenf .4¿rfüPiíJtíc Cnunuí, Norwcllh MA: Khiwen
Afbib, M A.. 1989. Fhr índ ediliun, Níw York: Wítey.
Afbib, MA, 1987. Epítíím. MfrúAíttX cine/ríes. 2nd cdilien, New York: Springcr-Vcriag,
Afbib, M A., ed. I99S. TStf JftwdbMtqfíhj^i TAran1 aire/A'íu/ct/Wenrertr. Cambridge, MA: MÍT Press.
AmiwsimLhL D.IC.uand C.M. Place, 199Ü. .íñ ¿vfhvjú/jrfwLSys’Aw.f, Cambridge: Cambridge Ufl ¡verei Ly Press.
Arlóla, A,, and W. Singcr. I9R7. Xng-tem poteflÜBtHHl md NMDA receptan in ral visual curie* ” A'a^rn?. voiJíO,
pp.649-652.
Ash, R..líp L965. ^¿nntfrroFJ TAcon', New York: Wi|eyr
Ashby, W.R., L964J. Dcsjgjijhra ^rudFJ. 2nd edition, New York: W¡leyr
Ashby, W.R., L952. Díijgji /ür¿r ¿raiFj, New York: Wiley.
Aspray. W., and A. Burks, 1986. Ripeas n/ Jriíur i'-üfj Afevflipip! i ?jj Cm/mIÚV Cbfflpkfcr nrcon-1. Charles Babbagc
JnslituCe Repnnr Senes for [he Hislory of Compuling, vq|J2 - Cambridge, MA: MIT Presó.
ÁeLtooh, K.J.,andlJ. Me Avoy, L992. '“InlelLigenLcnjitmE An meniew and evaluación T In ffcrJNÍÍi wA o/Mleífrgcnf Cojrtrot
D.A. While and D. A_ Sofgc, eds., New York: Van Nostrand RemiuiLd..
Albcrton, D.P.,1981. SrabJ'íirp Chichcscer, UK: Research Studies Press.
Atick, J.J., 1992. "‘CouLd inromiatmn theory prmide an ceofogicnl rheoiy oFSíflwrv' Processing?'1 A'efnurJt.- CompiF/ff/j^n
id .VciiniJ-"^SÍCflU, vflL.3, pp-213-251,
AiickJJ.,and a.N. RcdJieh, 1992. ’^Tiac docs ihc retina kncw abom nmtfll seenesrjVírrrcr/Comprj^aífoH, toI .4, pp. L96-2I0.
Al ¡ck, JJ-h and A.N. Redi icll, 1990. ^Tüwands a llieuTj- of e*riy viisua I procesa! ng? Vcjíra/ í awpjfforirur. vqI.2, pp.308- 3 20.
Atick, J.J.* P.A. Grilfin, and A.N. Redhch, 1996. ^Slalislicil appruai."h Co shape from shading: Rccnnstruclfon of
ihíwdimensitmal face wrftcs Frvin single iwodimcnsional images."'borraj Cflurpújtrrforj, vol. 8, pp.].12l-l34Or
AtiymA^F^ 19R7, "l.úftriñn^uma general iiecsvicjTk/1 InA^tt//.'r1i,.:jir^JÉrj,Jtwr/JrucíWdÍJ?gSrsf™5_ £J.Z. Andcram,cd.,pp.22-30,
New Yúricr Afuetean laaliLucc orPhytiEi.
Aliya.A.F.. andYS. Abu-Mcutlfii. l9S3._tAn analogfecdback ossociaLitc mrnwry,” IEEE ThwactiomOfl Ari*uríií .Vi'Mxjrfcj,
wlApp L17-126.
AHneavt, F., 1954. "‘So™ infonruEiizmiil aspeéis úf visual pcrccpMon,1' P.ri fi^rjdhi; vcl,6la pp.lb3-L93.
Back, A.EJ. and A-S. ^'tigend. 1998. L,A Firsl applicalicm of mdcpendcnl ceimponcnt analptií ta cjtlracling scruclurc ffom
stock refonisJ’ frttrFMÚMdT/cní™/ü/.VcwnjJ1 S>mrt«. «I. 9. Specill Ihhuc on Data Mining m Finante, a ser lancado.
Back, A.D., and A.Q Twia |99|. '"FIR and 1ÍR Syflúps^, A m.'*- neural ndwurk archilecLure t'or time series modeling ”
Atara/ GoffTjWíJftcwT- vol.3a pp.373-38S.
Baek, A.D., and A.C TsoÜ 1998. “A low-Ktuitivlly recumnt neunil ttHHtrfcf*Maura/CtwqpjrfaffoFj, vol. 10, pp.l65r|RR.
Baldi, P., and K. Hornik, 19S9. “Neural nei^órk^. and priik ¡pal CompuncnC anatysis: Lcamlng from ctamples wlLhcwt local
mínimum."'.VeidroZ Atíuw¿r, voi. 1, pp.53-58.
Bantinr, W.L., and A.S. Wclgcnd, 1994. '"Cnniputlng second dcr¡tai¡vc$ ]n feud-fonvard nclwiwks: A twiew*
TniMS£?rrí<?ns OF» Acwraf Acniw^, vuUh pp.4B0-488.
Hidden page
BeiLvtibisce. A.h M. Méüvier, and P. PriükinJL 1987. J/gwj'íArpis 4íh J Sfeeioitfc ^pjxro.rjjnarráñ, New York:
Kpringcr-Verlag.
Bcrtcro, MUTA- Poggio, and Vr Tone, I98ÍI SIRS "[ I t-posed prohíems in wty visinn," Fjtj^'íyí^.y qftte fEEE* YCL76,
pf>.SiS-«j-R8^.
HcrtRCkaR. D.P., 1995. PLÑLTflJJC.Ph^rürtírtríW^ JWrfflprrnidrí CWbV/. tol. E and tul. II, BíbíiCirt^ MA; AUWftt^ SííeOliflC.
HertRckaR. D.P.. 1995, T^qgmwvJ>9 Bc-hnnnr, MA: Alhenu SíiernifiC.
HcrtRckaR, D.P., and J,N. TsíesíUí^ t996. A'd'rjJij-OrrJü/irrí" /tyúWffltoí. Reí moni, MA: AlhefWS S^itifrtíík
Bflymcr. D.i -and T Pqggjo» [ 996. Hbnige repreaníilions lor - i>ual leamnig? Scú'orc. wjL.272, pp. 1905-1909.
BíeneMtMkj E.L., 1..N, Cooper, and P.W. Munro. 1982 "Theory for Ihe developrnent oí nwren ¡setectivity: OrkniiUi-in
spccifirifr' and binocular intHKfkm in visual concjcr Jmi™/ (/MtwwtffewM, ved .2, ppJ2-48.
B¡shoplC M h 1992. “Emci calculaúon üfthü Hesitan tMtrix foriliLpmuki-la¥erpereLpiren,H.VcNrfT/Cojr?/?jrr4z//mr. vol.4,
pp. Í94-501.
Bishúp. CAI.. 1995. Atara! AAfAW^ ihr ftfttrn OxíónJ: Clarendon Press.
Black, I.DJp 11991. J^npiírrrán rn rííJrain^ Afr ^ctfvlar AnpKtfve. Cambridge, M A: MIT Press.
Blakc-, A., 1983. 'The Icast-d.is1urbüncc principie and ucck enrístralas/' Pdjrcwi JteupgrttfM vol. 1, pp. 393-399.
Bhss,']'_VP., and!. Loma, L97J. H]_ong-las1inij poccntialion üisynapttDlfansndssion in thc-dc-ntalc weaoíthtanacschcrizcd
rabbit foi leming s!imula(ion qf thc perioratant palto/' 7. FJji.-í^!, va|.232, pp.331- 356.
Blumcr,A.,A. Ehrentcuchl, D. Hausstcr, and M.K.Wamiuth, L9S9. '"'I.caniahilky and cheY^apriik-QwrwmeflldlDimcn&ion/
«foKFMf Jjf J"1^ .4v.fneí¿?rr^d /uj1 Crwj-wrrjjrg MtKfrírtPy, vol.36, pp 929-965.
Blumcr, A., A. Ebrenfcncbt, D. Haussler, and M.K.. Warmuth, 1987. ’,Occam's w/1 Píwwfeg iíffPX
vol24,f^.377-3M.
Boahen, k.A., L996. "A rctincimoiptoic visión systrm/' JEE£ Artero. vol.16, ikjlÍ, pp.30-39.
Bcrahcn, K.A., and A.Ci. Andreou, 1992. ,LA contras! stórtEilivc Silicon relina wilh reci precal synapses/' AAflWCTfe JVeurü'i1
Zn/n.^HLT/Jü'jj P^üecs.Tr^p-STííertis, voí_4. pp. 764-772. San Malea, CA: Morgan Kauhnann.
Braticn, K.A., RO Puul:Qi*cen, A.Ci. Andnc£iun and R.E¿. Jcnkins, L989. "A hcl€TassocL3.1¡ve mciliory US¡ng CWTHfrmodc
analojt VE.s! c-iicuilfl,"1 /EFE Thcmutitortm On-Jru.r rw?Jvcl. CAS-36, pp.747r 75?.
Rodcnh.iuwn, U., and A. Wjiibcl, 199]. “Thelempo 2 algonchra: Adjusiin^ dnie-deliysby supervued loamii^J’iWtaMitMf
fe P^cv.v.vj^ ral. 3. pp, II55-161, Sin Maltu, CA: Morgan Kaufmum.
DuhíjnaniL. L., 1872. ^¡Im flludien Ílber du ^annegleichgwicht unlcr gaMMkkülenhBI Srfz/rn^hmcfcFe Ar
AÍCTf+cJNírfísc/r-A'urjmLfssL'gsLÍqrtfrrArJr Af Eflrscrík Arjr Jííj^r^rc' í/rr vo-l. 66, pp. 275-3 70.
Bosut, B.. 1. GnyOTi, jnd Vjpnik, IM2. “A training algorithm fot aptimal maegin classificen,"J+'isnLTÑ¿?p
gh CoffyHiftirtGJisí Zftc&n-. pp. I44-L52. han Matea, CA: Morirán Kaui'mann.
Horct. B.E., L. Sackingcr. J. Bremlry, Y. LcCun. and L_ü. Jackcl, IW2_ "Hardware requiremems tbr ncnral nccwnrk
pallcm c lassi fiers? /EEE Afwl. 12. pp.32- 0.
HourLard, H.A., and N. Morgan. 1994. CaMwlinnÉsrEccngHí/j^i?. J/rfri í¿i4fTVEUC^- lioslon: Kluwcr.
Bourlard, II.A.,and C.J. Wtllckens, L99C1. "LinksbtfweetiMufcúvmodclsand inull]]ayerpcTLncplrons,,L?f¿E Tnumrerñuu1
¿jfj Fd?ililm qjk/íWíw/iprr /jrrrV/jgííicc1. mi. KAMI -12. pp.l 167-1 ] 78..
Hoi, G-L.R, and C.M. Jcnkms, L976. Time &ne.Y .4rjci/irírr and CtaftvJ. San Francisco: I lnJde:i Day_
HraLtcnbcrg, V„ LCJ67. **laIhcccrebcüa cortes a hiological dock in thc millisccand range?" an T^e Gpftfíllfira. fe
fffüjTr fles-Krreft, C.A. Fói and R.S. Snidcr. cds._ vql 25 pp. 354-346, Amslcrdam: Elscvicr.
Hraitcnherg.V., 199Ü. '"Etcadini; 1he strudure oíbrains." MefwoHt1 fe *ol-1, pp. 1-12.
HrnLLcnber^ V, 1986. " l'wo -\ ie^í ot the ccrelm.1 cortea,"' in tf/crúr THwn; Cr. Palm pnj A. Acdsfn, cd$-. pp.S1-9Ó. New
York; Springcr-VcrLBg.
[IraLLL-nhcrg, V., L9ü4. Pt'/ikJv.Y. AperlrtWtíf fe .Vrd Jjt frf PjF>cA*tojJ-. L álllh: dg- BMA; MIT PrtM.
RfaLtcnhtr^, V., L977. Únfee TttiW qfJfrufef, New York: Springcr-Vcrlag-
ñregnian, A.’S., LMÚL &ene E^l' A'JtL'p/wffí Onpr'Jdzaíícj? Sarjjrrf, Cambridge, MA: MIT Press.
Hreiman, L., 1996a. ^Baggmg prcdiiloní" .V<rr/ifer AcwntÍHg. vol M. pp 123-14(1
BníntlU Lia |996b “B¡m» wimcía ítnd arciiiLT ctaífifieWa11 Th Jj/uc rjí ÑrpurJ «Jrift SUIlncíci Deparríneúi, Upiviindiy of
OI i fixrpa, Bflfcdcy, Cal if.
Bit imán, L, J. Frkdmflíi, R Olihea and C. Stone, 1984, CtarstffMrffer ¿feí Bwi> New York: Cheprnin
HaII.
F+ndle. J S-, L990a ""Probabi listic inlcq^rclaEionpríicdforwVFdüIasR i fica1¡LWi j^ctwnri ompm^wich relitHMHlupfl ios.ia[iR[LC^]
paiicmrctogniñmi," in A'cuftj-^jrfi^Jrrj'jtfl.^í^w-j'rfi/tTV, 4^7uJr¿LJtJrt<vnínf4^j¿rjYrncwf.v. F. Fougtlman'SchdiCJnid J. Ifiraní],
«ta .Ncwftft Springcr-Vcrlíg.
B-Tidle.LSi, J990b. "TrainingtlOCJustiú ilbódel rVCOgriincn algürilhnuu net^OTks tai! Itad tomáximum mutual informalioñ
estimation oí piirumrlers? ¿drtMS fe Mtamí fil^HWWridft 5l a7##h kI.2, pp-211-217. CA:
Morgan Kíufmanib.
Rrodal, A., b94 L. .Víidm^fl^JcaJ^najtwni' ín AeArfr.au ío CfflflrorJ\Avirrrjrirc. 3rd edición, New York: Oxford llftivcnity Prtes.
Brodmann, K.L 19Ü9. kéKH^je/jen^eLDLaírsflrioffJÍcAxerf'crGnaíJÍJj^í/'fnde. Leipzig: J.A. Barth.
BrogmJVL.. L9S-5, .'.fi-.i1:.".- Cúum^TTicrm- Zndeditian, Englrwood Ulifl's, NI: PTrnlicE-l-Ln.ll.
&R!-Limhem1. D-S.a Hld D Lowí, L9SB. hMu11 ¡variable Funcrional interp. «Ia1 ion and adaplive nclwarks,” Crwp/ev Sl'jííwtj.
wLl pp 311-355.
Crown, TJI.u E.W KnirisS.indC.L. KflMA, 1990. “fMJbiusynapscs: ñinphyHieal mechanismE and algorilhmE,'’^wiJM/
ícifn*- q/",Ycjfrr^crcTOp. vol. 13. pp-473-511.
BruoL J, 1990 "CMl ll>C cemvcrgcncc prnperties n-fihe HopíieL-d model," RirjceetfjTfgí c/lta I£E£. vol. 73, pp.l 579-1585.
JJryson. A.E., Jt.l andY.C- Hfr, 1969. Blaisdcll. (Rcviñed prinling, L975, Hcmisphcrc Publishing,
Washinglon. DCi.
ñurg, J.P., 1975. Atadena ¿jwcEni/ üjffpwfrán, Ph.lh ThttlSt Stanford Univeraity, StUlfbrd, Gilíf.
ByrgísL C J C., 1996- L,A luLorial cm supporL Verter machines for pillé rt b fCCúgibi I iM," JWlM^g dflri Ario Drj^krni
t<i a.ppcar.
CflC&üÜM; T, 1906, ‘TfiliniatiíHi pf a muh: varíale denELty,” Xwiét/.t &f ííjc ¿BJíMfc ¿r/ííLTffrfrcjr/ fTdhüJ, val.
14, pp. 179-1R?.
Caianidlu, E. R., 1961. "Otj-11 ÍIK of : dwoiy of [hQU[(h|- piwcsscs and 1 hi nking machines,” Jm»/ CjfHfrwtÚCdf ¿to/úgr,
vol. L pp.2CW-235.
Cameron, S. L L, L960. Toeh. Repon 60-600, Prottftíífigs£¡f'Ai Bíontelpp 197-212, Wri^kitAir Dvvelupmem
División, Diyton. Ohíui
CanJoso, J.-F.u 1998a. "Rhnd sitial Hptnlion: A rrviw," ftwwtftqp 0/7^ J£E£, vol .86, a ser latinado.
CanJuso, J.-F., 1998b. L'\1ull ¡dimensional ¡ndependentíímponenLanfllysi^^^mí^Jí^s /£££JCtóSÍ SciXtfe, WA. May.
Lardoso, L-F.. 1997. ‘'Inferna* and inasimuiti LBteBhMd íor hlind nuce KpntinC1 IEEE Srg#wf Pmctuütg LtMrf,
toI.4, pp.l L2- 114.
Cande™, J.-F^lO^b. ‘"Lnlcup t: MdtfMtl for ajurorseparaLiem," AprcsenLücbi naNIPS 96 lliir^rAc^wi fihWSrgíiír/ PrtKCMrng
organizado por A. Cachoki al Snomabü, Cuín. Slf;i um capítulo do Livro tvuj/pmTJirfFiiíeriírg, i. Kaykin,
cd., New Yortc: Wiley.
Cardóse, 1-E, and H. I.aheld, 199fi. "EíquivBrisnl adapenr hnunre «paralum/ i££E Trtniwcfrn/rs ou Pmw.w7|gh
vcl.44rpp. 3017-3030,
Lardoso, I.-l-' B and A, Soulnuiriiü. IV93 - "Hhnd beusfofmktlf í« nL’rtL-trü.iiNfimji si^iial^,"' JBff iflxj^rdtJ^. ¿tK.r
/? vul.LJO, PP.3Í2, 37»
C arpciiier, G.A., and S. Groutaqi, I9®7/'A maHÍn^y pial Id uchátKtiin far a Hlf-cipidiing ncunl pacccm rítójtniikm
nuichilH1-,'' tVrnr^niJtr H3ÍEML GrajrArr.v, íinj /muyr Prrjce.Y.vrrjjíf, V0137B pp.$d-L 1.5.
CflTWivT, Cr.A., Xd.A. C^hcii.atki R. Gmfiibcpg, L9S7. TcchnicaLcomineéiscm ,7Ccimpiítmg wi1h neural MW<irkí,"S( f^cr.
wl^S^ppi 1226-1227.
( arpcnrírHG.A., flfld S Gnüssbtrj, L995- "Adaplive fwnmM ihnty (ART),” in M.A. Arhih, cd., ftf Hd/riJAr.^ [jfíhnd
TÁc^n' Md Atara? AfitfWWlte pp.79-82, Cínibrid^tc, MA: MIT Pícsr.
Casclagli, M._ 1989. "hTortíflwpndkctian ofchaotic t¡iTW-Ber¡4"^v*04i voL33D, pp.33í-.1S6
w
Ccdjy, V-, J9S5. "Thcrniüdynamic approach lo Ihc travrlling -talesman pr-oblem,” íy tJpjj>N¿e¿rn'od Túcon- m#
volr45, pi1 1-51.
Changcux. J.P., and A. Danchin, 1976, “ScléCii^ <iahib¿^:i<in oF devtlopingayfiiptei ¡AS a raeduníim Fot thv spot-i Ficalion
of neural iwlworks."1 jVfffN^c1. TOl 264, ppi705-712
Chaltcri-cc- C . VP. RoychcwddlUrT, and F.KnP. rhtKrt^t 199fi. ,LOii r^litlveMnrafenK pwpcrlivsúf principal componcnt
íi|gnr¡ilimN,L' IEEE Thwsdfaiu m Atan*? Netwwfcf, wlr9P pp.319-329.
Chcn. H-. íind JL-W 1-iu, 1992. ''Adaplive disiribuied crthofomli^imn pwessing for principal componen^ analysis?
u?Gcu^fcwwf t'iu dowticr. ana!.íjjfjiírf Akcvíh^ vol. 2, pp, 29.1-29^ San Fnncucoi
Chcn, S., L99S. ""Non', near lime |eri<4 modelling and predacticm usinfl Gausfiian RBF ndwnrkí w¡lh cnhjnctd cluSteriilg
and Rl.S Icaming,” f íve/rorjía iíffeni vol.31. Mo.2, pp.l I 7-L Ifl.
Chci\ S. Billings, and F. Gran!, 199Ü. "'Non-linear Eystem identific-alion using neural neLwnrksr Znr^rjíúJj'Mfl/AHfflof
o/ Co?rrjT?¿ vol.51, pp ] 191-1214.
Chen, S., B. Mulgrew, and St Mcf a^gjllin,, 1992. "Xdaptivr UayeEÍan tccd.ba.ck cqu3(. :<ertiascd on a radial hasis fuKtMK
nehvrrk," IEt£ AiXcnrarráno'/ CwVfonKtf1 twr Comfflr^iJcuXJOrtí, vol.3a pp.L267-L271, Chicago.
ChcrkaiElcy, V, and F. Mulicr, 1995. '"Sclf-organizalion as an ilerativc kcmcL Hmoothing procenT jVrtrraí C^mprírtr/Tcn.
i'ol.7T pp.l 165-L177.
ChcrkaEEky. V., and F. Mulier, L994. .Dffíj.- Co^rcepü, TTieürv ¿znJ A/erAndr, New York: Wilcy.
Chcny. EjC., 1953. ,LSomrcspefimmt5 Dnlherccognitiem of 5pc«hrwLth onc andwith iwn e-ars,'1 4cwsfta?
Socjffr ¿ifArimcú-n wL.25. pp.975-979,
Cherry, E.CL. irtd W,K. Tííylo*, I9J4- “Sane furil^r expííimciiis upan íhc nccagfiiricMi af spccth, with anc and wich 1wo
cars? JbwitóJo/^¿tMíforiSbcÑVi_4f4F?icric4?< \ol.26, pp.554-559
ChesEcr. D.L., 1990. “Why (wo hidden l-iyer> ¡vrebciivftbaii LHhj,'1 AtltyiMtibftrfJWta Cari^n^n^1 Sfl Atalffll Ali,ifmTJir¿Y_ vqL
1, pp.2-)5 -yfi'<. ^hdümton. D.C.
Chimngjueflf. C, and C-H. SAqilin (L 794 j. "'OpcimaL adaplivc k-mcans algonthm with dynamie .idjuslmc-nt of leaming
ríle." ÍEEE Tramocrwrii mjífaira/jVcJMxJrt^ wl.6. pp. 157469.
Choey. M., and A.S. Wtig^íld, 1906 "bfonlihfa* IríuJi-ng. modcN Lhraugh Sharp racin maKimization,1' m A. WcLgcnd, Y,S-
Ahu-MosLafa, ¡uid A.^P.N. EUrfcnes, cds.,DMÜfon Fecíwe?tog¿fí,/ím1 financia/Engfrwüig, pp.3-22. Stngipcn: World
ScicTjtiíic.
Chunahland, P.S., 1986. AAHfH^Mtoi^Ay.1 Ibwmfa Lfa/fled Sc/mcc ó.ülw Mfr^Enúii Camba dgcn MA: MIT Press
Churchland. ES., and ['.I Sejnowski, 1992. JSí Cm^jrrcTffcriúí Cambridge MA: MIT Press,
C'íchock-i, A., and R. Unbchaucn. L996. "RobusL ni-uraL neLwtnks. wrlh 0O*lilW lean! hg (ri blind ídcnliflutíún and blind
separation o-f sources," /EEE ftwuac/roflj twi Cmaíts and FtadfflNftNM? 7hw> Offltf wl.43,
pp.894-906.
Cíchncki, A., R. Ubcnhaucn, and E. Rummed, L 994. "Kobusl leaming alguri Lhms fw blind Kptntion of signáis,M EhtMnñA
J.iW. voL-IO. pp.l 386-I3H7.
Cklwcki. A., and I-- MüRMsynski, l.., 1992, “New leaming algonthm for blind separation of sauncT5,,-L7ecr«w?rc£ ¿eltaT
TOLM^ppi 1986-198 7,
Clceremans. A.. D. Strw>S<hrehbcr. and J.l McCIeUind, 1989- 'Finiie Riaieaclámala and simplq rwuildlnttwwta?
Acj/raJ GMipirtffltíaii volt, pp.372-381.
Cohén, L._ 199S. JriFie-EM-rpr^rQ ^nnAirs. EmJewaod CliíTs. NI PPtfflke-Hlll.
Cohén, M.A., 1992a. “Thi.'synLbe&is or^rbiirary sUiWedyrmiuks in no«i -I i pear neural ndwarls [1; Fwdhsck aiiJ universal hy?
ZnAenufícNu? Jbntf Canfifratfü cr-r MfwrtiJNflHtVÍi, vol 1. pp I 41-Mí» BtUiiitfih;.
Cohén, M.A., 1992b. "Tlrt mHÜUCtÍDfl rfarbiirary ilabU dynamies m nonlincar neural neiwarkR." Mwnl AtanTJirihr.
TOl^pfkBJ 103.
CohcnP M.A., and S Grussberg. 1983 "AWluie q?Nlily nf global paitan formalion pnd prallcl menwfy by
cunijwtiiive neural nei^'wks/ IEEE Tniír.tiJrJtow A^jjr úhiíF vni. SMC-1^, ppiBI 5-Í126.
LohrttD-.andG. Tw¡jutp, 1992. “tfaw ú^hc areiltt Vafpnik-ClKTVüntnJíisbound^" CdiiTj/^w^i. «14L pp.2d9-269.
Camón, P., 1995. “SupcrviwdduslIílMliOfV* prvhiibilisCieípprL'síühJ £i/FTY-,(J4^1.yrni/^itírj^4in .V?jfiWAfitfiWfifcri
pp. L ] 1-128. BntHdBt Bdgivnt
Camón, P., 1994. '"IndrpHident tumpwwnl unulysis: A n£w «D«pt?”-í/g.|r<J jPnJCÉSTÍNg. vnl 36, ppi2i7- 314.
Camón, P., 1991. " Independen! componenl analysisi" ?RJLíT-Jfrj^ü- uf Jrí/L'MCTffúMrtfí Sjgntrí llbr^jfrop Ai
pp. I L1-120^ Chamrousse. 1-rance.
CoriStanrinc-Patnn, M., H.T. Clinr, and E. Ltehski, 1990. "PaLtemed tófvttfr syiwptie eonvergencc, and ihc NMDA recep-
l<ir ¡D devcloping. visual pathvmys,*Anden cf Nevmmencr. vüL 13. pp.l29-154.
Cooki A S-, 1971. HThc complciity oí Lheorem-proving prouedures," rfie Jn/J/rw/ JCAÍ Sii?rpü£jjrjTj m
FAron- flfCunípirfmg, pp. 1514S8. New York.
CüuIí, PA.. 1986. MwJfawXJiiiíJrtTrc-drí l.ondon: Pncnlicr-Hill IntemaLional.
CtMper. I..N., IJ73. "'A posible organization üf animal mnnofy and leamingr' ou
CÓffiKrftt ftvpc/tta o/ Syj/ewfj, B. LundquisL and S. LundqiiiEl, cds., pp.252- 2&4, New York: Academia
Press.
ConmitT.H^C hZ. l.ciscnKin, and R.R. Rivesl, 1990. rt? J/ifonfr^rmf. Cambridge, MA: MCT Press.
Corles, C., aabd V, Vapnik. 1995. '"Euppnít vectnrrwtwwta/ jUavAí^e ¿wnj^g, rol.20, pp.273-29"?.
Cotrrell, H._ and J.C. Fort, I 986. "“A ¡stnchasLi-C jnodL"l orMÍÍMKpyr A í*ul f Lirgaíiizjiig pTOCOM^1 iJwfüXJL-af Ci-í^mcrJCJ,
VQ1.5J, pp.^Ü5^!l.
Cottrell, M., J.C. Pon, and G- P^gCs. 1997. ''PicarLii.aL aspeéis eif [he SC1M algúrilbiii,''' FjiMt'í/ífrJg-.v ü/jJíc ¡VívfaAr^ rtrj
M^pt, Espeja, Finland.
CoCtrell. GlW h and J. Met^líe. 1991. -EMPATH: Face, emolían, and pender Tccognition using helons,1' ru
iVrwnrj/ AwusMg1 .ÍL.-ídL'jri.í-, vni. 3, pp. 564-571.* San M aleo, CA: Morgan Kjufmann.
Cottrell, 6 W., P Munro, and D. F.ipscr, IÍR7. 'l.caming inrtemal rrprcscntaLions írom gray-scalc images: An cxampLc of
CAKnswmJ programa:ing,'-'/tawpdjqgr RtA Ajwim/¿^emwi? (J'rfie CagÑJJire 5'cjfrjcí pp.46L-473.
Cnurant, R., and □. Hilbcrt. 1970. vd. L and [1, New York.: Wilcy Inlcrscicnce.
Cover. T. Mr, 1968. "'Capacily prob-lems for linear machines? ín J_. Kanal,cd.,/trWerTJ Jtrtúpgirjftrwr. pp.2 63-289,Washington,
DC; Ibompson Uook Co.
Cavcr. T,M-, 1965. "'Gcomctrieal and slatistrcal propcrtics ot'sysLcms oi'linear incqual ¡1 ¡es wilh applkations in pattem
nccognition," /EEE Traír5¿?cíJG.ní ofj E'acftuH/c Cbfqpwtax ral. EíC-14, pp.126- 334.
Hidden page
Hidden page
Fcldkamp,LJLF and G.V Pmkúrím. 1997. “Adiptiwbehavioir frwi Tixcd wcighr nerwürksC/^rÍjmüféfljr Sctott?, val,9$^
pp.217-235.
Fcldkamp, L.A., and G.V PxtókorinS. 1998. "A squl pnonil frumvffc bascd on dynímic neural wtwurio wilh
application tn prohlcms :n adaptalionP íillcring and classificalion? F c?f tfre tEEE. vüI.86l a Ser lanfftdDi
Fcldkamp, L.A^CLV Puakuriu^ and PC. Mowe, 1997. -Adaptaiion ffCMU ftnd weighl nciworkn." JtftouJto Sctowi
vi>m. pp.217-235.
Fcldmaj-i, J.A., L992. ^Natural cwnpuiacwd and artificial intdligvnec." Plcnary LkVuv prcflcnlcdfli ihe MenMftoaAMrt
m Afeunií A'cAiívís, BalLimure
Fcilcr, L9&K. iln JjTrxDrfrícrrán rt? ftutah'frr nkwpúrtfiix dj^ftrtírríidíP vol, 1. Jrd DditHn. New York: John W¡lcy¡ Lst
cd-hion, |95ft.
Físchlcr, M.A., and O, Firschcin, 193.7a ArJW¿rig&rFCf.- 7icE"i^. jT'Vctf™7rP mrJ/JrcCmnpu/cr; Reading, MA: AdÚLaun-WesIcy.
Fisher RJL. J925- -Thcnry af slalislical CHtimation..’' (?/ fie Cambridge PÜfaio-phieaJ í&cicA: v-ol-22,
PF700-725.
Flx, E.i and JJ.. Hongos, 195 L. "Diacriminacnry analysif; Nonparamctric dÍFCTimination: Cons-islcney proponies,'1 ¿j'SHF
SdkMÍ «/^víufrrj^r A/cvírtíiiü-. Prc? icct 2 L-49-004, Rcporl na.4, pp-261 -279, RanduLph F:c-ld,Teias.
Fltlchcr, R., 1987. ^rfjajíMlífcaA rjuíJcrtóM. 2nd edil ¡en, New Yorte Wílqf.
Fndor. J.A., L983. .t/ütirtorijy qf.VmtL Cambridge, MA; MIT PrtSs.
Fndor, J.A.j and ¿AV. Pylyshyr. 1988. ‘Connecticmism and cugnilivu archilcclun;: crilical arwlysis^ Cügmíjan. vol.28,
pp3-?2-
Fáldialí, F, 1989. "'Adaplivr nrtwork fcroptimal linear feaCurcexirtCtiom" /EEE/nJenjjA-Ma/JadFjrCüJ^emrrfl twr jVejrra!
AAefhwfe, «I. L pp.4O !-4O5. Washington, DC.
Fricada, M.i- i and R-C- Carrasco, 1995. ‘"Leaming 1hc inilaal Hiato el a sccond-ordor rcourrcnt neursl netwnrk duiiiij
regular- languagfi míiewKí," Atírra^ Cüfflpufürirur. vüL7, pp.923-93Ü.
FOTtty. G.D., Jr„ 1971 ‘The Vilerbi aJgorilhm," FraectfJjTifli qfíAj IEEE, rol .61, pp.2óE-27&
Forte. J.C.. and G. Pagés, L995. ,lÜnlhca_5. com-rf^rnce ofihc Kabcmen algonttini witha general ncighbofhood FuncliouiC
of .4pp/j'ed FrobodiJíA; wL5, pp. LI77-1ÍL6-
Forlfi, JjC.b andG. Pagos, [99fi. ^CímrerBcnccofstnchastjc algorithm: FromlhcKushner and Clark thconcniiodic Lyapan&v
runeticnaL.” .1.,'...í|l । .i Aubtfbr/rr}: vd]_28, pp. 1072-1094.
FfeBKGUa P*. M G0riL □i™.!-íj. Sodtv L 992.I ..d ícedhaclc mu-lliJayErEd nEtwmrks^Afaw'v/Cmi^TJfi'.p^cur.. VOl.4, pp. 1-20-130.
Fraswmi, P., and M. OcriB iWfi. XomputatíMil cípíbiliiies ofloal-&edbMk nseumne itviw^ks actmg ¡h fínuc-siace
rnfiehhn^Nj17EEE TVwudCttoltt NtWflí AfehWfífat vol7P pp--1521-1524.
f'rascL, A. M. । 1989. L,lnfümi4ilit>n and cnlrupy in slramjcflllraíhXrsJ’iEEE Dtmmc^NUcn? AT/ljrwarj'cw Tirar, vol. 35. pp.
245-262.
Freeman, J.A., and D.M_ Sakpura. 1991. ™íPragrarTrmbrg TírAjir^uíj. Eteeding,
M A: Addis<jn-WesLey.
Freeman, WJ.. IÍ95.. &ctaí^o/E™>f5. H.iiljdale, NJ: Lamente Eribaum.
Freeman, W.J., I W2_ "J utofiaiem neunobL-üIngy: Prora single netirons Lu brain chajus,1" .ftrAv™frQ^ Janr™/¿^'Ejyirned'nün
ü-wJ Ckw jTt .4p/>ZíHf Atoan1 jwb voL2, pp.451-482.
Freeman, WJ., 1971. “The physLülogy of percrpCiOft.’' ícjo/rAjSc ^merfraa. wi.264 (2), pp.7ñ-S5.
Freeman, W.J., L78R. n,Why neural nctwnrkñ dom’t yei fljy; Inqu.ry intolhe neumdynamiDS-nfhiologital ¡ntcl|¡¡cnce/' fEEE
¿Rfpmtoal Cmr/c/rnce m A’ramí A'ífHwis. wl. II, pp. L-7, "sin Dipyo. CA.
Freeman., WJ.. 1987. -Simulación of ctuolÍG EUG paLlems wich 1 dynajnie modcl of ihe nlfactory systcmT Ejúfojjjídí
Cy&í/vrríjei. wi.5t_ pp. L39-150.
Ficoman. WJ.,L975. Afü.w^rifl/r ftr rfií jVenuiu New York: Academic Press.
Frrgnac. Y, and D. Schuh, 1994. L'Modrls of symiplic pl-aslicbty and. tellular analogs of learzimg in ihe dwvhjping and
adult vertébrate visual cortes,” ^íAunrej rn Aterira/ ¿rnd Jeiavrora/ Eteitffo/wnerU voL 4, pp. 149-2)5, Ncwwoüdh NJ:
Neural Ables.
Frtund. Y„ 1995. -BoosCmg a Wttk leaming algorithm by majorily/ /^bnwflfw^r compríJA-an. wl. 121_ pp.25G-2S5.
Freund, Y. h and R..E. Schupi ret I 997. ,LA dccisi-on-lbccireLic gcncralizatinn otf on-lior Icamipg and an appJicaticn lo boosling."
Jbunu^ qf Cn/jrpirr^ mí íi'jfra Atocix vti| .55, pp. 1L 9- L 39.
Fícundí V.l ííuJ R E. Schipn, 1996a "ExptriineaLS wilh a new boosiing algorithm? Aí¿K/u'j?e ¿eflmAqg;
rbt fttiWKtftow/ Cdín^nrmíí'. --r 148-156. Bad, Híily.
Frcund. Y., and R E. Schapinc, |996b. 'flanie theocy; Ondine prediclion and bousí ng," /Trcccrfújgs o/rfje AMA
Cbf^bvncv oñ Cm*ípjrj,flrú^iJÍ ¿furjun.ij TjfrjftNy. pp,325-3J3^ Defltnzanü del Gfrrda. I ualy.
Friodman, J 1995. -,,An nverview of prcdbction leam ¡njj and funcl ion approí ¡iskíi ion? I n V. ChcrkasskyH J.ll {. Friedman,
and H. Wechsler íds., Erm toj-rla ftr Nrarcri Ndwrtf; TAíün1 M:/ JtacgnUiMNeu' York:
Sprlufef-Vtri^g
Fukunaga, K., L990. ¿ítríisíica! fíaffern «Rett^nífrflM. 2nd cd-1:.-an, New York: Acadcmic Press.
Fukualiims. K., 1955- '’Ncocognilrein: A model fbr visual paliem rceoínitinn,” in M.A. Arhib, cd., 77jí^F/ít/w/Aímíérr/"F™m
TTÍKrVdlw/Nnraí Mtftawte, Cambridge. MA: MET Press-.
Fukushima, 1L, 1988a ’A hierarehical neural oetwfk modcl íbrRcIcctivcanculicm” in Nnrra/ CoNpvftn R. Eckmiller
and € vuri der Mallburg. cd*- pp-Sl -M, NATO ASI Serien, N<hv Yurk. R-prinjjer Verla g.
Fukusbimíl. K-, PRSbi '’Ncoccignirnjn: A hicrarchical ncurat ndwnrk capahlcn/visual jWetti recognitipn^Atrdrtj/Jfcftrorib;
vol-1. pp-119’ 130.
F Liküshirtlíi. K-. 19RÜ. "NHKQgnitnn- A sctf-nrganizmf neural nccwíirk niodcl ior a mechan ism uf paLIcm pccflgíliticiti
tmfltotcd h>- sh-i'i in pojiiin 'n,** 0taA3gfm/ C^hfrtií/fej. vol .36, I93-2D2-
F □kuih¡ni¡Jt K.-, ]9?5- L,Cogni1-rcm: A scLf-organizing mulii-laycred neural rictwork.'-' Qfrenwf/Cfi vd.20.
ppJ2L-l3t
Fukushinm, K., S. Miyifce.ind T. 11c. IQ83. Itaogniiw A neural network modcl fo* a mechauism of víiual paticni
recognición," Í££E Ihutfaüriúttf tiri irire™. Mwr. üttd Crherwíic’ü. Vfll SMC* 13t pp. 826-834.
Funahashi, K.., L989. “Chi ihe approajmate realización flf COnlinUMU mappinyf by neural nclworks?1 A'rartrl A'dlwnkr.
vtf,2, pp.l 83-192.
Ciabnr, D., 1954. “CommuniDalion iheory and cybcmcrics? //¡ti' 7>¿7niff¿7mrj tw Cj'jtfjj/ vnl. CT-L, pp. 19-JÍ.
G-abor, W.P.L. Wilby, and R- Woodcock, I96E). *A universal non-linear Glltf. prediclocand simulator which oplimizes
ilsclf by a Irarmng proerss? PriwMwiínjp q¡frirf /njfjJzríÍM qj'E/ctrriai/ Eírgmccrs. Londonr vol.lÜS, jfp.422-415.
Cialland, C.C., !993-L,The limilations oí determinaseis Bohzmann machanc Icaminp," A'tfwí. vü1.4,pp.355-J79-
Gallam, A.R., and H. Whiic, L98S. "l"herecs]st!io neuraliMtWMkthlldocs not makeaYoidablc mistakes,"1 /£'££'fn/c.i™/tfiN£d
CrtFj/cra'rtceoHi .Venria/ iVcftranki, vol. I, ppj&57-664, San Diego, CA.
GalLant, A.R., and H. Whitc, 1992. '"On Icaming 1be derivativas of an unknown mapping wilh muLtiLayer fcediorward
nctwork^r Mturaf KrniwjLr. vn-1.5, pp. U29-I3S,
GuLLanE. S.l, 19^3. Mura/Míhw* ¿ramA1^ Mr/ F^rj-r Camhíid^c. MA: MIT Pkk
GalListelf.C.R.11990. O^dniariiM Cambridge. Ma MIT Fren.
Gardner, L., 1907. “Masimum ftúflge cjpíüity iniWunil iiCliMjrk<L £Avfir?Jp/jr.iíí,j Íeífw. vtl.í, pp.4KL-85
Garey. M.R.. and D.S. Johnson, 1979. Co^^flSúftdMnfJcrtfWf(K New York: W,| |. Fh-rman.
Gce, A.H., L9W. "Ptublcm solving with upcimizüliwi ncCurrlís." Ph D. disscrtalion, Univ;rs¡Ly -oíCambridge.
Gce.A.H^SlV.B. Aiycr, and k. Pragcr, 1993 ^Ananaly-Lul írarncwüTk roroplimizLngneiíralMlWfflta?1 A'rarfl/MftiwAj,
vol .6, pp. 79-97-
Geisttt, S., 1975. "The praliiiive-jínmplc reufe meflnd wích jpphcacio<B1,,-^?i/r/i4r/^f rtí'/rrcrjcrj-j?
volTÚ, pp.320-324.
Gclftnd, A.E„ and A.F.M. ímhh, 1990. ,LSampling-bii3ed jpprüiiihcs 1o calculating marginal Aurao/ t?/’íftt'
^mcFdMFj i'rjíjYxjíffy^rjíM-jíjrrán, wlJ85, pp.398-409.
Ccirnan, S., and □. Gcman. 1994- ^tochasCic relaialion. Gibbs disIrcbuCion-s, üthI the Dayesian restoniLion of images,”
IEt£ 7'ransacíions on Auítfffl 4ncrA5j"scinrf .VucAmc fn/c/íígruív. vol. PAMM, pp.721 - 7d I,
Goman, S._ L. Dienenstock, and K. Dou-reaL 1b'Ne.irdl ndwurkN and ihebíuAwfincedilemnwTAVwírf CíJflrpw-fírfrí^r..
vol.4, pp.l-38.
Gcrsho,A., 1982. ''On Ihc stnKtknrofvectorqiMnlizcTS-'Jt'ÁL'Jhf/njírc^üFrjío^fanmaJtovi JfrcíJH', toI. ET-28, pp.l 57-L66.
¿jcrího, A,, and R.M. Liray^ 1992. FfecfcryNa^XJZírrjM rtnrfSi^naí Caoipre-jjj'ñi?. Norwcllr MA: Kluwer.
Gcrsrcin, G.L,, P. Bedenbaugh, and A.M.H.J. Acndcn, 1999. "Neural asscmblics,-1 JEEE 7)\ifísaeíío?r5 4W
volJÍ, pp.4-L4P
Gibbs, J.W.,1902. 'Tlementary principies in stalislical mcchuica,4* reproducid in vúl.2 of Cfl//crferf irorAr J
(7/Hf ftt fijarme.-.y, Nltv Yiwk. Lúúyirianh, Green and Cu.. 1928.
{jibión, tj.J.B andCrKN. Cow-bíi, L990. 'Tkn rhc ctecLsinn regíons of inultiLayei pcrceptrans” o/'rÑe fEE£r
xrtl.TRtpp.l5W-l5W.
<j idas, B_, 1985. "Global opíimizalion vía 1he LangeL'in equalion? '2ííA C<irj/rrericc mr eroJ
pjk774-778h Fe. Landerdale. FL.
Giles, C.L., LL>96. "UyiLamically drivenrecurran nevnil neLworks: Modcls. leaniing al^orilhmsi and applllMlions/'hrtDrill
M, fwi'u/riLUJi^ri/ Cc^/tWKe ON .Vl’j™/Afe/Mwrtr, Wasbinglon. IX?.
Giles, C.L., D. C"hen, G.Z. Sun. E1.H. t'licn, Y.C. Lee, and M.W. Goudreau, 1W5. "ConsInjctiYC leaming ofrecurrenL neura.1
ndwnrks: Limitations of recurrenC cascadc correlalion w¡1h asimple *úlidiímtH/EEE OnAfeura/.^ni^rtr,
wl.6, pp.$29-836.
Giles, C-T.., T. l-inh and B.G. Home, 1997. '’Rcmcmbertnj. rhc pase: The rote of'anlwdded mcmory n mmnt neural
nciwürk arehiiectiircs," At.ii,,,' AtrMV?rjLR V1E, Pracccdings of (he 1997 EEEE Workshop- EEEE
Press, p.34.
86fi Bwm.hiCxaHa
GilesnC.L, ind T. MnwdL IftRT. "Lvarning, invariancc. and gfncrahzalinn in hi^hcr-ordcr neural ndwark^' ¿pptied
r ?. u'i. . vqI.261, |ip.4972-4?7-R.
Giles. CI.., and B-G- Home, L 994. "Representa-:inn oflcaming in rccurrent neural ndwurk arcj.lttcCuT^sB,, o/'
fhr £^*/A Jlfaidtfftftp üJiíUd^fJVü úhmjfii? SVsrettfj. pp. 128-L34,Yalc UnivcrsLty, New Haven, Ct.
Giles, C LC B MLllci, D. Cher^ H HrChen, G.Z. Sun. and Y.C. Lee, 1992. ^Leaming andextracting Unitr State autómata
witli wcond’flrdcT recuncnt neural ndworks" Atara! CtepitfarfwL tal,4. pp. 393-405.
Gilcs,C.L.tGjí. Sun, il H Chen.YjC. Lee, and D-Cbcn, 1990.^HigbcrwJwncumnlndwürtssndflramtnatLcal inferenc<
Jí/v^-re* 9t Atara/ Fnicariqg tal- 2h pp. 38O-3S7. San Miteo, CA: Morgan Kaufmanu.
Gilí, P„ i. J lunuriing, W. Murny. M. Sauoden» and M. Wright 19M. "'Uscr’i piide fcrLSSOLTTtahakal Report 86-1.
Systems Üptimization LaboraLory; Slanfcnl LnAens ty Slñnford, ( A-
Gil! P, and W. Mumy. 1991. ‘"liKTtLiL-ccinlrülling mclbods for general ^uadralic prOgrtmm¡-ug¿ SMM Rcvfrw. vol.3X
pp.l-36.
Girosa, F., and G. AnzclluLti, 1992. '"Raies of Mn^ergenec úf apprüxiitkfliiün b>- iran^líiies,"1 Ai Meno JJfiS. Artificiad
Intelligencc Laboralorji MITCambridge^ MA.
Girusi, F-h M. knHi and T. Ryg^io» 1995. “Regulariraii&n theory and neural netwofki udñtccturai,” Atara! Con?pNftrftta.
wLT.pp 219-269.
Girusi, F„andT Puggiú. 1990. L,Net^rksand Itiebesl appraximaLioii prvperty "Ewfcígfrw^CvÍK'rTiL'rfrs. ^ol.63,pp. 169-1 76.
GlauberP R.J., 1963. L,,[jmc-dcpe™JcnC sUiAtfcl ot ihc [sing model'1 Jbünu/ dfJUfrftMdftai/ P6rjfcjP vol. 4P pp.294-3Ú7.
troggin-. S.D.D.,K_M. Juhnstm, ¡md K. GüftaSofh 1989. ’Trianacy Mdraceocy efTecrsdueiúihümenrurn iukrack-prup^gaüon
leaming/ ÜCÓ' /écAi?íí¿?/ flíporf Í9-J5, Büultkli CO ; Uñitarsily of Ccloradu.
Guldcn, R.M., 1996. .WirrAcJwtrrí™/ Ne/HuríMflo$BÜ rnw/ Cambridge, MA: MIT Preut
Cruldcn, R.M._ 1986 *The 'Bnun-SlaLc-in-u-BoC neurahnwlel is ¡ifrvbnt dcsiXnL algóriLhrn/'^JNnwJ^fAíerfócJTiCTfrcer/
vuL JOp pp.7340.
Goles, E., and S. Martínez, 199Ú. A'cüjjí anrf^NFomflfo AfeffiMwfa; Dondrechl, The Nethorlands: Kluwrr.
trcdub. tr.ll. andC.ü. Van Loan. L996. Idofrfr Gjrwpifta/rDCTS, 3rd ediliem-UalLimore: Johns Hopkins llnivcríity Press-
Güftdinan, R.M.. C-M- Higgtns, 1W. Millcr, and P. Smyfh, L992. '"Rule-based neural networi^ for classifieatinn ..ird
prftbabililj.'esiimaciím,’'Ccirtt^hfdJJíMf. vol.4, pp.7Kl-SCh4.
GoríT M-. and A. Twi. 1992P rilCn ihe problem of local mi nima in hadcpropagatL-ün," /££E 7hW0Cf*Pffll jji'r iPíLri'i'i/.rn jiljJi'.rá
flJíjf .IfflcArnr tal. pp.7-6-«IÍfi.
Gorin. A.. 1991 "Ncl^ürk *iTucruK"i generílv-ímoii íatd adapiive la-nguage Kquílíttoa” í?/fíe íei'Cj?rA Ht/í
MwfatapJííjiímjlcmí/¿r<rrníflg5'.jiv pp l55-160.YaleUnivCTsity, NewHavenrCT.
GMidrciiu. M.'W t andC,LGÜei. 1995.'"‘IJsin^nKurrenc neuffll nelworkN DO tttim ihcslnicmre of inKrttinFicction nd^rits’-
j^Atmw*!1. wl.RL pp.793-8W.
Góudíeau, M.W., C L. Giles. S.T Chilndhu1. and D. Cheik JW4. "Fnt-onier vs. second-wder Híigk-layer nxunent
neural neLworis<1 /EEE TnifíMcfwns tM A'crifcií A'crtwrfcj. V0L5, pp.5l 1-513
Gnrnger. R., J_ Whítsun. J Lu«aand G. Lynch 1994. "Nwi-HAbiu-n proprnies ofLTP enable higb-capacÍLy cncodingof
temporal NEquettMÍ1* Prací'rrf¡í.ogj íj/-fAr A'trJj'owl/^Mdíffllvqf ícj'cntcjf UEA r a ser tardado.
GfUsher^er, I., and I. FtoCKCÍl. I9A3P “McMinm Lhe sirzngcncu qf strangí aUraAnT" £X wl 9. pp. 18^-208.
Grauband. S.R.. cd., IMS. fát1 Jrnyícj'üí Zijte/fljgnRZfetate: ftta^ora. Eeu/íbEjíwiüfjrNtr. Cambridge, M'A: MIT Press.
Cray, R.M., 1990. EhfrtfTp h^tinnidM New York: SpringcT-VerL-ag.
Cray, KM., L9SH. AaniíApnr Pnscé'ijfj. amí £>tfn/j£ fro/WFricj, Neu'Yorli: Sprinjjer-Vcrlag-
Cray, R.M., 1984. "Vaciarquanlizalion." vol.l, pp_+-29.
Cray, R.M.. -and LD. Davis-stm, 1986. Aandbn! Eraccjjcj.-jí Englewnod ClilTs, NJ:
^il'! dice-Hall.
Oreen» M . ind DJ.N. Lii^ebeer, 1995. £JjiftirjJi:±.^yr Cmfrnt Etylewud ClIff^NJ: Pmuitc-ílall
GíMítbcrg, Hl. J9R8 “Eqifl-iJihrLa of ihcbflin-Ultedn-í’h&s (ftSR) neucül mixta!'" A'cwrai .Vcrtkarír. vol.l, pp_32J+JM-
GfeflOfy. R.L., 1970. r^cE^t-. Wiedefeld and Niclwlson, London.
Crruandec, L1-. 19R?. TijruF-jLr? jn ñrrr^rji R-tO^H Uni^tr^iiy. Pro^jdcnce, R.L
Gfpval, M.S-i and A.P AndrcwsL 199J. FjJjmog- n»?d^/W7j.X CnglwcKxl Cliffs, NJ: Frantíce-Hall.
tjiiíTithfi, 1..J., and C.W. Jim. 1982. "'An fiktmalive approaeh 14 line^rly CúnSLrilflcd uptimum beunforming" JEEE
Thwactiow*' .4jjrí?flFjLTjLindvq|p AP-]0.ppJT^Ji
Gftwbs^ S>L 1W0. -CnnWnl-addrcsMblc memciry stüffl^e by neural networkM A general modrl and jk-h;il LLapunm
incthod.'" In Cí>rripkrüfdrj™/ArdJzrjTi.Y¿ítnc^ E L ScbwartZ» cd.ipp $6-65, Cambridge. MA: Mil Press.
Gn- sbcrgi S., 19E3a "Competitivo leaming: From interaccivc activation ra adaptive motunT In okf
Afeitara!AufcMtanicr. 5’ Grossbcrg, cd., Cambridge, MA: MTT Press.
CiTLKhbiir^ £., L98Ah. .V™jTa¿ WfflfwfcrdfttfA'jrwrn/ Cambridge, MA: MITFrcss.
BllMJDCkftl-IA &67
GíüSSbtr^i S.h !9B8c. "NünlLniMj Mural ncLworks: PnncipSc-F.. mcehanisms, and uchitectuits;" .WtVflflí M'/hvtíó; vol. I,
pp.17-61.
GnKsbrng. S., 1982. Snuries ú/'.tfúi¿f ¿r«J Hrdi.it Bosíon: Re iIqL
Cjmssherg. S., 19H0. HHow dxn a hraLn buitd a crigjiilive cade?" flírííHr vul.87p pp. L -51 _
GfwbfflB, $., L97Ra. ‘"Decisión- pallems. and oscilkiioih in ihe dvnuniks of compciiiivr systrms wilh spplLcaiion lo
VoltCITa-I.OLka S.yRtEinR,'L J. FrhL'-r.irrJJCi'Jj' Hjívol .7 \ ppL IQ L -1 Ml
üTKsbcrg, S.. 1978b. nlCompctltlon, decisión, and cüíiscilíus," J. .,Wtjj/i£rma/ré¿?í^FrcT^,5J>flFjcf/F^fíYTfíoNJ. vul.66« pp.470-
«3.
Crrossbcrgp S., 1977. ’Tatlcni formalion by che global limha nf u nun linear rcimpetitivc interadion in n dímctisions/' J
MtíJtaiwrfñfl /íii.-i'j^i. toI,4h pp.237-256.
Gmcuberg, &. 1976a. “Adaptivepattem clíiss i ricaliortUWl universal rtMUing: [. Paral Id dcvelopmcnt and. cadinguf neural
ddcctors1,L Rídiúlfcvf CL-AürtFúrk'j. vo|.23? pp-121-134;
<jmss.bcr^,&., 1576b. HAdjplivcp3llcrTidaAh¡!Ka[ionand universal róCCJiny U Fwdbaük, rapectaLiun^lfarlion- illtiiionsC
fiírjJrjjid^ QAtfNNW.f. vftl 23, pp. l!8-"->2?02
CÍTüEíSberg, S.. 1972. ,LNeural tapccliilien: Ctrebelthi and riMinal analogs □frclls fired by l-ramablc of unlcanicd [wnem
clttKS," wl. 10. pp.49-57.
Groiísbcrg, £., '969a. ,LA prrdi.rL¡ün Lhcory fnr somc noníinc-ai t'uMlional-ditTcrencc cquatifMW,”'JjrJ^rfqfAÍ£rf^rni<?rrér?¿
4naATJ£a/w/.4^p/j?ajdmr.T, toI.22, pp.49D-522.
GmfcRbcrft,S-, 1969b. "u-leamingandenergy-wrtiopy1 dependan ¡ntecunentand winrcvurrent sipned MCworks/* Jomad
flf.íLarr.frrttzf Pín.térif. vnl.l, pp 319-] Sil.
CrmsRhcrg, S., LQ6B. **A prcd.ieiior thcoty íbr SOITK nonlinear fonctiOíuMíífeftíKe equfltkins" ^mul
¿Hffhyü d^4r^íkdiií?.tiF vqI.2|, pp.-M3-694^vnl.22, pp.490-522
CiroEsbcrg. S., 1967. L,>Jon linear diiltTcncc-díllercnlial cquaiions in predicción ¡uní leani-iiig Ümjrv/ q/ ríe
A'tffKWdr/ 4-Ljíít'mv qf&ñPWL US A, v-ol.58, pp. 1329-1114
Crupls, M.M., andN.K. Sjnlui, ed«. 1996 Cwri^^^.Vrni.v.- TAívn1 ífo /f^kuíjcwpj. New York: lizEiL Pfcrr.
Ciuyon, [.. 1W0, At-J^Ti1 A,ffi'.wr¿Tdtt¿í/i^j?íi^njr.T. Gwnpuccr Physcs Repone Ainsctrúaiii: Ekevler-
HalTncr^R, I99J. "A probabi hfljcfiimewwi Ílw CüiukíCIÍuiuM Ümealignnii^,-,ft™™^gJí^7C5LP pp.1559-1 562,
Y^kobanu, lap-n
HafTueTi ?-i M Ftanzini and A. WhibeL 1991. "'Incegrattiig time aliignmcTiL and neural netwarks for Hgh períbnniticc
cmttfintnu tpeech reragnitíoa" AtíOMdwjgr c//Et'E JCáSSP JtJ. pp. 105-108.
Ha.fl. M., and. J .L. van Henuncfi, L . ,L-I"hcory and ímplcnicntalinns ot' i nfbmu filtcR for ihencl i naiVcfm-chrJt.- CwvnJa'J'jMS
m jV™f¿?í íy^siix toI.9. pp.39-71.
Hagiwara. M„ 1992. “ Thctiretical derratLon üfnionieivLum 1crm in back-prApagatinn,” CíiFr/m.'ncL'
JVievnii Afernwis. vol. 1, pp.O82-6ÍIO. líaltimürc-
Hajck. El., 1985. HA tucrenal surveyofthcory and spplicaüons ofsamulatedamealíllft.1'Prweer^rgr q/ fAc2-T/A Ct?^fcre^
í?jj Ifeer.írnft 0KÍ CúÑirnJ. EFEE Press, pp.733-760, Fr. Lauknfalea Fia.
Hajck. B.. 1988-‘‘Coolíng schcdulcs foroplinHl ^nncaling^ 4Yi?f^jc r?idrrír.í ü/íj^-wrjjjnr vol. l_\pp. 3l 1-319.
Hammentram. D., L99Ja. "'Nrural networtcs at work." í£"¿£ ¿/jerO j/i?!. vol. 30. no. ó, pp_ 26-32.
HammErsIrom, D . 19Wk "A'urkinp witb neural nel^rrkE.'" /jEE£"ijwcO j/r?i1 vnl. 30_ no. 7, pp. 46-53.
Hainmeralium. D., andS. Rahíusi. 1992. "NeurwompuLm^ hardware: Preserttind future,"' S'Lr-crff.Tfi Afa/ftwi^ í'njríí^HKie
cw? CbffnrtctiowsH» Skuvade, Swcden, Scplembcr.
Hamps-harc, J.B., and B. PcarlmuLter, I99D. "Equivalen^? pnxiis for inullilayer pefetprrofi dwiflen and Büycsian
discriminan! ñuwtfon^ Pnjeecrffrjís qf/Ae 7JIW Cwwí/MÜF Mcdeú Awwr pp l,S9-172, Su Mateo. CA:
Morgan Kuuftnann
HanipsoíL. S.E., 1990. C"a'Hvfrórju'£éc - Brr in: Birkhauscr.
Haiieock, P.J,B R. J. BadoklL^ and [..$. Rnñih, 1992 “The pTrttip^l cwnpuncnls of nalurat imagesr- Aforrar*, wl.3.
pp.til-70,
Hansnn, L.K., and P. So-laman, 19W. ''Neural nctwnrk cnscmblcs?' fEEE Tram;fjeífo*r5-caji ftrWc^ /TutrAy-ró' <?r?c/ Afcrc/rjnr
/nreíñgcjrec. val. PAMI-12, pp.991-1002.
Hürdlc^ W.. 1990. .Jppíiúí Atenparamelrú1 Lambndgc: Cambridge Univcnsily Fren
Hardy. R. L., 197J. "MiLltiquadric equaüons oflopographv and ffther irregular Rurfaee*,',-^j/irj?íJ^/"fT^Jinjcr ffr.TCflFí A.
vüI.76, pp. 1905- 1915-
E-larel, D., 1987. "jlfgBntAjH/cs: 7/ic 5pj>ií q/ Cowpüjpr^.'' Rcail íig. MA: Addífon-Wfesky.
Fian liilc, H.K., 1940. "Tlw rcuirplive íifil-ds of oplic nfitVc tebens-^' /fff-cj kijjr vnl. 130, pp. 690-699.
I Eurlinan. E., 1991- *A high sturuge capacity neural neLwork content-addressahlc jncmcry,11 AfohW*. vnl. 2P p[\ 3 L5-3.14.
Hsrtman. EJ-, J.D. Kcílcr, and J.M. Kowalski. 1990. “Laycredl neural ntLwtnks wilh Gansean hidden units as universal
apprOKinLaitíríC Ar4?ur¿íir G*mpiííxj.r¿nn. tól 2, p[k 21(^21J.
Hashürlk S.B 1997. "dpi i mal linear comh-inaíionE ot' neural nrLwEwks? A'cujctJA'chntwCs Yol. LO, pp .599-614.
Jlassrbi, DJBA.IL Sayvd. andT Knilíiih I99R, ÁJ/fj-úiirf
/fw Tftwríry. SlAM
Hassihi, B-. A.H. ¡Saycd, and T. Kai l-nth, 199^ "The I E" oprimal ¡1y óf ÜW LMS llgorKhmB" IEEE Truír.vuerrOír.f ¿ut .íiftrjüí
Pracrjfírrj^. v&l 44, pp.2fi7-2Klk
Hass-ihi, El., A.H. Sayed. and-T. Kuilath, 1993 “LMS i-s upiirLftl?'fjTwc^Irr^ríjf^Jí /EEE CjpH/iwjsevon Deeismi and
Crtírfroí- pp.74-79, San Anlor-c, Texa?
HflSAÍhi, R.t D.G Slork, and G J. WoLÉT, LíK?2. ^C>plim-al brain surpron and general MtWtKfc prunirtg,'1 IEEE AMmaftMOf
Cwift/wreon .Víurul .Venvorkí. vol.l, ppJM-lM. San Francisco.
HttSibk B.Pand T. Ksilailv 1995. “H" fiplimal traininj algorich™ and tbar rclatron Lo back propag^tLon.’-traces ú?
/n/íwTTiórfíí'-'n -^i'Y^-rhJíi vciL.7. pp.l9L-l9K.
I [asLie, T B and W Srutule. 1989. "Principal curves," -. jA-l?¿rjrcrjfdjr Sjaíisíka//fjs¿wjafíorj. vol. 84. pp.502-516.
I EaSlEflgl,W.K..l 1970- '‘M&nílc Cario sampLing mcthndi mdng Markov chains and Lheir applienIions7‘ tf/omrfrito. vol .87.
ppi97-l09
lhujier, D., 1988. "Quanrifving inductrve biu Al ícmiob ilDoriÚuiv íiuJ Ifeliím's Icaming framvwwV
vol .3^ pp.l 77-121.
Hmfcirit, R-D., and-G.H- Bnwcr, cds.. 1999- CcwvwMrtwiflJJWoífebÉ^ica/jrnjjinSrjNp/í Atwra/ÍTsfcm^ San Diego, CA:
Acadenüc Press.
Híykin, S,B 1996a. Jr/a/irr^ FWn?r Tfiepr^ 3rd edil: .un. Englcivond CliiT's. NI: Prenticc-Hall.
Haykin, S.B 109611. ,lNquíhI MfWtfcl expaikl RP's bonzwu." fEEESgnul PrvMX.í^g Mfl®tní<Wf vdJ3. no.2, pp.24-r29.
Hay km, S., ed. 1994a. EJmd DúamolirtióJi. Englewood Cl i rTs, NJ. Prenticc-llall.
Hayk.:i, S., 1994b. CcHumuncujirNi iy.TXcwrj. 3id cdÍLÍon, Nrw York: John Wilcy.
Ifúykin, S., 1992. uBlind equali^^tíun fbrrnulnc^ u a scir-organizcd Ic-jmiíng procesé Fitwwijj ofrtw
/JjtfftMMr ftr? Sígncr/v. Swww. fldrf CMiputor, pp.Mft-350. Pííific Grove, CA
J-Laykin, S.. and C. Deng. 1991. “ClíissiíkariMl i>F mular cluLier usirtg nínral iiei-wOTks," IEEE Thj^ó-flt ffcHró- c?n A'cNrfj/
Atrwwtr. vol .2, pp.589-6<lU-.
HsKykiíi, S.. and E. KíhJíd, cds.1998- Spccial (ssue nf /^rKíc/írpgj / Jjí It'L'E on Súpan/ vnl.SS, a
HF lanzado.
EKybfjTi. S .. nnd J. PrinLÍpL", 199& ‘"MakinJ KHM OÍft CLunplcT wlifU: lJ>in^ itcurul nizLwr?rk^ Lu dyiiainiiziil ly [dímÍeL lzIi¡mj[ll~
WCntt fUth M K9 cLueelt.'1 IEEE Sr^ntii PrxKf$}ÍHf .Vúisftrzrizü-. vü!. L5, a Mr Lajeado.
Híykinr S,B 'A SlvtiwaunL l1 Wfeber. C- Deflg» fl-nj Lí, MannL 199Í. “ClkHificvthiri of lí^Jar cluttcr in air -;ii'_'il- ítmcrol
rnv ronmcnir' E^L'íVLÍprgí ü//Sí f£E£, vül.79_ pp."?4L-772.
Haykin, 5., P. Yec, and E. Drrbcz. 1997. "üpi mum nonLincín tlltering," /£££ Transuclioju o?r Signa/ frocíS-Tijig. vol.45,
pp.2774-2 7S6.
Haykin, S., and Q. Van AA:cn, I 99fl.. SjjpuhSureffjj. New York: Wilcy.
Hcbh, D.O., 1949. Jíe a/'0fA¿rvj^.*.4 .Vírj^p-si^nlngj^dí Ttwj. New Vori: Wilcy
H<chi-NicLscnt R., L995. 'RcplkaRX ncaral nclwwkg foruniversal úpamaLscurce wding/' Atoict, v&l 269hpp. 186d-1863.
Hcehi-NiclsoiL R., 1990. .VridnJ^jrtr/jrjjjriv. B.cíd.in^t\lA:Add¡snij-Wcs|tyB
Hcehi-Niclson. R.t 1987. '’KolmcgOTflv's mappiflg neural nctwork sristencc Lhwrcni,Vr^r/EEE/ri¿tY^r¿rfrürwfCffli^n!!w
nri jVt-wn#} vol Eli, pp.l 1-H, Sun Diego. CA.
Jlrklroin. CW.. 1968. Srarúrrra/ ¿kíccrrárj. 2nd ediliun, Perganuon Press.
I LeraulL J., and CL Juílcn, 1994. Asww AfeunuwuF rr Jrrrj7ci?ic^rr t/jr Sígrju/. Ptrta; I Lemes Puhlishera.
I Leraulr, J._ and C. Jullcn. 1986. '"Spacc ortime udaplho signat prcKTSsrng by neural net^ork models," in J_S. Dcnker, cd.,
/Yeuraf AfatHwfcJfcrr CDmpirrrng. Procmlings üf ihe A1P Cünfrrence, American Insl iulc of Fhysics. New York,
pp.lM-211.
I lerault, J.+ C JuHcn, Md 13 Ans, 1985. "DelecLion de grundeur&prímilivcsdans un messiigetoTnposiLepiir unearchiIccíurE
de cakul ncuromimeliquc un apprerilisragü non supen iít" jP'fwbo’w/es GA£7S¿ Nrcc, Francc.
Hettz, J.,A. Kjugh. and k.G. Palmer. 1991. AiftuArctiMltortw7fewy<3fAfeifra/Cor?r/?Nf^frí?n. Reading, MA: Addiscm-fttsley.
L teslenes- M.R. _ and C. Slicfd, 1952. '"McIívlhJs üf conjúgate grai.1 ents for sol -: ng. I mear systcms," Jnmul n/EfSíajrA ¿j/
rAr Mtttaiurf Íhfiytn StandandFr voE.49, pp.469-436.
Hcthenngton, P.A.. and M.L. Shapiro, 1993. '’SiinulaLing Hchb ücII ssscmblics: The ncecssicv for parliliontd dcndriiic
Lroes and a port-not-prr LTD nilc,"1 MeftHHit; voL4. pp.l35-1 53.
hhller. ES., and ü.J. Licbcnman. 1995. C^ervU^nj 6ih edición, NcwYník: McGraw-Fiill
I linum. O E B1989 W-innectionisI leaming pmnlurca,"íÍf-^/ícJb/ vol_40. pp.l 85-234.
Hinton. <j.E.,1989.n"DetenninÍRdc Bollzmann machine IcamLng prrFnnns jlccpcsi ÍCíWUf ¡P wcighb spflíe/' i¥nraf
Conyh/trj/füjr. vol.l, pp. 143-156.
HiriEonh (j.E„ 19R]. "Stupc rcprc&cntaticin in parallcl systcmsr o/thf Jtk inlematitmül J&int Catiferciwc t»t
/frtf/rrrtfj /ni,(’íífp7J?rr1 VjinCOuvin-, Eh r..^'i Columbb
J-Emion, G.E., P. Dayan. BJ. Freyh and R.M, NkiI. 1995. “The "wikMleep1 dfccriHhm fbr unnpervircd neuí&i networiu?1
iYrcurc, vol.lóS, pp. L158-1L61.
H.nton, Cj.L.,and Z.-Cihahramani, 1997. ^XJtrtertiírrt mudéis fbtf dittúwrií^g hparyedistrihuC«lrípreéCil1a[¡cnsJLFArycwcipfl/cflí
ftwUQttfPlW q/ fifi ^íJjwrfÁtMderr Áíftcs F. vnl.152, pp.] 177-1190.
HiniM^GÉ, and SJ. N-nwlan, 1990. "‘The hoclslrap W idraw-HuíT rule As C luslcr-formation alguridim,L| Nrorcrf Ct?mpuíaIímrP
vol.2. pp.355-361
Hifllflti, G.E., snd S.J. Kowlan, L9S7. ,_How Icaming can guide nxsluiiün/ Comp/ei Susíems, vol.l, pp.495-502.
G.E.,aridTJ.S4jnmwki, L9S6Ln,ljeamingand nelcamingin Boltmunn machines/in HrrcTWííDis/RÍJNícYfrtnrmíi^:
jft .tfrrm.uflrvrirrf c?/'Cr]i_í#íjJ6'N1 D.E. RumeELhari and J.L. McClelland, eds., Cambndgc, MA: MET Press.
Hárten.GJE..HMT.J.&cjnmvRkiL 1 -9K3_"'Opr.mal pcrccplual infcrencc^ Fjneci»Jj^jsflfjrEffiC¿?j?jpNfcjíficr4?íi: Cn^r/¿NUJ?cc
(íj? Gcjmppiírr Urtoft ürfJ fljiJt'FYi pp. 443-45 3-. Wash nglon. DC.
Hirach, M.W., 1989. ^Cüiiver^ntaclivition dymnúcs ¡11 cvrilinwus lime ndwürkR/Afew^MMwta, wl 2bpp.^bJd9
IJirsch-j M.Wh 1987. +±Coirver[eMe hi nete," Ffraí /Ej..1, l/tíffíwtiwtíií m iVtjrna/ Afefrurtj, vnl. IIL
pp. 115-125.. San Lhcgu, CA
I Iih<,¡iM% . ; r ¡1 5. Simle. 1974. EpJnrrjHriv JwTPW. ¿ínJ Sl\v York: AcadcmLc
Prest.
Huchraitcr, S.p 1991. £j,Hr/crTrírAji,Jigx,níiJ^wrPij1írA^r^4'rjmnrj/r^ Wrtfíri, Ripluiii^Tlb^iN^Tuctiahij^hc EJnivCrsitai Munchen.
Clcrniajiy.
Hochrri-Ler, S., and J. Schrnidhub-cr, 1997. "LSI M Can ttilvt hnrd hmg nmc lji(prabk^ns'M-r/r^r<-ej: Ñí A'cñtct/ Í^rnr«í?oj?
Processing Svsfcms. vul.9_ pp.473-479. Ciihbridgt, MA: MET Press.
I Eudgkin, A.L., and AJ. Hvtttey. 1952. "A quamilitivc denripckin of nbcmbratie cwrent and ib ípplkadon 1o condición
r-:! ttcdUtÍM in ntTve/ ^JurJT{7? Vfl|. I I 7, pp.SM-5J4.
H&lden, S-B., and M. N ¡Tanjan, 1995r HOn Ihe practicaL applicahility üfVspnLk-Chen'cmcnkis dimensión bnundH/ Newnf
CGM^HrtdíÍM. to17b pp. 1265’1280,
Hi>llandi J ifl Cambridge» MA: MIT Pjimr.
I IfipcreifL J.i and U. Ullmu^ 1979 MtrodtoJM 4u^j-mrjj<j Tfrewj-, £tí®sflger G^j^i^íÜottP Rcadin(h MA
AddittO-Wcslry.
Hopfietd, J.J., L995. ‘"PalCent nreo^niciem computa-litro using airliün poícntial Ümd^g for stimulus tcprrrenlalitm/
wUTOBpp3í-3fiT
Floplield, JJ.l 1994, "Neurfins, dvnamics a^díoaupuiniion/ FAiwhm vnl.47, pp.4CM6, Fefnuaiy
Hopíirld, J J.t 1987^. ^NíC^irlí^i CtwnpUiíJlinns, 1 jogic, and Noisc?' JEFE//tJdrviLrJj^riüj1 Cu^í.tojíl.'í rwr .Vt^uru-j1 .V^íiiyj^Av,
vy| la pj^lQT-liL,. San ETíújjú-, CA.
HopfMd. JJ,, LM7h '-[.eaming al^nfithms and pnohabiEicy distribuí ions in íced-íorward and íccd-twcfc nctworkfi/'
r^"rftí AüfrflÑJÍ^edJe/ur ií/'Scdenccj, CY4_ vnl_K4, pp.8429-H433.
Hopfield, J J., 19H4. "‘Neurcms with graded respernse have collcci: ', c computal lotnal propcTlics like ihore of Lwo-JTLaCc -nrurans,"
¿f/Wjd jS¿?rÑJrli1jjl ^LúLfeNj1 oj1'5<d£Fjecs, Í--S4. vol.81, pp.3ÜH-E-3<JP2.
Hopfield, J.J., 1983- ,LNcural neL^oriísand jihyBical syslems WLLhímrrpentíúllteiiMt üüfflpuLaiiünal dbiliüiüs/ALicwJjjrgr
qf 'rftí ArjarrcMwri 4ccrrfcjnr d/ ftipsoes. IÁ£4, wL.79. pp.2 554-255 B.
HopticlcL J.J., and D-W. Tank, I98fi. "LompuOng wilh neural cireuils: A modcl,"- Scfcjfcc, ™l.233, pp.625-633.
Hoptield, ÍJ-^and llW- Eiinlc. 1935. Neural' compuCalion ofdecisions ]n optiiniEation probtcms/ií^I^c»/ C'L^c^nefícsP
vol.5Ípp.l41-L52.
Hopfivld, JJl-n [>X FednMin, and E^GPainw; J983- ILIUnLcarnLngbhas a scabLLizin^ efTecl i 11 wHwtjvc mcmnííei,’
VükW,pp.|3S459.
Hom, B.K.P., 1977. HUnderslanding intage intensitics/ vol_S, pp.201-237.
HíhiilIc» K_, M. SUnchcombc, and H. White, 1990. "Universal appnoymi'li.in ofanunknown mappLngand lis derivativos
using mullilayrr feedíunvind nctwürksr' Atjrrof Aífuurfa, yüL.1» pp.55 L-560.
Hornik, K., M. SlincEicombe, and H. Whíte, 1939. '"Mullilayer fwdfonvard nctwürJtE are univcral appnosimators/jVcwnaf
A'ehLUHfcr, vúlJ» pp.359-366.
Ikiueliii^, ]-[,,. 1933. LAnaly^ !i ofaeomplcn of sJ3E.jjic.31 wsrisbks inm ^i.cieipal cúenpüúenís/Amr™!
Fs^a^v, vol.24, pp.4 L 7-441,49ÍI-520.
Hubclr D.H_P 19flL £jw, Fra/n, crnJ Hrim New York: Scientifie American Librare.
hubeL D.H., andT.N. Wiesel, 1977. "FimcLiónal dütecftreofmacaqüe visual dflrtest^^raccfflJjngi úfffte Fcn aí &crrn:
B, voi. L 93, pp. 1-59, London.
Hubcl, D.lí, and T.N. WiescL 1962. “Ruceptive ficlds, binCurulur IrttHUlkm and funcional arehiífiCftire in llic tufa visual
Dudes,hl ÁHrrocr/ ü/’FArsjo/og)'. vol.1.60, pp. 106-154, LumJun.
870 ESrñi itx;x * fi *
HuberT PJ.19R5. “Prajecikfi pyrsuii,” ¿ifSAjfjj.fjLit, wl. 13, pp.435-473.
Hub¿r. PJ.,l9Al. jÍ/jÓniJ SftrJjjVjei. New YiJfk Wíley
Hube?, F.J., 1^64. “Etubusi esiimiiiiün uf locací-on paramclcíT Aunáis rf Mathwtatiad Statistia, vol ,35. pp. 73-101-
Hudl. D.R. 1997. "[.Mining fcom cxamplcs: Fram Hicory m poetice" Tnlflfíll J4L /997 /nff'rjaíuvwí CctnfWiCf
iVfirnfJ AfeftKflb; Hnuslon, June.
Hush, D.Jtj and U-CL Honnep 1993 "PrOgress ¡n nperviwd íwural natwurfo: What’s new since Lippmann'.rr JEEE Signa/
JWétjojíft^ vol. HJ, ppJ8-39.
Husti, D.R., and J.M. Salas. 1988. "Im-proving (he le-anung tuLc oí bjick-prüpagfllión svillb (he gf-adieiit ncu.sc algorilhm?
ÍEEF Jjtiemartwaí Cflufcmice orj Aíeunuftafnio/'b, vol. 1, pp.44]-^, S» D Cgo. CA.
Illings wurilk V., E,L. filasen, and l.C. Pylc. 1939. üie/rafijn' ^Cdrpiprrrrig. New York: Osfurd Univírsily Press.
InCralor, N.. 19^2. “Figure cutracLion ming an unsupervised neural nelwoik? JVírircrí CíJrtpüíírtdh, voL 4_ pp.98-107.
Jíiakkol-ii. T.. tad M.l Jiwdan, 199fi. ^Gomputn^ uppcrand lowcr bounds on I i krl iboods in inlracublc ntlworks? in C.
HorwítZ' «L, lf?^.tí/wp ufl UriCi^^ríJA' ftj Jfri/f-chi/ ÍJífrf/igenco. Portland, Or.
Jackson, ti. A.- 19B9 flP^ptCÜW^WMWwor Pljiqjhjcí vol. I. Cambridge: Cambridge Universlly Prtst
Jnckson, E. A., 1990. fltrtpftXÜW? qfMMfltasr PiJkrjriJot. vol .2, Cambridge: Cambridge Umveraity Eta.
Jack-sun, L.K.H.. 1919. "An arder of convincente Ibr some radál basü functions? JAf.4 Jbu/nof rjffjjaít, vol
9. pp. 5Ú7-5B7.
Jheksüql. J A 1975- C^.-=í/r¿2¿ Fteefiw^iflnqfcs. 2nd cdhion. New York: Wilcy.
Jacobs. ELA., 1990. ^¡ut DccOfTipcsilKW ThfoughCompulatmn ¡na Modular ComwctMfflist-Aríhircctuno;" Ph.D.Thp¡ÍRt
U:nvcrsily trf MuuchUMtts.
Jacobs. R. A., 1988. "Jncreiised nrtesof convergente ihnJugh leammgfale adapcaliflnrMewmí iV<-jMiyr+á. vol. I, pp. 295-307.
Jacobs. R..A., and M.l. Jordán. 1091. '"Lcaming pirLtwisc control slTuligies in ü medular neural ntlwurk inohilrrlura?
JEEE TíwiMCítonf cw Si .wau. Vfafi. ¿?fjJ Crfjcnacfjcs. vfll.23. pp.33 7-345.
Jiootet R. A.» and ML Jordán. L99L ila.competitivo modularcmmcctionisi ardhiteciwvT’^^^* V.-i.'.-.i1
Atwrsyprg Smtvny. vcl.3. pp.767-77}, San Macc<\ CA: Moqpn Ksufmanri.
Jacobs. k.A.+ M.l Jordán. S.J- Nowlin, and G E HiiHonJ99la. "Adapib e nifflluYel OÍ Local eyptrts/'Afeírtr/
vd). 3. pp. 79-17.
Jacobs. K..A., M.l. Jordán, and A.G. 1 Jarlo. 1991b L,Tusk doLomposition Lhrough compet liun in a modular conncrtíonisC
üTL-hiLL-eiuie. The whar and whene víhíoíi lasks," -C^rJ/rAr 5c¿7icf. val. 15. pp.219-250.
Jayanr. N.S., andP. Noli. 198< Huve/ánnj, Englcwood CLLíTs, NJ: Prcntiec-HalL
JayncH, E.T. 1982. "'Qn Ihe rationale afnuDíinium-cnlJDpy methods.” Pjocccíñ.1^qf-f.be f££E. vol. 70, pp.939-952.
Jayncí\ EPT, 1957. '"Informalion Lhcory and Aliniral morhanics," Mjnku/ Aevíenc vol. 106, pp. 62Ü-Ó3Ü; "[nfonnation
thcory and stalislical mechante II" vol. 108. pp.l7l-lc?0.
Juwinsíi, a H.% 1979. StactofEf ftaw.rcr owrf FWferiwg Tiraiyt York: Aeadcmic Press.
Jelinck. F J997. Srtíí.víj'cíjI MMwh J6r Ax^rín'wr. Cambridi^ M A MIT Press
JohMUOn, &.M.> L U. lKiwl;t. md D-M. Ghim.íiii^]i. 19^0. ,LR.íi£k-pcvipa^iiion Icaniln^. for rnuhi-layer FeídfbTw-iiTd ncuial
MfwofkK usingtlie coftjnavteiiadimt methMVRflportVCRL.-JC-104839^ Ijwihkc LivcníMnc Na:¡onal Laboratciy.
CA.
JohnBon. D.S., C.R.. Aiaüüíi. L. A M'cGeocti, udC. Schc^on, 3989. "OplimiHiion by simulaird annealing: An cipcrimcn-
lfl| cval nal ion." ÍJfiem/mis vx?l..17. pp.365-H92.
JolUña. I.T.. JÍRri fWflC^ptrf .4j|fllr.f¿f. NcwYwk; $pnngcr-Vqrl?g.
Jones. J.P.hand L.Al Palmer. 1987a. “Tbe two-dimensionaL apaliil Etrucbnof simple ncepdve ílelds in cat suiaic corles?
-Jrjrífflflf fj/ iVj zr.rrijrif.'i-.TR.iM.i^L: Vül 58. pp IIB7-I21 L
Jones. J. P. híiid II A. Palmer. 19p7h “An mlu JtÍM of ilie two-dimemi hhí G abor fiker modal off siin pie receptivo ficlds in
ut sItíMcOHtex.1" JrJN-rwííj/AfewistpAjtifdflüigi-. vúLÍB. pp. 1233-1258.
Jones. J.R.A SíajKNHki. and L.A. Palmer. 1987j "The tWO*dimeittiortÉl spcctral slrucruTc ofsimple neceplivc ñelds in cal
s1íiale c<inú!i.?.Júurj?ijJ ¿jf iVí^jTí^j^i.YfoJrj^i.: v(il. JSa pp 1212-1232
Jordán. M.L. 199-5."“A Flarisrical approach lodccifiifHLtrwmodclin^"fWMÍiífSwwtrt JCI/CcíJFfcJíñce
on r/jcofT. New Yori: ACM PrcR<
Jordiintl-1.l.. 19^h. ‘'AlirtEtórdynainL-cs and paralleljwri ina LViinicerionL^tiquchiiaLilLí chine? TírcE.'gAx/r^jprjrjcTyCtwr/éfc/Fcc
o/Wk1 C"oi[jrífíL<'¿cííjiíl'Spcfeíjí pp.531-544. Amher¥t>MA
Jordán., M.l. cd.. I9M. hj CjxrpJuc-rjJ1 BMltn: Kluwer
Jordán. M.L. ¿. Ghiibramam, T.S. Jakkolla. and L.K.. Saúl. 1998 'An irnrLHiuccivn Lo v^riarivnal methods foi gjaptiicaL
modelar In MI Jordun. od..¿mm!Íng jfi Gn^AícHf Mbde/y, Hüsron: KLuwei.
JordíUiuM-L. and El.A. JK0hah 1995- '’Modularand Hicrarcbica: I .caming Syslcmí? in MA. Arbib, ed., Tfirífcrndbonitof
flíiii.’t rjjínri-jZÑLf A'd'rjrti/pf>i379JR3B Cíirnbndge- MA: MIT Ptess..
Jordán, M.IH and R.A. Jacobs, 19M. 'Hícranchícal mixluncs of «pífll andthe EM íilgorichan,” A'crjín/ Coírr^rj/erfiorj, vol.6,
frp. | SI -2 14.
Jordán, M.1.hand ELA. Jacobs, 1992. ,-EiicrarchtcsofadajílivúexpertS,,L.4íA Tercer fe AbaraíJn^ixniHtfhM
vol.4. pp.9E5-992, San Maieo, CA- Morgan Kiivfmana.
Joscph, R.D.> L 9641. "The numbtr of Orthants in n-B|MCe InttrtttLtd by an s-dimensional subspacc,’' Tcdmicíl Mtihü d,
Projod PARAi Cortwll Aertmauiical Lab.. Bu fíalo. N. Y.
Junen. C.B and J. HetaulL 1991. -Blind sL-pumlion of sdutccs, Part 1: An adaptivc algorilhm bascd on neuroinnniíLk
KUtKtUR;" Srgraf Fnm'JsZng, vol 24, pp. 1-1-0.
J .1L.. M.M. Mcrzenich, and El.P. Killackey. 1983. "The rcorganizattnnof sorrisrosctisory wrlex íbllüwing pcriphcral
iwtve diimagc m idult and dcvrLeipmg mammals,"' Ziuruol /íci jíh' q/"Afeawc/fflWE, *üL 6. pp. 325-3 56.
Kailath, T.k L9M.. ¿¿irarS^JeHU. Englcivcod Cliffs, NI: Prcnliec-Hall,
Kailath, T.d 1974. \A virwofthrec decadcs-nf linearfttteringlheory,"1/E££ TrafWfJtíru^ryo//^,fijri^rni7í?.ir T6coft. vol. LI-2Ü,
pp. 146-181.
Kai larh, T.p 1971. *TUCHS appr-Daehlo dctcetion and cslimalion prohlcms - Parí I: DetermrnisÜC sigitak in Gaussian noLser"
ÍEEE TkttrtMOkMt q/V^íirwflfrcui JXrwy ral. IT-17, pp. 530-549.
Kailath, T., 1968. “Afl innovations approach tD Irasl-squares cstiniation: Part 1.1.incar fihering in addíthv wNte notsc,'"
ÍEEE Ínr/Tjflcrwrjj qCíiF/oflf-aric Confro/P vnl. AC-13, pp. 646-655.
Kalman. R.ÍLP 1960. ,kA ncw approach 1o linear iiltcring and predtclion problema" Ttwwffforu qf Jdííjtjq/q/'
jS-qíj'l EfigjjuMnng, vol. B2, pp. 3 5-4 S.
Kandel, E.R_, and J.H. Sehwartz, 199]. Fríncjpfts eíf.VewraJScrcnce. 3 rd mí, New York: lilscvicr.
Kan£ashJ.,T. Kohoiwn, and J. 1.absorten. 1990,“Vari-imlsof self-urgínizingmaps.,’/¿"£¿'7>UÑ.wcl,Jrwp.f om .VtTjm/ Vdtfuwjtj.-
I, 93-99.
Kanter, I., and H. Sonrpdiuky. 1987. “AíSOCiKlve nealI OÍmemciry wilhouE errurs;' Wprícii/fcvtaM voLJ 5. pp.380-392.
Kaplcn. J.L», and J A. Yorkc. 1979 ,LCh¡>.ii i c bchkvior ofm ulli dtmensiona I di flfcncnce cqual ions," ín H .-□ Pcitgen and H .-O
Wülker, eds.n frJrtfriciiwiffhfltvit'Hfttt/ EqwricMrj uarf4pjn¿uvf.r?itfLíom o/pp.204-227, Berlín: Springer
Kuppen, UJ^índ F.B. Rodríguez. 1098. "Eflkicnt Icaming in Boltzmann machines usin^ linear respciise Iheory?1 jVrwna/
CtwnpN/rjJÁur. vol 10, a ser Infido.
Karhunen. K., 1947. “Uber I intare methoden ín der WaJi^sclKl^lLchkcLlsTlKhn^Jlg1’, □fwifl/tif ^¿hfrwrr.uT- .SdeWtaHMtF^Puajc1.
SericrXI: MtrrJren»í4iK'«-PhvriüOt voL 37. pp. 3-79, (Traittl: RAND L'nrp., Sania Ménica, CA, Rcp. T-131, Aug. 1960).
Kartiunen, JLP and J. Joutsmsalo. 1W5. "General izations nf principal compnneni ansJyiÍB. opcimiziiliun prcblcms, and
neural ndworks^ Mnrraftfeftmdkr, vol.ü, pp.549-562.
Karpinski, M.,and A. Macintyrc, L997. "Polynütrii*| bnuiids for V-C dimensión tlfisi-gmoidal and general Fia litan neurona!
nelwoiks,"1 JbunuJ o/ Canijndar cifiJ Ji'.fkvH Acjídcf.v, to].54, pp.S69r I 76-
Kalagin, S., and E. McDcnnott, 1996. ''Disertminalivc tnining - Receñí prx^rexs inipeech nx-ognilion.''' in CJ4. Chcn,
L.F. E^au, and P.S.P. Wang, cds., q/ PiJirerd £c.‘-Cf^rJÍtiort¿¿íjíJ CnmpH/fr Ejyínn. Jnd edilion^ Singaporc: World
ScKfltífk Publishing.
Katz, B., 1966. AferMe. Aftcreíe¿uní 5j Mapíe, New York. MeGsaw-HilIr
Kawamoto, A.H^and J.A. Andcrson, 1985. ’A neural nciwftrk nu^lel ofrnuliÍKEíihl<-peT<xp1ionk,,'/lc/¿rFiTí'A£i/ogjefl1 vol.59,
pp. 35-65.
Kawato, M., H. Hayakama. andT Jnu], L993. '"A ÍDmard-imerse c-ptics model of reciproca] ccnnectíoftt bvlwvcn visual
ourlicaE arcas?' vcl.4+ pp.415-422.
Kayp J-+1992. "Fcaturc-discovery under cnnlestuaL suprnistníi using mutud informatiücii” /nJe^rírrwntry ^?rj?r Ccw/rfCFrcf
dff A'fNFYTj1 Nanvorfa1, vol. IV. pp.79-84, Ballim-Dre.
Kcajnt, M1996. ,bA hound on tfw CTW oí ero» vjlidaiiuai ming i he apprvs iination and cstímaLion ratea, with conscqucnccs
for 1he 1ra¡ ning-letf split/ xfc#wwtc¿j fe /AffWHcnfen /^ucr.^ÍJrg Srj/cr?u. vol .S, pp. 183-189, Cambridge. MA:
MET Press.
Keamsk M . inid L.G. VHiuií. Í9R9. "Cryptographic hmitattons on leaming Hocican fonnulac and i inhe flitlnnwa,"
Pmrívz/rng.r Bwfflfp'firtr 4whíi/ 4CJW Symywfeffi í?rj Jfrrory q/'CrwpÑ/úr^. pp.4 33-444, New Yurk.
Kcams, M.J., and U.V. Vazirani, 1994. .4^ femMfecrfett M CampHtarfeinu/¿eíiFvrúrg Tftcwv. Cambridge, MA: MET Press.
Kcchrioli^ G., E. Zcrvas,and E¿. Manolakos. 1994. “Ufing ncunent lu-nnjd ndwurks íbrüdaptivc tommun calionchanncl
cqualtzaCiorC 2£EE Ihuiracrfons twr Nevrof .VefwflHb. vol. 5, pp. 267-27A.
K.eclc^ J.D., 1986. "Hasans of aclraetiün of ncurat nclwcrk modeh™ in .Vl i/a-jJ VrrMY?r¿< ftr J.S. Licnkcr. cd..
pp.259-264, New Voris: American [nslilulc ci’Fhysics.
Kcllcr, JR.t 1976. *lnvern; pnbleQH," jfanyiaur AfaJfcjmrtnxrf iW^drfi/i, val. 83, pp. LO1?-] IE.
Kclsop A.H. Gancng, and T.FL Broun, 1986. ,fcElchbian synapsrs in hippocampuR.,n Proetfíí/jjrtfjí q/‘//rt Mtí/ow/
.frniteNB1 q/'.Seíffice.í. í.'.V4, vqJ.83. pp.5J26-33M
Ksind. M.B., ft Brown. and HJXl. Abaibanci. i 992. ''DeLermining mínimum tmbrdding dimensión using a gcümetncal
COUtHKtWDL1 PJiLiJía/íírfflwX vol-45, pp.3^01-3411.
Kürlirtn. P., and F. ValLrt, L W1 HRübustness in mullilayrr perceptrons;" .Yrura/ Camptírtr/j-arj. vol.5, pp.473-4B2_
KiikpalricK S., 19M. L,0p(irTnza1iern hy simularcd annealing. Quanritativc StW&H," AwnM? vnl. 34,
pp. 975-98*.
Kiripatnck, S.. and D. Shcrrington, 1978, “Inliniie-Tunged tnoddl of spán-fJtnBT EÉJíTÍíMV ffcwm Svrics B. wul. 17,
PP.4384-44O1
Kiripacrick, S.,CLDl Gelatl, Jr.,and MAVecch.. 1983. L,Qptimizaliwiby simulaled ajmcalLTig,,LSr^cmrc. wl.220,pp.671-680.
Kirsch.A-, IW6- -^J to MrtbBHfrtfaif H«jryo/AnCT'jf FraWer?up New York: Sprimgrr-Yrrlag.
KImk, S.Cb 1956. '"Rcpresentation oFevcnts in nenmets and fínile autómata?1 in CIE. Shannon and. J. McCarlhy, eds..
SrkJjiS.í, Princcton, NI: Prinoelon Umvrrsity PresF-
KmcntH, J.J97L o/ £"codL?mefrrcjP Mcw York: Macmillan.
Knudsov F•>• S, dul.sc, and S.D. Estcrly, 1987. “CompiítaJional maps in the brain/ ^jíunlJi1 Ñci^k üf AfeunwinK
val. 10. pp.41-65.
KocK C , ind Ir Segfv, cds., 1989. wrA*CWM¿ Afade/úrg: Fhüai m AfefHWjtr. Cambridge, M A: MIT
Prast,
Kocb, C . T Poggin, and V. Torre, |9B3. n,Nímlinear inlcractions in a dcndritic tree: LíKatizalicm, timing, and. role in
in formal fon Frr^t'ú'jirÑX.f í?/jVíifMííJíj/jlL'a^wrv cj/'Jcrvwítfi. t/S4, vol.80, pp.2799-28Ü2.
Koch. C.. and R Mídiur, 1996 -'KcurnmcHphic visión ehipsC/jEEE^wc-jrjírTi, vol-33, iickS, pp.JS-46.
KíihrtafcCn, T, I997l “ExptoflUion vtry large datahanes by self-íHganizing niípi/' JJW7 Afftmrttaiw/ CwyfenMC# frn
.VíN^j/ífenrtrtr, vol. l+pp. PL1-PL6, HfflHkn.
Kohonen J'.,1997bi-íc^-í^r^wnjzjTrj; 2nd cjitinn, ñírlhr SprfagH^Vüda^.
Kohonen- T., 1996. 'Tmergencc of invarianí-feilure deítCLCra in (he adaplivr-subspaec sdf-mganizing maps," Siofogical
Qrteiwffcíj vq|.75t pp.281-291.
Kohonm, T.J993. "Fhysiolo.ccal ¡inerpfflanon oflbeseiRcitjtaniHii^map alj$oriiln>CWeNnr^ M'mvr+j. voL6rpp. 895-905.
KohHfiU T., 1993- "T'-iiigs p«l havcn'l heard about thü Mlf-orga^i.-i-ig Íimp/" ¿i/j+c /EEE /nícmcrtionaí
GMtftnwiítpfJd rtnraf «miwifcy. pp 1147*1156L San Francisca.
Kohcmen, T.. 1990a L,Tht sdf-orgjnizing map,"1 PnJLínt/jTrgi íj/tfc AktfftWf o/" Eictíricoí úttd EJccfrunrcs Ej?g¿?rfen.
VL>LT(,pp-l4*H4ÑÜ
KnJKinen, T., I 990b. "[mprovEd yctrichií oflearairig vector quanEizalitm/" JEjK-Jíiúj/ MwW
,\úTh íínLv. vol. I, pp.5^5-5501, San Diego, CA.
Kobonen, T., I988u. “An iirtrodiicdfln (& neural eompuiínj? iVr-irnuf Afefhwfcf. vol. kpp.3-16.
KoJwnen, l98Sb ¿mr? 'iAWfatftaf .WcffK?n'. 3rd «JÍL¡onh Ne* York; Springer-Vcrlag.
Kobcmcn.T.JSSRc, The 4mhT pbúnetk !y¡K-*T¡ief.w votlli pp. 11 -22.
Kohorwn. T. 1086. "I.^rnin^ ^-ector quuHultni Íbí (uehíh hmojíi i: .i in? 7brtRÍCUÍ/í(7™-f ÍXflf-FvIóíM, Helsinki UflivcrMly
i>f TecbiHilotíy. Finland.
Kohcmen. T.. 1982. '“Sclf-orpanizcd íormat cm of topoiogically corrcct íeature maps,” volAl,
^p.S9-fi9.
Kohonen- T., 1972. "fonrclarion maírn. mentones,H J£E£ Íhutoí^bnu «i CarwpNfm-- vol. C-2 LP pp.353-359.
Kohonm- diul E. Oju, 1976. “Fasl Miipttve fcnhílion of uílhuEínalizing íilteni and associative mcniory in nccurrcnl
networiu for neuwi-lihí etemenur ‘-oULpp. 85-95.
Kchcinen. T, F. Qjar D. Simull, A- Visa, jnd J. Kangas> 19%. "EngñHTIlg applieaciLuts of ihc seif- orgamzmg map."
JEEEi vol.S^, pp.]350-1334.
Kflhonen, T., E. RcuhlalaL K- Mákisara. and 1- Vamip, 1976. 'AMOCiaUiffl mil flf ilMfles," Efoíygjraí Criemefre.T,
V0122, pp.l59L)6í.
Kohcmcn. T.,íj. Barcia,and R. Chnslcy, 19S8. '^laristiea! pademfKQpílHnWÜh neural nelworia: BendimarlcmgstudiM"
J£EE faaprMftonaí Lcw/tzipirp ñii Nea^uí Mftawfc «□! I, pp- 61-6R, San Diegus CA
Kohonen, T., J. KangaE. J- [.aakEüncn, and K._ Tnfkkola, 1992. ",[.VQ-«PAK: Th¿ !c:n-ii: g vecUN" iqu-iinLizaEini Prograin
Pac! aj^.” Helsinli Eniveraiiy of Toehnology, Fínlflnd.
Koiran, P.. and F,D. Seinrag, 1996. "Neural Mtworiu wilh quadnbc V-C dimensión;- fa .Vfrjrtj/
vol.fl. pp. 197-203, Cambridge, MA: MITPw-
Kolen-i J.F.,and J.E3-. Follack, 1^90. "tíaDkpcqpagalicmissensitivoEoiniiial cnndilions”vol4^ pp.269-281 *.
Kíilliín, S t y.nd D Anuturiou» 1989. ,LAn adapLive least squaTCE aLgorilhm for thc cílicicnr tninhlf of artificial neural
nelwüjks,"' fEEE Thwoctfw oq Cfrndfr ¥0136, pp.1092-1101.
KüíLlis. S., and D. AnaíLasiiou. L98K. "Adapcivclraning of mullíIfijer neural MlWttrfcl using A Leasl sqnarcs estimation
lechniquc-'" /£££ JíUeniafional fifam/ M/HW*Ir «I. I b pp.3 83-390. Í¡jn Diego.
Krlmcigürüv, A.S.d 1942. "Intcrpuhü-ün and wcir^potalion of Mac ühíit? Tándem sequenwsr Iriruliíed by ihe Rand
Corporal ion, Santa Mónita* CA., Apn) I Qfr?
Kcsko. 13., LOT7. Fuzzl Ejrgmcmjrg. Vppcr S;i - J' Rivrfh NJ: Preiuke-I Cali.
K.flsko, B., 1992. AtjrnfJ AfefUwfa fidrf ^nzzt ^V.r/euu. Englewüod CliíT^NJ: PrenLicc-Flall.
Kbflkah B_, 19S8. ‘Bidirrelional MUCÍativt: memoria," JEEE TrcTUír-icífí^ry cW Srjft'w. lifrw, ítfjJ Cinfrcnrr/rcj. vul.18,
pp.49-6fl.
Km.lamen, R, 1993. L,SirnulatiMB and implcmcncnlions t>f netiral nci works For principad conponent analyiH," EZcrPwírj
/íc/mf? J-PJ, Tampre UniversiLy oí Technolcigy, Fiidand.
Kr&iijvcld, MA, and R.P.W. buin, L99l. -Genera QCiM Ctplbllítbs OÍ rrtimrnal kerrid-bu sud networiu/1 M-RwRTfídM/
-forrjf roí I. pp.84 3-848, Sealllc.
Kthhwt,AH, andA_ SajigL-ovajini-Vincrntclh, I9M. LLftkienC parallel leamingalgünEhms tor neural nc!wvrk5,lhXifHim»
Al Ht^Fdr^j/íWHúJJíMj FrTXtfiíJÑtf Sl'.wíjis. vq!. I, pp_ 40-18, San Mateo. CA: Morgan Kauímann.
Krtimer, S.C„ I Wti. “Cocnments wi cansí rucdoc Icaming of recurren neural nclwnrkñ: LimiLBlions of recurrcnt caseade
COnrlatÍM iArtd ¡I ainiplc SOlUfliiC»^1' Trunxfic/mfiA r.i/r .VcHraí Arfu jíri-Y. Vftl.7, pp. L047-« 1049.
Knmer, S.CL, 1995. “Chi ihe compulBiíonal powef of ElmarbMyle rKUiml wtworiw," IEE£ Th^^crúiJw m ¡Vtaraf
A’^wis, Kd.fLpp. 1000-1004.
Kreys-tig, E , r-;S8 j4</raftced EtygfeMttfeg Afofeffidflfa 6ch ed., New Ynrk: Wilcy.
KrifhnamurEhy.A.K...S.C.Ahalt. D.E. Mellon, and PiChcn. 1990 “Nttmi nelworks fbr YtCtorqUMíizvtiauof speivh and
¡ntlgesr IEEE-JcWJT-i?/ C'f StItGMÍs4 r(tÜt jn CiJPimwíHCüIífijrx, vol .XB pp. 1449-1457.
Krr>iak, A., T. Lindcr- and C. LuguL, 1996 "Nunpflmiielrie rSIíiAéiíoH tnd cltt*^ffca1 ¡M USÍRg nadijl ha*™ Fumeímh™
IEEE TrcTFjscrci’íyn.v M Afetraí voL7, pp.475487.
Kufih । C.-M.i íind K. FfcnuJc, 1991 .'Xeinraipnceofkarinnj algcrilhmf widi ccfisUitt lotmbri p^’’ /EEE TíYur^ettaM
Afi'wncrf ^i>L2, ]jp.484-4A9.
Kuan. C.-M., K. Horaik,ind H. White, 1994. "A «Entfgence rernlt Inr L-cflmmg ¡n rceurrent ncu^l nclwprks" Afama/
Garjrpüícrfítfn. toI.ó. pp.420-440
Kutller, S.W.. J.G. Nicholls, and A.R. Marlin, 19Í4- Erewi Afautirt ft> ftaAt; J fr JAtf Fwr/ícrf c/fAc
jVcn^ids Siifcjw. 2nd ediLion, Sunderlandi MA: Sinaucr AMOdites.
Kullback, S., L9&41. A^Hmiiíán ¿rw/ Sfu/rr/úy- G loucestfif, MA: Pelcr Smith.
Kung, S.Y., and K..I. Dianianlarafi, 1990- **A ncunl nrlwork Lcarmngalgonthm t'or adaptive principal componen! citraetion
(APEXJ,"JEEEAJ^FrJdJjfl^ CflFj/írcrjccíJíXc^N.írícj. .Sjjl'lyA, dffl/S(gM!F,Jocr.™?j?. v^ol.2, pp.dóL-KM, Albuqucrque.
Kushticr, Hl.,-and D.S. Clark, 1978. fiwAMífc Jpj7jn>nN^™i .VrfAoJj/ir CcrimTajJwrfnjrí 6>rcíP5/ra/nerfí,i,5fevíu1 New
York: Spangcr-Xtrlag.
Lacoumc, J.L^ R.O. Arablard, and P. CdrtWü, 1997. StariMgutt rf SHperú'i/rjMUr fe r^r-Tc^rí^r <fe Mfisson
Puhlishcni-
l .antüJ, C-, I9S4. J-rNíürDijjéjvíjfiü/ íJpL’rífoFí, l.ondon: \-^n NoKtrand.
l .andíiuL Y.D., L979P Cflttfmí: Tke Wo.Jp/sjnncJj, New York: Mancel Drkker.
l .flúJí.uL 1 ..D., aiidE-M [.ifshilz, 1980. SkpJíjJfWAní /. 3rdedilion, London: Pcrg^mon PneHF.
l .aciFurd,O H-, 19SI rittnKtonandin H.L. Swinncy and J.P. GolLuh, edfi., /Avfí&A'rjüJUde Avftifrlfofa
Md rh- Trtfri.t^hir ¿o HfftataKe. New York: SprinircT-Verljig
l_3ngtKJ.tlimd GLE. I firtlon. 198 R, “The dível^pincni eif[hc liine-dclny ncaml nrlwnrk HJchíteChmfbf ípccch rcco^niti-on,"
Tochnical Rfiport CMU-CS-884J2, CanKhgi«jMdlün Univmiiy, P [isbwjh, PA.
Lapedts-, A., <ind R. Ftrb-et, 1986. LPrúgTa.nLinLaga rnaHí-utiy pmllel, wnputiliofi unrvíc^l *yvtem: Slhiíc Betavinr,^ 1h
A'crj/Tj? .VcEHTjrJL^ /tjf J-í*. Dentar-, ed., pp. 283-298, New York: American Ii^eíeuic of Physicfi-.
LtifsupIi J., und ti Lyik'hi [^*9, “ I :-<[ jiínchb siinulíunn and ihe indueiion of E.'ER: The sequcncc in whách sytiapscs anc
Btimukiitd decemiiiiís che di groe co which (hqr polsiiiate," ffcmcí, val. 4g9, pp,49-5S.
LaSalki J., »d S. Le&chelz, NewTforic Acfldimk Pn*$&.
l .í*t'|LnLY, 1993. E/Krrrírí ?.r^FYij>rjtJ .írr.Mjnd-africT .Wcffrür/v. / JVWÍS 9J, D^nvur
I .cCllu.^ 1989. "Cicncratizarion and ticruork design fitrarcgics^Tcehnkal Repon CRCr-TR-Ñ^M, DcpanmctUofCnmpurcr
ñciencc, UnivBisity ofToronlo, Cañada.
LcCun,Y., L985. '"Une proccdure d’appncntiFHagc pour rescau a fcuíE assymcLnquc_" Co^íj^ív-q, vol. 85, pp.599-6D4.
LeCun. Y, and Y. Bcngio, 1945. ,X"on^olu1ic™il ndworks for ¡mayes, speech, and time «ia* in M_A. Aibib^cd., 77ie
/fandbaat n/Aura and Al’ihuJ AtJnwfc. Cambridge, MA: MIT Press.
LtCia^Y^ B. Uoscr Dcnker, D. iHcmk-níon. R-E. Hüward, W. Hubbard. and L.D. Jackcl, 1990a. "Handwritlcn digit
rtCúgii iiürl ^¡1li n baük-prYiplgíiion IHCWoric* fe A'erjra-V /jr/brwrcTfrorj Pnicrn-fe^. wU, pp.39fr404t Sun
Maceo. CA Morgan KaufiPaim.
[.cCun,Y., [.. Boiioti, and Y. Bengio, Í997,-,Rcadidgdwcí»^ith tnukilicyer firaph ti^nsfLimwriWtwwiu^’/EEFJjrjír^jrjrtrJú!
Cn^/CFerjei? oh /íeÉMtiTfcs, ¿ywecA ¿uníÍY^piltí PíWííJfr^g, pp. 151-154, Munich, ¿lennany.
LoCun, Yn Bollou, Y_ Bcngio. and P. Haffner, L99E. ''Gradient-based Leaming applied to document recognición,"
a/"Ju JE££P val-86, a ser lanzado.
LeCun, Y> J.S. DsnktrLflfl<J S-.A. Solía. 1990. lLOp4iiníLhni:n d^magc/1 ilffrwKOJJitcííjhs.
yi>1.2, ppJSHUSW, 8an Macea, CA: Margan Kauímann.
LeCuih Y„ T. Karter» .and S .A. Salla, 1991. HSeecmd order properties of crear surfaces: Leaming l imc and general ization,”
/jtf/vflncr.Y jh .VjiuftrJ JtybrwMtfM Atw.'.rAfje Sv.Trem.f. vol. 1. pp. 918-924, Cambridge, MA: MIT Ptess-
Lee. D.D . and SLS- Seung, I "97. HUnsupcrviscd leaming by eorrwx and conic coding," dqXrwm/ fttffrmfllÍM
vol.9, pp.-515-S21, Cambridge, MA: MIT Pies,
Lvé, Ti 1997- Ccwri/wri(?n¿ Hrcri-ry if^/fcurjrwf.í. Ph.D. Tbcsis, Tech ni sebe Uní versitit, Berlín,
Gemuiny.
Lee, l'.-C., A.M. Petrrccm and J.J-C. Tsai, 1990. HA mutliliyeT íwd-íctwartl neural rWlwwk witii dynamiully adjustablc
strucEures," JEt'E J/ríf nrwrfona/ Ctw^frrence o/r SkTftvw jp Afcn. ¿mí Qtanwflter. pp. 367-169P Los Angclcs.
Lcc, Y. and R.F. Lippmann, 1990. “Pracliual charactenStLGS OL nóural DEtWOria and convenEiona] pattem ciasstíicra on
anificial and spccch problema," 4/Awei ín Ar«rai Jrt/i?™¿rífon Processing iys/wifs. val-2, pp.l 68-177, San Maleo,
CA: Morgan Kaufniann.
I .ee, Y., S. Oh. and M. Kint. 1991. HTbc ctfect of initial weigbts on prematuro saluration in back-propaga1ion leaming,”
Jdj>iX Cmr/érrnoeon .Vénto/ AfaMvdb Vol. l.lpp.765-77{J, Seattlc.
l .ce.Y.C. Cl. Doolen. H.H. Chao, GZ_ Sen, T Maxwell, J-t.Y Lcr. and t.L. Gi!esP 1986. -Machine leaming usinga higber
order corrciation ndwark," FAi'sreo, D22. pp_27ó-289.
LefebvrVi V.'.C .1991 Cibjer-r Ortentef Ai /hr /Erjo^iii fl/Mewaf Nc/hwíj; Muter^ Theui, Universiiy of
Florida. Gt&uvilk, FL
Leon-Garcia, A . 1W4 fttótóifíiy drtd flfflÍMl ftwowEfi-cfrícn/ fiqgfaHríqg, 2nd rdilion, Readiitg, MA:
Addfe»-Weitey
LcuntanEcs- [.. and S. Bílliñgs. 1985. "íñpuL-OulpuC paramelriú ittüdels fürnürtlLñeár sysiems: ParE I: Detcrministic nnnJincar
systrms? AuttHúJñNU? Árwnqff/ q/"Cúifffro/. nl.41p pp.303-328.
Leí. .¡i, A.V._and JCS. Narrndra, 1996. LCojirtFolüí"nonlirirardynamw;aL systems- using neural netwofks - Part [I: ÜbsrrvnbilLty,
identiftc-alion. and conlrol,lh /£££ Tmnicrííjc™ orf Y™hí?¿ jVc^wfa-, wl.7h pp.30-42.
Levin. A.V., and K.S Narendra, 1993. "Control of nonli-nrar dynflmital syslrms u-sing neural TirVworks - Control lábil ¡1y
and stabilizationC iEEÉ IrcrffMcfwns gít MtwttJ NtfWdU Wl A pp. L 92-206.
Lrvinr. M., 1985. Aícrn dffldJWtaftíM tíídort. NwYort: MiGraw-Hill.
Lewas, F.L., and V_L. Synnas, L995. Opírmí/ Cc?nfn?íP 2ndedilionl NrwYorft WlUfy {tnleracjencc).
[.cu-is, F.L., A. YeRtLdircfc, and K.Ltu, L996: "'MuLEtlaycrneuraL-net robot controller with.guarantccdtraekingpcriflcinancer
/£££ Tfwuactións cw Mnn/MrftMTfr, vol.7P pp.l-12.
Lichtcnberg, A.J., and M.A. Lirbcrnian. 1992. Íísu/crr emí Chaoíjc QpuHÍdx 2nd edition, New York: Springer-Vcriag.
Ligjit. W.A., 1992a. "'Some aspecEs of radial basis funclion approsimaCiDn." an rfpywxjMUtdOff TAmpt. /7kKttHK
JJ?JDir¡i¿,i!?i,rDiiii- SA Siingh, cd., NAID ASE voL 256, pp. 16J-190, Boston: ICluwrr Acadrmic Publishcrs
E.ight. W.. 19U2h ,hRi.igc ftmeti-.ms, sigmoidal fiinctions and neural netwüAs,1' in E.Vr' Chxjítcy, C-K- CbuL and LL
Schumaker. cds„ 4pp™™¿rfWÑ TAeori' K/J. pp.tó3-2O6P Bos-lon: Academie Press.
Lin, J.K., D.G. Grier, and J.D. Cowan, 1997. "Tailhfu.1 repmentaEion nf separable distribuí ion a,” Crinrpniufínn.
vol. 9, pp. 1305-1320.
Lin, S., 1965. “Cumpuler Solutions üflhecravelingsalrsmanproblcm,,,-^c//Si3f?/Ti JecAnrca? Jwmpi vflLUppp-23i5-2269.
LiaT„B.G. I [unnei P. TinaandC.L. Giles, 1996. "Leaming long-L-eim drprndenciesin NAfcX recurren! neural networksT
?EEE ThjJtiíZÉrirNW m Nttíraf MfhwAi; vul.7L pp. 1129-1338.
LindcuY.Á. Buzfl.and R M. Cray, 1980- ,LAn algoi :thm for tkvEurquanlizerdtsigflC/Ei'ETrnjiMcríDnr oñ CtNWMfEHijeajdf^tr.
wJ. COM-28. pp84-9J
Linsker R , 1993 "DefivingrtCtplr- e fields uing In Optima] eTKüdijxgcrilrnünC^rfíUJTCé's ú? A,ízjMff//n^jnn¿?fjrtrj Avk¥XR*A£
óri/í'^iy- vol 5. pp 9.5 3-960. San Maleo, CA: Morgan Kaut'mann.
Linsker, R.. 1990a. '-Ücsignirig a sensory processmg syslem: What ean he Leamed from principal componcncs MÍyiÜ?F1
rftf /HijtfrÑjfírtfjcr/-forrar ^>|fÍnEKC n-fl Aruj-ij/MtftWFibk vol 2. pp. 291-297, Washington, LK .
Linsker. R., iHOh.wSclt:-organtzaCian in a pereepcual Ryslcm: Hcviv nclwark models ;n"l irtfofffiutidn iheury may shed light
un neural MgMidlbMiJ* Chapter 10 ín Vad^rru BmjTt S.J.
Hammand C.R. QlfMU edL. pp.351 -392r Cambridge- MA: Mil Press.
Linsker. R.. L 990c. "Tcreepiual neural o^pidatixn: ¡Lpproiwhcs based 00 nclwork modcCs and informal ion theny”
/CcTrí'H'o/’AeHraicfcjrce. vol. 13. pp.257-281.,
Linsker R.. L989a. "An appttraEian of the principie ofmáximum infbrmation piwrHlñn 10 linear sysCerris,H fu
frWi'SJíng Srs-fc'rnx vtd. I, pp. 186-194. San Malea, CA: Morgan Ksufmínn.
BrauoGRAFiA 875
Linskcr, R_, ]989h. ''How lo generarte onJened mapa by mminuzkng the mutual information hdwecn input and Qu(pul¡
sígnala*” Míwjtíí wL L pp.402-111.
Lirisker, R., 19JJ8*. “Self-organiiíticn ¡n a perceptual nenvorV CtaptM; vol .21, pp. i OS-117.
Lindter, R.< 1988b. 'LTowírds ari «ganiang principie Tora laymd perceptua.! network/1 in Atara/itytaiMtiM Procrarúrg
SpttH». D.Z. Andttwn, ed.< pp.48 5-494, New York: American Instituto of Physits.
Lmsk-rr, R_F 1987. ""Towaids nn ojgptnizing principie for percepción: Mrbbian synapses and 1hc principie of optímal ncuraJ
cncoding/ Á5.W JteidarcA Ae^orr JFCJ2E2Q. IBM RrsramhFYiuktnwn Heighls, NY.
Unsker; R., 1986. Trom hfl^ic neftvort principies to neuraJ arehilecture” (series), o/ rfií Nd-Jj'tíripy/Íeíjffc^i' c/
&ÜH«> üStf, voLSJ, pp.7508-7512, 8190-8394, 8779-S78J.
Lippmann, R.R, 1987. “An introduation to compuling wtth neural neis,” JE£E ASSP vol.4, pp.4-21
Lippmann, R.RP 1989a_ -,Rcview of npuraE netwcrks for spceeh rteognition,” jVíirrtí^ CúmyiNürttan, vol. ], pp. ]-3ít.
Lippmanu,R.rn 1989b- ,LRattemcla5Sificfft¡Qn uiipg neural DtiwwiV J£EE w¡LZ7app.47-64.
Linle, W. A ., 1974. ‘The Bürta» of perriítenl tintos in dw bonT JMoKtaw, wL19, pp. 10 i - i 20.
Liule, W.A., and GL. Sltaw, 1978. "Analylic study of 11>c memory sterage capaeity of a neural nctwmV MfeíJbeiiaJtad
írásrreflcrj. vül.39, pp. 28 i-290.
Liule, W.A., and C.L. Shaw, 1975. "A siarisrieal theory of short and long, term metnory™ Aduitara/ fiWqgy; vol. 14,
ppjií-m.
Livewy, M.? 1991. HlClampíng in Bollzmann machines? ¡É££ 77¿™arfwns tur A’euraJ Networks, val. 2. pp. 143-148.
Ljunjr L.? 1987. MtagtatftaJt1 TSmft/>r /fre Ltotí Englewood CliETs, NJ: Prenlíct-Hall.
Ljung, L.i 1977. "AnflJysLR of rceunne stachsstic algoriüims" fEE£ TrartSücfionr tw Caít/raí. vqI. AC-22,
pp-53 L-575.
Ljong, L., and T. Glad, 1994. r/ZtyHOfltfc EfiglewMKJ ClifFs, NJ: Premití-Hall.
LkytL&R, 1957. "LeasE squares quanrtizaticn in ROM “nata técnica nao-publicada do Bell Laborawri«. Publicado postr-
riwwienlc sob O momio titulo cm /EE£ Trau.wcXhww üh Jtt/¿FfflüfraíJ TAeon1. vol. ]T-28, pp.117- 115,1982.
L04 Z.-P.. M. Fujila, and B. Rayarían,. 1991. "Analysis oí ncighhorhood inleractLon in Kjohnncn neural nctworks" 6i¿-
JhtfmartoW AndW Fr^ísing pp.247-2^9, L« Alamiins, CA.
1A Z.-P.,Y Yu iir.d B. Bavarian. 199J. "Analysis ofthc convergente prapertM of topology prcscrving neural netwnta;”
I£E£ TrattsacXioni ofj NeoraJ NeAvarks. wL4> pp.2fl7-220.
Lockery, S.R_? Y. Fang. and T.J. &rjnow3Jdh 1990. “A dynamical rmmjd MtMHk m&díl OÍ sin^rirrwlOrljnnsfijnnatiuns in
the Leechr /níemo'J'júJMf Gw^&rtn« tw? Nraral NchLOífe. vol. I, pp. 181-188, San Dicguh CA.
Loíve, M., 1961. PraÍMrbihTy ÍAeürj'. 3rd «lÍLÍan, Ne* York: Van Nútifind.
Loncnlz, G_G.n 197&- hThc Hth problrm of Hir>ert.’,'Fracccirfprgr jTt /Jnrt Warfrcm-aflcj. vol. 28, pp.419-430.
LoncnlZ, G-G-, 1966. ^/TíinarjaiaJ'jrN! ¿^r Funefrans. Orlando, FL: Holc, RinelwrL A WinsboiL
Lüríriz, E.N., 19fi3. ^hstoraÜDÍtik non-periodíe flows,”-AjÉrrrtfl!flf^fJTJ¿?sp!jer¿e Scja^es. vol.10. ppJ3ü-l4l,
Luwíh D., 1989. “AdifMive radial basis function nonlincariliM. and Iheproblcm ofgcncrHlisalion;" Fr-irf f££ JnferrjffíJüFJd'í
M ^rr¿/?rí¿rí Neurcií Nefworki. pp. I 71 - i 75. London.
Lom D., 1991 a. lhWhat have neural ndworics toofler stalrlical paLLcm pracessing?" Pwcedrngs<i/;hcSP/E Con/crcncc
Xffepfrvtíigwípp. 460-471, San Diego. CA.
Lüwí, D.h 1991b. llOíl llw iierative ínwnin ni RBF ndwarks: A stalislical inlcrprciation.^ Seronrf /££ ynfernffn'üna'?
Oíu/LT-L Jkv on drttyfctaf NcwraJ MAwrte pp. 29-3], RoumcmouLh, Engjand.
Lowe? D.? and A.R_ Wfcbb, )99lt *Tlme urbes prtdidi&u by adaptive neíwoffci: A dynamical lyslemi pcrspecti ref f£E
Pt&MeJütys íLoñ¿fon¿ AifíFr voL 118, pp. L7-2J-
Lowc, D_p and A.R_ Vfcbb, 1991b. "OptLrnLzEdfeaEurecstractiüo und [he Buyes cteeisLü[liiL fecd-fortvárd cl&ssirierncCwvcks?*
/E£E TFartMeftflíis tw Fu/tern amf Msriíw ^rrtffigirritr. FAMI-13, 3-S5-364.
Lowe, D., and A-R- Wcbb, L990. "T¿sploLting prior knowltslgr in nct^urk úptimlailon: íiü illuSEffilion frMi medical
prognosis" Nerworfc. vol.], pp.299-323x
Lowc, D., and M.E. Tipping, 1996. “Neurobcale: Novel lopographic fruLurC c^LrícCiún using RBF networti;”
FroeeMÍng SVsícjfisp *oL9, pp. 543-5^9, Cambridge, M A- MIT PrCSS-
Luenbergcr. D.G.P 1984.Eúrear ffmiMjFi/jTrcar 2nd editian, Reacing, MA: AddLwn-WcRlcy-
I u¡,H_C., L 990. "Analysis ofdecisión conrtour ofncmal neLwork wilh sigjooidnl núnlineftriLy” GNfftafflK
üti NfUrtj/ NfrH'OMtE. vol. I, pp.655-659. Washington. DC.
Luo, Z., ]99L ’XTn tbe convcrgcnce of thc LMS algonLhm with adaplivc Iwming raLc für linear ftedfcirward nrE^crits?1
jVf^raí Camptiíffnon. vol .3, pp_22ó-245.
Loo, F., and R_ Unbchauen, 1997. j4ct?/j'ctí jVcurat ftweixftw NcwYorií- Cambridge IJnivc-nicj1 Press.
LuCCrrl I, S.F_P 1997. “A uoiíínJ rheory úf dwtsily mcdíls and aucü-enroders," TícAwcíi/ ffqpfltr 97J0X Dcfcncc Research
Agency, Círcat Malvem, UK.
Luttnell, S.P., 1994. MA Bayesian analysis of sclf-organizing maps/1 Mnira/ CampirfflffWT. vol.6, pp.767-794.
I । i । < L S. 11. I Wl fl. LlCüdcvwtwdcnsily in tnpojjrapli i_: mapptngs: Scalar case,11 f££EThansartióm mMtvni/AfanKw4%
wl.2. pp.427-436,
l.uttrell, ¿!R, 199 Ib. "SdtfltperviKd irainingúfHeiiKhkil vector qmntlzn/* Jínd tomarioMÉjí
AAnral Mnwdbi pp.í-9n Houmemouth, língland.
bullidI, S.F-. |98?a. "Hierarehica! vcelor quantizaEiün;' /FE Pracw Jíqp val. 11& (ParL I), pp.4Ú5-4l3.
Lunrell, $.P., I SOTb. '’Sclf-nqjaiiization: Adcn\ation ftom firslprncipleofacLassof Leaming algarilhms,1 "/£££ Cm/erence
Wl Mntraí Jftftwrfa; pp.495-49IJL Washinglon, DC.
M.iaSíu Wu |99). hRoundB for thc compulaliíMul powerand LcammgeonipLndly nf analog netiral nets," n/ffre
25f 6 Xnnitcri ,4CM 5)w|pm^MK rih TJttíyj.i-i- ú/-üiiítptjjwj pp 3 35-344, Ncv. York: ACM Prk
Mubs W„ 1993. -Vapnik-Chcrvoncukis dhnmfon of neural networksr in M.A. Afbib, cd., Fite ffaíjrfñflút ü/ Jrarir
.j .-/Nnraf jVcjMxarV Cambridge । MA: MIT Press.
Machi E.i I865. L,(rher di< Wirkung der raumlichtn Vcncitung des Lietnreizes auf dio NetzhauL L Sitzungsbcrichlc der
Mathemalisch-Nalurwissenschafilíchcn Klassc der Ka-iwlichcn Akadcmic der WisscnschaEtcn,” vd.>2, pp.303-322.
MacKay, D, 1992a. “'Daysían interpohliMC Cy^rcrJirfícrJ, Vül.4, pp.415-447.
Mac<a>', D-i 1 W2K*A practica] Bayesian framework forbairk-propagaliQniHMw-LirksJ" Ahnra/Ct?ffjpjFfüritNL wLApp.44S-
472.
MaeKaVi D.J.C.. Jnd K.D. Milita [990. "Analysiseif Linskcr',fi fiimulalicms nf Hehbjan rules * AVwraí CbfliprriaíteM, vüL2,
pp. 173-L 87.
Maeintyre, A.J., and E.D. Sontag. 1993. "Filness rrsults for sigmoidal ‘neuronal’ ndworks,"' F/ucecrfj'^s rfte 25j/i
jlrtHtjd-? .íCV JvjFipüíiuHrt ofj Nwry o/ C í'mpwffffg, pp. 325-134, New Yode: ACM Press.
Macíjucen, J., 196?. “Sume mdhodh for rLassificaticw and analysis of multiv^riale □bsm'ation?1 in ftwecrilrnj^ o/rAe JíA
¿tapeta1 ¿wMatAffnflAcufStatirttes¿?ndPrafrabríín'- L.M. LrCun and J. Neyman, cds., vol. L, pp.281-297.
Berkeley: UniversLty úf California Press.
Madhuranath, H.., and S. Haykin, 1WB. ILlmprevrd Aclivalion Funtlions for Bíind Scparation: Ddails of Algebra: l
DcrivationsC Cffí fn/erna/ /?epo^? A'¿?. ÍJÍi Communicalacms kcscareh Laboralory, MoMaster UnivErsity, Ramillón,
Omario.
MdWMÜd. M.A., and Q McadL l9KÍ, HS¡lioan retina,"' in4rjü/üfl (C. Mead}, Chaplcr 15. Reading.,
MAí Addiwri’WcsIey.
Mandelbrot, 13. El., 1982. TAí Sm RmcÍMíí: FrteiHM.
Mañé, R., E 9J¡1, 'Xhi ihe dimensión of Lbe Dom¡ract invariant stEs (rf ccrtain non-linear maps?1 in D. Rand and L.S. Young,
cds., Ehvwrpikay amí TbfÓHÍc^cf. Lectura: Notes in MachcmStics, vo]_8M, pp. 230-242, Berlín: Springer-Verlag.
Marr, □., I9B2_ J7írojr_ New Yoric:: W_H. I rremai: and Company.
Martineta, T.M.. H J. Rilter, and KJ. Schulten, LWft '"I tirrc-dimensional nmral nd for leaTning vlsuoonolaTcocirdinatiDn.
OÍ a robot arm.,n JEEE ThtDwfhuu o?j Abura J j\rcJ>i wir, vo L P pp. 15 L ‘116.
Masón. SJ., L953_"'Fcedb3c-k Lbcory-Some propertiesoí'signal-ílcFwgraphsr1 ÍYwecrfrjrgro/j'Ar /nsfiJuíí o/Kíkíw tírgíneen.
vol. 41. pp. 1144-1IH.
Masoni SJ., 1956. “Fttdbldf thwry Funher píoptnies -úf Mgn&l-Étow grapbsJ" qf^^e Aurihríf i?/-íac/jc?
Eo^íriccfr.Y, 44, pp. 92H-926.
Maybtcki E*.SU I9K2. J|/n^rJí, E-íHinyrrzm, é.i.-:/ wl2^ NüwYüik: Academic Fw?
Maylwckn p,5.1 1979. .frtthuwfcífríLftíü, Esriimirrófl, ¿tjícj1 Cmh4 vnl.l, New York: Acadcmic Press.
MnZáik^i P K- 1987 "A :n.iilicin:ii:¿31 modíl rfthf Eíh L i: ;ir.n machine," JEFE FInf fitttfltdtfM&í Ca^r/r^t'ncc ou? íVcirrof
Nefworte. vol. 1 [], pp.]57-1 ti3, San Diego, CA.
McBridc, L.E^ Jr., and K.S. Narendra, 1965. '^Oplimization of timc-varymg systems,” /EEE B-arutu^nriní pn AUoftWíic
Crttffroí, vol. AC-LD, pp. 289-194.
McCullagh, P., and J.A. Ncldcr, L9H9. .WnMl 2nd edición. London: Chapman and Hall.
McCulloch, W-S., 1988. Jjbrcfffs o/Afdnrf. Cambridge, MA: MIT Piras.
McC^ulLochu WA.índ W, PÍU, 1941. **A lugical cakulus oflJie ideas imrnanenC en nrrvmisartivity,"
Rúsp^vfcs1! vflt.5, pp. 115-133
McFlicec, RJ,, Et C- Pc^ntr. EJL Rixlflftlich.ind S.S MsnkatesK 1987. "'Thecaplcicy of the HopfirldasMJcialivc memory/'
fEEE TVwuatiton tur Aybrnutffoft wL IT-33P pp.461-482.
Mel-athlan, G.J., and K.F., Bufbfd, 1988. iWf.rftíre jWctÍc/j.- /q/cnenccanJiípp^jbjntwts fo New York: Martí!
Dckkcr.
McLachlan, ü.J., and T. K.rishnan, L997. Efe¿- EAf4f^wj7Ajn nú New York: Wilcy (Inleracimcc').
McQum, J., 3967. “Sane rmnhnds fnr classificatLon and analysis of nivIlKarííte obsertíliúnsj' /Yoceerfrr^'j o/ rite
StffifalAgf 5vrnpaj/um on ,Wariter™tic¿ri írurúrtej úmJ Fmñafrririx vol. 1, pp. 2SI -297, Berkclcy, CA: Univcrsity of
California Press.
Mead,C.A_h 1990. "NrurümüqjhLe dectnníc syslcms-" jRnM**írjígJ ofíte AtíJífírtf </ ElcrtrráJ crmf EJcclnjírksEfíEÍncm.
vd.7S,pp.L619-lS36.
Mead. C.A_, 1989. XjeJdj HUdTdndAfamrf iysfcmj, Rrading, MA: Addison-Wcslry.
Mead. C. A., and M.A. Mahownld. 1918. "A silletín modcl ofrcTly visual proccssinEi/ iVtrmrf A'c^lü/-^, voLI h pp.9l-97.
Mead. C.A., X_ Arreguit, and J_ Lazzano, 1991. "'Analo^ VLSI modcl of ^nwural. beaniig," /EFE frniuacriáos ofj Jtairo/
jVrni^HLf. vol.2, pp.232-2"!--.
MccklenbraukcT, VA, and F. Hiawalsch, eds., 1997- TX iHgrjfrDüftiAvflíwi. New York: Elscvicr.
Memmi. ] 9H9. HCünnectionism and arLi ficial intel hgence? Afewv^Mmes "Í9 HExHUk^ ofj Aci/raJMtfuivdb
dÑ¿f ¿frjN>^7^fie¿rfJürii. pp. L 7-34, Nirncs. T rance.
Mendtl, J.M., l995.¿UWfflr Jfl£rfteMten7AwnjJ^' C<Mqwu/H?üjj^Hs<nu/C!m^v>/r Englewnod ('lillk
NJ: Pividiíe-Fíall.
Mendcl, J.M., and R. W- McLaren» 1970. LIRe¡n(bfvefnenb Icamrag conlrcl and pflMcm recqpulion syslems r in Hí^priW,
Ltvmr^g. ltwÍftrfJt'm íw^mrívirSvóR'mi" wl 66,J.M. Mentó and K S. Fu,«ds.tpp.287-3I8,
New York: Aeademic Press.
Mefinon. A_h K. Mchrotra. C.K.. Mohán, and S. Rlflkl» 1996 “ChüTiHlcncaLi-ün of a class OÍ sigmuid fimflions ^ílH
applicatL-nns to neural Mtwditartaw'fl/ A'cnktfnl'i. voh 9+ pp 819-835.
Mcfecr, J., 1909- "Tuncrions of pOíiLivc and negativa type, and ihcit connecílon w¡ih thc llwüry of inlcgnil «lualiuns,'1
nwiw/JMi tjfxAe Pfiihsup/iíca/ SocrrJT vúL2OTh pp.4 15-446.
Mcs-iilam, M.M . I9U5. "Attvn1ionhcoiifu¥ioRül líate*. and nugkcC" in Wncrp/c.vnEJc^NTr-rjnj/A'crJA-J^Jgn M.K1. Metol-íim,
cd., Phi ladclphia: F.A. Davis.
MeLrapDli.5- 14^. A. RoscnbLuth, M. Rüwnbluth, A. TcLIlt, and L Tclkr. 1^53. "Eiqwiliomí of State calculan* ms by fas1
eomputing machines/ Jbvnu/ o/ Chemfcu/ Fr*?vjjlcfr yoI.J L pp. 1087-1092.
Mhaskar- H.N._ 19961- "Neural netWOfka foroptimnl apfnoximatcon orsnUMthandanalylic ftlttCtLouT A'cw¿r/ CtiwrpN/íiJj'™.
vd.B,pp. 1711-1742.
Mhaskar, H.N., and CLA. MícchelCL 1992. "AppTusiin^taun b) jíupcrjHijíiriMi of si^moidal and nidiaI buü funtlionií/
-Atañera rn .íppfkd iWcrf^cmerÑcj. Vúl.l3_ pp.350-373t
MiccheJIi, CjV. L986. "'Interpolación uf watLervd data: DktMCe mairica and candiliunally positive definito fimctions?'
CtauftiKtiw vtL2. pp L1-22
MlÍrrP D.. A.V- Rao, K-Rose, and A. Gersho, ]99fi. "A globíl optifflittkLúnltduiique fcif SlfiCÓ'-.eíd Cla^íificrdísignr /EFE
Trffjrj-acrránr dhi Sígm? AzjccwjTte. l'olJ4, pj>3IOB-3122
MÍIICR K.D., J.B. KeLLer. and M_P. Strykcr, )989_ " Ckiiljr deminancc cnlumn developincnt: Analysis and simnlaLÍon/
íefrwc. ^qI,24Jb pp.605-ci],S.
MiLIúf, D.rand K. Rnae. 1996. “Hicranchical. un¿upcrv¡Kd leami nu w ich grawlng vía plus? tranELtionEr1 Afeara/Cpi^aMfcm.
mi, S, pp. 425^50.
Millcr, D., and K. Rene, JÍW. "'Combincd seurec-ehannel vector qu-anlizatiem usLng delcrministic annealinj'/ /£££
Frtrticdcddrtrt.f iJJF rüftJFJtuFiJídJJrNtf. vol_ 42, pp. 347-356.
MíIIer R , 1^7. ^bepnKntltion üf hcrLcr temporal psttems. Ilebbian BympM^ and Lhc- Lcft-bciniKphercdnmi nance for
™^ni[iüíir'rtjirtoWpJpjx vqLI5, pp. 241-247.
MiíLai, ArA-h and R.J, Williams, L99Ü. "'Back-propagaiion hcuri -Lies: A alud? of 1he cxlendcd deha-bar-della alEonthni/
/£EEJ^r^hjrieFJd/ttavC^j/lwfjíc on Afewra?Afemw4rr vol. I. pp.595-MXL San Dic^o, CA.
Minsky. M_l.., 1986. Socicty ül Mind, New York: Simón and Schuslcr.
Miíuky. M.L., 1967. GM^nmrián? Anteo^/FjtfnteMkJWíks1. tn^Le^Dod CliOs. NJ: FrcnLiec-Haíl.
Minsky. MI.. 19&1. riSLepE towtide aflj-Ticial inLtl1]ge^cLL., Erc^c'iv/mgs /Fr.rfííjrfc E¿t4íü £>iirri?wr. vol.49. pp.
8-3Ü (Rciinprcsso cm: Feijjenbaum, Eí.A_, and J. Fddman, eds.. Gbffptifien d?rjJ pp. 406-430, New York:
McGraw-HiLL.)
Minsky. M.L.P 1954. "Thcory uf nrural-analog rcinfoncemenL syslcms ¡ira! lis applLLatiDn to thr briH -modet problcm/
Fh.D. thcHis, Princcton Llnivenity, PnnceLond NA
Minsky. M_L., andS.A. PapcrL 1988L tarqrtftw, expended edición. Cambridge, MA: MU' Press.
Min5ky+ M.L.. and 5.A Paprrt- 1969- Cimbndge. MA: MI i PrtSS.
Minskyi M.L.l and O.Gt Sdftidge, 1961 -|Aíiniin£ in random neta/ Tfreon.-.
Lofldcn: Buncnvortht
MiiehcEL T.M., L997. New York: MeGraw-Hill.
Milchison. G., 19M. "Leaming algorilhmií and neLworks ül nrunony/ in 77ie ONfyiuriAtewwi [R. DurtiinjC. MiaEL and
G. Michison. eds). pp.35-53, Rwdin^. MA: Addison-Wrj¡lcy.
Moller»M.F. 1993. “A ^alcd«(^|mite^íd ¡ínfl iluTari iln» fur fasi superviví lendng»" iVcjíjít/ jVc/utj^. VDk^pfkSlS-SM-
Moody, L. ímd C.J- Carfctn. 1989. -'Fast leaming in THtWfki ef L-neally-tuncd prnccssing unics/ .YíTj^j? CMjwrJjFfrrtHr.
vihlJ.pp^SMÍM.
M-ondy, J., and L.Wu. 1996. "'Optimizarían oftradmg syítems and portfolios/ in A. Wcigcnd,Y. Abu-Mi?sufa, and A.-P.N.
Elefcneí, eds.b Drajjbn TecAna/tfgrcsjtxr /‘¡fjo'^cjlTJ1 iffgdneerfflg, pp.23-35, Singaport: World Scicnlific-
Moody, J,E., and T. Rógjrvatdswn, 1997. HISmootlr.ng negularizrrs lur prpjective basis íundion ndwarfcs,11 Áhjmcfl ¿n
Abura/ Fn?cv?jsj>rg Snícm. wl 9h pp. 585-591.
Mr?ray, N., 19S9. “AWttiw ín dícboti^ I¡stcningi Aflectivc cues and the influencie af instructions," JbjdFFJj! úf
Fjir^úJúípí. vol.27, pp.56-60.
Morgan Ni and H- RaufLard, 1990. X'fmtinunuE spccch recognición using niuLtilaycí [rercepírons wiíh hidden Markov
modelar IEEE fiUmaffoMf Cüriféjüflce rtM jtowrtfls; Sjptttaíl MÍ Sjffrtfl J /’íwííír^ff, val. L. pp_413-416, Albuquerque.
Moriia. M.a l99?. ^Awctatiw memciry with nonmanotonic dynamLes,1' jVfKra! MrfuwJj; val.fi, pp.l 15-126.
MDHnvaV.A,a 1991. .VerAnif/n#1 J//-/bsarf Fruite/ttí, Boca Ratón, FL: CRC Press.
MgfsCh P.M.ind H-Fcshbach, 195?. 7j. : r-u-,-,:,-,:' Pfrr.rá.r, F'.irt 1, New York: McClraw-Hill.
Müztrr, M C.i I994 "Neural íKI architcciures for temporal sequcficc prnccssing/' in A,S- Wcigcnd and N.A. Geruhcnfcld.
cds., JJjire Senes PftdtaÜM: firtCdíi^rg f&c Firfujv tfnJ UidmAMdbv ttí ftxl. pp.243-264h ReacJíng. MA:
Addisufi-Wfeakjr
Ktpicsos. G.J., 1990. ,LChíWs in bfiin fnncüon and thc prohkm of KnAtHmarily: A conmcntary” in Ctaw M Arata
¿Mic/jan. E. Basar, rd., pp.l 62- L76. New York: Springcr-^srlag.
Müllcr. El, and J. Reinhandt, 1990. .VfrwoFifc5.-4n Jff/raJjFcn¿wi, Neiv York: Springer-Verlag.
Mullir, D, and Cr. l.yneb. 198S 'Lw^+tq :*otentíaliun diñorentially affeets lwo romponenls of synaplic responses in
hlppacampus,” ?/£ * ¡Yí.c v ^¿^JHyc/StJíFicís, USA, voLU-J^ pp.9346-9350.
Mvmforü, D., L994. "Neural nn&-'r.t L-rc., fri.- (ratt-cTn-theorette prablcms/1 in C. Koch and J. ftavis, oda.. Lorgr-Sco/t
Thwrio <¡/'iAe CrtfÑyf, pp. 125 1 «'SÍir ükc- IM A: MIT PrtiSH.
Murray, M.K.t and J.WL Rice; 1993 Djffi pi nbd OÍMWrty onjNt* Yúik: Chípman and Hall.
Murlagli, H.. and M Sil-andera, 1978 i. d.'gfr-1 i:a IrI it.i-- i- ly wnsCrtincd api i mi-wiricma" AíniJrcwfteflJ fir?gn?m*o1.14,
pp.4l-71.
Musrlli, M._ 1997. LOft canwíígwKe propenies of poeta al^úfiihm/ /EEE Duuw^aKf í^t NtwuiNtfMribi val. H, pp.
623-619.
Nadal, J.-R* and N. Pat]ML 1997, ,LR<dtindfiíiíy pedudion and iudcpendent compneot analyxlaL CondiLions h tumulanis
and adaplive apprMúhíS/ .Vinar! wl. 9,pp. 1421-HSfi.
Nadal, J.-P., and N. Purga, 1994. "Nl-ni inear neurona in the low-ncisc hmit: A Factori3E€0dcnLax¡nLÍzes Informarían transfer,"
Afernwt «I. S+ pp. 565-58].
Nadaraya, L.A., 1965. "'On ".inr:r:i: \ :r; cslimaCrun of dcnsily fumílions and regresaron tunes," I^coft p/'.PrafrafiiÑrv
ojuí ib 4f^culfauu, vol. JÜ, pp. tS6-]90.
Nadaraya, EA-. 1064. _,C)n estimaling irgression,” TAeory ¿?/ FmfeaÍKVdh' rK vol,9, pp. 141-M2.
Nafisly, L"., N. [n(ra1orLand D. Homp L997. "□ptimal cnsembtcaveragingofneural nelwoits,” vol.fi, pp.2S3-296.
Nakano, K., L97?. /AsROCLatím - a model of assocíative mernory/ /EEE TraíisacotNFS on Si iiím.?, .Wdítr jjnJ QqfrtHMtftar,
wl.SMC-^pp.380-388.
Narcndra- K.S., I995. .Ueuraf AAHmdb_í?r /dcnff/írarjCT? Cbwml N1PS 95, Tutoría I Pnagram, pp. I- 46, üerwer.
Nanendra. IGSta, and A.M. Annaswamy, 1989. Sftji/cTfc/erpfri^Englewood CLiíls, NJ: Prvntiirc- Ha!l_
Narendra. K.S., and K. Parütósarailry, 1990. ,L!dtn1ifieaiion and control of dynainicat systems using neural nelwoiks/1
ÍEEE ThiittMfkMtt oj? Mrwni MrfMrie, vol. 1, pp.4-27.
Nataraiin^ BJC.a 1991. IfatAñír £eíjr^rrj?g.d Tfaoratfad/ /ipprucrc-V San Mat«h CA: Morgan Kaufmaxin-
Neal, R-M a 1995 flfjvcjfíjn ¿unti^.^ A'i^rtrf Acrwcrfcs. Ph.D. Thesish Lhdwniiy oíToronto- Canada.
Nral, R.M., IW3, L,Ba>fsiari leanring vil siochasiic dynanriaT ¿Ammi m Mttrraf Ancenúqg ^vttwr
vol S, pp Í75-4R2. San Mac», CA: Morgui Kíufinanit.
Ncil, R M a 1992 "Canneciiaii-st Itamin^ of bdief neiw^rW vol.56, pp.71 - J13.
Ne^coinhu S., I 886 “A generalÍ’¿ed llkeory of drt Cumbinalion of observations so es lo otnarn (he best resuLtJ"
Juvwf qfWn^rcmj/rró-. VoLL pp.343-366.
Newe]]. A., and I [.A. Simón, 1972. ftjrnfrn £*rai/ri?i tngtrw-Düd CIiíYe^ NJ: Frentiec-Elall.
Ng, K.-andk.R Lippmann. 1991. '"PraclicaJ charactrnstics ot'neuralnelwork and conventional psEtemela^LÍi^/1 dt/trrmrej
Ai Wcjír?/ FracL'jjrng Vül3k pp.97U-97ó, Sún Malea, CA; Margan K.aufmann.
Nguyen, D..and ü. Widiow; 1989. ,LThc truckhaeker-uppcr: An c3tampLeofse[rLíanñng.irtTWiiral DttWWfcl^ÁrXevwarirWM/
Jaútf CoiyfentfMt M Mtunlí MfNwfe. wl. II, pp. 357-361. Washington, DC.
Nic, J., and S. Hjykiii. 1998. lbA Q-learn-ing-bíisíd dynarnrc channel üsíignmcnl tcetmíquc for mobile HxmmmlcitíK
syslcms,** i£££ rf uníacífoíis twr FfeMfvfczr .i ser Lanzado.
Nic, J., and S. Haykin. L99&. L,A dynamic channel assignmcnt policy ibrough Q-learníRL” Cft£ Ar^úirf Ml 334,
Communkations Rcscsiíb Laboraiory, McMaster (JmvcniLLy, Hamilion, Ontario.
NillSM^ N J h 1980. PnTrtípít'j o/rlrfr/jcraJ1 ^r^gence, New York: Springer-Verlag.
Nilsson, 1965. Leomr^gAf¿Bornes: fijun^flfwFis^fTrffjmrüe JízfXe^ff-C/asrj^F^ívsfeflis. New York: Mc<jtbw-HlII.
Niyogi, P.r and F. GirasL 1996. HCh Uk relatkmship bcfwccn generalizan w envr, hypothn cümpkxily, and samplc
ccmpkaity foi radial basii íunctioniT Ar<*ww/ CMgwftnftm. wLS, PP.8Í9- 842-
NovikoíT, A.B.J., 1961. “Cm convergente ptoúís íútperMpLrórts™ in PrtKrc'i^Vrgj qfxfrr5™püsfem o/r xfrr AÍCTiftíYUffXinry
Tíewy ü/jíuftNwo'ía, pp.ól 5-022, BrtioklyiK NY: Pólylechnic Insimule of Brooklyn.
Nowlan, SJ_. 1990. “Muirmrni likdihood compcfÍErvc Leamrng,H jlrfLwmrfí ín AenraíA|bnMÜM Processing St^Xems.
voll. pp574-582b San Mateo, CA: Morgan Kauñnánn.
N envían, S.J., and C.E. Hinton. 1992. '‘AdapCÍve soft wrigjiít ly ing using Gaussian ni uUltts/1 Jim^s jfj A'euraí fn/ormaXion
Pmce.wing 5ysrems. wl_4p pp.993-IDOÜp San Maten, CA: Morgan Kauírnami.
NiWF'lfln, S J, íii:dG-F-. H¡nbqnp J991. “Evalualkinnfadapávemixturesnfcompetingexperta,'"4rftujKí.Tj> AtirmJfjF/kzmj/j'rírt
wL3, pp.77J-r7Wp San Maleo, CA: Morgan Kauímsnn.
Qberrnaytrp K.p H ñiittr, and K. Sctmltcn, 1 Wl_ HhDeve]opment and spacial stmeiurc of cortical (tature mapsi A modtl
study,1" rfííwirttíj fe Atara/ /j0™wricwt f’hwewfef 511^ vol. 3, pp. 1 bl 7b San Mateo, CA: Morgan KsiÚnuiL
Ojah E.p 1992a_ ^Principal ccwponenlí, minor compwwnts, and linear neural netwudaT^tarafMnwrfa, «15.927-936.
Q¡ah E.< 1992b. “Sel f-organizing mapa and compete viitan." in.Atamf AVnithrjjj^tt^rxtui. vol. I. H- WedxCa; eJ.n
vol. I, pp.368-385H Sin Diego, CA: Academk Pre»
Oja, E_. 1991. "Data compresa ion, fcaturt exrmcti&rt,and auteassociaiiM in reedfofvarct iwm al net^orks,",drxj^cxfl¿A,cxíra/
Vshuorití. vol. I, ppP737-746, Amslrrdam: North-Holland.
Qja, E-, 1989. uNem^-l wiworfcsh principal wmpünenis, and sutaspaccsr- feterrtarinFwJ Jbarrta/fl/^eura/ Sjsrtím.r. volt 1,
61-68.
Ojl, E-, ]9R3- SuAf^wce AfeXArkíí Ldchivorth, England: Research Sindica Press.
Ojtu, E-, L9S2. >LA simplificó neuron m artel as a principal compcmenl analyzer,'’Jíjuffm? of.WjaXXjímariM^ JftoXú.qr, vol. 15p
pp. 267-273.
Oj-tL, Eh and J. Karhunen, 1985. “A JtwhMlic appraxiniation Of [he cigcnvtctara and cigcnvaluefl oí thc experlalion of a
randorn malrix,H Jaur™/ qf AíffX^íviwricfl¿4FMjJvjrj (rnr/ J/^?ífccrJJc™. vol. It>6, pp. 69-84.
Oj-1, E.,andT. Kobcncn, l?8fl. ‘The suhspacc Icamingalgonthm as formajsm íorpattem recugnition and nCural itrtwnrks.
/E£E JjiftFrtóffOMl Coq/mnce üh Mürrof toL I, pp.277-2H4, San Dí^ed, CA.
OfldlHt C_W.H and C_L. Giles, 1996. “Ccxislflictingdjctcmiínifllic finiEc-slatcatilíMnala in rccumenl neural nctwíwfcFkT
o/xAe4jjocfúfrán /or CífflpwJíng wl.^3, pp.937^72.
Oppcnhcim, A.V.P and R.W. Schafrr. 1949. Drjcjrfo-nww Sí.g™i PraccwiTrg. Engle*tx>d ClíifíK NJ: Pmtíce-Hall.
OfLpndo, J-, R- Mano, and S. Hay km, L99ü. ^Cl-assificati-nn of BMrkx us-ing a dvál-polírized rartar,'1 J££E Áwrnn? c/
OflMHk vol. I5P pp.228-237.
Osher^on, D.N_P S. Wcinslcin, and M. Stoh. 199ü. '^Modular lr¡íniingh,L CcwrrpirXiTXrcníj/MttmKtoKC E.L SchwuUi ed.,
ppJGÍ-JTT, Cambridge, MA: MIT Press.
Osuna, E., 1998. JLSupport Vector Machines: Tratning and Applications,” Ph.D. Thrsis. OprraCwns Research Ccnlífi MTT.
Osuna, E., and F. Gns. E99R. “Rcducing Ihe run-time rcimplex i.v of support WCter machines,'1 ICFR 98, BrisbarHi
AustnÜL
Osuna, E , R. Fíwnd, 3-nd F. Girtwi, 1997. '"An improved iTainLngalgonthm forsupport vector mathLrtts/^VcKrw/jV^wfiIj
SígjwlPvwtssMf Vil, Píocccdii^s of thc 1497 IEEE Worishop, pp. 376-285, Anielia kland, FL.
Ou, E_, 1993. Cfeoar fe Cambridge, MA: Cambndge (Jnivcrsity Press.
N H , J.P. CfuEChfield, J.D. FafflWf, and R.S. Shaw, L98Ü. “Gcomelfy fran a lime series," Pfr/jjrff/ímÉwLcXXcxr,
voL45, pp.712-716.
Pfcjm, O., L932. .Veuraf Assemó/res.An J1JlJcFTlfN,M, NwY«fc Springcr-Vcrlag.
PaJmjcri, F.,and S.A. Shah, 199Ü. wFbsI trainingofmHLli1avcrpcrceplTnnítu-,1inEniuLLi Linear parüjnerH-u.air.un.'1 Jjr/íímtrJj'oriüf
Jafef CoFj^Fwrcr on jVewraf \cXHwr±jr Vol. 1, pp.696-699t Washingion, DC_
Palmicfi, F., I. ZhiL and C. Chang, 1993. “Aitíi-Híbbiao tarnirig in lopolnjically constraincd linear neiworka: A tutorial,"
f£E£ IraFmcXj'MJ en Ncjrra¿ ^cVwtvds; Vol. 5. pp.748-76l_
PajxxiJis, A., 1934. AobdMÜQ^ AancAwr fMflHtr, «ntf Sx«7Affjrj£ ftvosw, 2nd cdilion, New York: McGraw-Hill.
Pariai, G.P 1988 Sdfofrsffcff/ Rdtf Tftcm; Rttding. MA: Addino-WWeyn
ParL, J., and I.W. Sandhcrg, 1991. “Universal approxiiTiation using radial-hasiR-runcEion ntfworfcs"JVejdraf
vo(.S, pp.246-257.
Parker, D.B., 1987. JlOplimal algwiíhm» fw adl^rvc netWOfta Sccond onder hack propagatmn, scoond arder direel
propagador!, ¿nd anod order HebbUn leanúng,"' IEEE /sf AtfenufltaM/ Ctwtfenfncí ¿m AfarW Afexworts, vol .2.
pp.593-6Ú0. San DiígrX CA.
Parker, D.B., 1985. “Lcaming-lügLC: <¡i--I¡:l (tic CüCWX <rfthc human brain in Silicon," IfcAndco/XíepflFX TjR-d7, Ccnlcr for
ComputalionaJ Research in Ecotnolci and Mngen«l Sí ¡erice, Cambridge, MA: MIT Plesa.
Parker, ES., and LjO_, Chua< 1989. ftudfeo/ /hr CbúoXJí^SfiM* York: Spnnger_
Paraen, E._ 1962. "On OÍ a prcb&hilíty dcnsity fimctinn and mnde,H JÑjr¿?¿TqfMaífiema?¿co/SíJíjj/jcj, vol.33,
pp. ] 065-1076.
Pass-inu, K.N., 1996. “Tü*lrti bridgLhglJw pcrcei^dgapbcTwccri cflnvcntmnai and .nlclligent control/ in M.D. Gupla and
YK. Srnha, cds., /¿rrcffigrnJ Cíj^t-T/vJ ppJ-27h New York: IFEF Press.
Pavlov, E.P., 192"?. Cíndj/ÜNrfl/1 Ac/jiTcy .íj? /nhi^fígwJJwn íf/"fl/'rAí? Círt^raJ Coranr, {Traduzulo
do ndiE-o por Ü. V. Annq>X New York Oxford Uh .vcts.i j- Press.
Pcarl, J., 1988. AotobÜ^c AñWAÍqgta AiteMfgfltfSklíflttJ. San Mateo,CA: Mor^n Kaufmann. (Rcviscd 2nd printing,
1991 jr
Pcarimuttrr, H.A., 1989. -Leaming stale-spacc tnffiCtfiriei in raumibL MUnl neLwwks/ ¡Vfiinrí G^pirfíJftcrj?. vel, 1.
pp.263^69.
RetHOfl K., 1901. "On Unes and planes oiclíBcst fit to systems of points in Epate/ /Vij'fejopArceTÍ jWogaz¿M. toL2,
PP.559-J72.
Peretto. P. 1984. -(JolIcCtivc propcrl k1* of r.r i-i : ' Mtwwtr A $misiital physics approach/ Cytorwrtcj. voL.50B
pp.5 L-62.
Frretto. RB and J.-l Nltt, 1986, "-Sioclusiic dynamies nf neural nctwnrks," JEEE Thwacffcmf m Sw/p^rj, Aíüfj, d/wf
CyScnic/ki. voíL SMC-1 6l pp.7J-8?.
Pcmn, D., 1990 "Fiuile auc^nsis/in J van l.ccuwcn, cd.L//dffJ/wútú/TAeünewea? CnuijMrJírHÜJ0K ff. frtpw:!
Mftteü and Sí-Tilica; Chapcer I. ppJ-57. Cambridge. M A: MU Press.
Perranc, MLP., 1993. "Impruving regrtssiüíi eflirutñii: Averagina mribod* fcir vníun radwtkn with etietifticins, lo
general tumi* mea-buns opiimization/ Ph.D. Thcsís, Biown Uníwníly. Rhodc talan!
Personnaz, L., I. Guyon. and G. DneyftK» 1983. ,Lln formal ¡on sioragc and retñml in spift-glasa lita wural «twati/
Jira™/ c?/JJAryí<fHít LeJJen. Oftdy. Flun. vol .46, L-3S9-L-363,
PcLcrson. C, 1991. “Mean field iheory neural neiuwks for ftatm fMognition. contení iddiwibte memwy and
oplimization/ Gwifítófl Scrra-r. ^ol. 3,. pp.3-33-
Pcterson, L.. and J.R. Andenlo. 1987. "A mean field ihiXicy Leaming aLgüriihrtt for iKvral necwmtT,1' GNipta Srjfrurj.
vol. L. pp.W5-LU19.
PctcrñDn, C.. and E. Uartman. 1989. ^Exploración of Lhew<an field iheory leaming algoriihm/Ataraí wlJp
pp.475^LJ4.
I’l-iephji^ (". „ and B. SLkkrbcí^, 14A9. “A ncw mechod of mappíng optlfULzaLion problema orno neural rKtworki,"'
Jbvmoívol. I, pp.j<22.
í3hamJ D.T.i and p. Carral, 1997. "Blind scparatLnnofrniaiuiitírf incfcpcfufcnítsüureefi ihrnu^h aquasi- máximum hkeiihood
apprrhflth/ fFEE T^SftMCltoJtf OH ¿PfwwIa^. vol .45, pp 1712-1725.
Pliam, D.T-i P^GvnL and c. 1992, ILScpsralionüf a mixture oF independen! sourecí Ihmughs máximum likelitaod
íppnfraúh/ Ph-jr.^'úíwtjíí í^EUSIPCO, pp.77 1-774.
PtñUiiH, D.. 1962. HA iccbniqnc for ihc numerical wludnn of ccrftiin inicgral equídems of 11>C firsl kindT Ánttw? qf
ilEHHráfnkn J&r toI.9¥ pp.S^^T,
Pineda, FJ., 1989, '-RKurncíil backprapagalion and Che dymnñcal afipnndi lo ídspiive neural campal ion/ ATomF
CduyNíti/fM, VOl i. |i? Ifil’i 72.
Pineda». FJ., tífica. ' íicncralizattün ofbaekprcipaga: on to rccurrcnC and hi^herorderneural nctwntrks/ in AfeÉjnjí/ri/ÚJWJfú/r
Awwáqp 5TJ/L7W.T» Ü.Z. Andenein, cd., pp. 64)2-6LI, New York: American Lnslrulc of Fhysies.
Pineda, F.J., I9tíí1h. ^Dynamics and architrclurr in cicunil computación/ Joirma/ a/Comip^ri,1 wl. 4, pp.2E6-245_
Pincda, F.J._ 1987. -Generalization of back-prupagítion tú recurrrnt neural nctworis»11 Misíca/' fleL'jfkv ¿f/rtrrí, vol.59,
pp 122^1233.
Pilis, W._ and W.SiMcCXdtotti, 19^7/'] [<i^ wt know universals: ThcperctTiLLon ofauditury and visual formn," Eidtfitfm (jf
AAtítanUtáo/JffpAkj/cj. wl.9, pp.l27-14 '
Plumbley, M.D., and F. Fallsidc, 1969. "Sensor} adaptation: An informalAm-theorrli-j vicwpaanL'' /^ferrj¿rrjüFJd-í Awff
Gj^trwí OFt .VaiFp/ .VeOrorLí, icl.2, p.59fí, Washington, DC_
Plumh-lcy, M.D., and F. Falkidc, 19EK- "An mformation-lbcorctic appr-uaeh lo unsuperhised cünnceliqníst models/ iü
AüCTfli/flíJ <?/ r^c /9SS Cüñ/rcc/FüjrÍjr MbdeJj ÍHni7w¿r 5'efttwA D. Touictzky, G. Hinton, and T. Scjnnwski, cds..
pp 239-245. Sin MU«t CA Morgan Kiufiuann.
Poggio, T., L99fi. “A ihecry nf how rhe bnun mi^hr woric/ CoM.í/7rj>rg /tortor$4qpo±íiriN czo (JNMfrffl/íw tfj'a/ogyP vol. 5,
PP.899-JIQ.
P-Dggio. T., and □. Beymcr, L9M. ''Liiaming io secf ÍEEE SJpectrWL vol .33, nO-5, pp. 60-69.
l\i^gLLh, r„ and S. Eddfmflr 1990. “A nctwork thal tetruA Ip recognizc ibrec-dimcnsionaL ofcgctfi/1 .V¿ujíñ?L vflL.343,
pp2e3-166r
Pogjio.T, and F. Gira&i, I 99Qb_',,Nciworks (brspproximiiíia md teaftiing," voi.78, pp. 1481-1497.
Foggio.TM*fld F. GiHH^mOh "RcgulanzalicmalgonLhms forlcaminglba! are Hjuivalcnt tomullilijyrintíwürkR/Sic^flWj
volJJ?. pp.97K-9K2.
Poggio, T., and C. Koch, I9S5. "lll-posed problona in carly visión: Frnm-coinpLilariúnal Iheory lo aiulngue Mfwcrfsr
PlDcwJjjrgi o/Aí Kü.i'flfSarkfi' o/'/.njirfíHr. Series E, vol.22fi, pp. 103-12 3.
Poggio, T-. V. Im, and CT ECoch, I9-K5. "'Cnmpütalional visión and Rgulnri^rinn. (ticoryr VOÍ Jl7h pp.3 14-319.
Pnlak, E., andíL Ribiere, L969.,lNütesuT la com-ergpnct de ifterhLX¡sdcdiftie1ioiisco<i¡.i^DCí$h,t A’eiiJí-Fo'J^rrm'se
fepfcerafe ™rinjwL?yí4; vol. 16, pp.33-43.
PíippcL <r,p and IJ.. Krcy.KS"’. ‘'Dynanrical learning prncesA Cor rec^nidofi of coirclíilcd piUenu in ajnlmctrk spin glosa
modcls,” EwnytAv.fíjL.í£tífef3, «1.4, pp.979-5R5.
Pmvell.M.J.D., 3992.'"The thcnryof radia I has is tunctinn apprnxiinaiion in IP9QlMinW LigllLed.L^J^W<Mff//TNHmcrfrc7/
/íri¿rAwj'.t lili ¿f; .íuAr/hj'.vjNN xügWiWWU'i ítríÍ flrJíJrrJ .'Íij.vj.v FjfjacN'^rjj. pp. I0S-210,. Oxford-: Oxford Science
Pvb' i :d¡QPS-
Powtll, M.J.D., 1988. "Radial bask fluwlion appnjximiHiMB lo pelvnomials,11 Mnnfrfrii/j4jw6,tít ¡M? Ffiaewii-.'.!.'-
«021^1, Dundee. UK.
Powdl- M.J.D., 3 9R5. "Radial basis íunutions for mbltivariablL* inlcrpnlaLmm A revjEW,"rJrjW>í Gwtfbwwc W? Jígflrrf^ri:
Jfer Ai 4pp?nxrjw¿rfforj o/FtacrftNi*r ¿?rjJ JlofiOL pp.l4j-l 67n RMCS, Shrivenhan, Fngíand-
PüwdL M.J.D., 1977. "Rwtart procedim for thc urenjusate ^radienl medwd,’1 Emeniivwj1^ ™i.l2a
pp.241-254,
Preiseiidorfcí, R.W... I9ÑS. Pr¿w¿píiJ Xrtdfrjrv í>r Mw4n>J4£v riW OvtvTÑag-rJip/ir. New York: Llscvirr.
Press, W.Hn B.P. Flanntry, S.A. TcLLkolsky, and W.Tr ^fterling, I9RÑ. MwtterícaJ ff-nfpe* A C: 77rtf/írf qf ó'crcjrfr/ji
Cfljjywrriwg, Cambridge: Cambridge l'nivcrsiry Ptkü-
Prrakis, J.(i„ I9R9. ConmNn^Cflrfwu; 2nd cditioiuNtfW Yflrt: McGflW-HilL
Prnkhom*; D.V., and D.C. Wensch, I'. 1997. ’Adapi ieei¡|¡iL dwiyJH” ÍEEE ThíHlMtínMS Ofl Vcnhi/ Vfll.8,
pp.997-[M7.
Puskorius, G.V., and LA. Feldkamp, 1994. 'Neurvccnlrcl of rnnlinw dyniniical fyrtemfl wdlh Kílman fílrcr-Lrained
recumnt rwtwwici^ JEEEítaiuocfiom ujt Aí-haj/Ate/wflrifcs; vüI.5h ppt279-297.
Fusküriusi G.V, md L A. F<ddkimp_ 1992. "Model rtfiMnce ¡idapLivc control with rccurront nctworfcs trained by ll&e
dynamic DEKF íilgüriüim,1' ^rfmícTfrárifl-y Ja/nt Ctn^íTencc t?1? A'ewwf toniwfc, vtiL II, pp. 106-1 13, Ballintütc.
Fuskíinují, G.V.i L.A. Fcldkamp, Uld L L. D*V^t Jr._ 1996, L í>>namit n^unil nrLwtnk methods app-licd lo on-vthicLc idle
sfHwd ccnirol? AwMdbgf /EEE. vol.84lpp. I44>7-I42Dl
Puslí<iriLL\ G V, síid LA. Ftldtsmp, 1991, “Decouplíd «tended Raiman filCcMrdining oí íbedíbrtrtfll layeredrtctwftrtaT*
ffltenu/fMafJbM Cvjt/í-^'Nlt ga Afeltra/ .Vchiwfa. voí Jh pp.771-777+ Sealllt
kabiner, L.R., 1989. “A lulorial on hidden Markov modcls." F/T.i<cr^i>?g5 ^fAc JEE£ toI.73, pp. IM9-1387.
Rabiner, L.R... and B.l [. Juang, 1986. "An intróduction Í0 hidden Markkuv nvudelsF Ji'Ei^íkSA1 jWci.íiazjwe, vü|Jt pp.^-16.
Rail, W.t 1989. “Cable llieory Tur dimdrilie neurona." in jWí/!iw/s ü A-ínrarjof .4foííe/j>rg. C. Koch and 1. Sc^ev, eds.t
pp.9-62. Cambridge, MAj MIT Prtss.
Rail, W-p 1990. '"Sume hislonujl nutes" in CDmpN/ffn'üfl'flFAkwreBuwfflí^ LL. Schwartz, Ed.^pp. 3-E, Cambridge: MN
Press.
Ramón y Cajni, S., 1911. í/rsfaíogk ¿Íh .VenvitK rfe ? I^mijneef uprtjftw. Fai i<! Maloine.
Rao. A., D. Miller, K. R-dsc, and A. Gentío. 1997a. "Misture oTcxpcrts irgrossion modelinghy dcEcmimisric annealing.""
í£EE ThanMcJnvu oh vol .45, pp.2Kl I-2S2Ü.
Rao, A.. K. Rose, and A. Ciersho, 1997b. "A ddrnmnistú: mnalíng approaeh te discrimijLalivc hidden Marli<iv nwdd
desigp* JtteflFfl/ A'igW FTí. Pwt'i-Jlljyí rirv íflP7 ÍEEE WbrfciTrop. pp 266-275, Aineli-a
btand. rr..
Rao, C.R., 1973. EJtwarSÍLrrí.Yríj.u? írjfOTdcv ltjtJ to 4ppJJíYj¿/rwr\ Nw-York: Wilcy.
Rashevjikv-N„ L93E. .*/nrfií^i¿?rrL\7f fifiqpJtjKÍís, Chicago: Universiiy ofChieíiLtn Press.
Raviv, Y t ¡md K tnirdior. I 996. '"boctstrappiiig wilh nmse: An cilcctivc regulariza! ion tcehniquc,'1 Atatm
vol,8hppJ55-372.
Rcctf, R.h 1993- “Phming atgOT¡[hm&-A survey." 7EEE DwtttKfitMtí CM Afevra/ .Ví/iiruÁs, vol .4, pp.74D-747.
Recle.! G.N- Jru [,.H FinkúliindG.M. Edclmun. 1990.‘‘StlectRe Teco^mtinn julomaLa,1' in Xñ ÍHflOíÍJrejjíWj ín Aj:\!iTjj!cr.izij1
EA írrnwL1 Aenvciris, S,FP 7omc1zcrt J I. Dav -.t and C. Lm* edk pp. 2Ü3-226, New York: Academic Press.
Etcif, 1965. n/SCíitíjficof ¿rrid rferTDidr/í’Ar.vrry. Ntw York; McGraw-Hill
Renal?, ^i., I9ft9. "'Radial basts function nelwork forspcccb pancín clttf[1íaltan7a£HKfritaic£¿r-f-fcHT, i'ol.25.pp.4J7-439.
RonykA. 196Ú. “On measures of entropy and infa^maLio^,,,u/’rAí? ^W(pwArni m MdAAM/ñx
Statftrfts, ¿rod /’njfvrh^rrv. pp.547-561.
R¿ny¡. A , 1979 fWwAf/fn- TAran-, North-Holknd. Amslerdam.
Hidden page
Ecblkkrafu 883
R.umelhart, DPE., Ci.L. tiinlon, and R.J. Williams, "Leaminu rcpmcntaCioni af hack-propa-cíTora,” .VtrfHíe
fÁrwrJrwrJ, Vüi.323, pp-533-534P
RumeEharl, DE^G. Eh Hintan, and R J. W^lhams, L9?i6b. "Tcaming inlcmal reprcficnÉati-nnsby cnm prnpagir.en” in D.Rr
Ruffielhad and J.1. McGíland. wí*., vol I.Chapler 8, Cambridge. MA; MIT Press
Russcll, SJ.,and P. Níwig, Wthfcríf JflprtMdl, UpperSaddlí R-Lyct, NJ: Prcnlkc-HllL
Ruhso, A.P., 1991. lulonal No. S, IEEE Confiraux cfj Afewu/AcrHW^/íir
Octfüff £ngji,re¿,Fi!iijr1 Washington, IX'.
Ruyck, D.W._>£.K_ R-agcrs, M_ Kabrisky, M.E.Üxlcy, and Ü.W. SliLct, 1990. "The muIlilaycTperceptron asan appnMÍmation
te a Hayes óptima! doscnmiiLant fijnc I ion," IEEE íbrnsa<ricui,.T qfh'amrl Nefworis. vúl. I, pp.296-298.
Saarinrn, S., R.B. Bramtcy. and ü. Cyhcnku. IÍ92. '"Neural niMworks. backpnjpagaLinn, and automal c dilíercntiation/" in
J¿íf¿jr?itTfk£^exenftíTJ,jc?j? HftJtJ. yíFjp/cttMJiMriófl; ¡Wid ,4/p/rntfítro. A. Gricwankiind OT. Curlis-5Pcd5.,
pp.3 1-42, Philadclphia: S1AM.
Siarinen, S.H R_ Bfunl^ and G. Cybvnko. L991. “The numérica! SúluÜon of neural ncliMjrk training probleras/- CfliE*
Jfcpcrf Afe. /A99, Center for Supmjumpulirig Rcscaroh -and Lk-vluprncnL Univcrs (y oí Illinois, Urbana, IL.
Saekingfr, F-, ñ.E. Ekiscr, J. Brcrfnlcy,¥. IjcCun, and [..□. Jactd, 1992a. ’Applicalinn of thc ANNAncurzl nclwofk ehip [0
high-speed charactcr rtMgn ilion/" IEEE JtanpotitaJEf aje .V^h/uI N?wfer vol_3, pp.49íl-505.
Sfckhger, En BF. Bceer, and LD Jackcl,]99jh. "A neurocomputef bwd based on (he ANNA neural necuurk chip,1'
/Irfiwiccj v? A'cntoI AwtfUftg Srírt'iwA-., vol. J, pp 773-780, Sun M¡Hco, CAl Morgan Kaufmann.
Sureña, M-,.iridA- Rímjuci. 1991. '"Nüucal cohirollet on baelt-propejattai alfOfUhm/ fEE /Vwrwí'rKs
ftrtf1vol.l]8tpp.55-ftí.
Sfl^e, A P-ed., 1990, Gnwím¿n .íi-vcttis .j.-.- IYork; Pcrgamon.
Salumon. R., and J.L van Hemúicii, 1996. 'Acui/leníling huckprüpagacioo ihpduglb dyiiaihk qwir-adiiphlliurk1 M'iíju/
Atnw^i.-;, vnl.9. pp. 5 89-601.
Samuel, AI l 1959. "Snmc Hdüm in machine Icaming using ihe gamc of chcckcr^” íB.tf Arawl
vnL.J, pp.2 11-229,
Sandbrrg, t. W., L 90 L. **StrtiCture íbMKflM for nunlincniT syitemsb'L .Ifflftrí/^nnrsíünn/ írsírJNS ct/kí Srgraí Prorcssijíg, vcL
2P pp. 2ó7‘2S6_
Sandbrrg, I.W., L.Xil, 1997a, ’Uaiíbnn approxiinji(iMlüíinullidimi'n-. onjil myopicinapsJ'/£'££' ?Attiíerei'pq-.T-j oñ Cíjtí'jj/j
¿?nrf SkTltrnsP v^l.44, ppA?7-4M.
Sandbrrg, C.W., and Ll Xu,L99?b. ^iJniforrri approxunarion and gamma rtttmnkl¿ .Vcwra/jVcAiwnl'.T. vol. Iü_ pp.7Sl-TWP
Sangcf, T_D., 199Q, '"AnaLyñJS ofthe [wci-dimcnsional rereptive ticlds Icamed by thc Hcbbian algor Ihm Ln rcsponfic 1o
Tándem inpuV Jfo'oVogrcvr/ Cvícmcfrcx. vülufiJ. pp. J21-22S.
SUgH1^ T.D.b I9lí:-l;i ",A]b upi malily ;">i ii lúiple fúr UnJUptfVLKd ItMnfnjfl" .-IflvirnLír.Y dJr .'VíTiriUJ1 /nyfwmrrJj'M P^JCCíí^rg
t-ol, 1. pp- 1149, S*fl Mvteo, CAl ki'iufmíLiirt.
SangW. T.D., |9S9h. "Xbpliiftal unsapervised Icunñtgin amn^lfrlaycr linearfeed&rwdneural
vül..l2,pp.«9-473.
Ssnncr, B.M., and 1.,-J.E, ¡Slotinc, 1992. '’Claussian ncEworkí ibrdinxl adaplive cerniré!" ¿EEE JFUHrwclJüWi m Neumí
iVífin-íírksr, voUxpp.S37-S63.
Saticr, bJ_. 1972. ""On the dcnsilics of tamil ios □íscts/AMinwí'p/'CflfllfJ^icrfoFTüI TThwr, vol. 1,1, pp, 143-172-
Saucf, T_, J_A. Vortic, uiid M. CasdagEi, 1991. "Efnbedplogy~^nhm?qf&arirfrarf PAi'.úcs. vol.65, pp_579- 617.
Saúl, UK., T Jakkolla, and M,). Jordán, 1996. "Mean Held Ihcory ibr ñigmoi-d hcLicf nctworfcs/' -fajóla! rtf.4fi,ífr¿?iüí
jÑaQfegíÑíe ArareJk vol .4, pp_61-76.
Saúl,. LJÍ.t and M.L Jordán. 1996 "ExpkÑling Iraclable wbsinJchMi in ¡niiíKiaMfl ílí1wuTk&/, ¿tfMwnr fr? Acr^
^i/órrwcrrwN VOlríh pp.4#6-4W, Cíimbndgc, MA; MTT Press
SauL LK, ¡iTid M.l. Jorduk 1995. '"Botanum chaímuid hidden M-iftov modela/1 ¿¿tanra ín jMtwuf
ftKCUfjJiX EiwfrrtiA,, vol."L pp.4 35-442.
Schapifí, R E., E997. ‘"Using üuiput endefi toboasr inultklutleunim prcihlemR^MicAhr¿«minifr
En^r^íJiA Jjjfírwdjjhndl Ca^biffiMiF. NashvüLc,TN.
Schapirc, R.E,, 199£L'"Tbc-fiirwijjth üfwcak kamabitiLy? Ifctf&Jt1 Ld^rjírjjg, vol.5, pp. 197-227.
Schapirc R.E., Y. Freund. and P. BartlcttP 1997. "Boosling 1hc nuirgin: A ncw ciplanat on for thc cTcctivcrtcss oi'voiing
mclJwdsr 4f¿?cArei? ¿eo^vrñrg: ftwwdútgi □/fie fóNF/LVJtjA /jrtBHHtffrMffll C^i/cFrjnre. Nashvilk, TN.
Schiffman, W.FL, and W. W. Ccffm, 1993. '"Adaplive conlrol of dynamk üysiems by back propagalien HEtwqrfc?/ A'ewreí
Mffliwfa; vol .&, pp. 517-524.
Schníidtr, C R., and H C. Cud. 1998- “Andog hardware implemenunion issuts in deiemimiBlk Boiízmiiwi machines/
IEEE Ttomctiónr w G^fjrírj otó Er-írr^^ JZ. h>I.45. a ser toncado.
SchneúderhC.R., and H.G CanL 1993. ^Anadxv CMOS cIcrcnnEnisiic BdOrnamcircutA/* fEEE^Hrtw/SWJ^EiHtt üát^i
«1.28, pp.907-914.
8B4 BCKUWIIAHA
ScholkopL D._ 1991. JflKWPXramííig. Muniíh, Germán/; R Oldcnbuuqj Vértag.
ScholJcopC B., P. Kimard, V. Vapník,and A.J. SmoJa. 1997. "Improving theaccuraGy and spced ofsupport vedcr machines/
jtóWCJ rri .VríJrrüJ JttíírtflJrrflH Apee3JÍJ|f Vü!.9. pp.3 75-381.
ScMVwpT, B., Au Snida, and K.-R. Muller, IW8. ’'Nonl incar componen! anal vele as a kcmel cigc-nvalue probit m/ iVenra/
CúmjjuJLrJjdJri. vol. Ifl, a ser lanzado.
ScHMkopf, B-, K.-K Sung, C.J.C. Burgts, F. Girosi. P. Niyogí, T. Pnggio. and V Vapnik, 1997. "Comparing suppnrt vector
machines ^ilh Gaussian kcmcls io radial buu Túnel ¡on classifiers,” JEEE ThwstflfcNU au PrncísiJír^. vol.45,
pp^75a^7h5.
Sehesudolpli, N.M., andTJ, Skjtiovi'ski, 1996. ""Tempcring hack propagaron nctworka: NlH all wcights are c-neatcd cquaJ,"
Je Ai^raí frwvnftjgSi'Jíem.r, vol.8, r-p.563-569. Cambridge. MA: MIT Press.
Schumakcr, L.L.. 1981.5/r/me FNJtttíMf; taire TAcz?n-. bfeu Yixk- Wilcy,
Schurmani_ 1997. "'Alltmalivrinclrics furmav itiunl margin clásSillMíion/jWÍ Wwfcrt^Jfln SwpporJ krrfcr MkMms;
Bcckcnhiidge, Cü.
^chuEtcT, H.G., 1988. DeftHOÑüttfe CAnui.'^Pi ffftHNÍucJ'Jon, Wcinhíim, Grrmany: VCH.
Scoñeld, C.L., and L.M. Cooper, 1985. "□cvclopmmt and propendes of neural nrtwotrks.^C-an/rrTipDHnn' PAitícj. voL26.
pp.]25-L45.
SvüLCAjC.. 1977, A'euiTjj-JinJc-v, Nw York. Wilcy.
R.E., and MJ Cancr, L99L. ,LFau][ lolcranee oF proned multU-aycr nctivorls/1 /rjnrrfjajjünd/ JWoí Cfr|^nc¥ rwr
.VcrJ^-r/MtfWCribf, vol. IL pp.447--45Zi Scarrk.
Sejhowski,T J., 1977a. ,n^ifong covariante witti nonlincariy inLcfacting nturons/vol. 4,
pp. 303-321,
Sejnowski, T.l.k t977b. 'ílatístí-cal canEtrainCs on synaplic plaslicity/Jonhwi/ q/77i<wrfr™? vql. fi9+pp.3S5-389.
ScjnowKki, T.J., 1976. 'X]n global praperties ot'nmronal mlerartion/ flotagjarf CiAenic/JU, vol.22, pp.85-95.
Scjnowski, T.J., and P.5. Churohland, 1989. '‘Hiain and ragjiilionT in Fn^m/ü/JcNtí M3. PoffTKr, cd h
pp. 30-1-356, Cambndgc, MA: MET Press.
ScjrviWfiki.T.J., P.K. KirakWfSndEi.E. Hintnn, 1986. HLcajningEynunctry gmups with hidden uniis: EcyondlhcpencepcrwJ"
PJji.ífCiJ, vol.220, pp.2601-175.
Sejnüwski, TJ.tC. Koch, and P.S. CbuRNud^ 1988. “CompuEdiional rtjeuíüsciwce? Scjlesfifi vol. 241, pp. 1299-1306.
Sejrii^vsk], L.J., and C.R_ Rosenbcr^, 1987. '"ParalLel nelworks :tut Jmjti 1o pronounoc EngLish lesi?' Crw^pícA Sj'Uíwu,
vol.L, pp.l45-E6K
Sv'inou'ski, T.Lk D.P. Yutus, Mil. Uo!ds1einH Jru and R.E J?nkin&i 1994. "Combimng viflttl and acoustic spcech. signáis
with a neuiHl nctwork improbes intrlHgibLliiyH./trfraH¿Ti ín A'cnhj//n/r¥7T?aíítwr JTucciirpgÍvjI'cwí, rol.2, pp.232-239,
San Maleo, CA: Morgan Kauftnann.
Sclfridge, C).G., KS- SutEon, and C.W. Anderson, IMS. ''Sclccíed bibliography on conneclioniñin/ íiwíjdrmjr,
CtagHÍríófi, Y.Cl LceP Ld., pp .391 -443, Rivrr Ldge, NJ: World Seicnlific Publashing, Inc.
Scung, H., 1995. "'Anncaled Iheones ot'Jeaming/ in J.-H Oh,C K.won, and S. Cho, cds., AfatraJMffNw4j.r TSc Süf.arúuL'dJ
.Vcc/un/íB ArapBcJrw; S ngapore: World ScienCific.
Srung. H.S. . IJ. Rkhaidsnn, J. C. Lagarióa, and JJ. Kopííeld, 1998. "Saddlc point and Hannltemían siructuTe in
eM-itatory-inhibilory netwürkH-'" JcAuncej Jid Mrirra/' Svjíems, vol.JÜ, a ser lanzado-
Shah, S-, and F. Palmirn, 1990. _tMLKA-A fasl, local algonthm for Lraining fcedfcirwand neural ndworks/ AitáraoflEMd
uÁprn? Gan/cmirc oh Acuna/ iVerH-antr. vol.Jp pp.41-46, San Diego, CA_
Shamma, S., I 989. "SfMtial and Icmpora] pnK^HELng in central auditnry nelvorfcsT in .Ve/AnA hfj Mwn/ C
Kúcb and 1. Segev. Lids., Cambridge. MA: MTT Prrsa.
Shannu. D.E. 1978. "'Conjúgate gfMÜSYt melhuds wilh incxact hne scanchcs/jWjfAcjnaíJci Jfr.whrní/j, vol 3,
pp.244-256.
Shannon, C.L., 1948. LA mathcmatical thcory of commumcalioo/Sujcjfj 7?cArjde¿2¿ Jhüwri3¿ voL 27, pj*.379-42X
3-656.
Shantion, C.E., and W, WeaverT 1949. TActfd/hHMíínaf í-/Cc|mflTNmccrJ/oir. Urbana, IL.: The Umvcrsity of Illinois
Press.
Shannon, CE., and J. McCarthy, eds., 1956l YWrL-.-r. Prineetnn, NJ: PrinccLfln Uiíívíísíev PitH
Shephcrd, ü.M., 19Í8. 2rid edición, New Yofl: Ortfofíl l.mivír^ity Press
Shephcrd, ü.M., 1978. "Microcíncuits Ln thr nerwufi syslcm/ £ctatf(¡0c jlffMriwiL vol.238> pp.92-IO5.
Shephcrd, <ÍJb(.. cd., 19lXJa. 77jí A'i'jiflfwj? JtdfdítiOfUNew YMc: (hitad Univcraly Press.
Shíplrurd, G.MU 1990b.,L Itie significante nf real ncumn architerlunes For neural nctuort limulfllitxns/ ¡n Cftjn/?uftrJ,jc?riíj/
A^jrwcjcritr. L.L. fkhwartz. ed.. pp.82-96P Cambridge: MIT Press.
SheplkCTd, G-M., fifld C. Koch, 1990. '"[rilrenjueliun lo syniipLic circuito,'" in Tíie 5yjr¿^xrjc Ajwiizoffm Smí*r. G.NL
Sheplieni, «L, pp.3-31 N^w Yo<k; Gritad Uni^mity Prcas
Sherringtfln, Q$-h 1906. 77rv XcTíon A't'nwjj Si j/ctj, New York: Oxford Univcrsily Fress.
SherririjfKiti, C$.H 1913. TÍk Eaj-j'/i dnírf.JjjjWecJhuiiyw, [.imdon: Cambridge Emvcrsity Prcas.
SherrÍEi|ftfln, Dl, and s. Kirkpalnck. 1975, "Spin-glasEcs," PAivjedJ E¿?vfew£cffln> vol.35, p-1972.
Sbewchut JJLa 1994 íIjt ftftvdtacriÍM to (Ai fíra¿fi>nf jlfcrhrrtf iHWíüf í!jí ^íúri^^j^RrÍJí, Schnfll oFCompulcf
Science, Camele Mellon Vihv&sily, Piccshurgh. PAt Augure 4J 994.
Sbore, J.E.h and R.W, Union, 19MJ. “Auomatic ofthe principte <f rnuimun empy and thc principie of
mínimum cmss-rntropy?1 /£££ TrMttctlMr tW wl. FT-26, pp.26-37.
Shustorcivich, A., 1994. |LA suhspaee projection appraach L-o triture1 citractinn: Tht Lwo-dimensional Gabortransfarm far
chUKter rcíognitH'in/1 Atara/ AímwrJtt, vol .7, pp. 1295-1,391.
Shustnrovich, A. andC. ThiLLsher, [996. nl Neural nrtwnrk position. igandclassiñcati-on ofhandwTLLLenchaTBClers/jVcjrjTa!
Ntfuvril. vqt,?, PP-.6ÍI5-69’
Shynk, J.J. 1990. '"Pcriórmance surfaces rifa singlc-laycr perceptron," j1 L'i'E T^r.racXhw en .Veidra/ 1.26K-2"4
Sbynkj J J^and N - Bershadt I Wl. ^StalinnafJ' poinls and performance Rurfaees of a pcrcepOnn Icaming algorilhm tora
nonstationary dala modcir AticnutioM/ an iVrjrr¿?/ A'íwnrts, wl. 2» pp. 13 3-139, Hihinujre.
Shynit, JJ.t írtd N.J. Bcnhad, 1991. “Steady^staK! analysiR of a single-laycr pcircplron bascó em j systcm iduUificatLon
model with bias Icrrns/ /EfE rwjjpcr/rw m Círca/lr ¿mrf .Si.wujj, voLCAS-38, pp.l030-1042.
Sívgtlinam^ H.T.a B G. Home, and C.L. Gücs. 1997 “Computilknil apobitilic* ofrecuncnt NARX neural oetwwiar
Si jJrr?i£. Mnt ¿rnJ Crtrnicrrcr. A; Cybmwifc^ vol 17, pp.206-21 5
StEgelmann- i!.["., and'E.D. Sunlag, 1991. "Lfvnng CWnpüUbihiy wíih flcurll mi*»'1 irffrrjr YOl <
pp. 77-60.
SimardP F., Y. LcCun, and J. Denker, 1993. ,fctíffic"cnL pjOcm recogntion uaing a tiew In-nsformalion distancc,” JdwA«s
frr Atañí/ Si'jPtwj. vol. 5, pp. 50-58, Sm Matw. CA: Morgan Kiiufmunn.
SimardP F., B. Vicíorri, Y. LcCun, and J. Denker, 1992. "langent prop-A formal ism for spccifyíng ¡idrclcd invanancrE in
an adaptiwnctwortCiíAuncai ¿n Abura/A^EmoAñn Sj’sJmr, vd. 4, pp. 89-5- 903, San Maleo, CA: Morgan K.aufmann.
Simmons,A 1989, ,LA vwwofitic wcwld thmughlhe hal"fi car: TheformatínníifacMsiic imajjcs in ecbnlncatmn,"CcgnítÍM,
Wl.33, pp.L35-|99.
Sjmnwnitj J.A., P.A. SaiLlant, and S.P. Drai, 1992, "l'hrciugb a hafí ear?" I£L£ ^pecfnm. voL.29(3 ! pp.46-46.
Singh, S.P., cd., L992. j^rnifaurtravi 77imT-i Spíine fmcfÜHU LTnr/^^p?KÉJJjmrj- Dordrechtj hc NciticfLands: kluwcr.
Singh, S., and D. Bcrlsckas, 1997. L,RcLnforcrmcnt Lcaming for dynamic channcl allocation in ccllular t^lcphím^^£y5Ccms1,,
rn Mnvp//fi/&™j.fjün ^ncc.rjf^S^TBBX vol. 9, pp. 074-960, Cambridge, MA: MU' Pites.
Singhath S.B and LP Wu, 1969. **TmLning fred-íbnvard nctwnrks wtLh thc entended KaJman filter,"' f££E
C¿--|riftlrc--rTíi,-4M j4c0ttf//cf, ^NKfrh pp.l IR7-119ílL CdflSjtQW, SontLand-
Siílgtelernh R.C t 1962. ,fcA test for Iíiiüt wprzbi I Í1y as apphcd M sel f-nr]ganizi ng machines " in M.C, Vcvití, C¡T, Jacobi,
and G-D. Gddstein. eds., frjfíhBanüftE ín/ciny. ppJ03-324aVtahvi||on DC: Sparfan Books.
Sjobcrg, J^O íhang, L. Ljung, A. lk-nvtnisLc_ B. Dejyurc P.-Y. GtorennOe, II FljúlmarSSOrt, and A. JwlilslyL 1995. “Nonlincar
blíkLk-bcn ir.iiLlc.-ng in >y>icm ideniIflcvtÍH A uiiifiod ümhview/' 'vol. 31 a pp- I 691 > I 724.
Slepian, Dla 1973. Á'o'ptrpm- ftt íj>yj/rí?rjr]frjj>^j Nw Vcwlfc; 1I F-.E Press.
Sloanc, N JJl.l and- A D. Wtncr. 1993, CfinHÍrfAvwiM Crjürj.-n11/Apcn; NcwYíirk: H IT Press.
Smilh- M., 1993. .Vcnftj/ lY^rn^Ht-v Jíar5r.sff¥rrrTj7 .ifor/r^rrjt;, bJew York: Van NiKíiíaiid Reinhold.
Sanóla, A J ind R. ScHIkopC 1996. ^Froui regularijalinn opcrarnrí t-n suppnrt vcecnr kcmcls,” A/mwej ¿n A^Jífu/
fjTJí t'.Y.YrrJ^-^rtflWl1! vnl. Iflt ro appcM.
Smolensky. P.b 1988. “Ou 1lw proper ircacmcnc cf Mnncciiflnism7 Setamr, wl H, pp 1-74.
Sontag, E.D., [996. ‘"Rccunmt neural nelwocks: Some tetmk|gand sysCeins-chcorctii-aspeéis,M De[\idinentofMachemalici,
Rulgen l-'nitersiiy, Hnjíiswick, NJ.
Sonra^, E.D., 1992. '"Fctd.baek stabihzalion URing twn-h ddcn-Eaycr ncL<' i£E£ cm A'cwihW'Xx vol.3,
pp.93j-99QL
Sontag, ÉJ>, 199D. Mz/^nufíáo? Coitírn/í^/L’nw^riffJ/cFuHiftD/fliMiÍQna^'i'ífcjrií, NcwYori: Springc-r-Vrrlag.
Süntag, li.D . 1969. “Sigmoids disLÍnguish inore fifflctefltly [han. Havisides,' ’ .'Vt'Nra/ Co/T^rf¿rrfoít vu]_ I, pp.470-W2r
Southwcll, R. V., L946. JtebnraTÜNi Aífe/Aiorff m TWkw/íciW 77ivjj?j. New York: Oxford. Univ-m.iy Prcss.
Spccfo, b.l,-.t 1991. LA genenl regressiun ncurd.! net^ork?' Jt'EE 7rüín<?cfjüuídn Acr/raí vol. 2, pp.5&8-57&.
SpwdiLii, A a 1997, L1Oa che«fuputatifflul püwer iif rwnfrrvnl neural n^Cv-nrks for !ímlcLure&1", A'roral Nrfwwfe, wl. 10,
pp.395-4OO-
Spcfdu:i, A., and A. Slarila. i 997. ''Supervired ncura.1 nctuorks ibr Iba classiñealiún of sinjctures," fEEE r^jj^úiL ^n^.Y mjj
A'mmí MAiwfer» wl.8. pp.-? 14-735-
Spwher» Ü.A^ IMS “Orí ihc slnicttm -of coniinuous foncLfons of several variables,1" 7rajrjínc//cíj!,j p/’íAc 4r?icrfc¿ro
.VíjlAc/narjcíj/ SoríL'fv. voLl I5> pp.340-355.
Sfceinhucli„K.a 1961. Lemimlrix vol |a ppJ6-45
686 Bibliografía
Siem, G.S.h 1973. “A physiúlogjcal m&chanism ibr Elebbs populare of lEarnirigJ^racreJjffjp o/JrcAfafwfluMciKfcmr of
Jcrenccj. LÍM, víd.Tfl, ¡^997-1001.
Sberiing, P„ 1990. ‘"Retina,'"in Ttatf Spruptic Jrarn, U.M. Sheptierd, rd., 3rd edilion, pp. 17EklL3t New
York: Oxford Univcrslty Pira.
StcvcnwEi, M., R. Winte^andB-WwinKY, 199D. ^Scnsitivily aflayered neural nctwcrlcR la htoth Inlbcwcights^/wYú^iLTrjortü^
Ji-.ijni í1*! Nturaf A'^OiTirtr, vnl.l, pp.337-34'Jr Waslñi'i^ioiL DC.
Sime, M._ I97JI, ' l u ---.-\ .iltdalinn: A review," .WarüfjHdJÍri.^ C^mtttajq^ncAuitf jtatff/trdtalL vüLV,
ppill7-l]9.
Store, M - 197^. ,'CrfflA-valida1ary choice and asscssiricm of Rta1 istical pf cdlcl inns " Jfltarvwí rtffAf 5Ydrrr.rrr.ftJ SbírcJn
vd D36, ppill-J33
Stock, D., 1989. b1s bíLGkpropíigíitiüTi btologitally plausible?" MlWWCitMMÍ Au-tJ Qn^IWKe1 un Mwnri Ncftwrfc. vol.2,
pp.2í I -246. Washington, DC.
Slrang, G-, I98Ü íWbJ rr.fl^pftiMrtoíu, Ntw York: Academia Prcss.
SJukLA-, and K. Ord, 1994, KrWrJnddttrweJ voL |, hth editioa New York: Halsted Press.
Su, H/I, and T. MtAw% i 991. 'Tdeniification of Chemical proceses usinj? recurren! nei^rfcsr^ract'Crfrrígjf c?/dre JM
jímerfean Cwtfwíi vnl.3> PP-23 Ld‘2319, Bitsion.
Su, H,-T- T- Me Avoy, and P. Wcibos, ] 992. "Long-lErm pred ic 11 dos of chrmlca] [wtmessk ustng TECunrnl neural nctworks:
A paraLLcl ii jiniruj app™ch,,n YnJir.rrrr.af £"FJXÚMtfrifl£ and CAemíca! fle.íesnc/j. val. 3 L. pp. IJ3H-1352.
Süga, N. | 99Q3.. "Cortical cflmputalicmal maps forauditaiy imajing," A'furaJ .¥pfu,nrtr, vol-3-, pp.3-21.
Sug¡i, N., 1990b 'CcTnipuiadüíis of uelwfty and ratigc ¡n che S.r «uditny syslcm fcr echo local ion,L| in CuropirüiJü™/
JVHrfwcíAKCp F ln Schwirtz, ed-, pp.2I3»23l, Cambridge. M.a: MET Pkhl
Sugd. N a H111---' "Bk^nar ¡ir.il ñ^urel COVQNItltion in hatS."Spto||^f Xmrrj\.-£J^T. tol.262, pp.60-68.
Suga, N, L9HS. “Theexime lo whichbiKmrinfanutÍM ¡a nepresemed in ihe bal audítoey cortea,"siiWiwc <?/"
G M- Eddman. W.F.. Gall, and WM. COMO. edL pp. 653-695^ Nt1*1 Vwk¡ Wíley (EnicrícicfKcK
Suga, N.b and J.5. Kuml. 1995. ’-Bcbolocalion: Crcaóng «arpadlñnil impía" M-A órbita, ed., TAe íín^íwt af
Anta ffican- flnJAfititfaJA'cmcrfcj. Cambridge, MA: MIT Press-
SuLiun, J_P., and J.A_ Andenn* 1995. “CompíitaiiMisl and neuíobi&logLcal feaiures of i netwófk af netwurks,1" in. J.M.
Bowcr, ed., TRe MwvMpJqgy o/ Ctw^ptrrjrj'ün. pp.3 L7-322, Bastón: Kluwcf.
SuttMa R-^-, L,1 jesniirig. Clt pr^diel h\ che IhúlhúdM af temporal AftHnCMa*4 ‘WúK-^ífjí1 wL 3a pp.y^J,
SuttMl, R.S p 1986. "Twkr problema wich hack-pnopHgfñMi and ctber atMpcsl-dtswfit Icaming procedurcs for netvmlHa"
/^tíítíATtsj qírAe ^Hiuraf CH^WKeqftff GspitfK Sr-íewiM ^ i- oí pp- 82J- S3I- HiUsdalc. NJ: barrenee
Lrltrnum.
SuLLOn, R .Stp ed-, 1992 Spccial 1WB on Re i nfonoement Lcaming, KkMk £wnilt£ vol. 8. pp, l - 395 -
SuLlon. R-S.t 1984. “Temporal Credií assignmenc inreirtfofeement leaming,'" Ph.D. Disscri-íiliwi, llnkírstly of Massachusolls^
Amhersl, MA.
Suttan, Et S a and A G- Bí-tlo, 1998. Jfriír/íwi rjntmJi^.r-.raÉnjf.-.-ljt1 MhMÓKlfiMl Cambridge MA: MIT Pneis.
SuykenS, J A.K-, J-P.E- Vflndcwalle, and H.I..R. DcMoar, 1996. Afetrr¿r? dVíl^ritr /ñr MMdfrtJ flwrf Ctafrv/</
Dordiccht, The Ncrhcrlands: KLuwer.
SwiiwiLchurst,. A_L_, MJ. Gons, and B. ÜtbmtEn, 1997. "‘Some «.perimenis- wilh irray daia túlIcctEd in actual urban and
suburban enviranmentR,"' /EEE ttbrftih&p m Signaf Prvcessing Acfcattes fn Híreírjs Cümmwnicaíionr, pp_3UL-3ÍM,
Parí?, Francc.
Takatiafihi, ¥., |993. ^General¡zallan and appnox.matLün capahilif.es úf multilayrr nrtwrirks/" A'raraf Compu'íúfTnff,. vol.5,
pp-132-139.
Takens, F-. 1981. L,On ihe numcric?] ddcrminatLqn of thc dimcfiiion of an attraeior" in D. Rand and US- Ycwng, eds.,
Drrajnjtu/ Sj4Aw umf rirn&wAwc- Annuíl Nolcs in Mathcmalics. vol 898, pp. 366- 38], Bcrlm: SpnngepVetlag.
Tapia. R.A., and J.R. Ilwmpson, 1978. Mh{pdFiMMrít F/üAfltM/íA' Ociurry Ejíj'^aft'tr/T. Baltimore: The Johns- Hoptins
Umverbtty Press.
TaylcM, J.G.. 1997. ‘'Ncurel computación! The híAOCKll haakgrnund,” in E. Fichen and R. Reale, etK, ffrrfJAtiwA (j/j¥™m/
CtefptftatiM, New York: Oxfcrd L'mveniily Pncsfi-
Taylor.W.K., 1964. '"Cortico-Ehalaniic organizaron and metnory," ü/ ífctf ftpví SocríXt; Lnjhírwf. .íerj'tT fl.
vol.]59Lpp.46647 R.
Taylor. W.K_ 1956. HE]ectricaJ RimulatÍMi of^ame ncn'ous syRtcm funccinna] accivities/' 7W0^. wl. 3^E.C.
CticfryL ed.L pp. 3II41-328, Locidon: Bucttrivúflhs.
Tesauro, ü h 1995. '"Temporal di-íferencc learning and TD-gnnuTW,” CawBttJvtaart«u of rte .IfSrTeddJXM./íAf
.l/íjrÍHMO; vul. 38, pp. 58-68.
Tesauro. 0 b 199*1. 'TD-Gammort, A sdí-ieaching EJickgununofi prugram, •cWwesmzsrer-level play,” A'fura/Co^Mrtóftóíj,
vol. ii, pp. 2(5-219.
Tcs3luü, Ci., 1992. '"Practica] isaues in temporal diflereftec IcanainaJ’ MkMhc Lt'úrnitig, vol.A, pp,257- 277.
lüSSurü, Ci., 19R9. “NnirOg¡i.TlrtrrtL'in wLrts ^LWpulcr rtlympLiid,11, CowipH/fl/'ííM. vol ]. pp.? ? I -313
Tesauro, Cr. andTJ. S^jnowvfcir I9S9. ”A parallel ndwnrk chai lurnt loplH-y bKkpinnoni** /I n1 r/rcítrí ^rír,rJígcuct,l toL 39,
pp. 357-390.
Tesauro.O-. andR. Janssens, L9SS.TSotvilrtl&1¡ondlÍ¡BÍnIndc-pNpipítiMleming,’1 CMHptotírjtrw^y. vuJ.2hpp. 39-44.
Tcylcr. T.J.l 19116. EIccLrophysiolcgk’al anatagffTin £«mr^$ oi^ ¿tierfegríY^ LÍfh; J.L. Martínez, Jr.
and R.3. Késíicí, edsn pp 237-165, New York: Actdemíc Fren
TlbOfrtdiltf, E.L.i I9| l. Jhft'/A'gtwiK DeriervCT: I liflur.
Thrunt S.B., 1992. "'The rote ofapfontiüH in Lesan!.:íoncricil in JjifrJfigrní Ca^rJ^u/. D. A. WHtCand DA.
SoFgeLcds.L pp.$27-559, New York: Van Mo^irand RrinholcL
Tiktbnnfflí. A.N-, 1973. '^On rejutartarinn of ill-poscd fwnbleni/1 JÍMÍ tZ-S-íR. wL Lfl?h pp.49-52
Tikhnno^, A.N.L 1963. ,LCti Aükárijj i nenrícet]y pnsed problema and mechad oF nc^ulari ^EÍLiab/1 ZhjJtfrjdi-^Wenrir .VrwA
L/.™, vol. 151, pp.501-504.
Tikbcmov, A.N., and V.Y. Aracniti, 197?. Pnjfttaiii, Washíngion, DC: W.H. Winsion.
Titterington, D.M., A.F.M. Smith, and V,E. Makov, 1935. Sjjji.wkü/ .Jjnafr.ffr o/Hmífí? A-íurrurt? Di.wríftkrrflrií; New Yorl
Wiky.
Tnurclxlcy, Dí¡._ and D. AP Fomerfeao» I5W, "WhaL i| hidden ín che liiddcn Lyers?" R^c. «1.14, pp-227j 333-
TsilíikRsL J.NP.. 1W. “AsysdllOMUl ftodwtit MpprysLn^iitinimdQ-leamin^.WíTrfjwÍDsnq^rg. vol. lí-. pp.18-5-.202.
Trtfii, A.C-, and ArO. R*ck, 1994, "1 J0üálly rtiCurpL-rtC gjobllly fttdfÓCWird rWlwtirks: A CTÍtiCtl K¥ÍeW,H/£úEE 7Vtintó£tí(>flí
M Nhwi Jítfworfcj, *Ql.S, pp.229-239.
Turing, A.M., L952. ‘The Chemical hasis üimorpliogcncsisr- PArtara/j-Ajed/ TrtJn.SdFCJj'owrt/'jA-l? .^eow/ükIíO'. R- vol .2 3 7,
pp.5-72.
Turing, A.M., 1950. "Compuiing machincry and inlclligcncc,” A/jW, vol.59, pp.43 3-460-
Turing, A.M., 1936. n,On compulahlc numbers wkh an appLication to thc Enischeidungs prablem," Pfúl-lil1 Jj^í- rAt-
ÍMdofl Afd-rAemdJJí?üJ.$oc<e(ft Sc-ncj 2, vol. 42, ppP 130-2)05. Corre^ü publicada cm vol.43, pp.544-546.
Tspi, A.C-i and A, Backt L994. "I jficflllj- nofiirT-cnL^lnbally FDfdFnrw-ard nclwcwka: A crilicaí review,” Thwwribflf
Neurni A'cíiiwis, wUr pp.2 29-239,
TzeFcstaí, S.ü.,cd., IW1 AdrfAüJj újrrf4pp/j?HtíoBr í^/fífr//¿g€íií CdhiPu/, Boston.: Kluwcr.
L'din, SB.,and J.W. Fawcctt. L^tf/Tomalion of [c^graphie map^'/fHjrNa/RcTfc^'t^A'rNramcJícc, vol.2, pp.289-327.
Ukraíncc, A.M^. and S. Haykint 1996. kA mndulíir neural «hrttft For eflhmcertttií of effiíf-políiT radíir Ungeís? AfaimT
AtaiMiribL vol .9, pp.,143-168.
UkjBincr, A__ and S. Haykin, 1992. **EflhUttinevtt <if ™Jiir imaycH using mulu-nl n forran ion bíised unsuprrviscd neural
nctworks," Gm^tan Ca^rsicc o^r ¿krfrTíY^ and Gi^rprjJer pp. MA6.9.1 - M Aó.9.4P TurontQ, Cañada.
Uúley, A.M.i 1979. A^&rwwfikm ?)wjwrpu>jf<|n m ¿A# AtenVoi Aiwfr-jn, Lofidfln- ÁctdenUc Fn^s.
Ullley, A. Mi. 1970. "Tlw infonnon: A tKlwi¿*k for kdtpcive píillíni neetnidonT-feknu/ »l 17»
pp 31-67.
Uuley»A A1n 1966. “Tbe tnmÍBBKn^F information and (be cITccl ofloca) fcedback in theontiol and nc-uraJ licLuMOíks?
ffirtrin RerranrA, vnl. 102, pp. 23-35.
LJlllev, A-M., I9$éí. "A Iticory of rhc mcchanism qf leaming hased on thc computaron of canditional pirihabiIitics/'
ftwwttivr n/Me Fj^.'ü AlfimdtkwM on Lj towrtcv- Namur, Cr-auibLcr-VÍJlara, París.
Vaillint R., C. kítitirocq,. =i id Y. l.eCun, L 994. '^Original approach Fürlhc Eacalizadraiofobjccts in imagci,1' JEEftpmdblff
f/.rjjzíírwrJ fjjt Hfjdíri, jcl.i.i Utti/Sr^rJú-y FnX'f.f.ífÑjí, VOÍ. 141, pp.245-250.
VUavuíI, K.P., and G.N. Saridk, L992. NarwcIL MA:
Kluwer.
Valíant, L.G., 1984. ,LA tbcory of thc leamable." Cmmiim/cvJhuu ilnKndhM_for Ctrmpjrrfflg jW^cArócn'. vol.27,
pplí 34-1142.
X'andcrbci, R. b 1994. ‘ímcrior poi nt mclbnds: Algorirhms and foraiu latinus/' F7R.74.AiJrrwdJ rwr Compúrúr^, vdA pp. 32-34.
Van Eiven, D.C., C.H. Andcrscm, and D.J. Fcllcman, 1992. "'Inionnarian proccssing in itic primate visual systcin: An
integrated systcms pcrspcclivc," Srfa®ppP ^'qI.255, pp.419-423.
van.dc.La3r, P-.í. Heskes, and S. Ciiclrn, L997. "Task-dependent leaming DfaCtmtion/A'frd^/.VerH'ork?, vol.K), pp.9B 1-992.
van La&rtiüvenP P.J.M., and L.H.L. Aads, 19S8.5j>»?rjJd/£j4tJÑé,a!^jg.- Boston: Kluwcr Acadcmic
Pub..silera.
VknTms, H.L., LíóH. üc^cíjm. ¿.sfrwjjftat AAiAobJ^v? 77iefl/n, Part J, NcwYeirk: Wilcy.
14fl Uutlr, M.M., 1997. uNünparamcrric dcms-ilv cal natiun and irgression achicved with tüfwgra.phic maps riLaximízing
lite inFormaiion-iheortúc tncrvpyof ilitir ouipuis." wl.77, pp.49-61
88S BlííLJDCJlAFCA
Víib HuLlv, M.M., 1996. nlTopügraphLC map fnrinaLion by maKimtzing unctmditional cntropy: A plausible straiegy for
L,oh-linen' unsupcrvised Dümpciitbvc leaming and nanparamctric densily cstimadon,” IEEE Transaeriotfs onr Afeurui
Atm^r+.v. voL7, pp.l 299-1303.
Vari Vttft B-, 1992. “Mínimum vjrianec buntfbfinin^? in S Haykiti and A. SleiríharcH, cds., JJü/írA-ir Jtafar Auo'ejíriJí
fnílMtfott; Ne^York: Wiley ([nierscicnce).
Vapnik, VPN-, 199S. SrdfUjjíüüütmiÉFJjí TAton', New York: Wiiry.
\^pnbkflV-N-, 1995. ArjfHf¥^.5ftldjrfC3/ í-ctrrnrrjí Tjfrcon', New York: Springrr-Veriag-
Vipnik, VN,B 1992. "Principies of risk mniníotmi ibr learning íhcory? 4diumrei m jVvjhjíz! J^bnwtfcfl ftwmúlg
íla^'ftt.y, Vülr4, pp.SS l-RSS, San Maieo, CA. Morgan KaufnLann.
Vapnik, V.H, 1982. E.sfrnddrríortofDTHdflKtffAmrfM Effl/Ai>j?uJ Éferta, Newlfork: Springcr-Vtrlag.
Vupnik; VNm iid A-Ya. ClHvoonkiL L9?l, L,On thc utiiform coiwrgcnce of relave frequnñi of c-cnis to their
probabjbticR? TTien^rjcj/ AraJwfu/r¡(^ áhdltt Xppíj'co/ro/rs. vul.l7, pp. 264-28ÍJ.
Vapnik». V.Nr. and A. Ya. Cherwncnkífi, 1964. ”A noteon a claHS of perceptrons,"¿jfjJ Eewwje Cowrníí» vol.25,
pp. 103-109.
VcLmans, M.» 1995- 'ConRciousncss, Thenrics oí? En M. A. Arbib. cd„ ntfMuidbíKAD/jRhaOr ZletwT.'mNÍ A'eNrjM'íYiiw.ts,
pp.247-250, Cambridge. MA: MIT
YcnJcataraman, S., 1994. "Ün entodmg nonbnear útcblhLlidm in neural nctworks for locomotion,’" qffhe JfrAi
Ka/e HwtíAopnn djrJíeunfrpE^iJfems, pp_ 14-20, New Haven, CT.
Venkatesh, S.J., O. Ranche. D_ Prallis, and G. Sítbí, 1990 "Shapmgattraction basins in neural ncE^orks,"' MwqJMrTMwfc.
votJ, pp.ól 3-623.
Vellerli, M„ and J. KoraCevií, 1995. Wivc/c/j ont? Sbb&Md Coiíj>rg. Englewoud Cliífs, NJ: Prvnóce-Hall.
Vidyusiigiir, M B 1997-yf TTwwj1 afEwitiqg t™/ Gt'm'iWta/tal 1 xindon Springcr'Vtrhg.
Vidyasagar, M . 1993 Nufllwr Swww d-Wi-rf.v. 2nd ediiiop. Enftavood ClilTs. NJ: Pninciw-Hall.
Viterbiif A.J., L967l Tin» bounds íúr cünvoLutiortíl túdte and an ásympltMically úptimuaíl deeudirtg algoriLhm.?1 JEFE
TraM.raoíioru oh /^Etrnuriwi Tfríwy. vol. 1¿'-L3P pp.?60-2&9.
ven drr Malsburg, C._ L990t '"Stíwork sclf-arganizaE]™,"- in An /jrriWHcrfou ro Mfwui ¿md E/ccfranír Atn+'onfcj S.F.
Zümctzcr, JL. Davts, and C. Lau, eds., pp.421-432, San Diego, CA: Acadcmic Press.
ven dcTMalsbur^ C., 1990b. '"Consideralians for a visual architccturc,"' an AAun(Jw/Afurj? Ctmfipjrí£,r.rP R. EctmiLlcr, cd.,
pp-303-3 L2, Amsterdam: Morth-Hnlland-
von de - MaLstaji^C., 19K1. 'Tticcnrrelalion theory ofbrain ftiDction,'" /iepo^í Í/-2, Departnumtof N™rohtíklngy,
Max-Plank-lnitbtuLc tbr Biophysical Ctttmislry, CioLtingcn, Gcrmany.
ven der Malsburg, 1973. "ScIf-üTganitaliün of orteatatk» HUlUvt colk in ihe Btrílte turfes? vqI.H,
pp.W5-lÜÜ.
von der Malsburg, C^and WtSchneidcrH 1986. 'A neural cocktail p.irfyprwesjHjr^JUWS^gi^CbfrcrmVícs. ‘ol M, pp.29-4Ü.
vnn Ncumann, J., L9S6. wnt M idmm tur ComptiXúrg tuwí CtN^pNíer JAwry W. Aspray and A. burles, cds.,
Cambridge, MA: MtT Press.
von Ncumann, J., 195S. Tfte CowrptJíerüÑJ rfre ífriaúr. New Raven, CT: Yalc Univcrsity Press.
W Neumann, J., 1956. ,LPlühabilisJic Logjcs and tbe synthesiH of rehable organillos from unrcliable coI^p^nenLIí,,, in
CE. Shannon and J. McCarthy, cds., pp. -43-9S, PrinccttMi, NJ: PrinccEtm UnivcraLty Prcas.
Wahha, G.% 1990. .Wode¿í /ór Ofrserva/JíWfi:! Arlo. SIAM.
Wahha,G. HR-Johnson, F. Gao, and J-<long, L995L*lAdaptivc tun.ngofnumcrkal weatber predictionmodch: Randomiied
CfCV in rhrce and tour dimcnsianal data assimtlalion/" .WbnrA¿i- Eeirfeib, vol. 123, pp_3JSS-1369-
Wathel, A.. T. Hanazawa, ü. Hinton, K_ Stiikano. and KJ. Lang, L9H9. "Pltoncme rccognitinn using time-delay Dflnl
nciworkñ? /£££ Trurtsocrforis Pr&cej.íújffp vol. ASSP-37, pp.32R-339P
Waltz, D., 1997. ‘'Neural nets and Al: Time for a synlhcsis," plcnary 1alt, Jjrfe/vwrfíoÑdJ Cr?jf/LWÑ¿df nq jVeAWTitf,
vol. I, p. k¡¡¡, Housrnn.
WaLtz, M.D., and K..S. Fu, 1965. “‘A heurisíic appmach 1o rcinforcenbenr learoing CúiblTCíl qyvtefu? JEFE TfflrijcTrffons twr
vol. AC-10, pp.390-]9S.
Wan, E.A., L994. "‘Time Renes predietion by using a conncelionist network wilh internal dcl^y linas? in finre ütritJ
EreJíbfro^.- J¿?n?c¿zíf^j_í íAeí'uftdñíüFjJ Anfp A.S. WcigtndandN-A. GfrshcnÉield^eds., pp. 195-217.
Readmg, MA:: Addaacm-Weslcy.
Wan, E.A., 1990. "TfthpCrfal bdekprúpagaiiun forFtk neural ncfworkp? Cbft/iTúflCí1 cu .Venrtrl
At-fiLorís, wl. J, pp. 575-580, San Diego. CA.
Wan, E-A., .i i.J F. Bcaufays, 1996. ,LDÍagraítl]naiic derivzlion OÍ gradient algorilhms for neural nerworks/1 Mnira/
Gwnpiífciftcj'JT. v&l.8, pp. L82-20Lr
WbteHbe. H., YamagurhL ud S. Kadgiri. 1997,. ,LDiscrimiiwlne mtínc design for rebutí pattem mogniiion? JEEE
TrjFj.wM-jjowjt iw SjjjmJ vol .45, pp.2655-2662.
Walcrhraiic, S., D. MacKay, and A. Rohinson. 1996. "Baycsian mcíhods ibr mixiures of cxpcrts/ ín Afenraf
/Vtwesriltg StWrfl.r. vol.K, pp35|-357TCamhridfB; MA: MIT Pfims.
Wattm-CJCH.. L9S9. /-fiTJTjjí^g-/rrjrtT RfWffllfr, Ph.D. Thesij, llwversiiy of Cambridge, Fngjand..
W^ikins. C.JC.Hf., urtd P. Dwyui. 1992- 'X^leaniing,'1 Jfcrtfeí' /.j-xr™rjg. w|. S, pf\179-292,
WtÉTüUt»R L I9R7. "l^irrting al^cinihiiií Fot iMirtütiMiónisi rttiwLwkfl Applied gjadiLnl incitada of nonlincarof^.m-ization,"
CF /jaft'JTiüJj'rjJzti/í -jri L . .'i. । irJ iWjíruf AíVut^ÍJC, wd, 2, pp.619-627B Sm Di-tg.0, CA.
WatuaG.S., 1964. "Srawttrcpenufi.1-1.1 x -.¡C .^nzMv¿.- ÜerteM. vol. 26,pp.359-372
Webb, A.R._ 1994. “FiiMlfcnl apprcnümalun by feed-forward neiwrki: A lca*l'Sqiwcf appnwh io general i sal ion,"
IEEE Thrn/mrJjt™ €?□ iVcirniJ A'brM^rír, wlJ. pp.4R0-488.
Wrhb,A.E., and D. Lowt. 1990. *The upiimal intenulreprerentilionoftnuliiliyercliMiliernctwwkiperibnnsiMiükKir
discriminant arulyEis.'" .Yei/nrf AfeTwwfa, vol. 3, pp367-375.
Wrigcnd, A_S., 13. Hubrnmm, and D. humclhacl, 199U. "Predklipg (he filtUK A tkmnw;lioni.sL uppruach? M-TrrHnfifru/W
JitMíma/ jVíejjyt/ ^i'sXerws. vol. .k pp. 193-209.
Weigend, A.S„ D.E. Rumelhad, and B.A. Hubennun, 1991. “GuenlÍKdioih by wetfH-eliiniitólicn wilh appiicvtÍM to
forocaRting, ^tñ-üFicrj ¿fi .Vcjrnf?//níunm?fí<?n ftiMüiiiHgSvjfcmy. Vúl 3, pp. 875-882, Sun Mulcu.CA: Morgan Kaufmami.
Weiperid, A.Sl, and. M.A. Cenhenficld, cds., 1994. 7¡heÍe,^ks/pnv/rríjí?n.- fiwrcm/fFig /fie Furtr/r ¿tuJ LWcn/a/rJíng rfce
Fasr, vol. 15, Santa Fe Inslilute SLud]« in 1hc ScicncES ofLompk\ily_ Rciding, MA: Addiüon-Wcslcy.
WbWHllW, K-i 1885, ,LUhcr dir analyEischc □arRlcllharkcil Kogcnannter wilIkürJichcr Funktioncn cincr rccllcn
vcrdndtrlichcti,” Srriudj.tfier/úArí t/¿'F.4ÁdJ¿?flíde pp.W3-639a 7S9- POS.
Würbo^i PJ.i 1992, “Neural fKíwotto and ihe human mind: N«- maihem^iics fiti hunani*tK iuigfrV1 JEES ZhttnM/taBdí
CcnA'irmrc M ^>WWP Wfln. ffnf? Ci-ficraríM-A-. v<il, I pp.784)3, Chka^o.
Wertrtn^ PJ.,1990 "Daekprupflgiiúuri chruugh túne: Wbart ii doe^ ud how to do ¡t" FtocMrtqgf </ rfir ¿EFE. vol ,78,
pp.l5$U-l56O..
WedxH, RJ.i 1989. L,BatkpnipagaLion and onmcniliol: A rtvieu and prospector AMmoffoM/Jtrj>Tf Caitffemtce ch?
AfauraT AAtfMirib wl. 1, pp.209-2lb. WastiingCuni D€
Wrrbos- P.I., 1974 "[^yondi rejreiSLiici: Xvw moh íflf predieiiofll^nd anaL^RÍR h [he behavinrftl Kíencu" Ph.D. ThesiS;
I lañan! Uahmil^ Cambridge, M a
VfettKbereck» D^udT. Diecccriclk L99?. -Imprrivingthe pcnTnmLancc of radial buh fancti-nn ndwnrkñ hy Lcaming center
loGaírans,"' XjA-lj riL-c? m iVfunuJA^i^uricHi wl 4, pp.l ] 33 - ] 140, Sun Mú1tü,CA"Mw^n Kiniímann.
WhaCr, D.A., and D.A. Sofgr. rds, 1992. í^ieNfetn/ CMfHrf.1 FirZ2>\ ípmíádtapfh'c1 í4pp*wchcsNew
York: Van Nostrand Rc iitiold.
White, H., L992. ^rrr/jcúaJ i\cjrnra¿A'c/iii&r-ij.-rfl/íjpiTi.ví^uJítw ít^í? ¿tvrrníní rficxiFT. CambriJgth MA: BluikwálJ.
WTntr, H_> r/JO/X-onneclioniüt nojipD.TamLlnL_TvgreHsiun: Mullilaycr ftvdfwward neTwofks Cun Itram arbilrury mappmgSi"-
Msira? .VcOr^riU «13. ppJJ5-549
White. H.» 19R9a. “LeinwiJ ifl arñílcial neural nccworks-: A slatÍKtka! pc^fipccLixx:,,, Afewi?/ L'rtfFiyiH/ürirw?. vol.], pp.425-464.
While, H-i Í9R9hi “Somc asymploLie ieuí1i& ibr leaming in single hidden-laycr tbcdEonvard nrtwork modrls/" Jónnw/ o/
Mt StatfctiMÍ Aíej'*.1/r, wpl-Mp pp. LOM -10 L 3.
Whicncv, H., L936. '"DilFcncnEÍablc manifolds,"1 vúL 37, pp.M5-6KU-_
WhíEEakcr,, E.T., 1923. ’XJn a ncw method of graduation." F/ücre^j/rgi qf/fie fAn^urgA SocrrA; vol.41,
pp.63- 7JP
Widmw, R.. 1962. '’CjcncraliHation anuí Information Hlnrage in networks-ufadalinc 'ncurunsV in M.C. YoyiI.é, CLT. Jacohi,
and (i I) , Cmldslcin. cds., Si aten?, pp. 435-46 L Washington, DC: Apartan Booka.
W¡dnowLH.LJ.M. McCool,M.G. Larimora, and C.R. fohnson, Jr.. 3976. "Slationajy and nonjrtationziry leamipgcharactcriEtics
cf"Lhr LMS adaptLvc lilter,'" f£C£. «1.64. pp. I L51-1162.
Widnmy, ñ., J.lt Cilovcr,Jr., J.M. McL'ool, J. Kaunitz,CS-Williams RJi. Hram,J.R. Zridlor, J. Dong,Jr.,and k.C.CrDodlin,
197S. "Adíptiví noific esncelling: Principies and applicationsf F/tJr?jYt/./iy.r a//fre JEEE. «o|. 63, pp. 1692-1716.
W'idrvw, B.. ^I.K. Gl^tB^ind S. Maura, 1973. "Pv.iiish-ncuard 1 evnin^. wiíhicntic in^daptive thnpthúld s^sccmE," JEFE
unJCj ¿uTYk'/ñ .h. vol. SMCv3-, pp.455-4ri5.
Widmw, B., and M.F_ HolT- Jr._ L460L '"Adaplivc swibdhing circuils,’' 7í£ fíEÍCfJjV í"i«n.í,fl//D/r Itacwil pp. 96-1Ü4.
Widnow, B., and M.A. Lchr, IMO. "30 ycars ofadaptrvE neural nctworks: Pcrecp^njn, madalinc, and backpropag^L on,”
í-rf/Ngs rfií tatiJWfc ctf tTc-cP íclIÍ and Efeí-fliPÑjeí E/igrt?cc/T. vül.78, pp. 1415- I44J.
Widrow, B., F.E. Manley, LJ_ GnfUths- and ElB. £joodc, IMT/’.AdaptivcanlcnnasyFEemñf F™?£i?íÍ/ñí’s o/fAe !££EP voL
55, pp. 2143-2I5*J.
Wídrvw, B.i fiíid S-.D. Steuvw, 1985. EnBjewwdClifft; NJ: Preinke-FitíL
WiAow. R., íimJ E. Walích, 1996. Atw» CmívA Upper Siddle Rr- >t. NJ:¡ FtwlkeJtaH
Wiclítíid, A . and 1? Leighcnn, 1987. ,lGwmclrie analysis of neural neiwcrk capabiIiúeC ftnt XEEECwi^wkí
jjn- A'ítj™-? AVfiLT.hi-JLx, voL ][], pp-jS-S’192, Diego, CA.
890 BítUKftAHA
WteoerpN.J961. Qtarndtaf, índedátion, NcwYorfc: Witey.
Wiener. H, I9S8 NMflteKr r-a Séjír/w 7Wwn*¡ New York: Wilcy-
Wiener, N.P 1949- Esírupaífl^mr- /flffrpüJaJ/w?. erro/^ífflfrúi^wn' íjítt< Strfet ki/fi ¿'ijgjmvriffg /Tppífrarráas.
Cambridge MA: VÍT Press (Foi mgindmcntc laucado comoNalimíil Dcfrnsc Rtsrarch RrportCiHssificado, r'cbruary
1942).
Wiener. N.b 194J1. CyAejwitfks. Oír ConfirJmrfCbmflrHFUMfJtwr in ^ñe dirima! and ^4 AfcrcAifleP New York: Wüey.
Wilki, $.$., 1962. Mrt*swriu!5ta¿¿F^cs. New York: Wiley.
Wilhams, R.J.. L992. "S.mpleslacEtcal gr&drnt-fallrwing algorilhms farcaainMlionist reiiforccmcnl leaming.” Afirefl'úw
¿fff^nrr^g. voLi. pp.229-256.
Williams, RJ.p L988. "'loward atheury üfremfaTcrmeni-IrajriingtüínnrcliünLEt syslcmiC Trcfi^iciJi1 Eep^rTATU-GCS-fií-J.
Coltrge i?f CcimpuLcr Science, NoctheasLCm Univrrailyh Boston.
Williams, RJ._ 1915. ^Peature disco^rry fflnugh <?nvT-corrrvli<in leaming?1 ItaJtafto! JtíjBrt ÍCS-X5OJ. Univcrsity of
California, San DiegutCA.
WilkLams, R.J.. and J. Fmg. 199ü. “AnefificicnJ gradimt-basedalgorilhm furon-line tramijigüfrccurTrnInclwcirk IrüicclüriK/1
Venra/CompuXcTfj^n. ™l.2tppi49O-S0l
Williams, R.J., and D. /ipser, 1995. “tirad-L-nC-bíiscd leaming algurilhms fot recurrent nrtworks and ihrir computaLimaJ
cúmplcxity,’' in Y. Chauvin and D.E. Rumelhar1,-EdE.,EaelpnvMguriüFr.- TAcYjn'.djrArrcrfrdres. unJ^ppiietf/iQiu. pp-433-
4156, HitLadaLc, NJ: Lawrencc Erlbaum.
Williams. R.J.. and D. Zípsrr. 1989. "A Iraní.ngalgorilhm íbrcontinually nmning fidly recurrenl neural nel works,"" .Veiiraj1
CtapulariMl vol. L pp. 27(^280.
Willshaw, D-J.. O.P. Buncman. andH. C. Lnnguct-Higginfi, L969. HNon-hokigrapihLC aRsoctativcmcmory/Aüfn^v-r4-ü*t4Íüra/.
TCI222, pp,960-962,
Wílkhaw, D.J.. and C vnn der Halshur^. 1974 “Huw pacccmed neural nfimctiofW can be sci irp by $d_ n-:i-:;iirj.iíí^h ''
ffjyj/ Sbetan ¿íwfofl JJ. toL. 194, pp_431 -44S.
WLLson. G. V^andCirS- Pawley, 19158. ’,Onlhcslabihty ofthe trawdling salcsman prohlem algürilhm of HeipÍLcldand Tank,”
C। Acnwrtu; vol .SU. pp.63-70.
Wríht>ik H.R.. fifld J.D. Go^ac, 1972. "'Esteilaccwy and inhihiiory inieractioníi in local¡zed popularifltis úf rriodtL rteurcns.H
JtfUrritfV (r/“V0L12, pp-1 -24.
Windef, R.G., 1961. '^¡n^LcficageihitúwLd Iqfjcf SMCriAQ Cfrndf AEEE Spwiab htikllHK»
vol. S-1,14, pp.]? 1-332.
WlhQgRd^ S-n and J.D Cflwan, 1963. JteffaMr Ctaptfürtwi tóf qFMÍM. Cambridge. MA: MIT Rress.
WoJpert+ D.H.i 1992. "StacLed geDenllattoaf1 .^'ewrtJÍ Mtfworfs; voL5, pp 241-259.
Wroodt N.L..jind N. ('uwan. L995. "ThewcJtLail putyptnonHnDnrevdfUed; Aueniiom ai&d menuey in ihc tlussicwlcciwe
llilealqgpfwedm ofCbenydmJjrJfcwrwf Gíjíiíjuf. vol. 124. pp.2-43-262.
WdckLvW. A.l 1986. "'ImporLaiU ¡fatucs in kriowlcdgc npwHivnr1 r^7te7íiífdfidfí ¿?fFkvr?^ydíriJÍSBC#wtfar
vol.74_ pp. I 322-1J34.
IS^C-FJ., L93_l. 'Xht Ituc cíinvcr^ence prapertiei qí thc LM algorithmr' ü/Sdfüfr£frejP vol_ L1, pp.9^-1 Ü3.
Wylic, C.R.. and L.C. Barrete. 1982. jidwiMd fjrgrncm-rrg AfíTrórrTiLirkr. 5th ediliem. New York: McGraw HilL
Xu, L.. A. Krxyiak, ai>d A. Tullir, 1994. ,L(Jn fhJij. bufl íunCliun neis and kcmrl regressiun: Slalistical rcinsiítcnry;
conven;cituy rales, and nxrplive field sizt.L| Ar™r¿n’ A'íFhwíí. wl.7P pp.6O9-628_
Xu, L„ E. Op, and C.Y. Sutn, 1992. "*Modlfird Hebbian leaming for curve and siirfacr fitting,’1 iVeurai A’efwürfcí. vo]Jp
pp.441^157.
Yang, H., and S. Aman» 1997. "Adaptive onlinr kamtngalgorrhnis forb'md separadon: Máximum cntmpy and mínimum
mutual intojmatLuru" Afainf vol-9, pp. 1457-1482.
Y«, P_V., I9Ml /iegrJíjrrzfJ RcKÍrul Saris Fwncfwít aVeMo^ts: «rf
Cid'sjr/kaj'iari. jaJ Tíme Senes Antaftaq. Ph.D_ ThcsÍE, McMasler University. Hamiliim, Oncario.
Yoclcey, BU., 1992. frr/¿n™fw¿r Fíimfv ¿rod .tfoZceií/ijr Cambridge: Cambridge Univcfrity Presí.
Vosliizawa- S., M. Morila. and S. Aman. 1993. HCapaeity of asEociative niemo^' uiin¿ a wnnwnDfDnK MURO medd "
A'erj^ji Mrftwrb, wl. 6, pp. 167-176.
Píulch. i hA^ 1973. “Üul lint oía ne^ íipprrwh Co the analys-is afeomplcx systcms and dec ision procesan," 7EEE ThSMSKftMl
oh Sysr^M. AÍüm. Q'AfMieji^je, yol. SMC-3. pp.2S-44
ZadehP L.A., 1965. HFuzzy scK' Jñy¿?™íjjiüri uriJ GwrJrrji. vol8. pp.338-353.
Zadch- L.A., 1953. fcA eontribution to 1be [htúry «f nonlineár qrUMur/ AhinAfin Arsrfíjrte. voi. 255, pp_3157-4QI.
Zadch. L.A^ and CA. Drsorr, 1963. ¿j'^r Srsíerw Tlkwy; rteNew York: McQf*W Bill.
Zamrs G., 1981. 'Teedback aj>d óptima! EenEitivity: Modcl referente iransíbrTnaCiüiis. multipliati» srminormE. and
Sppnox ;nete irwettfo/1 JEEE 7ra#Tsactfons o« uAutoRaiie C.oMfmf. vol. AO26, pp.301- 320-
Zamcst Ci.b and B.A. Francis, 1983, “FccdhackL ntinimax, acnsil iv iíy,. and nptimal mbuslncss," .r/.7-.7T Tmtt.taclifífi.': ati
VOÉ- AC'2íh [kp,5R5->6GI.
Zcev^ A.-T-, R-- Wcir, and V Mapmv, 199S. n,Errof bfluhdíi frir ftlKtíonal flpprdstnnaliíin ¡ind £*1hsbft1¡flnillÍP¿ ihixhUH cf
cxpcnfi,” ÍEEE PdrtMífrflMi dn rtwiy, vq144, pp, 101(^9025.
Zcki, S_, 1993. ií r¿idtijr .Brtaw. OkíotcI: Blackwell ScictiliHc PühlicalinnR.
ZifMf, D., and D.E. Runiclharl, 199fl. "'The jwiinnhmtügical ^¡¿niilcancv ftf Ihe íkw leming modclsj'' in G>nd/wrrJ'J<^ír/
NwvwtaKV; F..[.. Echwstnj, íd.B pp. 192-200. ranihdd^ MA MIT Ehusíí-
Hidden page
índice
Acumuladores, 560
AdaBoost, 394, veja também Rríbnfü,
descmpenho de cito, 3%
resumo do algoritmo, 396
AgjtipñmenUi hierirquitó, -18
Algoritmo dü minimizaría do valor Esperado (MVÜ),
416-11
aplicado h modelo MHE, HA
Algorilmo da rtropropag&cto de erro, vqa
TtcrtrprtipagsfÍLó
Algoritmo de BroydEn-Fletdirr-GlDdEajb-Shannó, 27Ü
Algoritmo de Davídon-FlEtclKr-pDwcll, 22Ú
Algoritmo de extracto adapEativa de cómpOncntefi princi-
po; s (APEJQp
iñ-l-Ur.:-:
Algoritmo de Lloyd genrrali^ado. 4Í6
Aljforitmo de rctropropaga^ío, 18S-2D2
«nwerigjfincta acelerada doh 25fr-2fifi
cccwtjtoña do. 252
critÉrios do parada, ?DH
eficiencia computacional do, 214-2.56
escalamEnto. 253
gradiente local, LOO
heurísticas, 2ÜU1L
inicipliza^to, 2D0
mínimos locáis. 252
modo por lote doh 132
modo seqüencial 1^199
momento, LSI
rcjra drita generalizada, LÍ7
regra delta, L 5L2L
represenla^io dr saida r rtgrt de deeistoh 7t 1-214
resumo, 200-202
MJnsibíl ¡dwfe, 256
laxa de aprendizagem, 1Q64M
temporal, 7ÍB-7W
virtudes e Jimilapfcsh 252-259
Algoritmo do cinnpiáo cerebral ótimo, 252
Algoritmo do mínimo q-ufldrado médio (LMS), 1^5^161
algoritmo LMS normalizarlo. 123
algoritmo LMS-Newlon, 121
curva de aprendizágEm, 119-161
desajustamento, L59
vzriacBO da taxa de aprendizagem, 161 -161
Algoritmo dos mínimos quodrados recursivo (RLS), 177
Algoritmo bdMuo goteral izado (A1IG), 453
convergencij do, 455
otimizafáo do, 456
resumo do, 152
Algoritmo Mcircipoli^ 603-6D6
Algoritmo, crigem do termo, Q2
Amostragcm dr Gibbs; 608-6ID
taza do teorema da convergencia da, 610
teorema da convergencia da, 6l0
leorema er^ódicn da, 6 LO
AnáLise de componEntcs independentes, 553-570
algoritmo de aprendi^gem para, 5M-.564
corisidcracfc* sobre a eonvtrgftieia do algqrlinio di
aprendizagem, S6á
«tabLLidaxlc do algoritmo dr aprendizagem, 565-566
ñinfáo de ativacán para, 561-563
gradiente natural para. 565
índice de desempenbo pdra, 170
propriedade cquivarianlc, 564-565
AñJIiic de componentes menores (ACM), 4BD
AnáliM de componentes principáis n^-linear. 474, üjj.
Anáüsc de compoíiíniíH principáis pw núcleeL 472
resumo. 125
An&llse de componentes principáis 413
algoritmos de decrarelacfri. 469
alguritmos de reeiimif&o, 46fl
auto-Eslnrlura da. 434
métodos adaplativos, 47L
métodos por loto. 471
iL3o-lincarL 474. 400
SUbopB^C principal. 469
Análíse de dados de mareado financcim,. AC1 pm, 51£¡
Análisr cm trmpo-frrquériCLíl, 854
Aprendizageni anEi-hchbi¿na. 81.4$2
Aprendizagem basada em memória, 23
rejra do vtanho mais prójimo, 2S
re^ra dos i i izinhos mui* pnfrrriic*. 2fi
Aprendizagem com uní professor, 8fi
Aprendizagem competitiva, tL488
regra. para. Si
Aprendizagem c-onrinua. IO8J8O3
Aprendizagem drlLa-barra-delí** 177h 279
Aprendizagem hebbiaiw, SU
generalizada, L04
hipócew da cowñfliK¡3a 82
postulado de Hebb, 82,4]L
retorno sinápticu, 81
Aprefwi:zagcm náo-supeix'is icnada, 90
Aprendizagem por corroí bo de crio, 2fi
Aprendizagem pw cwidiflo em encala, 22ñ
Aprend* zagem per diferenf* lempucal, íifi L
Aprendizagem por reíorcu, S-9-%- 651. 681
Aprendizagem (J, 671-676. 681-682
aproximada, 673-675
esptantefo na. 675-676
Icoremi de convergencia da. 672
Aprendizagem recórreme em lempo-real, 812-819
complete idade computar iunal da. 828
grafo de sensibil idade, 817
imposi^áo de proEessor da. 819.845
rwwF 81?
Aprend izaron selcrivn. darwiniana, 122
Aprend izn^em ran um pnrfwor. ES
Aprendizagem supcrviEsonada, Efi
como um problenu de uúmizasáu. 2££L22i
amo um problema de neco«tru0o de
hipcrsupcrficic mal-liormulado, 293-294
Aprendizagem, SU
dcíin¡QÍD di; 25
Lcoria c^tBlifiliea da. LUI
Aprwrnuclo ortoo&rticm Lúl
Arvore de duñfi£O(io e regre^á-D íL AKT,
cAixr^ldudón turf remita frw)p 408
Amtores; 725
hacia de atraco, 727
cítranhci, 762-775
hiperhólíMS. 7j7t 832
manipulaban de, 730
pontuaLsr 727
Autflfiltro máxima hchhiano. 442
CRtahiLid^e dí\ 446
Autñtnam- 4c cslado& finilos. 804
AuOpCrganizi^O, SQ* 430
principia ih, 4M
Autovalores, 435
Autovetores, 435
dnminanlen, 441
Axónio, 13
Jíaci-prapCTgfl/rciHr. veja Algo?:lino de Rcimpropagajíáo
Bits. 522
Busca cm linha, ¿66-268
Canias de Markov, 595-603
cl-us-s-i tlizaf-üci, 6Ü2
defin ¡íioh 595
diagrdnu de ttwuiffo de ebladu das, 600
ergódias» 598
idenlidade de Chapm-an-KolnLügorov, 597
irredu1ivcLih 597-598
maíriz cs-locásEica, S96
principio dti halando decalhado, 602^603
probabilidades de 596
propriedades recurrentes das, 597
Icnrcma da ergodie idade, 599
(’am inhada aLearória, 645
Campo Ixni induzkkh difinitíOi 11
Gunpus reteplivos, 53, 7Q Ll?f 11L
Cañe el ador de L-úbulo lalenil generalizado, 22
Cm»! 762-771
definicáo deP 768
dimrnsau de torrelabijci, 766
cxpDcntes de Lyapunov, 766-768
recunstruíáü dinámica de. Ttffl-772
Capucidade de separacáu de uma superficie, 288-290
Cari^lcrislicas espacia Imenle eferentes, 549-55 L
CaraclerislicaK cspacLalmenlc incítcrcnlcs, 551-553
Cclutaf de Vihiiinoi, 506
Cerebro, 32
organizaba^ eslnnural de níveis,. 15
Cluií-i'ücacíw adaptativa de padróes. L"xpcrimentDS sobre,
314.
335,369,508
Clwsif-eadflr bl(ywkan&a 169-175
rifen bipesiiDCt 169
Ccberta de Miriur, 631
Ccdlfio^o de fantpm. 458
Coeficiente de correlafaD, 5 E 3, S50
Lompartilhamcnlei de pesos, 53, 114
Complexidad^ cumpulac i>nal, L30, 322
algoritmos do tempo exponencial,. ISO
algoritmos de lempo pohnomia]p J8£i
Complex idade d* amcBlra, Lk¿
Componentes principáis, delin^Aci, 41B
ConexiOTismo, 252-253
Conhecimento, deími^ió, 49.
ConlrulE adspcaLLYü por rEÍcrencia a modelo, S36-840
Converjéncia cm probabilidade, LLú.
Convergencia sinSptic^ 42
Cóftex cerebral, mapa cilúfirquitetural, 3£
Criterio de Neyman-Pearaon, SI
Criterio do mínimo romprimenio de descriéao {MCD),
270
Criterio HhJ 77,256
Curvas (superficies) principáis, 48(3. 5ft?
[’kcc-rji pc-s n;¿ri cm subtspaco, 441
[>Kümpc4¡cto por valor singular, 471
valores singulares,. 471
vetares singulares, 47]
DccottvciIucAci cega, 522
Dendritas, 11
Derivadas ordenadas, 81E
Dcsigualdadc de Cauchy-Schwarz; 166
Dcsigualdadc de Jcnscn. 427
Difercnciaclo cm relacio a um vetor, 176-177
Diferencial de Fréchet, 295-298
Dilema bLas'vzriancia, 1_L2
erro de apruximalivo, 112
erro de estimativo, 113
Dilema da estábil ¡dartc-plasticidade, 3Ü
Dimensao VC, 119-123
drfini^Ao da, 1211
limites da, 121. 13£l
Dinámica da desoída de gradiente - subida do gradiente,
777
DíscriminanlE linear de Fisher. 227-228
Dísláncia de Mahalanobis, 52
Dísláncia euch diana,. SI
DislribuiQfto de Boltzmann, veja dislrihuitáo de Grbbs
Dislribui^áo de Gibbs, 593f 642. M7
Dislribuii^o talorial, 538, 629
DÍ5lribLLÍQÍfci subgaussiana, 5Í2
DÍBJrLbuipta supergjusiiana, 582
Divergencia (distancia) de Kullback-Lciblrr, 528, 53T-
539
dccomposi^o por Pitigoras, 539
rela^áo wm a iníórmaf-io mutua, 538
Divergencia sináptlca, 41
Dot pruducl, veja Frodulo interno.
Energía do erra, 22
Energía Iívtep 593
Enlropia diferencial, 529
Entropía marginal, 539
kntrerpia relativa, veja Divergencia de RuNback-Leiblcr
Entropía, no sentido da teoría da infbcmsíJü, S2E
Entropía, no sentido lermodinjmico, 595
Equa^Sü de Eulcr-Lagrangr. 298-799
Espado de caraelcrislicas, 225, 285, iúJ
Espado de Hilbert, 297. 339
Espato do produto inlcmo, 311
Espato normalizado, 294. 339
Espato rierhamriftiKi, 585
Espetlrograma, 693
Estabilidadr, 722-724
Teorema de Lyapunov, 724-725
Estimado por máxima verosimilhanta para reparaijio
cega de fontes, 570-573
retaco com a gnáfise de componente independmecs.
572-573
Esiimatáo por míKima verosimilhonta, 411
Íimf5o Logariimo da vetusimílhanta, 414
prcipnedades da, 414
Estimador per regresoáo de Nadaraya-W&1$on, 326, 519
Esiraiégia de aprendizagem proeura-cntiü-comrerge, lid
Exponsfle de Edgeu'orth, 585
Exp^nslo de Gram-Charliw, 558, 582-58^
Faior Q, 659-660
Fenómeno da Testa de wqueteL 97, 135, 53fi
Fi Itragem adapcaliva, 144-146.
processo adaptativo, 146
processo de fíltragem^ L4t
Filtro de Kplmin, cstcrnMo desacoplado, 823-828
comptexidide computaciona], B21L828
inúhiplas oonrenles, 846
resumo, B26-828
ruido de processo artificial. 826
Filtro Untar des minirnos quadrados, 152-155
Filtros de Kalnw, 177, 819-823
erro de aümKlo filtrado, 823
falo? de convcrsáo, S23
fenómeno da divergencia, B23
inciVBcdes, 820
rrualnz de covariancia de erro, 8211
raiz quadrada,. 82D
resumo, 82]
Filtros de resposta a impulsos de durado Finita, 698
Filrros de Wiener. 151-151
FiEtros neurais,
distribuidos, 698
focados, 694
Forma a partir de sombras, 478
Fórmula de Flcicher-Rwcs, 265
Fórmula de Hcsteness-Siiefel, 2BÜ
Fórmula de PdWc-RIbtere. 265
Furiíio de mlvftflGp 1L 1^5
definidAo de, 32
níü-moflútonr 3íi 779, 785
i pos de, 38-4L 195-196
Fundo de crtscimento, 1LÜ
Fun^áo de Green. 2S3.
Fundió de H caví si de, veja Fun^&o de limiar
Funfio de limiar, 33
Funfáo de partirán, 593
Fundió de perda ümhíkí a e, 372-373
Fun^án limitada saturada de um lado, 805
Fundan linear por partes, 4LL 755
Fun^áQ logística, 4<i- 79, LÍ5
Fun^áo sigmótdcP 49
Fum^rs ijngcnte hiperbólica como fundió de ariva^áo,
39. l£fi
Funcional de risco empírico, 1 LÜ
mautAKÍn esirita do, LU
Funcinil de Tikhünnv. 295
Fu rindes (distribuido*) gHussianas multivariadas, 3Ü4,
327. 534
Fuftíóes de bttC radial, 291
jsussianas, 191, 304, 327
muHiquádricax inversas, 291
multiquádricas. 291
Gunuio, LiL
Gamáo-DF, uil
General izafáo, 28, 51L 232-234
tamanho do conjunto de toe .ñámenlo para, ?~^4
Gradiente natural, 565,585
Gradiente relativa, veja Gradiente natural
Gnfo uquitetml. 14
Grifo de ílusto de sinal, 41
regras hásicas do, 12
Hiperplano étimo, 151
método quadrálico para computar o, 553-357-152
propriedades esiatisticas do. 152
H ipótese de Ekarl-uw, 542
H ipótese de Church-Turing, 804
Identidade de üiwn. Ü8
Identifia^Sú de sislemas, 146- 710- 814-837
modelo de entrada-saida, 836-837
modelo de espado de estados, 834-836
Igualdadc de Wbadbury, veja Lema da inverrao matncial
Independencia ^StailítifiK 537
ínfimo, 1 Lti
Iníoimafáo mutua, 514
para aprendizagem auro-orgimizada. 5411
propriedadec da, 535
Informan. 5_Ü2
Inibi^áo lateral, 84
Inteligencia artificial, 59
llcrac&o de política. fíSO-rWhl
aproximada, 6hS-67l
liento de valor, 66 i-666
Lema da inveho lUtrkU. 251
Lema de Sauer, 125, 136
Limite de CherrtofTn 22Ü
Maldigo da dimcnsi-unalidade, 237-238, 321-322, 606
Mapa de identidade, wja Replicador
Mapas auio-orginistáveis (modelo de KoboocaX 4fiü
adaptado siniptiea. 43L, SIS
algoritmo de coisdAKia. 521
algoritmo normal i oda» 490, 524
casamento de dcn&idade, 5UQ
tase de convergcnc a, 493
fase de ordenado, 492
finito de VÍ21IÜMHÍ3, 490
ordena^áo tupológjcat 499
processo competitivo do, 48R, 518
processo cooperario, 489
propriedades- dos, 494
resumo, 493
versáo por lote, 199
Mapas contextuáis, 5 14
Mapas corticais {computacionais), 35,484, 517
Mapas semánticos, veja Mapa* contextuáis
Mapas topográficos- 34
Máquina de Boltzmann, 610-617
delerministica, 626-627
regra de aprendizagem paraP 86-86. ril 1-61-6
Máquina de HclmhoEtz, 622-623
Máquina de Turing, 804
Mtquiiiu de omM» 315
Máquinas de vetor de suporre, 349
comparado com a aprendizagcui por
retroprepagado-, 370-372
projelo ótimo das. ^64
reconliecimcnta de padreSes petas, IllI
rcgressáo, 373
Máquinas eslocásticas bascadas na mecánica cslarísrieaj
591-643
Máquinas inteligcnles, 849-853
para comióle. 851-852
para processaímcuLo de sinais, 852-853
para Tcconhecimenlo de padróes, 85Ü-B51
Matriz de correlato, 153. 434
Matriz de Grecn, Mtt
Marriz de influencia, 1L5
Matriz de informado de l'LEher, 474
Matriz de intcrpolacáo, 291
Matriz de núcleo, 473
Mltriz definida pctiummcnl^ defíni^áo, 177
Matriz hessiana, ISO, 2341
computarán da inversa da, 2S£k251
Malrizjaenhiana, 151, ZJft, 72]
computarán da, 22:-: I-jj
Máxima eslimHQáq ¿f jwferiari (MAR). 425
Mecánica csratlsti^^, 592-595
Memoria aeessivel por cnnKúdü- vqjl fMdelo tk-
J-tupficld
Memoria de linha de arraso derivada,
Memórin garúa, 669-691
Memória por matriz de correlato, 104408
nlapk) com o algoritmo LMS» US
M-emóriá» LÍK1
OSSOCUlliva» $2
de curto prazo, LÜÜ
de longo prazo» lllli
distribuida, 1QLI
interferencia cruzada (cnwftdfcL LCfi
por matriz de-otirreLaj?5a, ID4-1Ü8
recordaQiOj 105
Memória, cstnituraa de curto prazo, 6B6-69]
profundidadii da memoria, 6SS
resolutío da memijri^ ú8fi
Método da decida mais íngjcmc» veja Técnicas de
atimuzjf&u, irríslnL-ii
Método da dire^&o conjugada, 264
Método da máxima entropía para separado cega de
Fontes, Í22z52ft
algoritmo de aprendizagem, 5??-57ft
equivalencia com a máxima, vernsimilhan^fl, 576
Método de aprendizagem por media de ensenóle, 3S7,
421
MdtOÓO de <3auss-Ncwton, veja Técnicas de otimiza^Jo,
fcnAÍUs
Método de Ntwton, 261
Método de quase-Ncwton, 268
Método do gradiente conjugado, 2Ó2-26H
busca cm linha, 2fiSz2úE
comparado com o método quaw-Ncwtoo» 270-171
fórmula de Fletcher-Reevcs» ZáS
fórmula de Polak-Ribiért, 2ñ5
método de Brenl, 26s
residual, 265
rwmo do, 2ú9
Método des multiplicadores de LagrangC. 249, 354, 531
«ndifta de Kutm-Tucbcr, 1S4
problema dual Í54* 359, 375
pl L>bienu primordial, 154, 359, 375
teorema da dualidade, 115
Mínlrpi^án do risco empírico, principio da, 117
Minimizacáo cmrarai de risco, L2fcJ2Z
Mínimos glúbais» deilnií Jo, 225
Mínimos locáis. definí^Sr*, 275
Mínimo* quadrados iterativamente ponderados, 425
Mwldo de Hopfield. 730-749
eapacidade de arm&zcnamcnto, 746-749
cenário de wqim 738
estados de mucura. 754
«radas de vidrv de Spín, 7M
caradas espurios, 745*746
fase de armazEnamEnto da aprendizagem, 740*741
fase de recuperaba {recordaba 741 -742
fuñado de energía do. 252
memorias fundamentáis (estadas prrtótipusL 739
memórias fundamentáis inversas, 752-754
parámetro de carga, 747
negra de Aprendizagem para, 742
nitflo idnal-niídD. 74?
Múdelo aditivo» 701-702. 727-728
Modelo aulú^rtgressivík 56» 511
Modelo de aprendiagem fratí, 392
Modelo de espado de estados da rede reoorrenlc, 794-8Ü2
Modelo de Linsker do sistema visual dos mamíferos, 413
Modelo de Litllc, 779
Modelo de McCullcwh-Pitts. 40, 63, L¿1
Modelo- de ti .! stura de especialistas (ME), 402
Modelo de mistura gaussiano associalivo, «i 1
modelo de mistura de «peeialisras (ME)r 402
modela probahil Fótico de gcracáft, 401
Mwltlo de miaurs hicrtrquica di especialistas (MHE},
4l~hS
estntdgiu de aprendizagem para, 4L5
Modela de WilLshaw-von der Malshtrng, 4S6
Modelo do -estado cerebral cm urna, caixa (BSB,
.ífüfí-j/t-d-ñox}. 755-762
agrupamentos, 760-762
dinámica do, 759-7M
fun^áo de Lyapunov do, 758-759
rede de redes usando. 775
Modelo provavelmence aproximadamente correto,
(PAC), L27431, 391
Modelos de redes neurais buetdtH na tafia da rníbrma-
qáo, 121
Modelos de Volterra, KI9
Modelos ocultos de Markov, 644, 693
Modularidade, deñnifflo 3B6
MonOoiín^, 2H6
Morcegú «oixKaliudDf. 27, 58
Nats, 122
Navalha de Oocam, 232, 397
Ncooogniinm. L 34, 277» 454
NETtalk, 693-692
NeurooompuLa^áo aEencional, 99» 852, 854
Neurónio intrgra-c-di.spara, 779-779
Neurónio oculto, 4é» 184
Neurónio vencedor-l-rva-ludo, 43
Neurónio, 31
modelos de, 36, JJ
Norma ponderada, 3Ü9
Núcleo do produto interno, 362» 473
Número condiciónenle, I 58
Operador de atraso unílário, í5
Operador pseuctodifcwKiei. 305
Otimla^io combinatória» 608
Análugia ¿úm * física atvtiitíu. 608
Perceptron de Rcwibliítt. veja Fcnjcpt™
Perceptron, 16M69
relav^u vom o ^hssificadút bayesiano, 169-175
PtntptTOtt de múlliplas cantadas, L83
tteiccy o Je earactrrisiicirs dos, 225.213
espado de carairterísticas des, Z25
limites para t> erro dt aprosúma^áo dos, 235-237
nrconmtes, 791-792
Plasdcidadc, 22
Poda. veja Técnicas de poda de rede
PoLílL.st 654
Ponrft de sela, 721
PotenciaQBjo de langa prazo (LTP}, 112
Potencia] de aCr/a^ÍQ, veja campo Local induzido
Prwidfo; 97- 696, 828
Pn r.¿ ipi<i da fnnTia^aii de mapa topográfico, 485
Principio <U máxima entropía (Max Ent), 531
Principio da máxima inforniacSo mútua (tnfornm), 5ZL
541-546
modelo para wterui pcwpiivos. S42r54fi
relaeio com -i ícduQlfl de redundancia, ,546-548
Principio da rrtimm¡i íñcrgií livni, 595
Principio da miniirw redundincÍJ, 542
Principio Ja onogonalidzdc, 110, 44&
Principio do balando dctalhado, 6Ü2±£Ü1
Probabil idade Je dassifkarfo eomeim 318
Probabilidade de erro (de clasrilica^^1 taflomctlh 318
Probabilidade muLtLnomial, 404
Problema da diligencia, 664-666.676-679
Problema da utinqlú de gradientes, 83L-814
Problema de atribuirán de crédito, 87, 19l. 6U
l’robkmi do KltMltor» 435
Problema do caiseiro viajante, 645-646
soluto usando o modelo de Húrpíield. 776-777
Problema do XOR. 202-205, 278. 287-2SB. 111-314,
167-869
Problemas ilNCHMt 293
condirüw para boa íormvlaciü, 294
Problemas NV-c-LimpItrUw. 186
PíucrsaniCTilo de tirranjo de UlOBM, ACI pGífl-, 556
PlocwMmtnlo tempúfaL 686-714
arquileLurúS de rede parah 691-693
Plucrsscis de dreisáo markovianos, 612-654
Produto ülcmn, 51
Programará o dinámica, 651
zlgcrilme de pr-ügjama^áü dinámica, 656-657
assiiwrona, t£J
equa^áo de otimiza^áo de Hcllman, 657-659
método dr Gauss-Scithl, 681
priwipio dfl ottaníziffot 655-656
Ptngrum^áo n^urüd-iúftúbka. 6íl±fifil
politiea de, 654
pnMom de horizonte finrkL 654
problemas de horizanit infinim, 654
relajo cerní a aprendizagem por reforto, filL
Programado quadrática, 1ZE
bibliotecas comerv.as snbrnr 381
Ptopriedadc equivalíante, 564-565
Psendobnversa, 153, 3 L4
P^euduCtmperaCunii 4L 593
vetoriat h.icrarquicaL 510
Quantiza^áo vetorial por aprendizagem, 507
Eazáu dr vrra-imilhanpa, IT. 215
razflo de veniEjnilhan^a logarítmica, L22
RcaJimcnía;do, 40, 44
global, ?15
local, 715, 844
Reconstruyo dinámica- 768-772
atraso de ineerváo, 7ó9
método dos falsos vizinhos mais próximos. 77fí
prcvisiü recurniva, 770-771
teorema de Takcn^ 769
Reco^imcnto dctcmiinfsiiío. 634-640
&grupíuiíHm1<k 634-639
analogia com o algj^rirmo MVE, 640
classifiíarfo de piMlnk?, 644
tMdelM 0CU11M de MutOTj 644
quamiza^io vclí-r;i|1 644
r:y:rx<iah 644
Recorimvnlo simulado. 606-608
otimizayo combinatoria, 608-6Ú8
roteirode rceozimento, 607-608-
Hede de regularizad^, 3Ü5-3D7
Rede cxcitalóna-inibilória, veja dinámica de descida de
grad icntc - subida de gradicnle
Rede tKuml de atrasé de tempo» 6G2-693
Redes (neurais) reeorrefites, 44.49, 728-729
Redes alimabda iduÉE atrasadas no tempo, 686. 7 lo
distribuidas. 702
ftndti. 691-696
¡eorema do mapeuKfllo miope universal, 696-697
Recle* ¿1 ¡mimada* adiame. 46, 181, 2S3
COtn IHÚllíplM CUMdMt íú
de cantad । úaki 4ú
puciiihnente von^iadas. 18
[íHalrrtmr Conreadas, 4K
Redes comolulivas, Ü. 27 F-773
Redes de cren^a sigmóide, di 7-632
dctrrmmis1icaEt 627434
diñrribuiyo Je ampo midió da^, 628
cquay o de campa niet±¡ot 631
regia Je aprendizagem das, 619-621
Ri*des dr íün^áo de base radial, 2H3
compara^áo com o perccptron de múltiplas camada.
321
Comple^-idiidc CompuLiunumil das, 122
CMqdflCidode de amostra das, 322
«ttvt^iu de aprendizagem das, 328-335
genrraliradash 107-1(19
normal i zadash 526
propnddades aproxima!ivas das, 320-32.1
r< :: ;. u > Com regmEáo dr núcleo dasn 321
Redes neuiais,
adapiabilictade <3ash 22
anatúgil neurübiolAgtcah Mi
anjuiEeturas de, 4ú
definipfio de. 28,41
inscrpfio de inrar-incias nas, 54
impcairicnlp d£ enlrada-sakJa das, 2Í
prnpricdídts das, 2E
loteriincia a falh^i das, 3C
Redes recorrenles, dirigidas dinamicamenté, 787-847
a1gontJiKi& de aprendiragera, 8Ú5-808
arquLteüiras de rede das, 788-794
aut-ü-regrcssLVíiH oio-lincares com entradas exógenas,
8Ü2-R-D4
CWKolabilidjdí e oh^ervalidade das, 796-797
CMnrolabilidadc focal dash 79MÜ0
ACÜDpiQ de gradóte*, M l -834
heurísticas dash 808
modelo de cntrftda-saidah 788-790
modelo de espado de estados, 790-791,794-802
modelos de segunda ordnnh 792-794
abservalidadje local das. 8OO-S02
perccptrnnq de múltiplas camadas neccrrentes, 791-
793
poder computacional das, 804-805
rcalimcntacSo local das, 344
RetfufJo de dimenMonalidadc, 419
Redundancia. 4jl, 546
medida deh Sáfi
Reflejó vestíbulo-ocular, 31
Reíbipo, »U423
AdaBoost. 194
método por filtragem, 59!
método por ponderado, 39 L
método por su^míKlragEm, 391
Rqzislius bioméditüS-, ACI para,. 5iíi
Regia de preserva^iio de bifonna^iio, 408
Regia do produEo externo, veja Aprendizagem hebbiurta
Rcgreasio.
de aresta, 342
nlo-linear, 110- 314
jiucteo de, 323-328
ReguLarirac^o dé Tikhonfrv-Phihp^ veja Teoría da regp-
lariacki
Replicador, 253-254, 276=217
Retina, 3]
Retrüpnjpagaé^0 *tra*¿s do tempo, 808-812
eomplexidadc cornpulacionaEp 828
considerandos pláticas, 811-812
derivada ordenada». 81 k8ll
por época. 808-811
mineada, 81 l-Sl 1
Robustez. I77b 25fr
Sal i ¡Sucia, 349
ScnjíbilidadCp 229.256
Separabilidade linear,.
Separado ccg3 de sinais (fonle}, 97, SU
Sinapse anti-liebbiaiia, 81
Sinapse hebbianah SÜ
propriedades dah Sü
Stniptt,
sinapse química, 12
Saslcmas difusos (/bzzy), 852
Sislemas dínámicoSp 717-720
endino de Lip^hiu, 719-730
defmirfú de, 717
espado de estados, 117-7L9
retrato de estados (fase), 718
Sistemas híbridos, &2* 852
Sistemas ncuromórfioas, 31
Solu^Bo da norma mínima, veja Psrudo-invrna
Splincs,
de tolha lina. J43
SuvidBdc. medida deh 341
Stinfafl0t 22
Superfici!.' de dncmpcnlKi dé crn>, 18
Superficie de regrrss&oh 406
Supremo, lió
Tarefas de aprendizagem, 91
aprou i ina^áo de fundan, ±1
assorKi^áo de padrón 91
controle, LL5
filtragem, 2fi
íormacAo de fcixe. 98.
rcconhccimcnto de padrees, 22
Tícnitft de driblo dv Hmcllín^ 455
Técnicas de otitnlufiD imAiilii; 147^152
método da dacídi mü lógreme 147-MR
método de Gauss-NewEOn, 110-152
método dfl Ncw|pn. 148-1 5Í1
mélodH quíse-Neuion, ZúE
Técnicas de pod^ de wten 244-2S2
cimrgiiü cerebral étimo, M8-Í52
datw cerebral ólimo, 348
dectfanefltc de pcwsP 2dfi
climinetilo de pesw
regularizadlo da compLcxidadc, 245-248
suavizador aprciimatno. 247-348
Tempo, 6fl5
representado explícita do. 685
represenl&fáo implícita du> ídü
Teorema (algoritmo) de vCrrtverjtrtcií d& pctnptnn. L6Z
resumo, 168
TcoWMí da flprmiimacáo univcraal. 234-235, 7^4
Teorema di csiabilidade asstniórica, 444
Teorema da LntFrpüIa^ü, 290-291
Teorema da representad 297
Teorema de Cohen-OroasbErg, 754-755. 758
Teorema de Covcr sobre a separabilidadc de padrfcsh
284-288
Teorema de Darmois, 539
Hidden page
Hidden page
Hidden page
Hidden page
SIMON HA/KIN
Redes
Neurais
As redes neurais artificiáis tém raizes em disciplinas como
neurocténcia, matemática, estadística, física, ciencia da computando
e eagennar id Sutís apkcanóes poden ser encontradas em campos
tao diversos quanto modeiagem, análise oe senes temporais,
reconhecimentó de padróes, processamento de sinais e controle
Este livro fomece as bases para o entendtmento das redes
neurais, reconhecendo a natureza multidisciplinar do tema.
O material é acompanhado de exemplos, experimentos
computaciones, problemas no final de cada capitulo e bibliografía
Conta aínda com duas páginas de apoio na Web