Текст
                    SIMON HAYKIN

Redes
Neurais
Principios e prática

Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
SIMON HAYKIN McManter Ufiiversify ilnntiilo/), Onfáríü, Cíinculü """ Redes Neurais Principios e prática Traducán: Paulo Mari iris Engrl Domar et» EageufwútEt&rica pela Tecfmischf Umwsiíüt MíímIwn, AIwmkím Púx-Dfntturadu tftíi Rcdtfs Ntítniis fvkt Tci/ittrath^ fíí¡chsftlt!t!. DüHnitttíilt Altfítíifíhtt Prüfexur/F tit> inslimtü de Infar/ttatica da Uf-üírS Reimpressao 2Ü0S 200]
Obi j orí;.1 iiluí mente publicada scih 0 lítulu Ne itraf /tfiworicf: <t frNttpreherixive fámdaiitm, 2/E C 1999. Pretil ice Hall. Ine. Public adu tín língua portuguesa cujifimite tenido 001M a Predice Hall. Inc., urna empresa Pearscm Educatíon ÍSBN 0-13-27335(1-1 Cipa: Máritt Rshneít Preparuv¡k> du urigiuu]: Dnflitl GtOSSi Super villa editorial: Aryxinhtt JtHifitfx Afftwi.w Edi trsra^ ¡hi eletrémica; i^íxer Hfmxe -fíf-p.aj'. O uulcr e O editor emprctnderam os seus melhorrs euforias na prepamQst) dcstc livno. Estes eífoi\Tus incluem. o desenvoh imrnki, a pesquisa c o- teste das teorías e programas para de1crTTi¡n¡ir a sua e íicjénuiu. O autor e n editor nün dan garantías de qualqucr tipo.explícitas <mi implícitas,eill relaja a estífi programas ou a documentarán rimtidu neste livro. (} autor e o editor náo SC vespotnsatMÜzam por daños ewmtiuis ou conscqiiéncias cm concxáo coin.au que surjani do famecimetiiu. dcMrmpeüho uu uso desees programas. Reservada^ l?do4 os direitos de publica^- Líneuu portuguesa, j ARTMED* EDITORA S. A. (B00KMAN* CÜMPANHIA EDITORA ¿ urna dh isao da ARTMED1 EDITORA S A.) Av. Jerónimo de Ornelas, fi-70 Santana 90040-34A Porto Aleare RS Fone {51: 3027-700(1 F^x (51) 3(127-7070 É. pniibida a Liiiplica^jo ou neprodu, .10 íle^c volume, i>> lüdo OU em parte, sub quaisquer forrrtíts ou por quaisquer me ios t ekttóídt». mecánico, gravs^ao, fotocopia, dislribui^áo mi Web e uniros), sem permissio expressa da Editora. SAO PAULO Av. Angélica. 1091 - Hi$ienópcihs 01227dWS,Í0 Paulo SP Pone ill) 3A6Í-I HK1 Fax(1113fió“-1333 SAC 0800 703-.U44 IMPRF.SSO NO BRASIL Htik'TEDiAl HKA¿fL
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Á<x) #• H H 1 i 1 I fun^áo de densidad* de probabilidad* do vetar aleatorio X subconjunto (rede) com o menor risco empírico mín ¡¡me matriz hessiana inversa da matriz H raíz quadrada de -1. tambera representado por J matriz idenlidadc matriz de informado de Fisher erro medio quadrado J -1) K'ft K" log i(w) SB(w) M, M fl p. p F c p. W) p; matriz jacobi u na matriz de covariancia do erro na teoría do filtro de Kalman raíz quadrada da matriz IK transposta da raiz quadrada da matriz K constante de Boltzmann logar, imo logaritmo da fun^ác de vcrossimil banca do vetar w logaritmo da fun^o de verossinú Ihan^a do vetar w baseada em um único exemplo matriz de controlaba lidade matriz de ohservahilidade tempo discreto probabilidad* do estado í em mecánica estatística probabil idade de transipao do estado J para o estadoJ matriz estacas! lea probabilidade de classificafáo correta probabilidad* de erro probabilidade condicional de erro c dado que a entrada é re lirada da ciaste probabilidade que os neurñnios visiveis de unta máquina de Boltzmann eslejam no estado a, dado que a rede estoja na sua conchfao presa {i.e., fase pos i Liva) Fñ probabilidade qu* os neurónios visiveis de urna máquina de üollzmann eslejam no estado a, dado que a rede esteja na sua condifáo livre (i.e.T fase negativa) r ,(/>;«) í.(Jt;ra) uk r R t T y tr var K(i) vi wi Yr ü y r 1* estiman va da l'un^áo de autauorrcla^ác de tía) c a (?t) estimativa da fun^áo de correlato cruzada de dfn} c matriz de correlato de um vetor de entrada tempo continuo temperatura conjunto de treinamento (amostra) trac o de um operador matricial operador variáneja funtao de Lyapunov do vetar de estado ¥ campo local induzido cu potencial de alivapao do ncurónio j valor ótimo do vetar de pesos sinópticos peso sinóptico da sinapsíe/ pcrtcnccntc ao neuronio A vetar de peso ¿timo valor de equilibrio do vetar de estado i media do estado x em um sentido “térmico” estimativa de x, representada por um circunfiero valor absoluto (magnitude) de x
Hidden page
Hidden page
Sumário Introduyáo 27 1.1 O que c urna Rede NcuraiV 27 L2____O Cerebro Humano_____12 L3____Modelos de um Ncurónio____H L4____Redes Nciinris Vistas entTin (irnfns Oí-¿rotados_41 1.5 Rcaljmoiilagáo 44 1.6 Arquiteturas de Rede 46 L7 Representapáo dn Conhecimcntn 49 1.3 Inldigeneia Artificial e Redes Neurais 59 U_____Notas Históricas__ Notas e Refeténeiafi_69 Problemas___7Q 2 Procesaos de Aprendizagem 75 2J [nlrodut^o 75 2.2 Aprendizagem por Corrccáo de Eitü 76 2.3 Aprendizagem Bascada era Memoria 78 2.4 Aprendizagem Hcbbhina 80 2.5 Aprendizagem Compelí [iva 83 2.6 Aprendizagem de Boltzmann 86 2.7 O Problema de Airibuicao de Crédito 87 2.8 Aprendizagem com um Profcssor 88 2.9 Aprendizagem sem um Profesar 89
2 JO Tarefas de Aprendizascm 91 2JJ____Mcmária_____EH! 2.12 Adaptado 108 2.13 Natureza Estatlslica do Processo de Aprendizagem 110 ¿.Id Teoría Estatifica da Aprendízagern 114 2.15 M udelo de Aprcnd i zagem Prwa vel mente Aproxi majamente Correto 127 2.16__Kcsuinu c i>jseus-slíi.i LzJ. Notas c Referencias___]_1? Emblemas____131 3 Perceptrons de Camada Única 143 3.1 Inliodugáo 143 3,2 O Probl emB da F iltragem Adaptativa 144 3.3 Téemuas de Otim izapac Irrcstritas 147 3.4 Filtro Linear de Mímenos Quadrados 152 3.5 Algoritmo do Mínimo Quadradc Medio 155 3.6 Curvas de Aprendí zagem 159 3.7 Estrategias de Variado da Taxa de A prend i agent 161 3.8 O Pcrccptron 161 3.9 Teorema de Convergencia do Perceptron 163 3 J 0 Kcl a ;:li'i entre o Pcrc cpl ro n c o Clasificador Ba^ es i ano p; i it mm A mbien le Gallas ¡ano_169 111____Resumo e Di scussáo___¿¿¿ MíWas e RrfrrrncÍFUi._176 Problemas 177 4 Pgrceptrons do Múltiplas Camadas 163 4.1 Introdujo 183 4.2 Algumas Considerares Prcl i m i nares 186 43 Al gori tme de Retropropagacao 18 8 4.4 Resumo do Alfioriimo de RecroprupaKacao 200 iS____O Problema do XOR 202 4,6 Heurísticas para Melhorar o Dcscmpcnho do Algoritmo de Retropropaga^jo 205 4.7 Rcprescntacao da Saída e Regra de Decis^o 211 4.8 Experimento Computacional 214 4.9 Dctccgao de Características 225 4JO Rctropropagapio c Difcrqicisyio 228 iJ_l___A Matriz Hcss^na______ 4.12 Generalizado 232 4.1J Apnoxima^ao de Funcces 234 4.14 Validado Cruzada 239 4.15___Tccji:c;ls Je l\uh de Rede_2Ü 4.16 Virtudes e Lira ¡toldes da Aprcndizagcm por Retropropaga^áp 252 4J7 Aceleraf^o da Convergencia da Aprondizagem por Retnopropagatjao 259
4J8 Aprendizagem Supcrvi sanada Vista como um Problema Je Ohmiza^aü 260 4.19___Redes Corcel mi va?_¿21 4-20___Resumo e Discutan___¿21 Notas e Referencias_225 Problemas___228 5 Redes de Fungao de Base Radial 283 5+1 Introducán 283 5.2 O Teorema de Cover sobre a Scparabilidade de Padrees 284 5+3 O Problema de Interpolagáo 290 5.4 A Aprendizagem Supervisionada como um Problema de Reconstruyan de 11 ipenuperfi cíe M alformulado 293 5.5 A Teoría da Regularizado 294 5.6 Redes de Regularizapáo 305 5+7 Redes de Fungan de Base Radial General izadas 307 5.8 O Problema do XOR (Revisitado) 311 5.9 Estimagáo do Parametro de Regular i zagao 314 S+I0 Proprledades Aprpximativas das Redes RHF 320 5+11 Comparagáo entre Redes RBF c Pcrccplrons de Múltiplas Camadas 323 $+12 Regressáo de Núcleo e sua Rdayáo com as Redes RBF 323 5+13 Estrategias de Aprendizagem 328 5.14 Experimento Computacional: Classificayáo de Padrees 336 5+15 Resumo e D i se ussáo 337 Notas c Referencias 339 Problemas 343 6 Máquinas de Vetar de Suporte 349 6.1 [ntrodug-io 349 6.2 H iperp I ano Oti mo para Padrdes Li nearmente Separóse I s 350 6.3 Hipcrplano Ótimo para Padrees Nao-Scparáveis 357 6.4 Como Construir urna Máquina de Vetar de Suporte para Reconheclmento de Padrfles 361 6,5 Eaemplc: O Problema do XOR (Revistado) 367 6,6 Experimento Compulse innal 369 6,7 Funcao de Pcrda Insenstvcl a t 372 6.8 Máquinas de Vctor de Suporte para Rcgrcs&ao Nao-Linear 373 6.9 Resumo c Discussáo 376 Notas c Referencias_¿Sü Problemas 381 7 Máquinas de Comité 3B5 7+! Introducán 385 7+2 Media de Enscrnblc 387
73 Experimento Computación^! 1 390 7.4 Reforjo 391 73 Experimento Computacional II 39S 7.6 Model o de M ¡ stu ra. Gau ssianu A99OCÍ a ti vo 40 1 7.7 Modelo de Mistura Hierarquica de Especialistas 406 7 .8 Sclc^áo de Modelo Usando urna Arvüre de Decisito Padráo 408 L2_____Prohabilidades. g Fnor/ c f? Areterjuri_412 7.10 Eslimagáo por Máxima Verüssinr lhan*;a 4] 3 741 Estrategias. de Aprendizagem para o Modelo MHE 415 7.11 O Algoritmo ME 417 7,13 Aplicaban do Algoritmo ME ao Modelo MHE 41S 7.14 Resumo e Di scussáo 421 Noias e Referencias 422 Problemas 415 8 A nal i se de Com ponentes Principáis 429 8.1 Introdu^&o 429 83 AlgUJis Principios Intuitivos de Auto-Oremi-zagSo 430 83 Análisc de Componentes Principáis 433 8,4 Autofi 11ro MAximo Bascado na Aprendí?agem 1 lebbiana 442 8,5 8.6 Ana 11 se de Componentes Principa» Baseada na Aprendí zagetn Hebbiana E xperi m coto Computar i ona l. Cod ificayáo de Imagcm 45 8 452 8.7 Analise de Componentes Principáis Adaptativa Usando [níbi^So Lateral 461 B.K Púas Classes de Algoritmos de ACP 469 8*9 8.10 Métodos de Computaban por Lote e Adaptativn 470 Anal i se d c Componernos Pri nci país por N úeleo 472 8.11 Resumo e Diseussáo 477 Notas c Referencias 429 Problemas 4SÜ 9= IHapas AutoOrganlzáveia 4B3 9.1 Introducto 483 9.2 Dois Modelos Básicos de Mapeamento de Características 484 93 O Ma pa A utoX7rga n. i zável 486 9.4 Resumo do Algoritmo SOM 493 9.5 Propriedadcs do Mapa de Características 494 9,6 $ imulacóes Compul ac i o na is 5 02 9,7 Quam ¡ ¿ayáo Velorta] por Aprendízagem 506 9.8 Expel í mentó Computactonal: Classlfieab^o Adaptativa de Padrocs 508 9.9 9.111 Quantizaváo Vetorial Hierárquica 510 Mapas Contextuáis 514 9.11 Resumo e Discuss&o 516 Notas e Referencias 51 7 Problemas 5±2
10 Modelos Teóricos da Informaba 525 1 1 10.1 Intraducao 525 102 Entropía 526 10.3 O Principio da Máxima Entropía 531 10.4 Informa; 3 o Mutua S34 10.5 Divergencia de Kullback-Lciblcr 537 tü.6 lnlormá;áó Mutua como urna k'un^o Objetivo a Ser Otimizada 540 10.7 Principio da Máxima Informado Mutua 541 10.8 Infomax e Reducán de Redundancia 546 10.9 Características Espac lilimente Coerenies 549 10.10 Características Espacial mente Incocrcn tes 551 1041 A nál i ne de Componentes Indenendentes 553 10,12 Experimento Computac ional 56S 10,13 EgtLitiBQao por Máxima Vcrossimilhanca 570 1044 Método da Máxima Entropía 572 11L15 Resumo c [Jiscussáo 528 Notas e Referencias 5fiD Problemas 5KZ ' Máquinas Estocisticas e auas AproximaQógs 1 2 Baseadas na Mecánica Estatistica 591 114 InlroduíHQ 591 11.2 A Mecánica Estatistica 592 113 Cadeias de Markov 595 1L4 O Algoritmo Metrópoli? 603 11,5 Recozimento Simulado 606 1L6 Amcsfntgem de Gihhs tifiS 1L7 A Máquina de Boltamann 6t0 11 s Redes de Cren^a Sigmóide 617 ll+9 A Máquina de Hdmholtz 622 11.10 A Teoria do Campo Medio 623 11.11 A Máquina de Boltzmann Dclcnr. i dística 626 11.12 Redes de Cren^a Sigtnóide Delcrm i ni$tícas 627 11.13 Recozimcnto Dcterministioa 634 11.14 Resumo c Discuta 640 Notas e Referencias f¡42 Problemas 645 ! Programado Neurodlnfimlca 651 12.1 Introdujo- 651 122____Pmww de Ttecirfn Martrwiann_______652 12.3 O Criterio de Otimi za^ao de Reliman 655 12.4 Iterado de Política 659
123 Iterarán de Valor 661 12, 6 Programado Neurodiitómica 666 12. 7 1tcra;áo de Política Aproximada 668 12-8 Aprendizagem Q 671 12. 9 Experimento Computacional 676 12.11 1 Resuma e Di scussao 679 Notas e Referértclas 68l Problemas 682 13 P roces sa mentó Temporal Utilizando Redes Alimentadas Adianto 685 Í3J Introducán 685 13.2 Estruiunis de Memoria de Curto Trazo 686 13.3 Arquiicturas de Rede para Processamento Temporal 691 13.4 Redes Alimentadas Adianlc Focadas Atrasadas re Tempo 693 13.5 Experimento Cornputacional 696 13.6 Teorema de Mapcamento Miope Universal 696 13,7 Modelos Espa^o-Tcmpnrais de um Ncurónio 698 13.8 Redes A Ementadas Adíame Atrasadas no Tempo Dislribuidas 702 13,9 A Igcrilmo de Retropropagacáo Temporal 703 13.10 Resumo e Discussao 710 Ñolas e Referencias 711 Problemas 712 14 Neurod i n árnica 715 14.1 Introducán 715 ] 4,2 $ istemas D inám lees 717 14.3 Estábil i dade de Estados de Equilibrio 720 14.4 Alratores 726 14.5 Modelos Neurodinámicos 727 14,6 Manipuladlo de Alratores como um Paradigma de Rede Recorrerte 730 14.7 O Modelo de Hopfield 732 14.8 Expel í mentó Computacional I 749 14,9 Teorema de Cohen-Orossberg 754 14.10 O Modelo do Estado Cerebral cm urna Caixa 755 14.11 Experimento Computacional II 762 14,12 Alralores Estranhos e Caos 762 14.13 Rcconstnicao Dinámica 76R 14.14 Experimento Computacional III 772 14.15 Resumo e Discussao 775 Notas c Referencias 778 Problemas 780
15 Radas Recórranles Dirigida» Dinámicamente 757 15.1 Introducto 787 15,2 Arquiteturas de Redes Recorrentes 788 15.3 O Modelo de Espado de Estados 794 15,4 Modelo A utn-Regressivo N.u । -Linear en ir Entradas Exógenas 802 15.5 O Poder Compulse i onal das Redes Recorrientes 804 15.6 Algoritmos de Aprcndizagcm 805 15.7 Relropropagacto Através do Tempo 808 15.8 Aprcndizagcm Rcconenlc em Tempo Real 812 15.9 Filtros de Kslnian 819 15.10 Fi Itro de Kalman Estcnd i do Desacoplado 8 23 15,11 Experi mente Com putacional 82 8 15.12 Extingan de Gradientes cm Redes Rccorrcntcs 831 15,13 Idenriricefto de Sistemas 834 15.14 Controle AdaptaLivo por Rcicrcncja a Modelo 836 15.15 Resumo e Dlscussto 840 Notas c Referencias 841 Problemas 843 Epílogo 849 Bibliografía 855 índice 893
Hidden page
CAPÍTULO 1 Introdujo 1,1 O QUE É UMA REDE NEURAL7 O trabalho em redes neurais artificiáis, usualmente denominadas “redes neurais* tem sido motiva' do desde o cometo pelo ruco nhee i mentó de que o cerebro humano processa informales de Ulna forma ¡tetramente diferente do computador digital convencional. O cérebro é um computador (sistema de processamento de infoima?ao) altamente complexo, nao-linear e paralelo. Ele tem a capacidade de organizar seus constiluintes cstniturais, conhecidos por neurdniast de forma a reali- zar certos processamentos (p.ex., reconhecimentó de padrdes, percepsSo e controle motor) muito mais rápidamente que o mais rápido computador dígita] hoje existente. Considere, porexemplo, a visito humana, que é urna tarefa de processamento de informado (Marr, 1982; Levine, 1985; Churchland e Sejnowski, 1992). A fun0o do sistema visual é fornecer urna representadlo do ambi- ente á nossa volts et mais importante que isso, fomcccr a informaqao de que necesitamos para interagir com o ambiente. Para sermos específicos, o cerebro realiza rotineiramente tsrefas de reco- nhccimcnto perceptivo (p. exM reconhcccndo um rosto familiar inserido cm urna cena nao-familiar) em aproximadamente 100-200 ms, ao passo que tarefas de complexidade muito menor podem levar días para serem ejecutadas em um computador convencional. Como outro exemplo, considere o sonar de um morcego. O sanar é um sistema ativo de loca- lizando por eco. Além de fomecer informavocs sobre a distancia ate um alvo (p. ex., um inseto veador), o sonar de um morcego transmi le tambera informadlo sobre a velocidad? relativa do alvo, o tamanho do alvo, o tamanho de varias características do alvo c o azimute c a elevarse do alvo (Suga, 1990a, b). A complexa computacáo neural necesgárla para extrair toda essa informado do eco do alvo ocorre no interior de um cerebro do tamanho de urna ameixa. De fato, um morcego guiado por eco pode perseguir c capturar seu alvo com urna fácilidade e taxa de sucesso que SÍO de causar inveja a um engenheiro de radar ou sonar. Como, cntac, um cerebro humano ou o cerebro de um morcego faz ¡ssc? No momento do naso menta, um cérebro tem urna grande estruiura e a habilidad? de desenvolver suas preprias ne- gras através do que usualmente denominamos “experiencia” Na verdade, a experiencia vai sendo
acumulada com o tempo, sendo que o iríais dramático desenvolvimento (i. c., por ikga^ocs físicas) do cércbro humano acontece durante os deis primeiros anos de vida; mas o desenvolví mentó conti- nua para mullo além desse estágio. Um neurónio em "desenvol vimento" é sinónimo de um cerebro plástico; aptasticidade permi- te que o sistema nervoso em desenvolví memo se adapte ao sen meto ambiente Assim como a plas11cidade parece ser essencial para o funcionaincnto dos ncuronios como unidades de proccssamento de informado do cerebro humano, também ela o é com relajo ás redes neurais construidas com neurónios artificiáis. Na sua forma mais gera!, urna rede neural é unía máquina que é projetada para modelar a mane ira como o cerebro realiza urna tarafe particular ou fun^ao de itrteresse; a rede é normalmente itnplementada útil izando-se componentes eletrónicos cu é simula- da por programado em um computador digital. Nosso intcrcssc nesse livro está res trico a urna daMC impelíante de redes neurais que realizara computapao útil através de um processo de apnm- dizagem. Para alcancarcm bom desempenho, as redes neurais empregam urna intcrligacáo nucida de células compuíacionais simples denominadas “neijrúnio$”ou “unidades deprocessamento”. Nos podemos emáo oíerecer a seguirte definíoslo de urna rede neural vista como uma máquina adaptad va1: ¿.'ffllfl rÁ’ neural é ’ífJ prncessadnr maci^arttettteparalelamente distribuido fdinítfrurdo <h' jííjjrffl- des de proccjSMHffltiP simples, ¡jue tem a pmpensda natural para armnzenar ennhecími atn experh mental e tíintñ-ln dixpnnivet para a ui£r /.'Ar se assemetha ao cerebro em dais aspectos: 1. O conhecimento c adquirido pela red<1 a partir de sen ambiente atreves- de processo de aprendilugem. 2. FüFifíJ.h' de cwieioü ctitre nelirónius, cOrtficCidas Cümu pestís siritipficús, .nlu ttlibzadai para armazenar o ambecimenln adquirido. O procedí mentó utilizado para realizar □ processo de aprendí zagem é chamado de algoritmo de aprettdizagem. cuja fiin^áo é modificar os pesos sinápticos da rede de uma forma ordenada para alcanzar um objetive de projeto desojado. A modificado dos pesos sinápticos c o método tradicional para o projeto de redes neurais. Esta abordagem é bailante próxima da teoría dos filtros adaptalivos lineares, que já está bem cslabdeeida e :bi aplicada ccm sucesso em diversas áreas (Wídrow e Stearns^ 1935; Hay km, 1996). Entretanto, c possívcl também para uma rcdc ncural modificar sua própria topología, o que é moti- vado pelo fato de os ncurónios no cerebro humano poderem morrer e que rwvu ccnexbes sinápiicas possam cresccr. AS redes neurais sao também referidas na literatura como fíelrrucumpulíiifottX, redes íf>nexif>n¡stíisr pmeeuadoresparvleiimenle dülribitidos, etc. Em lodo esto livro, usamos □ termo “redes neurais"; ocasionalmente o termo “ncurocomputador” ou “rcdc conexión i sta** é usado. Beneficias das Redes Neurais É evidente que uma rede neural extrai mil poder compulacional através, primeiro, de sua eslrutura ma<. ¡oamente paralelamente distribuida c segundo de sua hábil i dade de aprender e portante de ge- neralizar A generalizando se refere ao feto de a rede neural produzir saldas adequadas para entradas que nán estavam presentes durante o trcinamento {aprendízagem). Estas duas capacidades de processamento de informa^ao tomam possívcl para as redes neurais resolver problemas complexos (de grande escala) que shv alualmcnic intratáveis. Napratica, cornudo, as redes neurais nao podem
tomcccr uma solu^ áo trabalhando individualmente. Em vez disso, elas precisara ser integradas cm uma abordagcm consistente de engenharia de sistemas. Específicamente, um problema complexo de interesse é decompasto em um número de tarefas relativamente simples, c atribui-sc a redes ncurais um subconjunto de tarefas que coincidem com as suas capacidades ínerentes. Entretanto* c importante reconhecer que nós temos um longo caminho a pereorrer antes de construirmos (se porventura conscguirmos) urna arquitetura computacional que mimetizeum cerebro humano. 0 uso de redes neurais oferece as seguí ates propri edades úteis c capacidades: 1. Ndo-iinearídade. Um neurfinio artificial pode set linear ou liSó-liueac Urna rede neural,. cons- tituida pcrconexdes de neurónios n3o-l ineares éela mesma náo-l incar. Além disso, a nao-linear i dade c de um tipo especial, no sentido de ela ser distribuida per toda a rede, A náo-linearidadc é urna propriodade minto importante, particularmente se o mecanismo físico responsável pela gera^áo do sinal de entrada (p, ex,, sinal de voz) for inerentcmentc nao-linear. 1 Mapeamenft) de Entrada-Saida- Um paradigma popular de aprendizagem chamado <rpmirfi* zagem COmumprvfesíürm upnífidizagem supervisio/rada cnvolvcamoditlca^aodos pesos xinápticos de uma rede neural pela aplicado de um conjunto de amostras de tndnamento rotuladas ou exem- pios da tarefa. Cada cxcmplo consiste de um sinal de entrada único e de uma respes tü desejada correspondente, Apresenta-se para a rede um excmplo cscolhido ao acaso do conjunto, c os pesos sinópticos (parámetros livres) da rede sito modificados para minimizar a diferente entre a resposta desojada e a re&pOsta real da rede, producida pelo sinal de entrada, de acordó com um cntério estatistico apropriado. O treinamento da rede é repetido para muitofi excmplos do conjunto até que a rede alcance um estado cstável onde nao haja ma i s modificadles significativas nos pesos sinópticos. Os exemplos de treinamento previamente aplicados poden) scr reaplicados durante a sessáo de treinamento, mas em uma ordem diferente. Assim, a rede aprende dos cxcm.plos ao construir um mapeamente de entrada-saida para o problema considerado. Tal abordagem nos faz lembrar do estudo de inferencia esíatistico náe-paramélricat que é um ramo da eslatfsúca que nata da cstirna- ^ao independente de modelo, ou, do ponto de vista biológico, aprendizagem tabtda rasa (Germán et. Al., 1992); o termo “nóo-paramútrlco" é utilizado aqui para significar o falo de que nüc sao feitas suposi^oes previas sobre o modela esíatistico dos dados de entrada. Considere, por ejemplo, uma tareíade ciussijicuedo de padrees na qual o objetivo seja atribuir um sí nal de entrada representando um objeto físico ou evento a uma entre varias categorías (elasses) precstabelecidas. Em uma abor- dagem nüo-parainétrica para este problema, o objetivo é “estimar" fronteiras de decido arbitrarias no espado do sinal de entrada para a Earefa de classificafS» de padrees utilizando um conjunto de excmplos, e fazé-lojem invocar um modelo de dístribuicao probabilisticc. Um ponto de vista simi- lar está implícito no paradigma de aprendizagem supervisionada, o que sugere uma analogía próxi- ma entre o mapeamento de entrada-saida realizado por uma rede neural e a inferencia estatística nao-paramétrica. 3. Adaptabihdade. As redes neurais tcm uma capacidade ¡nata de adaptar seus pesos sinópticos a medí ficaf fies do mrio ambiente. Em particular, uma rede neural tre i nada para operar em utn ambiente específico pode ser fácilmente retreinada para lidar com pequeñas modificadles ñas con- difóes operai ivas do ambiente. Além dísso, quando está operando cm um ambiente nda-esiaeinnd- ría (i. c., onde as estatísticas cnudam com o tempo), uma rede neural pode ser projelada para modi- ficar seus pesos xinápticos em tempo real. A arquitetura natural de uma rede neural para classifica- £ño de padrfies, processamento de simáis e aplicapócs de controle, alinda á capacidade de adaptado da rede, a loma uma ferramenta niuito útil para classificapáo adaptativa de padróes, pracessamento adaptativo de sinai s e controle adaptativo. Como regra geral, pode-se dizerquequanto mais adaptativo
se fizer um sistema, assegurando-se de que o sistema se mantenha estáveE, mais robusto tenderá a ser o seu desempenho quando o sistema for exigido a operar em um ambiente nao-estacionario. Contudo, deve ser enfatizado, que adaptaba lidade nem sempre resulta em robustez; na verdade pode resultar no contrario. Um sistema adaptativo com constantes de tempo pequeñas, por exempio, pode se modificar rápidamente e assira tender a responder a perturbadles espurias, causando urna drástica degradado no desempenho do sistema. Para apro veitar todos os beneficios da adaptabili- dade, as constantes de tempo principáis do sistema devem ser grandes o suficiente para que o siste- ma ignore perturbares espurias mas anida usirn serem suficientemente pequeñas para responder a mudanzas significativas no ambiente; o problema aquí descrito é referido como o dilema da exíabi- Jidade-pfasricidade (Grussberg. 1988b). 4i Rexpualu a E^ídéticiax. No contexto de classifica^ao de padrees, urna rede neural pode ser pro jetada para fomcccr informacáo nao súmente sobre qual pftdráo particular sefecionar., mas tam- bé™ sobre a confianza ou cren^a na dccisáo tomada. Esta última informacáo pode ser utilizada para rejeitar padrees ambiguos, caso eles estejam presentes, e com isso melhorar o desempenho de clas- sifica^ao da rede. 5. CMlexltarf. O conhecimento é representado pela própria estrulura e estado de ativa^ao de urna rede neural. Cada ncurónio da rede é potenciaimrntc aktado pela alividade de todos os nutrns neurónios na rede. Conseqücntcmcntc, a informa^ao contextúa! é tratada natural- mente pela rede neural. 6. Tídermcta a Fathas. Urna rede neural, implcmcnlada na forma física (em hardware), tem O potencial de ser iirtrencemente tolerante a ftdhas, ou capaz de realizar computado robusta, no sentido de que seu desempenho se degrada suavemente sob condeces de operado adversas. Se um neurónio ou suas concxóes sao daniiícados, por exempto, a recuperado de um padreo armazenado c prcjudicada em quallidade. CTontudo, deviilo á natureza distribuida da ¡rtformafio armazennda na rede, o daño deve ser extenso para que a resposta global da rede soja degradada seriamente. Assirm a principio, urna rede neural exibe uma degradado suave do desempenho em vez de apresentar urna fallid catastrófica. Há algumas evidencias empíricas para a computa^io robusta, mas geralirente ela nao c controlad*!. Para se assegurar que urna rede neural seja de fato tolerante a falhas pode ser necessário adotar-se medulas corretí vas no projeto do algoritmo utilizado para treinara rede (Kerlirpin cVallct, 1993). 7. Imptemenia^áo em VLSI. A naturcza macizamente paralela de urna rede neural a faz ser potenctalmente rápida na computacao de certas larcfas. F.sta mesma característica loma urna rede neural adequada para implcmcntazáo utilizando tecnología de integracao cm escala muito ampia. Urna virtude benéfica particular da tecnología VLSI (.very-ltirge-Kale-haeff-adün) c que ela fomc- cc um mcio de capturar comportamentO6 realmente complexos de urna forma altamente hierarqui- ca (Mead, 1989). N. Unifói midade de Atiálüe e Pwjelú. Básicamente, as redes neurai s desfrutara de universal । da- do como processadorcs de informaqáo. Dizcmos isso no sentido do que a mesma notado é utilizada ero todos os dominios cnvolvendo a aplicaqáo de redes neurais. Esto caracieristicu se manifesté de diferentes modos; » Os neurónios, de urna forma ou de outra, representara um ingrediente comum a todas as redes neurais. • Esla uní ibrmi dade loma possivel eompartilhar teorías c algoritmos de aprendizagem cm apti- ca^ocs diferentes de redes neurais, * Redes modulares podem ser construidas strwés de urna integrando homogénea de módui&i.
Intrcm>lk;Aü 31 9. A na logia Neurobiológicu. ü ptüj eto de u ma rede neural é motivado pela analogía com o cere- bro, que é uma prova viva de que o prncessamento paralelo tolerante a fe Litas - nSo sementé possíve! físicamente mas também ráp ele c poderoso. Os neurebiólogos olham para as redes neurais (artifi- ciáis) como uma ferramenta de pesquisa para a Interpretará® de fenómenos neurobio lógicos. Por metro lacio, os cngenheinM olham para a ncurobiolugia procurando novas idéias para resolver pro- blemas maifc complexos do que aqueles bascados cm técnicas convencional s de projeto por eone- xóes fixas. Estes dois pontos de vista sao ilustrados respectivamente pelos dois exempios a seguir • Em Anastasio (1993), modelos de sistemas lineares do reílexo vestíbulo-ocular sSo compara- dos com modelos de redes neurais bascados em nedes rvcunentes, que sao descritas na sc^ao l,h e discutidas. em detalhe no Capitulo 15.0 neflgw (RVO) é parte do siste- ma ocu tomo tor. A fun^áo do RVO c man tor a estábil idade da imagem visual (i.c., retina!) fazendo rota^oes oculares opostas as roEa^ócs da cabera. O RVO é mediado por neurónios pré-motores nos núcleos vestibulares que recebem e processam os sinais de rotaq&o da cabera ad viudos dos neurónios senso riáis vestibulares e enviara os resultados para os neutrón i os mo- tores do músculo ocular. O RVO c bem apropriado para modclagcm porque a sua entrada (rotado da cabera) e a sua salda (rotado ocular) podetn ser especificadas precisamente. Ele é também um rcflcxo relativamente simples cas propiedades ncurofí biológicas de scus neurónios constituimos se encontram bem descritas. Entre os tres tipos neurais, os neurónios promoto- res (mlerneuiróniüs de reflexo) nos núcleos vestibulares s£o os mais complexos e. portante. es mais inieressanlcs. O RVO luí modelado anteriormente utilizando deser ilores concentrados de Sistemas lineares e a teoria do controle. Estes modelos forain úteis. para explicar alguinios das propiedades global s do RVO, mas fomcciam pouco en tendí mentó das prepr i edades dos scus neurónios constituimos. Esta situarán mclhorou substancia!mente atreves da modelagenn por rede neural. Modelos de redes recocientes do RVO (programados utilizando um algoiiimo chamado aprendizagem recursiva em tempo-real que é descrito no Capitulo 15) podem repro- duzir e ajudara explicar mu tíos aspectos estáticos, dinámicos, nao-] incares c distribuidos do processamento de slnal pelos neurónios que medeiain o RVQ, especialmente os neurónios dos núcleos vestibulares (Anastasio, 1993). • Na tiea'mx, mais que cm qualquer outra parte do cerebro, é onde nós cometamos a agregar as rela^óes entre o mundo extemo representado porum sentido visual, sua ima^em,física proje- Cada em um airar.¡o de receptores c as primeiras imagett-i neurais. A retina é uma folha fina de lecido neural que re veste o hemisferio posterior do globo ocular. A tarefa da retina é converter uma imagem ótica em utna imagem neutral paira ser ítransmitida através do ñervo ótico para uma quantidade de centros para analise posterior Esta ó uma tarefa complexa, como evidenci- ado pela organizapáo sináptica da retina. Ñas retinas de todos os vertebrados, a transforma^áo da imagem ótica em imagem neural enzolve tré* eslágioa (Slcrling, 1990): (i) Transdueáo da energía luminosa por uma camada de neurónios receptores. (II) Transmissáo dos sinais resultantes (producidos em resposta á luz) por sinapses quúnicas para uma camada de células bipolares. (iii) Transmissao desses sinais, também por sinapses químicas, para neurónios de saída que sáo chamados de células gangliañares. F.m ambos os estágios sinápticos (Le., das células receptoras para as células bipolares e das células bipolares para as ganglionare.s) ha neuronas especializados conectados lateralmente chamados cé- lulái korixcMtíúiS c cé/w/ftv anjñcriaas, respectivamente. A tarefa desses neurónios é modificar a transmissáo atravús das camadas aináplicas. Há também elementos centrífugos chamados de cé/u-
¡as interplexijbrmes', sua tarefa c transmitir s i na i s da camada sinápLca interna para a camada cxicr- na. Alguns poneos. pesquisadores construiram circuitos eletrónicos que mimeuzam a «tintura da retina(Mahowald eMcad, 1989; Boahen e Ardreou, 1992; Boahen, 199b). Estes circuitos eleírónicos sao chamados de circuitos integrados neuromórficos. um termo cunhado por Mead (1989). Um sensor de imageen ncuromórfico consiste de um arranjo de foto receptores combinados com circui- tos analógicos ern cada elemento de imagecn (pixel. pictitrv element). Ele emula a retina na medida cm que se adapta localmente a variares na luir inane ia, delecta bordas e detecla o moví mentó. A analogía ncurobiológica. ejemplificada pelos circuitos integrados neuromcrficos. éútil lambém de outro modo importante: ela forrees uma esperanza ea crencah c de uma certa mancira a existencia de pro va, de que a eompreensáo física das estruturas neurobiológlcas pode ter influencia produliva na arte da eletrónica c da tecnología VLSI. Tcndo cm mente esta inspirado na neurobiologia, parece-nos apropriado examinarme^ brevemente o cerebro humano e seus níveis estruturais de organizado. 1.2 O CEREBRO HUMANO O sistema nervoso humano pode ser visto como um sistema de tres estágios, como mostrado no diagrama em blocos da Eig. I. I (Arbib, 19S7). O centro do sistema é o cerebro, represeniado pela rede neural (umg^t que recebe conLnuamentc informacáo» pcrccboa c toma decisoes apropria* das. Dais conjuntes de setas sfio mostrados na figura. Aquel as que apontam da esquerda para a direite indicam a transmissáo pana frente do sinal portador de niiformagach através do esterna. As setas aportando da direita para a esquerda indíeam a presenta de realtmenlacáo no sistema. Os recepiorex convertem estímulos do enrpo humano ou do ambiente externo em impulsos eléirieos que iransmitem informagáo para a rede neural (cerebro). Onatuadnrea converiem impulsos ele tríeos gerados pela rede neural cm respostas discerní veis como saldas do sistema. Eí.ümnilc FIGURA 1 .1 Rapr&MirtaGáo em diagrama em bíneos do Sistema naívoso O esforzó para entender o cerebro se lornou mais fácil pelo trabalho piomeíro de Ramón y Cajál (1911), que introduziu a ideia dos neutumiaa como constituimos estruturais do cerebro. Típi- camente, os neurónios s5c de cinco a seis ordens de grandeza mais lentos que as portas lógicas cm silicio; os eventos em um circuito de silicio aconlecem na ordem de nanossegundos (10"s}, enquan- to que eventos ncurais acontcccm na ordem de milissegundos (KHs). Entretanto, o cerebro com- pensa a taxa de operacáo relativamente lenta de um neurónio pelo número realmente espantoso de neurónios (células nervosas), com eonexóes macizas entre si. Estimarse que haja aproximadamente 10 bilhóes de neurónios no córtcx humana c od trilhóes de sinapses OU C0DCXfiC8 (Shephcrd c Koch, 199Q). O resultado livre é que o cérebro é urna cstnitura extremamente eficiente. Mais especifica- mcnict a eficiértcia energética do cerebro é de aproximadamente ID-1* joules (J) por operado por segundo, enquanto que o valor corrcspondcnic para os melhores computadores em uso cm nossos días é de cerca de 10'h joules por operacáo por segundo (Faggin. 1991), As ainüpti.'.'i sao unidades estniturais e funcionáis elementares que medeiam as interaíóes entre os neurónios. 0 tipo mais comum de smapse é a xinapse tfuíntictt, que opera da seguí me
[NntDDUCAlD 33 forma: um proccsso prc-sinápLÍco libera uma substancia transmissara que se difunde através da jun^áo sináptica entre neurónios e entao age sobre um proccsso pós-sináptico. Assim, uma sinapse comerte um si nal elélrico pré^sináptico em um sinal químico e enláo de volca em um sinal elélrico pós-sinápiico (Sbepherd e Koch. 1990). Na temí nolcgi.i el ¿trica, um demento assim é chamado de um dispositivo de dota termináis' ndo^ecipmcv. Ñas descrizóes [radífiionaisda organizacao neural, asmme-se que uma sinapse é uma ccoexfo simples que pode impor ao neurónio receptivo excítenlo ou inibicao, mas nao ambas. Anteriormente, mencionamos que a plásticidade permito que o sistema nervoso em desenvd- vimento se adapte ao seu rucio ambiente (Eggermoot, 1990: Churehiand e Scjnowski, 1992). Em um cerebro adulto, a plasticidade pode wr atribuida a deis mecanismos: a criante de novas cone- Kóes sinópticas entre neurónios c a modiíicacao das s.napscs existentes. Os uxonios, as tinhas de iransmis&So, eos dendritas, as zonas receptivas. oonstiluem deis tipos de filamentos celulares que sao distinguí veis por razoes morfológicas; um asónio tem uma superficie mais lisa, menos ramifi- crufócs e maior comprimentó, enquanta que um dendrita (assim chamado pela sua scmelhan^a cum uma árvorcjtcm uma superficie irregular c mais ra mi (i cacóos (Frccman, 1975). Os neurónios apa- recen! em uma grande variedade de formas e lanianfios cm diferentes partes do cerebro. A Figura 1.2 i lustra a forma de uma eéiuia piramidal, que c um dos tipos mais comuns de neu reñios corticais. Como multas outros tipos de neurónios, cía recebe a maiona de suas entradas através de espmitas dendritais; veja o segmento de dendrita na inscrito da Fig. 1.2 para detalhes. A célula piramidal pode reccber lO.OÜOou muís contatos sinópticos c pódese prticíar sobro miLharcs de células-alvo. A maioria dos neurónios. codifica suas suidas como uma série de pulsos breves de lensao. Estes pulsos, usual mente conhccidos como potenciáis dentelo ou impulsos (spikes), originam-se no corpa celular de neurónios, nu perta dele, e entilo se propagan! através dos neurónios individuáis a velocidade e ampl ilude constantes. As razoes para o uso de potenciáis de a<;ao para a comunicante entre neurónios se basciam na física dos axónios. O axónio de um neurónio c muito longo c fino o c caracterizado por uma alta resistencia elétrica cunta capacitancia muito grande. Estes dois elemen- tos cstáo distribuidos ao longo do axónio. O axónio pode tóssim ser modelado como uma linda de transmissáo RC, daí o uso ccmum da "cqua^áo de linha" como a tem: inologia para dése rever a propagarán do sinal ao longo de um axónio. A a nal i se dcstc mecanismo de propagado revela que, quando uma lensáo é aplicada a urna estreñí dado do axónio, cía dccai exponene lalmcnte com a disiáocia, caindc a um nivel infligpilicanlv no mumcnio em que ela atinge a outnt extremidade. Os polenciais de afáo fomecem urna mancira de evitar este problema de trian sm L xsao (Andcrson. 1995). No cerebro há organizares Anatómicas lanío em pequera cscalfi como ern grande escala, c fun^óes diferentes ocorrem nos ni veis mais baixos e nos mais altos. A Figura 1.3 mostra urna lii epar- quía de nívei i entrelazados de organizante, emergente do extenso traba! ho sobre a anal i se de negióes localizadas no cerebro (ShepherdeKoch, J990:Churchlaiidc Sejnowski, ] 992). ncprcüci)lam o nivel mau fundamental, dependente de moléculas e ions para sus a^áo. Nos iiivei'i seguintes. temes os microcircuitos ncurais, as árvores dcndrlfais e entáo os neurónios. Um micmcircidto neumi se refere a um agnipamcnlc de sinapses organizadas cm padrees dcconectividadc para produzir uma operazáo funcional de Ínteres», Uní mi croe ircuito ncural pode ser comparado a um circuito de silicio constituido por um agrupamente de transistores. O menor tamanho dos mi cree incultos c medido em micrómetros e a sua yclocidade de opem^te mais rápida é medi- da em miiHscgundos. Os miuroeirculíos neurais san agrupados para formar xtibwiidades dendritaia dentro das árvores deitdritots dos neurfinfos individusis. O neinv/fio completo, com tamanho de cerca de lOd pm, contém vári as subunidades dendrita i s. No nivel seguirte de complexidade nos temos eir•caitos ¡ováis (cerca de 1 mm de lamanho) constituidos por neurónios com propr¡edades similares ou diferentes; estes agrupamentos neurais real i rain operares cañad eri áticas de uma re-
34 Kh ]FS Nt-UKA IS FIGURA 1.2 A céluta pi rameal giáo focalizada no cerebro. Eks sSO seguidos por cfnriw'to.v infer-regíonaia constituidos por carril- nhos. coluros c mapas topográficos que envolvem regí oes múltiplas localizadas em partes diferen- tes do üdrebro. Os mapaj1 topográficossao organizados para responderá informado sensorial incidente. Es- tes mapas sao freqücntcmcntc arranados cm fallías, como no coiíctJt> jtaperit/r, crde es mapas visual, auditivo c so meslésicri están empilhados cm camadas adjaccntes de tal modo que estímulos advindoti de pomos correspondentes no espado se localizan acima ou abaleo de cada um deles. A
1ntrodlx;áo 35 FIGURA 1.3 Organizado estrutural dos ni veis no córebro Figura 1.4 aprésenla um mapa citoarquilctural do córtex cerebral como apurado por Brodmann (Brodal, 1981). FIGURA 1.4 Mapa citoarquitectural do córtex cerebral. As diferentes áreas sáo «dentiheadas pela espessura de suas camadas e tipos de células netas conttdas Algumas das áreas especificas mais importantes sáo como segue. Córtex motor: banda motora, área 4; área pré-motora, área 6; campos oculares frontais, área 8. Córtex somesiesico áreas 3, 1.2. Córtex visual: áreas 17. 18. 19 Córtex auditivo: áreas 41 e 42. (De A. Brodal, 1981; com permissáo da Oxford Unrversity Press.)
36 Ri m - ts'b.uuB Esta figura mostra claramente que diferentes entradas sensor¡ais (motora, somestésica, visual, audi- tiva, etc.) sao raspeadas sobra áreas correspondentes do córtcx cerebral de uma Forma ordenada. No nivel final de complotidade, os mapas topográficos e outros circuitos inter-regi onais medeiam tipos específicos de corapnriamento no aistema nervoso centrui. É importante reconhcccr que os niveis cstruturais de organizando descritos aquí sao uma ca- racterial ica única do cerebro. El es nao sáo encontrados em lugar algum em um computador digital, eolo estamos próximos de recriados com redes neurais artificiáis. Apcsar disso, estamos avanzan- do gradualmente no eaminho de uma hieranquia de ntveis computacionais similar aquel a descrita na Fig. 1.3, Os neurónios artificiáis que utilizamos para construir nossas redes ncurais sao realmente primitivos em comparado com aqueles encontrados no cerebro. As redes neurais que atual mente podemos projetar sao comparativamente lio primitivas quanto os circuitos locáis e inter-regionais do cerebro. O que c realmente gratificante, contudo, c o progresso notávcl alcanzado em varias frentes durante as últimas duas décadas. Com a analogía neurohiológica como fonle de inspirafiD e com a riqueza das Fcrramcntas teóricas c tecnológicas que temos acumulado, estamos cortos de que cm mais uma década nossa compreensáo das redes neurais artificiáis será mullo mais sofisticada do que cía o c atualmcntc. Nosso interese primordial neste livno está limitado ao esludu das redes ncurais artificiáis de uma perspectiva de engenharu? Cometamos o cstudo descreyendo os modelos de neurónios (arti- ficiáis) que formara a base das redes neurais consideradas nos capítulos subsequentes do livro. 1.3 MODELOS DE UM NEURONIO Um HeuHMiiD é uma uní dado de proccssa mentó de informaqao que o Fundamental para a opera^áo de urna redi1 neural. O diagrama em bíneos da Fíg- 1.5 imoalra o modelo de um ncurónic, que Forma a base para o projelo de redes ncurais (artificiáis). Aquí nós identificamos tres elementos básicos do modelo neurona I: figura 1.5 Modelo náo-lrnear da um nauFÓniíJ Ir Um conjunto de fótqpfts ou eíaidgconexiiú, cada uma caracterizada por um peso ou /arpa propri a. Espcci ficamcntc, um siria L 21 na en trada da sinapse/ conectada ao neurónio A é m ull ipl i- cado pelo peso sináptico u1^. I. importante notar a mancira como sao escritos os índices da peso smáptico w;. O primeiro índice se refere ao neurónio em questao c o segundo se refere ao terminal de entrada tía sinapse á qual o peso se refere. Ao contrário de urna sinapse do cerebro, n peso sináptico de uní neurónio artificial pode estar em uro intervalo que incluí valores negati- vos bem coran positivos.
2. I Jm samadnr para sumar os s i na i s de entrada, ponderados pelas respectivas sirápscs do ncurón lo, as opera^oes descri tas aquí CODStilUCfn utl\ cambiijador tincar. 3. Uma /wifflo de etfrapfo para restringir a amplitudc da saída de um neurflnio. A fun^So de ativa^ao c também referida comoj resrrítfvu já que restringe (limita) o intervalo pertnis- sivel de amplitude do sina! de sai da a um valar finito. Típicamente» o intervalo normalizado da amplitude da saida de um ncurvnio é escrito como o intervalo unitario fechada [O, 1] ou alternativamente [-1, 1], O modelo neuronaI da Fifi. 1.5 incluí também um j&ítf.v aplicado externamente, representado por ?.. O bias b{ tem o efeita de aumentar ou diminuir a entrada líquida da lunqáo de aliva^ao, depundendo se cíe c positivo ou negativo, respecté ámente. Em termos matemáticos, podemos descrever um neurónio A escrevendo n seguíate par de cqua^ocs: ni J6 = IR , e y\ = «n-(iía h A.) (l.t) (1.2) undu.vr .v,...sloos sinais de entrada; u^, ....sao os peso!» sinápticcs do neurónio Á\ m# é a Mida do combinador linear áevido aos sino i s de entrada; í' é o bias; (p () c a fun^üo de trfivfflpfio; cy c o sinal de saída do neurónio. O uso do bias (cm o clcilo de aplicar uma transformando afitn á saida a( do combinador linear no modelo da Fig. 1.5, como mostrado por r. = n+¿t (13) Em particular, dependendo se o h ¡as ht é positivo ou negativo» a relajo entre o campo local induci- da cu potencial de afivanda uc do neuronio £ c a saida do combinador linear u1 ó moditicada na forma ilustrada na Fig. 1.6; de agora cm di;iiUc, o termo “campo local induzido" será usado. Note que como resultado desta transformado a ti ni, o gráfico de em fuñado de ií( nao passa unáis pela crigem. FIGURA 1.6 Transfarniacao <1éti produridá pela presenta da um bias; nol& que v. em 1^*0.
O bias b é um paramcira externo do neurónio artificial A. Podemos considerar a sua presenta como na Eq. (1.2). Equivalcnicrncntc, podemos formular a combinado das Eqs. (II) até (13) como segué: .11 (M) (1.5) Na Eq. (1-4), adicionamos uma nova sinapse. A sua entrada c (1.&) e o seu peso c (1-7) Podemos, perianto, retbrmular o modelo do neurfiflio i como na Fig, 1,7, Nesla figura, o efeito do b. ís é levado em corita de duas maneirasi (1) adicioriando-se um novo si nal de entrada fixo cm +1 e (2}adicionando-se um novo peso sináplico igual ao bias b.. Embora os modelos das Figs. 1.5 C 1.7 sejtim diferentes na apariencia. el es silo matemáticamente equivalentes. finápliccs ¿ i ncEisi nd-:'' o FIGURA 1.7 Um oulro modelo náo-lirear de um neurónio Tipos de Fun^ao de Atlvapao A funcao de aiivafac, representada por tp(tX dtfme a salda de um neurónio cin termos do campo loca] inducido r. Aquí nós identificamos tris tipos básicos de fundóos de ativa^an: I. Fttít^So de Limiar. Para este tipo de funcán de atlva^áo. desuri lo na Fig. 1.8 a, temos ü se v¡* 0 se r < 0 (1-8)
IrvntoMJt;AQ 39 FIGURA 1 .S (a) Fun^Sa de ímiar. (bj FunpSo linear pw parles, (c) Fun^áD siflrttóitfe páre parÉmairú de inclinac&o u variável Na literatura de engenhariíu esta forma de fun^áo de Iimiar c normalmente referida como fuñado de Hesvíxide. Correspondentemente, a saída do neurónio que emprega esta fun^ao de limiar c ex- pressa como í l se ut > Q J * 10 se < 0 (1.9) onde v4 é o campo local induzido do neurónio; isto é J-l (110) Tal neurónio ó referido na literatura como o madejo de McCnlioch-Piíls, em reconhecimentó ao trabalho pionciro realizado por McCulloch c Pitts (1943). Neste modelo, a saída de um tieurónio assume O valor k se O campo local induzido daquele neurónio c náo-negative, c 0 caso contrário. Esta defímeao déseme a pmpriedade tudo-ou-nada do modelo de McCulloch-Pitls.
2. Fitnpoo j urea? par Paites. Para a fuñico linear por partes descrita na F g. 1.8b temos j' >+{ (i.ii) onde a$sume-se que o fator de amplificarán dentro da regían linear de operacáo c a unidade. Esta forma de fundan de alivaqáo pode ser vista cottid uma aproximaban de um amp ificador nao-Linear. As duas situantes seguí n tes podem ser vistes como formas especiáis da fundan linear por partes: * Sí a regiáu linear de operario e maní ida sem entrar em saturado, surge um combinador iirteaf. • A funqáo linear por partes se reduz ijunb-au de limitar se o fakir de amplifica^ito da rqpio linear éfeilo infinitamente grande. 3. Furi^ao Sigmóide. A Curnjao Mgmóide. cujo gráfico lem a forma de s, ¿ de longo a forma malí comum de fun^o de ativafio utilizada na construyo de redes neurais artificiáis, lila é definida como urna fuiicáo estriiamentc crescentc que ex i he um íjalanceamentc adequado entre com porta- mcnio lineare nao-linear.' Um excmplode fundan sigmóideéafititbán fagiwi'caS definida por q?(r) = -----;---- 1 +eKp(-av) (1.12) onde a ó o parámetro de iacUtiabua da fiuuiáo sigmóiJc. Vari ando-se o parámetro a, obremos fun- des sigmóides com diferentes inclinantes, como ilustrado na Fig. 1.8c. Na verdade. a iiiclina^áo na or.gem é igual a xd/4. No 1 imite, quando o parámetro de inclína^áo se aproxima do i nfiníto, a fun0O sigmóide te loma bimplesmente uma futifíio de lindar. Eínquanto que a fuiieáo de limiar assumc o valor de 0 ou 1, uma fundan sigmóide assumc um intervalo continuo de valores cnlre í) e 1. Note tilín hem que a finido sigmóide é di rerene i ávd, etiquen tu que a fimqBo de limiar úSo o c. (Diferenciantildado é uma característica importante da teoria do redes neurais, como descrita no Capítulo 4.) As fundes de alivio definidas ñas Eqs, {1 .8). (l. 11) c (1.12) *e e-stendem de 0 a +1. Al ¡fu- cilas vezes c dcs^jávcl que a funqáo de ativaqáo se cstenda de I afl, a.ssmilindo ueste caso urna forma anti-simétrica em relajo á origein; isto é, a fon^o de alhajo é uma fun^áo impar do campo local iridu/idó. Especificar nenie, a fuñado de limiar da liq. (1.8) é definidla agoni como I se r > Ü <p( el =< 0 jé tí = Ü (1.13) -1 .Yf ÜKÓ a qual é normalmente denoiniiiada/jírrcJíj .•iimii. Fama forma correspondente de uma fundan sigmóide, podemos utilizar a./l«ícñí? ¡anuente ftiperbática. definida por <p (w) = tanh (w) (1.14) O fatodc se permitir que urna fun^áo de auvaciínk-- lipu sigmóide assuma valores negativos como descrito pela Eq. (1.14; traz beneficios analíticos (como mostrado no Capitulo 4).
Modelo Estocástico de um Neurónio O modelo neuronal descrito na Fig. 1.7 ¿ detennlnisüco já que o seu comportamento de entrada- saída é definido precisamente para todas as entradas. Para algumas aplica^res de redes neurais, é dcscjávcl que il análisc scj a bascada cm um modelo neurona! cstocáslico. Em uma abordagem ana- líricamente íratável, é dada uma interpretado prübabilislica á íunfáo de aliva^ac do modelo de McCulloch-Pitls. Mais específicamente, pemil tose que um neurónio assnma apenas um de dqis estados: +1 ou -1* por exemplo. A decisáü para disparar um neurónio (i.e., mudar sen estado de “desligado" para “ligada") é probabilística Considere quex represente o estado do neurónio e P(v) represente apmbabiiidade de disparar, onde tj é o campo local induzido do neurónio. Nos podemos cnlao cscrever f+1 com probabllldade f(ti) -i com probahilidadc ! - Uma escolha padreo para /’(»> c a fu tifio de forma sigmóide (titile, 1974): P(u) =---------:------ l + ex.p( v ' /') (1.15) onde Tó uma pwudotemperaiwu que é utilizada para controlar o nivel de ruido e portan co a incer- teza de disparar E importante pcnccbcr, entretanto, que f nao c a temperatura física de uma rede neural, seja ela uma rede neural biológica ou anificial. Em vez disso, como já mencionado, nós devemos considerar T meramente como um parametro que controla as flutua^ocs térmicas que representara os efeitos do mido sinóptico. Note que quando T -> 0, o neurónio estocástico descrito pela Eq,(l. 15) se reduz a uma forma sem ruido (i.e., deiermmística), que é o modelo de McCulloch- Pitts. 1,4 REDES NEURAIS VISTAS COMO GRAFOS ORIENTADOS O diagrama ew blocas da Fig. 15 ou aquele da Fig. 1.7 fomccc uma dcscri^ao funcional dos varios elementos que ccnstiluem o modelo de um neurónio artificial, Nos podemos simplificar a aparéncia do modelo utilizando a idéia de grafos de fluxo de sitial sem sacrificar qunísquerdetalhes do mode- lo. Os grafos de fluxo de sinal juntamente com um conjunto bem-deiInido de negras foram desen- volvidos originalmente por Masan (1953, 1956) para redes lineares. A presenta de nao-l inearidade no modelo de um neurónio limita o encopo de sua aplicando as redes neurais. Apcsar disso, os grafos de fluxo de sinal fomeccm um método elegante para retratar o fluxo dos sinais em uma rede neural, que c o nosso objetivo nesta scqao. Um grajo dv fluxo de siual é uma rede de elo# (mmos) orí enlados que sSc iriterligados cm certas pontos chamados ndr. Um nó típico j tem um sinal nodalx associado. Um cío orientado típico origlna-se no nó,/ e termina no nó k; ele tem umayuHpto de íransferencia ou transmitáneia associada que especifica a transirá pela qual c sinal _i L no nó k depende do sinal x no nó j. O fluxo de sinais ñas diversas partes do grafb é ditado por tres regras básicas: Jtegra 1. Um sinal fluí ao longo de um elo somente no sentido definido pela seta do elo. Dois diferentes lipes de clos podem sor distinguí dos:
* Í7af sinópticos, cujo oornporiamcnto é guvemado por uma retablo de entrada-sai da linear. Específicamente, o sinal nodal .t é multiplicado pele peso sináptico para produziro sinal nodal como ilustrado na Fig. 1.9a. -----£.------o /jt. W¡/X/ (•) Jj o------------» a >t ifiCtjí FIGURA 1.9 I lustrado das regras básicas para a confilruQ3ó da gr^fcc ds lluxo de sinal i«H • EAw de ativacao, cujo comportarnento ¿ gobernado em geral por uma relamía de entrada-sai da rófr-Atanr. Esta forma de relajan c ilustrada na Fig. 1.9bt onde (pf-J c a funcac de ati^^áo nao-linear. Rpgra 2» Um sinal nodal é igual á soma algébrica de lodosos sinais que entrara no no pertinente via os cios incidentes. Esta segunda regra c ilustrada na Fig. 1.9c para o caso de crtnwjpénria tfndptiéú OUjílrt-wl. Regra 3, O sinal cm um nó c transmitido para cada cío do saída originario deste nó, sendo a trans- mis&áo in tetramente independente das fundes de transferencia dos el os de saída. Esta tcrccira regra ¿ilustrada na Fig. 1.9d para o caso de dhwgéiicrfl .wnóptrea ou fan-Mf. Utilizando estas regras podemos construir,. por escmplo, o grato de fluxo de sinal da Fig. 1.10 como o modelo de um neurónio, correspondente ao diagrama cm blocas da Fig. 1.7, A representa- q5o mostrada na Fig. 1.10 é claramente mais simples em aparéncia que aqueta da Fig. 1.7, apesar de conter todos os delalhcs funcionáis descritos naquele diagrama. Note que em ambas as figuras a entrada ,rff = +1 e o peso sináptico associadn WÉ<I A., onde é o bias aplicado ao neurónio De fato, com base no grafo de fluxo de sinal da Fig. LIO eomu o modelo de um neurónio, podemos agora ofcrccer a segumte defiji:^án malemíhu de uma rede neural:
AGURA 1.10 Grate de fluxo cíe sina' de um neurónio E/má rede neund é um grafo ttrifniíido constituido de nóy cpwj c/íw ífr ftiferliga^do sinópticos <? de ativa^ao e é caracterizada por guaira propiedades: I, Cada neurimia é representada por um coFi/Mfffo di? dos sinópticos lineares, um bias aplicado externamente e um do de ativa^ao possivdmente nUa-linear. Obiasé representadapw um do sinóptico conectada a uma entrada fixa em -l- l. 2. Os elos sinópticas de um neurónio ponderan os seas respectivas sinais de entrada. 3, A soma ponderada dos sinais de entrada define o campo loca! inducido do neurónio em ques* tac. 4. O ela de afivafaa Umita o campa ¡acai induzidn da neumnio para prwtuzir uma salda. O estada do neurónio pode ser definido cm termos da seu campo local induzido ou de seu sinal de salda. Um grafo orientado assim definido é completo no sentido de ele descrcvcr nao somente o fluxo de sinal de neurónio para neurónio, mas lambóm o fluxo de sinal dentro de cada neurónio. Entretanto, quando o foco de atcn^ao c rustrito ao fluxo de sinal de neurónio para neurónio, pode- mos utilizar uma forma reduzida deste grafo, omití ndo os detalhes do fluxo de sinal no interior dos neurónios individuáis. Este grafo orientado é chamado de parcialmente completo. Ele é caracteriza- do como segue: 1. Nos defonte fomecem sinais de entrada para o grafo. 2. Cada neurónio é representado por um único nó chamado de nó computacional. 3. Os efos de comunicando que eonectam os nós de fonte aos nós compulacionais do grafo nSo carrcgam pesos; des meramente fomceem diretes de fluxo de sinal no grafo. Um grafo orientado parcialmenle completo definido dessa forma ó referido como um gra/o arquitetural) que dcscrcvc a planta da rede neural. Ele o ilustrado na Fig. 1.11 para o caso simples de um único neurónio com m nós de fonte e um único nó fixo em +1 para o bias. Note que o nó computacional que representa o neurónio está mostrado sombreado c o nó de fonte c mostrado como um pequeño quadrado. Esta convengo é seguida em lodo 0 livro. Exemplos mais elaborados de plantas arquiteturais sfto apresentados na Sc^áo 1.6. Para resumir, temos tres rcprcscntacoes gráficas de uma rede neural: • Diagrama cm biocos, que fomccc uma dcscricác funcional da rede.
FIGURA 1.11 3rata arquitet u ral da um naurónio » Grafo de fluxo de siriaL que fúmese urna describió completa do ftuxo de sinal na rede. • Grato arquitctural. que descreve a planta da rede. 1.5 REALIMENTAQÁO Dizemos que existerealítHefttatfü em um sistema dinámico sempre que a saída de um elemento do sistema influencia cm parte a entrada aplicada áquelc elemento particular. Originando assim um ou mais de um caminho fechado para transmito de sinais em torno do sistema. Na verdade, a reaLi- menlacao ocone em quase tedas as partes do sistema nervoso de lodos os animáis (Freeman, 1975). Além Jisso4 cía desempenha um papel importante no cstudo de uma elasse especial de redes ncurais ccmhccidas como redes recórtenles. A Figura 112 mosira o grafo de fluxo de sinal de um sistema realiineRíado de laca único, onde o ¡sinal de entrada jt(jj), o sinal interno j. '(>;) eo sinal do saída v,(rt) sao funches da varia vel de tempo discreto n. Assume-se que o sistema seja linear. consi Blindo de um caminho di reto e de um caminho de real: inentacáo que sto caracterizados pelos “operadores’* A e B, FIGURA 1.11 Grata de 1luxo da sinal de um sistema realimenladD com Ibj;ü única respectivamente. Em particulada saldado canal dircto determinacm partesua propria saídaatravés do canal de real i mentado. Da Fig. 1.12 notamos fácilmente as seguimos relaijóes de entrada-saída: [.v.W] (1.16) X.^1) i- H Lvx(n)J (1 17} onde os colchetes &¡So incluidos para enfatizar o falo de/I cB agircm como operadores. Eliminando .r VO entre as cqs. (l. 16) c (1.17), obtemos h 00 = —-—[x.(*o| J l-X5L ' J (1.18) Rcfcrimo-nos a ] - AH) como o operador de ia^ófechada do sistema, e a Afi como o operador de luco abert™. Em gerak o operador de taco aherto náo ¿ comida ti vq no sentido de que HA * AB. Considere» por excmplo, o sistema rcalimentado de taco único mostrado na Fig. L. 13, no qual A ú um peso tixu. cí cum operador de atraso unhtiriii^ z k cniia saída está atrasada cm relajo
iMTRGOLQto 45 FIGURA 1.13 Greta-de flu*Q de sinal de um fiiltro de respoEta a impulso de d dragaa infinita [Hfí. intrnite-dwation impu¡S9 respan&s], de prim&ira ordem á entrada cm uma unidade de tempo. Podemos enlao ex pressar q operador de lapo fechado do sistema tumo A _ ic I - ~ I -V7 1 = W(i-WÍ ') 1 Utilizando a expansao binomial para (l - «•; 1) ', podemos rescrever o operador de 1 a<;c fechado do sistema como .4 I - AB .-ii : (1.19) Assim, substitLÍndo a Eq. (1.19) cm (1.18), oblemos ytOi}= J [.¥>)] (1 20) onde novamente incluimos os cólcheles para enfatizar o falo der 1 scrum operador. Em particular, da definido de z 1 temos tJ [<001 " x/« - 0 (1.21) ondc.r (zr - J1) é uma amostra do sinal de entrada atrasada de ! unidades de tempo. Conscqíientcnnerv teT poetemos expressar o sinal de salda; .(h) ramo uma soma ponderada infinita das amostras pre- sentes c passadas do sinal de entrada jt/ji), como mostrado por v- J ; («) = £«7'*’ *0 (1.22) Vemos claramente agora que o comportamcnto dinámico do sistema é c unir o lado pelo peso W. Em particular, podemos distinguir deis casos específicos: I, |ir| < ]. para o qual o sinal do salda jj({») ó exponencial mente ctwergtW; isto é, o sistema é ¿íídvífZ kto é ilustrado na Fig. 1,14a para um ir positivo. Z |w| > I, para o qual o sinal de salda c isto é, o sistema c instável. Se jü| = I a divergencia é linear como na Hg. 1.14h, c se f?v| > L a divergencia ó exponencial como na Fig. 1.14c, A estábil idade lem papel de destaque no estudo de Sistemas rea! ¡mentados. O caso de it’| < I corresponde a um sistema com memoria infinita no sentido de a salda do sistema depender das amostras da entrada que se eslendem sobre o passadü infinito. Alóm disso. a memoria é eswecertte já que a inilucncia de uma amostra passada se reduz exponencial mente com o tempo n. A análi&e do comportamento dinámico das redes ncurais en vol vendo a api ¡cacao de rcalimcu' lafao nfelizmente c complicada pelo falo de as unidades de proccssamento utilizadas para cons-
l 0 12 3 4 figura 1,14 Reiposta temporal da Fig. 1.13 para tréj valoras dife- r&nt&s da pasos wem um cammlxi para ironie. (?) gsiavelr(O) Divar- gBncia li»iMr. (c) L' ^orgflncia expnnancial fruir a rede serem geralmente fútodtneara. Outras considerares adicionáis sobre este assunto serán tratadas mais adianto tiesto livro. 1 >5 AROUITETURAS DE REDE A mancira pela qual os neurónios de uma rede nCural estad estro turados Mtá intimamente ligada com o algoritmo de aprendizagem usado para treinar a rede. Podemos, pódanlu. (alar de algoritmos (negras) de aprendizagem utilizados no projelo de redes neurais como sendo esíntitiradü.^ A classi- ficacao de algoritmos de aprendizagem ó considerada no próximo capitulo, e o desenvolvimcnto de diferentes algoritmos de aprendizagem é tratado nos capítulos suhsequentps do livrQ, Nesta sepilo, focalizamos hossaatencáo ñas anquí ícturaií (cstroluras) de redo. Em geral, pedemos identificar tres classes de arquiteturas de rede fundamentalmente diferentes: 1. Redes Alimentadas Adiante com Camada Única Em urna rede neural a» ¿.amadas, os neurónios cstao organizados na forma de camadas. Na forma mais «implen de urna rede cm camadas, temos uma etunada de entrada de nós de fonte que se projeta sobre uma camada de suida de neurónios (nós computad ornáis), mas n3o vice-versa. Em entras palavras, esta rede é estritamente do tipo af¡mentada adíame mi acicHea, Ela é ilustrada na
ImtroolcAo 47 Fig. 1.15 para o caso de quatro res canto na camada de entrada como na de salda. Esta rede é chamada de rede de camada ártica. sendo que a desígnalo “camada única'1 se refere á camada de saída de nos compulacionais (neurónios). Njin COtilamos a camada de entrada de nós de forte, porque 1á rúo ó realizada qualquer computando. Carnuda Jl_ Lnlrjilü . Jú íieururiiús, de fúme Cániaila de uuL de iied róiiió-i FIGURA 11.15 Rada alimentada adíente ou acidia com uma única camada da neurónios 2. Redes Alimentadas Dlretamente com Múltiplas Camadas A segunda elasse de uma rede neural alimentada adianto se distingue pela presenta de unía ou mais camadas och/Ah, cujas nos compulacionaís siu chamadoscontspondentemenledeneun&ftiasacuif/js ou ttculfax. A fuinjao dos neurónios ocultos éinterv ir entre a entrada externa e a salda da rede de urna mancira. útil. Adicionandc-sc uma ou mais camadas ocultas, tomamos a rede capaz de cxtt&ir cstotfclicu de ordem elevada. lún uní sentido bastante livre, a rede adquire uma perspectiva gtobctf apesar de sua concclividade local, decido ao conjunto extra de concxócs sinópticas c da dimensáo extra de intenses neurais (Churchland c Scjnowski. 1992). A hábilidade de os neurónios ocultos ext miren cstal Esticas tic ordem elevada é particularmente valiosa quando o tamañito da camada de entrada é grande. Os nos de fonle da camada de entrada da rede fomcccm os respectivos elementos do padráu de ativaffto (velor de entrada), que constituem os stJiais de entrada aplicados aos neurónios (nos compulaciortais) na segunda camada (í.e.. a pri meina camada oculta). Os sinnis de salda da segunda camada sao utilizados como entradas para a tercera camada, c assim por diantc para o resto da rede. Ti pica mente, os neurónios em cada camada da rede tém como suas entradas apenas os sitiáis de suida da camada precedente. O conjunto de abluís de suida dos neurónios da camada de Mída (íinaI) da rede constituí a resposta global da rede para o padrau de ativa^ao fomucido pelos nos de fonte da camada de entrada (primeira). O grafo arquilctural na Fig. 1.16 ilustra a planta de uma rede neural de múltiplas camadas alimentada adianto para o vaso de uma única camada uculia. Porconcisao, a rede na Fig. 1.16c referida como uma rede 10-4-2 porque ela tcm ID neurónios de fontc, 4 neurónios ocultos c2 neurónios de sai da. Como um nutro ejemplo. urna rede alimentada achante com m nós de fonle, h neurónios na primeira camada oculta, /i, neurónios na segunda camada oculta c q neurónios na camada de uídn é referida como urna rede m-h^k q. A rede neural da Ftg. 1.16 é dita iaíafmente enneciada, no sentido de que cada um dos nos de uma camada da rede está conectado a todos os nos da camada adjaccntc seguí ntc. Entretanto, se alguns dos dos de comunícacao (concxócs Mitápticas) esliverem faltando na rede, dizemos que a rede ^pttKlüintunít: ctutncfiuia.
FIGURA 1.1B ftede alimsnlada ad ar la ou aciclica totalmente conectada cdíti uma camada oculte e uma camada de caída Camada de entrada da ntade tente Camada da rteurOnióS ocultos Camada da neurfinios de salda 3. Redes R eco frentes Uma fvtie neurül recórreme se distingue de uma rede neural ah mentada adianto por ter pelo menos um I¡ko de reaii'fnetiia<;¿¡ü. Uma rede recurrente pode consistír, por exemplo, de uma única camada de neurónios com cada neurónio alimentando jeu sínaL de saída de volts para as entradas de todos os outros neurónios» como ilustrado no grafo arquitctural da Fig. 1.17. Na estrutura representada nesta Itgura» ndo há lafos de autorealimenta^áo na rede; auto-reakineniafSoscrcfcrca uma sitúa- q3o onde a saída de utn neurónio é «alimentada para a sua própria entrada. A rede recorren! e FIGURA 1.17 ñette recórrante ssm tarjos de aiUte-itePlimente^BO sen neurOniw ocuNos
iMKlDUIr’ÁO 49 ilustrada na Fig. 1.17 tambémn¿o tem neurónios ocultos. Na Fig. 1.1 8., ilustramos uma mitra classc de redes recurrentes CúiTi neurónios ocultos. As concxñcs de ncalimcntagáo mostradas na Fig. LIS se originan! dos neurónios ocultos bem como dos neurónios de safda. A presenta de lagos de real i mentaban, quer se.a na cstrulura rucorrcnlc da Fig. 1.17 ou naque- la da Fig. LIS, tem um impacto profundo na capacidade de aprendizagem da rede e no seu desem- penho. Além dissci,<is lagos de realimentagáo cnvoivcm o uso de ramos particulares compostos de elementos de atrasa ujnfthíG (representados por; o que resulta em um comporta mentó dinámico n&ü-lineíir, admitmdo-sc que a rede neural contenta unidades nao-Lineares. 1.7 REPRESENTADO DO CONHEClMENTO Na Segáo l.l, utilizamos o termo "ocxihecinienttf na definig Jo de uma rede neural, sem uma des- criban explícita de que isso significa para nós. Agora nos ocuparemos desse assunto ofcreccndo a seguinte definido genérica (HuMer e Firsebein, 1987): Cutiheeimentú se refere ti ’iunenoda <mj n modelos utilizados par ftoiapessoa au máquina para mrcrpn'iaK prever e responder aprapritidíituefrrr uo mundo exterior. Sin duas as principáis características da representadlo do conhecimento: (1) que informaba a ó realmente Lomada explícita; c (2) como a informapáo é codificada físicamente para o uso subsc- quelite. Portante, pela sua prúpria natureza, a representaban do conhceimcnto c dirccionada a um objetivo. Em aplicares do mundo real de máquinas “inteligentes”, podemos dizer que urna boa solugao depende de uma boa representagao do conhceimcnto (Woods, 1986). Assim tambem o c com as redes neurais que rcpresenlam uma das.se especial de máquinas inteligentes» Típicamente, entretanto, as formas possiveis de representado desde as entradas até os parámetros internos da rede sao mirto diversificadas, o que tende a tomar o desenvolví mente de uma solugáo salufatória útil izando uma rede neural um desafio real do projeto. Uma tarefa importante para uma rede neural é aprender um modelo do mundo (ambiente) no qual cía está inserida e manter o modelo suficientemente consistente com o mundo real de mancira Copyrighted materi
a atingir os objetivos especificados da aplicado de intcrcsso, D conhccimentó do mundo consiste de dois tipos de informadlo: L O estado conhecido do mundo, representado pelos falos sobre o que é e o que era conhecido; esta Forma de conhccitnealo ó chamada de üijfonwacáo prévía. 2. As observares (medidas) do mundo, obtidas por mcio de sensores proj ciados para sondar o ambiente no qual a rede neural deve operan Normalmente, estas observa^óes sáo ioerentemente ruidosas, sendo sujcitas a erres devido a ruido do sensor e imperfeí0es do sistema. De qualquer maneira, as observares que sSo assim obtidas fomecem o conjunto de informales de onde sita retirados vtexempfas utilizados para treinara rede neural. Os exemplos podem ser rutttkida'i ou ndo-ra/u/adar Nos ejemplos rotulados, cada cxc implo que representa um final de entrada é ajsociado a uma r•empasta ¿¡enejada correspondente (Leu, saída* alvo), Poroutro lado, os cxcmplos nao-rolulados consistem de ocorrencias diferentes das próprios sinais de entrada. De qualquer maneira, um conjunto de ejemplos, rotulados on n3o, representa o conhccimentó acerca do ambiente de interesse que uma rede neural pode aprender através de treina- mento. Um conjunto de pares de entrada-saída. com cada par consistindo de um sinal de entrada c a resposta desejada correspondente, é referido como tí/n conjunto ¿le dados de ireinsmento ou ct/íioi- tí-u ¿fe treinamenffi. Para ilustrar como este conjunto de dados pode ser utilizado, considere, por exemplo, o pmbtcma da tvconíteci menta de um digit¿> manuscrito. Ncstc problema, o sinal de entra- da consiste de uma imagem com pócela (elementos da imagem) pretos ou brancos, com cada tma- geni representando um dos 10 dígitos que estáo bem separados do fundo. A resposta desejada c definida pela "idcnñdadc" do dígito particular cuja imagem c a presentada para a rede como o sinal de entrada. Típicamente, a amostra de treinamento consiste de uma grande variedad? do dígitos manuscritos que sao representativos de urna situado do mundo real. [Jado este conjunto de exem- ploSt o projcío de uma rede neural pode prosseguir como segué: • Primetro, uma arquitetura apropriada é selectonada para a rede neural, com uma camada do entrada con'isr ndo de nós de fonlc iguais cm número aos/?ürt.j/s de urna imagem de entrada, e urna carnada de saída consistindo de IQ neurónios (um para cada dígito). Um subconjunto de cxcmplos ccntáo ulilirado paratreinara rede pormcio de um algoritmoapropriado. Esta lase do projetu da rede c chamada de apiendizagem. • Segundo, o desempenho de reconhccimentó da rede [reinada é testado com dados nao apre- sentados anteriormente. Específicamente, unía imagem de entrada c apresentada para a rede, mas dista vez nao Ihc c fomccida a identidade do dígito que corresponde a esta imagem particular. O desempenho da rede é cntáo estimado comparando-sc o recunhcciirticnto do dígi- to fomecidopda retic com a real identidade do dígito em questáo. Esta segunda fue da opera- cáo da rede é chamada genertrtizueütK um termo emprestado da psicología. Aquí se en contra uma di lerenda fundamental entne o proj el o de uma rede ncural c o de sua contrapartida, o pnoccssamento de Informado classicn (classifica^ao de padrees). Ncstc último caso, normalmente procedemos primeiramente formulando um múdelo matemático das observa- res do ambiente, validando o modelo com dados reais. c cntáo cstruturando o projetu com base neste modelo, O prejeto dv uma rede neural, ao contrario, é bascado diretumente nos dados do mundo rcalt/>enM/|lóh/r>-.ve tpít' o ¿mnjmutf ¿le dttdosfale por si mesmo. Assirn, a rede neural nao somente fomcce o modelo implícita do ambiente no qual cía está inserida, como também realiza a fungáo de processamenfó de mferma^áo de interesse.
Intrcol^ao SI Qs exemplos utilizados para tresnar uma rede neural podrm consistir tanto de ejemplos posi- tivas CQOIO de exemplcs negativos. Em um problema de detecto passíva de sonar, por estemple, os cxcmplos positivos sfo relativos aos dados de ireinamenlo de entrada que contfim o alvo de ínteres se (ex.. um submarino). Agora, em um ambiente de sonar passivo. sabe-se que a presenta eventual de vida marinha nos dados de teste causa alarmes falsos ocasionáis. Para atenuar este problema, exemplos negativos (p.ex., ecos da vida marinha) sao incluidos nos dados de trelnamento para encinar a rede a nao confundir a vida marinha com o alvo. Em uma rede neural com uma arquiletura especifica, a representado do conhecimento do meio ambiente ¿definida pelos valores assumidos pelos paramemos livres (i.e., pesos sinópticos e bias) da rede. A forma dessa representaban de conhcrirncnto constituí □ verdadeíro projeto da rede neural, c portanto c a chave para o scu desempenho. Entretanto, o tema da representadlo do conhecimento no interior de uma rede artificial é mul- to complicado. Apesar disso, existem quatro legras para a representaban) do conhecimento que sao de seuso comum (Anderson, 1988), Regra 1. Entradas similares de classes similares normalmente devem produzir rcprcscntaQoes si- milares no interior da rede, e portante devem ser clasificadas como pertencentes á mesma catego- ría HA uma profusAo de medidas para determinar a ilsimi lat xtade" entre entradas. Urna medida de similaridade usada fraqüentemente é bascada no conccito de distancia euclidiana. Para sentios es- pecíficos, considere que x. represente um vetor m-por-1 cujos elementos s£o todos números reais; 0 índice superior T indica a transpaai^au mátircial. O vetor \ define um ponto em um espado de dimensao m chamado espado euciidiant) e representado por UíA distancia euclidiana entre um par de vetares m por I, x e x é definida por (1.23) onde XiJt e i', sBo os A-ésimos elementos dos veto res de entrada x, e i, respectivamente. Corrcspondcntemcnte, a similaridade entre as entradas representadas pelos vclores x o x é definida como o recíproco da distáncia euclidiana ¿(x,, x j. Quanto mais próximo entre si estiverem os ele- mentos individuáis dos vetores de entrada x, e x. menor sera a distancia euclidiana d(xr xy), e portanto mator sera a similaridade entre os vetares x c x . A regra 1 afirma que se os vetares x, e x sao similares, cíes devem ser atribuidos á mesma categoría (elasse). Unía nutra medida de similaridade é baseada na idéia de umprodnto escalaroupmduta inter- no que também c tomada emprestada da Algebra matricial. Dado um par de vetores xd e x. de mesma dimensao, o seu produto interno é x x . que na forma expandida é escrito como segue: (x,., xj = (124)
O produto interno (x, K} dividido por ||x | ||x é o coseno do ángulo subentendido entre os vetores ¥s/ As duas medidas de similaridadc definidas aquí esláo na verdad? intimamente relacionadas entre si. como ilustrado na Fig- 1.19. A distancia euclidiana ||x. — x || entre os vetares Xj e x está relacionada com a "proje^áo11 do vetar xf sobre o vetar x. A Figura 1-19 niostra claramente que, quantn menor a distancia euclidiana ||x. - x e portanto quantc mais si mi lares forem os vetares x^ e x , maiorserá o produto intemo x v , figura i .i$ ilustrado na relajo entre o pnodutu internó ü a distocia euclidifiriB cetro medidas da simllandadQ enlí« parta Para formal izarnos esta relajo, primeiro normalizamos os vetores x e x. para terem comple- mento unitario, ou seja. NI = M‘i Podemos entáo utilizar a Eq. (1.23) para cscrcvcr = 2 2x\ (1.25) A Equa^áo (1.25) mostra que a niirmniza^áo da distancia euclidiana J(xp xi corresponde á maximizaijáo do produto interno (x, x)e, portanto. da similaridadc éntreos vttOtes x e X- A dísl&ncia euclidiana e o produto interno descritos aquí sáo definidos em termos detcmni nisticos. O que acontece quando os vetares xc x sao retirados de duas populares (fontes) de dados diferentes? Para sexmos específicos, suponha que a d itérenla entre essM duas populaos esteja somonte nos seus vetares medios. Considere que |1 e g representem os valores medios dos vetores x e x, respectivamente. Istoé, H=£|>J 11.26} onde £é o operador estatístico esperado. O vetar medio g é definido de forma similar. Como uma medida de distancia entres essas duas populares, podemos utilizar a dfcAmcta de MahafanobiSt representada por d . O quadradü do valor dessa distancia de x para x c definido por (Duda e Hart-, 1973): (1-27} onde E‘1 é a inversa da matriz de eovariánc.a E. Assumc-sc que a matriz de covariancia é a mesma para ambas as popúlameos, como mostrado por
In-i^ul^áó 53 1 (1J8) = E[(x,.-p;)(i/- pJT] Para o caso especial quando x = iT J1 = g. |A e E = I, onde I é a matriz identidade, a distáncia de Mahalanobis se reduz A distancia euclidiana entre o vetor de amostra x. c o vetar de média p Regra 2. Devem ser atribuidas representares bem diferentes na rede a ifens que devem ser categorizados como classes separadas. A segunda regra é exatamente o oposto da Regra l. Regra 3, Se uma característica particular c importante, cntáo deve haver um grande número de neurónios envolvidos na representado daquele ítem na rede. Considere, por exemplo, uma aplicado de radar cnvolvendo a detecto de um alvo (p.ex., uma aeronave) na presenta de perturbadnos (Le,, reflcxoes de radar por alvos indesejáveis como edificios, árvores e formajes meteorológicas). O desempenho da dctcccáo dcstc sistema de radar é medido em termos de duas probabilidades: ♦ Probabilidad? de detectan, defi nida como a probabi Iidade de o sistema decidir que o alvo está presente, quando ele realmente está. * Probabilidad? de abarme /abo, definida como a probabtl idade de o sistema decidir que um alvo está presente, quando na realidade ele náo está. De acardo com o criterio de Neyman-Pearson, a probabil idade de delecto é max ¡raizada, sujeita á restripao de que a probabilidade de alarme falso nao exceda um determinado valor (Van Trees, 1968). Nesta aplicado, a presenta real de um alvo no sinal recebido representa uma característica importante da entrada. Na verdade, a Regra3 afirma quedeve haver um grande número de neurónios envolvidos na tomada de decisáo se um alvo está presente, quando ele realmente estiver. Pelo mes- mo motivo, deve haver um número muito grande de neurónios envolvidos na tomada de decisáo se a entrada consiste apenas de perturbares, quando realmente este foro caso. Em ambas as situapóes o grande número de neurónios assegura um elevado grau de precisáo na tomada de decisáo c tole ráncia em relaf<¡o a neurónios defeituosos. Regra 4. Informa^áo prévia c invariáncias devem ser incorporadas no projeto de uma rede neural, simplificando com isso o projeto da rede por náo ler que aprende-tas. A Regra 4 é particularmente importante porque a adcrcncia adequada a ela resulta em uma rede neural com urna esfratura especializada (tvstñta). Isto é altamente desejável por várias razóos (Russo, 1991): L Sabe-se que as redes biológicas visuais e auditivas sáa muito especializadas. 2. Uma rede neural com estrutura especializada normalmente Lcm um número menor de parámetros I ivres dispon [veis para ajuste do que uma rede totalmente conectada. Conseqüent emente, a rede especializada requer um menor conjunto de dados para treinamento, aprende mais rápido e frcqücntcmcntc generaliza methor.
3. A taxa de transmi ss^o de informaí^a através de uma rede especializada (J.e., a pradutividade da rede) é acelerada. 4. O custo de constniQao de uma rede especializada é reduzidu por causa do sen (amantio menor» quande comparada com a rede totalmente conectada equivalente. Como Incorporar IntonHafSo Prévia no Projeto de uma Rede Neural Uma questan importante a ser tratada, evidentemente» é como desenvolver uma cstruiura espe- C ¡al izada incorporando inferma^áo previa no sen projeto. Infelizmente, nao há alúa] mente negras bem-detinidas para fazer isio; cm vez dissü, temes alguns procedí men tos ad-iiac que sabemos que produzem resultados útets. Panicularmente, podemos utilizar uma combinado de duas técnicas (LeCunetal., 1990a}i l Restringir a a^uiletura du rede pe lo usa de con ex eres locsi i s conhec idas como crnnp os recepti- vas^ 2. Restringir a escoiha de pesos sinópticos através do uso de cctmparrdhwnento de pesos," Estas duas técnicas, particularmente a última, tcm um beneficia marginal vantajoso: o número de parámetros liivres da rede é reduzido significativamente. Para sennos mais específicos, considere a rede alimentada adíame parcialmente conectada da Fig. 1.20. Esta rede tem uma arquitetuna restriia por construyo. Os seis prime Iros nós de fonte constiiucm o campo receptivo para o neurónio oculto I c assiin per diantc para os cutios neurónios Cuihujifl. Jt t,Ti1rad¡i di1 nde-tk ront^ Camada de CMMdl de nmitoin nuúriMS OCUllM de saída FIGURA 1.20 llusEra^áo do U9O oorntoiriado de um campo nnptfvD e de comparblharTfcertta d? pasos. Todw » qualrc neur&ídos ocultos com- partilham o masiro conjunta de pesos pon Buu conextes sinópticas ocultos da rede. Pana satisfacer a restií^in- de comp^rLilhamento de pcsosH apenas devenios utilizar o inestmc conjunta de pesos sinápticos para cada um dos neurónios da camada oculta da rede. Entáo. para o cxcmplo mostrada na Fig, 1.20 com seis conexocs locáis por neurónio oculto c um erial de quatro neurónios; ocultos, podemos expressare campo local inducido do neurónio oculta / como segué = J= 1.23,4 {] 29) l-l
iNTftOMKAv 55 onde MttStituí o mesma conjunta de pesos compartí hado por todos os quatro neurónios ocultos, e Jt.éo simal captado do nó de fonte k = i + j - I. A Equa^áo (1.29) está na forma de uma soma convoiuliva. É por este motivo que urna rede alimentada adi ante utilizando concedes locáis c pesos compartíIhados da forma aquí descrita c conhccida como rede eanvíilutiva. A questao de incorporar informaqáo prévia no projeto de uma rede neural é urna parle da Regra 4; a parte restante da regra eovolve a questao das ÍDVBríáncias, Como Incorporar Invariáncias no Projeto de uma Rede hlsural Considere os seguintes fenómenos lisíeos; * Quando um objeto de intcrcsse sofre rotaban, o modo como a imagem do objeto c percebida por um observador normalmente muda de forma correspondente. • Em um radar coerente que femece informaban tanto de amplitude como de fase sobre o seu meto ambiente, o eco vindo de um alvo móvel é deslocado cm freqüencia pelo efeito Doppler que surge dei ido ao moví mentó radial do alvo cm relapso ao radar. • A tocu^áo de uma pessoa pode ser feita em uma voz alta ou baixa, e de inane ira lenta ou rápida. Para construir um sistema de reconhecimento de objetos, um sistema de reconhecimerttc de alvos de radar e um sistema do reconhecimentn de voz que possa IIdar com estes fenómenos» respectiva- mente, o sistema deve ser capaz de lidar com urna serie de do sinal observado (Bamard eCasasent, 1991). Conseqüentemcnte, um requisito fundamental pana o reconhcci monto de padrees é prejetar um da&siíicador que seja invariante a tais transformables. Em cutres pala- vras, uma csiimai va de dasse representada por uma saída do dnssiíicador nao deve ser afetada pelas transformables do sinal observado aplicado A entrada do classilicudur. Lxistem pelo menos tres técnicas para implenicntar urna rede neural do tipo clarificador invariante a transformabocs (Bamard e CasascnL 1991i: 1. Ittvsriánciu por Exlntrum. A invariáncia pode ser imposta á rede neura] cstrutuiando apro- piadamente o scu projclo. Mais específicamente, as concedes sinópticas entre os neurónios da rede sao criadas de forma que versees transformadas da mesma entrada sejam forjadas a produzir a mesma saída. CwMÜdere, por cxcmplo, a classifiea?áü de uma imagem por uma rede neural com a exigencia de ela ser independente a rotares no plano da imagem. em torno do seu centro. Podemos impar uivariáncia rotacional na cstrutura da rede da seguinlc forma. Scja i¿ o peso sinóptico do neurónio./ conectado ao pixel j da imagem de entrada. Se ÉbriQarmos a condlitio ipj, para todos os pi'íds i c k que se encontrcm a distancias iguais do centro da imagem, cntao a redo neural scrá invariante a rolaqócs no plano. Entretanto, para que scja mantida a invanáncia rotacional, o peso Bhnáplico u) de ve ser duplicado para todo pixcl da imagem de entrada á mesma distancia radial da oí igem. Isto causa uma dcsvantagcjn da invariáncia por cstrutura: o número de conexdes sinópticas da rede nvural se loma preiMivamente grande mesmo para iinagcns de tamanho moderado. 2. fnvanánciíi por Tridnamento. Uma rede neural tem uma habí lidade natural para cl&ssificar padróes. Esta hábil idade pode ser ex plorada di recamen Le para obter invariáncia a transformacóes da forma descrita a seguir. A rede é tremada apresentundo-sc um número de ejemplos diferentes do mesmo objeto, sendo os exempios cscolhidos para corresponder a diferentes transformares (i.e., vistas do aspectos diferentes) do objeto. Desde que o mimere de ejemplos scja suficientemente
56 Rfdfk N>~l rach grande e que a rede wja (reinada para aprender a discriminar as v astas de aspectos diferentes do objeto, podemos cntáo esperar que a rede general! ze coirctamente para outras transformaedes que nao as apresentadas durante o tremamento. Entretanto, por uma perspectiva de engentaría, a invariáncia por treinamento tem duas desvanfagens. Primciro, quando a rede neural foi (reinada para rtconhecer um objeto de manelra invariante em rela^áo a transformares conhccidas, nao é obvio que este trcinamcnlo tambán capacitará a rede a rccunhecer uniros objetos de classes difo rentes» de maneira igualmente invariante. Segundo, o estorbo camputacional imposto á rede pode ser demasiadamente severo para se licLar, especialmente se a dimensional-dade do espado de carac- terísticas for elevada. 3- Espado de Características invariantes. A terceira técnica de criar uma rede neural invariante do tipo clarificador está ilustrada na Fig. 1.21. FIGURA 1,21 Diagrama em bíneos de um sistema do tipo espado da características invariantes Rnlnida Fs-li nativa de cImm Ela se base i a na prcmissa de que pude ser possívcl se extra ir características que caractcrizcm o conteúdo essencial da informado de um conjunto de dados de entrada e que sejam invariantes a transformapocs das entradas. Se tais características forcm utilizadas, cntáo a rede como um classi* ficador é aliviada do fardo de ter que delinear o intervalo de transformares dr um objeto com fronte! ras de deci&to complicadas. Na verdade, as únicas diferenpisque podem aparecer entre ejem- plos diferentes do mesmo objeto dcvcm-sc a falores i nevi lavéis como mido c oclusáo. A utilizarán de um espato de características invádanles oferecetrés vaniagens distintas. Primeiro» o número de características api «cadas á rede pode wt reduzidoa ni veis realisiss. Segundo, a* exigencias impos- tas ao projeto da rede sao relaxadas. Tereeiro, é ¿¡¡segurada a invarianCtá para todos os objetos cm relajo a transformacóes conbccidas (Bamard c Casasen I» 1991). Entretanto» para que cía funcio- ne. esta abordagem requer cotillee 11 nenio previo do problema. Concluíndu. o uso de um espado de características invariantes, como aquí descrito, pode pro- porcionar uma técnica multo adequada para clasificadores ociirais» Para ilustrar a ideia de um espado de características invariantes, considere o exemplo de um sistema de radar cocTcntc utilizado para vigilanciaaerea, onde os alvos de interesse incluem aerona- ves, sistemas meieonológicos. bandos de pássaros migratorios e objetos terrestres. Os ecos de radar dcslcs alvos possuem dilcrentes características espcclni.s. Alcm disso» escudos experimentáis mos- traram que estes sinais de radar podem scr modelados bastante fielmente como um auta- /tgflLh.Mím(AR) de ordem moderada (Haykm e Deng, 1991). Um modelo AR é uma forma especial de modelo regresivo definido para dados de valores complexos como *(*)= -O + íOO (1*30) onde as sao os alicientes AR, M é a tmlent Jo madéla, Ai'nJ c a entrada c efn) é o erm descrito como ruido branco. Básicamente, o modelo AR da Eq. (1.30) ó representado por um/rfrro de finha de atrasa com deriva^da como ilustrado na Fig. L22a para M= 2< De forma equivalente, ele pode ser representado por umJHin de grade (iatticefdter}, como mostrado na Fig. 1.22b, cujcs coeficientes $3o chamados de coeficientes de reflcxao. Existe uma correspondencia de um para um entre os codicíenles AR do modelo da Fig. I 22a e os coeficientes de rellcxao do modelo da Fig. 1.22b. Os deis modelos representados assumem que a entrada jc(n) lem um valor complexo, como
Ih’IHJÍ Jl JLJfÁK 1 57 ihi FIGURA 1.22 Múdalo auto- ragrasswo da orttem 2: (a) modelo da linha de atraso com derivafáo; Ib} modelo de filtro de pfflde (ítUirce ffilefy. {Q asteri$oa representa ccnjug&^aa complexa.1 no caso tic um radar eoerente, no qual os coeficientes AR e os coeficientes de reflexáo sao iodos valores complexos. O asterisco na Fq, (130) c na Fig. 1.22 significa a con} ligandoamplia. Por enguanto, c suficiente se dizer que os dados do radar eoerente podan ser descritos por uní conjunto de coeficientes aiifo-regrewtvos* ou por um conjunto correspondente de aiejicú ules de iv/lexao. Este último conjunto de coeficientes lera uma vantEi^em computar;ional, pois existem algoritmos eficientes para o seu cálculo dn etamente a partir dos dados de entrada. Entretanto. o problema da extrajo de características é complicado pelo falo de que objetos em moví monto produjcin. frcqücncias Doppler Yarióvcis que dependem dir su as velocidades radia i s^ medidas em relajo ao radar, e que tendeen a obscurecer o contcudo espectral dos coeficientes de rcficsao, nfiados como disen minadores de características. Para superar esta dificuIdade, devemos incluir a invariüntki Dtrppto" no cálculo dos coeficientes de refiexáo. O ángulo de fase do prime i ro coeficiente de rcfJc- xSo vem a ser igual á freqüéncm. Doppler do sinal de radar. Conscqücntcmcntc^ aplica-so a nnruiü- da fregancia Dnppler a todos os coeficientes de modo a remover o deslocamento Doppler medio. lato é frito dcfiníndc~se um novo conjunto de coeficientes de refiexáo 1k',J relacionados com o conjunto de coeficientes de rcflcxao ordinarios {calculados a partir dos dados de entrada como mostrado a seguir: Krp(= para m - 1,2,.,., Af (1.31) onde 6 é o ángulo de fase do prime i ro coeficiente de refiexáo. A operado descrita pela Eq. (1.31) é chamada de hetefódina Um conjunto de características de radar invariantes a Dappler c cntáo
representado pelos coeficientes de reflexao normalizados K'p KfJh com K' sendo o único coeficiente do con junto com valor real. Como mencionado anteriormente, as principáis categorías de alvos de radar de inicrcssc para vigilancia aérea sáo íorma^óes meteorológicas, pássaros, aero- naves e o solo. Os tres prícneiros alvos sao movéis sendo que o último nao o é. Os parámetros espectrals heteródinos dos ecos de radar correspondentes ao solo tóm ecos similares em termos de características, aqueles de uma aeronave. Um eco do solo pode ser discriminado de um eco de aeronave devido ao seu pequeño destacamento Doppler. Conseqüentemcnte, o clarificador por radar incluí um pós-processador como mostrado na Fig. 1.23, que opera sobre os resultados ctsuí- fieados (rótulos codificados) para identificar a classe do solo (Haykin e Deng, 1991). Assim, opré- proeesMtdor da Fig- 11+23 se ocupa da extra^ao de características invariantes a Dopplcr, cnquanlo que o pós-processador utiliza a assinatura Doppler armazenada para distinguir entre retornos de aeronave e de sota- F1GURA1J3 Classi I cador de sirváis de radar invariante a destacamento Etappler Um excmplo muito mais fascinante de representado de conhecimentó em uma rede neural é encontrado no sistema de sonar biológico du morcegos para ecotacaliza^áo. A mu ¡¡cría dos morec- gos utiliza sinais modulados cmfrcqfiéncia (FM ou “chilro") para ti ns de rastre amento acústico; em um sinal FM a freqúéncia instantánea do sinal varia com o tempo. Específicamente, o morcego utiliza a sua boca para transmitir sinais FM de sonar de curta durarán e utiliza o seu sistema auditivo como um receptor de sonar Os ecos de alvos de -nieresse sáo representados no sistema auditivo pela atividade de neurónios que sao scíctivos a diferentes combinaqoes de parámetros acústicos. Existan tres dimensóes neurais principáis da representado auditiva do morcego (Simnnons, 199]; Simmons c Sai lian t, 1992); » A. freqiicncia da eco, que é codificada por "posi^o" originada no mapa de freqiiéncia da cóclea; ela é preservada por lodo o caminho auditivo como um arranjo ordenado através de cotos neurónios sintonizados on diferentes freqüóncias. A amplitud^ do eco, que ó codificada por cutres neurónios com intervalos dinámicos diferen- tes; ela se man tiesta tanto como uma sintonía de ampl ilude como no número de descargas por esl Emulo. • O aira.'io do eco, que é codificado através de computadles neurais (bascadas em corrclscác cruzada) que prvduzrm resposlas setal ivas ao atraso; ele se maní fasta como uma sintonía por distancia (alcance) do alvo. As duas pr ¡ncip.i is. características do eco de um alvo para o propósito de formafáo de imagem sáo o cs/wc/ro para a forma do alvo c o atraso para o alcance do alvo. G tnorcege percebe a "forma" era termos do lempo de chegada dos ecos de diferentes superficies reílctoras (brilhos) do alvo. Para ísso ocorrer, ¡i inforrnacáü dt freqÑénc¡a no espectro do oco c convertida em estimativas da estretura lempímd do alvo. Experimentos conduzidos por ftimmons e co-aufares sobre o grande mereege marrom, Epfc.itctixftaeus, identificara™ crificamenleesleprocessc de convcrsáo como consistíndo
de transformadas paralelas no dominio tempo e no dominio freqücncia pelo tempo cujas suidas convergentes criam o atraso comum do cixo do alcance de uma imagem percebida do alvo. Aparen- temente, a un i dade da percep^ao do morcega é devida a certas propriedades das próprias transí or- maífies, apísar dos modos distintos como sao intcialmcnte realizadas a representado temporal do atraso do eco do sistema auditivo e a representado em frecuencia do espectro do eco. Além disso, as invariáncias das características sao incorporadas no processo de formacáo da imagem de sonar para fazé-lo essenci almenie independente do moví mentó do alvo c do própric movimeoto do mor- cego. Retomando ao tema principal desta septo, que é a representado do conhecimento cm uma rede neural, esta questao está dirctamente relacionada com a da arquitetura da rede descrita na Se$to 1.6. Lamentavelmente, RÍO há uma teoría bem desenvolvida para olímizar a arquitetura de uma rede neural que deve interagir com um ambiente de interesse, ou para avahar o modo como modif]ca^5es na aiquüctura da rede afetam a rcprcscntacáo do conhecimento no interior da rede. Na verdade, respostas satisfatórias para estas queslóes sito normalmente encontradas através de um estudo experimental exaustivo, com o projet i sta da rede neural sendo uma parte essencial do ciclo de aprend í zagem cstrutural. Independentemente do modo como o projeto é realizado, o conhecimento sobre o dominio do problema de interesse c adquirido pela rede de uma forma relativamente simples e di reta através de treinamento. O conhecimento aspira adquirido ó representado cm uma forma compacta c distribuida como pesos através de coñetes '¡mápticas da rede, bnquanto esta forma de represenia?üo de cu- nhcci mentó permite que a rcdc neural se adapte c generaliza, infelizmente a rede neural sufre da incapacldade inerente para explican de uma forma abrangente, o processo ccmputacional através do qual a rede torna uma decisto ou apresenta suas saldas. Isto pode ser uma limttafto séria, parti- cularmente naquelas ap!¡capóes onde a seguranza é a preocupado principal, como no controle de tráfego aéreo ou no diagnóstico médico, por cxcmplo. Em aplicaron desta natureza, nao c somonte desejável, mas também absolutamente essencial foniecer alguma fonna de capacidu^e explanallva. Uma forma pela qual esta capacidad^ pode scr incorporada c atraves da integrado de uma rede neural e de inteligencia artifidal em um sistema híbrido, como discutido na próxima se^ito. 1.8 INTELIGÉNCIA ARTIFICIAL E REDES NEURAIS O objetivo da inteligencia artificial (1 A) é o desenvofvimento de paradigmas ou algoritmos que requeiram máquinas para realizar tare fas cognilivas, para as quais os humanos sáo atualmcnlc mc- Ihores. Esta afirmacao sobre IA c tomada emprestada de Sage, 199C. Note que esta nao é a única definido aceita para J A. Um iiítema de ÍA deve ser capaz de Inzer Inés cljíühs; (I ) armazenar COrthecimentOt (2) aplicar o conhecimento aimazcnado para resolver problemas c (3) adquirir novo conhccimentó atravei da experiencia. Um sistema de IA tem tres componentes fundamentáis: representado, raciocinio e aprendizagem (Sagc, 1990), como representado na Fig. L24. 1. Representadlo. Provavelmente, a característica mais distintiva da IA seja o uso difundido de uma linguagem de escrutaras ¡imbófwüs para representar tanto o conhecimento genérico sobre um dominio do problema de interesse como o conhecimento específico sobre a soluto do problema. Os símbolos sito normalmente formulados em termos familiares, o que toma as roprescntaqóes simbólicas da JA relativamente facéis de serem entendidas por um usuárto humano. De fato, a clareza da IA simbólica a toma bastante adequada para a comunicado homem-máquina.
FIGURA 1,24 Ilustra?!» dos irés componantes principáis de um sistema do IA "Conhecimento11, como c utilizado pelos pesquisadores de IA, é apenas mais um termo para dados, lile pode Mf do tipo declarativo ou procedí mental. Em uma rcprcscntaQao dectareitiva, o conhecimento é representado como uma colero estática de fotos, com um pequeño conjunto de procedí montos gerais utilizados para manipular os tatos. Uma característica particular das repre- sentadles declarativas é que cías pareccm possmr um si^nilícado próprio, do ponto de vista do usuario humano, independen le do sen uso dentro do sistema de IA. Em uma representarán pmeedimentat, por outro lado, o conhecimento está incorporado em um código executável que representa o significado do conhecimento. Ambas as formas de conhecimento, declarativo e procedí mental, sao ncccssárias na maioria dos dominios de problemas de interesse. 2. Xactocínto. Na sus forma mais básica, racfocfaj/j é a habilidadede resolver problemas. Pan um sistema ser qualificado como um sistema de raciocinio, ele deve satis fazer certas condiQocs (Fischlcr e Firachein. 1987): • O sistema de ve ser capaz de expressar e resolver uma vasta gama de problemas e tipos de problemas. • (.) sistema deve ser capaz de tomar conhccidas para ele tanto a inforroaQáo explícita como a i idbrmagiki implícita. • O sistema deve ter um mecanismo de cfmtrvte que determine quats operaedes devem ser apli- cadas para um problema particular, quando uma soluto para este problema foi cbtida, ou quando deve ser encerrado o iratamentn deste problema. A resoluqao de problemas pode scr vista como um problema de busca. Uma maneira comum de lidar coma “busca" é utilizar negras^ tiatiaa e CQtiiinle (Ní Jsson, I9R0). As regías operam sobre Os dadas,, e o controle opera sobre as regias. Considere; por exemplo, o “problema do caixeiro viajan- te’1, no qual o objetivo é encontrar o roteiro mais curto que vá de uma cidade para outra, com todas lis cidadcs no roteiro sendo visitadas somente uma vez. Ncste problema, os dados silo constituidos pelo conjunto dos roteiros possívcis c pelos seus custos em um grato ponderado, as regras dclincm as maneiras de pro&seguir de uma cidade para outra, e o controle decide quais regras devem ser aplicadas c quando apkcá-las. Em multas ^tuafóes encontradas na prálica (p. at., no diagnóstico medico), o conhecimen- tó disponível é incompleto ou jnexalo. Em tais situares, sáo utilizados procedí mentes de raciocí- nfopermitindn des|e modo que sistemas de IA lidem com incertezas (Russell e Norvig, ] 995; P«r1,19KS). 5. Aptvfíiiiza^em. No modelo pimples de aprendizagem de máquina representado na Fig. 1.25, o ambiente fomecc alguna infürma?áo para um el^mefítü de aprendiingetn.
Inthodu^Aci 61 FIGURA 1.25 Modala simples de aprendizagem máquina O elemento de aprendizagem utilizo, etnáo, esta infarmaeáo para aperfei^oar a bti$e de cnrjljeci- ni&tlo, e final mente o ¿tememo de dexempenlrtt utiliza a base de conheci mente para cxcciitar a su a tarefa. Normal mente, a inte miarán que o ambiente fomece para a máquina é imperfeita, resultando que o elemento de desempenho náo sabe previamente como preencher os detalhes ausentes ou ignoraros dctalbcs que nao sao importantes. Portanto, a máquina opera iniciaImcntc por suposiqáo e depois recebe rvatimenití^ü^ dci elemento de desempenhe. O mecanismo de real i mentado permi- te que a máquina avahe suas hipóteses o as revise, se nccessário. A aprendizagem de máquina envolví dois t i pos bastante diferentes de processamento de inícr- mnffo: o indunvoeo dedutivo. No processamento de informado indmivo, padróes genis e negras sao determinados a partir dos dados brutos c da experiencia. Poroutro lado, no processamento de informando deditfivü sáo utilizadas negras gerais para determinar latos especificas. A aprendizagem bascada cm similaridadc utiliza indu^áo, cnquanlo que a pro va de um teorema c uma deducáo breada em axiomas conhecidos e cm nutras teoremas existentes. A aprendizagem baseada em explanado utiliza tanto indu^&ü como deducáo. A importancia das bases de conhceimcnto e as di (lenidades experimentadas com a aprendiza- gem levaram ao desenvnlv tinento de vanos métodos para apedciQOor as bases de ccmheeimetilo. Específicamente, se existirem especialistas em uma dada área, c normalmente mais fácil obter a experiencia compilada dos especial ¡sí» do que tentar duplicaros experimentos que os levaram a adquirir esta experiencia. Esta c a ideia por tras dos sistemas especialistas > Agora que nos familiarizamos com as máquinas da IA simbólica, como nós as compararíamos eflm as redes neurais como modelen cognitivos? Para esta comparado, seguimos tres stibdivisocs: o nivel de explanado, o estilo de processamenioea cstrutura representativa (Meinmi, 1989K 1. Nivel de Expianafíto. Na IA clássica, e dada enrase á conslrucáo de representares simbóli- cas, que sáo presumívelmente assim chamadas porque representan! algo. Do ponto de vista da cognicáo, a IA assumc a existencia de representadles mentáis e cía modela a cogni^áo como o pnocessameniítxL'qüeneialde rcpresenia^ñes simbólicas (Newell e Simón. 1972). Porouiro lado, redes neurais a ¿n lase está nodesenvoh 1 mentó de modelos deprocestamefiifi pai^uleiamefílc titslrihuída (PDF, Partdlcl DistribufedPmcesxing). Estes modelos assuinein que n processamento de inferma^áo acontece atraves da interacaa de um grande número de netirflnics, onde cada neurónio envía sinais excitadores e inibitóríns para outros neurónios da rede (Rumclhan e McClelland, 1986). Alérn disso, as redes neurais dao grande énláse á cxplana^áo biológica dos fenómenos cognitivos. 2. Estila de Pmeessuffíefítn. Na IA clássica, o processaiTicnto é .teqiieni.icsL coma lia progrílma- fio de computadores típica. Mesmo quando náo há urna ordenado predeterminada (listando'se os Tatos c as regras de um sistema especialista, por cxemplaX as operaeñes sáo executadas pas.su a passo. O mais provávd é que a inspiracáo para o processamento sequen-íal lenha viudo da natureza seqñencial da linguagem natural e da inferencia lógica, bem como da csirutura da máquina de von
Neumann. Nao devenios csqucccrquea IA clástica sutgiu pouco depois da máquina de von Neumann, durante a mesma era intelectual. O paralelismo, ao contrario, nao é somente um conceito esencial ao processamento de infor- madlo cm redes asumís, mas é também a fente de sua ílexibiLdade. Alera dtsso, o paralelismo pode ser macizo (centenas de milhares de neurónios}, o que da as redes neurais uma forma notável de robustez Como a computadlo está distribuida sobre muitos neurónios^ normalmente nao importa multo se os estados de alguna neurónios da rede se desviarem de seus valores esperados. Entradas ruidosas OU incompletas podem aínda ser rcccnhccidas, uma rede danificada pode aínda ser capaz de funcionar satisfatoriamente, e a aprendizagem nlo precisa ser perfeita O desempenho da rede se degrada suavemente dentro de um corto limite, A rede pode se lomar aínda mais robusta atreves da “codificado grosseirah (Hinton, 1981), pela qual cada característica é espalhada sobre varios neurónios. 3. Eslnríurfí Representativa- Consiiderandn que perseguimos uma linguagem do pensamentocomo um modelo para a IA classica, constatamos que as representaqües simbólicas possucm uma esf/-«íw- m quase lingüistica. As expressites da IA clássica, assim como as expressóes da linguagem natural, sao feralmente complexas, construidas de uma forma sistemática a panir de símbolos simples. Dado um repertorio limitado de símbolos, novas expressócs significativas podem ser compostas cm virtude da MpocídWt* de ctímpnsicáo das expreses simbólicas e da analogía entre a estrulura sinlática c a semántica. A natureza e estrutura das reprcscntacocs c, contudo, um problema crucial para as redes neurais. Na edi^ao especial de mar^o de 1988 datcv ista Cagnificnt, Fodor c Pylyshyn fazcm criticas vigoro- sas sobre a adequa^o das redes neurais em lidarcom cognifloe lingüistica. El es argumentara que as redes ncurais cstáo do lado errado em duas qucstocs básicas da cognipao: a natureza das tvpra- xEnia^-vrx mentáis e a natureza des pmces.w* mentáis. De acorde com Fndor c Pylyshyn, podc-sc afirmar para as teorías da IA clássica, mas nao para, as redes neurais, que: • As representares mentáis ex i bem de forma característica uma estrutura con si i tu inte combinatoria e semániiea combínatária. * Os procesaos mentáis sao caractcristi camcntc sensíveis á cstrutura combinatoria das represen- tantea sobre as quais eperam. En) resumo, podemos dcscrcvcra IA simbólica como a manipulaqáo formal de urna línguagetn de algoritmos e representacóes de dados em uma forma de cima para baixo Por culto lado, podemos dcscrcvcr as redes ncurais como proccssadones distribuidos paralelamente com uma habl- Iidade natural para aprender e que normalmente operara de uma forma de baixo para cima {baiiom- tep). Portanto, tomarse evidente que, para a implementa^áo de tare fas cognilivas, melhor que procu- rar solufSes bascadas cm IA simbólica ou cm redes neurais isoíadamente, uma abordagcin potenci- alrncnic mais vantajosa seria construir modelas canezinnistas estnttnrüdos ou ylsfeniux h¡bridan que integrem ambas as abordagens. Fazendo isso, somos capazes de combinar as características desejáveis de adaptabil idade, robustez e uní lórni idade oferecidas pelas redes neurais com a repre- sentadlo, inferencia e universalidad?, que ,sáo características in¿rentes da IA simbólica (Feldmam 19921 Wallz. 1997). De falo, Ibi com este objetivo cm mente, que fnram desenvolvidos varios méto- dos para extrajo de negras a partir de redes neurais tremadas. Alcm do entendí mentó de como as abondagens si mbólica e conexión¡s(a podem ser integradas para construir máquinas inteligentes, há varias outras razóes para a cxtratfo de negras de redes neurais (Andrews c Dicdcrich, 1996):
[ \TIÍC?L-,Á( 63 * Validar componentes de redes neura is em sistemas programados, tomando os estados i otemos da rede neural acessíveis e compreensiveis ao usuario. • MdhorarO dcücmpcnhu de generalizado das redes neurais, (1} identificandú rcgiñeS do espa- do de entrada onde os dados de treiiiamcnto nao eslao adequadamente representados, ou (2) indicando as circunstancias onde a rede neural pode falhar na generalizado. * Descubrir características mareantes dos dados de entrada para explorado de dados (minera- íáo de dados, data mining), • Fornecer nietos de atravessar a fronteira entre as abordagens conexionista e simbólica para o desenvolví mentó de máquinas inteligentes. * Satisfazer a critica necessidade de seguranza cm uma elasse especial de sistemas na quai seguranza é uma condiffto obligatoria. 1.9 NOTAS HISTÓRICAS Concluimos este capítulo introdutórío sobre redes neurais com algumas notas históricas? A era moderna das redes neurais come^ou com o trabaLho pioneiro de McCulloch e Pitts (1943). McCulloch foi um psiquiatra eneuroanalomisla por treinamento; passou cenca de 20 anos refletindo sobre a reprcscnta^áo de um evento no sistema nervoso. Pitts foi um prodigio matemático que se assocíou a McCulloch em 1942. De acorde com Rail (1990), o artigo de 1943 de McCulloch e Pitts surgí u dentro de uma comunidade de modclagcm neural que tinha. estado em atividade na University of Chicago por pelo menos cinco anos antes de 1943, sob a lideran^a de Rashcvsky. No seu clássico artigo, McCulloch e Pitts descrevem um cálculo Lógico das redes neurais que unificara os estudos de neurofisiologia e da Lógica matemática. Eles assumiam. que o seu modelo formal de um neurónio seguía uma leí “ludo ou nada11. Com um número suficiente dessas unidades simples e oom conexóes sinápticas ajustadas apropiadamente e operando de forma síncrona, McCulloch e Pitia mostraram que uma rede assim constituida realizaría, a principio, a computado de qualquer fim^ao computávcl. Este era um resultado muito significativo c com ele c gcralmcnte aceito o nascimento das disciplinas de redes neurais e inteligencia artificial. O artigo de 1943 de McCulloch e Pitts foi amplamente lido naque le tempo e aínda o é. Ele influencien von Neumann a usar chaves de atraso idealizadas, derivadas do neurónio de McCulloch- Fiits na construyo do EDVAC (Electronic Dücrete Variable Automatic Computer) que foi desen' volvido a partir do ENIAC {Electronic Numericai Integraran and Computen) (Aspray e Burks, 19S6). O ENIAC foi o primeiro computador eletrónico de propósito geral, que foi construido na Escola de Engcnharia Elclrica Maorc da Univcraity of Pcnnsylvaniadc 1943 a 1946. A teoría de McCulloch- Pitts sobre redes neurais formáis se destacou de forma preeminente na segunda das quatro palestras proferidas por v&n Neumann na University of Illinois cm 1949. Em 1948, foi publicado O famoso livro Cyberneiics de Wiener, dcscrcvendc alguna conccitos importantes sobre controle, común icafáo c proccssamcnto estalistico de sinais. A segunda cdiqáo do livro foi publicada em 1961, adicionando material novo sobre aprendizagem e aulCHorganiza^ao. No Capítulo 2 de ambas as ediles desse Il^to, Wicncr parece compreender o siguí ficado físico da mecánica estatístiea no contexto desse assunto, mas foi com Hopfield {mais de 30 anos depois) que se oonscguiu consumar a liga^áo entre a mecánica estatística e os sistemas de aprendizagem. O próximo desenvoK¡mentó sigrJficativo das redes neurais vcio cm 1949, com a publicado do li'To de Hcbb The Onganization af Behavitir^ no qual foi apresenlada pela pri metra vez urna
64 Rh>I:5N|-LRAI'í formulado explicita de unía regra de aprendixagem fisiológica para a modificandosinóptica. Espe- cíficamente, llebb propos que a coneciiv idade do cerebro c continuamente modilicada conforme um organismo va i aprendendo larefai funcionáis diferentes e que írgrrfpumeBíGff nearals sfo cria- dos poníais modificavoes. Hcbb deu seguí mentó a urna sugestáo anterior de Ramón y Cajúl c apre- senlou 0 seu ngora famoso postulada de aprendizagem, que afirma que a eficiencia de uma sinapse \ a: lável cnirc deis neurónios c aumentada pela atíva^áo repelida de um neurómo causada pela outra neurónio. através daquela sinapse. O livro de Hehb foi tmensámente influenic entre os psicólogos, mas Lamentavclmcnic ele leve punco ou nenhum impacto sobre a comunidad? de engentaría. O livro- de Tiebh tem sido uma fonle de inspirarán para o desenvolví mentó de modelos computad onais de .sf.tfemas' adaplaíivas e de aprenditagem. O artigo de Rocbcster, Holland, Haibt e Poda (1956) Calve? soja a pr.mcira tentativa de usar simulaban computacional para testar uma teoría neural bem-formulada com base no postulado de aprendí zagem de Hebb; 09 resultados de simulado relatados naquele artigo mostram claramente que se deve adicionar inibiijáo para que a teoría realmente funcione. iNaquelc mesmo ano. Utlley (1956) demonstrou que uma rede ncurai com sínapses modifícáveis pode aprender a classificar conjuntos simples de padroes binarios em classes corrcspondcnies. Uttlcy introduziu o assim chamado neurónio integra e dispara emnfitga, o qual fui mais tarde analisado formalmente por Caí amello (1961). Um um traba Ihu posterior, UtUcy (1979) formolou a liipótese de que a eficiencia de uma sinapse variável do sistema nervoso depende da rclacao cstalistica entre os estados 11uluantes cm ambos os lados daqucla sinapse, fazendo assim uríici assuciüQáo confia teoría da informado de Shnnnon. Em 1952, foi publicado o livro de Ashby, Designfiirü Brain: The Origin ofAdoptivoBehuviWt que é tüo fascinante de ser lido hoje em di;i como deve té-lo sido naquela época. O livro trata da noqáo básica de que o comportamcnlo adaplativo nao é inato mas sim c aprendido, c que alravés da aprrndizagem o ccmportamentii de um animal (sistema) normalmente muda para melhor. O livro en (atiza va os aspectos di mímicos do organismo vivo como uma máquina e o cunee ico eorrolaciunadu de estábil idade. Em 1954. Minsky escreveu urna tese de doutorameolo em “redes neurais" na Univcrsity oí Príncelon. intitulada “Thcary of ^eurai-Analag Reinfarcement Sysfems and lis AppUcntian lo tke Brain-Madel Ptxrbiem". Em 1961, foi publicado um artigo excelente de Minsky sobre IA intitulado "ó’ltp.s Timan/ Arfificial IiUe/ligenee"[ este artiga cantém urna grande seijao sobro o que agora é denominado redes neurais, Em 1967. foi publicado o livro de Minsky, Cüfítpttfat¿<>n: Flttlte and fnfitúfeMachines. Este livro. escrito de forma clara, estendeu os resuliados de 1943 de McCulloch c Pitts e os cnlncou no contexto da teoría dos auto matos e da teoría da computado. Também em 1954, a idéia de im./j/íai adapluítia nao-linear íoi propostd porGabor, um dos pierna i ros. da teoría da comunicando e o inventor da bo logra ti a. Ele construí u essa máquina com a anida de colaboradores, e os dcialhos estilo descritos em Gaborct al. (1960). A aprendízagem era realizada al i mentando-so a máquina com amostras de mn prccesso estocásl ico, juntamente cum a l’.ir^dn-ahi' que ü máquina deveria produzir. Nos anos 50, .nicióu-w o trabaIho sobro a .menifiria assf>cífítiv¡¡ por Tjylcr (1956). Ele foi seguido por Sleínbruch (1961) que introduziu a mitriz de aprendizagem; esta matriz consiste de uma rede planar de chaves interpostas entre arranjos de receptores “sensoriais" c ¡Hiladores “moto- res". Em 1969» foi publicado por Willshaw., Uuneman c Longucl-Higgins um elegante artigo sobre a meniój:.i asociativa nác-hülograñca. Este artigo aprevenía deis modelos engcnhasos de rede; um sistema ótico simples real izando urna memoria de corrcla^áo c uma rede neural intimamente relacionada com ele, inspirada na memória ópliea. üutras contribuiooes significativas ao desen- volvinténto inicial da memoria associaj -. a inclucni o.s artigo* de Anderaon (1972), Kohoncn 11972) c Nakano (1972), que de mane ira independente c no mesmo ano introduziram a idéia de uma fnemó- riapor matriz de correia^dot bascada na regra de aprendixagem do p/oduíti externo.
Von NcurtiHDn foi unía das grandes ilguras da ciencia na priraeira mctadc do Sáculo vintc. A urcfuiieiura de von Neitmenit, básica para o prqjeto de um compuiadur digital, é assim denominada em sua homenagem, Em 1955, fui convidado pela Univcraidadc de Yate para proferir as Palestras Silliman durante 1956. Ele inon-eu em 1957» e o manuscrito inacabado das Palestras Silliman loí publicado mais tarde como um livro, TheCo/upuler and íhe fírain (1958). Este Iívfq C Ultercssante porque sugere o que von Neumann (cria fciiu se üvesse vivido; ele tena sedado corta das diferen^as profundas entre cerebros e computadores. Uma questáo particularmente interessante no contexto das redes neurais c aqueta do projeto de urna rede cnnfiávcl com neurónios que podem ser vtitoít como componentes nBfr-oonfiAveis. Este problema impórtame foi resolvido por von Ncumann (1956) utilizando a ideia de redundancia, o que motivou Winograd c Cowan (1963} a sugerir a utiliza^áo de uma representado redundante distribuida para as redes neurais. Winograd cCwan mostraram como um número grande de ele- mentos pode coevamente representar umconceito individual, com o aumento correspondente cm robustez c paralelismo. Cerca de 15 anos após a publicado do elásüico artigo de McCullcch c PitTs, uma nova abonda- getn para o problema de recofihcciinentn de parirte*. foi iniruduzída por Rosenbtalc (1958) em seu trabalho sobre o perceptrvn, um método i novador de aprendizagem supervisionada. O coroaincuto do [i ;ibalho de Rosenblatt foi o chantado feortnna da convergencia do percepnum. cuja priimcira dcmonstraqáo foi delineada por Roscnblatlf 1960b); outras provas do teorema lambein apareceram em Novilíoff(l963) e outros. Em 1961), Widrow e I loff introduziram o algoritmo do mínimo qtta- dmdo medio [LMS. LeaxtMean-Sfpiarc) e o usaram para formular o Adaline (adaptivelinear elemenf, elemento linear adaptativo). A diferen^a entre n perceptora e 0 Adaline está no procedí mentó de aprendizagem. Uma das priimeiras redes neurais cm camadas treináveis com múltiplos elementos adaptad vos foi a estrutura Madaline (muiíiple-atialtrtv) prcposta por Widrow c seus estudantcs (Widrow> 1962). Em 1967, Amar i líT.Iízou o método do gradiente estocase. <0 para classifíca^ao adaptaliva de padrtes. Em 1965» foi publicado 0 livro de Nílsson, Leaming Machine* que aínda é a exposi^áo mais bem escrita sobre padróes linyarmente separareis por hipcrsupcrlkics. Durante O periodo clássico do perceptren nos anos 196Ü, parecía que as redes neurais podenam realizar qual- quer coisa. Mas entáo veio 0 livro de Minsky c Papcrt (1969), que uflilizaram a matemática para demonstrar que existem limites lúndamcnlais para aquí lo que os pcrccpErons de camada única po- de m calcular. Em uma breve sc^áo sobre pcrceptrons de múltiplas camadas, des aftrmavam que nao havia razáo para sopor que qualquer uma daj bmitaqóes do perceptron de camada única poderla ser superada na versáo de múltiplas camadas. Um problema importante encontrado no projeto de um percepción de múltipla^ camadas é o problema de atribid^'ao de crédito (i.C., O problema de atribuir crédito a neurónios ocultos da rede). A terminología "atribulan de crédito*' foi utilizada prime i no por M m&ky (1961 )r sob o titulo de "O Problema deAtribuifAo de Cródile pura Si?¡tLiii;i'i de Aprendizagem por RcibrifO’1. No fítud dos anos 1960 já ha vi a sido formulada a maioria das idé jas e conceitos twcessdrios para resolverá problema de atrihuicáo de crédito do pcrccptron, bem como muñas das i.dé i as que fundamentan; as redes (neurais de atratores) recorrentes que sao agora denominadas redes de Hopíield. Entretanto, I¡ve- mos que esperar alé os anos 80 para que emergissern as solugfles para esses problemas básicos. De ftcOrdo com Cowan (1990) houvc trés razues para este al raso de úUis de 10 anos; • Uma razao foi tecnológica - nao ha1, ¡a computadores pessoflis ou estatúes de trabalho para a experimentacáo. Quando Gabor, por exemplo, desenvolveu o seu Mitro nao-linear de aprendi- zagem, seu grupo de pesquisadores levou mais seis anos para construir □ filtro com dispositi- vos analógicos (Gabor, 1954; Gabor ct al., 196Ü).
• A nutra razác fbi em parte psicológica c cm parte íinanccira, A monografía de 1969 de Mfrisky e Papen cerumente náo encorajan ninguétn a traba!bar com perceptrons.tampouco as agencias a apelar traba Ihos sobre des. • A analogía entre redes neurais e spina de grade foi prematura. O jvrodefo da vulva de spins de Shcrringlon c Kirkpatrick ioi inventado somonte em 1975. Estes fatores contri bu lram de um modo ou de nutro para o esmorecimenta do interesse continuado em redes ncurais nos anos 70. Muitos pesqtiisadores, com taccc^So daquelus que trabalhavam cm psicología e em neurocíéncias» abandonaram a área durante aquel a década. De fato, somonte um punhado dos pioneiros origináis mantiveram scu compnomctimento com as redes neurais. De uma perspectiva de engen haría, podernos considerar os anos 70 como uma década de adormecimiento para as redes ncurais. Uma atividade importante que emergíu nos anos 70 foram os rnqxn tfííto-fjrgtimdvdA utili- jando aprendizagem competitiva. O trabalho cm simulacro corapulacional fcito por von dcrMalsburg (1973) tal vez tenha sido o primeiro a demonstrar a auto-organizado. Em 1976^ Wilkhaw e von der Malsburg publicaram o primeiro artigo sobre a formado de mapas aulo-organizáveis, motivados pelos mapas ordenados de forma topotógica do cerebro. Nos anos B0, foram feitas importantes contribuidles em várias frentes á teoría e ao projelo de redes ncurais» e com isso bou ve um ressurgimento do interesse pelas redes neurais. Grossberg (198A), haseandn-se no seu trabalho anterior sobre aprendizagem competitiva (Grossbcrg, 1972, I976a+ b), cstabcloccu um novo principio de aulo-orgar.izafáo conhccido como tivríu da rf.vvcfJTUJícja ert/írp/ufíva (ART, Adaptíve Rexonance Theory}. Básicamente, a teoría envol- ví uma camada de reconhccimcnto de baixo para cima (tatforH-up) c uma camada generad va de cima para baixo (ííj/j-ü'íjtvfí). Se o padrio de entrada e o padreo real i mentado aprendido coincidi- rem, entio ocorre um estado dinámico chamado de “ressonáncia adaplativa” (Le., amplitkufáo c prolongamcnto daal .vidade neural). Estcjjrúrcr/iró de pmje^exparaftettfe/pat'a trásfoi rcdcscobcrto por cutres pesquisidores sob diferentes aspectos. Em 1982. Hopiield uiilizcrn a idéia de urna funesto de energía para formular um novo modo de se entender a computado ejecutada por redes recorrentes com coneKÓes si crípticas simétricas. Alcm disso, ele cstabcleccu □ isomortismo entre uma rede recorrente as^im definida c o modeio ising utilizado na física cstattstica. Esta analogía desencadeou um grande interesse da física teórica (e dos físicos) pela modelagem neural, transformando com ís» a área de redes neurais. Esta classe particular de redes ncurais com realimenta^ao atraiu muita atcncáo nos anos 1980, e no docorrer do tempo tomou-sc conhccida como redes de Hop fietd. A pesar de as rede de Hopfield nfto sercm modelos realísticos dos UBtetnas neimbiDlógicns, o principio que cías inccrporam. isto é, o armazenamento de uformaíao cm redes dinámicamente estáveis, é profundo. A origem desle prin- cipio remonta ao trabalho pioneiro de muitos outros investigadores: • Cragg e Tampcrlcy (1954,1955) observaran! que assim como os neurónios podem scr+kdispa- rados'* (ativados} ou "n3o disparados" (quicsccntcs), também os átomos em uma rede tém seus.vpfas apernando “para cima” ou llpara baixo". * Cowa n {1967111 itroduiiu a característica de d i sparo "sigmó i de" e a condíf áo de d taparo suave pura um neurónio que era bascada na fundan logística, • GnO&sbcrg (1967, 1968) intrndujiu o ffiodefa aditivo de um ncurónin, emolvendu equacóes nao-lineares de difercnfaÁ'diferenciáis c cxplorou o uso do modelo como uma base para a memoria de curto prazo.
IsrTFCDUtÁo 67 • Amari (1972) introduziu, de íormá independenti\ o múdelo aditivo de mu neurónio e o utiti- zou para esludar o uomportarnenio dinámico de elementos scmelhantes a nenióme»conectados aleatoriamente. • Wilson e Cowan (1972) derivaran! equaqáes diferenciáis náo-1 inca res acopladas correspon- dentes adinámica de popula^oes localizadas no espado , conlcndo ncunonios tanto excitadores como i tilintónos. Lidie c 5haw (1975) descreverani um nrr^/t'/oprt>buñil¡>{ittt de titn neurónio, que:' disparando ou nao um potencial de a^áu, c usaram o modelo para desenvolver uma teoría da memoria de curto prazo, • Anderson, Sdverstein, Rkz e Jones (1977) propuscram o riwdcto do estado cerebral em ama caixa (bmiit-ttíiltí-in-í^bót, 8SB), OOtUÍSlindo de uma rede MSOCiativa simples acoplada a urna dinámica nao-linear. Ktlo causa surpresa, portanto, que a publicarán do artigo de Hopfield cm 1982 tenha gerado tanta Controversia. Apesar disso, foi ueste mesmo artigo que pula primeira vez o principio do amiazenamento de informacáo cm redes dinámicamente está veis foi cxplicitado. Alcm d'sso, Hopfield mosirou que ele havia. se baseado no modelo do v idru de ¿prní da mecánica cstatisi ica para exami- nar ocaso especial das redes recurrentescom concxSes simétricas, garantindo com ¡saca sua con- vergencia para uma candido estóvcl, Ein 1983, Cohén e Urossber¡; cstaheleceram trm principio gcral para estimar a estabilidade de uma Humaría endere^áveipor ainfeúdo, que inclui a versáo de tempo continua da rede de Hopfield como um caso especial. Urna característica distintiva de unía rede neural de atratures é o modo natural como o tempo, urna dmenslo essencíal para a Bprcndiza- gem, se manifcsla na dinámica nao-linear da rede. Neste Contexto, o teorema de Cohen-Grossbe^g ó de profunda importancia. L'm nutro desenvoh imento importante cm 1982 foi a publicado do artigo de Kohonen sobre os mapas auto-organizáveis (Kohonen, 1982), utilizando uma cstruiura de rede unidimensional ou tridimensional, que era cm alguns aspectos diferente do trabaIhc anterior de Willshaw e von der MaJsburg. O modelo de Kohonen receben muito mais ateneo cm tnn contexto analítico eem rela- jo as aplicalóes na literatura que o modelo de Willshaw-von der Malsburg. c tomuu-scuma refe- rencia para a avalizo de entras inevapSes ueste campo. Ltn 1983, Kirkpatríele, Gelatt a Vccclti descreyera m um novo proccdimcnlo denominado recarimenta simulada^ para resolver problemas de olimizavuo üombinatória. O necozimentó simu- lado tem suas raízes na mecánica quántica. Ele c bascada cm uma técnica simples que foi primeira- muilte utilizada em simulares compuíacleñáis por Metrópolis et al. (1953) A idéi.t do recozimentO simulado foi utilizada mais larde por Acktey, Hintori e Sejnowski (1985) no desenvolví mentó de urna máquina estocástica conhecida como a ihíñ/jumi de Bídtzfítatw. qtte foi a pt^tdm realizado bcjij-sucedida de uma rcdc iicural de müir pías camadus. A[>esar de u ulgoruno de dprendizagem dzi tnáquina de Bnltzmann náo toi se mostrado táo ¿-íi cíente do ponto de vista eocnputacional como o algún imo du retropropagafáü (Bock-pmpQgaliwt), ele superuu □ impasse psicológico, mostrando que a especuladlo de Minsky c Papert (1969) nao cstava corrctamcntc embasada. A máquina de Boitzmann lambem serví u de base para o desenvolví mentó subsequen te das de cren^a slgtnáidt! de Neal i 1992), que conseguíu realizar duas uoisas: (1} a mdhoria significativa da aprendízagem e (?) a ligadlo das redes neurais ás redes de crcnpa (Pcarl, 1988). Urna mclhoria adicional no desem- penho das redes de crcn^a sigmóide foi realizada por Saúl, Jakkulla e Jordán (1996) utilizando a teoría do campo medio, uma técnica lambém com raizes na mecánica cstatística. Um artigo de Bario, Sutton e Anderson sobre apre ndizagew por nfüt^O fe i pub 1 i cado um 1983. Apesar de elcs náo leretn sido os primeirofi a utilizar aprendizagem pur reforjo (Minsky a
levou cm considerarán na sua tese de doutorado em 1954. por exemplo). seu artigo gerou muito interesse em aprendizagem por reforjo c na sua api ¡cacao cm controle. Específicamente, eles de* monstraram que um sistema de aprendí ¿agem por reforjo pedería aprender a equi librar um cabo de vassoura (Le-, um mastro montado sobre uma carreta) na ausencia de um profcssor auxiliar O sistema requerí a somonte um sinal de insuccsso que ocorre quando o mástic, ao cair, ullrapuasa um ángulo critico a partir da vertical, ou quando a carreta alcanzan final da puta. Em 1996, foi publi- cado o livro Neumdynamfc Prugranrming de Bertsekas e Tsilsiklis, Este livro coloccu a aprendiza- gem por reforjo sobre uma base matemática apropriada, ligandoa á programacáo dinámica de Reliman. Em I984,foi publicado o livro de Braitenberg. EéAfo/ev; Experimenta in Syntheiic Psychtdogy, N este livro, Braitenberg dufende oprnici/ífo r/íf dexempenha auto-or^ganixtílo, diivcionadu a objetivo', obtcm-sc um mcihor cnlend ¡mentó de um processo complexo pula sintese de mecanismos elemen- tares putativos do que por uma análisc de cima para baixo (tap-down). Süb o pretexto da fie^áo científica, Braitenberg ilustre este importante principio descreyendo vánas máquinas com uma arquitetura intema simples. As propiedades das máquinas e seu com pon a mentó sáo inspirados em fotos acerca dos cerebros de animáis, um assunto que ele cstudou di ralamente ou indi netamente per mais de 20 anos. Fm 1986* foi relatado por Rumelhart, Hinton e Williams (1986) a desenvol vi mentó do atguriíríjü de wrmpmpagafao (buck-pmpagalifm). Naquclc mesmo ano, foi publicado o célebre livro cm dois voluntes, f3n>éfí<sing.- Explofatitins ¡A the M¡L/ü!iifiniHiTf(>f Cogfiilíf>!it ed i la- do por Rumelharl e McClelland. Este livro e^erceu urna grande i i fluencia na utilizado da aprendí - zagem por rctropropagaqao, que emergíu como o algoritmo de aprcndizagcm mais popular para o treinamenlo de perceptrons de múltiplas camadas. Na vendade, a aprendízagem por rctropropagafáo foi descobertadc modo independe em outros dois lugares, na mesma época (i*arker, 1985; LeCun, 1985). Após a descoborta do algoritmo de rctropropaga^ao cm meados dos anos 1980, revelcu-se que o algoritmo ha vía sido descrito anteriormente por Werbns na sua tese de demorado na Univer- sidade de Harvard em agosto de 1974; a tese de doutürado do Werbos foi a primcira dcscripáo documentada da computacao eficiente do gradiente cm modo reverso que foi aplicada a modelos gerais de redes, sendo as redes neurais um caso especial. A idéia básica da retrograda^áo pode aínda ser encontrada mais anteriormente no livro Applied Opiimui Conrmi de Bryson e J Id (1969). Na Se^áo 2.2f intitulada “Sistemas de Mulüestágios" diquele livro, é descrita urna derivaqáo da rctropropagaqáo ut ilizande um formalismo lagrangiano. Em última anal i se, entretanto, deve-se atri- buir muito do crédito peto algoritmo de reircpropaga^So a Rumelhari. Hinfon c Williams (1986), por proporcm a sua utihzaqáo para a aprendízagem de máquina c por demonstraren! como ¡StO poderia funcionar. Em 1988, Linkscr descreveu um novo principio para a auto-organ i ZAFELO em uma rede perceptiva (Linkser, I98«a). () p: mclpio é concebido para preservar o máximo de informacáo sobre os padrees de at i vi dade das entradas, sujeito a limi taqoes como as concxócs sinópticas e o intervalo dinámico tías sinapses. L'ma sugestáo similar foi feita independentemente porvários pesquisadores da visan. Entretanto, foi Linkscr quem utilizou concettüs absintios bascados na teoría da informando (formu- lada por Shannon em 1948) para formular o principio da máxima frfornutyiiü mútita (Infomax). D artigo de Linkscr rcaccndeu o interesse pela aplicado da teoría da ínlbnnacáo ás redes neurais. Em particular, a aplicado da teoría da informado ao pt^bf&rta da separadlo eegu da Juntes por Bell c Sc¡nowski (1995) provocou multas pesqui-^adores a explorar cutres modelos teóricos da infnima- cao para resolver uma vasta clí^c ufo problemas, condecidos en let i va mente como decarí'vtdueatt
Também em l988, Broomhead e Lowe descreyeran um procedimenlo para o projeto de redes alimentadas adianto, cm camadas utilizando fun^aes de base radial (RBF, radiai basis function), as quais fcmecem uma alternativa aos penccptrons de múltiplas camadas. A idéia básica das fun^oes de base radial remonta pelo menos ao método dásjttiifdes de poteneiaí que foi proposlo original- mente per Bashkirov, Braveman e Muchnik (1964), c cujas propriedades teóricas fbram desenvol- vidas por Aizerman, Braverman e Rozonoer (1964a, b). Urna describo do método das fun^ocs de potencial é apresentada no clássíco livro» Páttern dassificalloa and Scene Anaiysis de Duda e Hart (1973). Apesar diado, o artigo de Broomhcad c Lowe levou a um grande esforzó em pesquisa para ligar o projeta de redes neurais a uma importante área da análise numérica e também aos filtros lineares adapiativas, Em 1990, Poggío e Gimsi (1990a) enriquecerá™ aínda mai$ a teoría das redes RBF aplicando a teoría da regularízalo de Tikhonov. Em 1989, Idi publicado o livro de Mead, Anafog VLSf andNeuralSystems. Este livro fomccc uma matura inusitada de concejos retirados da neurobiologia e da tecnología VLSI. Sobretodo, ele incluí capítulos sobre a retina de silicio c a cóclea de silicio, escrito por Mead c co-autores, que sao daros exemplos da mente criativa de Mead. No inicio dos anos 90, Vapnik e coautores inventaram umadasse de redesde aprendí/agem supervisionada poderosa do ponto de vista computacional, chamada de máquinas de vetar de su- porte, para ser utilizada em reconheciinenio de padrees, regressáo e problemas de estimado de densidadc(Bo5cr»Guyone Vapnik, 1992; Córtese Vapnik, 1995; Vapnik» 1995» 1998). Este método novo se baséis nos resultados da teoría de aprendizagem com lamanhos de amostra finitos. Uma característica inovadora das máquinas de vetor de suporte é o modo natural pelo qual a dimensuo de Vapnik-Chervtmenkis fV-C) é incorporada no seu projelo. A dimensáo V-C tornee e uma medida para a capacidade de uma rede neural de aprender a partir de um conjunto de ejemplos (Vapnik o Chervonenkis, 1971; Vapnik, 1982). Agora já está bem estabelocido que o caos constituí um aspecto-chave de fenómenos físicos. A questáo que mui (os levantam é; existe um papel importante para o caos no estudo de redes neurais? Em um contexto biológico, Freeman (1995) acredita que a resposta a esta questáo c afirmativa. De aconto com Freeman, os padróes de alividade neural n5o sáo impostes de fora do cerebro; em vez disso eles sao construidos a partir do scu interior. Em particular» a dinámica caótica ofcrccc uma base para descreyeras condtQées que $3c requeridas para a emergencia de padróes auto-organiza- dos em popula^óe*; de neurónios c entre estas populares. Talvcz mais do que qualqucr oulra publicado, o artigo de 1982 de H opíle Id e o livro em deis voluntes de 1986 de Rumelhart c McClelland foram as publica^ócs mais influentes, responsáveis pelo ressurgimente do inlcresse cm redes neurais nos anos 1980. As redes neurais certamente trilha- ram um longo caminlio desde os dias iniciáis de McCulloch e Pites. De falo, elas se cstabeleccram como um lema interdisciplÍEiar com raizes profundas cm ncurocicncias, psicología, matemática» ciencias físicas r engenharia. É desnectKsárw dizer que elas entáo aquí para ficar e que conlinuaráo a cresccr cm leona, projelo e aplica^óes. NOTAS E REFERÉNCIAS L Fsta definirán de uma rede neural £ adaptada de Alck^andcr e Mcrlon (1990). 2, Para uma pcrspccl ;va complcmcnlar sobre redes ncu rais com cniáse em modelageni neural, cognicáo c ccnsideracóes iieurofisiológicas, veja Andtrson (1995). ftira um relato bastan- te legivd dos aspectos computaeionais do cerebro, veja ChurehEand e Sejrtúwsld r L992). Para dése i ¡$¡k$ niuis detalliadas dos. mecaiusmcH neurais e do cerebro humana, veja Kandel
e Sclnvirl/ (1991 L Shcphcrd {1990a, h), Ktich e Segev (I9R9), KuíTltír el al. 119R4) tí Freeman (1975). 3. Para UIH rclaKi minucioso das funi;óv-. signtoidcx e queslnes relacionadas, vi",a Mennn qt al. (1996) 4. A liinvao logística, ou mais. pree i saínente a jíuifJio ¿fe distriimi^üu logística^ deriva sen nomc de lima L,lci de crcscimcnto h)gistico'b trnnsccfidcmal que resultan cm uma imensa Lúcraturj. Se medidos em unidades apropiadas, todos os ptvoessos de crescimento sito SUfKistam-.'nLv representados pela l -rtCid distribuidlo logística = I -f'"' 5 onde i representa o tempe, c a c [3 s3o constantes. Entretanto, veriticou-seque ruto súmen- le a d i slri bu ¡cao logística mas Lamhém a gaussiana e nutras distribu imites podem ser aplica- das aos mesmos dados com os meamos resollados de ajuste ou ate mclhorcs (Fcllcr. 1968). 5. De acorto com Kutllcr et al. (1984). o termo "campo reccpt iva*1 Ibi cimbado origi Raímen- te por Shemngtiin (1996) t icilrLHluzidií novamente por Harllíne (194(1). Mo contexto de um sistema víkujL o campo receptivo de um ncumnio se nefere a área rcsti ita sobre a superficie red nal, que influencia as descargas Jaque le neurónio causadas pela luz. 6. Aparentcmcnlc. a técnica de compan i!'lamento de pesos foi originalmente descrita em Rumelhirt et al. (1986b). 7. AS ninas históricas apresetitadas aquí >io eilonncmenle (mas. nao exclusivamente) busca- das ñas seguirnos fonte*: (|) o artiga de Saarincn ct al. (1992); (2) o capitulo escrito por Rail (1999); (3) o artigo de widrow e Lehr (1990), (4) os artigas de Cowan (19901) e Cnwan c SKup (1988); (5) a artigo de Grasaban (19R8ck (6) o livro cm deis voluntes sobre computado neural (Anderson et al., 1990; Anderson e RtisenfekL I988); (7) O capi- tulo escrito por Sdfiidge ci al (19fifi), (8) a colero de arillos Je von Neumacin sobre cnmputaflp c teoría Ja compuiafiQ (Aspray e Durkji, 1986); ;9) o 111; urja I sobre a tcoru do cérel -i.' e redes neuniis eilHado por Artiih (1995); (10) O Capítulo I do l'VTO de RllSSCl e Norvig (199?); e{L I) o artigo de Taytor (1997). PROBLEMAS Modelos de um neurónio 1.1 Um Cxemplu de fun^iih lúgístÍLa é definida por V(t?}=-------------- l-rexpf o») cu¡ijs valimos limites síq () ü I. Mostré que a r.L'riviidn de (i9 cm rcla^ao aré dada por ^E = <Jtp(r)|l -q>ívj] Qual é o valor dcsla derivada na crigem? 1,2 Urna fuñado sigmóide Impar ¿ definida por ( . l-exp(-nav) <p[ r-'J =---------- l -i-cxp(-rru) fíit; i — I
1MTR0DUÍ7AO 71 onde lanh representa a tangente hiperbólica. Os valores limites desta segunda turulo sigmóide sáo -L e . Mostré que a derivada de <p (ij) em retalio a vé dada por Qual é o valor desta derivada na origpin? Suponha que o parámetro de inclinado ¿r sej¡i infinitamente grande. Qual é a forma resultante de Q (u) ? 1«3 Uma ouha fun^ao sigmóide impar 4 a sigmóide algébrica; íPW = -r—-r %' i + ij cujos valores limites s¿o -] e +1. Mostré que a derivada de q> (t'j em relajo a v ¿dada por dv v3 L.4 Qual é o valor desta derivada na ongcm? Considere as duas segnintes fundes: (i) np(v) = exp —— dx k * j (íi) <p(u} = —tan 1 (u) it Explique por que estas duas fungues sati-.fazcm os requisitos de uma fun^áo sigmóide. De que modo estas duas ñinqóes diferem entre si? 1.5 Qual das cinco funches sigmóideü descritas nos PrnbicmiK L l a 1.4 scria quaI ¡tienda como uma fun^áo d -stribuicáo (de prebab.1 idade) cumula i va? Justifique a sua resposta. 1.6 Considere a fiin^áo de aliva^áo pseudolinear ip (i1) mostrada na Fig. PL .6. -03a & O-5<? AGURA P1.Í (a) Formule <p fu) como uma túnQáo de tt. (h) O que acontece enm tp (h) se íi aproximST-Se de Tero? 1.7 Repita o Problema H.6psTBafimíaodcaüva£aopscudolmcar<p(v) mostrada na Fig. P l .7. 1 .X Um neurónio tcm uma fun^áo de atva$ 3o tp(v} definida pela funQ¿o logística do problema ]. ]. onde vio campo local induzido, e o parámetro de i ik hitado n está dispon ívcl p^ra ajustes. Considere quexr rcprcscTitcm os sinais de entrada aplicados aos nós de fonte do ncurómo e que b represente o bias. Por conven ¡encía de representado, podemos tazer com que o parámetro de ¡uclínavao a soja aburvido pelo campo local induzidov, escrevendo ^(v • i ---------- I + exp( tt)
72 KhUhh NíLKAlS Como voté modi litaría as entradas A,. X,.,. . Xh de taima 5 produ/ir a mesmjí saida de antes? Justifique a sua resposta. i.9 Uní neurónio/ recebe entradas de quatro outros neurónios cujas niras de aliva^áo sao LO, -20,4e —2. Os respectivos pexini sinópticos tío neurónio j s3o 0. K. 0,2, i ,Ü e ü,1). Calcule a salda do neurónio j para as duu segúrate* aituatfes: (a) O neurónio é linear. (b) O neumnio é representado por um modelo de McCulJoclb Pitts. Assuma que o bias apl.cadfi aO ittUrtnk) é zeni. LIO Repita o Problema 1.9 para um modelo de neurónio buscado na fimpfo logística 1. L L (a) M nslrc que 0 modelo formal de McCultaelt-Piits de um neurónio pode ser apnox ima- do por um neurónio sigmóidc (i.e.. um ncuronio que utiliza uma íun^áo de atíva^áo sigjnólde) com pesos sinópticos grandes. (b) Mostré que um neurónio linear pode ser aproximado por um neuróniu siginóidr com pesca sinópticos pequeños. Arqulteturas de rede 1.LZ Unía rede alimentada ódiame totalmente conectada ten 1 10 nós lie tanto. 2 camadas ocul- tas, uma com 4 neurónios c a outra com 3 neurónios c um único neurónio de sóida. Cons- iga um £ralo arquitciural dcsta rede. 1,13 (n) A Figura P1.13 nioslra uní grata de tluxo de sinal de uma rede 2-2-2-1 alimentada adíame. A fundió <p(-} representa uma hincito logística. Escrcva o mapeamento de entrada-saida definido por esta rede. (b) Suponha que o neurónio de saida do grata de iluso de smal da Fig. 1*1.13 opere na sua regiáo linear. Escrcva o raapcamcnlo de entrada-saida definido por esta nova rede. 1.14 A rede descrita na Fig. PL.I3 n3o tcm bias. Suponha que bias iguais a -I e+1 Jíejam aplicados aos neurónios superiore inferior da primeira camada oculta, e bias (guaje a +1 ? -2 sejam aplicados aos neurónios superior e inferior da segunda camada inulta, respecti- vamente. Ewrera a nwa forma do mapcaracnto de entrada-saida definido pela rede. 1.15 Considere uma rede cta mü (tipias camadas alimentada adíame, na q ual t»d»s- os neurón ios operara ñas suas regiócs lineares. Justifique a alinm^o de que esta rede c equivalente n um$i rede alimentada adianto de camada única. 1.1 fi Ctmstiuu uma rede totalmente recórtenle com 5 neurónios, mas sem Huin-realimcntaeáo. 1.17 A Figura Pl. 17 moslra um grata de fluxo de sinal de uma rede recórreme constituida de deis neurónios. Ekkms a equacao de diferencas nSo-11 ncar que define a evolu^üo dejrjn)
1.J8 üU ce JT-ífr), Estas- dllM VariiMCÍS delineen as saldas tkw neuróniíis superior e inlérior. K£- pccth ámenle. Qual é a tudem deste cquafSo? A Figura PUS mo&tra o grafo de íluxo de ti nal de nina pede Reoriente que con&tstc de dois neunjuios crwn Mito-nalimeiita^o. Escrcta o sistema acoplado de duas equiiQfles de difereneas de primeifii ordeiu que desenvem a opeTú^iü Ju >¡stema. FIGURA P1,1B LI9 Urna rede recórtente tcm 3 nós de iiinte, 2 neurónios ocultos e 4 neuróniqs de saída. Construa um grafo arrjuiietiiral que descrema esia rede.
Representado do conhecimento 1,20 L'ma Ibntia útil dt pré-processamcnto He basetu no mítdeiti tjutfj-regrertsivg (AÜJ descrito pela cqua^So de difcrcn^as (para dados de valores reais) v(it) *- I) + WjJ'trt - 2) + - - _v(rt — Ai) + i'lrJ) linde _i(n) é ; dó íliodeh.i. v(ft) ó Lima amostra retirada de u]fl pcocessode raido branca com media zero c uma wíAncii prcdclin ¡da; irr w w^, s3o os coercientes do modelo ,t/<; c M c a orden do modelo. Mostré que o uso dcstc modelo tornee c duas fonnas de invariáncla geométrica: (a) em escala e ibi em transíalo temporal. Como estas duas ¡ uvariánciaj paderium ser uli lizudus em redes neurais? 1,21 Considere que X scja um vetar de entrada e que s(a, x} scj a vtn operador de transformaQáo alindo sobre x edependente de um parámetro a. O operador s(gi_, x) satisfaz dois requisi- Ioh: • s(0, x)=x *(a. x) é difcrenuiável cm rclafüo a a. O veftv' tundente é definido pela derivada parcial dsfnt, xV¿)a {Simard el al„ 1992). Supcnk.! que x represienle uma imugem e que tt se;. i um parámetro de rota^áO- Como vticc calentaría o velar lungentr para o caso rm que tf. é pequenp? O vetor lADgcnlC C local mente invariante cm ralacao á miaban da imagem original; por que'?
CAPÍTULO 2 Processos de Aprendizagem 2.1 IMTRODUQÁO A propnedade que ó de importancia primordial pon urna rede neural é a sua hábil idade de aprender a partir de scu ambiente e de meíhoriar v> seu tlesempedho através da Bprendizagem. A melhoria do desempenho acorre com o tempo de acardo com al cuma medida prccstabcLcc .da. Uma rede neural aprende acerca do scu ambiente através de um processo inierativo de ajustes aplicados a seus pesos sináptieos e ni veis de bias. Idealmente, a rede se torna mais instruida sobre o seu ambiente após cada iterando do processo de aprendizagem. Há atividades demais associadas ú no£io de ‘'aprendizagem'* para justificar a sua dcfiiucáo de forma precisa. Além disso. o processo de aprendizagem depende do ponto de vista, o que causa dificuldadcs cm se oblur um consenso sobre urna defimeáo precisa do termo. A aprendizagem do ponto de vista de um psicólogo, por exemplo, c bastante diferente da aprend:zagcm cm um sentido de sala de aula. Reconhccendo que o nosso interesse particular se concentra ñas redes neurais, Utilizamos uma definirán de aprendizagem quee adaptada de MondeI c Mediaren (1970). Definimos aprendizagem no contexto de redes neurais como: Aprendizagem é Jmr pmctSSO pela qual Of jXm ürk-ftujy lims tít! rriflfj ffldí1 WUIW/ Jiíff adaplados atravéx de um pmcasso tle esttmuiiHr¿H> pela títfibiettíe MG qual a rede esfá inserida. O tipo de uprendizagim t1 ftaMHNÍMtyfo pela muneira ptdtt qual ti mtMiifica^ao dtrs parántelnrs tjeanv. Esta definido do procos so de aprendizagem implica a seguinte seqÜSncift de eventos: L A rede neural é L'.ttímufuda por um ambiente- 2. A rede neural jq/n? rnadifica^oes nos ecus parámetros livres como resultado desla estimuladlo. 3. A rede neural tmspaude de uma ntarieifa nava ao am b i ente, devido ¿3 modificares acorridas na sua estrutura Intenta.
Um conjunto preestablecido de negras bem-defí oídas para a soluto de um problema de apren- dizagem é denominado um aígariimn de aprendiiugem.' Como m pode esperar, nác há um algoritmo de aprendízagem único para o projeto de redes neurais. Em vez disso, temos um “conjunto de ferramentas" representado por uma variedade de algoritmos de aprendízagem, cada qual ofcrecen- do vantagens específicas. Básicamente, os algoritmos de aprendizagem diferem entre si pela forma como é formulado n ajuste de um peso sináptico de um neurónio. Um outro fator a ser considerado c a mane ira peta qual uma rede neural (máquina de aprend ¡zagem), constituida de um conjunto de neurónios inler ligados. se relaciona com o seu ambienie. Neste último contexto, talamos de um paradigma de aprendizagem que so refere a um modefo do ambiente no qual a rede neural opera. Organizado do Capítulo ü capitulo está organizado em quatro partes ínter-relacionadas. Na prime ira parte, que consiste das Soeces 2.2 a 2.6, discutimos cinco negras básicas de aprendí zagem: aprendí zagem porcorrccao de erro, aprendizagem bascada em memoria, aprand¡.zagem bebbiana, aprendizagem competinva e aprendizagem de Boltzmann. A aprendizagem por cornejo de erro está fundamentada na filtragem ótíma. A aprendizagem bascada em memoria opera memorizando explícitamente os dados de treí- namcnlo. Tanto a aprendizagem hcbbiana como u. aprendizagem competitiva sao inspiradas cm considerares neurobiológicas. A aprendizagem de Bnltzmann c diferente porque é bascada em ídeias Lomadas emprestadas da mecánica cstatíslica. A segunda parte do capitulo explora os paradigmas de aprendizagem. A Secflo 2.7 discute o problema de atribuido de crédito, que é básico para o processo de aprendizagem. As Sc^ócs 2.S c 2.9 aprcscntam um resumo de dois paradigmas de aprendizagem: (l) a aprendizagem com um pro- ícswir e (2) a aprendizagem .rem um professor. A tereeira pane do capitulo, que consiste das Sebees 2,10 a 2*12, examina as que&t&es relativas as tarefas de aprendizagem, memoria c adaptado. A parte final do capítulo* que consiste das Secóos 2.13 a 2. J5, trata dos aspectos prohibí lis!icos e estilísticos do processo de aprendizagem. A Se;áo 2*13 discute o dilema bias/variáncia. A sw;ao 2.14 discute a teoría estatislica da apnendizagcnt. bascada na ntx;áo da dimensao V-C que fomeec uma medida da capacidade da máquina. A Sc^áo 2.14 iniruduz um outro conccito importante: a aprendizagem provavelmente aprox i mudamente correta (PAC), que fomecc um modelo conservativo para o processo de aprendizagem O capiculo é concluido com algumas considera^des fináis na Scváo 2.16. 2,2 APRENDIZAGEM POR CORRE^ÁO DE ERRO Para ¡lustrar nossa prime ira regra de aprendizagem, considere o caso simples de um ncuronio k que constituí o único nó compuiacional da camada de saída de uma rede neural alimentada adiantc, como representado na Fig. 2.1a. G neurónio ¿ é acionado por um vetar cíe sino! i(n) produzido por unta ou mais camadas de neurónios ocultos, que sao* por sua vez, acionadas por um velor de entrada (estimulo) aplicado aos nos de fontc (i.e., a camada de entrada) da rede neural. O argumento « representa o instante de tempo discreto, ou mais precisamente, o passo de tempo de um processo iterativa envolvido no ajuste dos pesos sinápticos do neurónio i. O sitia! de saída do neurónio Á c representado por vjn). Este sinal de saída, representando a única saída da rede neural. í comparado com uma ntapasta desejada ou mída-<dvf>. representada por J in). Con.wqüenienientc, é produzido um sinal de erm, representado por ejn). Por definicao, temos assim
PttxTSSH? pe Aprendizagem 77 Rt?4e d? miillipljs anudas al ¡menliuhs nd ianlc (a) Dii^rdmu -um KIltcch nk uiriLb mk rujuraL rawllando 0 único ncnránni do tamado de saida (h) Grafo de íIuxq de si ral do ncuránin de salda AGURA 2.1 Ilustrarlo da aprandizagam per ampia da arto **<«) *VB) “>'*(*) (2.1} O sinal de erro ¿.(n) aciuna um mecanismo de canlmie, cujo propósito é aplicar uma seqüénda de ajustes corretivos aos pesos sinópticos do neurónio Os ajustes correlivos sao projetados para aproximar passo a passo o sinal de salda >A(n) da resposia desejada rfjw), Este objetivo é alcanzado minimizando-se uma fun^aa de cusía ou índice de desempenha, í (a), definido em termos do sinal de erro et(n) como: «(»)=-<.;(») (2.2) Com isso, %(n) é o vaiar instantáneo da energía do erro. Os ajustes passo a passo dos pesos sináplicos do neurónio k continuam até o sistema atingir um estado estove! (i.e., os pesos sinápticos estíle» essencialmente estabilizados), Neste ponto, o processo é encerrado O processo de aprendizagem dcscrilo aquí c denominado, por razóes óbvias1 aptvndizagem par comido de erro. Em particular a minimizado da furrio de custo $(jj) resulta na regra de aprendizagem normalmente referida como regra deíta cu regra de Wídmw-Hoffi assim denominada em homenagem aos seus criadores (Widrow e HofK 1960). Supon ha que wJji) represente o valor do peso sinóptico do neurónio k excitado por um elemento r(n) do vetor de sinal i(jt) no passo de tempo n. De acorde com a regra delta, o ajuste Aw J/l) aplicado ao peso SÍrtéptíCO W* no passo de lempo n é definido por (23)
78 Rfiws NfitjuAih ondeq é unía constante positiva que determina a foxu de aprendizadn quando avanzamos cm um pa$so no proccsso de aprendizagem. É, portanto, natural que denominemos T] parámetro taxu de aprendizado. Em oulras palavras. a regra delta pode ser formulada como: O afustefaifa em nm peso si/tttpfiCQ de um TWWWUa ¿pmpmcimal an pmdiilft d<>.vinal de erro peto sinai de entrada da xinapte em ipiextuti. Note-se que a regra delta, assim formulada, prcssupóe que ü sinal de erro sejíi tiiivludiente Memninhu/. Para que esta medida soja rcalizável nccessitamos claramente que a resposta desojada seja fomecida poral&uma fonte externa, que seja direfamenicacesflível ao neurónio k. Em nutras palavras, o neurónio k é vifsivel ao mundo externo, como representado na Fig- 2-la. Desta figura tambem observamos que a aprendizagem por conejo de erro é na vendado do natureza focal. Isto apenas significa que os ajustes smápticos foitos pela regra delta sEo localizados em torno de neurinic t Tcndo calculado o ajuste sin ápüco AWj.ínX ° valor atua tizado do peso sináptico w¡f é determi- nado por + ] ] = wjin) + Aw^fo) (2,4) Na vendado, W-Pr) o icXi(/r + 1) podem sor vistos como os valores antigo e novo do peso sináptico w , respectivamente. Em termos computación ais, podemos tambera HCTBVer w^ = r'[^+L)] (2.5) onde z*1 éo operador atrasa luiltárfo. Istoí, z_| representa um elemento de armazenamefíto. A Figura 2.1b mostea uma representarán em grafo de fluxo de si nal do processo de aprendida- gem por corroso de erro, enfocando a atividade na vizinhan^a do neurónio í. O sinal de entrada .r c o campo local induridu y do neurónio k sSo referidos respectivamente como os Piapoco epós-sitiáptico da/-¿sima sinapsedo neurónio A, respectivamente. Da Fig- 2.1 vemos que a apren- dizagem por corrc^áo de erro c um exemplo de um Jisjcmcj teídimeafado de tawfichado. Da teoría de controle sabemos que a estábilidade de um sistema como sise é determinada pelos parámetros que eonstitiiem os la^os de realimentapo do sistema. No tiossü caso temos apenas um lace de rcalinnciilacáo, com desses parámetros, que é particularmente interesante, é o parámetro taxa de aprend^ado q. l’or esse motivo, é importante que q seja seleciuñado cuidadosamente, para asegu- rar que soja alcanzada a estábilidade ou convergencia do proccssc de aprendizagem iterativo. A escolla de q tem tamhém urna influencia profunda na precisáo e cm outros aspectos do pnocesso de aprendizagem. Em resumo, o parámetro tasa de aprendizado q desempenha na prática uní papel- chave, determinando n desempenho da aprendizagem porcomjqáo de erro. A aprendizagem por correcto de erro é discutida com muito maúdetalhes no Capitulo 3, que trata das redes alimentadas adianto de camada única, c no Capítulo 4, que detalla as redes alimen- tadas adiarte com múltiplas carnada^ 2.3 APRENDIZAGEM GASEADA EM MEMORIA Na aprendizagem bascada em memoria, todas as (ou a maiot i a das) experiencias passadas sáo armazenadas explícitamente cm uma grande memoria de cxcmplos do entrada-saida Clarificados
FROCEJWSDE ArGJiKDIZACEM 79 cencíamente: {(xp J, )} ' ,ondc x representa um vetor de entrada c J representa a resposta desejada uonespvndentc. Sem perda de genera lidade, restringimos a resposta desejada a ser um esealar. Em um problema de classiñca^áo de padrees binario., por cxcmplo, há duas classcs/h i potases a scrcm consideradas, representadas por^, e^3. Neste exemplo, a resposta desejada df assunne o valor 0 (ou -1) para a classe :íl e o valor 1 para a classe :íL. Quando desejantns. classificar um velar de teste x|n|r (nao visto antes), o algoritmo responde buscando c analisando os dados de trcinamcnta cm uma "vizinharuja local”dex . Todos os algoritmos de aprendizagem bascada cm memórid envolvem dois ingredientes es- senciais; • O criterio utilizado para definir a vizinhanca Local do vetor de teste xk^. • A regra de aprendizagem aplicada ms ejemplos de treinatnento na vizinhanga local de xlflw- Os algoritmos diferem entre si na íbnna como estes dais ingredientes sao definidos. Em um tipo simples mas delira de aprcmlazagcm bascada cm memoria conhcctdo como a <fo viíifíhtt mais pritxima-. a vizinhanca Irieal é de ti ni da como o exemplc de ireinamento que se encentra na vi/ nhanca ¡mediata do vetor de teste x Em particular, dizemos que o vetor x’w6 {xr x,...xj (2.6) c o vizinho mais próximo de xlnk. se P7) onde di x, X ) c a d istánc i a euc I id iana en tre OS vetares x ex . A c lasse associada com a di stánci a h i" Indc^ . Lev Ir mínima, ou seja. o vetar x . é apreseniada como a classifíca^áo de x . Esta regra c independente da distribuiqáo fundamental rcsponsávcl pula gera^ao dos cxcmplos do treinamenta. Cover e Jlart (1967) estudaram formalmente a regra do vizinho mais próximo como uma feiramenta para classifíca^án de padrees. A ana liso apresentada por elcs é bascada cm duas supes i - Coes: • Os exemplos clasificados (i. ti j sao independ&itemmfe íj iefertiit.umwtte di*tribuidos frit/j, de acordó cam a distríbuic^a de probahi Iidade conjunta do excmplo (xT </)r • O lamanho da amostra A' é infinitamente grande. l.evando em considerado estas duas .suposifdes, mosin-se que a probabilidade de erro du classif]- cacáo pela regra do vizinho mais próximo é limitada acima pela dabro dapmbabiiidade de em baytt.fiuti^ isla e, a mímma probabilidade de erro entre todas as regnis di: dec sao. A probabilidade de erro bayesiana ú discutida no Capí la lo 3. Ncstc sentido, poderse dizer que metade da infónnBfto sobre a classifícacáo de um conjunto de treinamento de tamanho infinito está coñuda no vizinho mais próximo, o que é um resultado sutpreendente. Uma variante do classilicador pelo vizinho mais próximo e o elaaníflcadorpetas k vitinbas muía pniximost que procede como scgpe: • Identifique as i padrees elassií cadas que se cncontram mais próximos do vetor de teste para um número intaire it.
8P Kejifs Neliíaii • Atrlbua x á clasve (hipátett) que está mais frequentcmcnte representada ñus k vizinhós milis próximos de xIMi. (i.e.. use uma votarlo majoritária para fazer a classitkatjao). A.isiin. o dajisificadur pelos A * ¡zinhos mais próximos alúa como um dispositivo que calcula a média. Em particular, ele discrimina um dado cstranho, como ilustrado na Fig. 2.2 para k - 3. Um dado estrecha c uma observado que tem um valor improvávcl cm rela^ao a um modelo de iníeres- sc. No Capítulo 5, discutimos um outro tipo impórtame de clasificador bascado cm metnória, con lucido coma rede do fuiujáo de base radial. 0 0 0 0 0 0 Efitrwri» | q 11111 FIGURA 2.2 A área coabda no interior do círculo fracajado incluí «Jais pontos pérténcenfles á classe 1 e um ponto eslranno partonconto á dasse 0.0 ponto d corrÉfipijnds ao valor de tosté Ctortt k = 3, o ctassifi&dor polas a vizintros mais próximos alntxii a dasse 1 aú ponto d, mésmo ale oslando mais próximo h dado esrwito 2.4 APRENDIZAGEM HEBBIANA O postuiüdi? deaprendiendo de Hebh é a mais amiga e mais famosa de todas as regras de aprendi- zagem; deé assim denominado em homenagem ao neuropsicólogo I lehh (1049). Criando o livro de Hebb (1949, p.62), The Organizatitm qfBehavfor. Quando um axónio da célula A está peno o suficiente para excitar uma célula B c participa do seu tlispanfl repetida ou persistenlemenlr, enlafl uluuni prOCtssú de CKSC.inentu Ou [iiodi íicii^áo mtta- bólica acontece cm uma das células ou cm ambas, de tal forma que a eficiencia de A tomo uma das células que dispara B ¿aumentada. Hcbb propós esta modilicsfAo como uma base da aprendizagem assocíatíva (;i nivel celular), que resultaría cm uma modificarán permanente do podran de atividadede um "agrupartiente de células nervosas" espacial mente disLribuido. Esta a firmando foi feita emtun contexto jieurohiológico. Podemos expandiré rescrevé-la como uma regra em duas pades (Stent, 197?; diangeuxe Panchin. 1976); L. Se duis neurónios em ambtM os fados de. uma sinupae (conaxdo) s&o olivados simsdtaneamenie (i.e., sincrrwanrentek entao a fotya daquefa sinap-w é sefeiivafíidMte aumentada- 2. Se dais neumnios em ambos ¡xv fados de ama sinupse año olivados assincrtmiimente. entáo atfueia sínapse é seietivamenfe an/raquecida tur eliminada. Uma ainapse assim é denominada uma strnpse hebbianu* (A negra de I lebb original nao conicm a parte 2). Mais precisamente, definimos uma ^inapsehebbi;inu como uma sinapse que usa um meca- nismo dependente do ¡empo. altamente focal e fin'temente inierutivo para aumentar a eficiencia
sinóptica como uma Junado da correteada entre as atividades pré-sináptica e pós-sináptica. A partírdeíU definido pedemos deduarctS seguintes quatro mecanismos (propri edades) fundamen- táis que caracterizan! urna sinapse hcbbiana (Brown ct al., 1990); 1. Mecanismo dependente do tempo. Fste mecanismo se refere ao fato de que as modifiea^óes em uma sinapse hcbbiana dependem do tempo exato de o correncia dos sitiáis prc-siiiiápticos c pos- s i íiApúcos. 2» Mecanismo Local. Pela sua natureza, urna sinapse é um local de transmissao onde sinais por- tadores de infonna^áo (rcprcscnlandD a atividade incidente ñas unidades pré-sináptica c pos-sinóptica) cstSo cm cera! i gü idade espado-temporal. Esta informado local mente di^ponível é utilizada por uma sinapse hebbiana para producir urna modificado sinóptica local que é específica para a entra- da. X Mecanismo inlemttvo. A ocorréncia de uma tnodificaq^o em uma sinapse hebbiana depende dos sinais em ambos os lados da sinapse. isto c, uma forma do aprendizagem hcbbiana depende de uma “inlcracao verdadeira" entre os sinais pré-sináptico e pós-sináptico, no sentido de que nüo podemos fazer uma previsto a partir de apenas uma densas duas atividades. Note também que esta dependencia ou interaqao pode ser de natureza dctcrminística ou cstalística. 4. Mecanismo conjuncioaal ou correlativo. Urna interpretable do postuiado de aprendizaje de Hebb é que a candirán para uma modificaban da efi< iéneia sinóptica é a conjunto dos 3inais pré- siuáptico e pós-sináptico. Assim, de acorde com esta interpretado, a ocorrencia simultánea dos sinais pré-sináptíco e pós-sináptico (dentro de um curto intervalo de tempo) é suli cíenle para produ- zir a modificábalo sinóptica. F por esta razao que uma sinapse hehbiana e algumas vezes denomina- da sinapse conjuncional. Para uma outra interpretaiyáo do postulado de aprendizade de Hebb, pode- mos considerar o mecanismo interafivo que caracteriza uma sinapse hcbbiana cm termos estatisti- cos, Em particular, a correlaí3otemporal entre wsinats pré-sináptico e pós-smáptico ¿vísta como sendo responsáve] per uma modifica^ao sinóptica. Ncstc sentido, uma sinapse hcbbiana é também denominada uma sinapse correlativa, A corre!ñ<;ao é de tato a base do aprendizado (Eggcrmont» 1990). Reforco e Depreesáo Sinópticos A definí pao de uma sinapse hcbbiana «presentada aquí nao incluí prücessos adicioniii $ que podem resultar no enfraquecimento de uma sinapse conectando um par de neurónios. De fato, podemos generalizar o coneeito de uma modificabác hebbiana reconhecendo que uma aiividadc positivamen- te correlacionada produz reforjo sinóptico c que uma ath idade nao-correlacionada ou negativa- mente correlacionada produz cnftaquccimentó sináptico (Stcnt, 1973), A depressao sinóptica pode ser também do tipo nác-interalivo. Específicamente, a condiv&o Literal iva para o enfraquecimento .sináptico pode ser simpl estríente a atividade nóo-eoincidente pré-sináptica ou pós-sináptica. Podemos seguir um passo h frente, classificando uma mcdiíicafáo sinóptica como hebhiana, anti-hebbiana e nao-hebbiana (Palm, 1982). De acordo com este esquema, uma sinapse hebbiana aumenta sua for^a com sinais pré-sinápiico c pós-sináptico positivamente correlacionados e dimi- nuí a sua fbr^a quando estes sinais náo sáo correlacionados ou sáo negativamente correlacionados. Inversamente, uma sinapse ant i-hebb i ana enfraqucce sinais pré-si nóptico c pós-sináptico positiva- mente correlacionados c reforja sinais negativamente correlacionados. Tanto em uma sinapse hcbbiana como cm uma sinapse anti-hebbiana, entretanto, a modificado da eficiencia sinóptica se baseia em um mecanismo que é dependente do tcmpoT altamente local e de natureza fortemente interativa. Ncstc sentido, uma smapse anti-hebbiana é aínda de natureza hcbbiana, apesar de nao o
ser funei analmente. Unía sinapse náo-tiehbiana, por entro Lado, nao cnvolvc qualqucr tipo de meca- nismo hebbiano. Modelos Matemáticos de Modificares Hebblanas Para formular a aprendí/agem hebbhna em termos matemáticos, considere um peso sinóptico tu do neurónio k com sinais pré-sináptico e pós-sináptico representados por .v uj'r respectivamente. O aj usté aplicado ao peso sináptico ti1.. no passo de tempo n é expresa® na forma geral (2.8) onde c uma fun^áo tanto do sinal prc-sináplico como do pos-sinóptico. Os sinais.t (ri) tjJ/i) sao freqüentemenlc tratados como adiznensionais. A fórmula da Eq. (2.8) admite mu i las fónnas, sendo que todas san qualideadas como hcbbianas. A seguir, consideramos duas destas formas. Hipótesi de Hehh, A forma mais simples de aprendizagem hcbbiana é descrita por (2.9} onde i] é uma constante positiva que determina a laxa deaprendizagem. A Equad® (2.9) claramen- te enfatiza a natureza correlativa de uma sinapse hebbiana. Ela é algunas vezes referida como a legra dopradttía das atívidades. A curva superior da Fig. 2.3 mostra uma representaban gráfica da Eq. (2.9), com a modificad® Vu\ trabada em fund® do sinal de saida (ali'. idadc pós-^ináptica).!^. Desta representado» vemos que a aplicado repetida do sinal de entrada (atividade pn¿»kmáptica) x resulla em um aumento de i; e, portante, em um aewimento exponencial que ao final leva a cone- xa® sinóptica á saturaba®. Naqucle ponto nenhuma informado será armazenada na sinapse e a seleti vidade é perdida rHSURAJ2.3 Ilustrado da tiipólesa de Hetib e da hipóle&e da covariancia Hipótcse da covariancia. Unta formu de superar a limitad® da hipótese de Hcbb é através da utilizad® da hiptit&m da cmaftínda inlruduzida por Sejnowski {1977a, b), Ncsta hipótcse, os
sinais pró-sináptico e pós-sináptico na Eq. (2.9) sáo substituidos pelo desvíos dos sinais pni-sináptico e pás-sináptico em relajo ¿os seus respectivos valores médios em um certo intervalo de tempo. Considere que í e v representeni os valores medios no tempo das sinais pré-sinápLico x c pós- sinóptico j;, respectivamente, De acorde com a hipólcsc da covariancia, o ajuste aplicado ao peso sinóptico w. é definido por nu, - X)Ó, - y ) (2.10) onde t| é o parámetro tasa de aprendizaje. Os valores medios Z e v constituem os Iimiares pré- sínáptico e pos-sinóptico, que determinan) o sinal da modificado sinóptica. Em particular, a hipóte- se da covariancia permite O spguintc: • A convergencia para um estado nao-trivial, que é alcanzado quando = v cu v, - _v. • A previsto da poteñcia$ao sinóptica (i.e., aumento da for?a sinóptica) e a depressao sinóptica (j.e., diminuido da for^a sinóptica). A Figura 2.3 ilustra a dtferenqa entre a hipótese hebbiana e a hipótese da covariancia. Em ambos os casos, Air. depende linearmente de y.; entretanto, o cruzamiento com o eixo de y. na hipótese de Hebb ocorre na origemT enquanto que na hipótese da covariancia ele ocorre em = y. Podemos fazeras seguintes observares importantes sobrea Eq. (2.10): 1. O peso sinóptico ó reforjado se houver níveis suficientes de atividades pré-sináptica e pos- sinóptica. ou seja, se ambas as condiqóes x > x e > y forera satisfeitas. 2. O peso sinóptico c deprimido se ocomcr uma das seguirles situares: • uma ativa^O pré-si nápt ica {i. e-, i > jr ) na ausencia de ati va^áo pós-sináptica suficiente (i.e., j; < y ), ou • uma ativBfáo pós-s i nápt i ca (i. e^ _ i > y ) na ausénc i a de a.t:i va^ao pré- si nápt i ca sufic lente (i .c., Xj< x). Este comportamento pode ser visto como urna forma de compenso temporal entre os padrees incidcnlcs. Há uma forte evidencia fisiológica4 para a áprcnd ¿agem hebbiana na área do cérebro chama- da hipocampo. O hipocampo desempenha um papel importante em certos aspectos de aprendiza- gem e memória. Esta evidencia fisiológica toma a aprendizagem hcbbi.ina bastante aírativa. 2,5 APRENDIZAGEM COMPETITIVA Na aprendizagem competitiva* como o nome implica, os neurónios de salda de uma rede neural competen) entre si para se tomar ativos (disparar). Enquanto que em uma rede neural baseada na aprendizagem hebbiana, vários neurónios de safda podem estar ativos simultáneamente, na aprendiza- gem competitiva sementé um único neurónio de saida está ativo cm um determinado instante. É essa característica que toma a aprendizagem com|x;titiva muito adequada para descobrir características cstatisticamcntc sal lentes que podem scrutilizadas para classiticar um conjunto de padrees de entrada. Existetn tres elementos básteos em uma regra de aprendizagem competitiva (Rumelhart c Zispcr, 1985):
• Um conjunto de neuranios que sao Lodos iguais entre si, cxccto por alguns pesos sinópticos distribuidos aleatoriamente, c que per isso respondem diferenteme/rte ñ um dado conjunto de padrees de entrada. * Um limite imposto sobre a “Ibrqa11 de cada neurónio. • Um mecanismo que permite que o neurónio compita pelo direíto de responder a um dado subconjunta de entradas, de forma que somcnlc wm neurónio de salda, ou sámente um neurónio por grupo, esteja alivo (i.e., "ligado”) em um determinado instante O neurónio que vence a competido c denominado um neErriÑiío vencedor leva tuda. Corresponden (emente, os neurónios individuáis da rede aprendan a se especializar em agrúpamen- os de padróes similares; fazendo isso, elcs se tomam detectores de características para classes diferentes de padróes de entrada. Na forma mais simples de aprendizagem competitiva, a rede neural (em uma única camada de neurónios de saida, estando cada neurónio totalmente conectado aos nos de entrada, A rede pode incluir ccnexóes de realimentacao entre os neurónios, como indicada na Fig. 2.4. Na arqiiitetura aquí descrita, as eoncxóes de realimeniafáo realizam imbi^ao lateral.11 com cada neurónio lendcndo a inibír o neurónio ao qual está lateralmente conectado. Por outro lado, as conexóes sinópticas de alimentaban adi ante na redada Fig, 2-4 sao todas excitadoras. Cnufa Camada ún-ic-a de nás de de neurónios- lóate de salda FIGURA 2.4 Gralo arquilédurÉl dé urna T-sdg de apr^nijizagem competitiva simples com arroda ce akrwiteGfo odiante (axciladcxas} dos rris de fonia para m neurdmw & censKOW taCe<Bis (initiiórias) ntn os nHurOnlos: as «antea (alarais bSd r-sprasentiidaE por sslas abertas Para um MUrónio t Ser O neurónio vencedor seu campo loca] induzido para um padreo de entrada especificado x deve ser o matar entre todos os neurónios da rede. O sinal de saida y. do neurónio vencedor £ c colocado cm um; os sinais de saida de Lodos as neurónios que perdem a competiere sao Colocados cm zuro. Com isso, podemos, escrever se t\ > para todos j,j # k caso contrario (2-11) onde o campo local induzido i1 representa a a<;ao combinada de todas as entradas direias c real i mentadas do neurónio £. Considere que represente o peso sináptico conectando o nó de entrada j ao neurónta k. Suponha que a cada neurónio seja alocada uma quantidade flxa de peso sináptico (Le., Lodos os pesas smápticüs sao positivos), que c distribuida entre seus nos do entrada; ou seja, = 1 para todo A {2.12}
Um neurónio, entao, aprende ao deslocar pesos sinápticos de seus nós de entrada [nativos para os seos nós ativos. Se um neurónio rúSo responde a um padreo de entrada particular, entáo n3o ocorrerá aprcndizado naqueíe neurónio. Se um neurónio particular vencer a competirás, entao cada nó de entrada deste neurónio libera uma certa propongo de seu peso sináptico e este peso liberado será entao distribuido uniformemente entre os nós de entrada ativos. De acordo com a regra de apnendi- Tagem competitiva padreo, a variapáo Au .. aplicada ao peso sináptico tí.1,. é definidla por —) seo neurónio £ vencer a competí jáo seo neureniü k perder a competí cao (2.13) ondcT| c o parámetro taxa de aprendizagem. Esta negra tcm o efeito global de mover o vetor de peso sináptico i\ do neurónio vencedor k em direfáo ao padráo de entrada x. Podemos utilizar a analogía geométrica representada na Fig. 2.5 para ilustrar a esséncia da aprendizagem competí i i va (Rumelhart e Zipaer, 1985). Supomos que cada padrao (vetor) de entra- da x tero una determinado compri mentó euclidiano constante, de forma que podemos vó-lo como um ponto em uma esfera unitaria AT-dimcnsional, onde Mé o número de nós de entrada. N representa também a dimcnsao de cada vcícr de peso sináptico w.. Suponías aínda que todos os neurónios da rede tém o mesmp compri mente euclidiano (norma), como mostrado por wj = I para todo ¿ J (2.14) Quando os pesos sinápticos sáo escalados adecuadamente, formam um conjunto de velones que se encontram na mesma esfera unitária ^-dimensional. Na Fig. 2.5a, mostramos trés agmpamenlos (c/tu/ers) naturais dos padrees de estimulo representados por pontos. Esta figura incluí também um estado inicial possívcl da rede (representado porcruzes) que pode existir antes do aprendízado. A Figura 2.5b mostra um estado final típico da rede que resulta da utilizado de aprendizagem compe- titiva. Em particular, cada neurónio de saída descobriu um agrupamento de padrees de entrada movendo o seu vetor de peso sináptico para o centro de gravidade do agrupamento descoberio AGURA i. 5 inlerpratapfio geométrica do processo de aprondlzagam «wnpatitiwa. Os pontos representan) os valoras da anteada a as cruzas reprasanrtam os valoras de pesos sinápticos de irás neunflnios de saída. (a} Estado inicial da rede, (b) Estado ina da rede
86 RcnF^MeuKAih (Rumelhart e Zipser. 1985; Hcrtz ct al., 1991). Esta figura ilustra a habiiidade de uma rede neural de realizara larcfa de agrupamento (clusferíng) atreves de aprendizagem competí i iva. Entretanto, para realizar esta tunado de uma maneira "cstáver1, os padrees de entrada deveni se local izar cm agrúpa- menos suficientemente distintos. Caso contrario, a rede pode ser instável porque nao responderá mais a um determinado padreo de entrada com o mesmo neurónio de saida. 2.6 APRENDIZAGEM DE BOLTZMANN A regia de aprendizagem de Boltzmann, assim chamada em homenagem a Ludwig Boltzmann, c um algoritmo de aprendizagem estocástico derivado de idéias enraizadas na mecánica estatifica.1 Urna rede neural projetada com base na regra de aprendizagem de Boltzmann £ denominada uma máquina de Bollzmann (Ackley ct al., 1985; Huklon c SejDGWXki, 1986). Em urna máquina de Boltzmann, os neurónios constiruem uma eslrutura recórreme e operam de uma maneira binaria, uma vez que, por cxemplo, eles estao ou em um estado ’+ligado” represen- tado por +1, ou em um estado “desligado11 representado por -1. A máquina é caracterizada por uma tia envrgiti, £, cujo valor é determinado pelos estados particulares ocupados pelos neurónios individuáis da máquina, como mostrado por E= (21i) J * onde x c o estado do neurónio j c u1^ c o peso sináptico conectando o neurónio j ao ncurónio k. O tato de quej k significa apenas que nenhum dos neurónios da máquina lem auto-real Lmeniacáo. A máquina opera escolhendo um neurónio ao acaso - por ejemplo, o neurónio i - em um determina- do passo do processo de aprendizagem. trocando cntac o estado do ncurónio jfr do estado i para o estado -xA a uma temperatura f com probabilidade P(r*-*-x>) = l 1 + éxjH A¿4/n (2.16) onde AE. c a variado de energía (i c.T a varia^áo da l'uncao de energía da máquina) resultante (tapíela troca. Note que Tnao é uma temperatura física, mas apenas umapteudolemperalura, como explicado no Capitulo I. Se esta regra for aplicada repetidamente, a máquina atingirá o equilibrio térmica. Os neurónios de uma máquina de Boltzmann sedividem em dois grupos funcionáis: os vüí- vcjj e os ocultas. Os neurónios visíveis fomec^m uma mlerface entre a redee o ambiente cm que ela opera, enquanto que os neurónios ocultos sempre operam livremente. Há dois modos de operado a serem considerado^ * CüFff/ífÉÍo pesn. na qual os neurónios visíveis cstáo todos presos a estados específicos deter- minados pelo ambiente; • Ctmdi&iü de upav^ao íivreh na qual lodos os neurónios (visíveis c ocultos) podem operar I ivremente. Supcnha que représenle A corTela^aa cnlrc os estados dos neurónios j c i, com a rede na sua condiqáo presa. Suponha que ji, represente a correla^du entre os esladoi dos neurónios / c kt com a rede na sua eond¡0o de operaíáu livtft. Ambas as correla^dcs corrcspondem is médias sobre
ladea os estados possiveis da máquina, quando cía está cm equilibrio temí ¡ico. Entao, de acardo com a regra de aprendizagem de Boltzmann, a varia^áo áre.. aplicada ao peso sináptico do neurónio j para o neurónio k é definida por (Hinton e Sqnowski, 1986) Att^ = r|(p¿ j*k (2.17) onde Tj é o parámetro laxa de aprendizagem. Note que lanío como assumcm valores no intervalo entre - i c + I. Uma breve revisan da mecánica estatistica ó ¿presentada no Capitulo 11; naquele capitulo, apresentamos um [ratamente dctalhado da máquina de Boltzmann c de outras máquinas cstocáslleas. 2.7 O PROBLEMA DE ATRIBUIDO DE CRÉDITO Quando se estudam algoritmos de aprendizagem para sistemas distribuidos, c útil se considerar a Tio^aü de atribulado de crédito (Minsky, 1961). Basicamenie. o problema de atribuido de crédito é o problema de se atribuir crédito ou culpa por n$ullados globais a cada uma das dccisocs internas que tenham sido tomadas por urna máquina de aprendizagem e que lenham contribuido para aque- les resultadas. (O problema de atribuí cao de crédito c também denomi nado problema de caiga, i sto ó, o problema de “cairegar" um determinado conjunto de dados de ireinamento para dentro dos parámetros livres da rede.) Em mullos casos, a dependencia dos resultados cm rdafáo a dccisocs ¡memas ó mediada por uma seqüéncia de atjóes tomadas pela máquina de aprendizagem. Em outras pahvras, as deeisóes intemas afetam a escolha das afóes particulares que sao tomadas c, com isso, as aijócs c nao as dccisocs internas ínfluenciam diretamente as resultados globais. Mesías isituaftas, podemos dc- comporo problema de atribuido de crédito em tais suhproblemas (Sutton, 1984): 1. A airibülfSo de crédito par resultadas a a^nes. Este c o chamada problema de atribitífüa de crédito temporal que cnvolvc os instantes de lempo quando as a^óes que mereccm crédito (ornen realmente lomadas. 1. A atribuicac de crédito por a^ocs a dcc i socs i alemas. Este é o cha tnado problema de atributado de crédito estmturai que enval ve atribuir crédito ás wírufwras internas das aftas peradas pelo sistema. Q problema de atribuifáo de crédito eslrulural é relevante no contexto de uma máquina de aprendi- zagem com múltiplos componentes quando devemus determinar precisamente qual componente parí ¡cular do sistema deve ter seu comportamento alterado c cm que medida, de Forma a mcihorar o desempenho global do si ¿lerna. Pür ouiro lado, o problema de atribuido de crédito temporal é relevante quando há militas a^ocs lomadas por uma máquina de aprendizagem que acarretam certos resultados, e devernos determinar quais dessas afóes foram responsáveis petos resultados. Ü pro- blema combinado de atribuidlo de crédito temporal e cstrulural é enfrentado por qualquer máquina de aprendizagem distribuida que se estarce em mdhcirar seu desempenho em situafóes env oí vendo compertamento csiendido no tempo (Williams, 1988). O problema de atribuifáo de crédito surge, por exemplo, quando J aprendizagem por correfáo de erro c aplicada cm uma rede neural de múltiplas camadas alimentada adíame. A operado de cada neurónio oculta, bem como de cada neurónio de saida desia rede, c importarte para a coma operafáo global da rede, cm uma larda de aprendizagem de inlcressc. Ou seja, para resolver uma tarcFa predeterminada, a rede deve atnlmir certas formas de coinportatnenta a todos os seus neurónios.
88 R: 1'1 - Neufíaiü atreves da cspccitka^áo da aprendizagem por correoso de erro. Tcndoem mente esta fundamenU- fáo, considere a situando descrita nq Fig. 2rla. Como o neurónio de saída ké visível para o mundo externo, ¿possívcl to mecer uma rcspOSta desejada para este neurónio. No que diArespeitO ao neurónio de saída, pode-se ajustar di relamerte os pesos sinápticos desic neurónio de aconto com a aprendiza- gem por corrcpao de erro, como esbozado na Sc^áo 2.2. Mas como de vemos alHAiuir crédito ou culpa pela a$Bo dos neurónios ocultos quando o processo de aprendizagem por cerrero de erro é Utilizado para ajustar OS respectivos pesos sinápticos desses neurónios? A resposta para esta questao fundamental requer ateneo mais detalhada: ela é apresentada no Capítulo 4, onde sao descritos os dctalhcs algorítmicos do projeto de redes ncurais de múltiplas camadas alimentadas adianto. 2.8 APRENDIZAGEM COM UM PROFESSOR Volcamos agora a nossa atengan para os paradigmas de aprendizagem. Cometamos considerando a aprendizagem cum umpmfissor, que é também denominada aprtmdizügefn auperviaiontida. A Fi- gura 2.6 mo.stra um diagrama cm blocos que ilustra esta forma de aprendizagem. Em termos conceptuáis, podemos considerar o professor como tendo conhecimento sobre o ambiente, com este V<crir deset 11 CSlWkl Jíb Siral de enu Fl G U RA 2.6 □iiflramd sm Uocde da aprendizagem com um prüfegwr conhecimento sendo representado por um conjunto de Enlrclantib o ambiente ¿ rfejcwftex'Kfo pela rede neural de interesse. Suponha agora que o professor c a rede neural sejam empostas a um vetor de treinamento (Le., exemplo) retirado do ambiente. Em virtudc de scu conbec¡mentó prévio, o professor c capaz de fomcccr á rede neural uma resposta desejada para aquele vetar de treinamento. Na verdade, a resposta desejada representa a a^So ¿tima a ser realizada pela rede neural. Os parámetros da rede sfto ajustados nob a Influencia combinada do vetor de treinamento e do sinal de erro, ü vfno/ de erro é definido tremo a di lerenda entre a nesposta desejada e a rcspcsla real da rede. Este ajuste c realizado passo a passo, iterativamente, com o objetivo de fazer a rede neural emular o professor; supóe-se que a emulafSo seja ótima em um sentido estatístkc. Desta formaT o conhecimento do ambiente disponive! ao professor c transferido para a rede neural atravcs de treinamento, da forma mais completa possívcl. Quando esta condifüo é alcanzada, podemos cntáo dispensar o professor c dcixar a rede neural lidar com o ambiente intciramcntc por si mesma.
A forma de aprendizagem supera asionada que acabamos de dcscrcvcr c a aprendizagem por ccrre^áo de erro discutida na &ef3o 2.2. Ela é um sistema realimentada de laqo fechado, mas o ambiente desconhecido nao está no la^o. Como uma medida de desempenho para o sistema, pode- mos pensar em termos do erro médio quadrado ou da soma de erras quadrados sobre a amostra de treinamento, definida como uma fún^ao dos parámetros livres do sistema. Esta fundió pode ser visualizada como uma superficie muitidimensiona! de desempenho de erro, ou simplesmente uma superficie de em, com os parámetros íivres como coordenadas. A verdadeira superficie de erro ó obtida pela media sobre todos os exemplos possíveis de entrada-saída. Qualquer operado do aísle- ma sob supervisé do professor é representada como um ponto sobre a superficie de erro. Para que o si'ítema melhorc o sen desempenho ao longo do lempo e portanto aprenda com o professor, o ponto de opcraifáo deve ser movido para babeo sucesivamente cm direjáo a um ponto mínimo da superficie de erro; o ponto mínimo pode ser um mínimo local ou um mínimo global. Um sistema de aprendizagem supervisionada é capa?, de fazer isto com a informado útil que ele tem sobre o gradiente da superficie de erro, correspondente ao comportamcnlo corrcntc do sistema. O gradiente de uma superficie de erro em qualquer ponto é um vetor que aponía na direpáo da descida mais ingreme. Na vendade, no caso da aprendizagem supervisionada por exemplos, o sistema pode usar a estimativa instantánea do vetar gradiente, supondo que os índices dos exemplos sejam os mesrnas dos instantes de tempo. O uso de tal estimativa resulta em um mavímenlo do ponto de opera^áo sobre a superficie de erro que se dá típicamente na forma de uma "cam inhada aleatoria'*. Apesar disso, dados um algoritmo pro.¡ciado para minimizar a fuñado de custo, um conjunto adequado de exemplos de entrada-saida e tempo suficiente para realizar o treinamento, um sistema de aprendiza- gem supervisionada c normalmente capaz de realizar tarefas como clas&tficafao de padrees e apro- ximado de fun(oes. 2.9 APRENDIZAGEM SEM UM PROFESSOR Na aprendizagem supervisionada, o processo de aprendizagem acontece sob a tutela de um profes- sor. Entretanto, no paradigma conhccido como aprendizagem sem um professor, como o nome implica, nao há um professor para supervisionar o processo de aprendizagem. Isto significa que n£o há exemplos rotuladas da fun^áo a ser aprendida pela rede. Neste segundo paradigma, sao identificadas duas subdivisocs: 1, Aprendizagem por refor^o/ProgramaQáo neurodlnámica Na aprendizagem por reforjo * o aprendizado de um mapcamenio de cntrada-saida c realizado através da mtera^áo continua com o ambiento, \ isando a mi tuto i zar um indico escalar de desempe- nho. A Figura 2.7 apresenta o diagrama em hlocos de uma forma de sistema de aprendizagem por reforjo construido em lomo de um critico que comerte um sinal de vejarlo primario rccebido do ambiente em um sinal de refoofo de mcihor qualidade, denominado j/no/ de reforjo heurístico, sendo ambos entradas escalares (Baño et al.. 1983}. O sistema é projeiado para aprender por refonco atrasado, o que signi líica que o sistema observa uma scqücncia temporal de estímulos (i.e., vetores de estado) tambem rcccbidos do ambiente, que eventualmenle resultam na geranio do sinal de reforjo heurístico. O objetivo da aprendizagem é minimizar urna fitn^áo de custo para avanzar, definida como a expectativa do custo cumuladvo de a^oes tomadas ao longo de uma seqüéncia de passos, em vez simplesmente do custo i medíalo. Pode acontecer que certas aqoes tomadas anterior-
FIGURA s.7 Diagrama «m Wkcs da aprendizagem púr retaría Trente naqucla scqücncia de pasaos de tempo sejani de falo os mclhorcs determinante!; do compor- tomento global do sistema. A fungSo da matutina de uprvndizqgem, que constituí o Segundo compo- nente do sistema, é descobrir estas a^oes e real intenta- Las para o ambiente. A aprendizagem por referió atrasado c dilícil de ser realizada por duas razocs. básicas: • Nao existe um professor para femecer uma resposto desejada em cada passo do processo de aprendí zagem. • Ü atraso incorrido na geranio do sinal de reforjo primário implica que a maquina de aprendí- zagem deve resolver um pmblemu de utrihui^üa de crédito temporal. Com isso, queremos dizer que a máquina de aprendizagem deve ser capaz de atribuir crédito ou culpa individual- mente a cada aijáo na soqüemoa de passos de lempo que Levam ao resultado final, enquanto que o reforjo primário é capaz apenas de avallare resultado. Apesar dcstas dificuidados, a aprendizagem por reforjo atrasado e muito atraente. Fia fornece a base para O sistema inleragir com o seu ambiente, desenvolvendo com ¡SSO a hábil idade de aprender a realizar uma torcía predeterminada Cüm base apenas nos resultados de sua experiencia, que rcsul- tam da interacáo. A aprendizagem por nsfor^u está intimamente relacionada com aprogramada dinámica, que foi desenvolvida por Bel Imán (1957) no contexto da icoria de controle óiimo. A programado diná- mica fomccco formalismo matemático para a tomada de decisáoseqDcncial. Enquadrando a apren- dizagem por refago dentro da abordagem da programado dinámica, o assunto se torna bastante ríce, como demonstrado em Bertsekas e 1 sitsilílis (1996), Um tratamunto introdutério sobre pro- grama^áo dinámica e sua relajo coma aprendizagem por reforjo é apresentado no Capítulo 12. 2. Aprendizagem náo-supervisionada Na aprendizagem nao-supe tcisionada ou íiitlíi-argünízadSt nád llá um professor extemo ou um crítico para supervisionar o processo de aprendizado, como indicado na Fig. 2.8. Em vez disso, sao dadas condifSes para realizar uma medida independente da tarefa da qualidade da representado que a rcdc deve aprender, e os parámetros livrc da rede sao otimizados em relajo a esta medida. L'ma vez que a rede tenha se ;i justado ás regularidades cstaLÍsticas dos dados de entrada, ela desen- volve ;i habilidad^ de formar representares intemas para codificar as características da entrada e, desse modo, de criar automáticamente DOVU elasses (Bccker, 1991).
rgrCEJKB M ApHUNDIZaGEM 91 vetar dése ns venda a estado do FIGU H A 2. B Diagrama fim biOCos da aprendizagem rtaQ-eupervisipnMia Para realizarmosaaprendizagem. nao-supervisionada, podemos utilizara regra de aprendiza- gem compelí ti va. Pedemos utilizar, por exemplo, urna rede neural de ditas camadas - uma camada de entrada e uma camada competitiva. A camada de entrada recebe os dados dispon (veis. A camada competitiva consiste de neurónios que compclcm entre si (de aconta com uma regra de aprendíza- gem) pela “oportunidade’1 de responder ás características comidas nos dados de entrada. Na sua forma mais simples, a rede opera de acardo com uma estrategia do tipo "o vencedor leva tudo"1. Como descrito na Se^áo 2.5, nesla estrategia o ncurór.m cpm a maior entrada total "ganha" a com- petido etc coma ligado; lodos os o ul ros neurAníos, eniáo, se tornara desligados. Nos Capítulos de 8 a 1 L sao descritos diferentes algoritmos para aprendizagem nao-supervisio- nadL 2.10 TAREFAS DE APRENDIZAGEM Ñas socóos anteriores dcstc capitulo, discutimos di 1 érenles algoritmos de aprend' zagem e paradigmas de aprendizagem. Ñusca sefáo, descrecemos al gamas tardas básicas de aprendizagem. A eswllia de um algoritmo de aprendizagem particular é influenciada pela tarefa de aprendizagem que uma rede neural deve cxccutar. Ncstc contexto, identificamos seis tárelas de aprendizagem que se apli- cara ao uso de redes neurais de uma forma ou de outra. Associaqáo de Padrees L'ma memoria avíoeiativu é urna memón;ndistribuida inspirada no cerebro, que aprende por r/x»- Desde Aristóteles, sabe-se que a associacáo c uma característica preeminente da memoria humana, e todos os modelos de enguiño ulilfram usocMffo de uma forma ou de outra como a operarán básica {A nderson, 1995). A associap^ü assume luna de duíis formas: ¿níta-m.* atracó oí* heterww¡&eís$So. Na auto- associapao, uma rede neural deve armuztmar um con i unto de padrees (vetares), que sao aprésenla - dos repetidamente á rede. Subsequenlemente. apiesenta-se a rede urna describan parcial ou distorcida (ruidosa) de um padrao original armazenade c a laretá é recuperar {recordar} aquclc padrao partí Guiar. A heleroasttacia^iío difenda auto-a^ocia^Aorelo fatn de um conjunto arbitrario de padróe^ de entrada ser as sodado a um oulru conjunto arbilrdriü de padrees de salda. A auto-assoeiaQao envol veo uso de aprendizagem náa-supcR-ísionada, enquanto que. na hctcroassociacao, a aprendi- zagem é supervisionada. Considere que i, represente umpa<hao-chave (vetar) aplicado a uma memoria associaliva e J represente um padrao memorízado{vtíXiT}. A assoeiacao de padrees realizada pela rede c descrita por i. k = 1.2..... (2.18)
onde 7 é o número de padrees armazenades na rede. O padreo-chave x, age como um estímulo que nio apenas determina a local iza?ao de irmazcoaíoeoto do padreo memorizado y., mas lambem c a chave para sua recupcracao. Em uma memoria auto-<issocia(iva. y = \, c assim os esparcís (de dados! de entrada e de saida da rede tem a mesma dimensionalidade. Em urna memoria hetereassoeiativap yÁ * xA¡. perianto, a diniensiüiialidadc do espado desdida oeste segundo caso pode ou nao ser igual a dimensional i dade do espado de entrada. H;i duas Pases envolvidas naoperagáo de uma memoria associaliva: • A jase de armazenameniot que se refere ao treinainento da rede de acordo com a Eq. (248). • A fase de recarda^cln. que cnvolve a recupera?aci de urn padreo memorizado cm desposta á aprcscntaqáo á rede de uma verseo ruidosa ou distorcida de um padráo-chavc. Suponha que o estimulo (entrada) x represente uma versáo ruidosa ou distorcida de um padrao- chave i. Este estimule produz uma resposta (salda) y, como indicado na Fig. 2,9. Para a recordado perlería, nos devenamos obter y = yr onde vio padrSo memorizado íissociado ao padráo-chave 1. Quando y y|V para * - a . diz-se que a meniória assnciativa fez um errar de recordado. Vl'Inr a kTlIrjlliii X xj Amciadar de padrees Veior de salda FIGURA 2.9 A raíalo d& entrada- sa ida de um aswciadar de padreas [ O número q de padrees armazenades em uma memoria asociativa forncee uma medida di reía da capncítíide de armace na mentó da rede. No prtijeCo de UiTia memótia usctiuti^a, o desafio é tomar a capacidade de armazenamento g (exprcssa como uma pareen tagcin do número total Ardc neurónios utilizados para construir a rede) cao grande quanto pcssivel e aínda assim conseguir que urna grande fiaban dos padrees memorizados sejam recordados conctamcntc. R&conhecimenlo de Padrees Os seres humanos sio bons no rcconhccimentó de padrees. Recebemos dados do mundo á nossa volts através dos nossos sentidos e somos capazes de reconhecer a fonte dos dados. Freqúentcmente, somos capazes de tazar isso quasc que ¡medíala montee pralicamente sem esfoc^o, Podemos, por exemplu, reconhecer um rosco familiar de uma pessoa muito embota esta pessoa Icnha cnvclhocido desde a nosso último encontró. identificar uma pessaa familiar pela sua voz ao telefone, apesar de uma conexao ruim, e distinguir um ovo férvido que é bom de um ruim pelo seu chciro. Os humanos rcalizamo retanheu¡meneo depadrues alravés de um processo de aprendizagem; c assini acontece com ss redes neurais. O rvconhccimenfo de padrne.t é formalmente definido como Gprocessopeto tfual wmpodran/ sinal recebúto é ítíribuido a uma dasse denire um número predeterminado de ctasses (catenariasf Uma rede neural realiza o recoidieclmenlci de padrucs passundo inicial mente por uma secan de treinamcnio, durante a qual se aprésenla repetidamente á rede um conjunto de padnDes de entrada Junto com a ¿alegoría á qual cada padreo particular pencncc. Mais tarde, apresenta-se á rede um novo padreo que nao foi visto antes, mas que perience á mesma populado de padrees utilizada para trclnar a rede. A rede ¿ capaz de identificar a classe daquele padrao particular por causa da informa- Q3O que ola cxlreiu dos dados de treinamenta. O recrnihecimencu de padrees realizado par uma rede neural é de naturezn eslatística, com os padrucs sendo representados par pontos cm um espado de
PtonrBnane tw Appfk iw.ru 93 í/htísuo niullidmiensionaL O espayo de dccisáo é dividido em regióos, cada Lima das quais asocia- da a uma classc. As fronte i ras de dccisao sao determinadas pelo processo de ireinamento. A cons- truyan dessas fnmtciras é lomada estatísliua pela vari ah i 1 ¡dade inórente que existe dentro das clas- ses e entre as dasses. Em termos genéricos, as máquinas de reeonhcciniento de padrúes que utilizan) redes neurais podem assumir uma das duas formas seguimos: • A máquina é dividida em duas partes,.uma rede iián-supervisinnada para extraídodecaraca- riaticéis e uma rede supervisionáda para (Vaw/farttió, como mostrado na l'ig. 2.10a. Este método segué a ábordagcm tradicional de recunhccimunlo estatfelico de padrdes (Duda e Haci, FIGURA 2.10 lluSln^So da abondagem cl¿5$k» para ctessificapáo da pútirifes ih] ] 973; Fukunaga, 1990). Em tcmros concciluais, um padráo é representado por um conjunlo de irj observa veis, que pode ser v isto como um ponto x de um espada de observa^ aa {de dadas) "¡-dimensional, A extraen de características é descrita por uma transformado que nupeia o ponto x para um ponió intermediario y cm um espado de características ^-dimensional, com y < ni. como indicado na Fig. 2.1 Oh. Fsta transformado pode ser vi si a como uma red uy So de d¡metí!iion¿ilidade ( ..e., cnrppreMSO de dados), CUja utilizayáo é justificada por cía simplificar a larela de classifica^áo. A própria classificapfo é descrila como uma transforniaySo quema peí a o pomo intermediario y para uma das elasses cm um espayo de dccisáo x'-dimensional, onde r é o número de clMBCS a ser distinguidas. * A máquina é projetada como uma única rede de múlunlds camadas alimentada adi ante, utili- zando um algoritmo de aprendizagem supervisiúiiada. Ncata segunda abordagem. a tarefa de extrayáo de características c realizada pelas uu ¡dades computaciones da(s) camada(s) oculta(s) da rede. A escüllia de qual dcstas duas abordagens deve ser adotada na pratiea depende da aplicayáo de uitcresüc.
Aproximado de Fun^oes A terecina tarefa de aprendizagem de ínteresK é a aproxímalo de fiuidSw- Considere um mapeamento de entrada-saida n&o-l mear descrito pela rtlaqáo funcional (2.19) onde o vetor x é a entrada c o vetor dea saida. Supdose que a fun0o de valer vetorial f{-} sega desennhccida. Para compensar a falta de conhecimento sobre a fun?ao lí L é fomcuido um conjunto de excmplos rotulados: ={(*.<>.)}' (2»>) ü objetivo é projetar uma rede neural que aproxime a funcao deseonhccidd f( ) de forma que a funpáo F( ) que dcscrcve o mapeamcnlo tic entrada-saida realmente realizado pela rede esteja sufi- cientemente próxima a t'l-1. em um sentido euclidiano, sobre todas as entradas, como mostrado por | F(x) - f(x) | < t para todo x (2.21) onde E é um número positivo pequeño. Conlanto que o lamanho .Vdo conjunto de ircinamcnto seja sulkicntomcnto grande eque a rede estoja equipada com um número adequado de parámetros 1i- vres, entáo pode-se fazer o erro aprox-.mativoc suficientemente pequeño para a tarefa. O problema de aproximado descrito aquí é um candidato per l'cito para a aprendizagem super- visionada, com x desempenhande u papel do vetar de entrada e d desempenhando o papel da resposta desejada. Pedemos cntSo invertir esta questáoe vera aprendizaje un supervisionada como um problema de aproximado, A habí li dad e de urna rede neural de aproximar um mapeamento de entrada-saida desconhecí- do poete ser explorada de duas formas importantes: * kteniificatflQ jírtoW- Suponha que a cq. (2.19) descreía a relajan de entrada-sai da de um sistema de m¡tipias entradas—múltiplas saldas (MíMQt mitiiiple iirpifi-muitipie ontpui} sem memoria, desconhccido; emendemos por sistema "sem memoria11 um sistema que sega invariante no tempo. Podemos cntáo ulili¿ar o conjunto doexemplos rotulados da Eq. (2.20) para tremar uma rede neural como um modelo do sistema. Suponha que y represente a saida da rede neural producida cm cesposla a um vetor de trnl rada jt. A di lerenda entre d. (associado com x 1 e a saida da rede y fomecc o vetorde sinal de erro e . como representado na f íg. 2.11, Este sinal de erro, por sua vez, é usado para ajustaros parámetros livras da rede de loma a minimizar a diferenfaquadrar.ca entre as suidas do sistema deseenliecido e a rede neural cm um sentido csiatísiicü, c é calculado sobre o conjunto de t reina mente inteiro. * 57.sfúnia /fhítod. Suponha a seguir que nos seja fomccido um sistema MIMO cotillee i do, sem inemónn, cuja relajan de entrada-saida ¿ descrita pela Eq. (2.19). O cbjistivo oeste caso c construir um ¿frtaina rnvíFyo que produza o vetor x em resposta ao vetor d. O sistema inverso pode, assim, ser descrito por x = f'(dl (2.22)
FIGURA 2.11 Diagrama em btocos da ¡JHiiitifKá^áo da sislama ande a fijnflo de valor vctonal f ’() representa a inversa de f( X Note, entretanto» que fl(} nao é a reciproca de f(’); cm vez disso, o uso do indico -I é meramente para indicar uma lUvúrsáo. Em nmitu situares encontradas na priiica, a funfilo de valor veto ría [ f() ¿ por demais complexa para que se possa formular di netamente a fun0o inversa f '(). Dado o con- junto de exemplos rotulados da Eq. (2.2G)„ podemos construir uma aproxima^ao por rede neural de r'(<), utilizando o esquema mostrado na Fig. 2.12. Na situando aquí descrita, os papéis de x, e d fbram trocados: o vetar d é uri liizado como a entrada c x c tratado como a reaposta desdada. SupOnha que o vetar de sinal de cito c represente a di 1'erenfa entre X? e a saída real yr da rede neural, producida em resposta a d.. Como no problema de identifícagao de sistemas, este vetor de sinal de erro c utilizada para ajustar os parámetros Ih res da rede neural» de modo a minimizara diferenca quadrática cutre as saldas do sistema inverso desconhecido e da rede neural em um sentido estalíslico. e é calculado sobre o conjunto de treinamento com- pleto. Erro *r FIGURA 3.12 Diagrama em Mocos da modalagam do sistemas inversas Controle O controle de uma planta é uma cutra tarefa de aprendizagem que pode ser feita por uma rede neural; aquí, “planta" significa um processo ou uma parte crítica de um sistema que deve ser man- tido cm uma CfiffldífSo controlada. A relevancia da aprendizagem para o controle nao deveri a ser surpreendente porque, afinaI, o cerebro humano é um computador (i.e., um processador de informa- fao), quct visto como um sistema» preduz saldas que sao opoes. No contexto de controle, o cerebro
¿ a pro va viva de que é possívcl construir um controlador genérico que lira total vantagem da ¡inplementa^ao física paralelamente distribuida, que pode controlar rauitos mi Ih ares de atuadores (fibras musculares) em paralelo, que pode tratar náo-linearidades e ruido e que pode realizar otimizayáo sobre um horizonte de pl aneja mentó muito ampio (Werbos. 1992). Considere o júre/Mí? de controle ivaiimentado da Fig. 2.13, Q sistema envolve o uso de reali- mcntai^ao unitaria cm tomo de uma planta a ser controlada; isto é. a saída da planta ó realimentada di netamente para a entrada? Com isso. a saída da planta y é subtraída de um xínuí de referencia d tornee ido por uma fontc ostenta. O sinal de erro o assim produzido c aplicado a um ctmfmiador neural com o propósito de ajustar os seus parámetros livres. O objetivo principal do controlador é fomecer entradas apropnadas para a planta, fazendo com que a sua saída y siga o sinal de referencia d. Em outras palavras, o controlador deve inverter o comportamento de cntrada-saída da planta. Notamos que na Fig. 2.13 o sinal de erro e dcve-sc propagar atraves do controle neural antes de alcanzar a planta. Conseqüeruemente, para realizar ajustes nos parámetros livres da planta de acordo com um algoritmo de aprendizagem por correcto de erros. precisamos conhecer a matriz jacobiana díí L ' Sinal Efflnifa Rü;iIi iii<r,nljiip\H-i unLl-iiniJ FIGURA 2.13 Diagrama em blocos de um sistema Jo controle realimentado ondej^ ¿ um elemento da saída da planta ycu.c um el emento da entrada da planta u. Infelizmente, as derivadas parciais ytf u para varios ley dependen; do pomo de operacáo da planta e, púnanlo, nao sao conliecidas. Podemos adotar urna de duas abordagens para tratar este problema: • idpreMrfzqgejh iik/irtfa. Utilizando medidas de cntrada-saída rcais da planta, é construido ini- cial ni ente wn modelo bascado cm rede neural para producir uma copia da plañía. Por sua vez, este modele c utilizado para fomecer uma estimativa da matriz jacobiana J. As derivadas parejais que consütucm esta matriz jacobiana sao utilizadas subsecuentemente no algoritmo de aprendizagem por corrugo de erro para calcular os ajustes dos parámetros livres do controlador neural (Nguyen c Widruw, 1989; Suykcns ctaL, 1996; Widrow e Walach, 1996)+ • rftreta. Os sin ais das derivadas parciais sao feralmente conhecidos e normalmente se mantcm constantes ao longo do intervalo dinámico da plañía. Islo sugere que podemos aproximar estas derivadas parciais pelos seus Bináis individuáis. Os seus valores absolutos recebem uma representatíto distribuida nos parámetros livres do controlador neural (Sacrens e Soquet, 1991; Schiffman e Geffers, 1993). Com isso, o controlador neural se torna capacitado a aprender os ajustes de seus parámetros livres diretamente da planta.
Phocukcs dk Ame97 Fittragem O termo filtro se refere frequenteraente a um dispositivo ou algoritmo utilizado para extrair infcr- Tna^ao sobre uma determinada grandeza de inieresse a partir de um conjunto de dados ruidosos. O ruido pode surgir de uma varicdadcdc fontcs. Os dados podem tersido medidos pormeiode sensores ruidosos, por exemplo, ou podem representar um sinal portador de informado que foi corrompido pela transmissao através de um canal de comunicaban. Como outro exemplo, poderse ter uma com- ponente de sinal útil, corrompida por um sinal de interferencia captado do meio ambiente. Podemos utilizar um filtro para realzar trés tárelas básicas de processamenlo de informado: 1. Fiitragcm. Esta tarefa se refere á extrafáo de informacao sobre uma quantidadc de interesse no tempo discreto a, utilizando dados medidos até o tempo w, inclusive. 2. Esta segunda tarefa difere da filtragem pelo fato de que nao c ncccssário que a infórmalo sobre a grandeza de interesse es teja disponivcl no tempo n c de que os dados medi- dos após o lempo « podem ser usados para obter esta informarse, Isto significa que, na suavizado, há um atraso na predu^ao do resultado de interese. Ja que no processo de suavizapáo podemos usar dados obtidos nao apenas até □ tempo n mas também após o tempo w, podemos esperar que a suavizado seja mais precisa que a filtragem em um sentido estatistieo. PrwLitio. Esta tareiacorresponde ao lado predítivo do processamento de informando. O objetivo aquí ¿ derivar informa^ao sobre como sera a grandeza de interesse cm um determinado tempo n + no futuro, para alguna > 0T utilizando os dados medidos até o tempo n inclusive, Um problema de filtragetn com o qual os seres humanos estilo familiarizados é o prvblama da festa ¿te coqueieL10 Temos uma hábilidade nolável para nos concentramos em um locutor dentro de um ambiente ruidoso de uma festa de coquetel, apesar de o sinal de voz originario daquele locutor estar envolvido por um fundo extremamente ruidoso devído á inierferéncia de outras conversas na sala. Presume-se que alguma forma de análise pré-atentiva, pné-conscienfe deve estar envolvida na reso- luto do problema da festa de coquetel (Vblmans, 1995). No contexto das redes neurais (artificiáis), um problema similar de íiltragem ocorre na chamada vejicnufai) de sinal (Comon, 1994; Bel[ c Sejnowski. 1995; Aman c al. 1996). Para formular o problema da separado ccga de sinal, consi- dere um conjunto de sinais de fonte desconhecidos Que 5*° mutuamente independentes entre si. Estes sinrus sao misturados linearmente por um sensor desconhecido para produzir o vetor de observado m-por-1 (veja a Fig. 2,14) x(/i) = A ii(rj) (2.24) onde u(fl) = !«,(«), ura(n)]r (2 25) jt(«) fr, («T X- J (2.26} Ui(n) o MiFlunufor Icwonhw .! I SqwiwJcir o V|(n) AGURA 2.14 Diagrama $rn blucos da separaQfio cegs de fonle ArtlhiciLie dreconhccidio
9S REOS NEukais c A é tuna matriz demistura náo-s inguiar, desconhecida, de dimcnsocs m-por-m. Dado o vetor do observado i(n), o objetivo é recuperar os sinais origináis íj,(n),..., wjn) de uma maneira nao- supera isii.inada. Voltando-se agora ao problema da previsto, o objetivo é prever o valor presente x(m) de um processo. dados valores passados dexte processo, que sao uniformemente espadados no tempo 1 como mostrado porj(n — 7}t.vir¡ — 27),,.., xf« — m7), onde 7'éo periodo deamostragememe aordem da previsto. A previsto pode ser resolví da utilizando-se aprendizagem por corracao de cno de uma mane ira nao-super\ isionada, já que os exemplos de Ir enlámenlo sSo reí ¡mitos d ¡relamen te do pró- prio processo. como representado na Fig. 2.I5. onde x(w) ama como resposta desejada. Suponha que X («) represente a previsác de um passo produzkla pela rede neural no tempo n. O sinal de erro ú(n) c definido como a diferente entre x(n) e ¡¡ (jiX que é usada para ajustar OS parámetros 1 ¡VTM da rede neural. Com isso, a previsáo pode ser vista como uma forma de consfrufdo de modelo, signi- ficando que quanio menor ícr o erro de previsáo em um sentido eslatistico, meihor será o desempe- rno da rede como um modelo do processo físico básico que c responsável pela geracao dos dados. Quando este processo é nün-íinear, O USO de urna rede neural fomece um método poderoso para resolver o problema de previsáo, dev.do as unidades de procos sámente nao-linearas que podem ser usadas nesta construyo. Entretanto, a única excedió possível para o uso de unidades de processamento nao-linearas c a uriidadc de salda da rede; se o intervalo dinámico da serie temporal {x(n)} for deseenhecido. a utilízalo de uma unidade de salda linear c a cscolha mais razoável. FIGURA 2-15 Diagrama em blocos da p<w¡5áe rutodinear Formado de feixe A formado de fcixc c urna forma de filtragem espacial c c utilizada para distinguir entre as propriedades espaciáis de um sinabalvo e o ruido de fundo, O dispositivo usado para realizar a formaban de fcixc c chamado deformador de feixe. A larefa de formaíáo de feixe é compal ivel com o uso de uma rede neural, para o que temos indi calóes i importantes de estados da ps ico -acústica das rcsposlas auditivas humanas (Bregman, 1990) e de estados do mapeamenlo de características ñas camadas cortical dos sistemas auditivos de mercegos ccolocalizadorcs (Suga, 1990a; Si inmons e Sailant, 1992)i O moncego eco localizador irradia o meio ambiente transanIlindo sinais de freqiiÉncia modulada (FM) de curta durare e entáo utiliza o seu BÍatona auditivo (¡neluindo um par de oral has) para focar a atencáo na sua presa (p.ex., um inseto voador). As oral has fomcccm ao morccgo uma forma de filtragem espacial (interferometria, para sermos exatos). que c cntáo explorada pelo sistema auditivo para produzir untaaelcrMade por atenido. A formaban do fei ve é normal mente utilizada cm sistemas de radar e sonar nos quais a tarefa principal é detectar e perseguir um alvo de interesse na presenta combinada de ruido do receptor c sinal de interferencia (p.ex., ohstrulores). Esta larda c complicada por dois falore^.
• O sinal-alvo se origina em urna dire^áo dcsccmhccida. * Náo há mformapáo apríorí disponível sobre os sinais de interferencia. Uma forma de lidar com situafóes deste tipo é utilizando um canceladbr de lóbulo lateralgenera- lizado (CLLG), cujo diagrama em blocos está mostrado na Fig. 2.16. O sistema consiste dos se- guintes componentes (Griffiths c Jim, I9S2; Van Vccn, 1992; Haykint 1996); FIGURA J.16 □¡agrume em Mecos do can«lador de lóbulo lateral generalizado • Um arranjo de elementos de antenas, que fomece um meio de amostrar o sinal observado em pontos discretos do espado. • Um combinador linear definido por um conjunto de pesos fixes Cuja saída c uma resposia desejada. Este combinador linear age como um “filtro espacial”, sendo caracterizado por um padrio de radiado (i.e., um gráfico polar da ampliiude da saída da antena em fün^áo do ángulo de incidencia de um sinal incidente). O lóbulo principal deste padreo de radia^áo está aportado ao longo de uma directo predeterminada, para a qual o CLLG deve ser restríto para produzir uma respnsta sem distendeos. A saída do combinador linear, representada por d(n)t fomece uma resposta desojada para o formador de fcixc. • Uma matriz btoqueadora de sinal C . cuj a fun^áo c cancelar a i nterferénc ia que escapa atreves dos lóbulos laten» do padreo de radiado do filtro espacial que representa o combinador linear. • Urna raefe neuralcom parámetros ajusláveis, que é projetada para acomodar variares esiatis- ticas nos sinais de interferencia. Os ajustes dos parámetros livres da rede neural sao realizados por um algoritmo de aprendizagem por coire^áo de erro que opera sobre o smal de erro ¿(ji), definido como a diferen^a entre a saída do combinador linear d(n) e a saída real j(n) da rede neural. Assim, o CLLG opera sob a supervisáo do combinador linear que assume o papel de um “professorComo na aprendizagem supervisionada usual, note que ú combinador linear está fóra do lapo de reakmenta^áo que age sobre a rede neural. Um formador de feíxe que uti liza uma rede neural para a aprendizagem ó chamado de formador de
100 RfiDfiS NftJHAIh J&íxe? tieuml- Esta elasse de máquinas de aprendizagem se enquadra sob o título gcral de ncw&campniadorex atencionaií (Hecht-Níelsen, 1990). A divcrskladc das seis tarefas de aprendizagem discutidas aquí serve de tcstcmunho para a universalidade das redes neurais como sistemas de processamento de informasáo. Em um sentido fundamental, todas estas tarólas de aprendizagem sao problemas relativos a aprender um mapeametita a partir de cxcmpkis (possivelmente ruidosos) de mapeamenlcs, Sem a imposiQáo de conhecimento previo, cada uma destas tarefas c na verdade mal-formalada, no sentido da náo-unic idade das pos- siveis soIuqocs de mapeamento. Um método de tomar a sülu^áo bcm-formulada é utilizara teoría da regularizado, pomo descrito no Capitulo 5. 2.11 MEMÓRIA A discussüo de tarefas de aprendizagem. particularmente a tarefa de associa£áo de padrees .nos. leva naturalmente a refletir sobre a memoria. Em um contexto ncurobiológico, memoria se refere as altcracóes neurais relativamente duradouras inducidas pela luterano de um organismo com o seu ambiente (Teyler, 1986). Sem esta alteraban nao pode haver memoria. Além disso, para que a me- moria seja útil, ela deve ser acessívcl ao sistema nervoso para poder influenciar o com porta menta futuro. Entretanto, um padrao de aliv idade deve ser inicialmcnte armazenado na memoria através de um procesan de aprefidizagL'm. Memoria e aprendizagem estilo conectadas de forma intrincada. Quando um padrao de al i v idade particular é aprendido, ele é armazenado no cerebro, de onde pode ser recuperado maia tarde, quando exigido. A memoria se divide cm memoria de "curio prazo** e de "longo prazo”, dependendo do tempo de retengo (Arbih, 19R9). Memoria de curía pruno se refere a uma compilado de conhecimento que representa o estado "corrente” do ambiente. Quaisquer discrepancias entre o conhecimento armazenado na memoria de curto prazo e um "novo” estado sio usadas para alúaIizar ir memoria de curto prazo. Memoria da tongo pnX20f por outro lado, K refere ao conhecimento armazenado por um longo período ou permanentemente. Nestíi se0ü. estudamos uma memoria associativa que oferece as seguí ntes características: • A memoria é distribuida. * Tanto os padrees de estímulo (chave) como os padrees de rcsposla (armazenados) de uma memoria assoclativa cansiatem de vetares de dados. * A informaban ó armazenada na memoria cstabcleccndo-sc um padrao espacial de atividades neurais atmvés de um grande número de neunOnios. * A informacáo cuntida em um estímulo nao apenas determina o seu local de armazenamento mas tamhcm o enderezo para a sua rceuperacáo. * Embora os neurónios n«io representen! célula^ compuiaciunais eonfiúveis e de bu.ixo ruido, a memoria exibe um alta greu de resistencia a ruido c a falhas, de uma forma difusa. • Pode haver intcra^ocs entre padrees individuáis armazenados. na memona. (De outra forma, a memoria Ócveria ser excepcional mente grande para acomodar o armazenamento de um gran- de número de padrñes em perfeito isolamenta entre SÍ.) Existe, portanto, a possibilidade de a memoria comecer errw durante o pruccsso de recordando, Em urna di.tlríbuída. a questúo básica de intcressc sfio as ativ idades simultáneas ou quase simultáneas de mui tos neurónios diferentes, que sao o resultado de estímulos externos ou internos. As atividades neurais formam um padreo espacial dentro da memoria que contém ínformafúo sobre os eslímulos. Diz-se, portanto, que a memória realiza um mapeamente distribuido que transforma
um padreo de atividade no espado de entrada em um outrü padrño de atividade no espado de salda. Podemos ilustrar algumas propriedades importantes do um mapeamento do memoria distribuida considerando uma rede neural idealizada que consiste de duas cantadas de neurónios. A Figura 2.17a ilustra uma rede que podo .ser vista como um LftmptMenit! rntufela de um tíaiemu MiMan (Coopcrt 1973; Scoíield e C o oper. 1985). Cada neurónio da camada de entrada está conectado a todos os neurónios da camada de Mída. Asconcxóes sin&pticu reais entre os neurónios sSo comple- xas e redundantes. No modelo da Fig. 2.1 7a. uma única jun^áo ideal c utilizada para representar o cfcito integrado de todos os contatos sinópticos entre os dendrilos de um neurónio da camada do entrada e os ramos do axónio de um neurónio da camada de salda. O nivel de atividade de um neurónio da camada de entrada pode afolar o nivel de ath idade de todos os ottlros neurónios da camada de salda. Ciimiidn 4tcni rodil Junpflcs Canuda de salda dcncuidnÍDS EÍnápticis de n«jj¿ni-DE (□| Ccxinpimünl^ inchdtsk' da rnerTiArui -¡ixxiil-ilsI iv;l ik um stslemn ncrra» { 'unudd. du Lnlrad:i íLl ik'kí du ÍliciElt Cíirn:i4ldeHÍ(h de ntiiTÍciiúfl FIGURA 217 Modelos de mamória associaliva (b) Múdelo de nicíinirii acocili i w uLil izando hL-UTLihlrikC rftflffaül A situa^áo correspondente para uma rede neural artificial está representada na Fig. 2.17b. Aquí temos uma camada de entrada de nós de le mu e uma camada de salda de neurónios al;indo como nós computan.enais. Nestc caso, os pesos sinópticos da rede cstáo incluido? como partes integrantes dos neurónios da camada de salda. Os dos de concxao entre as duas camadas da rede sao simplesmente iros. Na análise matemática segumte, sup3e-se que ambas as redes neurais das Figs. 2.17a c 2.17b sao ?/ffenre.r. A impheacao desta suposiqáo é que cada neurónio age como um combinador linear, como representado no grato dt? Auto de sinal da Fig. 2.18. Para prosscguircom a análisc, suponha que um padráo de atividade v ocorra na camada de entrada da rede c que um padrüo de atividade j
AGUA A 2 J 8 Muíalo do gralo da flux? de ginaI de um neurona line-ar r&luladü / ocurra simultáneamente na camada de saída. A questáo que desojamos considerar aquí é a aprendi- zagem da associafüío entre os padrees \ e y Os padrees x c y,. sao representadas por vetares, escritos ñas suas formas expandidas como: 'i " e y* ' Li'Ai'-víi.yjr Por conveniencia de apresentacao, suponías que a dimató ¡=malí dade do espada de entrada (i.e., a dimensao do vetor x.) c a mesma que a dimensional idade do espado de saída (i.c,, a dimensao do vetar yA i v igual a jh. De agora em ।liante, nós nos referimos a m coma a dimijnsíonüliíífide da rede ou simplesntente dinwixíonaiidvde. Note que ftr é igual ao número de nós de fonte na camada de entrada ou de neurónios na camada de saída. Para urna rede neural com um grande número de neurónios, que é o caso típico, a dimensionalidade m pode ser grande. Os elementos tanto de x. como de y. podem assumir valores positivas c negativos. Esta é urna pruposi^áo válida em uma rede neural artificial. Isto também pode ocorrer em um sistema nervoso, considerando que a variávcl fisiológica relevante seja a diferencia entre um nivel de aüvidade real (p.ex., a laxa de disparo de um neurórt-iü) e um nivel de ai i v ¡ dade espontaneo diferente de zcro. Supondo que as redes da Fig. 2.17 scjatti lineares, a assocÍLi^ao do vetor'chave x com o vetar ineinor izado y, pode ser descrita na forma matricial como: yt=W(^ i=L2,...,« (2.27) onde W(A) cuma matriz de pesos determinada apenas pelo par de entrada-saida (lr y() Para desenvolvamos uma describo detalhada da matriz de pesos W(¿), considere a Fig, 2.18, que m os ira um aíran ¡o dctalhado do neurónio i da carnada de saída. A saída do ncuronio i devi do a a$to combinada dos elementos do padrao-chavc \ aplicada comn estimulo á camada de entrada, é dada por II -h- (2.28) j-i onde os h r^( Aj, j 1.2...jw. sao os pesos sinápticos do neurón io t correspondentes ao A-é&imo par de padrócsassccjatlos. Utilizando a notado matricial, podemos exprussar v. na forma equivalente
ti 12 J’= (2 29) Reoonhecemos o vetar colima no lado d ircito da Eq. (2.29) como o vctor-chavc i, Substituindo a Eq. (2.29) na definirán do vetor m-por-1 armazcnado y,h oblemos >« ^h(A) wli(A) ÍCJ2I(A) WkÍA) »!„(*) -^.2 ¡ — - - - - J w.i(fr) W^(A) - wm(A). (2.30) A Equa^ao (2.30) é a forma expandida da transformaban matricial ou mapeamento descrito na Eq. (2.27). Em particular, a matriz de pesos m-por-m W(A) c definida por w(í(¿) m?Iw(A)‘ «a(¿) Wj-Í*) ^2<*) »„(*)_ (2-31) As apresenta^Qes individuáis dos q panes de padrees associados -> y., A = 1T 2,.. T q, produzem valores correspondentes da matriz. individual, ou scja, W(1), W(2), ...T W(<j), Reconhecendo que esta associa^ao de padrees é representada pela matriz de pesos WfÁ), podemos definir uma matriz de memoria m-per-m que descreve a soma das matrizes de pesos para o conjunto Intel no de associ- aíóes de padrees como segue: M = ¿W(k) J- -1 (2-32) A matriz de memória M define a conectividade global entre as camadas de entrada e de salda da memoria associativa. Na vendade, ela representa a experiencia total ganha pela memória como resultado das apresentaqóes de q padrdes de entrada-saída. Dito de ouira forma, a matriz de mentó- ría M conté™ uma parte de cada par de entrada-saída dos padrees de atividade apresentados á memória. A definido da matriz de memória dada pela Eq. (2.32) pode ser rccstru turada em forma recursíva como mostrado por + W(*), k~\,2r.,q (2.33) onde o valor inicial é zcro (i^h| os pesos sinópticos da memoria sao inicialmente todos zero), e o valor final é idénticamente igual a M como definido na Eq. (2.32). De acordo com a fórmula recursíva da Eq. (2.33), o termo M^1 é o valor antigo da matriz de memória resultante das assccia' ^ócs de padroes (A - Ib e M* é o valor atualizado devido ao incremento W(A) produzido pela k- ésima associa^áo. Note, entretanto, quequande W(k) c adicionado a M. p o incremento W(A) pende
Hidden page
Hidden page
cride, na segunda linha^roconhcccmos que ijx. é um escalar igual ao produjo internados veto-res- chave xÁ e n Podemos rescrever a Eq. {¿.40) romo y = t s %) v + £ (x[i, )y, (2.41) 1 = L Suponha que cada um dos padroes-chave xp x , x. seja normalizado para ter energía unitaria; isto é, = ¿Vr ÍI42) — Sj. = 1, k = 1,2,...^ Conseqiienicmcntc. podemos simplificar a resposla da memoria ao estimulo (padráo-chave) y como y=y/*. <2-43} onde v^^fx^Jy, t-i »*> (2.44) O primeiro termo no lado direito da Eq. (2.43} representa a rtspGsta “desojada" y(; ele pode ser visto, portanto, como a componente do ”si-iaF da resposta real y. O segundo termo v é um "vetar de ruido11 que surge devido á iuterfenincia trazada entre o vctor-chavc x c todos os outros vetares- chave armazenados na memoria. O vetor de ruido V.éresponsávcl pelos erres de recordado. No contexto de um espado de sinal I mear, podemos definir o conseno do ángulo entre um par de vetares x c y como o produto interno de x_ o xr dividido pelo produto do suas Hfwma.i cuc]¡dianas ou «w^rtiFionías, como mostrado por (245) O símbolo x.¡| significa a norma cuclidiana do vetor x , definida como a raíz quadrada da energía de V h2 (246) Retomando a si tua^ao cm questita, note que os veto res-chave sáo normalizados para terem energía unitaria dcaconlo com a Eq. {2.42). Podemos, portanto, reduzira definido da Eq. (2.45) a COÍ^.lJ - IjX, (2-47) Podemos entáo redcfuúi o vetor de ruido da Eq. {2.44) como
t-l (2.48) Vcroos agora que se os vetores-chave forem ortogonaLi (ixu, perpendiculares entre si no sentido euchdiano), entilo eos (sjT ) = 0, (2.49) e, portante, o vetor de ruido v é igual a zeno* Nesie caso, a resposta y iguala y. A memoria (¡asocia perfectamente se os vetores-cnave pertencerem a um conjunta orinnormal', isto é, se el es satisfíze- rum o segumLe par de condif des: (2.50) Suponía agora que os vetores-chave formam um conjunto ortononnal, como descrito pela Eq. (2.50). Qual ó entao o limite da capacidad? de armarenamento da memoria associativa? Dito de outra forma, qual é o maior número de padróes que podem ser armazenados de forma confíávcl? A res- posta a esta quesfóo fundamental se encontra no posto da matriz de memoria M. O posto de uma matriz é definido como o número de col unas (linhas) independentes da matriz. Tsto é, se r é o posto de uma matriz retangularde dimensftes Apor-m, temos entilo que r < rainf/, m). No caso da memória por correlato, a matriz de memória M é uma matriz nt-por-m, onde m é a dimensionalidade do espado de entrada. Assiui, o posto da matriz de memória M é limitado pela dimensional i dade m. Podemos endfo formalmente afirmar que o número de padrees que podem ser armazenados de forma confiável em uma memoria por matriz de correla^áo nunca pode cxccdcr a dimensional i dade do espado de entrada. Em sitúameles do mundo real, freqüentemente observamos que os padróes-chave apresentados a uma memória associativa nao s3o nem ortogonais nem estilo muito separados entre si. Conseqüen- tcmcnic, urna memória por matriz de correlato caracterizada pela matriz de memória da Eq. (2.34) pode algumas vezes se confundir e ocasionar erroa. Isto e, a memoria ocasionalmente reconhecc c associa padrees que antes nunca foram vistos ou assoctados. Para ilustrar esta propriedade de uma memória associativa, considere um conjunto de padróes-chave. {»*-}: «i.V-*, e um conjunto correspondente de padróes memorizados, (y—}:y,-y3--y. Para expressar a presimidade dos padroes-cbave em um espado de sinais linearas, introducimos o oonCcito de comunidad?. Definimos a común idade do con ¡unto de padrees jx k ! como o limito inferior dos produtos internos de dois padrees quaisquer x e i¿do conjunto. Suponha que M represente a matriz de memória resultante do treinamento da memória associativa com um conjunto de padróes-chave representado por o um conjunto correspondente de padróes memorizados {yiiriii}l de acorde com a Eq. (2.34). A resposta da memória, y, a um estimulo i selecionadc do
IOS IÍ FPFS Nl-11 HAIh conjunto {x.¡ é dada pela Eq. (2.39}» onde supernas que cada padrao do conjunto {x ! c um vetor uniiário (i.c., um vetor com energía unitaria), Suponhamos aínda que x'*j > Y para 4*7 <2.511 Se o limite inferior y for suficientemente grande, a memoria pode falhar cm distinguir a resposta y daquela de quaiquer nutro padrao-chavc comido no conjunto |xvXrti}- Se os pádrócs-chavc dcstc conjunto tiverem a forma x — Jt + V . II (2.52) onde v ó um vetor cstocástico, c provável que a memúria neconhcqa i(l e o associe a um vetor y cm vez de associá-lo a quaiquer um dos pare* de padrees reais utilizados intalmente para Lreiná-la; e y,, representara um par de padrees nunca vistos anteriormente. Este fenómeno pode scr chamado de lógica animai^ apesar de nfro ser nada lógico (Coopcr, 1971). 2J2 ADAPTAQÁO Na realizarán de uma tarefa de interessu, frcqüentcmcnlc constatamos que o espado c uma dimen- sao fundamental do precesw de aprendizagem: o íe/npo é a outra. A natureza &¡t*w>-temporal da aprendizagem é ejemplificada por muñas das tarefas de aprendizagem (p.cx., controle, forma^áo de feote) discutidas na Segio 2.10. Todas as espides» desde insetos até os humanos, tém uma capacidade incrcntc d? representar a estrutura Cempcnil da experiencia. Urna represenla^ici asaim toma possivel para um animal adaptar seu comportamento á estrulura temporal de um evento cm seu espado de ccmportamcntos (Gallistel, 1990). Quando uma rede neural opera em um ambiente estacionária (i e.. um ambiente cujas caracte- rísticas estatificas nao mudara com o lempo), as cstalísticas csscnciais do ambiente podem ser, em teoría, pela rede, sob supervivió de um pnofessor Em particulados pesosuiipticos da rede podem ser calculados submetondo-se a rede a uma ícSiio de tremamentn com um conjunto de dados que é representativo do ambiente. Uma vez que o processo de Ireinamcnto esteja completo, os pesos sinópticos da rede capturanam a cstrutura cstatística subjaccntc do ambiente, o que justifi- caría o “ccngel amento" de seus valores depois disso. Assim, o sistema de aprendizagem se baseia de urna forma ou de outra na memáritit para recordar e explorar experiencias pascadas. Frcqücnicracntc, entretanto, o ambiente de interesse c nao-£.staci<inárío,t o que significa que os parámetros estaListicos dos si mus portadores de i n formado, gerados pelo ambiente variam com o lempo. Em situares dcstc ?po, os métodos tradic ionais de aprendizagem supervisi onada podem se mostrar inadequados, pois a rede náo está equipada com os meios necesarios para seguir as variares estatfcticas do ambiente no qual opera. Para superar esta dificuidade, é desejávd que uma rede neural possa aítaptor continuamente seus parámetros livrea ás vari atoes do sinal incidente em ¡c/npa reai. As^im, um sistema atiaptativu responde a toda entrada distinta como sendo uma entrada nova. Em outras palavnas, n processo de aprendizagem encontrado em um sistema adápiativc nunca para, com a aprendizagem sendo realizada enquanto o processqmento de sinal está sendo ejecutado pelo sistema. Esta, rorrea de aprendizagem é chamada de optendizagem cümífiuu ou upretidizagem em tempo real {on-the-fly}.
lJmOCI:5M>5 Pl: ApIÍEÍNUIZAGUM 1D9 Os fiitottGíÍGptíilivüslimares, construidos em tomo deum CombinadorLinear(i.e,. um único neurónio operando em seu modo linear), sáo proj ciados para realizar aprendizagem continua. Apc- sar da sua estretura simples (c talvcz por causa dissn). cíes sao ui ¡fizados largamente em aplicares láo diversas como radar, sanar, oormim calóes, sismología c processamento de sinal biomedioo. A teoría dos filtros adaptados lineares atingí u um esiágio de desenvolv ¡mentó de elevada maturidade (Hdykitt, 1996; Widrow e Sitaras. 19S5). Entretanto. o mesmo nao pode scr dUo sobre os filtros adaptalivns náo-lineares.11 Considerando (juca aprendizagem continua scja a propiricdadcde intcrcsscc uma redoneural o vcículo para a sua implcmcnlaíáo, a questáo que devemos abordar c: como uma rede neural pode adaptar seu comportamento á estrutura temporal variávcl dos sinais incidentes na espado de com- portamantas? Lima forma de abordar esta questáo fundamental c rcconhcccndo que as característi- cas estatísticas de um processo nao-estacionario normalmente variara de forra a suficientemente lenta para que o processo scja considerada pxeudo-estacwmirio cm uma jancla de tempo com dura- qáo suficientemente curta. Incluera-se como exemplos: • O mecanismo responsável pela produjo de um sinal de voz pode scr considerado cssimcial- mente estacionario durante um periodo de 10 a 30 milis segur dos. • Ondas de radar retomadas de urna superficie da océano permanecerá esseneialmcnlc estacio- narias por um período de varios segundas. • Considerando-se a previsto do tempo a longo prazo, os dados meteorológicos podem ser vistos comu cssencial mente estacionarios durante um período de minutos. • No contexto de tendénci as a longo prazo, estendendo-se por meses e a nos, os dados do merca- do de Bodes podem ser considerados como essencialuiente estacional ios por um periodo de di as. Desta forma, podemos explorar a propríedade pseudü-estacionáriade um processo estocástico para cstendera utilidade de uma rede neural, refreinando-a cm determinados micrvalos regulares, levan- do em corita assim as flutua^fies estatísticas dos dados incidentes. Esta abordagenn pode, porcxeni- plo, ser adequada para pracessar dados do mercado de a^ocs. Para uma abordagem dinámica mais refinada, pwle-se proceder como segue: • Selecione uma janela suficientemente estrena para que os dadas de entrada pessam ser consi- derados pscudo-cstacionárias c use as dados para trv:nar a rudc. • Quando íbr recebida uma nova amostra dos dados, atualize a janela eliminando a amostra de dado mais amiga c destocando as amostras restantes para tras, cm uma ur.idadc de tempo, para fazer espado para a nova amostra. • Utilizo a janela do dados atualizados para tremar uovamentc a rede. • Repita o proccdimcnta de forma continua. Podemos, assira, incorporara estmtura temporal no projeto de uma rede neural fozendo com que a rede safra treinamerito continuado cara no tempe?. De acardo com esta aborda- gem dinámica, uma rede neural 4 (ista como um Jífrm adaptativo nao-fínear que representa uma gcncraliza^áu dos filtros adaplatívos lineares. Entretanto, para que esta abordagem dinámica para til tras adaptativos nao-lineares scja rcabzávcl, os recursos dispontvciis devem sct suficientemente rápidos para completar todos os cálculos descritos durante um periodo de amostragem. Somente entáo o filtro accmpanhara as varia^ucs na entrada.
2.13 NATUREZA ESTATÍSTICA DO PROCESSO DE APRENDIZAGEM A última parte de capitulo traía dos aspectos eslatisticos da aprendí /^gem. N'este con texto, nío estamos interessados na evolu^áo do vetor de peso;; w enguanto a rede neural passa por um algoritmo de aprendizagem.. Em vez disso, conccntramo-nos no desvio entre uma fun^áo "alvo'-./Cx) c a fun- ií3o "real” J'lx.w), realizada pela rede neural, ondeo vetor x representa o sinal de enlrada. Odes\ io é expresso em termos estatisticcs. Urna rede neural é meramente uma forma pela qual cnuhccinrenlü empírico sobre um fenóme- no físico ou ambiente de interesse pode ser codificado através de treinamento. Por conhecimenlo "empírico” emendemos um conjunto de medidas que caracterizam o fenómeno. Para sermos mais específicos, considere o cxcmplo de um fenómeno estocástico descrito por um vetor aleatorio X consislindo de um conjunto de vurithvú ind^pend&tícx, C um escalar aleatorio D que representa uma vuriável dependente Üs elementos do vetoraleatorio X podem ter significados físicos particti* lares d i furentes. A suposif&o de que a vanável dependente D é escalar foi leita siinplesmentu para simplificar a expósito. sem perda de generalidade. Suponha também que tenhamos N realizaQoes do vetor aleatorio X representadas por {x ] pe um conjunto correspondente de realizares do escalar aleatorio D representado por ' , Estas reali zapees (med i das) conslitucm a amostra de treinamento representada por ?={<I,4C, (253) Normalmente, ndo conltecemos a relajo funcional exala entre X e í> e assim prosseguimos pro- pendo o modelo (Whitc, l9R9a) D-/(X)+e (154) onde /() c uma fundan determinixtíca do seu argumenio vetorial. e t é uní em de expeciotiva aleatorio que représenla a nossa "ignorancia11 sobre a dependencia de D e X. O modelo eslatfstico descrito pela Eq, (2.54) é denominado um modelo r^gpetfivtx, ele está representado na Fig. 2.20a. O erro de expectativa e é, em geral„uma vanável aleatoria com media nula e probabilidade de ocurren- cia positiva. Bascado ni seo, o modelo regresivo da Fig. 2.2Qa aprésenla duas propriedades úteis: F1GUHA SJ2Q (a) Modelo (matemático) rÉ^réssiwo. (ti) MOtfelO (Pinico} de rede neural
LO valor medio do erro de expectativa £, dada qualquer realízatelo x. ¿ zerv\ isto c+ E[e|x] = 0 (2,55) onde E é o operador estatístkc do valor esperada (esperanza matemática). Como um corolario desta propriedade, podemos a firmar que ayunado de regressdo é a media condicional da saida do modela D, dado que a entrada X = x, como mostrado por /(x)-E[^x] (2.56) Esta propricdade segue direlamente da Eq. (2.54), considcrando-sc a Eq. (2.55). 2. O er/o de expectativa € ftao é correlacionado com a Junado de tegressdojty.)',, isto é ^X)] = 0 (2.57) Esta propricdade ó o bem ccnhecido principio da ortogonafidade, que afirma que toda a infor- mado sobre D que nos ó disponíbi lirada através da entrada X está codificada na fun^fio de rcgrcsMoj(X). Podc-sc demonstrar a Equa^áo (2.57) cscrcvcndo: 4v(x)]-f[4«fíX)iKi] -4/pt)4t|xj =4fPt)o] = 0 O modelo regressivo da Fig, 2.20a é uma describo “matemática" de um ambiente estocástico. O seu propósito é utilizar o vetor X para explicar ou prever a variável dependente D. A Figura 2.20b é o modelo "físico" correspondente do ambiente. O propósito deste segundo modelo, bascado em uma rede neural, é codificar o conhecimento empírico, representado pela amostra de trciinacncnto 3" em um conjunto correspondente de vetores de pesos sinópticos, w, como mostrado por ST -> w (2.58) Na vendade, a rede neural fomece uma ktaproKimapao'' para o modelo regressivo da Fig 2.20a, Suponha que a resposta real da rede neural, produzida cm respecta ao vetor de entrada x, se ¡a representada pela variávcl alcaLóriu K=F(X.w) (2.59) onde H sw| é a fun^áo de entrada-saida realizada pela rede neural. Condecidos os dados de treiñá- mente ¡7 da Eq, (2,55)t O vetor de peso W é cbtiilo pela mimmiza^áo da fun^ao de custo .-II onde o fator 1/2 foi usado para ser consistente com as notajes anteriores e com agüelas usadas nos capítulos subscqucntcs. Com cxcc^ao do fator de escala 1/2, a fundió de custo T€(w) é a diferen^a
quadráticn entre a resposta desojada íi c a resposla real y da rede neural, catediada con» a média sobre todo o conjunto de dados de trei ñámenlo "J. ü uso da Eq. (2.60) como fun^ü de CUSIO implica a niilizáfelo do modo de treinamento porlote", pelo qual os ajustes dos pesos sinópticos da rede sfo realizados sobro o conjunto intci.ro de exemplos de ircinamcnto, cm vez de o serení sobre cada cxcmplo Individual Suponha que o símbolo E represente o opeurdor tüédiu tomado sobre todo o conjunto de treinamcTUO 3". As variáveis ou suas funffrcs sobre as quais age o operador media £T sáo represen- tada* por x c J; o par (x, ti} representa um cxcmplo na amostra de trei namente de íf. Por culto lado, o operador cstalíslico de valor esperado £ age sobre todo ü en semble de variáveis aleatorias X cD, o que incluí ? como um subconjunto. A d I feren^a entre os operadores E e Ex será cuidadosa ir ente identificada a seguir. Considerando-se a transformado descrita pela Eq. (2.58), podemos usar alternativamente Fíx, w) e A'(x, y)e assim rescrever a Eq. (2.60) na forma equivalente «(w) = | £,[(<(-fU,?»1] (2 61) Adicionando e suhtraindn /(x) ao argumento (rf- F(x, í71) o cntáo uti lizando a F.qP (2.54). podemos esc rever d - F(x, = (<7 - f(i)) + (/(i) - F(x, ;/)) = e+(/(x)- F^gj) SubslUuirtdo esta Cxpressáo na Eq. (2.61) e entáo Cxpandindo os termos, podemos re formular a funfiri de custo í(w) na forma equivalente «<») = J£j[6¡] + |M-f(!l)-f(’L'7>']+ £,[</(’)-(r(x.9’»l (2«2) Entretanto, o último termo do valor esperado no lado dire ¡lo da Eq. (2,62) é zcro por duas razoes: • O cito de expectativa e c nao-correlacionado com a funfao de regressáo7(x) devido á Eq. (2.57), interpretada etn termos do operador E¡r • O erro de expectativa e c relativo ao modelo de regressao da Fig. 2.20a, enquanto que a funt-áo aproximaliva F(x, w) é relativa ao modelo de rede neural da Fig. 2_20h. Conscqíicntcmcntc, a Eq. (2.62) se reduz a + (263) dL- jL. O primeiro termo no lado direilo da Eq. (2.63) e a variare i a do erro de expectativa (do modelo regressivn) e, calculado sobre o conjunto de treirtamento 3". Estu termo représenla o erm inínn.secoi porque ele ¿ indcpcndcntc do vetor de pesos w. Ele pode ser ignorado, na medida em que seja considerada a minimizado da fuñólo de cnstoí(w) cm reíanlo a w. Assim, o valor particular do vetor de pesos w* que minimiza a fun^áo de custo í(w) Lamben ira minimizar a media de ensamble da distancia quadrática entre a funcáoderegressáojfx) ea íunfáo aproxima ti va F(x, w). Em outras paliaras, a meiiidn naíurai da eficiencia de F(x, w) cm prever a resposta desojada d ó definida por ¿^(/(x), F(x, w)) = E.KAD-Fíx, (2.64)
Este resultado c de f undamental importancia, país fomccc a base matemática para o oompromisso entre o tifas e a variáncia resultantes da utilizacáo de F(x, wj como a aprdximabáo dcj?x) (Germán el al., 1992). Dilema Bias / Varíancía Invocando o uso da Eq. (2,56), podemos redefinír a dist&ncia quadrálica entreV(x) eF(x,w) como: - £t[(¿[D|X -- x] - H*. W1 (2.65) Esta cxprcs&ao pode também ser vista como o valor médio do env estimativo entre a funqáo de regr-essao/fx) = £[Z)|X = xj e a fun^o aproximauva F(x, w), calculada sobre toda a amostra de treinamento Note que a média condicional £[D|X = i] tem um valor esperado constante em rela^áo ao conjunto de dados de treinamento 9". A seguir, constatamos que £[D|X = x] - F(x, S") = (£[D|X = x] - [Hx, ?)J) + £)] - S-)} onde simplesmente adicionamos e subtraimos a media í’JFfx, 9")]. Procedendo de uma maneira similar áqucla descrita para derivar a Eq. (2.62) da Eq. (2.61 )t podemos reformular a Eq. (2.65) como a soma de dois termos (veja o Problema 2.22): Mx> ^)) = + P(w) (2.66) onde Mw) O l'(w) sao, por sua vez, definidas por 5íw)-£f[flis 9D1 -£[D|X - x] (2.67) e H«)= JÍ-KjCHx. ST)])1] (2.63} Agora fazemos duas observables importantes: 1. O termo £(w) é o trias do valor médio da funqáo aptos imatíva F(it 5), medido em relajan á fcnq&o de regressáoJíx) = £[D|X = x]. Este termo representa a ineapacidadc da rede neural dcñnida pela fongáo F(x, w) de aproximar com preciso a fiin^áo de regressao/i) = £[D|X = ]. Dcstc modo, podemos ver o bias 2¡(w) como um erra dpmwmafjvo. 2+ O termo ^(w) é a varíáncia da fun^ác aproximativa F(xt w), medida sobre leda a amostra de treinamcnio ff. Esle segundo termo representa a rtóo-adequai?áoda informaban comida na amostra de treinamento Sf acerca da fiinqao de regressao/(x). Podemos, portante, ver a variáncia P(w) como a manifestacac de um erro estimativo. A Figura 2.21 ilustra as relaces entre as fonjes objetivo e aproximativa e mostra como os erros estimativos, islo é, o bias e a variareia, se acumulara. Para se obter bcra desempenho global, tanto o bias Zf(w) como a variáncia F(w) da fun^áo aproximativa F(x, w) = F(x, 3") devem ser pequeños.
FIG URA 2.21 llutttáC&> dáG váriáS fOrtl&i MFO rti SüluCte dC ptiftfeffM de f&grosiiú hiel límente, constatamos que em uma rede neural que aprende por ejemplos utilizando para isso uma amostra de treinamento de tamanho fixcr, o preqo para se obten um bias pequeño c uma vuriáneia grande Para uma rede neural única, comente quando o tamanho da amostra de treinamen- to se Loma i n fin llámenlo grande ¿ que podemos esperar eliminar lanío o bias como a wilncÍB, ao mestno tempo- Tornos entáo um dilema bias/varíánciOf e a conscqüéncia é uma convergencia CXCCS- sivamentc lenta (Germán el al.» ¡992). O dilema bkis/variíncia pode ser evitado se cstivermes dis- postos a incluir iniencicnaímente um bias, o que enláo toma possivel eliminar a variáncia ou reduzi- la significativamente- F dcsnccessário se dizer que devemes assegurar que o bias incluido no proje- to da rede seja inofensivo. No contexto de clasificado de padroes, por exemplo, dizemos que o bias é “inofensivo” quando ele contribuir significanvamente para o erro médio quadratico ¿órnente se tentamos inferir regrcssccs que nao estejam na elasse prevista. Em gcral, o bias deve ser cohcc- hido para cada aplicado especifica de irteresse. Um modo prático de se conseguir este objetivo í utilizando uma arqiiitclura restríia de rede, que normalmente lem desempenho melhor do que uma arquitelura de propósito geral. As restribes e portante o bias podem, por exemplo. ¿¿sumir a forma de conhecimento previo incorporado no projclo da rede utilizando (1 1 compatiiitiumento de pesos onde varias sinapses da rede sao controladas por um único peso, e/ou (2) campos receptivos locáis atribuidos a neurónios individuáis da rede, como demonstrado na aplicado de um pcrccptron de múltiplas camadas no problema do reconhec¡mentó de um caractcr óptico (LeCun et al., 1990a). Eslfti queslóes de prejeto de rede foram discutidas brevemente na $ef3o 1-7, 2.14 TEORIA ESTADÍSTICA DA APRENDIZAGEM Ncsta so^áo, continuamos a caractcriza^áci cstatíslica das redes neurais descreyendo uma teoría da aprendizagem que trata da questao fundamental de como controlar a hábilidade de generalizado de uma rede neural em termos matemáticos, A discussfo é ¿presentada no contexto da aprendizagem superví sionada. Um modelo de aprendizagem supereisiuñada consiste do tres componentes interrel alionados, ilustrados na Fig. 2.22 e descritos cm termos matemáticos como segué (Vapnik, 1992. I99S): 1. Ambiente. O ambiente é estacionario, fcmcccndo um vetor x com uma fim^áo de dislribui^áo (de probabilidade) cumulativa fíxa, mas dcsconhecida 7'^x).
FIGURA 2.22 Modelo do procos» de aprendizagem superviskinadH 2, Professor O professor fornece uma resposta desejada cf para cada vetor de entrada i recebido do ambicnlc, de acorde com uma fundan de dístrihuicáo cumulativa condicional íf) que é tam- bém fixa mas dcsconhccida. A resposta desojada ¿co vetar de entrada x estáo relacionados por <f“jU,v) (2 69) onde v é um termo de ruido, que permite que o professor seja “ruidoso14. 3. Máquina (algoritmo) de aprendizagem. A máquina de aprendizagem (rede neural) é capaz de implementar um conjunto de funfdes de mapeamento de entrada-saida descritas por (2 70) onde .y é a resposta real producida pela máquina de aprendizagem em resposta á entrada x, e w é um conjunto de parámetros livres (pesos sinápticos) selecionados do espado de paramemos (pesos) TK As Equa^oes (2.69) e (2,70) eslío escritas em termos dos ejemplos utilizados pare realizar o trema- mentó. O problema da aprendizagem superviví onada é selec tonara fundió particular F(x,w) que apro- xima a resposta desejada ¿f de uma forma ólima, sendo “ótimo" definido cm um sentido estatistico. A própria seltcáoébaseada no conjunto dos A exemplos de tretnamenlo independentes, idénticamente distribuidos (iid) descritos pela Eq, (2,53) e reproduzidos aquí por conveniencia de apresentaqáo: »#*,< Cada par de cxcmplos é retirado de £7 pela máquina de aprendizagem com uma funcao de distribui- qío (de probabilidade) cumulad va conjunta FK jX d), que, como as nutras ftm^&es de distribuido, c também fixa mas dcseoithecida. A viabilidade da aprendizagem supervisionada depende desta quesillo: os exemplos de treinamento {(jt/R d)} contar informaqío suficiente para construir uma máquina de aprendizagem capaz de ter bom desempenho de general izacáo? Uma resposta para esta questío fundamental está na utilizado de ferramentas desenvolvidas por Vapnik e Chervonenkis (1971). Específicamente, procedemos vendo o problema da aprendizagem supervisionada como um problema de üproximafdo, que envolve encontrar a fun^o F(x, w) que é a melhor aproximado possívcl para a fundió desejadaj(x).
Suponha que F(x, w)) represente uma medida da perda ou dlserepáncia entre a resposta dcsejada rf correspondente a um vetor de entrada x e a respusta real F(x, w) preduzida pela máquina de aprendizagem. Uma definido popular para a perda t(rf, F(x,w)) é ajun^Ho deperda quwlráiica definida como a dista neta quadralica entre d =flx) ca aproximado F(k, w) como mostrado por12 L(d, w)) - (d- F(x, w)): (2-71) A distancia quadrálica da Eq. (2.64) c a extensáo de L(dt F(x,w)) para a media de ensemble, com a media sendo realizada sobre todos os pares de exemplos (x, d). A maior pane da literatura sobre a teoría estatística da aprendizagem lida com uma perda especifica, O ponto forte da teoría estatifica da aprendizagem ¿presentada aquí c que ela nda de- pende criticamente da forma da fiin^áo dependa í{r¿ f^x, w)). Mais adían te nesta se^áo, restringi- remos a discussao a urna fim^áo de perda especifica. O valor esperado da penda ó definido pelo funcionaí de tinco A(W)= (2 72) onde a integral é uma integral múltipla sobre todos os valores possíveis do par de exemplo (x, d). O objetivo da aprendizagem supervisionada c minimizar o Funcional de risco J?(w) sobre a dasse de íuncües aproximativas (F(x, w), w € W). Entretanto, o cálculo do funcional de risco /í(w) é com- plicado porque a ftin^ao de distribuido cumulaba conjunta ,i x, tí) é normalmente desconheci- da. Na aprendizagem supervisionada. a única informarse disponlvel está contida no conjunto de treinamento J. Para superar esta diñculd&dc matemática, ui i hitamos o principio indutivo da minimimeao do riscti empírica (Vapnik, 1982). Este principio se barcia inceiramcnte na disponíbi- lidadc do conjunto de dados de Ireinamcnto 9", o que o toma perfei (ámente adequado ú filosofía de projeío de redes neurais. Alg urnas Def ¡nlgóes Básicas Antes de prossegmnnos, introduzirnos algumas definiffes básicas que usaremos no material que se segue. Convergencia. em probabilidade. Considere uma seqü encía de variáveis aleatorias cr <av Dizemos que esta seqücncia de varia veis aleatorias converge em probabi iidade para uma variável u if se para qualqucr fi >0 for valida a retafSo probabIIEstica - d„| > & A I) quando .V » (2.73) Supremo e ínfimo. U supremo de um conjunto náo^vazto ¿4 de escalares^ representado por sup ,?í, é definido como o menor escalar x tal que x > _r para todo > e si. Se tal escalar náo existe, dizemos que o supremo do conjunto nao-vazio ¿4 c «. Análogamente, o infimo do conjunto .íí, representado por inf ri.é definido como o maior escalar t tal que a s v para todoy e ¿4. Se tal escalar nác existe, dizemos que o ínfimo do conjunto náo-vazio .si é «. Función al de risco empírico. Dada a amostra de ircinamcnto 7 = {(x,,t/.)}L |? o funcional de risco empírico é definido em termos da funijao de perda L(d. . w)} como
J’ r-r (2.74) Cn nsí sténci a Eütrita. Considere o conjunto I#- de funpoes ¿(í/, F(x, w)) cuja distribuido funda- mental é definida pela funpao de distribuidlo cumulativa conjunta ..{x, d). Suponha que 1T(c) soja um subconjunlc náo-vazio qualqucr dcsic com¡unió de funq&cs, tal que W)= w: £(rf,fXx,w))¿c (2.75) onde ce (-»,»). O funcional de risco empírico ¿ dito ser estritamente (nao irívialmcntc) caisi^ tente se para qualquer su be o nj unto W(¿) seja válida a seguí rite convergencia em probabilidade inf > inf i?(w) quando N—>« (2.76) Com estas definieres, podemos retomara discussáo da teoría deaprendizagem cstatística de Vapnik, Principio da Minimizaba da Risco Empírico A idéia básica do principio da minimizaban dn risco empírico é trábalhar com o funcional de risco empírico Jf^w) definido pcia Eq. (2.74). Este novo funciona] diferc do funcional de risco J?(w) da Eq. (2.72) em dois aspectos desejáveis: 1. Ele nao depende de forma explícita da fun^o de distribuido desconhecida Fx D(x, tí}. 2« Em teoría, ele pode ser minimizado em relajo ao vetor de peso w. Suponha que w e F(x, wj representen! o velen de peso e o mapeamento correspondente que minimiza o funcional de risco empírico /?<111.,(w) da Eq. (2.74). Análogamente^ suponha que w c /|(x, vfj representem o vetor de peso e o mapeamento correspondenie que minimizan! o funcional rea] de risco fl(w) da Eq. 2.72. Tanto como w _ pcrtcnccm ao espado de pesos V. O problema que devemos considerar agora sSo as conduces sob as quais o mapeamento aproximado w mp) está “próximo" do mapeamento desojado F(x, wj, como medido pelo deseosamente entre ^(w^ ) c R (w?). Para um w - w*, o funcional de risco í(w*) determina a esperanza matemática de uma vari* ável aleatoria definida por Z_+=¿(¿, F(it w*)) (2-77) O funcional de risco empírico /^(w *), ao conlrário, é a media (aritmética) empírica da variável aleatoria Z^,. De acordó Cüm a ¡ei dos grandes números, que c um dos principáis teoremas da teoría das probabilidades, em casos gerais constatamos que. quando o lamanho N da amostra de treina- mento -7 c feito infinitamente grande, a media empírica da vartável aleatoria converge para o seu valor esperado. Esta observado fomece uma ¡ustificaciva teórica para o uso do funcional de risco empírico ^^(w) no lugar do funcional de risco A(w). Entretanto, apenas porque a media empírica de Zw, converge para o seu valor esperado, nAc há razAo para se esperar que o vetor de
pesos waii que minimiza o funcional de risco empírico fftmp(w) tambem minimizc o funcional de risco /í(w). Podemos satisfazer estes requisitos de unía forma aproximada procodendo como descrito a seguir. Se o funcional de risco empírico A. (w) aproxima o funcional de risco original fl(w) tífíifor- memenfí.' em w com uma prvcisatj t, cnlao o mínimo de .<w) se desvia do mínimo de Á(w) por um valor que nao excede 2e. Formal mente, isto significa que devemos impor uma cundido resentí va, Lal que para qualquer w e :.í e e >0. valha a rela^ño probabilístlcíi (Vapnik. 1982) Ffsunl^"^w)l>t)->ri quando V« {2-78) Mi Quando a Eq. (2.78) c satisfeita, diremos que ocurre unra rortVttjéiffleró uniforme no valor depeno w da risa? empír ico medio, paco o sen valorespetveio. De forma equivalente, desde que, para uma prwis&o predeterminada e qualquer. possanios afirmar que val ha a desígualdade P(sup|fl(w)-/f(mp(w)l>e)<tt (2.79) para algum íX >0. cntáo, como eonscqücncia. vale a seguí ule desigualdadc: P(A(w ) - JffwJ > 2e) < nt (2.80) fim outras palavras, se valer a condi^áo (2,79), eniáo com probabilidade de no mínimo (1 - a), a soluto A(x, w 1 que minimiza o funcional de risco empírico (w) resultará em um risco real j?(w .. i que se desvia do verdadeiro risco real mínimo possívcl J?(wJ por um valor que nao excede 2e. Dl* falo, a condi^Ao (2.79) implica que, com probabilidade (1 — ct), as duas desigualdades se- guí ntes sOo satis feiitas simultáneamente (Vapn-.k, 1982). (2.81) (2.82) Estas duas equaf&es definem as diferen^as entre os funcionáis de risco real ü de risco empírico em w = wrm e w = w , respectivamente. A Lém disso, como w c w: san os pomos mínimos de e Af(w), respectivamente, segue que R (w ) < R (w ) rT?:p- QTipr rmpT .-H (2.83) Somando as desigualdades (2.8l)e(2.S2)e entáo utilizando (2.83), podemos cscrcvcr a seguí nte desígualdade (2.84) Além disso, romo as desigualdades (2.81) e (2.82) sáo &ansfcitas simultáneamente com probabili- dade (I - a), cntáo a desígualdade (2.84) também o será. Podemos, portanto, afirmar que com probabilidade a vale a desigualdadc que c uma reformula^do de (2.80).
Estarnos agora preparados para formalizar o principio da minimizando do risco empírico em tres partes inter-relacionadas (Vapnik, 1982, 1998): I, No lugar do risco funcional A|*ó, conslraa 0 ftinc fonal de risco empírico ^,(W) = ^X«rf.,F(l,.W)) A I. bastado no tonj unto de treinamentu de exemplos i.i .d (' 11 2,.. l, A 2, Suponha que w represente o vetar de pesos que minimiza o funcional de risco enpiriuo sobre o espado de pesos V. Entác fl(w ) converge em pnobabilidade para o mínimo valor possivcl do risco real A(w). w £ V, quando o lamanho A' da amostra de tronamenta ó frito infinitamente grande, desde que o funcional de risco empírico convirja uniforme- mente para o funcional de risco real,/?(w). 3. A convergencia uniforme como deñmda por Pfsup1 - W<mp(w)|>e) -* 0 quando A —> « é i.rn4 IttCCflítlS V suficiente para ¿i <zonH¡HlcnLÍsi do principio da <Lo nsco eoipirico- Para uma interpretado física dcstc importante principio, eferceemos a seguinte observado. Antes dü tteiDMDcnto de uma máquina de aprendizagem, todas as fiin^es aproxima ti vas &3o igualmente prováveis. Na medida cm que avanza o l reina mentó da máquma de aprend i zagetn, aumenta a proba- bilidade daquelas fuñones aproxicnativas F(x ,w) que sáo consistentes com o conjunto de dados de treinamcnlo {(i. rf) I 1 r Quando o tamanho A' do conjunto de dados de ireinamento crcsee e canse- qüentemente o espado de entrada se torna "densamente?’ povoadn, o ponto mínimo do funcional de risco empírico A1 (w) converge cm probabilidade para o ponto mínimo do funcional de risco ver- dadeiro Á(wX Dlmensao V-C A (cariada convergencia uniforme do funcional de risco empírico A. iw) para o funcional deriüCO real /i(w) incluí limiers na (axa de convergencia, que sao bascados cm um importante parametro denominado a di mansito Vapnik-Chervfmenkisfc\u siinplcsincntc dimenstio P’-C denomnada assim cm homenagem a scus criadores, Vapnik c Chcrvoncnkis (197 i). A dimensao V-C é urna medida da capacidade ou poder de* expresa ció da familia de fundóos de clarificado realizadas pela máquina de aprendizagem. Para descrecer n conceito da djinen^o V<em uma forma adequada para os nossoa propósi- tos, considere um problema de classitlca^áo de padrocs bínários, para o qual a resposta desejada é escrita como de 10, I}. Usamos o termo dicoiomtu para no* referínnos a uma futuro de clasüi flea- fáo hmária ou regra de decisáo. Suponha que £> represente o conjunto de dicotomías implcmcntadas por uma máquina de aprendizagem, ou soja, i? - wg W, M (0,1}} (2-85)
Suponha que 'd represente o conjunte de jV pontos no espado m-dimensional Sf de vetores de entra- da, ou seja. íf = {M,€ %\i = l»2,...tM (2.86) Uma dicotomía i mp (ementada pela máquina de aprendizagem partí cierna ¿t em dois subconjuntos disjuntos^, e ££,. de tal forma que nos podemos escrever Í0 F(a,w) = J para i para x e ££, (2.87) Considere que represente o número de dicotomías distintas implementadas pela máquina de aprendizagem, e Aj(J) represente o máximo de A^íf) sobre rodo !£ com |íf| = l, onde |íf| é o número de elementos de Dizcmos que c particionado por í? se A . (if) = 2|5a, isto é, se todas as dicotomías possi veis dcJf puderem ser inducidas por fun^Ces em Referí momos a AF(0 como a fuñada de ciescimcfíto. Exemplo 2.1 A Figura 2.23 ilustra um cspatjo de entrada tridimensional «msislindc de quatro pontos i|t x,, x} c xr A* froniciras de ¡Ik isto das fundes F1( eFr indicadas na figura, eomespondem ás cIbsüch (hípúieses) O c I sendo verdaderas, respectivamente. Da Fig. 2.23 vemos que a fun^áo Ffl indnz a dicotomía - (^n * {XpX^Xj,^- (X,n FIGURA 2.23 Diag'ama para O Exemplo 2.1 Por mitro lado, a func¿o induz a dicoíoinia Com o conjunta .fí consistmdo de quatro panto*, a cardinalidade |¿/| 4. Assim, Af(SP) = 21= 16
PMOCESSGS TE APRENDIZAGEM 121 Retomando á discussAo geral delineada pelo ensemble & de dicotomías na Eq. <2.85) e o conjunto correspondente de pontos íf' na Eq. (2.86). podemos agora definir formalmente a dimensáo V-C como (Vapnik eCbervonenkis, 1971; Keams c Vazirani, 1994; Vidyasagar, l997;Vapnik, 1998) A dimensao VCde um conjunto de dicotomias f? é acardinalidade do maiorconjunioíí particionado por í?, Em outras palavras, a dimensao V-C de í?. escrita como VCdim(5í)> é o maior /V tal que A/jV) = 2\ Dito cm termos mais familiares, a dimensao V-C do conjunto do ñin^óes de classifica^ao {^(x, w); w e W} £ o número máximo de exemplos de treinamento que podem ser aprendidos pela máquina sem erroh para todas as rotuladora possiveis das íuncocs de classificafño. Exemplo 2.2 Considere uma regra de dccisio simples em um espado fft"dimensional de vetares de entrada, que é descrito por y = <p(wrx 4- fe) (2.8B) onde a £ um vetorde pesos Jn-dimensiorial eí é un bias. A fun^áo da alivio ip c uma ñm^ao de limiar; isto é. p(u) - i1 >0 t! <0 A dimensao V-C da negra de dccisao na Eq. (2.88) é dada por VCdim(í') - mi - ] (2.89) Para demonstrároste resultado, considere as s^ua^ocs descritas na Fig. 2.24 relativas a um espado de entrada bidimensional (i.e., m 2). Na Eje. 2.24a, temos tres pontos xr x, e xy Tres diferentes posibilidades de rotulaba destes pontos est&c incluidas tu Fig. 2.24a, da qual vemos fácilmente que um máximo de trés linhas podem squrar estes pontos. Na Fig. 2.24b, lemas os pontos xp xi; e x4, com os pontos x, e x} rotulados comoO c os pontos x e i. rotulados como 1. Desta vti, entretanto, vemos que os pontos x l nSc podem ser Fl G Ll RA íM Um par dp dretribuiptea de dados bkfcrnerisionals pana o examplo 2.2
separado» de x. c xk por uma linha. A dirncnsaxi V-C da regra de dccisao descrita na Eq. (2.88) com m = 2 c portante 3, o que está de acordo com a fórmula da Eq. (2.89). Exemplo 2.3 Como a dimensao V-C íorned: uma medida da capacidade de um conjunio de fun^oes (indicadoras) de classi- ficaeáo. podemos ser levados a esperar que uma máquina de aprendizagem com muilos parametros hvres tena uma alia dimensáo V-C, enquanto que uma máquina de aprendizagem com poneos parámetros livrcs teria uma dimensSo V-C baixa. Agora apreveníamos um contra-cxcmplc11 para esta afirmado. Considere a familia de f aniñes indicadoras de um único parámetro, definida por - smal(seij(tu)), uc R onde smal(') c a fun^ao sinal. Suponha que cscolhemos um número qualqucr A1 c o objd ivo soja encontrar .V pontos que possam ser separados. Esta exigencia é saltsfeita pelo conjunto de funches /(i, ¿r) escolhendu-se .1,-10', É— V Para separar estes pontos de dados em duas classes determinadas pela seqüáncia é suficiente que o parámetro a seja cscolhidn de acordo com a fórmula: Concluimos^ assim, que 3 dimcnsñn V-C da familia de fungues indicadorasy(.rh a) cim urn única parámetro livjvdié infinita. Importúnela da d¡mensao V-C e da sua Estima<?áo A diinensao V-C é um conceito pwamente combifítitório que náo tem conexau com a no^ao geomé- trica de dimcnsác. Ela desempenha um pape] central na teoría de aprendizagem estatixtica como será mostrado no material apresentado ñas próximas duas subsepóes. A dimensáo V-C v também importante do ponto de vista de pro;efe. Grosso modo, o número de exemplo» necessános para se aprender de manen ¡i confiávd unta elasse de interesse é proporciona] á dímensúo V-C daquda elasse. Conscqüeniemente, urna estimativa da cümen»»o V-C ¿de fundamental importancia. Emalgún» casos, a dimensao V-C ¿determinada pelos parámetros lívres de uma rede neuralL Na maioria dos casos práticos, entretanto, é difícil calcular a ditriens&j V-C por meios analíticos. Apesar disao^ os limites da dimcnsáo V-C de redes neurais sao frcqüenLemenijc traláveis- Neste contexto, os dois resultados wguintes sáode especial ioteresse14: 1. ¿Sjjpri/?Jrlf fue Jf repmsi'irte unja nUnientuda adiuntü arbttn&ria COftStttutds de neiit&ttüS com ima fim^áo de ütivüf&Ci de iimiur (ffeavixide^ i
0. V >0 4J<0 A r/írtfífljtfO J ’f1 í tJfBVpgFf^ nrtrfí JKé númiu intaf de paramerm.i livrex da rede. Este primeiro resultado se deve a Cover (1968} e Baum e Haussler (1989). 1 ¿taponta que A represen fe urna rede de múltiplas camadas alimentada odiante cujas neurónios uliliLam uma/i/fifan de ativafdo xigmáide , । <P(v)-t--------—7 l + cxp(-t') ✓4 dimenaao fzC de S é OfW*}. tmde W7 é O número lolai de parámetma tivrea da rede. Este segundo resultado se deve a Koüran c Sontag (1996). Eles chcgaram a este resultado primeiro mostrando que as redes que consiste™ de dois tipos de neurónios, um linear e o entro utilizando uma fim^ao de ativa^ao de lim!^ já lem urna dimensao V-C propon? i cmal a W1. Este resultado é surpreendente, pois uma rede pinamente linear tem uma dimensao V-C proporcional a W como mostrado no Excmplo 2.2, enquanto que uma rede neural puramente de limiai tem uma dimensao V-C proporcional a KíoglTem virtude do resultado 1. O resultado desejade relativo á rede neural sigmóide é entao obtido invocando-se duas aproximadles. Primeiro, os neurónios com funpóes de at ivacio de lindar sio aproximados pelos neurónios siigmóides com pesos sinópticos grandes. Se- gundo, os neurónios lineares sio aprox uñados por neurónios ligmóides com pesos si ñipe icos pe- queños. O ponto importante a notar aquí é que as redes de múltiplas camadas alimentadas adianle tem uma dimensao V-C fin ita. Limites Construí i vos Independ entes de Distribuirse para a Habilidad^ de Generalizadlo de Máquinas de Aprendizagem blcste ponto da diseussio» achamos instruíivo considerar o caso especifico da classifica^o de pa- drees binArios, para o qual a resposta desejada é definida por d t {CL 1!. De uma forma correspon- dente, a fiinpao de perda tem apenas dois valores possívcis como mostrado por ÍO se F(i, w} = d caso contrario (2.90) Sob estas condi^ócs, o funcional de risco Jí(w) c o funcional de risco empírico 7?(w) definidos pelas Eqs. (2.72) e (2.74)» respectivamente, assumem as seguintes interpretares: * O funcional de risco J?(w) c a probabilidadc de erro de classificacáo (i.e., a taxa de erro), representada por P(w). • O funcional de rÍBCO empírico /? iiip(w) c o erro de tninanmlo (i.e., a freqücncia de erres feitos durante a sessao de treinamento), representado por
Agora, de acorde com a lei don gmnd&> números (Cray e Davisson, 1986), a freqüéncia empírica de ocurrencia de um evento converge quase ceriamente para a probabilidade real daquele evento quando o número de tentativas (supostamenDc i independen tes c idénticamente distribuidas) é feito infinitamente grande. No contento desta discussáo, este resultado significa que pana qualqucr vetor de peso w, que rufo dependa da conjunto de treinamento, c para uma prccisáo e > 0+ vale a seguíate condi^áo (Vapnik, 1982); H|nw) - v(w)| >()-»(} quando A1'—► « (2.91) onde Neo tamanho do conjunto de treinamento. Note, entretanto, que a cond\áo (2.91) nao impli- ca que a regra de classifica^n (i.e., um vetor de peso particular w) que minimiza o erro de traína- mentó v(w) também minimiza a probabilidade de erro de dassificaQio /Xw)- Para 11111 conjunto de treinamento de tamanho N suficientemente grande, a proxímidade entre v(w) e P(w) é conseqüén- cia de uma condi cao mais forte, que estipula que vale a seguinle condicac para qualqucr e > 0 (Vapnik, 1982); F(sup|Hw) - v(w)| > í) -* 0 quando V —► ™ (2.92) Neste caso, falamos de convergencia unt/árme dafreqüéncia de erres detreinamentopara o proba- bilidad? que v(w) = P(w). A no^áo de dimensao V-C fomeccum limite para a laxa de convergencia uniforme. Espccjfi- cálmenle, para o conjunto de fun^oes de elassifica^ao com di incnsao V-C A, vale a seguínte desigual- dade (Vapnik 1982, 1998): J’bup! F(w) - v(i*)| > e) < cxp(-t’N) (293) onde N o o tamanho da amostra de treinamento créa base do logaritmo natural. Queremos tomar o lado ¿írrito da desiguíddade (2,93) pequeño para N grande de modo a obter convergencia unifor- me. O fator cxpt-tW) c útil neste sentido, pois ele decaí exponencial mente com o aumento de .V. D fator reslanle (2eWA)A representa um limite para a fun^áo de crescimento Af(0 para a familia de fungues í? - {Hk w)í w € W’} para fS. h £ I como oblido pelo lema deSauer.** Desde que esta fun^áo nao crespa rápido demais, o lado dircito irá a zcro quando N vai a infinito; esta exigencia é salisfeita se a dimensfo VC h for finita. Hm outras palavras. uma dimensBc V-C finita cuma condi- £áo neccssária o suficiente para a convergencia uniforme do principio da minimizado do risco empírico. Se o espado de entrada íf i iver cardinal! dade finita, qualquer familia de dicotomias íf terá dimensao VC finila cm rcla^áo a \ embora o inverso nao seja ncccssariamcnte verdadeiro. Suponha que a represente a probabilidade de ocorréncia do evento sup|F{w}- v(w)| > e Entáo, com probabi kdade I — a, podemos afirmar que, para todos OS vetores de pesos w e *W, vale a seguinte desigualdade: P(w) < v(w) + c (2.S4) Utilizando o limite descrito pela Eq. (2,93) c a dcíini^áo para a probabilidade a, devemos cntáo lixar
(2-95) Suponha que eu(M h, a) represente o valor especial de t que satisfaz a Eq. (2.95). Dessa forma, fácilmente oblemos o seguínte resultado importante (Vapnik11992): SÍMA,«)= ^lüga (2.96) Referimo-nos a eJ^V, A, a) como um úrtervaJo de cuenca, cujo valor depende do tamanho jV da amostra de treinamento, da dimensáo V-C A e da probabilidadc a. 0 ¡imite descrito em (2,93) com t = A, a) é alcanzado no pior caso P(w) = mas nao, infelizmente, para F(w) pequeño, que na prática c o caso de interesse. Para Pfw) pequeño, um limite mais útil é obtido considerando-se urna modificado da desigualdadc (2.93) como segue (Vapnik, 1982, 1998): Jn.fIAw)-Kw)l (2.97) Na literatura, sm reportados diferentes resultados para o limite cm (2,97), dependendo de qual forma particular de desigualdade é utilizada para a sua derivado. Apesar disso, todos cíes tem uma forma similar. De (2.97) segué que com probabilidade I - Ot e simultáneamente para todo w € W' (Vapnik, 1992,1998), P(w) < v(w) 4- e/A1', A, tt, v) (2.98) onde í,(V, A, a, v) é um novo intervalo de órenla definido como segue, cm termos do intervalo de creída anterior, ^(N, A, a) (veja o Problema 2.25): tl(N,A1a,^ = 2E¿(.V,A1a) 1 + L v(w) JI+ j ,— V <(A'Aa) J (2.99) Este segundo intervalo de cren^a depende do erro de Lreinamenlc v(w). Para v(w) - 0 ele se reduz á forma especial €1(^,ft,a,0)=i4ei¡(JV,A,tt) (2.100) Podemos agora resumir os dois limites que derivamos para a taxa de convergencia uniforme: I, Em geral. temos o seguínte limite para a laxa de convergencia uniforme: P(w) í v(w) + ej/V, ht ot, v) onde e,(M A, ot. v) c definido como na Eq. (2.99). 2. Para um pequeño erro de treinamento i(w) próximo a zcro, temos v(w)+ 4tn(.V,A,Ct)
que fomece um Limite razoavclmcntc preciso para o caso real de aprendízagem. 3+ Para um cito de treinamento v (w) grande próximo á unidade, temos o limite Píw'l £ v(w) - t/M A, a) Minimizado E&trutural de Risco O erra de treinamento é a freqüéncia de Ciros cometidos por urna máquina de aprendizagem com um vetor de peso w durante a sessáo de treinamento. Análogamente, o erni de genemltzapto é definido como a freqücncia de erros cometidos pela máquina quando c testada com cxcmplos nao vistos antcriormcnic. Assume-se aquí que os dados de teste sAo retirados da mesma populado de onde foram retirados os dados de treinamento. Considere que estes dois erres sAo representados por v,icmJw} e v (w), respectivamente. Note que v|ciib,(w) é o wesntoque t<w) utilizado na subsefáo anterior; usamos ilw) ¡iqui para simplificar a nota^ao. Soja h a dimensao V-C de uma familia de fimeócs de classificacao ¡ F(x, w): w e W} cm relamió ao espado de entrada X. Entao, levando cm consideradlo a teoría sobre a laxa de convergencia uniforme, podemos afirmar que com probabilh dade 1 - a para um número de cxcmplus de treinamento JV> A c simultáneamente para todas as fun^des de classifica^áo /^x, w), o erro de ¡Mineralizado é menor que um rato garantido definido pela soma de um par de termos antagónicos (Vapnik. 1992, 1998) v (w}=v (w) + fc(.'VtA,ft, L' 1 ¿vyi' r IrEin.P * p IPJIFh' (2.101) onde o intervalo de trenca eJA'. A, a, vhlllH1) ó definido pela Eq. (2.99). Para um número fixo Ade exetnplos de treinamento, o erro de treinamento decresce monótonamente com o aumento da capa- cidade ou da dimensao V-C /i. enguanto que o intervalo de cren^a aumenta monótonamente. Consc' qüenlcmenk-, Unto o risco garantido como o erro de generalizado passam por um mínimo. Estas tendencias sao ilustradas de modo genérico na Fig. 2.25. Antes de alcanzar o ponto mínimo, o problema de aprendizagem c supgndeterrninadf^ significando que a capacidade da máquina h é pequeña detnais para ¡i quantidade de detalhrs de treinamento. Alcm do ponto mínimo, o prchiema de aprendizagem é aubdffermtnado porque a capacidade da máquina é grande domáis para a quam ti dade de dados de 1 reí lamento. AGURA 2 J5 UuSlragán da f¡l.i C¡10 antfV úrrfl de traína- menta, intervalo de cranga a risco garantido
O desafio ao se resolver um problema de aprendizagem supervisionada é, portante, realizar o melhor desempenho de generalizado adequandose a capacidad? da máquina com a quantida- de disponível de dados de ireinamento para o problema em questáo. O método de minimizado estrutur&i de risco forrtece um procedimiento indutivo para alcanzar este objetivo tomando a dimensao V-C da máquina de aprendizagem em uma variavcl de controle (Vapnik, 1992, 1998). Para serums mais específicos, considere um conjunto de classificadores de padroes {^(x1 w): w e 'W} e defina uma estrutura aninhada de h dcstas máquinas - (F(x, w): w e Wj, ft = l, 2„-, Ji (2-102) tal que tentamos (veja a Fig. ¿25) (2.103) onde o símbolo c significa “esta contido em-'. Correspondientemente, as dimenwes V-C dos clari- ficadores de padrees individuáis satisfazcm a ccndicáo VM (2 -104) O que implica que a dimensao V-C de cada clarificador de padrees c finita. Encao, o método de minimizado estrutura! de risco pode proceder como segue. * O risco empírico (i ,e„ o erro de treinamento) para cada class iffcador da padrües é mi ni mi zado, * O clarificador de padróes J* com o menor risco garantido é identificado; esta máquina par- ticular fbmece o melhor compromisso entre erro de treinamento (i.e., a qualidade de aproxi- mado dos dados de treinamento) c o intervalo de érenla (i.c., a complcxidadc da fúndan aproxima! iva) que competcm entre si. O nesso objetivo é encontrar uma estrutura de rede tal que o decresciino da dimensao V-C ocorra as cusías do menor aumento possívcl no erro de treinamento. O principio da minimizado estruturaI de risco pode ser implementado de varias formas. Po- demos variar a dimensáo V-C A, por exemplo, variando o numere de neurónios ocultos. Específica- mente, avallamos um cnscmblc de redes de múltiplas camadas totalmente conectadas para frente, ñas quais o número de neurónios cm urna das camadas ocultas é incrementado monótonamente. O principio da minimizado estruturaI de risco afirma que a melhor rede desre conjunto é aqueta para a qual o risco garantido é □ mínimo. A ti imensao V*C n&' ó apenas central para o principio da mini mizafao cstrulural do risco, mas também para um modelo igualmente poderoso, chamado de provavclmente aproximadamente cór- relo (PAC), tiste modelo, discutido na próxima sepilo, completa a última parte deste capítulo que trata dos aspectos probabilisticos e estatíslicos da aprendizagem. 2.15 MODELO DE APRENDIZAGEM PROVAVELMENTE APROXIMADAMENTE CORRETO O modelo de aprendizagem provavebneHie aproximadamente eomlo (PAC) é crediiado a Vahant (1984). Como o nome implica, o modelo PAC é uma estrutura probabílistIca para o estudo de
aprendizagem e generalizadlo «ni pístenlas de classificacáo binaria. Ele está intimamente relacio- nado á aprendizagem supervisionada. Coine^amos com um ambiente ró Um conjunto de SE é chamado de um coneefftj e um conjun- to do subcon ¡untos de si7 c chamado de uma cZíiWtf deenmeltos. Um exempínde um conccito c um objeto do dominio de interesse junio mente com um rótulo de elasse. Se o cxcmplo tur um membro do COneeilO, referimo-nos a ele como um exempte positiva-. se o objeto nao tbr um memhro do conceito, referimo-nos a ele como um exvmpin negativo. Um canee.Lo pira o qua'. sjc: fómcüidos exemplos c chamado de um concedo ít/víj. Podemos adquirir uma seqü^neia de dados de treiñámen- lo de compri mentó Ar para um conce ¡lo alvo e como mostrado por = {(«„<«,)}« (2.105) a qual pude conler exemplos repetidos. Os exemplos xp x,,..., xv sáo retirados aleatoriamente do ambiente í. de acor do com uma dislri buifáo de probaklidade fixa mas descemhecida. Os seg a untes ponías sito tamhéin dignos de nota na Eq. {2.105): » Ocaacciio-alvo c(x) e tratado como uma fiinfto de 3? para JO, 1}. Além disso, assume-se que c(xj seja. desconheeido. • Normalmente, assumosc que os exemplos sejam estilísticamente mdependentes, o que signi- fica que a densidade de próbahil dade Conjunta dé quaisquer deis exemplos, digamos, x c i. c igual ao pruduto de suas fungues de densidade de probabilidad? individuáis, So contexto de nossa terminología precedente; o ambiente pode ser identificado como o espado de entrada de uma rede neural co cenceño-alvo pode ser ídcniiflesdo enmo a resposta desejada da rede. O conjunto de ooocejics derivados do ambiente áf c denominado espado de conocí ton O espado de cunee tus pode cunlcr, portxcmplo, ”a letra A", Lla letra B” c assim pordianlc. Cada um desses conceitos pode scr codificado diferentemente para gerar um. conjunto de exemplos positivos c um conjunto de exemplos negativos. Na cstnjtura de aprendizagem supervisionada, cornudo, te- mos um nutro conjunto de conceitos. Uma máquina de aprendizagem típicamente représenla um conjunto de fuiiQÓcs. com cada fun^áo corrcspondcndo a um estado específico. Por excmplo^ a máquina pude serprojetadn para reconhecer "a letra A”, “a letra li" e assim por di ante, ü conjunto de todas as fun^ocs (i.e., conceitos) determinados pela máquina de aprendizagem ó denominado (yt/Wfo de hipáleses <8. o espago de hipóteses pode ou nao ser igual ao espado de conceitos. De certa forma, as no^fies de espado de cunceitus e CSpaqO de /iipólcsCs sáo análogas á funoáo /(x) c á tun^áo apruximaliva/F~(ji, w), respectivamente, que foram utilizadas na se^áo anterior Suponha cntáo que nos é dado um conccito-allvo cfi) £ que assumc apenas o valor 0 ou ]. Desojamos aprender este conccito por mcio de uma rede neural, tremando-a com o conjunto de dados J definido pela Fq. (2 105). Suponha que qO) e represente a hipótese correspondente ao mapeamento de entrada-salda que resulta do scu treinsmento. Uma forrnn de avallar o sucesso do processo de aprendizagem é medindo-M o quito perto a hipótese ^x) está do cunccito-alvo cfx). Naturalmente scráo cometidos erras, fazcndo-scg(x) t?(x). A razio para a ocnrréncia de éreos c que estamos lentaJido aprender urna funqío com base em informando limitada disponivel sobre aqucla fiinnáo. A probahilidade de erro de treinamento ¿ definida por vilcl,«,= e * cfr» (2.106)
PrüCLSSíJS- UE. A IfLEMDtZAGEM 129 A distribuK’ao de probabil idade resta cquaqao deve ser a mesma que c rcsponsávcl pela geracáo dos cxcmplos. O objetive da aprendizagem PAC £ asegurar que VHrtB soja normalmentepequato. O dominio que está dispo nivel para o algoritmo de aprendí/.agerú é Pont rolado pelo tamanho A da amostra de treinamento ?. Adictonaimcnle, Ibmece-scao algoritmo de aprendizagem dois parametros de controle: • Farámetm Je ¿m, t e (0,1 ]. tiste parámetro especifica o erro permitido em uma boa aproxi- mafáo do ecnecito-alvo c(x) pela hipótesc g(x). • Parámetrv deemtfa Ó e (0,1 ], Este segundo parámetro controla a probabilidade de se cons- truir uma boa aproximado. Podemos assim visualizare modelo de aprendizagem PAC como representado na Fig. 2.26, Com esta fundamcntaqáo, podemos agora formalmente formular o modelo de aprendizagem PAC (Valiant, 1984: Keams e Vazirani, 1994; Vidyasagar, 1997): PirdrnLlriTj ifc-LunlrulL A. fi í lipíXCEC FIGURA 2.26 Diagrama em Moco ilustrando o modato üc apreriditagfim PAC Considere que % seja uma elasse de conceitoü sobre o jimbicntc . Diz-sc que a elasse de conccilos '< pode ser aprendida por TAC se existir um algor ;mo ¿í com a seguinte propriedade: para todo coneeito-alvo c € para toda distribuido de probabil idade cm X c para todo 0 < t < 1/2 e 0 <5 < 1/2, se for fcimecido ao algoritmo de aprendizagem /. o cnryunln de exemplos de ireiciainentt.1 3" = {(x,, f. ( v, )} , e os parámetros c c 3. cntáo, com pnobabil idade de no mi n i mo 1 - o, o al gor¡ tino de aprend-^Hgpm jc praduzirú uma HipótCSC g COffl emi v ^e. Esta probabilidad? engloba 05 exemplos aléalo nos retirados do con.'unto 3 c quüiqucr alcalorudadc interna que possa existir no algoritmo de aprendizagem 2L O tamarilla da amostra A'deve ser maior que uma funcio de 8 t e. Em nutras palavras, de.'uie que o tamanho ,V da amostra de treinamento ST seja suficientemente grande, após a rede neural [cr sido tremada com aquele comunto de dados, c "provável1' que o mapeamento de entrada-saida calculado pela rede seja “aproximadamente córrelo’1. Note que, em- bora haja uma dependencia cm 3 c e, o número de excmplos, -V, nao c ncccssariamcnlc dependente do conceito-alvo c ou da distrihuiqáo de probahi Edade retal iva a T. Complexldade da Amostra Na teoría de aprendizagem PAC, uma questáo de particular interesseccm impl¡calóes práticas é a questao da compfexidade da amostra, O enfoque nesta queslao está sobre quantos exemplos aleató- ríos de\ cm ser apresentados ao algoritmo de aprendizagem para que ele adquira intbrmafáo sufici- ente para aprender um ccnccito^alvc deseo nhccido c cscolhido da elasse de cancel los S6. Ou aínda, quáo grande deve ser o tamanho Ar do conjunto de trcLiiamenlO 3^7
A questáo da complcxidade da amustia está intimamente ligada á ti imen sao V-C. Entretanto, antes de prosseguirmos sobre esta questlo, precisamos definir a noqáo de um conccito consistente. Seja íf = {(x,,¿f,)} ^. um conjunto qualquerde exemplus rotulados, onde cada x. s 3?e cada d¡ e (0, 1). Seja í? um conccito alvo sobre o ambiente cJ . Enláo, dizemos que o centello t ó consistente com o conjunto de treinamento rJ (cu, de forma equivalente* í7 c consistente com c) se para todo l < í < ;V tiramos e(x ) (Kearns c Vazarini. 1994). Por outro lado, contante que a aprendizagem PAC seja considerada, nao ú o tamanho do conjunto de fundes de entrada-salda calculável por uma rede neural que c crucial, mas sim a dimensáo V-C da rede. Mais examínente, podemos formular um resultado fundamental, em duas partes (Blumcr c al., 1 989; Anthony c Biggs, 1992; Vidyasagar, i 997); Conviden uma rede neural com uma dimensao V-C finita > I. 1, Qualquer algoritmo <lc aprendizagem l\h)j-¡siente para aqueta rede neural é um algoritmo de apretLilbzagcm PAC. 2. Existe uma constante f tal que um tanuinho sulkieiüu da conjunto de tr^inameniíi 3* para, qualquer algoritmo deste tipo c calculado por KLi P'l i .'l —I ólogl - 1+ (2.107) ondef é o paramcim de erro e 6 é o parámetro de cnen^a. A genera lidade dcstc resultado c impressi únanle: c aplicável a um processo de aprendizagem super- vi^ionada independen teniente do tipo de algoritmo de aprcndi/agcm uli Izado c da ¿islribuifáo de probabilidade responsávd. pela geraffio dos cxcmplos rotulados. É a grande generalidade dcstc resultado que o loman um loma de ¡menso interesse cien tí íleo na literatura de redes neurais. A comparado de resultados provistos para limites de medidas bascadas na dimensao V-C com resul- tados experimentáis rcvelam uma grande discrepancia numérica.14 De certo mudo, isto nao deveria surprccndcr. pois a discKpáncút é apenas um reflexo da natureza buiependente de distnbuican c piar case das medidas teóricas e, em ntédia. sempre podemos obler mcihores resultados. Complexidad^ Ccmputacional UrnaouLra questfio de interesseprimordial na aprendizagem PAC ¿a cumplo;idade computacionaL Esta questao se refere á eficiencia computad un al deum algoritmo de aprcnd:/agciin. Mais precisa- mente* a cwtidü.íitiutfe ctrinpuííh-'itrfíailida eoin o pior caso de '‘tempe de proccssamcnto" ncccssá- rio para iruinar uma rede neural (máquina de aprendízagem), dado um conjunto de exemplos rotu- lados de lamarillo finito JV. Em uma siluacáo prática, o tempe de processiunento de um algoritmo depende naturalmente da veloddade com a qual os cólcukis envolvidos sao realizados. De uma perspectiva teórica, entre- tanto, a intcncao c obter urna definióle de teinpn de processamentó que Seja indcpcndcntc do dispo- sitivo utilizado para realizar os cálculos. Tendo em mente esta considerado, o lempo de processamente, e conseqüentemcntc a cumplexiJadc computacional, é medido normalmente em ferinos do número de operares (adiQ3c&* multiplicacóes c armazenamentos) necessártas para reali- zar a computacáo. Estimando a complcxidade cumputacional de um algoritmo de aprcndizagcin, queremos saber como tía varia com o lamanhc m do excrnplo (i.?., o tamanho da camada de entrada da rede ncural trcinada). Para que, neste contexto, o algoritmo seja eficiente do ponfo de vista eomputacional, o
tempo de processamento deve ser O(mr) para um inteiro fixo r > L Neste caso, diz-se que o tempo de processamento crosee de forma pol i non i i al com mt Jo próprio algoritmo c denominado algoritmo de tempo polinomio!. Tarefas de aprendizagem realizadas por um algoritmo de lempo pol momia! sáo normalmente consideradas "fácei/’ (Anthony c Biggs, 1992). O outro parámetro que requer atenqto é o parámetro de em e. Enquanto que, no caso da complexidade da amostra, o parámetro € o fixo mas arbitrario, para estimar a complexidad^ computacicnal de um algoritmo de aprendizagem queremos saber Como da varia com e. Intuitiva’ mente, esperamos que quando e é reduzido, a tarefa de aprendizagem estudada se tome mais difícil. Consoqücntcmcntc,, devose imper alguna condiqáo para o tempo que o algoritmo leva para prudu- zir uma salda provavelmente aproximadamente correta. A condiqto apropriada para uma computa- pao eficiente é que o tempo de processamento seja polinomial em 1/t. Juntando estas considerares, podemos fazer a seguí nte afirmado formal sobre a complexi- dade compulaciOnal (Anthony c Eliggs, 1992); Um algoritmo de aprenii-zagcm é eficiente, do ponto de vista compulacionakcm rda^toao parámetro de erro e, ao tamanho m do exemplo e ao tamanho jVdn conjunto de treinamento, se o seu tempo de prrKcss^T'nÉrihj ir polirtomial érti JVe Sí CXÍSLif uní vdlcr de .V fS, eJ SuíiciúrtCt parí a aptttkLzagem PAC que scja polinptnial tanto em m como em e —L 2/16 RESUMO E DISCUSSAO Neste capitulo, discutimos aIgumas questSes importantes relativas ás muitas facetas do processo de aprendizagem no contexto de redes neurais. Com isso, cstabclecemos os fundamentos para grande parte do material restante dcstc livro. As cinco negras de aprendizagem, aprendizagem por correado de erro, aprendizagem boxeada em memoria, apteadizugem hebbiana. aprendizagem competitiva e aprendizagem de Boltzmann sáo básicas para o projeto de redes neurais. Alguns destes algoritmos requerem a utilizante de um professor c outros nao. O ponto importante c que estas regras nos permitem ir mui te além do alcancé vel por filtros adaplativa lineares, tanto em termos de capacidad? como em universalidadc. No cstudo da aprendizagem supervisionada, uma conducto fundamental é a existencia de um “professor" capaz de fornecer corre^oes exatas para as saidas da rede quando um erro ocorrcr, como na aprendizagem por correcto deem; ou de "liixar” em rela^to ao ambiente as unidades de entrada e de saída livres da rede, como na aprendizagem de Boltzmann. Ncnhum dcstcs modelos c possivcl cm organismos biológicos, que náo possuem as conexóes nervosas reciprocas exatas necessárias para a retropropaga^to das correqdes de erro {em uma rede de múltiplas camadas alimentada adían- te), nem os meios nervosos para imposicáo de comportamcnto pelo mundo exterior. Apcsar disso, a aprendizagem supervisionada cstabclceeu’sc como um paradigma poderoso para O projeto de rede neurais artificiáis, entino é demonstrado nos Capítulos de S a 7. Por cutro lado, regras de aprendizagem auto-organizada (nau-supen isionadM)> tais como a aprendizagem hebbiana e a aprendizagem compelitlva, sáo motivadas por considerares ncuiobiológicas. Entretanto, para aperfei^oar o nosso entendí monto sobre a aprendizagem auto- organizada, precisamos também buscar idéias relevantes na teoria da de Shannon. De- vemos menci uñar aquí o principio da máxima ñfórmafw mutua (íu/bmax) de Linskcrf 1988a, b), que fomccc o formalismo matemático para o processamento de informado em urna rede neural auto-organizada, de uma forma ate certo ponto análoga á transmissáo de informando em um canal de comunicado. O principio Infomax e suas variantes sáo discutidos no Capitulo 10.
Uma discussáa dos métodos de aprendizagem seria incompleta K rtáo mencionás&emüs 0 modela lie aprendizagem seietiva darwlniaw (Edelman, 1987; Reeke el al-, 1990). A je/efío é um principio biológico poderoso com aplicantes tanto na evcli^ao como no desenvehi mentó. Ela ocupa uma posifáo central no sistema imunológkc (Edelman. 1973), que é o sistema de recen tieci- menlc biológico mais bem entendido. O modelo de aprendizagem seletiv? darviniano é baseado na teoría da sele^ao de grupo neural. Ele prcssupdc que o sistema nervoso opera por unta forma de sele^áo similar ;i sele^^o natural evolutiva, mas que isto acontece dentro do cerebro durante o periodo de vida de cada ammal. De aconto com esta teoría, as unidades opcncionaÍB básicas do sistema nervoso nio sao os neurónios i sol ados, mas sim grupos localizados de células fort emente interligadas. A pertinencia de neurónios em um grupo é modificada pela alterabas dos pesos sináptico* dos neurónios. A competido local e a cooperando entre células sáo claramente necessárias para produzir ordenado local na rede. Uma cole^áo de grupos neurona! s é denominada repertóriQ. Gru- pos cm um repertório respondem methor a padrees de entrada superpostos mas similares, devido á natureza aleatoria do crescimento neural. Um ou mais grupos neuronais cm um repertório respon- den! a iodo padreo de entrada, assegurando assim que h aja uma resposta a padróes de entrada itáo- esperados, que podem scr importantes. A aprendizagem seletiva daiwinkinac diferente dos algoritmos de aprendizagem normalmente utilizados no projeto de redes neurais, porque ela assume que, por projeto, baja mui las subredes c que sumen le aquetas Com a resposta desejada sao sclccionadas durante o procedo de treinamento. Completamos esta discussao com alguns comentarios fináis sobre os aspectos cstatístícos e probabil!slicos da aprendizagem. A dimensáo V-C se eslabeleceu como um parámetro central na teoría estatistica da aprendizagem. Ela c básica para a minimizado estrutnral de risco e para o modelo de aprendizagem provavclmcntc aproximadamente correto (PAC). A dimensao V-C é urna parte integrante da teoría relativa is chamadas máquinas de vetor de suporte, discutidas no Capitulo 6- No Capítulo 7, discutimos uma elasse de máquinas de comité bascadas em reforjo, cuja teoría está fundamentada na aprendizagem PAC. A medida que avan^armos ueste livro, haverá mudas ocasiñcs c boas razocs para revisita! o material neslc capitulo sobre os fundamentos dos proccssos de aprendizagem. NOTAS E REFERÉNCIAS 1. O Icmui '‘algoritmo" é derivado dn irae do malemáiicn pena Mohammcd a I -Kcwí rtsini i, que vjvcu durante o sáculo IX c a quera se atribuí o desenvolví mentó das regras passo a posso para a adiQáo, subüacáo, multiplicadlo e d ¡visto de números decimai.H ordinarios. Qijundc) Sen nómt ll'ri escri Id em Istim, tofIMU-SC A Igorismus, do qual algoritmo C deriva- do (Harel, 1987). 2. A regra do vízinho mais próximo envolve urna ¡mensa Literatura; veja a colecto de artigas editados por Dasarathy (] w 1}. Este livro incluí o trahaihooriginal dt Fíx e Rndges (1951) c mu i tos outros arigot importantes sobre técnicas de cías*, i (icario de padriie? por vízinho mais próximo. 3. Para uma revisto detallada sobre sinapse* hebbianas, incluindo um reíala histórico, veja Bmwn «I al. (1990) e Frégnac e Schuiz (1994). Para maierial de revisto adiciona!, veja Constanlinc-faton et al. (1990). 4. Polencia^üjj de Longo Prazo — Evidencia FímdIógica para a Sinjpsc Hebbiima Hebb {1949) nos fnmeceuvtn modo de rcflctir sóbreos mecanismos de memoria sinópticos, mu futo ocurren quasc um quarto de socolo antes que fbsseobtida evidencia experimenta] que sustentarse suas proposlas. Em 1973. Blissc Lomo publicaran) utn artigo descreyendo uma forma de modificadlo sináplica induzida por rtivwffo em uma área do cerebro cha-
ni ada hipocampo. Eles aplicaran) pulsos de estimulado elétrica na maiar parte das vías que entram nesta estrutura, enguanta registravam as res.po$tas evocadas sinópticamente, Após se certificarem de (erem caracterizado urna morfología de raposea básica estável, cíes aphearam trena de pulsos breves, de alta íreqü&ncia. nestes mesmas vías. Quando retomaram a aplicad0 de pulsos de teste, canstalaram que as respn$ta$ eram muito malo- tes em ampl ilude, O mais interessante para os pesquisadores da memória foi o tato de que este efeito era de longa durad0- Eles chamaram este fenómeno de püleiKiu^au Je longo prüzO (PLP). Existen) agora centenas de artigos publicados anualmente sobre o fenómeno PLP» e sabemos muito sobre os mecanismos envolvidos. Sabemos, porexempla, que ofl efeftoe da potenciaría eslió restritas ás vías que sao ativadas. Sabemos também que a PLP aprésenla vanas propiedades assccialivas. Por propiedades associativas queremos dizer que ex És- ten) efeitos iterativas entre vías co-nrivaí- Em particular se uma entrada traca que nor- malmente nío induziria um afeito PLP cslivcr casada com uma entrada forte, a entrada fraca podará ser potencial izada. Isto é denominado urna proprieJaJe ítrípcíatrixi, pois é similar As propriedades associalivas dos sistemas de aprendizagem. Nos experimentos de condicLonamcnto de Plavlov, por exemplo, utn estimulo auditivo neutra (fraca) era disoci- ado a um estimulo forte (alimenta)- A MMCtado resulta va no aparcei menta de uma rer- posta condicionda^ salivad0 em resposla ao estimulo auditiva. Muito do trabalho experimental ne$ta ireu enfocan as propriedades associativas da PLP, A maioria das sinapses que demonstraran! suportar a PLP utiliza o glutaraato como neuroíransmissor. Ocorre, entretanta, que existen» virios receptara diferentes no neurónio pós-sináptica que respndcm ao glulamata- Todos osles receptares lem propriedades dife- rentes, mas nós consideraremos apenas dois deles. A resposta >máptica principal é induzida pela ativacáo do receptor AMPA (estes receptores sáo denominadas de acardo Cóm as drogas te quais cíes responden) mais fortcmcntc, mas sáo todos receptores de glutamato). Quando uma resposla é registrada em um experimento PLP, ela é atribuivel primariamente i ativado de receptores AMPA. Após a ativacao sinóptica, o glulamata c liberado e se liga aos receptores na membrana pós-sináptica. Abrem-se, entío, canais iónicos, que sáo parte dos receptores AMPA, resultando em um ílujto de córtente que é a base da resposta sináptics. O segunda tipo de receptar de gluiamato, o receptor NMDA, tem algumas proprieda- des interessantes. A liga^áo do glutamato com o receptor NMDA nóo é suficiente para abrir o canal iónico associado. Este canal se manten» bloqueada ate que uma diferente de tcns&o suficientemente grande lenha sido produzida pela alividade sináplica (cnvolvendo receptores AMPA). Conseqüememente, enguanto que os receptores AMPA sinquim tea- mente dependentes, os receptores NMDA sao tanta químicamente dependentes como tam- bán dependentes detensóo. Ncccssitamos de mais uma informafáo para enlendermos a importancia desta diíetenga. O canal iónico associada com o receptor AMPA está ligado á mov i i ttertíá£3o de íonsde sódia (que prUduz uscortentes sináptiCaS). O canal iónico ligado nr receptor NMDA permite que o cálete se mava para dentro da célula. Enguanta que o movimenta de cále ¡o também contribuí para as correntes da membranah a sua fun^o prin- cipa] é de um sinal que dispara uma cadeiade eventos que resulta em um aumento de tonga duraría na fün,a da respasm asociada com o receptar AMPA. Temos agora o nosso mecanismo para a sinapse hebbiana. O receptor NMDA requer lanío atrv idade pré-sináptica (liberado de glutamato) armu ativ idade pós-sináptica. Cama isto nonnalmente acorrería? Assegurando-se que baja urna entrada suficientemente forte. Assim, quando associamas uma entrada Traca a uma entrada forte, a entrada fraca libera seu próprio glulamata, enguanto que a entrada forte assegura que haja urna diferente de potencial suficientemente grande para ai i varos receptora NMDA asociados com asinapse fraca. Apcsar de a proposta origina] de Hebb ter sida para urna regra de aprendizagem em uma única directo, as redes neurais sáo muito mais ílexíveis se urna regra de aprendiza-
gern bidincional fjirussda. F. v¡inLü¡LiM < se icr sinapses nas quaiso peso sinóptico possa ser tanto diminuido como aumentado. É tranquiltz&dcr ¡saber que existe i:irnhérn evidencia experimental para uní mecanisrnu de depressito sinóptica. Se entradas iracas sáo air adas sem a ativa^áo combinada de entradas fortes, o peso sinóptico é frrqüenttmerue en Fraque- cid», Esto é típicamente observado na resposla á aiiva^óo de baixa freqüéncia de sistemas sinópticos, e o fenómeno ó chamado de depressav de i/mgí>prüzü (PI.P'l, Existe lambérn alguma evidencia para o que se chama de um efeibo de deprassóo heterossináptico. En' quinto que a DLI1 é urna depressao que é rcstrila á entrada ativada. a depreasáo heteriíssiuáptica é reslrita á entrada náo-alivada. 5, A idéi a de aprendiz?gem competí liva remonta aos trabaIlíos pioneircis de von der Malsbu^g (1973) sobre a auto-organizaijáo de células nervosas sensíveis á oritriiatfáo no uórtice estriado, de Fukushinia (1975) sobro umti rede neural de múltiplas camadas auto-organíkivel conhccida como neocognitivri, de Willshaw e von der Maisburg C197ó) sobre a forma^ao ile padróes de conexiies neurais por auto-orgaiiizaijáo e de ürossberg (1972,1976a,b) so- bre dasMÍLca^áo adaptativa de padrocs. Tatnbém luí substancial evidencia de que a apren- tl /agem uomper.iiva desempenhe um papel importante na tórma^áo de mapas liípográtí- cos no cerebro (üurtinet al.. 1989}c o trahalho experimental recente de Ambros-lngcrson et al, (1990) fcirneee i.¡>uficat!va fisiológicaadicional para a aprendizagem competitiva. 6. A utilizado de inibÍQáü lateral, como indicado na Fig. 2.4, c adaptada dos sistemas nrijrobiol¿>jtco&. A maior i a dos tecidos sensoriais, como a retina do olho, a cóclea di? ouvido e os nonos sensiveis á prcssáo da pele, c organizada de tal forma que a estimulado de qualquer Local prinluz inihi^áú fias células iWWM M:/irtha¡» (Arhib. 1939; FiSCHer c Firochcin. 1937}. Na pereep^á» humana, a iiiibicau lateral se man:fcsla atraves de um fenómeno chamado dentaos de Mari), denominado assim cm referencia a Emesi MacLi 11865). Se olhurncd, por exemplo. para uma lolha de papel metade branca e melado preui, veremos paralelamente i fronleira unía fui xa '‘mais clara que O claro’" nci lado branco c urna faixa “mais escura que o escuro*1 no lado preto. embota, na realidade. ambas lenliarti urna dens Liarle unifórme. A fainas ¿e Mach nao ex i s tem Físicamente; na verdaJc cías sao urna i I lisio de ótica, representando "sobrdevafócsH c "subclcvafócs" causadas pela afilo dent al iva da inibifáfl lateral. 7. A importancia da termodinámica eslatlhlica no «luda (los mecanismos cumputaeíonais fot rcccinhccida por John von Ncumann. Isto fica evidenciado pclatcrccira das suas cinco palestras sobre a Teoría c Orgait/za^t de AuHmiafus Compítanlos ji.l Un i veraily of I llinoi 5 cm 1949. Na sua fenecí ra palestra. Kíibre’T'eorias Estatistieas da Informafáo”. von Neumann disse: Conceitos termodinámicos prova vilmente entrarüo rusta nova teciriu da infonnufáo, Elá lurtes indica^lies de que a iiilbnnafái? é similar á enlmpí» e de que OS procesaos degeneratívcis d¡> entropía se cranpüram aos proccsws degenerativos no processamento da tnformafáo. Éprovávcl que nao se possa definirá fijt^áodé um sulAnnat». ou a sua eiic éjlc:;i, sem caracterizur o ambiente no qual irle [rahidhn pin mcío do traeos CStatís- ticos cinTiL» aqueles utilizados para caracterizar um ambiento na icrmcdinátirica. As variñveis cxtaúsiicas di? ambiente do tmtómalo serijo; c claro, um pouco mais compli- cad jsque .i víiriávd de temperatura da termodinámicapadtüo, itijs sera» similares cm carúlei. 8. Aparentemente, o termo "apTCIld¡zagüin jXir refir^íf" fo¡ cunhadn por Mtnsky (1961) írtl Muí estados iniciáis sobre : niel igfnc ar:i¡fi. ¡.il c entilo, deforma independente, pnr Wdltz c Fu {1965), na looria de coninile. Entretanto, a idcia básica de “reibr^cf1 tem Sun origen nolestudihs experiineniáis de aprendizagem anímahia psitolüyia (Hampwm, 1990). Ncste conlexin, i: pfírticul ármente csclarecedor recordarmos a clássica /« rfo efrjfrídc Thomdike (Thomdikc, 191 ]«p244):
Das d¡verana mpostes á mesma situado, aquelas que sao acompanhadus ou seguida* de porto pela salisft^íte ilr animal seriio, x o t estante tói igual. mais fbrtcnicntc conectadas com a situado, de forma que, quando a situante ticurrer novameiite, elas torio maitir pnvbíibilidade de ocorrcrem] aquetas que sao acompanTiíidas ou seguida* de perto por dexconforto para <i animal, se o reste for igual. [crio menor probabilidade de úcorrercm. Quanto maior foru *atisfacao ou o desccinforto, maior será o reforjo ou o eijíraqueclmenlo da ligado. Apesar de uño ser posslvcl afirmar que este principio fámula um modelo complete de cumpurtamente biológico. sua slmplicídadc e sua abonfagem de sonso comum o lewani a ser uma regra de apnendi/agem influente na abordagem elástica da írjwTwc/izffgcwpw reforja. 9. A saida da planta c típicamente uma variávcl física. Para controlar a plañía, precisamos evidentemente conhcce? o valor dcste variívd; isto é, devemos medir a laida da planta. O sistema utilizado para medir uma variivel tísica ó chamado de .verdor Por este motivo, para sentios preciaos, o diagrama em blocos da Fig. 2.13 deveria incluir um sensor no seu la^o de rcalimcnte^áo. Nós omn irnos o sensor, o que. por implica^ao. significa que aií-u- mimos que a tunero de transferencia do sensor é unitáru. lll. O ''fenómeno da festa de coqueteF1 w refere ¿ notávcl habihdade humana de atentar selelivamente para uma tonta de entrada auditiva c seguí-la, cm um ambiente ruidoso (Chcrry. l953;Cheny eTaylin. 1954). Esta hábil idade se man i festa cm urna combinado de tnés procesaos realizados no sistema auditivo: • íte^meniu^. O sinal auditivo incidente é segmentado cm canais individuáis com c.iiki canal pruvendo iufbrmsignificativa sobre un: ambiente do OUViilte. Dentro as heurislicas ur.lizadas polo ouvifllc para realizar esta segritenlacio. a espacial talvcí 5cja a mais importante (Moray, 1995). • Aten^üí). Diz respe i to ¿i habi.idailc de o om inte focalizar a ateneo cm um canal, enquanto bloqueia a atendió em cunáis i 11 elevantes (Chcrry, 1953). • Desvio. O tercciro proccsso envolve a hab lidadu de desviara atChfSo de um canul para outro. o que c provavclmente mediado de urna forma de cima para baixo pdo “Lhaveamertto'1 ¿o sinal auditivo incidente (Wood c Cowan, 1995). A conclusáo que se 1 ira dcsies ponfos é que o pniccssamento real Izado sobre o si 1 ia| juidi- tivo Incidente é realmente do tipo espado-temporal. 11. O problema de prújetar um í¡ I tro 1 inear Mimo que tornera a eslrutu ra teórica pata os filtros adaplfitivns lineare* foi concebido :iTÍmi-mínente por KobnOpOTOV (1942) e rcsoh ido um pouco depois de forma independente por Wiener (1949). Por ouiro ludo, uma soluto formal para o problema da filtragcm ido-linear ólimo c matemáticamente inlratávcl. Apo sar diüjío, noí (chis L95Ü foram. zc.ikziidos ijubaHios bi ¡Ltiaiiies na área por Zadeh (1953), Wiener e seus colaboradores (Wiener, 1958), c cutres que multo fizeram para esclarecer a naturcjzít do problema. Uabor foi o primeiro a conecte? ¡i idéta de um tlltro adaptar.vo nao-1mear cm 1954 e continúen] a trabalhar para construi-lo com ;i ajuda de colaboradores (Gabor el a]r| 1960). H.i'ii .luiente, Gabor prn-pó* .i .superávit) das i! .rlculdadc* matemálitas da Fillra^em adaptan va nao-linear con&truindo um t-ltro que olí miza sita resposta alravcs de aprcud i za gcm. A saida do filtro é cxprcs&a na forma fl N X onde.r(O), jc(í), .,„ x(.V) sfc anuisiras dii entrada do filtro. (Este polinomio é agora re ferenc i: ido ctimo o pofiníimin de Gnhrn-Knlmogomv OU féHir de ) O primeiro termo do polinomio representa um fillro 11near curacterizado por um conjunto de coelici-
entes jwj. O segundo termo caraclerizado par uní conjunto de coeficientes di índicos {u'n, f é nio- Linear: este termo contcm os produtos de duas amostro de entrada do filtro, C #Mim por di ¡inte, para oa leimos de ordem mais elevada. Os coeficientes do filtro sdo ajustados vía desdida do gradiente para minimizar o valor medio quadratico da diteren^a entre uma resposlaolvo (desejada) ¿/(A1) c a salda real do filtro jX-V). 11. A furwján de cusió /.(J, A{ i, w)) definida na Eq. (2.71) se api ica a uní escalar ¿ No caso de um vetor d como nesposta desejada. a fimflft aproximativa usfiume u forma de valor veioriaL F(x, w). Neste caso, utilizamos a distáncu cuclidiana ao quadrado £(d. F(i.w))=||d-F(s.w)|: como a fun^ao de penda. A fun^ao F(-. J éUma foníáo de valor vetori al de mus argumen- EOS. 13. De acorde com BltrgCS (1998), O Ejemplo 2,3 que aparecen primeiRímente ern Vapntk (1995) se deve a E. Leviti e J.S. Deriker. ] 4, O lim ile superior da ondem de HlogJF para a di mtnsw V-C de uma rede neural ali mentada odiante construida com unidades de Inniar I- -reares (pcrccptrons) foi o b ti Ja por Baum e HaUMler{I9R9). SuhüeqüiMlemenie, Maass (199J) mostrou que existe um limite inferior também da ordem de HlogíF para esta classe de redes. O primeino limite superior para a dimensao V-C de uma rede neural sigmóide foi derivado porMacintyre e 5ontag( 1993). Subseqüenlemenle, Koiran e Sontag{ 1996} abor- daran! umu queslao abena levantada por Maass (199,3); "A dimensio V-C de redes neurais analógicas com funcAo de aliva^ta u« J/J + « ' é limitada por um polinomio no número de parámetros prKigramávuis'?Lt Koiran c Sonlag responderán! afirmativamcnlc S esta questao no seu artigo do 1996, como descrito no texto. Esta questáo foi também respondida afirmativamente por Karpinski c Macintyrc (1997). Nlesle último artigo, tbi utilizado um método complicado bascado em topología diferencial para mostrar que a dimensao V-C de uma rede neural sigmúide usada como classificador de padrees é limitada acirna por O(K*). Existe um grande intervalo entre este limite superior c o limite inferior deduzido por Koiran e Sonlag (1996). Em Kaqpinski e Macintyre (1997) cnnjcftura-sf que aqucle I i mile superior pedería ser reducido. 15. O tonto tic Satter pode scr fbrmu lado como (Sauer, 1972; Anthony e B iggs, 1992; Vidvnsagar, 1997}: Considere que í? represente o oonj unto de dicotomías i mplementadas por uma máqui- na de aprendizagem. Se VCdiin(r?) — ir ctim h finito e l & lt S 1. cntáo a limeño de CTOKiment» i F(/) é limitada acima par (g//A)* onde cía base do logaritmo natural. 16. Nesta nota, apresentamüs o resumo de qualre importantes cstudos relatados na Literatura sobre a complexidade da amostra e as questfcs relacionadas A general iza^au. Prlmeim, Cobo e Tesauro (1992) ípresentam um cstudo ex per1 mental detalliado so- bre o valer pratico dos ¡imites da complexidad? da amostra bascado na dímeruiáo V-C como uma fcTramenta de projetó para clabsiñeadorex de padrees. Em particular, os experi- mentos ióram coocebidt^ para testar a relajo entre o desempenho de genenliziifSo de uma rede neural c q limíte de pifíf COJO. rrtJe^WrÑ/crtft' tfc distrif^ii^áfj derivado pela tcoria estaiística da aprcncnzagcm de Vapnik. O limite considerado é definido por Vapnik (IOS2) °U0íI.Ár,J (l)
onde é o erro de generalizadlo, A c a dimcnsao V-C c jYÍ o lamanho do arquivo de treinamento. Os resultados apresentados por Cohn c Tesauro mosttam que a desempeoro medio de generalizado í significativamente meltar do que aquele previsto pela Eq. (I). Segundo, Molden e Niranjan (1995) estenderam o cstudo anterior de Cohn e Tesauro abordando uma questáo similar. Entretanto, existem tres diferen^as importantes que de- vem ser destacadas: • Todos os experimentos foram realizados com redes neurais com resultados exalos conhccidos ou cun limites muito tans da dimensSo V-C. • Foram feitas cansidera(óes especificas com relaja au algoritmo de Aprendizagem. • Os experimentos foram bascados em dados reais. tiritara os resultados relatados lenham tornee ido prcv i ^ocs sobre a complexidad^ da amostra muito mais valiosas do ponto de V i sta próliuo do que aquelas íomecidas por teorías mais antigás, aínda ttá deficiencias significativas na teoría que neoessitam ser superadas. Tercdro, Baum e Haussler (1989) relataram sobre o tamanho .Vda amostra de tn:ina- mento ncccssario para (reinar uma rede de camada única al ¡ mentada adíame com neurón i os de limiar linear, obtendo boa genera. iza?ao. Supoc-sc que os exemplos de treinamento sSo cscolhidoS de vma distribuido de probabilidade arbitraria c que os exemplos de teste para avallar o desempenta de generalizado sao também retirados da mesma distribuirse. En- tao, de acordó com Baum e Haussler, a rede quase scmpnc aprcscntara boa gcncraliza^ao, desde que sejam saitisfciüis duas cundi^tas: (1)0 número de crios comeados sobre o conjunto de treinamento ¿ menor que c/2. {2) O número de exemplos, N, utilizado no treinamento é ( Hr f jV>Í?| —lúd — 11 (2) onde FFé o número de pesos sinápticos da rede. A Equa^fln (2) fornece para o tamanho TV um limite depior cwoi índependente de distribuífíiü. Tauibém aquí pode haverum^ enor- me diferen^a numérica entre o tamanho real da amostra de rreiriamento necessária e aque- le calculado pelo limite da Eq. (2). Finalmente, Bartlcit (1997) ahordou a questáo de que em tarefas de ciassificaQáo de padrees utilizando redes ncurms grandes, freqüentemente constatamos que uma rede é capaz de operar com sucesso com exemplos de treinamento que sao significativamente menores em tamanho que o número de pesos da rede, como relatado por Cohn e Tesauro (1992), No artigo de Barlett, mostra-se que naquelas tardas cm que redes neurais genera- lizan! bem e se os pesos s ¡nápi i eos nao forem muito grandes, é o tamanho dos pesos em vez do número de pesos que determina o desempenta de general i za^ao da rede. PROBLEMAS Regras de Aprendizagem 2.1 A regra delta descrita na Eq. (2.5) c a regra de Hcbb descrita na Eq. (2.9) representan! dois métodos diferentes de aprendizagem. Liste as características que distinguen! estas duas regras entre si. 2.2 A regra de aprend í zagem por correteo de cito pode ser implementada uti tizaodo-se in ibi- para subtrair a resposta desejada (valor-aho) da salda, c cntáo aplicando a regra anti- hebbiana (Mitthison, 1989). Discuta esta interprelaQSo da aprendizagem por correcto de erro, 2.3 A Figura P23 tnostra um conjunto bidimenstonal de pontos de dados. Parte dos pontos de dados pertence i classe ’É, e a outra parte pertence j classe Construa a fronteira de deciñ&j producida pela regra do vizinho mais próximo aplicada a esta amostra de dados.
14 Considere um grupo de pessoas cuja opiniio coleüva sobre um tópico de interesse é Reti- ñida como a media ponderada das opiniocs individuáis de MUS uiembros. Suponha que se, no decorrer do tempo, a opiniáo de um membro do grupo tender a concordar com a opi- niño eoleliva do grupo, a opinido diquele membro ganhará inais peso. Se. por outro lado, aquel c membro part 11 uLar disoendar de tbrm.i ¿ r i i s i '.lente da opi i niío cold iva do grupo, a opinifiQ daquele membro rcccbcra um peso menor, Esta forma de pondenacáo é equivalen- te ao controle uoiti leatinKntBQfio positiva, que produz um consenso de cpiiriio no grupo (Llnskcr. 198fia). Di-.cuín a analogía entre a situa^ño descrita e o postulado de Hebb de aprendizagem. 2.5 Uma forma generalizada da regra de Hebb édescrita pda relajo AwJít) = aFO'JJi)X?(ij(Fr)) - onde .v(n) c ,r.(nj sao es sinais pné’sináplicü e pós-sináptico. respeelicántenle; /() e <?() sao1 funfoci de scus résped i vos afúmenlos; e Aw^/n) é a variacñn producida no peso sináptico no tempo n cm ncsposla aos sinais .Y(n) Encontré (a) o pomo de equilibrio e (b) a dcprcssáo máxima, que sáo definidas por esta regra. 2.6 Um Sinal de entrada de umplilude unitaria c aplicado rupel idamente a uma coUCXÍO sinápl ica CUj4 valer inicial é também unitario. Calcóle a vnri¿i^áo nn tempo do pCbO sináptico Utili- zando as duas regras seguintes: (a) A forma simples da regra de Hebb descrita na Eq. (2.91 ass-umindú o parimetro de tana de aprendiz ¡ido F| w 0,1, (b) A regra da covariancia descrita na Eq. (2.1D}. assunnndo que a ativIdade pré-sináptica í = 0 e a atividade pós^sinápi ica r = 1.0. 2.7 A .íinapse hebbiana descrita na Eq. (2,9) cnvülvc o uso de retíItmcntaíáo positiva. Justifi- que a validarle tienta afínna^áo. 2,8 Considere a / pótese da covariancia para a aprendiziigem auto-oigan i/ada descrita na Hq. (2. W). Assunitndú a ergodicidade (i .e„ medias temporais pndem ser substituidas por medias de etisemble), mosire que o vakrresperado dedw(i na Eq. (2. lü) pode ser expresan como
ElAWjJ - - V * } Como vocfi interpretaría este resultado? 2,9 De acordo com Linskcr (198ó), o postulado de Hcbb de aprendizagem pode ser formulado como: AwJf-tiO; _rXx-ij + fl. onde j ir s3ooh tiñáisprt-sinápticoepós^sináptico,respectivamentee o hT[4x.ey. sSo lodos constantes. Assuma que o neurónio i í linear, como mostrado por =XW^Tr + “j onde n, é uma outra constante. Assuma a mesma distribuida o de probabilidade para todos os sinais de entrada, isto é, E]xJ = £"[x'| p. Suponha que a matriz C represente a matriz de covariancia dos sitiáis de entrada com o seo y-ésimo elemento definido por cf = ¿1(1, - - |1J] Determine 1.10 Formule a expressáo para a saída i do ncurór a j na rede da Fig. 2-4. Vpce pode uti liw as seguintes representares: X, = r-csimo sinal de entrada w.. peso s mápl i co da entrada j para o neurónio j eÁ. peso da conexáo lateral do neurónio k para o neurónio j ü campo local induzido do neurónio j v = <?(».) Qual é a candido que deve ser satisfcita para que o neurónio j seja o neurónio vencedor? 2.11 Repita o Problema 2-10. assumindo que cada neurón lo de saída i ncLua auto-reíi I miéntatelo. 2.12 O padrflo de conex&o para a inibif 3o lateral, ou scj a "cxcita^ao próxima c üübíflo alta- da11, pode ser modelado como a difcrenfa entre duas curvas gaussianas. As duas curvas tcm a mesma árcah mas a curva positiva pira ;i excita^So tcm um pico mais alto e mais estrello do que a curva negativa para a inibi^ao. Isto í, podemos expresar o padr&) de conexao coma onde xí a distancia a partir do neurónio responsável pela in i b i f áo lateral. O padreo JP(.r j c utilizado para varreruma pagina, sendo que metadedeh é branca e a OUlta metade é prefa; a fronteira entre as ditas metades é perpendicular ao cixox. Trate a laida que resulta deste processo de varredura com l c o, = 2. Paradigmas de Aprendizagem 2.13 A Fig. P2-13 mostra O diagrama cm hincos de um aialema adaptalivo tiv aqui.iifáo de tingHügem (Goniu 1992). As concxocs s:náplicas na parte da rede neural do sistema sao fortalecidas ou enfraquecidas, dependendo da reallmenlaQfo relativa á adequa^áo da res* posta da máquina a estímulos de entrada. Irsle sistema pode üervisLu Como um exemplo de aprendizagem por reforjo. Rcflita sobre a val ¡dude desta ¿firma$í¡o.
FIGURA P2.13 2.14 A qual dos dois paradigmas aprendizagem com uro professor c aprendizagem sem um professor, pertence cada din dos segu le i tes algoritmos? Justifique as sius respostas. (a) rt^ra dts vizinho mais próximo (t>> regra dos k vizinhos mais próximos (c) aprendizagem hebbiana id} regra de aprendizagem de Bol tzmann 2,15 A aprendizagem nito-fiupervisiórtada pode ser implcmcntada em ama forma “cm tempo de cxccu^o" (onJíne) ou “fóra do tempo de cxccufáo“ (aff'iiné), Discuta as implicat;ócs físicas desías duas posibilidades. 2.16 Considere £H difículdades que uma máquina de aprendizagem enfrenta un atribuir crédito para o resollado (ganho, penda ou empale) de um jogo de xadrez, Discuta as noyóes de atribuirán de crédito temporal e atribuLfiio de crédito estrutural no contexto deste jogo. 2x17 Urna tarefa de aprendizagem supervisionada pode ser vista como uma tarefa de aprendiza- gem por nfitaQO utilizando como sinal de reforjo urna medida da proxltn idade da resposta atual do sistema cm relajan a resposLa desrjada. Discuta esta rela^ao entre aprendizagem supervisionjda e aprendizagem por rcfDT$D, Memária 2,18 Considere os scgumtes conj untos ortonormais de padrocs^chavc. aplicados á memoria por matriz de correlajáo: s,—[1,0.0,0]r x,-(Ú, 1,0,0f xj-[0, 0, hD]r Os respectivos puchóos armazenados sao y, - [-2, l,ftjr (a) Calcule a man :/ de memoria M. (b) Mostré que a memória assoeia perfeiiamente. 2.19 Considere novamente a memória por matriz de correlato do Problema 2J R. O estimulo aplicado A memória é uma verafo ruidosa do padrio-chave t, como mostrado por t‘-[0.Rt-0,l51 0,15> -0,2Ü|r (a) Cakulc a rcsposla da memoria y.
(b) Mostre que a resposía y é a mais próximo do padráo yL no sentido euclidiana. 1.10 Uma memória auto-associativa é tremada com os seguintes vctores-chavc; la t] = i[l,-L V&] (a) Calcule os ángulos entre estes vclorcs. Quáo próximos esláo da situado de orlagonalidadc cnlre cks? (b) Utilizando a generalizado da regra de Hcbb(i,e., a negra do produto externo), calcule a matriz de memória da rede. Investigue o quáo próximo da perfei^áa está a auto- aasocia^áo da memória. (c) Uma versáo mascarada do vetor-chave x . isto é„ i-[D-3j3]r é aplicada á memória. Calcule a resposta da memória e compare o seu resultado com a resposía desejada I . Adaptarse 2.21 A Figura P2.21 mostreo diagrama em blocas de um sistema adaptativo. O sinal de entrada pera o mídete previsor £ definido pelos ralores. pasados de um procera), como mostrado por l(B - 1) - Mjt - I), .r(/r - 2),4» - A saida do modelo, tío), representa uma estimativa do valor presente, x(n), do processo. O comparador calcula o sinal de erro -Xrr) - í(n) que, por sua vez, aplica uma cocregSo aos parímetms ajustareis do modelo- Ele lambón fomece um sinal de salda para transferencia para o próximo nivel de processamento neural, para fíns de inlcrpreta^So. Repetí odo esla operario cm uma íonna nivel pornirel, a iníbr- mac&o proce&sada pelo sistema (ende a ser de qualidade progresslvamente melhar (Mead, 1990). Prwncha m s delalheü du nivel seguinle de processarnento de sinal bo descrita na Fig- P2.2I. Teoría de aprendizagem eetatística 2.22 Segulodo um proeedimento similar áquele descrito na derivaría da Eq. (2.62) a partir de (2.61), derive a fórmula para a fimofin de méd.ia de enstmble /Hx, T)) definida naEq. (2-66). 2.23 Nestc problema, desejamos calcular a dimensáo V-C de urna regiflo retangular alinhada com um dos eixos no plano. Mostré que a dimcnsao V-C destr enneeilo ó quatro. Vocc pode íazer ísso considerando o seguirte: (a) Quatm pontos em um plano c uma dicotomía realizada por um retangulo al inhado cam um cixo.
Sitial de uida FIGURA P2.21 i h j Quatrc> potitos em udti plano, para os qua i s nao existe uma dicotomía realizavcl por um rclangulo alinhado a um eíw. (c) Cinco ponfos cm um plano, para os quais tambúm nao existe uma dicotomía rcalizá- vi;l por um retinyulo al inhado a um eixo. 1.24 Considere um classitícador linear de padrees binarios cuja vetar de entrada x tcm dimen- sao ffj. O primeiro elemento do velnr I t constante e fixo em urna unidad?, de Forma que ti pesa correspondente do clasificador introduz um bias. Qual é a d metisáo V-C do classiti- elido? cm relajan eio espado de entrada? 2,25 A des: juaklade (2,97) definí u m. |l i ffliie para a laxa de Cilnvergéi)C i a uní forme, que é Risica para o principio da minimizacio de risco empírico. (a) Justifique a validade da Eq. (2.9S). assumindo que valha a desiguaIdade (2.97). (h) DerívC ¿i Fiq. (2,99) qilC define o intervalo de cíenla * 2.26 Continuando com o Excmplo 23, mostre que os qualro pontos uniformemente espadados da Fie. F2.26 nüo podem ser separados pela tamiliade fundes indicadoras de um parámetro /{X.tí}. d € R. 2.27 Discuta a relajo entre o dilema bias-variáncia e a minimizado estrutura! de risco nn Contexto da regressiio niu-lineur. 2,2$ ( ü) Um algoritmo ui i liado pitra ireínar uma rede de múltfpl afi camadas a I .mentada ad i an- te cujos neurónios utilizam uma tunQáo sigmóide pode ser aprendido por PAC. Justi- ilque a val¡dade desta afirmaba». (b) Voce pode Inzer uma afinria^áo si m ¡lar para uma rede neural arbitraria cujos neurónios utilizam uma fnneao de ativa^an de Iiiniar^' Justifique a sua nesposta. 12 3 4 I---0--0--*--O x-0 AGURA P2-26
CAPÍTULO 3 Perceptrons de Camada Única 3.1 INTRODUQÁO Nos ariús fórmativos das redes neurais (l 943-1958)+ virios pesquisidores se sohressafram por suas conTribuÍQóes pioneiras: • McCulloch e Pius (1943) por introduzirem a idéia de redes neurais como máquinas cocnputacionais. • Hebb (1949) por postular a primetra regra de aprendizagem auto-organizada. * Roscnblatt (1958} por propor o pcrccptron como o pnmeiro modelo para aprendizagem com um professor (i.t,. aprendizagem supervisionada), Ü impacto do artigo de McCulloch-PittS sobre redes neurais foi realzado no Capitulo I. A idéia da aprendizagem hebbiana foi discutida com alguma extensao no Capítulo 2. Neste capítulo, discuti- mos o perceptmn de Rosenhlatt. O pcrccptron c a forma mais simples de uma rede neural usada para a ciassitica^ao de padrees ditos ibuanwtíeseparáveis (i.e., padrees que se encontram em lados opostos deum hipcrplano). Básicamente, ele consiste deum único neurónio com pesos sinópticos ajusta veis e bias. O algoritmo usado para ajustares parámetros livncs dcsta rede neural aparcccu prime i ro cm um procedimento de aprendizagem desenvolvido por Rosenblatt 1962) para o seu modelo cerebral do perceptrcn.1 De fato. Roscnblatt provou que se os padrees (vclorcs) usados para tremar o pcrccptron sao retira- dos de duas classes I ¡Reármente separáveis, enláo o algoritmo do perceptron converge e posiciona a superficie de deciisao na forma de um hiperplano entre as duas classes. A prova de convergéncia do algoritmo c conhccida como o teorema de convergencia da perceptron. O pcrccptron construido em tomo de um único tteumnio ó limitado a realizar dasnificatfo de padrdes com apenas duas classes (hipóteses). Expandíndo a camada do (Computaijao) saida do pcrccptron para incluir mais de um neurónio, podemos correspondentemente realizar classilicafáo com mais de duas classes. Entretan- to, as classes devem ser Imearmcntc separaveis para que o pcrccptron funciono adequadamento. O
ponto importante ¿ que. na medida em que consideramos a teoría básica do perccptron como um clarificador de padrees, ncccss Llamos considerar apenas o caso de um único neurónio. A extensfio da teoría para o caso de mais de um neurónio é trivial. O neurónio único também forma a base de um filtro adaptativa, um bloca fuñe i anal que é básico para o tema do prncexnamento de sinais.. que está scmprc cm expansáo. O desenvolví mentó da fíltragem adaptad va deve muito ao ciánico artigo de Widrow e Hoff i I 960), por criar o chamado algoritmo do quadrado medio {LMS, temt-mean-xquare),. também confíen i do como a regra delta. O algoritmo LMS é simples de implcmentar c no cntanto muito efetivo cm rclaqáo á sua aplica^áo- Realmente, ele é o carro efíefeda fíltragem adaptativa tincar, linear nc sentido de que o neurónio opera no seu modo linear. Os filtros adaptad vos tém sido aplicados com sucesso em cam- pos filo diversos como amenas, sistemas de comunicasáo, sistemas de controle, radar, sonar, sismología e engenharia biomédica (Widrow c Stearns, 1985; Haykin, 1996), O algoritmo LMS c o perccptron sao naturalmente inter-rclacicnadüs. Por ¡Sso, éapropríado que os csludcmos juntos cm um capítulo. Organizado do Capítulo O capítulo está organizado em duas panes. A priincita pane, que consiste das Sc^ocs 3,2 a 3.7, trata dos filtros adaptalivus lineares c do algoritmo LMS. A segunda parte, que consiste das Se^cs 3.8 a 3 JO, trata do pcrceptron de Resentíate. Do ponto de vista de apresenta^o, acharaos mais conveni- ente discutir primeiro os filtros adaptativas lineares e depois o perceptron de Rosenfílatt, invertendo a ordem histórica de como surgí ram. Na Seqáo 3.2, abordamos o problema da fíltragem adaptativa, seguida da Se^ao 3.3, uma revisto de tres técnicas de otimiza^o irrestrita: o método da descida mais ingreine, o método de Newton e o método de Gauss-Newton, que sáo particularmente relevantes ao estudo dos fillros adaptativos. Na Scqáo 3.4, discutimos um filtro linear de mínimos quadrados, que se aproxima de forma assin[ótica do filtro de Wiener, qnandú o tamañito dos dados aumenta. O filtro de Wiener torneee uma estrutura ideal para o desempenho de filtros lineares adaptativos operando cm ambien- tes estBcionáriios. Na Seqáo 3.5, descrevemos o algomtmo LMS, incluirido uma discussáo de suas virtudes c limitafocs. Na Sc^áo 3.5, exploramos a ideia de curvas de aprendizagem, utilizadas normalmente para avqliar o desempenho de filtros adapiativcs. Seguc entáo uma discussáo sobre esquemas de rceozimento (fánnAiíing^) para o algoritmo LMS, na Sccáo 3.7. A seguir, passando para o perceptron de Ro&enblalt, a Se?3o 3,8 apresenta algumas considcra- fSes básicas envolvidas na sua opera^áo. Na Sc^ao 3.9, dcscrcvcmos o algoritmo para ajustar □ vetor de pesos sinápticos do pcrccptron para a classificaqáo de classes linearmente separáveis e demonstramos a convergencia da algorr me. Na 3.11),consideramos a relaQáo entro o percepción c o clasüificador bayesiano para um ambiente gau.uiano. O capitulo é concluido com um resuma e uma dtKUMSo final na Sc^ao 3.11. 3.2 O PROBLEMA DA FILTRAGEM ADAPTATIVA Considero um inferna dinámico cuja caracterizado malemática c descanhecida. ludo do que dis- paraos sobre o sistema c um conjunto do dados de entrada-saida gerados pelo sistema cm instantes de lempo diséñelos a uma taxa uniforme. Especiticamente, quando um estímulo m-dimensional x(f) é aplicada através das m nós de entrada do sistema, o sistema responde produzinde urna salda
Entrada Salda JV) FIGURA 3 J ( h} Sistema dinámi- co descoiNccidü. (bj Grafo d& lloxo de sinal do nwdaío adaplativo para o sistema escalar<^(0- onde í 1,2,.,., «T... coma representado na Fig. 3. la. Assim, o ccmportamento extemo do sistema é deserto pelo conjunto de dados J: {x(0, (3.1) onde xjj)]r As amostras compreendidas em ÍJ pan idénticamente distribuidas de acardo com uma leí de proba- bilidade desconhccida. A dimensáo m relativa ao vetar de entrada x(r) é referida como a dimensionalidade do espado de entrada ou ^mpl estríenle dimensionülidade. O estímulo Wj pode aparecer em uma de duas formas fundamentalmente diferentes, urna espacial e a outra temporal: • Os m elementos de i(í) se originam em diferentes pomos do espado; neste caso, Talamos de he(í) como um instantáneo de dados. • Os m elementos de x(j) representara o conjunto do valer presente c dos (m - I) valoras passa- dos de uma excitado, que sfio uniformemente espadados no tempo. O problema que abordamos £ o de como projetar um modelo de múltiplas entradas-única salda do sistema dinámico desconhecídoT construíndo-o em tomo de um único neurónio linear. O modelo neuronal opera sob a influencia de um algoritmo que controla os ajustes neccSsários dos pesos sinápticos do neurónio, considerando os seguintes pontos: • O algoritmo inicia com uma configurando arbitraría para os pesos sináplicos do neurónio. • Os ajustes dos pesos si nápt i eos, em resposta a varia^des estatlsticas do comportamento do sistema, sao Jeitos de uma Forma continua (i.fc, o tempo c incorporado na constituicáo do algoritmo). * Os cálculos dos ajustes dos pesos si nápticos sáo completados dentro de um intervalo de tempo que c igual a um periodo de amoEtragem.
O modelo neurona] descrito é conheiido temo um filtm adapiat Iva. Apesar da describan ser apre- sentada no contexto de urna tarefa claramente reconhecida como de identificaban de sistema* a caracterizado do Rltro adaptativo é suficientemente genérica para ter ampia api ¡cacao. A Figura 3.1b apmcnra um grato de íluxo de .a i nal do filtro adaptativo. A sua operacSo consiste de dois procesaos continuos: I. ftiK££ft» defitragem, que envolive a computacao de doi.s sinais: • Uma saida, representada porv(í)P que é producida em nesposta aos m elementos do vetor de estimulo je(í), isto é. x/í), r/Ov-T • Um sinal de erro, representado por é obtido comparando-se a saida y(0 com a saida correspondente d(f) produzida pelo sistema desconhecido. Na verdade, cí(j) age como uma nrupasta defcfada ou ainai-alvo. 2. Prvcessü adaptativo* que envolve o ajuste automático dos pesos sináplicos do neurónio, de acorde com o sinal de erro ¿(í). Assim, a combinado destes dois procesaos amando juntos constituí um laca de reídiinentabíio que age cm tomo do neurónio. Como o neurónio ó linear, a saida _iVi c chatamente a mesma que o campo local induzido ®(j); isto é, JK iV) = »!(O = ^^(j}rt(0 (3.2) i-i onde W^r),lt\(0 sao os m pesos sinápticos do neurónio, medidos no tempo i. Na forma matridal podemos expreiMr.HO como um produto interno dos velares x(r) ewfl) como segue: *V)= x'ÜXO (3.3) onde w(r) = [w HJa(rV+ WJOF Note que a notaeáo para um peso sináptico tbi simpl ifícada aq;n. nUn Liicluindo um índice adicional para identificar o neurónio, p^is Iidamos com apenas um único neurónio. Fsta notafao será seguida em Lodo o capitulo. A saida do neurónio v(i) é comparada com a saida correspondente d(i} rebebida do sistema desconhueido no tempo <. Típicamente^ i^j) é diferente dt ¿Acom isso* esta compara- do resulta no sinal de erro: (3.4) A mancira pela qual o smal de erro <(j) é utadn para controlar os ajustes dos pesos sináptieos do neurónio é determinada pela fundió decusto utilizada para derivar o algoritmo de filtragem adaptativo de mlcresse. Esta quesffin está ¡intimamente relacionada com a da utimizacáo. É, portante, apropi- ado ¿presentar uma revi sao dos métodos irresiritos do otimiza^áo. Este material é aplicável nao somente aos filtros li meares adaptativos, mas também as redes neurai.s em geral.
3.3 TÉCNICAS DE OTIMIZAQÁO IRRESTRITAS Considere uma fuñado de custo ^(w) que su a uma fon^áo continuamente diferenciávei de um vetor de peso (parámetro) doconhccido w. A fun^áo í (w) mapeia os elementos de w em números reais. Ela é uma medida de como escolher o vetor de peso (parámetro) w de um algoritmo de filtragem adaptativa de modo que ele se comporte de urna mancira ótiina. Queremos encontrar a solu^áo ólima w* que satisfaz a condigno «{»*)< '«(w) 0-5) Isto é, precisamos resolver um problema irrestrito de ottouzai¡áü, formulado como segue: Minimiza afumado de custo ^(w) em retando ao vetor de pesos w (5.6) A condifáo necessária para a otimiza^áo é W<w*)-0 onde V é o operador gradiente: (3.7) ¿) ¿ ¿íir. 1 ¿nú,1 e V^6(w) é o vetor gradiente da fortQáo de custo: (3.8) (3.9) Urna classe de algor i irnos de oiimizacao irrestritos que c particularmente adequada para o projeto de filtros adaptativos é baseada na idéia da descida Iterativa local: Iniciando com uma su/xmi^afi inicia! mpresemuda por w(0), gerg u?jjít seqüéncfa de vetares de pesa w(I}, w(2)r.demadaqucafuncüúde cusíaí(w)seja redmidúúcadaiterandodo algoritmo, coma mostrado por fá(w(jT+l)) <«(»(«)) (3.10) onde w(rt) <? o valor anligo do vetar de pesa e wín + 1) i a sea valor canalizado. Esperamos que este algoritmo eventualmente conviija para a solucao ótima w*. Dizemos “espera- mos” porque há uma nítida possibilidadede o algoritmo divergir (i.e.t se tornar insiávcl) a menos que sejam tornadas prccaucccs especiáis. Ncsta scvaob descrecemos tres métodos irrestritos de climiza^áo que se basciam na idéia da desoída iterativa de uma forma ou de outra (8ertsekast 1995a).
Método da Desoída mais íngreme No método da desoída mais íngreme. oí ajustes sucesivos aplicados ao vetor de peso w sao na diredáo da dése ida mais íngreme. isto é, em uma dirc$ao oposta ao vetar da gradiente V¥(w). Por conveniencia de apre&entefao. escrevemos K-W(w) (3.1l) Corrcspondentemente, o algoritmo da desoída mais íngreme é descrito formalmente por w(n + |) = w(ff) - qg(a) (3.12) onde T] c uma consume positiva chamada de tamanho da pa.v.w ou parámeiro de tara de uprendíza- gem¡, e g(/r) é o vetor do gradiente calculado no ponto w(n). Passando da itera^ao n para n + I, o algoritmo aplica a carreado Aw(n) = w(h +1) - w(/r) -W-0 ,5,3) A Equa^áo (3.13) é na verdade uma describo formal da regra de correQác de erro descrita no Capítulo 2. Para mostramos que a fomula?ao do algoritmo da dése ida mais íngreme satisfaz a conditfo de (3.10) para a desoída iterativa, utilizamos uma expansao cm serie de Taylorde pnmcira ordem cm Como de w(n) para ápróxirnar - I)) como < 1}) -¥(w(rt}) + fiWw(rt) cujo uso é justificado para T] pequeño. Substituirá Eq. (3.13) nesta rclacáo aproximada praduz í. (w(n + L)) = (w (»)) - Hg' (« )g(") = ^(w(ft))-r|||g(f0||í a qual mostra que, para um paramclro de laxa de aprendizagem positivo T), a luncáo de custo decres- ce quando o algoritmo evolui de uma Uera^o para a próxima. O raciocinio apresentado aquí é aproximado, pois este resultado final só é verdadeiro para taxas de aprendizagem suficientemente pequeñas. O método da dése ida mais íngreme converge lentamente para a solu^ao ótima w*. Além disso, o parámetro de caxa de aprendizagem p tem uma influencia profunda no seu comportamento quanto á convergencia: « Quando q é pequeño, a resposla transitoria do algoritmo é Sahreamortecida, sendo que a [rajclória Hadada por w(/i) segué um caminho suave no plano ¡V, como i lustrado na Fig. 3.2 a. • Quando T] c grande, a resposta transitoria do al goritmo é muiutrnt¡rteeidu, sendo que a Irajctória de w(¿r) seguc um caminho ziguczagucantc (oscilatorio), como ilustrado na Fig. 3.2 b • Quando r, excede um valor critico, o algoritmo se toma instavcl (i.c.t diverge).
i . i1 _ 1 ! L t b J . -J |l 1 II 1 I- : \ 1 fe ü'3 L fi=Ü\//^ ft= 1 ff - ? 4.CJ Ü “l (l Jfl 4.Q («) a) i ! Jr'TrTJÍX I I I J I 1 r l i 1 1 F e e ll F O — ÍN ir - t t K ' 1 1^——
Método de Newtcrn A idéia básica do método de Nwtfm c minimizar a aproximado quadrática da fundo de custo fí(w) em torno do ponte córreme w(w); esta nunimizagáo é realizada a cada iterad^ do algoritmo. Específicamente, usando a expansaü de Taylor de segunda ordent da fundo de cusió cm torno do ponto «00, podemos escrever tf(wOO) = $ (»'('»* l»-l(w(n)J — gr(/i)¿w(N) + —Aw7(.rr)H(n)Aw(n) í$.14) Como anteriormente, g(fl) é um vetor gradiente m-por-l da fundo de custo ig(w) calculada no ponto w(rt). A matriz EI(n) é a matriz htnsiana nt-por-M de ^(w). tamben) calculada no ponto w(n). A hcssrina dc%(w) é definida por H = VJ£(w) ... 1 — 1 iT! íhi.yhr. fhlMíhí! - m y* r?JÍ‘ ííw. í)w JiC, m x (3.15) A Equa^áo (3.15) requer que a fundo de custo ^(w) seja duas vezes continuamente difcrenciável em relacáo aos elementos de w Diferenciando2 a Eq. (3.14) cm rolado a A", a variac^u Afí{w) é minimizada quando g(n) - H(n)AwQr) = 0 Resolver esta equacüo para Aw(n) resulta Isto ó, Aw(n)--H -0?te(n) w(rt + l) = w(rt) i Aw(jt) = wW-ií'i{'0s('0 (3 16) onde H-'(n) é a inversa da hessiana de 'tf(w). Genéricamente la lando, o método de Newton converge tapidamente de modo assintótico e ndo exibe o comportamcnto ziguczagucantc que algumas veres caracteriza o método da desoída mais ingreme. Entretanto, para que o método de Ncwton funcione, a hessiana H(n) deve scr uma matriz definida pw i fívamenié* para lodo ji. Infelizmente, em gura!, nao :iá garantía de que H(w) seja definida positivamente para toda ¡teracao do algoritmo. Seabessiana Húi) náo é definida positiva- mente. é necessária uma modificado no método de Ncwton (Powcll, 1987; Bcrtsckas, 1995a),
Método de Gauss-Newton O método de Gauss-Newton é aplicável a uma fun^ao de cusió que é expressa como a soma de arros quadradas. Seja = (3J7) ¿ í=i onde o fator de escala 1/2 ¿ incluido para simplificar a análise subseqüente. Todos os termos de erro nesta fórmula sao calculados com base no vetor de peso w que é fixo dentro de todo o intervalo de observado l á íí n. O sinal de erro efí) c uma fun^ao do vetor de peso ajustávcl w. Dado um ponto de operaban w(n), lincanzamos a dependencia de e(t) em relajo a w escrevendo —— (w-w(n))P . tfw Jn-KIIT) ( = L2.n (3.18) Equivalentemente, utilizando a notado matricial, podemos escrever e'fff, w) = e(n) + J(«) (w - w(n)} (3.19) onde e(jt) é o vetor de erro eW = k(M). e J(fl ) c a matriz jacobiana n-por-m de e(n): de(0 3K1) ÜWj Se(2) jte(D a*(2) J(n) = dw. dw2 ¿hrm de(g) defrr) de(ff) thi)2 " =*< n | (3.20) e*(Aw) - e( j ) + A jacobiana J(/r) é a transposta da matriz de gradiente m-por-w Ve(n)P onde Ve(n) = [Ve( I), Ve(2).W(«)] O vetor de peso alual ¡izado w(n + 1) Ó assim definido por w(fl + l) = argmin L 0.21) Usando a Eq. (3.19) para calcular a norma eucltdiana quadrática de c ía, w), oblemos | t' (^wJll1 = +ír(ff)J(jr)(w - w(íi)) + l(w - w(jr))r Jr(fl)J(fl)(w - w(rt))
Assim, diferenciando esta expressáo em rela^ao a w c igualando o resultado azeto, abtemos Jr(w)e(n) + Jr(n)J(rf)(w - w(n)) = 0 Resol vendo esta equa^ao para w, podemos cntáo cscncvcr a partir da Eq. (3.2l)t w(f? + I) ’ Win) - (3.22) que dcscrcvc a forma pura do método de Gauss-Nwton. Diferentemente do mclodo do Ncwton, que requer o conhecimento da matriz hessiana da fun^ao de cusió ^(fi), o método de Gauss-Newton requer apenas a mafriz.iacobmna do vetor de erro «00- Entretanto, para que a iterado de Ciausü-Newton seja cotí puta vel, a matriz produto Jr(tt)J(w) deve ser náosingular. Com rda^áo a este último ponto, reccnhecemcs que Jr(fl)J(H) é sempre definida nBo negativa- mente. Para assegurar que ela sqa náo-singular, a jacobiana J(rt) deve ler jéws^j ¿r, em relajo ás linhas; isto c, as n linhas de J(n) na Eq. (3.20} devem ser lincarmcntc indcpendcntcs. infelizmente, nao há garantía de que esta cóndilo seja sempre satisfeita. Para nos resguardáronos contra a possi- bil idade de que J(fí) seja deficiente em posto, a plática habí mal é adicionar a matriz diagonal Si á matriz Jr(fl ),J(n). O parámetro 6 ó uma constante positiva pequeña escribida para assegurar que Jr(jT)J(rt) । bl. definida positivamente para lodo n Bascado nisto^ o método de Gauss-hlcwton c implcmcntado na forma ligci remonte modificada; w(« ♦ l) - w(/f) -(JWfo + 51) TbiJeOr) (3.23) O efe i lo desta modificacáo c reduzido progressivamente á medida que o número de itera^oes, w, é aumentado. Note também que a equa^So recursiva (3.23) éa soluto da fun^ao de cusió modifica- da: &|w - w(0)||J + - (3.24) 1 I onde w(0) ó o valor inicia/ do vetor de peso w(¡). Estamos agora equipados com as ferramentas de olimiza^áo de que ncccssi tamos para abor- darmos as quesiocs específicas que en volvere a filtragem adaplaiiva linear, 3.4 FILTRO LINEAR DE MÍNIMOS CUADRADOS Como o nome implica, umJiürtt limar de mínimos tfum/rados lem duas características distintivas. Prime]ro. o único neurónio cm lomo do qual c construido é linear, como mostrado no modelo da Fig. 3.1b. Segundo, a fún0o de custo $(w) usada para projetar o filtro consiste da soma de erros quadrados, como definido na Eq. (3.17). Bascado nislo, utilizando as Eqs. (3.3) c (3.4)t podemos capncssar o vetor de cito e(rf) como segue; e(«) = d(n) -1 i(l), x(2) l(n)]rw(n) = d(fl)- X(n)w(fí) *(«)=!
ende d(ff) é O tx’tór da reapaata de.iejada n-por-1: e X(fl) é a matriz de dados n-por-m: M2X . sW Di Per ene jando a Eq. (3.25) em telaraña w(jt), obtemos a matriz do gradiente Ve(n)--Xr(r;} Corrcspondcnlcmenle. a jacobiana de «(«) é J(n)=-X(n) (3.26) Como a equa^Sc do erra (3.19) já é Linear cm rclacao ao vetor de peso wfw), □ método de Gauss- Newtpn converge em uma única iterado, como mostrado aquí Substiluindoas Eqs. (3.25) c(3.2ó) na Eq. (3.22\ oblemos w(n 11) = w(») + (X’,(»)X{1>))“1 Xr(n)(d(ii)- X(n)w(»)) = (X»X« Xr(»)d(n) Rcconhcccmos o termo (Xr(ff)X(rt)) X (jf) tomo a pyeudolttverxa da matriz de dados X(jp) como mostrado em Golub e Van Loan (1996), e Haykin (1996)1 isto ó, X» (Xr0F)XH)lXT0í) (3.28) Com isso, podemos rcscrcvcra Eq. (3.27) na forma compacta w(w + l) = X (n)d(n) (3.29) Esta fórmula representa um modo conveniente de dizer: LlO vetor de peso w(n +• 1) resol ve o problo ma linear dos mínimos quadrados definido sobre um intervalo de observado de durado rt,• ** Filtro de Wiener: Forma Limite do Filtro Linear dos Mínimos Cuadrados para um Ambiente Ergódico Um caso de particular interesse é quando o vetor de entrada x(¿) c a rcsposla desejada </(rl sao retirados de una ambiente e^ór/rieoqueé também estacimário. Podemos entfto substituir as medias de amostras de longo prazo, ou medias tempnrais, por expeciativas ou medias de ensemble (Gray e Davisson. 1986). Um ambiente assim é parcialmente descrito por cstalísticas de segunda ordem: • A matriz de correlata do vetor de entrada k( l ela é representada p<?r * O vetor de wwfaqütj eruzada entre o vetor de entrada x(0 c a rcspcsta desejada rf(i); ele ó representado por ri,
Estas duas quantidadcs sao definidas, respetivamente, como segue: R, = éfj¡(í)sr(O| = litn-¿K(a)ir(0 = lim-Xr(rt)X(rt) i,-,w n {3.30) ^ = £IK(M0] = lim - ¿ x(0¿0) " *""7T = lim —Xr(n)d(n) II— 0-31) onde £ représenla o operador estaiíslico do valor esperado. ConseqúenieirienLe, podemos reformular a solu^áo linear dos mínimos quadradusda EqJJ.Z?) como segué: ivi:, = lim w(n + I) = 1iin(Xr(n)X(«)) 'Xr(n)d(w) H—P» = lim-(Xr{M)X{a)) 1 lim-Xr(w)d(fl) = «Air (3-32) onde Ra: é a inversa da malri?. de correlato O vetor de peso wn é denominado a jctapcfo de Hfc/rarpara d problema da filtragem linear clima, cm reconhtei mérito ás contribuyes de Nurbert Wiener para este problema (Widrow c StcamsT 1985; Hay km, 1996). ConsDqilentemente, podemos fazer a seguirte afírmalo: Pura umpnxxsxo iT^ódifü, v filtro iiftL'arde mirtim&S qUMlradüS M ¿ipr&xitnu deforma usxirittjtíLa do filtro i!, Miañar quando O jjJ¡ntFnJde ob.iervafíes xe apíiouma dn mftniKr. □ projeto do filtro de Wiener requer o conhecimento das estalísticas de segunda ordem: a matriz de correlafáo Rt do vetor de entrada í(n) c c vetor de oorrclacáo cruzada entre x(tt) e a resposta desejada rAn). Entretanto^ esta informado ndo está disponivel em muitas situares importantes encontradas na pratica. Podemos 1 idar com um ambiente dcsconheetdo utilizando um filtru linear u<fapitiiiv.‘. adaptativo no sentido de o filtro ser capaz de ajustaros seus parámetros bvrcs em res- pecta a varíSQfcB cslaCíslicas no ambiente, Um algoritmo mui 1o popular para fazer este tipo de ajuste de forma Limiínua é u algoritmo do miuimo quadrade medio, que está intimamente relaciona- do com o Til tro de Wiener.
3.5 ALGORITMO DO MÍNIMO CUADRADO MEDIO O algoritmo do mínimo guadnado medio (LMS) é baseadn na utilizado de valores instantáneos para a fuuf So de cusía, ou seja, (3.31) onde e(rt) é o sinal de erro medido no tempo jv. Diferenciando ré(w) cm rcla^áo ao vetar de peso w, o bienios ^>-e(„)^!> 0.34) dw Como no caso do filtre dos mínimos quadrados, o algoritmo LMS opera com um neurónio linear de forma que podemos expressar o sinal de erro como -?(«)- ¿Vi) -x»w(n) (3-35) Com isso, tteQili dw(n) 5w(n) Utilizando este último resultado como uma e.flfnurlimj para o vetar do gradiente, podemos escrever ¡H"-x0i)e0i) (3.36) Finalmente, usando a Eq. (3.36) para o vetar do gradiente na Eq. (3.12) para, o método da dcscida mais íngreme, podemos formulare algoritmo LMS como segué; w (n + t) = w(n) + (3.37) onde T| é □ paramcuo da taxa de aprendizagem. O lapo de real ¡mentado em tomo do vetor de peso w (fi) no algoritmo LMS se comporta como um jft/ro /wxrrr-bíriras, de ix and o pausaras componen- tes de baixa fteqiténcia do sinal de erro e atenuando suas componentes de alta freqüencia (Haykin, 1996). A constante de lempo media dcsta acáo de filtragcm c inversamente proporcional ao parámetro de laxa de aprendizagem q. Conseqüeniemente, atrihuindo-se um valor pequeño a q, o processo adaptativo progredirá lentamente. Um número maior de dados paseados sera enlác recordado pelo al&cntmo LMS, resultando em uma a^lo de fillragem mais precisa, Em outras palavras, o inverso do parámetro da taxa de aprendizagem T| c uma medida da memoria do algoritmo LMS. Na Eq, (3-37), utilizamos w(n) em lugarde w(it) pare enfatizar o fata de que o algoritmo LMS preduz uma estimativa do vetor de peso que resultaría da utilizarán do método da desoída mais íngreme. Conseqüentemente, utilizando o algoritmo LMS sacrificamos uma característica distinti- va do algoritmo da descida mais íngreme. No algoritmo da dcscida mais ingreme, o vetor de peso w(tt) segue uma trajetória bem-defínida no espado de pesos para um determinado q. Por outro lado.
no algoritmo LMS o vetor de peso w(n) traca urna trajetória aleatoria. Por essa razao, o algoritmo LMS é algumas vezes denominado "algoritmo do gradiente estocástico". Conforme o número de itcrapoes no algoritmo LMS se aproxima do infinito, w(n) real iza uma caminhada aleatoria (movi- mento browniano) em tomo da solupao de Wiener w O ponto importante o o lato de que, di feren- tementc do método da dcscida mais íngreme, o algoritmo LMS nao requer o conhecimento das cstatísticas du ambiente. Um resumo do algoritmo LMS é aprcscnEado na Tabcla 3.1, que ilustra claramente a simplici* dade do algoritmo. Como indicado nesta labela, para a iHfcftrtzatfo do algoritmo, normalmente se Pazo valor do vetor de peso no algoritmo :gual a zero. TASELA 3.1 Resuma do Algoritmo LMS Jjflrt.vrrrt cf? Vetor da sinM de entrada = i(fl) Rcsposla desejada = dVú Píirfliuftit) sefecíovnidb peto tísuáríb: h inicia!Supunha que w (0) ~ 0. CíifnpHia^uc. Pañi n ~ 1.2, :...,tümpuUir efnf J/ítJ - w Representado por Grafo de Fluxo de Sinal do Algoritmo LMS Combinando as Eqs. (3.35) c (3.37), podemos cxprcssar a cvolu^án do vetor de peso no algoritmo LMS como segue: w(n +1) = w(«) + t[i(n)p(ft}- Mr(rt)w(n)J = [1 -qi(n)xr(n)]w(ji)+ ni(n)d(«) onde I é a matriz identidade. Utilizando o algoritmo LMS, rcconhcccmos que w(n) + I)] (3.39) onde Z 1 é o operador atraso unitário^ implicando armazenamento, Usando as Eqs. (3.38) e (3,39), podemos cnlao representar o algoritmo LMS pelo grafo de fluxo de sinal representado na Fig. 3.3. Este grafo de fluxo de sinal revela que o algoritmo LMS é um exemplo de um sistema realimenttHto cstocásiia). A presenta de realimcnta^áo tcm um impacto profundo no comportamento cm rcla^ao á convergencia do algoritmo LMS, Considerat;oes sobre a Convergencia do Algoritmo LMS Da leuria de controle sabemos que a estábilidade de um sistema neahmentado e determinado pelos parámetros que con se iluem seu lago derealimcnta(ao. Da Fig. 3.3 vemos que éo la^o de rcalimcn- tapao inferior que conten? variabilídfide ao comportanicnto do algoritmo I.MS. Em particular, há duas quantldades distintas, o parámetro da taxa de aprendizagem q e o vetor de entrada x(rf), que
FIGU RA ReprcseniaQáa por gi?.fa de fluxc. de sinal do alQGritmo LMS detemiinam a transmi tanda deste ¡390 de realimentafao, Portanto, deduzimos que o comportanjen- to em relajo á coirvErgcncia (i.e., estábilidade) do algoritmo LMS c influenciado pelas caracterís- ticas cstatísticas do vetor de entrada x(n) c pelo valor atribuido ao parámetro taxa de aprendizagem 11, Formulando esta observado de uma outra forma, podemos afirmar que para um determinado ambiente que fomece o vetor de entrada i(njt devemos ter cuidado na sele^áo do parámetro da laxa de aprendizagem T] para que o algoritmo LMS sc ja convergente. O primeiro critéric para cctivergéncia do algoritmo LMS é a convergéncia da media* descrita por w quando a —> «> (3,40) onde w é a solu^ao de Wiener. Infelizmente» este criterio de convergencia c de pouco valor prático» pois uma seqüéncia de vetores aleatorios de media zero, mas de cutre modo arbitráriaT converge por este criterio. Do ponto de vista pratico, a questáo da convergencia que realmente importa é a convergencia do quadradt) media, descrita por -> constante quando n —+ >-' (3.41) Infelizmente, uma análisc detalhada da convergencia do algoritmo LMS cm relajeo ao quadrado médio ¿ bastante complicada. Para tomar esta análise matemáticamente tratáveE, sáo feitas normal- mente as seguí ntes suposifdes: L Os vetores de entrada sucessivos i( 1 )T x(2X- sáo estilísticamente independentes entre si. 2. No passo de tempo n» o vetor de entrada x(n) c cstatisticamcntc independente de todas as amos- tras anteriores da resposta desejada, isto é, cflj), ;/(2)>...> JO - I}. 3, No passo de tempo nt a resposta desejada d(n) é dependente de x(n)» mas eslatisticamente independente de todos os valores anteriores da resposta desejada. 4. D vetor de entrada x{ n) e a resposta desejada ) sao rcti rados de popula^oes com distribuid Oes gaussianas. Uma análisc estatística do algoritmo LMS assim fundamentado é denominada a teoría da indepen- dencia (Widrow et al., 1976),
Invocando os elementos da teoría da independencia e assumindci que o parametro da taxa de aprendizagem r| seja suficientemente pequeño, í laykin (1996) mostea que n algoritmo LMS é con- vergente em relajo ao quadrado médiii desde que t] satisfaga a condi^te 0 < p < (3.42) onde Ari.h]h éo fíiaiürímfovíiíar da matriz de concíacáo Ri. Em aplicares típicas do algoritmo LMS+ contudo,nao é conhceido. Para superar esta diificuIdade. o fungo de Rt pode ser útil izado como uma estimativa conservadora para a ,i(h e ueste caso a condiQÍo da Eq. (3.42) pode ser reformulada como 0< ” * (3'43) onde tr[RJ representa o traqo da matriz Rl. Por definÍQáo, o tra^o de urna matriz quadrada é igual á soma de seus elementos na diagonal principal. Como cada elemento na diagonal da matriz de corre- lacñc R c igual ao valor medí.iquadrado da entrada sensoria! correspondente, podemos reformular a cundido para convergencia do algoritmo LMS pelo quadrado medio como segue: i 0 < 1) <------------------------------------------------------- (344) soma dos valores medios quadrados das entradas sensoria i s f Desde que o parámetro da taxa de aprendizagem satisíaca esta condi^ao, asscgura-sc também a convergencia do algoritmo LMS pela media, Lalo e, a convergencia pelo qu adrado medio implican convergencia pela media, mas o contrario n5o é necessar ¡ámenle vertí aduno. Virtudes e Llmita^óee do Algoritmo LMS Uma virtude niportaniedoalgorilmo LMS é a sua simplictd&de, como exempi i litado pelo resumo do algoritmo, apresentado na Tabela 3.1. Além disso, o algoritmo LMS é independente de modelo e conscqücncemente roAttt/O, o que significa que pequeñas incertezas do modelo c pequeñas pertur- bantes (i.c., perturbantes com pequeña encrgia) resultam apenas em (xcquenos erres de estimativa (sinais de erro). Em termos matemáticos precisos, o algoritmo LMS c ótimo de acordo com o criláña H" (ou wtenímtci) (Hassibi el al., 1993, 1996). A filosofía bási¿ade otinúzalo no sentido de 7C é pro ver subsidios para O cenar io de pior caso’; Se rrdo xtntber o que ini enfrcttitif, plaitiyí- pura rt pior comí í' tj/intize. Por muito tempo, o algoritmo LMS foi visto como uma aproximado instantánea pam o algoritmo da descida do gradiente. Entretanto, a otimiza^áo por ?/' do algoritmo LMS fomeec urna base rigorosa para este algoritmo largamente utilizado. Particularmente, da explica a sua hábil dado para funcionar satisfatociamente tanto em um ambiente estacionario como cm um ambiente náo-estaci- onário. Poruni ambiente "náo-estacionário"entende-se aquele cmqucas cstatísticas variam com o tempo. Em um ambiente assim, a sotuváo ÓC ina do Wiener assume urna forma vari&vel no tempo, c o algoritmo LMS tcm agora a tarefa adicional de .ycgríir as varia^óes dos parámetros do filtro de Wiener. As Limitantes principáis do algoritmo LMS stea sua taxu de convergencia lenta c a sen sibil E- dadea variantes naauio-cstruiura da entrada (Haykin. 1996). O algoritmo LMS típicamente requer
um número de üera^óes igual a cerca de 10 vczcs a dimcnsionalidade do espado de entrada para ele alcanzar uma condiqao de estábilidade. A lenta taxa de convergencia se Loma particularmente séria quando a dimensionalidade do espado de entrada se toma alta. Assim como em relajo á sensibili- dade a variaf3es ñas condiqdes do ambiente, o algoritmo LMS c particularmente sensível a varia- 9óes no número condicionante ou intervalo do autovaior da matriz de correlato Rl do vetor de entrada x. O número condicionante da matriz de currela^So R. representado por XíRs). é definido como Z(Rj = T-fc (3,4$) min onde X e X sao os autoralores máximo e mínimo da matriz R » respectivamente. A sensibilida- de do algoritmo LMS a variares no número condicionante x(RJ sé toma particularmente aguda quando a amostra de treinamento A qual pertence o vetor de entrada x(n) é mol condicionada, isto é, quando o número condicionante z(RJ é alto - Note que no algoritmo LMS a matriz hessiana, definida como a derivada segunda da fiinfáo de custo £(w) em relajo a w, é igual á matriz de correla^ao R,; veja o Problema 3.8. Assim, na discussSo aquí apresentada, poderíamos ter talado tanto em termos da hessiana como da matriz de coracla^áo R.. 3.6 CURVAS DE APRENDIZAGEM Uma mancira informativa de examinar o comportamento de convergencia do algoritmo LMS, ou de um filtro adaptativo em geral. é trabar a curva de aprendizagem do filtro sob condi^oes ambientáis varia veis. A curva de aprendizagem c um gráfico do valor medio quadrado do erro de estimando, 7 em /iíJifao do número de iteracoes. n. Imagine um experimento envolvendo um ensembtede filtros adaptatívos, com cada filtro ope- rando sob o controle de um algoritmo especifico. Assumc-sc que os detalhes do algoritmo, indura- do a inicializa^o, sao os mesmos para todos os filtros. As di ferrabas entre os tritios surgem da maneira aleatoria pela qual o vetor de entrada r(n) e a resposta desejada ¿f(n) s3o retirados da amostra de treinamento disponivel. Para cada filtro, trabamos o valor do quadrado do erro de csti- macáo (i.e., a diferenca entre a resposlñ desejada e a saída real do filtro) em fim$3o do número de iterares. Uma curva de aprendizagem da amostra assim oblida consiste de exponencia i s ruidosas, sendo o ruido causado pela natureza inerentemente estocástica do filtro adaptad ve. Para calcular a curva deaprendizagem media do ensembfe (i e., o gráfico de em fun^ao de n), calculamos a media destas curvas de aprendizagem das amostras sobre o enscmblc de filtros adaptad vos utiliza- dos no experimento, suavizando com isso os efeitos do ruido. Assumindo que o filtro adaptativo seja estávcl, constatamos que a curva de aprendizagem media do cnsemblc cometa com um valor grande de determinado pelas condicocs iniciáis» entSo decresce a urna laxa que depende do filtro utilizado e finalmente converge para um valor estávcl j(“)+ como ilustrado na Fig, 3.4. Com base nesta curva de aprendizagem» podemos defi- nir a taza de convergéneia do filtro adaptativo como o número de itera^óes n, necessárias para rediizir V-.. / /f) a um valor escolhido arbitrariamente, tal como LO por cento do valor inicial r4mc,(Ú)r Urna outra característica útil de um filtro adaptativo que é deduzida da curva de aprendizagem múdia do cnsemble é ó dcsajustamento, representado por M. Suponha que ¿.represente o erro medio quadrado mínimo producido pelo filtro de Wiener, projetado com base nos valores conheci- dos da matriz de correlato Rc e do vetor de oorrela^So cruzada Podemos definir o desajustamento para o filtro adaptativo como segue (Widrow e Stearns» 19E5; Hay km» 1996):
Número de ikinedcs Tana de t(in^r^CTii;¡í FIGURA 3.4 Curva de aprendizagem idealizada do algoritmo LMS. ^ = -L¿------ i®1 npn (5.46) O desaj ustamentr) ,.lt é uma quantidade adimcnsiOrhal, que fomccc uma medida de quáo porto do étimo está o filtro adaptaíivo, no sencido do erro medio quadrada Quanto menor for comparado com a unídade, mais precisa será a a^áo de fíltragem adaptativa dn algoritmo. Normalmente, .« é expresso como uma porccnlagcm. Assim, por cxcmplo, um desaj ustamento de LO por ccnLo signifi- ca que 0 filtro adaptativo produz um erro medio quadrado (após completar a adaptado) que é 10 por ccnlo maior que o erro medio quadrado mín: me r .produzido pelo filtro de Wiener correspon- den te. Tal desempenho é normalmente considerado na prática como sarisfatório, Uma outra característica importante do algoritmo LMS c o tempo dmcfímtida^df}^ Entretanto, nao há uma definigáo única para o tempo de acomodafáo. Podemos, por cxcmplo, aproximar a curva de aprendizagem por uma exponencial única com constante </e tempo media i v, e assira usar ". f como urna medida grosseira do tempo de acomoda^áo. Quanto menor for o valor de t . mais rápido será o tempo de acomadacáo (Le., a algoritmo LMS convergirá mais rápidamente para a cundido "eslávei”), O desaj usía mentó U do algoritmo LMS ú, dentro de um bom grau de aproximaban, dirctamcnte proporcional ao parámetro da laxa de aprendizagem q. enquanlc que a constante de lempo media : ^ ¿ invcTsamcnlc proporcional ao parámetro da taxa de aprendizagem r| (Widrow c Stearns, 1985; Haykin, 1996). Conseqüentemente, temos resultados concitantes no sentido deque seo parametro da taxa de aprendizagem íbr reduzido para reduzir o desajustamenlo, enláu o lempo de acomodaban do algoríimo LMS é aumentado. De forma inversa, se o parámetro da taxa de aprendizagem fbr aumentado para acelerare processo de aprendizagem, cntáo o desaj estamento é aumentado. Deve-
se dar multa atengan á cscolha dü parámetro da taxa de aprendizagem Q no projeto do algoritmo LMS para produzirum desempenho global saLisfalório. 3.7 ESTRATEGIAS DE VARIAQÁO DA TAXA DE APRENDIZAGEM As dificuldades encontradas com o algoritmo LMS podem ser atribuidas ao fato de o parámetro da toca de aprendizagem ser mantido constante durante toda a computado, como mostrado por T](n) = para lodo n {3.47} Esta é a forma mais simples possível que o parámetro da taza de aprendizagem pode assumir. Por outro lado, na aprnúmagao estocas tica. que se baseia no artigo ciánico de Robbtns e Monto (1951), o parámetro da taxa de aprendizagem c variável no tempo. A forma particular de variando temporal mais comum na literatura sobre aproximarán cstocástica c descrita por H(n) = - (3,48) n onde c e uma constante. Uma escplha assim é realmente suficiente para garantir a convergencia do algoritmo de aproximarán eatocástica |Ljiing+ 1977; Kushncr c Clark, 197S). Entretanto, quando a constante c é grande, há o perigo de o parámetro disparar para n pequeño. Como uma alternativa para as Eqs. (3.47) e podemos utilizar a e.rfnatégw procwia-eHtdo- eonverget definida por Darken e Moody (1992) <3-49’ onde T)n ex sáo constantes definidas pelo usuário. Nos estágios iniciáis de adaptado cnvol vendo um número de iterantes n pequeño comparado com a constade de lempo de busca t, o parámetro da taxa de aprendizagem q(n) é aproximadamente igual ae o algoritmo opera esencial mente como uma algoritmo LMS "padrifo”, como indicado na Fig. 15, Assim, escolhendo um valor alto para dentro do intervalo permitido, esperamos que os pesos ajtistávcis do filtro encontrara e permane^am em torno de um “bom” conjunto de valones. Entáo, para um número de iterantes o grande compara- do com a constante de tempo de busca x, o parámetro taxa de aprendizagem T](n) se aproxima de cf rt, onde c como ilustrado na Fig. 3.5.0 algoritmo opera agora como um algoritmo de apren- dizagem estocástica tradicional, e os pesos convergen para seus valores ótimos, Assim, a estratégia de busca-cntáo-cOnvcrge tem o potencial de combinar as características dcsijávcis do algoritmo LMS padreo com a teoría de aproximado estocástica tradicional. 3.B O PERCEPTRON Chegamos agora á segunda parte do capitulo que trata do perceptron de Rcsenblatt, daqui cm diante denominado simplesmente deperceptron. Enquanto que o algoritmo LMS descrito ñas seqdes ante- riores é construido em tomo de um neurbnio linear, o pcrccptron c construido em tomo de um neurónio náo-lmear, isla ét o modelo de McCidlock-Pitts de um neurónio. Do Capítulo I lembra- mos que este modelo de neurónio oonniste de um combinador linear seguido por um limitador abrupto (realizando a funcáo sinal}T como representado na Fig. 3A O nó aditivo do modelo neurcnal calcula uma cpmbinaqáo linear das entradas aplicadas as suas sinapses e também incorpora um bias
FIGURA 3.5 Estrategias tjs varia^áa da laxa da aprandiEagam FIGURA 3.6 Gfflfc da fluxy dfi sinal do peiceptron aplicado externamente. A soma resollante. isto é, o campo Iota! induzido, c aplicado ao limitador abrupto. Corresponden!emente, o neurónio produz uma saída igual a +1 se a entrada do limitador abrupto for positiva c -1 so cía fer negativa. No modelo de grafo de ÍIuko de sinal da Fig. 3.6, os pesos sinápticos do percepiron sáo repre- sentados por wp w, Wm- Correspondcntemcntc, as entradas aplicadas ao perccptron sao represen- tadas por -V , A'p... a . O bias aplicado externamente ¿ representado por 5. Do modulo constatamos que a entrada do limitador abrupto ou o campo 1 ocal inducido do neurónio é h j = (3.50) O objetivo do perccptron é clas^ificarcorrctamcntc o conjunto de estímulos aplicados externamente Jr jrr... cm uma de duas clames í(?| ou £,. A regra de decido paffi a cías»i!iua?ao c atribuir o ponto representado pelas entradas á dañese ;i saída do pcrccplron v fior+1 c á elasse se eh for-1.
Para compreender melhor o comportamento de um classificadoc de padróes, norma Imente se tra^a um mapa das regifies de decido nn espumo de .sinal m-dimensiona¡ abrangido pelas m varíá- veis de entrada xr x>t... xw, Na forma mais simples do pcrccptron, existen duas rcgiccs separadas por um hiperptano definido por !* £^ + 6 = 0 (3.51) j-i Isto está ¡lustrad» na Fig. 3 7 para o case de duas variáveisjL c jt.. para O qual a fronteira de decisMo toma a forma de urna liriha reta. Um ponto (xr .v, 1 que se encentra acima da linha de frunlcira é atribuido á classe e um ponto (xr x,) que está abaiv> da Linha de fronteira é atribuido á classe £C, Note tambora que o efeito do bias h c meramente de destocar a fronteira de dccisao em rela^ao á origem. FIGURA 3,7 Irustra^ao do biperplano (nasbe aa&rnpfra, urna linhh neta) como framteira (Je decisáo para um problema i:$ das$if»ca?áiQ de padrees bidimensionai de duas classes Os pesos sinópticos u’1twa4... u1 do pcrceptron |»odem ser adaptados de iterado para itera0o. Para a adapla^áo podemos utilizar uma regra de corrcqáo de erro conhccida como o algoritmo de convergencia do pereeplron. 3.9 TEOREMA DE CONVERGÉNCIA DO PERCETRON Para derivar o algoritmo de aprendizagem por corrcíáo de erro para o pereeptron, achumos mais conveniente trabalhar com o modelo modificado do grafo de fluxo de sinal da Fig. 3.8. Ncstc segun^ do modelo, que é equivalente áquele da Fig. 3.6, o hias hpí) c tratado como um peso sinóptico acionado por uma entrada liza igual a -1. Podemos assim del inir o velor de entrada (n; + I )-por-1 • t+t JTa(fl}................-íJ'OF onde w representa o passo de iterado na aphea^áo du algorilmu. Corrcspondcnlemente, definimos o vetar de peso (m + I J-poM como w(m) = WíJfOr
Ehcradj ifl ti XA FWURAJ-8 GrfllacieHuM rtfl cirial equivÉlenlé dó porcflptífln; por da reja 5 dapandénc a dú terTipO 1u prnilida C\imhi-i^ir linear 0 *rCt'5 Saida j--------►-------- Limitador diik’il E>1 HldiLt -4 Conrapondenlerrienle, a saida do combinador linear pode &er estrila na forma compacta íJ(«) = Xw.trtJjtX») = v ''(fl)x(fl) (3.52) onde Wfl(rt) representa o bias h(fl). Para n fixo. a cquaijao w'x = 0. trabada cm um espado rft- dimcnsional (trabada para um bias prcdcLcminado} com coordenadas .y , ,v„... xm, delire um Ilipcrplano como a superficie de detisáo entre duas classes diferentes de entradas. Para o perceptron funcionar adequattarnenie, as duas classes ’í e Íí1 devem ser /reármente scparáwis. Por sua vez. isto significa que os padrees a serem clarificados devem estar suficiente- mente separados entre si para assegurar que a superficie de docisáo consista de um hiperplano. Esta exigencia e ¡lustrada na Fig. 3.9 para o caso de um perceptron b¡ dimensional. Na Fig. 3.9atasduas classes e *6 están suficientemente separadas entre si para que desenliemos um hiperplano (oeste caso uma linha reta) como ffonicira de decían. Entretanto, se permúirmos que as duas classes <. e 'í, se aproximem demais.como na Fig. 3.9b, elas se lomam oto I i ncarmente separé veis, uma situ- a^áo que está alcm da capacidade do pcrccptron. Froreteini de decían Cías» f Cl£55C<£ CLjssc 1 AGURA 3.9 (a) Um par da padrñes linaarrnenle sapar^veia. (b) Um per de padr&es náo iinearmenlQ separáveis. Suponha eni^oqueas. variávtis de entrada do pcrccptron seoriginem de duas classes linearmertte separáveis. Sen 3E, o suhconiuniode vetar» de trciTiamentc ), qucpcrtcnccm á elasse e seja Jt;, o subconjuiUo de veletes de treinamento 1^1). x/2),... que pcrtcnccm á elasse A uniáo de SC ! e é o conjunto de ircinamento completo SE. Dados os conjuntos de vetores 9? e SE, para (reinare classiftcador, o proccsso de tre namcntci envolve o ajuste do vetor de peso w de tal forma que as duus
classcs c % scjam lincarmcntc separarais. Isto ¿\ existe um vetor de peso w para o qual podemos afirmar wTx > 0 para todo vetor de entrada x pertencente a classe wrx í 0 para todo vetor de entrada x pcrtcnecntc á elasse Ms, (3.53) Na segunda linha da Eq. (3,53), escolhemos arbitrariamente que o vetor de entrada i pertence á clasae <6, se wri = 0. Dados os suhconj untos. de vetores de treinamenio ,. e o problema de treinamento para n perccptron elementar c, cntáo. encontrar um vetar de peso w tal que as duas desigualdades da Eq. (3.53) sejam satisfeilas. U algoritmo para adaptar o vetor de peso do perccptron elementar pode agora scr formulado como segué; I. Se o H-ésimo membro do conjunto de treinamento, x(¿r), c cornetamente classillcado pelo vetar de peso w(n) calculado na /r-ésima iterado dü algoritmo, entila o vetor de peso do perceptron náo é corrí gldo de acordo com a regra: w(fl +1) se wri(ji) > 0 e je(n) pertence á elasse^, w(n +1) = w(r) se wri{n) < 0 e je(m) pertence á classcr€. (3.54) 2. Caso contrario, o vetor de peso do perccptron c alual izado de acorde com a regra w(n + i) = w(rt) - r|(j¡Ji(n) se Wr (/r)x(«J > 0 e x (n) pertence á elasse , (3.5 5) w(n + I) = w(n) + T](n)x(ji) se w (n)?í(n) < 0 e x (n) pertence á elasse céL onde o parámetro da ¿oro t/e aprendizagem H|0i) cnuirnla o ajuste aplicado ao vetor de peso na iterado n. Se T](s) - T| > 0. onde i] é uma constante independen te do número da ilcra^ao «, temos urna regra de adaptando com irtctvrnenlo fizo para O percepirürt- No que segué, primeiro provamos a convergencia de uma regra de adaptarán com incremento fixo para a qual T| = 1. Claramente, o valor de t] nSo é importante, desde que seja positivo. Um valor deT| * 1 meramente escala os velones de padrees sera afetar a sua sepa rabil idade. O caso de um r|(¿r) varió vd será considerado mais tarde. A prava é apresentada para a condi cao inicial w{0) * Ú. Suponha que wr(n)x(tt) < 0 para n=1, 2...., e que o vetor de entrada x(w) pórtenla ao subcon-unto 3 . Isto é, o perceptron classiiica incorrctamente os vetores x(lX ’t^),..., jó que a segunda condifóo da Eq (3 J3) é violada. Entóo, com a constante Ttfn) = L podemos usar a segunda linha da Eq. (3.55) para cscrcvcr +• l) = i*(n) x(n) para sOr) pertencente á elasse (3.56) Dada a condipao inicial w(0) = 0, podemos resolver iterativamente esta cquapao para w(n + I) oblendo o resultado w(n + l) = x( I) + x(2) + x(n) (3.57)
Hidden page
M* + 1 IIP - II w(t)||2 < ||x(ó)||2t k = 1, ... n (3.64) Samando oslas desigualdades para k = 1ji, c invocando a condifáo inicial assumida w(0) “ 0, obternt» a seguirte desigualdades |w<n * 1J|; < ¿IWtJ2 S (1.65) < Jlp onde P é um número positiva definido por 0= mas ||x(*)||2 (3,66) ifJS 1CJ | A Equa^au (3.65) afirma que o a norma euclidiana quadrátiea do vetor de peso w(h + 1) cresce no máximo lineannente com o numero de iteratfjes ff. O segundo resultado da Eq. (3.65) está claramente cm conflito com o resultado anterior da Eq. (3.61) para valores suficientemente grandes de m De Tato, podemos afirmar que n náo pode ser maior que um valor para o qual as Eqs. (3.61) c (3.65) sao ambas satisfeitas com o sinal de igualdade. Isto é, é a soluto da equafáo = h fl || |J FJ Resolviendo para dada uma solu^áo Wfl, obtemos que Provamcs assim que para rtffl) 1 para toda r, e w(C) = 0, e desde que exista um vetar soluto wúT a regia para adaptar os pesos sinópticos do perúeptroii deve terminar após no máximo n .ix iteraqdes. Note também das Eqs (3.58), (3.66) e (3.67) que nüü existe uma soluto única para wa ou Podemos agora formular o teorema da convergencia com incremento Jixo para o pcrccptron como segue (Rosenblatu 1962): Scjam os subcmijunrttt de vetores de treinamento T(e íí 3 linearmenle separáveis. Suponha que as entrados apresentadas ao pcrccptron se oí i<iLnem destes defis subconjuntos. O pcrccptron converge apis % Significando que W(J1Ü) - W(nn I|)" w(nD < 2) • é uma solucio para . Considere a seguir o prucedimento absoluto de correado de erro para a adaptado de um perceptron de camada única, para o qual r|(n) é varíavd Em particular, suponha que q(jr) scja o menor inteiro para o qual n(/T)xr{n)x(n) > |wr(ff)x(n)|
Hidden page
Note que o vetor de entrada x(n) é um vetor (m + 1 )-púr-1 cujo primeiro elemento é fixo em +I durante todos os cálculos. Correspondentemento» o vetor de peso w(n) é um vetor (m + l)-por-1 cujo primeiro elemento é igual ao bias b(n). Um outro ponto importante na Tabeia 3.2 é' inlroduzi- mos & resposta desejada quantizada d(jr), definida por +1 se x(n) pertence ú dasse ’<, -I $c x(/t) pertence á elasse (3.70) Assim, a adaptado do vetor de peso w(a) pode ser resumida adequadamente na forma da rcgra de aprendizagem por correado de erro'. wfn + 1) = w(«) + nm (3.71) onde t| é o parámetro da taxa de aprendizagem e a diferenfa d(n) — y(n) assumc o papel de um sinai de erro. O parámetro da taxa de aprendizagem é uma constante positiva restrita ao intervalo 0 < r) < 1. Ao atribuir um valor dentro des le intervalo, devemos considerar dois requisitos confitantes (Lippmann, 19R7): * Obtenido da media das entradas passadas para f&mecer estimativas estáveis para o peso, o que requer um Y] pequeño • Adaptando rápida em retaco a varia^fles reais das distribuidos relacionadas ao procesan responsável pela geranio do vetor de entrada x, o que requer um T| grande 3.10 RELAQÁO ENTRE O PERCEPTRON E O CLASSIFICADOR BAYESIANO PARA UM AMBIENTE GAUSSIANO O perceptron mantém uma certa relajo com o clasificador de padrees clássico condecido como o classificador bayesiano. Quando o ambiente é gaussiano, o classificador bayesiano se reduz a um elassificadar linear. Esta éa mesma forma assumida pelo pcnceptron. Entretanto» a natureza linear do perceptron nao depende da suposiqáo que as distribu i coes sejam gau$<¡iana$. Nesta seqáo, eslu- damos esta rclacao c desse modo desenvolvemos uma visáo mais apro fundada da operado do perceptron. Iniciamos a discuss^o com uma breve revi sao do classificador bayesiano Classificador Bayesiano No classificador bayesiano ouprtteedimento de texlepela hipótese de Sayes, minimizamos o risco medio, representado por Para um problema de duas elasses, representado pelas elasses SÉ e o risco médio ó definido por Van Trees (1968): (3.72}
onde os vários termos sáo definidos como segue: /j = pmbabiiidade a piiori que o vetor de observado x {representando uma realiza- do do vetoraleatório X) seja relindo de subespa^o 8f., com Z“ 1,2 e p, + l. r = cusió de decidir em la ver da elasse (éíP representada pelo subespa^o \ quando a elasse <S for verdadeira (i.e.T o vetor de observado x é retirado do subespa^o si ), com(t ;) 1, 2. /^{x|'€ ) = l’jnpáo de densidade de probabilidade condicional do vetor aleatorio X, dado que o vetor de observado x seja retirado do subespa^o 9C, com /“ h 2. Os prime i ros deis termos do lado direito da F.q. (3-72) representan decisdes ooríWaj (i.e., classi- ffca^oes co rectas), enguanto que os últimos dais lomos representan! dccisdes ittconniltis (i.e,t dessificafóes i acometas). Cada decisáo c ponderada pelo produto de deis fatores: o custo envol- vido na tomada de decisao c a frequcncia relativa (i.e.T probabilidade u priori) com a qual ela ocorrc. A intenso é determinar uma estrategia para o riten media mínimo. Como exigimos que uma decisao deva ser tomada, cada vetor de observacao x deve ser atribuido no espado de observado global St, ou a 3C, ou a Assim, (3.73) Correspondentemente, podemos rescrever a Eq. (3.72) na forma equivalente J '. J । i. +c'2iA JldífQífc + qjp, J r-e (374) onde cH < c2| c t'„ < r.Observamos agora o lato de que fK (xffipdx = I J । (3.75) Assim, a Eq. (3.74) se reduz a = CjiP, + Cnft +J [a (C|I - C22 )14 (*1^ )“ Pi (Cjl - Cii),^ (x|(É , )ífx (3.76) Os primeiros dois termos no lado direito da Eq. (3.7b) representan! um cusió fixo. Coma o objetivo o minimizaría risco médioR, podemos portante, deduzir da Eq. (1.76) a seguinte estratógia para a c I assi fica^ao óti ma:
1. Iodos es valores do vetor de observado x para os quaix o integrando (i.e., a expressá(> dentro dos cólcheles) é negativo devem ser atribuido* ao subespa^o 3t1 (ix„ a classe . j para que a integral de uma contribuido negativa ao risüO 3t. 2. lodos os valores do vetor de observado x para os quais o integrando é positivo devem ser excluidos do sube&papn f (i.e. atribuidos a classe para que a integral de uma contribuí pao positiva ao risco 31. 3, Os valores de x para os quaís o integrando for ?.ero nao tem efeilo sobre o risco medio J? e podem ser atribuidos arbitrariamente. A ssum iremos que estes pontos scráo atribuidos ao subespa^o , (i.e., á classe A partir desta fundamentado, podemos formulare classificador hay estaño como segué: & a candicáo PSciI - r. x(* > * A11 “ cnVk<“ í /¡W trfrr&riir O irJAT x/f x dü .T N-C.. ¿ Tí J. Cíesí) tíwi/FVjrd'fl. aJr¿^ÉZ Ifl T, f¿e.. ¡’i ¿Yoí.tí 7 ./ Para simplificar 0 desenvolví mentes defina A(I) = 0”) e A quanudade A(x), a razfo de duas fun?oes de densidade de probabilidade condicional, é chamada de razaa de verossimiíhan^a. A quantidade £, ó chamada de lindar do teste. Note que ambos A(x) c t, sáo sempre positivos. Lm termos desias duas quantidades. podemos agora re formular o clarifica- dor bayesiano afirmando: Se. para um velar de observadla x. a ftS&O de verütir«í{h(¡nt;i¡ >\(\} [nr matar que O fimiar atribtííi x á dasse Caso contrario. atribua x a dasse A Figura 3.10a mostra uma representaqao cm diagrama cm blocos do classificador bayesiano. Os dois pontos importantes ueste diagrama em blocos sio: 1. O processamento de dados envolvido no projeto do classificador bayesiano está nestrito inteira- meóte á compulacáo da razao de vcrossinjlhanca A(x). 2. E sla computado c totalmente i nvariante aos va lores atribuidos ás probabi lidadcs a prian c aos cusios envolvidos no processo de tomada de decisáo. Estas quanpdades afetam meramente o valor do 1 imiar Do ponto de vista computacional, é muís conveniente se trabalhar con) o logaritmo da razdü de verossimilhanfa em vez da própria razao de vtressimilhanca. Isto c permitido por duas razñes. Pi imc:rat o logaritmo c uma funcao monótona. Segundo, a nz3o de verossimilhan^d A(x) c o limiar c. sáo ambos positivos. Conscqiientemente. o classificador bayesiano pode ser implementado na forma equivalente mostrada na Fig. 3.1 Ob. Por raztes obvias, o leste: ncorporado resta úh ima figu- ra c chamada de teste do log da mzda de verosisifíidflatida.
ÁlribuLk x á ctaMc^l se A{x) > £ CíiíZh l-mi iribú, acriba x i c-Ijííc^. Alnhu;i; X ú ¿fase 'ftl K Lí'E A(üi > lofv CáHü-cürtEI-il-rfi, aliibua x á rlassí 41. (b) FIGURA 3JD Duas implamfirthac&es éCfuivalerbles do dlassilicador bayesiarw: {a) leste da razáo da vergssimilhfln^ (WTflsls do log da razáo de v*rMs.¡rnilhani;a Classificador Bayesiano para uma Distribuidas Gaussiana Considere agora o caso especial de um problema de duas dasses, para o qual a distribuirás sub| aconto é gaussiana. O vetor aleatorio X tem um valor medio que depende de se ele pertence á classe f€, ou á elasse<¡É,, mas a matriz de covariancia de X c a mesma para ambas as elasses. Isso o equivalente a se dizer: Classe'^: £[X|-ji. fRX-im-ll/l-C Classe^: £[X) = |1, £[(X-njtX-gJ3- C A matriz de covariánc i a C é nao-diagonal , o que signi fica que as amostras retiradas das classes . e^-', s5o carretaci^nadeu. Assuzne-se que C seja náo-singulan para que exista a sua inversa C_|. Com esta rundamenta^áo, podemos expressar a fun^áo de densidade de probabilidade condi- ciona] de X como segue: A(I|C^j)=------FT--------FTcrpÍ- Pr)rC"'(> ” K )1 J “ /K 1 J (del{C)) J ^2 7 (3-79) onde m é a dimensionalidade do vetor de observado x. Assume-se ainda que 1. As duas elasses e sfo eqQipiwáveis: I /> = r: = i (3.80)
2, Classilica^ñes mcorrctas acarrciam o mesmo cusió e classifica^oes carretas nSo incorretn em cusios: t'ji" t'ij e tu ca 0 {3.81} Temos agora a mfbnna^áo necessária para pro-elar um classificador bayesiano para o problema de duas classes. Específicamente, subsiituindo a Eq. (3.79) em (3.77) c efetuando o logaritmo natural, oblemos (após simplificadles): logA(x) = -i(x-|il)!FC (i-fkj + ifx-mfc-(a-gj) 1, x <3 j32) =(Pi - mj'c-i+- iíc-x) Substituido as Eqs. (3.80) e (3.81) na Eq. (3.78) c cfctuajido o logaritmo natural, oblemos kjg^ = o (3.83) As Equadxs (3.82) e (3.83) expressam que o clarificador bayesiano para o problema especificado é um dassificador linear, como descrito pela rela^ao onde y = wri + Z> (3.84) y = logA(x) (3^85) w = C’di,-pj) (3 87) Mais específicamente, o classificador consiste de um combinador linear com vetor de peso w e bias b, como mostrado na Fig. 3.11. FIGURA 3.11 Grafo de iluxp fifi sinal do classllieadaf gausslano Com base na Eq. (3.84), podemos agora descrever o leste do Log da razio de verossimilhaufa para o nosso problema de duas classes, como segue: Se a saida > da eombinadar fincar (¡ncluintfo a bias b) fbr positiva, alribua o velar de observafdú I ¿¡ dasse Caso contrario. atribua este vetor ¿i ciasse '-ff
A operadlo do classificador bayesiano para o ambiente gaussiano descrito aquí é análoga aqueta do pcrccplron, na medida em que ambos sito classifícadores lineares; veja as Eqs. (3.71) c (3.84). Entretanto, existem algumas diferenca* SUtis e importantes entre eles, que devem ser exami- nadas cuidadosamente (Lippmann, 1987): • O perccptron opera sob a premi ssa de que os padrdes a ser clasificados sejam linearmente ¿eparáveís. As distribuidles gaussianas dos dais padrees assumidas na dcnvapá.o do classili- cador bayesiano ccrtamcnto se superpoem c, portante, sio Jrüo-separávcis. A extensá-o da supu-rpositae é determinada pelos velares medios p( e g,, e pela matriz de covariancia C. A natureza desta superposi^áo está ilustrada na Fig, 3.12 para o caso especial de uma variávcl aleatoria escalar (i.e., dimensional idade jw = 1). Quando as entradas s3c náo-scparávuis e as suas distribuicocs se superpoem como ilustrado, o algoritmo de convergencia do perceptron aprésenla um problema porque as fronteiras dedecisio entre as ch ferenies elasses podem osci- lar continuamente. • O el assifi cador bayesiano m । n । m i /a a probabi I idade de erro de class i fica^áo. Esta m i n i m iza^áo é independente da superposi^áo entre as distribuidles galicianas relativas as duas classes. No caso especial ilustrado na Fie. 3.12. por excwplo, o classificador bayesiano somprc posiciona a fronte! ra de de<: । sáo no ponto onde as disti ¡ bu tfdes gau ssianas para as d uas dasses e , se cruzam. AGURA 3.12 Duas distribulcófifi gaussianas unicJimensionais E-uperpostas • O algoritmo de convergencia do perceptron é nño-puiíttfíétríco, significando que ele nao faz suposicocs a nespeito da forma das dislrjbuicbes envolvidas. Ele opera concentrando-se nos erros que ocorran onde ás disttibui^oes se superpoem. Pode, portante, funcionar bem quando as entradas Ibrem geradas por mecanismos físicos nao-lineares e quando as suas distribuidles forcm muito inclinadas c náo-gaussianas. O chssi ricador bayesiano, ao contrario, cpfji-nméirico\ a sua derivado ó dependente da suposicao que as distribuifñe$ envolvidas sejam galicianas, o que pode limitara sua área de aplicagSo. • O algoritmo de convergencia do perccptron c adaptativo e simples de implementar; a sua exigencia de armazenamentn é restritB ao conjunto de pesos sinápticos cbias. Por outro lado, o projeto do classificador bayesiano é fixo; pode ser feito adaptativo» mas á custa do aumento das exigencias de armazenaracnto c de cálculos mais complexos.
3.11 RESUMO E DISCUSSAO O perceptron e um filtro adaptativo utilizando o algoritmo LMS sáo naturalmente ínter-relaciona’ dos» como evidenciado pela atualizaqáa de seus pesos. Na verdade, representar» diferentes impletnentacAes de um perreptrvn de camada única bascado em aprendizagem por corneado de erro. O termo “camada única" é usado aquí para significar que em ambos os casos a camada computadora] consiste de um único neurónio - daí o titulo do capitulo. Entretanto, o perceptron e o algoritmo LMS dtferem entre si em alguns aspectos fundamentáis; • O algoritmo LMS utiliza um neurónio Imear, enquanto que o perceptron usa o modelo formal deum neurónio de McCull&ch'Pitts. • O processo de aprendizagem no perceptron c realizado para um número finito de itcrapocs e entáo é encerrado. No algoritmo LMS, ao contrario, ocorre aprendizagem continua, signifi- cando que a aprendizagem acontece enquanto o processamento do sinal está sendo realizado, de uma forma que nunca acaba. Um limitador abrupto constituí o elemento nao-li reardo neurónio de McCulloch-Pilis, É tentador se colocar a questio: o perceptron feria melhordesempenho se ele utilizaste uma rufo-linearidade sígmóide em vez do limitador abrupto? Ocorrc que as características de regime permanente de tomada de dccis&c, de estado estávcl do perceptron sáo básicamente as mesmas, nao importando se utilizamos um limitador abrupto ou um limitador suave como fonte de náo-lmearidade no modelo neural (Shynk, i990; Shynk e Bcrshad, 1991}. Podemos^ portanto, afirmar formalmente que, desde que nos limitemos ao modelo de um neurónio que consista de um combinador linear seguido de um elemento nao-linear, enlao, independent emente da formada nao-lincaridadc útil izada, um perceptron de camada única pode realizar classificafflo de padróes apenas sobre padróes I i reármente separá- veiü. Encerramos esta discussao sobre perceptrons de camada única com uma nota histórica. O perceptron e o algoritmo LMS surgíram aproximadamente ao mesmo tempo, durante o final dos anos 1950.0 algoritmo LMS realmente sobreviven an teste do tempo. Na verdade, ele se estabele- ceu como o carro-chefe do processamento adaptarivo de sinal devido ll sua simplicidade de impl ementarlo e á sua efetividade cm api i calóes. A importancia do perceptron de Rosen b latt é principalmente histórica. A primeira chuca real ao perceptron de Roscnblact foi apresentada por Minsky c Sellridge (1961), Minsky e Selfridge mostraram que o perceptron como definido por Rosenblatt náo pedería generalizar ncm cm rcla^áo ¿ nocáo de paridade, muito menos fazer abstra^óes genéricas. As limi- ta^óes computaciioníiis do perceptron de Roscnblatt foram subseqüentemente enquadradas em urna fundamentado matemática sólida no famoso livro, Perccplrons, de Minsky e Papen (1969, 1988). Após a aprcscnlfifáo de uma análíse matemática brilhantc c bem-detalhada do perceptron, Minsky e Papen provaram que o perceptron como definido por Rosenblalt é inerentemente incapaz de íazer algumas gencralizacoes globais baseadas em exemplos aprendidos localmente- No último capitulo do seu livroT Minsky e PapeTt fazem a conjectura de que as limitafoes que dcscobriram para o perceptron de Rosenblalt também scriam válidas para suas variantes, mais específicamente, as re- des neurais de múltiplas camadas. Extramdc da Se^áo 13.2 do seu livro (1969): O perceptron mostrou-se merecedor de cstudo apesar de (c mesmo por causa del) suas severas limita^ocs. Ele tem muitas caracterisricas que alraerti a ateiigáo: sua lineandade; seu teorema de aprendizagem intrigante; sua clara MmpX idadc paradigmál^a como uma forma de compulsan
paralela. N3o há raz3o para se supar que qualquer uma dcssas virtudes persista na versan de mullí- pías camadas. Apenar diuo, cotuidcniniM que é um importante problema a ser pesquisado para elucidar (ou reje i lar) nosso julgamento intuitiro de que a sua exlcrisáo para mí temas de múltiplas camadas c estéril. Esta concluso foi largamente responsávd por lanzar serias dúvidas sobre as capacidades cnmputacninais nao apenas do perceptron mas das redes neurais cm gcral ate meados dos anos í>0. Entretanto, a histeria mostruu que a conjuelura feita por Minsky e Papert parece ser injustificada, pois lemas agora varias formas avanzadas de redes neurais que sao mais poderosas, do ponto de vista computaciuna]h que o pcrccplion de Roscnblatt Por exemplo, os peraeptrons de múltiplas camadas, tremados com o algoritmo de retropropaga^o discutido na Capitulo 4, as redes de fun^o de base radial discutidas no Capitulo 5 c as máquinas de velar de suporte discutidas no Capítulo 6, superan as limítameles computacionais do perceptron de camada única, cada um á sua mancira individual. NOTAS E REFERENCIAS L A orgam/afao ilc rede na versáo original do perceptron como considerada por Rosenblltt (1962) tcm irés tipos de unidades; unidades sensoriais, unidades associativas e unidades de resposta. As conexfies das unidades sensorial s para as unidades assoeiativas tÉm pesos fixoí, c as ecmcxács das unidades as&ocialivas para as unidades de resposta tcm pesos varia veis. As unidades asociativas aluam como pré-processadores projetados para exltair um padrao da entrada do ambiente. No que 4ÍZ respeito aos pcw$ v^riaveis, 3 operarán do perceptron de Rosenblatt original é «scnciatmenlc a mesma que aqueta para o caso de urna única un idade de resposta (i.e.. ún i ¿ir neurónio). 2. Diícrcncia^in «m itIj^üo a um vefOF Suponlta que/(TV) represente uma fun^ita de valor Tea] do vetar de parámetros w. A deriva- da de fivt)rm rda^ao a w é definida pelo velar; y _ di jf_____________ dw Su1! ’ Su1. ’ onde rtr é a dírnensio do vetar w. Os dois casos seguinies sáü de mltresse especial; CASO 1 A ñinc3o./(w} é definida pelo produto ¡memo: /(★)= tr* = 1-1 Assim, — =a,. j = l,X-^ifi thítr outta forma matricial equivalente: w (l) CASO 2 A funeao /"(w) c definida pela forma quadrática:
Hidden page
1 > l , ondc tJ2, r c r sao constantes. 1 I J 3.2 Considere a fun^áo de rusto ¿ííw) = -a: -r’.w + -w'R.w 2 2 onde n3 é urna constante c r, R.- _ "0,SIR2 í=[ (1,354 ] 0,8182” asi 82 I {a} Encentro o valar óiitíw w* para D Qual'í (Wi alcanza o sen valor mínimo. (b) Use o método da dcscida mais íngreme para calcular w* para os dois valores seguin- res de parámetro de taxa de aprendizagem: li) n=o,3 (11} n - lo Para cada caso, dcscntic a trajetória trabada pela cvoluijáo do valor de peso wpj} no plano W. Nota: as trajetórias obtidas para os casos _ i) e l ii i da parte (b) deveni corresponder ás imjgens, ^presentadas rm Fig. 3.2. 3.3 Considere i funijáü de costo da Eq. (3.24) que representa uma forma modificada da soma de erras quadrátieos. definida na Eq. (3.17). Musiré que :i aplica^áo do método de Gauss- l^cwton á j-i: (3.24) produz a alualiza^áo de peso descrita na Eq. (3.23). Algoritmo LMS 3.4 A matriz de conela^Ao Ri de vetor de entrada k(m) no algoritmo- LMS é defienda por Defina o intervalo de valones para o parámetro tasa de aprendizagem q do algoritmo l.MS para que seja convergente pelo qu&drado médio. 3.5 O aigariímo LMS ntirmateutto é descrito pela seguinte recursáo para o vetor de peso: w(i| + i) = w(fi)4 n II» M onde r] é uina constante po.HÍtiva e | M^Jil é a norma euclidiana di? velor de entrada i(m), O tmal de em? £{n) é definido jwir e(fl) - d(/r)- wJ (h)x(a) onde íf(rt} é a resposta desejada. Para que o algoritmo LMS normal izado seja convergente pelo quadrada medio, mostré q UC 0 < F|< 2
J .6 O algoritmo LMS é usado para mplcmcntar o canceladcr de lóbulo lateral mostrado na Fig. 2.16. Estabeleca as equa^ies que define m a operario destc sistema, assumindo a utilizado de um único neurónio para a rede neural. 3.7 Considere um previsor linear com seu vetar de entrada constituido das amostras i(n - 1), jt(n - 2) x{n - ai), onde mea ordem da previsto. O objetivo é utilizar o algoritmo LMS para fazer urna predi^to i í/i} da amostra de entrada xl>). Estabclc?a as rcCuraóes que podem ser usadas pera calcular o peso derivativo w|h w^.. to„do previsor. 3.8 A contrapartida etn termos de média de ensemble para a soma de erro* quadrálicos vista como uma funi^to de Gusto é O valor mérito quadrado do ¡.mal de erro: J(w)-y£(e:(n}] {a) Assurnindo que o vetar de entrada x(n) c a resposta desejada sejam retirados de um ambiente esiacionário, mostré que “ Twn + tw^w xi X onde (ti) Para esta funqtode cuito, mostré que o vetor gradiente e a matnz hessiana de J(w) sto expresaos como segué, respectivamente; g = -ru+Rl* H = R. (t) No úigúritma LMSWewtan, o vetor gradiente £ é substituido pelo seu valar instantá- neo (Widrow e Stearns, 1986}. Mostré que este algoritmo, incorporando um parámetro de taxa de aprendizagem TJ, é descrito por W<H + I) = W<«) + T]Rjl(H)(íí(ffl) -1' A inversa da matriz de corrclafáo Ra, assumida como sendo definida positivamente, é calculada ú frente no tempo. 3.9 Ncste problema, revisitamos a memoria por matriz de concia?30 discutida na 3e?to 2.11. Uma deficiencia desta memoria é que quando um padrao-cliavc nf í apresentado a ela, a resposta real y produzida pela memúria pode uto ser próxima o suficiente (no sentido ruclidiano) da resposía dt?$ejad^ (padrao memorizado) y, para que a memoria Msocie per- feitamente. Esta deficiencia é inerente ao uso da aprendizagem hebbiana, que nto possui realimenta^to da saida para a entrada. Como sulufáú para esta deíici&ncia, podemos in- corporar um mecanismo de conecto de erm nu prujeto da memória, foreando-a a associar adequadamente (Anderson, 1983). Suponha que M(jt) represente a matriz de memoria aprendida na itera?to rt do pnv cesso de aprendizagem por correcto de erro. A matriz de memória M(n) aprende a iníor- ma?to representada pelas associa0ea:
x, -> yb, A = 1.2......q (a} Adaptando o ulgoriimo LMS pata este problema. m<witrie que ti votar a&mtiudo da nutriz de memória e den rudo por M(n + l) = M(it)+ ilfjj -M(h)k4})e^ onde TJ í ti parámetro da kix;i de aprefldizjgein. Ib} Fara au(o-as»ocía<3o. y, - \ Para este cuoespecial, mesue qoc quando o número de urra^óes, ir. k aproa jin¡i do infinito, n memória iiuto-asHOcia perfen ámenle, como mostrado par M(“) 1^-^, k = L 2.....q (ci O resultado mostrado na parte (b> pode ser visto como um/JJriMewj rfe UMfrwa¿v. Neste contexto, representa um auiovalor de M(wj. Quais sáo os atitovalores de Mi-)0 3.10 Neste problema. Investí gamos o efeito do bias sobre o número cond ¡clonante de u ma ma- triz de coítcIíkjüo c ccinscqiicrUcmcntc KbR o desempenht] dt> algoritmo LMS. Considere um vetor aleatório X com a matriz de covariancia t o vetor media («} Calcule o número condicionante da matriz de covariancia C. i b i Calcule o numero condicionante da matriz de Lürrelix,a*j R. Comente o efeito do bifes p sobre o desempenho do algoritmo LMS. 0 Perceptron de Rosen blatt 3.11 Neste problema, consideramos um outro método para derivar a equa^u de iCutlizafSp para o perceptron de Roscnblaft- Defina aJiwpúd do critéri&tfoprnxptnm (Duda c Hart. 197?): Aí*>= E f- lí“ isniltí !?(¿oLunjunlo-ik-amostrastlassifiLiiidattinLhHTtljmeTil-r pelacswlhado vcEorde peso w. NoEe que J lwj u definida cníDO zerci :héJ nfio huuver AftMMtTM CiUfciñCA&U incorretamenic. e a siflda é dosificada iiicDnetamenlE se -í 0_ (m h Demoutn gccmcCircainentcque J.(w)é propone i< mal i soma dudutíDcuaeodidiinK entre as amostras claísitkadas iiiéorretauietite e a fnníeira de deciskh ib} DelerminE d pr^dienle de J -íw) cm leLs^ño Jo vetor de ptW w. (c) LJ han do orcsultüLln <-h:ido na parte (b|, mostré qucaftfuAÜZ&pSodos pQÜfi do ptiCcptim e:
*(«» 1}= w(rt) 4-nW X * ilí !' IIF onde SEO(fl)) ¿oconjunto das amostras classificadas incorretamente pelo uso do vetor de peso W(n), e T|(n) éo pSiirtiClnj da taxa de Spcendizágem. Mostrt qut: ujile resultado, para o caso de uma correoso para amostra única, c básicamente o mesmo que agüete descrito pelas Eqs. (3.54) e (3.55). 3.12 Verifique que as Eqs. (3.68) - (3.71), que rcsurncm o algoritmo de convergencia do perceptron, sáo consistentes com as Eqs. (3.54) e (3.55). 3,13 Considere duas clas&es unidimensionaís, com distribuidles gaussiaius r&( e r(. que tíre uma variáncia comum igual a I. Os seus valones médios sño H, = -10 n, =+ 10 Estas duas dasses sto esencialmente líricamente separáveis. Projete um clarificador que separe estas duas classes. 3.14 Suponha que no grifo de fluxo de sinal do percepción mostrado na Fig. 3.6 o limitador abrupto seja substituido pela náo-linearidade sigmóide: <p(r) - lanh^} onde v é o campo local Musido. As dccisftcs de classifíca^So íeitas pelo perccptron sSo definidas como segué; O vetor de observando x pertence a ciasse :r se a saída y > 6 onde 6 é um AMv? curo conlrária, I pertence á ciaste *í£_ Mostré que a fronteiia de decisio assim construida é um h^perplano. 3,15 (a) O perceptron pode ser usado para realizar numerosas fun^des lógicas. Demonstre a implementa^áo das fuñí oes lógic as binarias E, OU e COMPLEMENTO. (ti) Unta limitado básica do perceptron é que ele nao pode iinplementar a futido OU EXCLUSIVO. Esplique a razáo pam ela limitacáo. 3.16 As Equa^Ses (3.86) e (3.^7) definem o vetor de peso e o bias do classificador bayesiano para um ambiente gaussiano. Determine a eomposiffo dcste classificadorpara o caso em que a matriz de covariancia C é definida por C-<fI onde u2 v uma constante. cu
Hidden page
CAPÍTULO 4 Perceptrons de Múltiplas Camadas 4.1 INTRODUCTO Ncstc capitulo, cstudamOx as redes de múltiplas camadas a] i meneadas adi ante, uma importante elas- se de redes neurais. Típicamente, a rede consiste de um conjunto de unidades sensorial (nós de fonte) que constituem a camada defíiírada, uma ou mais camadas ocultas de nós computacionais e uma camada desoída de nós ccmputacLonais. O sinal de entrada se propaga para frente através da rede, camada por camada. Estas redes neurais s3o normalmente chamadas de perceptrons de múlti- plas camadas (MLP, multilayer perceptron), as quaís representara uma generalizado do perceptron de camada única considerado no Capitulo 3. Os perceptrons de múltiplas camadas tém sido aplicados com sucesso para resolver diversos problemas di ficéis, através do seu treinamento de forma supervisi imada com um algoritmo muito popular conhccido como algoritmo de retmpropagacáo de erro (error back-propagation). Este algoritmo é bascado na regra de aprendiíagem por correada de erro, Como tal, pode ser visto como uma gen eral izac&o de um algoritmo de filtra geni adaptativa igualmente popular: o on ¡presente algoritmo do mínimo quadrado médio (LMS) descrito no Capitulo 3 para o caso especial de um único neurónio linear. Básicamente, a aprendizagem por rctropropagado de erro consiste de dois pasaos atravós das diferentes camadas da rede: um passo para frente, a propagando, e um passo para tras, a retmpmpagacao, No passo para frente, um padreo de atividade (velor de entrada) c aplicado aos nós sensoriais da rede e seu efeito se propaga através da rede, camada por camada. Finalmente, um conjunto de saldas é producido como a resposta real da rede. Durante o passo de propagado, os pesos sinópticos da rede s£o todos/tav, Durante o passo para tras, por outro lado, os pesos sinópticos sao todos ajustados de acorde com uma regra de corrc^ao de erro. Especifica mente, a re&posta real da rede é subtraída de uma resposta desejada (alvo) para produzir um sinaf de erro. Este sinal de erro é entilo propagado para irás através da rede, contra a direí 3o das conexóes sinópticas - vindo dai o nome de “retropropagafao de eno" (error back-propagatian), Os pesos sinópticos sáo ajusta-
dos para fazcr com que a resposta real da rede se mova para mais perto da resposta desejada, cm um sentido estatifico, O algoritmo de retropropagatf o de erro é fambém referido na literatura como algoritmo de r^tropropaga^áo (back-pr&pagatiori). 0 processo de aprendizagem realizado com o algoritmo ó chamado de aprendisagem pur retTvprupaga$ito. Um perceptron de múltiplas camadas tem trÉs características distintivas: 1. O modelo de cada neurónio da rede incluí urna fuñado de ativa^ao nao-linear. O ponto impor- tante a se enfatizar aquí é que a náo-linearidade ó jumw(i.e.* diferenclável em qualquer ponto), ao contrario da Limitado abrupta utilizada no perceptron de Rosenblatt. Urna forma normal' mente mi liizada de nlo-hitearidade que satisfaz esta cxigéncuii c uma nao-Iinearidadg slgmáide' definida pcla/imfJo logística. I 7 l+opf-uj onde ico campo local induzido ( i .e., a soma ponderada de todas as entradas sinópticas acres- cidas cío bias) do neurónioj. ey é a salda do neurónio. A presenta de nio-linearidBdes é impor- tante porque, do contrario, a relamió de enlrada-saEda da rede pedería ser reduzida íiquela de um perceptron de camada única. Além diSSO, a utilizando dú fúnffo logística tem motivarse bioló- gica* pois procura levar em conta a fase refratária de neurónios reais. 2. A rede contérn uma ou mais camadas de neurunios acuitas* que nao sao parte da entrada ou da saida da rede. Estes neurónios ocultos capacitan) a rede a aprender tarefas complexas exiraindo progressiKámente as características mais significativas dos padróes (vetores) de entrada 3. A rede exibe um alto grao de cunectividade^ determinado pelas sinlpscs da rede. Uma modríi- caí^o na conectividade da rede requer uma mudanza na populado das conexóes sinópticas ou de scus pesos. 1 através da combinado destas características, juntamente com a hahdidade de aprender da expe- riencia atraves de treinamento* que o perceptron de múltiplas camadas deriva seu poder computantonal. Estas mesmas características, entretanto, sto lambém responsáveis pelas deficien- cias no estado atual de nosso conhceimcnto sobre o comportamcnto da rede. Primero* a presenta de uma forma distribuida de nJo-l i nearidade e a alta conectividade da redetornam difícil a análise teórica de um perceptron de múltiplas camadas. Segundo, a utilizado de neurónios ocultos torna o processo de aprendizagem mais difícil de ser visualizado. Em um sentido implícito* o processo de aprendizagem deve decidir quais características do padrao de entrada devem ser representadas pe- los neurónios ocultos. O processo de aprendizagem, conseqüenlemenle* torna-sc mais dificil por- que a busca deve ser conduzida cm um espaco muito maior de fun^óes possiveisT c deve ser feita urna escolha entre representares alternativas do padreo de entrada (Hinton, 1989). O emprego do termo ^rctropropaga^áo" (back-pmpagatian) parece ter sido desenvolvido após i 985, quando seu uso foi popularizado pela publicado do livro seminal, intitulado Pamllei DairilMed Processing^ (Rumclhart c McClelland, 1986). Veja a Se^3o 1.9 sobre notas históricas acerca do algoritmo de reinypropagafdo. O desenvolv ¡mentó do algoritmo de retrapropaga^o representa um marco ñas redes neurais, pois fomece um método computacianai eficiente para o treinamento de perceptrons de múltiplas camadas. Apcsar de nao podemos afirmar que o algoritmn de retrapropagafSo feme^a uma solu- cao ótima para todos os problemas resol□ veis, ele acabou com o pessimismo sobre a aprendizagem cm máquinas de múltiplas camadas que ttavia sido causado pelo livro de Minsky e Papen (1969).
Organizabas do Capítulo Nesle capitulo^ estudamcs os aspectos básicos do perceptron de múltiplas camadas, bem como a aprendizagem por retropropaga^áo. O capitulo está organizado em sel? partes. Na primetra parte, ahrangendo as Se^oes de 4.2 a 4 6, discutimos assuntos relacionados á aprendizagem por rclropropaga^áo. Cometamos com algumas tons idcrafBtfl prclirr-inarcs na Sc^áo 4,2 para preparar o caminho para a derivafáo do algoritmo de retropropaga?áo Na Se?ác 4.3. ^presentamos uma derivado detalhada do algoritmo , útil izando a regra da cadeia do cálculo; seguimos uma aborda- gem tradicional na deriva^io aquí apresentada. Uin resumo do algoritmo de retropropagaqáo í apresentado na Sc^áo 4.4. Na Sc^áo 4.5, ilustramos o uso do algoritmo de rctroprcpagafáo resol- vendo o problema do XOR, um problema interessAnlc que nSo pode ser resolví do por um perccptron de camada única. Na Se^áo 4.0, apreveníamos algumas regias pláticas ou heurísticas para fazer com que o algoritmo de retropropaga^áo lenha melhor desempenho, A segunda parte, ahrangendo as Sebees de 4.7 a 4.9, explora o uso de perceptron? de múltiplas camadas para O rcconhecimenlc de padrdes. Na Se^áu 4.7, abordamos o desenvoh imento de uma regra para a utilizado de um perceptron de múltiplas camadas para resolver o problema estatíslico de reconhecimentó depadróes. Na Serian 4.8, utilizamos um experimento computacional para ilus- trar a aplicaqao da aprendizagem per rclnopropuga^áo pata distinguir entre duas elasses de distri- buí fíes gaussianas, bullí mensionats superponías. Na Se^áo 4.9, é discutido o papel importante dos rculorjos ocultos. A terceira parte do capitulo, abrangendo a? Se^óes de 4.10 a 4.12, trata da superficie de erro. Na Sc^áo 4,10, discutimos o papel fundamental da aprendizagem por retropropagaqao no cálculo das derivadas paresis de uma fun(áo aproximada. Discutimos cntáo, na Sc^áo 4.1 I, questftes computa? ionais relativa? a matriz hessiana da superficie de erro. A quarta parte do capitulo trata de vários assunlos relacionados com o desempenho de um perccptron de múltiplas camadas [reinado com o algoritmo de rctropropaga^ao. Na Se^áo 4.12, discutimos a questáo da general i za^áo, a csscn<ia fundamental da aprendizagem. A Scfáo 4.13 discute a aproMtnafáo de fundes continuas por meio de perceptrons de múltiplas camadas. O uso de validado cruzada como uma fcrramcnta cstatística de projeto é discutido na Se^áo 4.14. Na Sccao 4.15, dcscrcvemos procctLimenlos para “podar” ordenadamente um perccptron de múltiplas camadas, maniendo (e freqüentemente melhorando) o desempenho global. A poda de redes é dese- jável quando a complexidad? compuiacicmal é a preocupado fundamental. A quinta parte do capítulo completa o cstudo da aprendizagem por rctropropaga^áo. Na Sefáo 4.16, resumimos as importantes vantagens e limitares da aprendizagem por reiropropagafao. Na Sc^ao 4.17, investigamos heurísticas que fomeccm normas sobre como acelerar a taxa de conver- gencia da aprendizagem por retropropaga^áo. Na sexta parte do capitulo, seguíinos. um ponto de vista diferente sobre h aprendizagem. Tendo como objetivo a melhoriada aprendizagem. discutimos aquesto da aprendizagem super- visionada como um problema de otimiza^áo numérica na Se^áo 4.18. F’m particular, dcscrevc- mos o algoritmo do gradiente conjugado e o método quase-Newton pára a aprendizagem supervi- 5íi muda. A última parte do capítulo, a Secan 4.19, trata do perceptron de múltiplas camadas propia- mente dito. Lá. descrevemos uma estrutura interessante de rede ncurah o perceptmn de múltiplas camadas de c&nvahtQÁa. Esta rede tcm s;do usada com sucesso na soIn^io de problemas diRceis de reconheci mentó de padróes. O capitulo concluí oom uma discussác gcral na Sc^ao 4.20.
4,2 ALGUNAS CONSIDERALES PRELIMINARES A Figura 4.1 tncstra o grato arquitetura! de um perceptron de múltiplas camadas com duas camadas ocultas e uma camada se saida. Para preparar o terreno para uma describan do pcrccptron de múlti - pías camadas na sua forma geral, a rede aquí mostrada é fatalmente enneciada. Isto significa que um neurónio ern qualquer carnada da rede está conectado a todos os nós/ncuronios. da camada anterior. O fluxo de sinal atreves da rede progride pare frente., da esquerda para a direita c decantada cm camada. Fl G U RA 4,1 g ralo arquiielural de um percepinon [fe múltiplas camadas com duas camadas ocultas A Fig. 4.2 representa uma por^ao do pcrccptron de múltiplas camadas. Dou tipos de sinais súo identificados nesta rede (Parker, 19B7): —'--► Si nais ruiKzinnaiK *-----Simis de erro FIGURA 4.2 Elustra^áo tías dita^Ses de dais IluXOS. tfe Sinal básicas am um perceptron efe múltiplas camadas: a propagado para fwitá da S¡03)S tlrncionais & a rSt/Oprúpagaijáo de sinais ds erro 1. Sitiáis Funefdnaís. Um sinal funcional c um smal de entrada (estímulo) que incide no terminal de entrada da redeh propaga-se para frente (nuurunió por neurónio) através da rede e emerge no terminal de saida da rede como um sinal de saida. Rcfcrimo-nos a este sinal como um ^sinal funcional” por duas razóes. Prime i nx presume-se que ele realizo uma funfáu útil na saida da rede. Segundo, em cada neurónio da rede através do qual um sinal funcional passa, o sinal e calculado como uma Punteo de suas entradas c pesos associgdos, aplicados áquele neurónio. O sinal funcional é também denominado sinal de entrada.
2. Sinais de Erro. Um sinal de cito se origina cm um neurónio de salda da rodo c se propaga para tras (camada por camada) através da rede. Referí mo-nos a ele como um “sinal de erro" porque sua computado por cada neurónio da rede envolve uma fun0o dependente do erro, de utna forma ou de outra. Os neurónios de salda (nós computacionais) consiituem a camada de saída da rede. Os neurónios restantes (nós computacionais) constituem as camadas ocultas da rede. Assim, as unidades ocultas nao sao parte da saída ou da entrada da rede — daí a sua designado como “ocultas". A prime ira camada oculta é alimentada pela camada de entrada, constituida de unidades sensoriais (nós de fonte); as saldas resultantes da pnmeira camada oculta s&o por sua vez aplicadas á próxima camada oculta; e assim por diante para o resto da rede. Cada neurónio oculto ou de salda de um perceptron de múltiplas camadas é projeiado para realizar dois cálculos: 1. O cálculo do sinal funcional que aparece na saída de um neurónio* que c expresso como uma turneo náo-linear do sinal de entrada e dos pesos sinápticos as sociados com aquele neurónio. 2, O cálculo de uma estimativa do vetor gradiente (i.e., os gradientes da superficie de erro em relapso aos pesos conectados as entradas de um neurónio), que é ncccssáric para a retropropaga^áo atreves da rede. A derivacáo do algoritmo de retropropagafáo c bastante envolvente. Para aliviara carga matemática envolvida na sua derivado, primeiro apresentamos um resumo das notajes utilizadas na deriva- ^áo. Notado * Os Indices i, j e k se referem a neurónios diferentes na rede; com os sinais se propagando airavés da rede da esquerda para a direita, o neurónio j se encontra em uma camada á direita do neurónio r, e o neurónio k se encontra cm uma camada á direita do neurónio /, quando o neurónio j i uma unidade oculta. • Na itera^ao (passo de tempo) n, o n-ésimo padrao de treinamento (exemplo) é apreseniado á rede. • O símbolo ¥(n) se refere á soma instantánea dos ortos quadrátioos ou energía do erro na ilcracáo n. A média de ‘Sfn) sobretodos os valores den (i.e., o conjunto inteiro detreinamento) produz a energía media do erro media • O símbolo c (jv) se refere ao sinal de erro na saída do neurónio j, para a iterado n. ♦ O símbolo dt.H) se refere á resposta desejada para o neurónio j e é usada para calcular ept). • O símbolo ^(rf) se refere ao sinal funcional que aparece na saída do neurónio/* na íteraQao n. • O símbolo w.pr) representa o peso sinóptico conectando a salda do neurónio i á entrada do neurónio j, na iterado n. A oorre^áo aplicada a este peso na iterapao n c representada por • O campo local induzido (i.e., a soma ponderada de todas as entradas sinápricas acrescida do bias) do neurónio/ na iteracao n é representado por t'fn); constituí o sinal aplicado á fun^áo de ativa^áo associada com o neurónioj. • A fun^áo de ativa^áo* que descreve a relajo funcional de entrada-salda da náo-Iíncaridadc associada ao neurónio jt é representada por q>(-).
• O bias aplicado ao neurónio j c representado por 6; o seu efeito é representado por uma sinapse de peso w?dl = b. conectada a uma entrada Asta igual a +1. • O í-ésime elemento do vetor (padrao) de entrada é representado por xfri). * O A-csimo elemento de vetor (padráo) de saida global c representado por oXn). * O parámetro da taxa de aprendizagem é representado por T|. • O símbolo representa o tamanho (íjCl, ° número de nós) da camada / do perceptron de múltiplas camadas; i = 0, I,. .... £, onde £ é a "pnofund idade1' da rede. Assim, oi0 representa o tamanho da camada de entrada, m, representa o tamanho da pnmeira camada oculta e fri. representa o tamanho da camada de saida. A notado - M também c usada. 4,3 ALGORITMO DE RETRO PRORAS A£ÁO O sinal de erro na saida do neurónio j, na iterado n (Le., a ¿presentará# do n-ésimo exemplo de treinamento), ó definido por <?(n) - dfn)-y(n}, o neur&nic J é um no de saida (4.1) Definimos o valor instantáneo da energía do erro para o neurónio/ como j ^(n). Corrcspcndcntcmcnte, o valor instantáneo ^(fl) da energía total do erro éobtido samándose os termes f c (w) de todos oa neurónios da camada de saida; sáó OS únicos neurónios **vi.síveis” para os quais os sinais de erro podem ser calculados dirctamcntc. Podemos assim escrever (4.2) * MC onde o conjunto C incluí todos os neurónios da camada de saida da rede. Considere que j¥represen- te o número total de padrees (exemplos) comidos no conjunto de treinamento. A energía média do em quadrudo é obtlda somando-se os ^E(n) para todos os c cnlao normalizando cm rela^au ao tamanho do conjunto A, como mostrado por A energía instantánea do erroíft(tt), e conscqiientemcnte a energía média do erro c uma tunca# de todos os parámetros livres (i.e., pesos sinópticos e nivels de biu) da rede. Para um dado conjunto de treinamento, % representa a junado de cusía como uma medida do descmpentio de aprendiza- gem. O obietivc do processo de aprendizagem é ajustar os parámetros livres da rede para minimizar V Para fazer esta minimiza^ao, utilizamos uma aproximadlo similar em raciocinio áqucla usada para a derivado do algoritmo LMS no Capítulo 3. Específicamente, consideramos um método simples de treinamento no qual OS pesos SóO atualizados de padrao em padrao ¿té formar uma época, isto c, uma apresentacao completa do conjunto de treinamento inteiro que está sendo proces- sado. Os ajustes dos pesos slo realizados de accrdo com os respectivos erras calculados para cada padrao ¿presentado á rede. A media aritmética destas alterares Individuáis de peso sobre o conjun- to de treinamento é, perianto, uma estimativa da alterado real que resultaría da modificaba# dos pesos bascada na minimizafáo da firncáo de cuito sobre o conjunto de treinamento inteiro. Abordaremos a quabdade desta estimativa posteriormente nesta seqao. Considere cntáo a Fig. 4.3, que représenla o neurónio j sendo alimentado por um conjunto de sinais funcionáis produzidos por uma camada de neurónios á sua esquerda- O campo local induzido v (n) produzido na entrada da furifáo do ativa^áo associada ao neurónio j é perianto
Ncurünki j V,(n)= Ew/WftOO i = n (4,4) onde m é o número total de entradas (excluindo o bias) aplicadas ao neurónio/ O peso sináptico w.,, (correspondiendo a entrada fíxajp, = +1) é igual ao bias /i aplicado ao neurónio/. Assim, o sinal funcional que aparece na salda do neurónio./ na iterado n é y/") = ’P/V/'O) (4-5) De uma forma similar ao algoritmo LMS, o algoritmo de reiropropagafJo aplica uma conejo AWjjOr) ao peso sináptico u’./r), que é proporcional á derivada parcial De acorde com a mgra da cadmía do calculo, podemos expressar este gradiente como: cfé(jt) _ dft(w) ¿teja) fy(ff) dtt/rt) du^(fl) Se/») 3y;(n) ¿b;(n) ^(n) (4.6) A derivada parcial d^f^ydw tn) representa um faiorde sensibilidades determinando a dirrgáo de busca no espado de pesos, para o peso sináptico w^,. Diferenciando ambos os lados da Eq. (4.2) cm rcla?ao a obtemos = e/rt) cte/rt) (4.7)
Diferenciando ambos os lados da Eq. (4.1) em rela^áo a i i n), oblemos (tyte) (4.8) A seguirT diferenciando a Eq. (4.5) em rela^ao a rte), oblemos fyte) d»/n) fjte/n)) (4.9) onde o uso do apostrofe (no lado dimito) significa a diícrencisfáo em relapso ao argumento. Final* mente, diferenciara Eq, (4 4) cm relajan a Wjj(n) produz fyte) ^.(fl) r.te) (4.10) O uso das F.qs. de (4.7) a (4.10) cm (4.6) ptüduK •OOM'O (4.11) A corrc^áo áto^F?) aplicada a w (i) é definida pela negra dclfá, d%(jr) d'UP^j^Jr) (4.12) onde T) é o panirttetm da laxa de opiendizagem do algoritmo de retropropagafáo. O uso do sinal negativo na Eq. (4.12) indica a descida do podiente no espado de pesos (i.c.T busca uma dire^ao para a mudanza de peso que reduza o valor de '£(n)). Coiruspondentememe, o uso da Eq. (4.11) em (4.12) produz (4.13) onde o gradiente local 8 (a) é definido por s- , , ^í(rt) dr.(fl) ¿fa(tf) ¿te, te) di, te) de:(ít) ¿te.te) ¿h-'.te) -Cj tejóte,(")} (4.14) D gradiente Local aponía para as modificares necessárms nos pesos sinápticos. De acordo com a Eq+ (4.14)t o gradiente local &(n} para o neurónio de saída j c igual ao produlo do sinal de erro tf.te) currcspondente para aquele neurónio peta derivada <p 7 te)) da lüncáo de ativacáo associada. Das Eqs. (4.13) c (4.14) notamos que um fatoi'chavc envolvido no cálculo do ajuste de peso A tí.'.(n) é o sinal de erro e i n) na saída de neurónio j. Ncslo contexto, podemos identificar dois casos A?t1,1(tt) = ’]
distintos, dcpcndcndo de onde na rede o neurónio j está localizado. No caso o neurónio/ é um nó de saida. Este caso é simples de se tratar, porque cada nó de saida da rede é suprido com uma resposta de&ejada particular, fazendo com que o cálculo do sinal de erro assocíado seta direto. No caso 2, o neurónio/éum nó oculto. Apesar de os neurónios ocultos nao serem aocssívcis dirctamcntc, cíes compartilham a responsabilidad^ por qualqucr erro cometido na saida da rede. A questáo, entretanto, é saber conno penalizar ou recompensar os neurónios ocultos pela sua parcela de respon- sabilidade. Este problema e o problema de atribuida de crédito considerado na Sc^ác 2.7. Ele é rcsolvido de forma elegante retropropagando-se os sinais de erro através da rede. Caso 1 O Neurónio j é um Nó de Saida Quando o neurónio j está localizado na camada de saida da rede, ele é suprido com uma resposla desejada particular. Podemos utilizar a Eq. (4.1} para calcular o sinal de erro eín) associado com este neurónio; veja a Fig. 4.3. Tendo-se determinado calcula-sc dirctamcntc o gradiente local 6,( fl)T usando a Eq. (4.14). Caso 2 O Neurónio Jé um Nó Oculto Quando O neurónio j está localizado em uma camada oculta da rede, nao existe uma resposta deso- jada especificada para aquele neurónin. Correspondentemente, o sinal de erro para um neurónio oculto deve ser determinado recursivamente, cm termos dos sinais de erro de todos os neurónios aos quais o neurónio oculto está dirctamcntc conectado; aquí c onde o desenvolví mentó do algoritmo de rctioprüpagaqáo se toma complicado. Considere a situado apresentada na Fig. 4.4T que representa o neurónioJ como um nó oculto da rede. De acordo com a Eq. (4.14), podemos redefinir o gradiente local 0 ín) para o neurónio oculto / como fyOrJdv/ir) (4 >15j - - - - , = - ip (u (nj), o neuronio / e oculto d>;(n) > onde na segunda linha utilizamos a Eq. (4.9). Para calcular a derivada parcial d^(ff)/5>’(fl), pode- mos proceder como segue. Da Fig, 4.4 vemos que 2 íbC o ncuróniit k é um nó de saida (4.16) que é a Eq. (4.2) com o indice k utilizado no lugar do índicej. Fizcmos isso para evitar a confusáo com o uso do índice j, que se refere ao neurónio oculto no caso 2. Diferenciando a Eq. (4.16) em relaoao ao sinal funcional yfp). obtemos d^(n) _ y1 ttef(n) j * djr/rf) (4.17) A seguir, utilizamos a regra da cadeia para a derivada parcial e rescrevemos a Eq. (4.17) na forma equivalente
yX«) FIGU R A 4.4 G rato dt¡ IIlixú da sin^l kl daialhes do nfttirónk} de so ida conectado aa nsurQniú úcxjNq j í^(«) _ v r i ^Et!ül í4 [8> Entretanto. da Fig. 4.4 notamos que £>(«) = (ít) = d¿ (ni - <ph í fé ( ji )), o neurónio £ é um nó de saída Assim, t¡S= *<•’*<'*» H-M) Também notamos da Fig. 4.4 que para o neurónio k o campo loca] induzido c n B X’M'fo'jW (4J1) onde mée número letal de entradas (cxcluindo o bias) aplicadas ao neurónio k. Aquí novainente. o peso sináptÍLio é igual ao bias fi/n) aplicado ao neurónio k, c a entrada correspondente e$l¿ fixa no valor fr I, Diferenciar a Eq. (4.21) cm relacáo a pin) produz
(«) = W^(") (4.22) Utilizando as Eqs, (4.20) o (4,22) em (4.18), oblemos a derivada parcial desejada: y;-~ = CfV 1 rt ? ; (4.23) = -£&i («)*»<(*) t onde, na segunda linha, utilizamos a defini^iio do gradiente local Ó^fl) dada na Eq, (4,14), com o índice Á‘ substituido por J. Finalmente, utilizando a Eq. (4,23) em (4.15), oblemos a fórmula de retropropaga^áo para o gradiente local Í5 {/]) como descrito: S/fl) = O neurónio j é oculto {4 24) A Figura 4,5 mostra a representado por grafo de íluxo de sinal da Eq. (4.24), assumindo que a camada de salda consista de neurónios w, Mrt) FIGURA 4.5 Grato da fluw da sinal d» uma pan» de sistema ad.unta pGrtenwnfe á refroprapagaQ&o dos sinais de-ama O * ^(*) o M") O fater <p'(fl(n)) envolvido no cálculo do gradiente local 6 (n) na Eq. (4.24) depende únicamente da fun^ao de ativa^áo associada ao neurónio ocultoj. O fator restante envolvido neste cálculo, ou seja, o somaíório sobre Á\ depende de dois conjuntos de Leimos. O pnmeiro conjunto de termos, os requer conhecimento dos sinais de erro ejit), para lodos os neurónios que se encontram na camada iiTLcdiatamcnte á direita do neurónio oculto j e que están directamente conectados ao neurónio/: veja a Fig. 4.4. O segundo conjunto deteneos, os tc^íw), consiste dos pesos sinápticos asociados com estas conexóes. Agora resumimos as rcla(Óes que derivamos para o algoritmo de retropropaga^áo. Frimeiro, a correrán AW?..(ji) aplicada ao peso sináptlco conectandc o neurónio í ao neurónio/ ó definida pela regra delta: Cojrefdo de peso Parámetro da laxa de aprendizagem Gradiente' focal ' sinal deenlrada' do neurónio j (4.25) Segundo,o gradiente local 5 (>r) depende de se o neurónjej c um nóde saída ou seé um nóoculto:
L Se o neurónio / ó um rió de aaida. Spj) é igual ao produto da derivada w j.pelo sinal de erro ambos sendo associados ao neurónioJ; veja a Eq. (4.14). 2. Se o neurónio./ é um nó oculto, &.(«) é igual ao produto da derivada associada cp i r íj)) pela soma ponderada dos Ss calculados para os neurónios na próxima camada oculta ou camada de saída que cstáo conectados ao neurónioj; veja a Eq. (4.24). Os Dois Passos da Compute?» Na aplicaban do algoritmo de recropropagaqáo, d^tinguem-sc deis passos distintos de computado. O primeiro passo é conhecido como passo para frente, ou propagado, e o segundo como passo para Irás, ou retropropagacao. No passo pura frente, os pesos sinápticos se manteen inalterados cm toda a rede e os sinais funcionáis da rede sao calculados individualmente, neurónio per neurónio. O sinal funcional que aparece na saída do neurónio /¿calculado como J'pr)- <PU'/h}) (4.26) onde t-'.OO ó o campo local induzidodo neurónm j, definido por ?-. («)£ ’<1., (»W «) (4.27) L-ll onde nr é o número total de entradas (cxcluindo o bias) aplicadas ao neurónio/T c w («) é o peso sináptico que conecta o neurónio í ao neurónio,/. e v.(it) é o sinal de entrada do neurónio j ou equivalentemente, o sinal funcional que aparece na suida do neurónio í. Se o neurónio j estiver na primara camada oculta da rede, nr = mi; e o índice i se refere ao í-ésimo termina] de entrada da redeT para o qual esenevemos i^n) - jc/fl) (4.2 8) onde r(n) éo í-ésimo elemento de vetor (padrao) de entrada. Se, por outrO lado, u neurónio j cstivtr na camada de saída da rede, m = ms c o índice,/ se refere au j-ésimo terminal de saída da rede, para o qual escrevemos o/Jt) (4.29) onde o 00 c o/-étimo elemento do vetor (padrao) de saída. Esta saída c comparada com a rcsposta desejada ohtendo-se o sinal de erro e/n) para o./-ésitno neurónio de saída. Assim, a fase de propagando da computado cometa na primeira camada oculta, com b apresentacSci do vetor de entrada, c termina na camada de saída calculando □ sinal de erro de cada neurónio desta camada. O puso de retrepropagaflo, por outro lado, cometa na cantada de saída passando-sc os simáis de erro para a esquenda através da rede, camada por camada, e recursiva mente ealculando-se o € (i.e., o gradiente Local) de cada neurónio. Este processo tecursivo pcrmiic que os pesos sinápticos sofram modifícacñcs de acorda cent a regra delta da Eq. (4.25), Para um neurónio localizado na camada de Mída, o S é simplesmerile iyual ao sinal de erro daquele neurónio multiplicado pela primcini derivada da sua náo-linearidade. Assim, utilizamos a Eq. (4.25) para calcularas modifica- cocs dos pesos de todas as concxócs que alimentam a camada de saída. liados os 3s para os neurónios da camada de saída, utilizamos, a seguir, a Eq. (4.24) para calcular os ó-, para todos os neurónios na
Pj-RCEITEinfJS. DE MüLTTnAS CAMADAS 195 penúltima carnada, e conseqüentemente as modificares des pesos de todas as conanoes que a alimentan!, A computaba recursiva continua, camada por camada, propagando as modificabas para todos os pesos sinópticos da rede. Note que para a aprésenla^ de cada exemplo de treinamento, o padrto de entrada está fixc (“pre- so”) durante todo o ciclo, englobando o passo de propagado seguido pelo passo de retropropegabo. Fundan de Ativa^ao O cálculo do & para cada neurónio do perceptron de múltiplas camadas requer o conhecimento da derivada da fúnbo de ativabo p() óswciada aquel c neurónio. Para esta derivado existir, ncccssi- lamos que a funbc <p(-) seja continua, Em termos básicos, a difcrendubilüiatie é a única exigencia que a ftin^o de ativabo deve satisfazer. Um exemplo de uma fun^o de aiivat’áo nao-linear, conti- nuamente difcrcnciávcl normalmente utilizada nos perceptrons de múltiplas camadas é a nao- íineañdade sigmoidea desbrevemos duas formas desla funqáo: L Fuhgüü Logística. Esta forma de nác-linearidade sigmóide na sua forma geral é definida por l»,(tí?00)“7-------7----— «>0 e (4.30) 1 + exfX-ev/fl)) onde t? (n) é o campo local induzido do neurónioj. De acardo com esta nác-Linearidade, a ampl ilude da saida se encontra dentro do intervalo Ü <_i <1. Diferenciando a Eq. (4.30) em relajo a obtemos tp/TJ; (*)) = fl expí-m?, (w)) [l + expf-ía'/fl))]* (4.31) Comy^/r) “ V/v/n}). podemos eliminar o termo exponencial eKp(-du?(w)) da Eq. (4.31)* e assim expressar a derivada ipJ U' (rf)) como (p;(^))-í _y/«)[l -y/n)] (4.32) Para urn neurónio j localizado na camada de saida, gradiente local para o neurónio j como y.(n} = o,(n). Assim, podemos expressar o (¥,(«)} = Op/ff) - Of (rt)[l - <?.(«)], (4,33) o neurónio j é um nó de saida onde o (n) é o sinal funcional na saida do neurónio/, c rf(«) c a resposta desejáda para ele. Por OUtro lado» para um neurónio oculto arbitrario j, podemos expressar o gradiente local como 8,(«) - = ay ( f; /1 - 7 (a i ] y, 5, (jt{ir), o neurónio J é oculto (4,34) Note da Eq. (4.32) que a derivada vr/v.(n)) alcanza o seu valor máximo emj/;(fl) 0,5, e o seu valor mínimo (zcro) cm j> l u) = 0, ou j <n) = I »0. Como o valor da modificaba do peso sináptico da rede
é proporcional á derivada íp/v.t'i)), resulta que para uma íun^So de atlvng&o sigmóMe, es pesos sinápticos sao modificados mais intensamente para aqueles neurónios da rede onde os sinais funcionáis estáo no meio do seu intervalo. De acorde com Ruinelhart el al. i i QSGa)* é esta caracte- rística da aprendizagem por retropropaga^ao que contribuí para a sua estábilidade como um algoritmo de aprendizagem. 2. Fundió tangente hiperbólica. Uma outra forma normalmente utilizada de rtáo-línearidade sigmóídce a futi^-o tangente hiperbólica, que na sua forma mai'i gcral é definida por Ip.fv/*)) a lanh(¿?j,(n)), (o. 6) > 0 (4J5) onde tí e b silo constantes. Na realídade, a fundan tangente hiperbólica c a funqao logística reescalada e modificada por um bias. A sua derivada em relajo a v(,i) é dada por <p' (t:. (ni) = । .'¿> scch" l.M-1 l n)) = - tanh2 (óu . (/r)i ¡i (4_ 3 = -|ú^v/n)JiJ+^(jFl] Para um neurónio/localizado na camada de saída. o gradiente local é ül (4.37) Para um neurónio /' cm uma camada oculta, temos 3 J (íí) = <P; (l?j ((rtJWx, t rt 1 Jt = ^Li -}•,(#» )J« 5,. úrk o neurónio./c oculto a 1 (4.38) Utilizando as Eqs. (4.33) e (4.34) para a funqao logística e as Eqs. (4.37) e (4.38) para a fundió tángeme hiperbólica, podemos calcular o gradiente local o. sem a ncccssidade do conhecimentó explícito da fun^áo de alivacáo. ATaxa de Aprendizagem O algoritmo de netnopropagacáo fnmece uma "aproximadlo" para a trajelória no espado de pesos calculada pelo método da desoída mais íngrcmc. Quantc menor for o parametro da laxa de aprendí- zagem q, menor serle as varia^óes dos pesos sinápticos da rede, de uma ítera^ao para a outra, e mais suave será a trajetóría no espaqo de pesos. Esta melhoria, entretanto. é obtída á custa de uma taxa de aprendizagem lenta. Par outra lado, se fizermes o parámetro da tasa de aprendizagem 1] mu i lo grande, para acelerar a taxa de aprendizagem, as grandes modificadora nos pesos sinápticos resultantes podem tomar a rede instóvel 1 i.e., oscihicna). Um método simples de aumentara laxa de aprendizagem, evitando no entantn o perjgo de instabilidadc, é modificar a regra delta da Eq. (4.13) incluí indo um termo de momento.' como mostrado por (Rumelhart et al, 1986a)
Aw/fl) = oAu^m -1) + (4.39) onde a é usualmente um número positivo chamado de constante efe momento. Ele controla o lapo de realimentacáo que age em tomo de como ilustrado na Fig. 4.6, onde z_| é o operador atraso unítário. A EquavÜo (4.39) c chamada de regra delta generalizada*, ela incluí a regra delta da Eq. (4.13) como um caso especial (i.e., a = 0). FIGURA 4.6 Grato da fluxo da sinal ¡lustrando o eteito da «n$- ante üh mámente a Para ver o efeito da seqüéncia de apresentasoes de padrees sobre os pesos sinápticos divido á constante de momento a, rcscrevcmos a Eq. (4.39) como uma séric temporal com Indice f. O Índice t vai do tempo inicial 0 ao tempo comente n. A Equaqáo (439) pode ser vista como uma equa^^o de diferenbasde primeira crdem para a Gorrero de peso ÁWr(/tX Resol vendo esta equa^ao para Aíc (ji), temos rl Aw1|(F?) = n^an’r6J(f)yí(0 (4.40) que representa urna série temporal de comprimento fl * 1 - Das Eqs. (4JI) e (4.14) notamos que o produto é igual a Conseqúentemente, podernos rescrever a Eq. (4.40) na forma equivalente Aw/)(n) = -q^a !=0 W0 (441) dw/r) Com base nesta retalio, podemos fazcr as scguinccs observables (Watrous, 1987; Jacobs, 1988); 1. O ajuste córtenle Auy rt) representa a soma de uma serie temporal ponderada cxponencialmente. Para que a serie temporal seja cwnwgiMtei a constante de momento deve ser restrita ao intervalo 0 £ |a| < 1. Quando (X é zero, o algoritmo de rctropropagapSo opera sem c momento. A constante de momento a também pode ser positiva ou negativa, apesar de ser improvável que um ot negativo seja usado na prática. 2. Quando a derivada parcial tem o mesmo sinal algébrico em iteraqpes consecuti- vas, a soma ponderada exponencial mente, Aw.,(fl), cresce em magnitudc, e assim o peso ur(n) é ajustado por um valor grande. A inclusao do momento no algoritmo de retropropagafSo rende a oce/erar a descida em dire^tes com declividade constante. 3* Quando a derivada parcial 3^(r)/^w.L(r) tcm sinais opostas em iterantes consecutivas, a soma ponderada exponencialmente, Aw..(fl), diminui em magnitude, de modo que o peso wj» é ajustado por urna quantidade menor. A inclusño do momento no algoritmo de retropropagaf^ü tem um efeíto estabilizador ñas dlre^cíes que oscilam cm sinal. A incorporabáo do momento no algoritmo de retropropagab^o representa uma modifícabáq pequeña na atualiza£io dos pesos, contudo ela pode ter alguns efe i tos benéficos sobre o comporta-
mentó de aprendizagem do algoritmo. O termo de momento pode também tero beneficio de evitar que o processo de aprendizagem termine em um mínimo local raso na superficie de erro. Na derivarán do algoritmo de rctropropagafáo, assumiu-sc que o parámetro da taxa de apren- dizagem é uma constante representada por rj. Na realidade, entretanto, ele deveria ser definido como n ; isto é, o parámetro da laxa de aprendizagem deveria ser dependente da eanBcaa. De falo, muitas en isas intenessantcs podem ser lenas seo parámetro da taxa de aprendizagem for diferente, cm diferentes panes da rede. Fomecemos mais déla Ules sobre esta questáoein seises subsequentes. L também digno de nota que na aplicaban do algoritmo de retropropagacao podemos escolher que lodos os pesos sináptiros das rede sejam amslávcis, ou podemos restringir qualquer número de posos da rede a permanecerem íixos durante o processo de adaptado, Neste último caso, os sitiáis de erro sao retropropagados através da rede na forma usual; entretanto, os pesos sináptieos súo deixados inalterados. Isto pode ser realizado simplemente fazendo-se o parámetro da taxa de apren- dizagem n para o peso sináptico igual a zcro. Modos de Treinamento Seqüendal e por Lote Em uma aplicado prática do algoritmo de retropropaga^áo, o aprendizado resulta das muñas apre- sentaqoes de um determinado conjunto de exemplos de treinamento para o pcrccptron de múltiplas camadas. Como mencionado anteriormente, uma apresen ta^ao completa do conjunto de Inri ñámen- lo inteiro é denominada uma época. ü processo de aprendizagem é mantido em urna base de época em época até os pesos sináplicos e os níveis de bias se estabilizaren! e o erro medio quadrado sobre todo o conjunto de treinamento convergir para um valor mínimo. É uma boa prática tomar atectfó- ría a ordem de apeeaenta^do dea exemplos de ríe mámenlo. de uma época para a seguí nte, Esta alcHtoriedade tendí a tornar a busca no espado de pesos estocástica sobre os ciclos de aprendí za- gem, e1. । lando assim a pnssihilidade de ciclos limitados, na evolu^áo. dos vítores de pesos sináptieos; os ciclos limitados sao discutidos no Capitulo 14. Para um dado conjunto de treinamento, a aprendizagem por relropropaga^áo pode entao pro- ceder de urna entre duas formas básicas: L Modo SetpieríeiaL O modo seqüeiiciat da aprendizagem por retropropaga^áo é também cha- mado de modo an-fine, moda padrao ou moda csrocásliea. Ncstc modo de epenaqáo, a atual izarán dos peses í realizada após a Bpresentaffio de cada exemplo de treinamento; este é o modo de apre- scotacao para o qual se aplica a derivado do algoritmo de rctropropaga^áo apresentado. Para ser- mos específicas, considere uma época con -¡i si indo de >V exemplos (vetares) de treinamento arranja- dos na ordem (x(1}, d{ i)), {x(,V), di'A1)). O priniciro par de exemplo (x(l}. d( I)) da época é aprcscnlado á rede, c a sequen cía de computa^ oes para frente epara irás, descritas anteriormente, é realizada, resultando cm certos ¿i .tistes dos pesos, sináplicos e níveis de bias da rede. Enláo, o segun- do par de exemplo (x(2), d(2}) da época é apreseniadu c a scqúcni ¡a de compulafdes para frente e para Irás ú repetida,, resultando cm nevos ajustes dos pesos sináptieos c ni veis de bias. E<l processo continua até que o último par de exemplo (x(.'V), d(/Ó) ¿poca seja considerado. 1. Modo par Late. No modo par totean aprendizagem por relr&propaga?áo, o ajuste dos pesos é realizado e^ós a apresema^áo de tírdea os cxcmplüs de treinamento que cansíituem uma época. Para uma época particular, definimos a funqáo de custo como o erro medio quadrado das Eqs. (4.2} e (4.3), reproducidos aquí na forma composia: । * «...... -—LS») <4-42> 2jV ffri .rr
PtRCEITEDtNS DE MÍILTTTI AS CAMADAS 199 onde G sinal de erro e(n) ó relativo ao neurónio de saidaj do cxemplo dn treinamento w, o qual c definido pela Eq. (4.I). O erro e(n) ó igual á diferen^a entre ü'(h) e v l ;i), que representara o y-ésimo elemento do vetor resposta desejada d(n) e o valor correspondente da saída da rede, respectivamen- te. Na Eq. (4.42), o soraatório interno cm rela^ao aj c realizado sobre todos os neurónios da camada de saida da rede, enquanto que o somatón o externo cm rela^áo a n é realizado sobre todo o conjunto de treinamento da época considerada. Para um parámetro da taxa de aprendizagem q+ o ajuste aplicado ao peso sinóptico wj|T conectando o neurónio iao neurónio j\ édefinido pela regra delta a» (4.43) Para calcular a derivada parcial dej(jr)/dWJ|r procedemos da mesma forma como antenonmente. De acordo com a Eq. (4.43}, no modo por lote, o ajuste de peso ¿iüH/t) c feito sementé após o conjunto de treinamento inleiro ter sido apresentado á rede. Do ponto de vista operacíonal "fín-line", o modo seqüenctal de treinamento é preferível em relapso ao modo por lote, porque requer menos armazenamento local para cada concxao sináptica. Alénn desso, dado que os parámetros sáo apresentados i rede de uma forma aleatoria, o uso de ajuste de pesos de podrán em padreo toma a busca no espado de pesos de natureza estocástiea. Por sua vez, isto toma menos prnvávcl que o algoritmo de retropropaga^áo fique preso em um mínimo local. Da mesma forma, a natureza estocástica do modo seqñencial toma mais difícil de estabelecer as condicoes teóricas para a Convcrgenúi.:i do algoritmo. Comparativamente, o uso do modo de treinamento por lote fomece uma estimativa precisa do velor de gradiente; a convergencia para um mínimo local é assim garantida sob condbdes simples. A compasillo do modo por ble também o toma mais fácil de ser paralelizado que o modo seqiiencial, Quando os dados de treinamento sao redundantes (i.e., o conjunto de dados contení varías copias exatas dos mesmos padróes), constatamos que. diferentemente do modo por lote, o modo seqüencial é capaz de tirar vantagem de sua redundancia porque os exemplos sáo apresentados um de cada vez. lato ocorre particularmente quando o conjunto de dados c grande c altamente redun- darte. Em resumo, apcsai do falo de que ú modo seqüeneinE da aprendizagem por retropropaga^io tem várias desvantagens, ele é muito popular (panicu[ármente para resolver problemas de classifi- GBfáo de padróes) por duas razoes praticas importantes: • O algoriimo é simples de implementar. * Ele fomece sclufóes efelivas a problemas grandes e di ficéis. Critérios de Parada Em gcral, náo se pode demonstrar que o algoritmo de retropropagefáo convergiu e nio existem criterios bem-definidos para encerrar a sua operado. Em vez disso, liá alguns criterios razoáveis, cada um com o seu mérito práticc particular, que podem ser usados para encerrar o ajuste dos pesos. Para formular um criterio assim, ó lógico se pensar cm termos das propriedades únicas de um mínimo local ou global da superficie de erroí Suponha que o vetor de peso w* represente um
mínimo, seja ele Cocal ou global. Uma condi^áo necessária para que w* scia um mínimo é que O vetor gradiente g(w) (i.c.h a derivada parcial de primeira crdem) da superficie de erro em relajo ao vetor de peso w seja zero em w w*. Ccriseqüenlemente, podemos formular um criterio de conver- gencia scnsívcl para a aprendizagem por retropropagafáo como segué (Kramer e Sangiovanni- Vinccntelli, 1989); Cc*í5rrfffV-xe <J¡iP V algn/itntfj de netmpnyuigogiio ¡enfta ^anv^rgielet quundo e¡ rutrma ettciidiunu dú vetar gradiente üieam;ar um fimiar suficientemente pequenü. O problema deste criterio de convergencia é que, para se obter tentativas bem-sucedidas, os tempos de aprendizagem podem ser longos. Ele requer também o cálculo do vetor gradiente g(w). Urna outra propriedade únüca de um mínimo que podemos utilizar é o fato de que a fun<;áo de custo ou medida de erro í^fw) é estacionaria no ponto w = w*. Conscqücntcmcntc, podemos sugerir um criterio diferente de ccnveigénuia: Considera-.<,e tpw o algoritmo de retropropaga^do teehü convergido tjutmdo o teuta absoluta de vtrriafáo da erro media taladrado por época for suficientemente pettwtta. A Laxa de variado do erro tnédio quadrade é típicamente considerada suficientemente pequeña se ela se encontrar no intervalo de 0,1 a l por cento, por época. Algumas vezes. um valor láo pequeño quanto 0,01 por centcT por época é uti Iizado. Infelizmente, este criterio pode resultar em um encer- ramerrto prematuro do processo de aprendizagem. Há um outro crítério de convergétiuia útil e teóricamente fundamentado. A pos cada iteraqio de aprendizagem, a rede é testada pelo seu desempenho de general i zaqao. D processo de aprendiza- gem é encerrado quando o desempenho de general i¿aq^o for adequado, ou quando ficar aparente que o desempenho de generalizaqáo alingiu o máximo; veja a Sesjáo 4.14 para nuda detalhes. 4.4 RESUMO DO ALGORITMO DE RETRO PRO PAG AQÁO A Fig. 4.1 aprésenla a planta anquí tetur al de um perceptron de múltiplas camadas. O grafo de fluxo de sinal correspondente para a aprendizagem por retropropaga^áo, incorporando ambas as fases, pera frmte c para tria, das compuiaf&es envolvidas no processo de aprendizagem, ¿ apresentado na Fig. 4.7t para o caso de L = 2 e m = m, = = 3. A parte superior do grafo de fluxo de sinal corresponde ao passo para frente. A parte inferior do grafo de fluxo de sinal se refere ao passo para iras, que é referido como o grafo desensibífidade para o cálculo dos gradientes lócate do algoritmo de rctropropagacáo (Narcndra c Parthasarathy, 1990). Anteriormente, mencionamos que a atuatizafáo scqücncial dos pesos c o método preferido para a implcmenta^áo cm tempo de cxccuqao (on-fru?) do algoritmo de relropropaga^o. Para este modo de operarán, o algoritmo circula através da amostra de treinamento dOOlí-j como segue: L fniciaiizacáo. Assumindo que nenhuma infoma?3o prévia csteja disponivcl, retire os pesos sinápticos e limiares de uma distribuido uniforme cuja media é zero e cuja variflneia c escolhida para que o desvio padrito dos campos locáis induzidos dos neurónios se encontré na transipáo entre M partes linear e saturada da fun^áo de ativa^áo sigmóide.
PERCErTRDHS DE MÚLITIUS CAMADAS 201 Ó ÓÓ ó O O F| G U RA 4.7 Resumo gráfico do fluro cc sinal da aprendizaje m por reíropropagafáo. Parla $up$riOr do grafi>: pasM parU líenle. Parte inferior do ^afci: pflBW par^ Irás 2. jipresenta^ao dos Exemplos de Treinamenla. Aprésenle uma época de exemplo® de treina- mtntó á rede. Para cada exemplo do conjunto, ordenado de alguma forma, realizo a scqüñncia de computantes para frente e para tras descritas nos pontos 3 e 4, respectivamente. 3. Computff^ao para Frente (Propaga^ao). Suponha que um exemplo de treinamento da época seja representado por com o vetor de entrada i(ji) aplicado a camada de entrada de nós sensorial e o vetor resposta desejada d(n) apresentado á camada de saida de nós computacionais. Calcule os campos focáis induzidos c os sinais funcionáis da rede prosseguindo para líente através da rede, camada por camada, O campo local iitduzido para o neurónio j na camada t é <(") - ¿wK’(»br,'W (4A4) 1=41 onde é o sinal (fun^áo) de saida do neurónio j na camada anterior 1 - lh na iterado «, e é o peso sináptico do neurónio J da camada /, que é alimentado pelo neurónio i da camada I - 1. Para r = 0T temosyU "(n) = +1 e = /?' ''(**) é o bias aplicado ao neurónio j na camada /. Assumindo-se o uso de uma fundió sigmóide, o sinal de saida do neurónio j na. camada i é y^O/v/jr)) Se o neurónio j eslá na prímeira camada oculta (i c.t / = I )T fapa ^0,(rt) = jt/w)
onde jr(fl) c o j-csimo elemento Jd vetor de entrada i(íí). Se o neurenio./ está na camada de saida (Le., / = £, onde ¿ é denominado a pnifundidade da rede), fa(?a Calcule o sinal de erro -o(i0 (4.45) onde </(*)) é oj-ésimo elemento do vetnr resposta desejada d(n). 4. Computacao para Tras (Reimpropaga^ao). Calculo os 5s (i.e., gradientes locáis) da rede, definidos por «“(»)= I para o neurónioj da camada de saida L (4.46) para o neurónio j na camada oculta f onde o apóstrofo em tp ’(•) representa a diferenciado em relajo ao argumento. Ajusfe os pesos sinápticos da rede na camada i de acorde com a regra delta generalizada: + O = u’J’(n) + 'fw - 11] + «).r/ :'(«) (4.47) onde T]co parámetro da laxa de aprendizagem eaí a constante de momento. 5. /feracíip Itere as computares para frente e para tras dos pontos 3 e 4. apresentó ndo novas épocu de exemplos de treinamento para a rede, ate que seja satisfeito o cri térro de parada. A;ufas: a ordem da ¿presentado dos exemplos de treinamento deve ser aleatória, de ¿poca para época. Os parámetros de momento e da laxa de aprendizagem típicamente sáo ajustados (e normal- mente reduzidos) quando o número de iteracóes de treinamento aumenta. A justificativa para estes pontos sera «presentada mais tarde. 4.5 O PROBLEMA DO XOR No perceptron elementar (de camada única), náo há neurónios ocultos. Consequcntemcntc, ele nao pode classifí car padróes de entrada que sejam nao Imparmente separa veis. Entretanto, padróes nío lincarmcntc separa veis ocomcm frcqüenlcmcntc. Esta situacáo surge, por exemplo, no problema do OU Exclusivo iXOfi. Exclusive OR), que pode ser visto como um caso especial de um problema mais gcraL que c o de classilicar pontos no hípercubo unitario. Cada ponto no hipcrcubo pertence ou á classe 0 ou á classe 1. Entretanto, no caso especial do problema XOR, ntxessi tamos considerar apenas osquatm vértices da tp¡atirmfo ¡tfiU&foque correspondem aos padróes de entrada (0,0), (0,1 \ (I, l) c (1,0). O primeirc e o tercciro padróes de entrada pertencem á classe 0, como mostrado por o ©o-o e I ® I = 0
onde ® representa o operador da fonoSo bodeana OU Exclusivo Os padroes de entrada (0,0) e (1,1) csláo cm vértices opostes do quadrado unitario; apesar disso, produzcm a mesma saída 0. Por outro lado, os púdróes de entrada (0J) e (1,0) esláo também em vértices apostes do quadrado, mas pertenecí!] á elasse 1 , como mostrado por Ü © l - ] e 1 ©0=1 Constatamos. primeiro, que o Uso de um Único neurónio com duas entradas resulta cm uma linha reta como uma fronteira de decisáo no espado de entrada. Rara todos os pomos de um lado desta linha, o neurónio coloca I na saída; para lodos Os pontos do outro lado da ii nhaT coloca U na saída. A pos¡0oe a orientado da linha no espado de entrada s3o determinadas pelos pesos sinápticos do neurónio conectados aos nós de entrada c pelo tías aplicado ao neurónio. Com os padrees de entrada (0,0) c (1,1) localizados cm vértices opo$tO$ do quadrado unilário, c igualmente para os outros dois padróes de entrada (0,1) e (1,0), está claro que náo podemos construir uma Linha neta como uma frenu-ira de decisao de forma que (0,0) e (I. I) estejam em uma regiao de devi sao e (0,1) c (L ,0) estejam na outra regiáo de dccisáo. Em nutras palabras, um perceptron elementar nao pode resolver o problema do XOR. Podemos resolvere problema do XOR utili/ando uma única camada oculta com dmsneurónios., como na Fig. 4.8a (Touretzky e Fomerleau, I9S9)l O grato de fluxo de sinat da rede está mostrado na Fig. 4.8b Sao (citas aquí as segeintes supositóes: Cnmiuh Camada Camada de wSra.líi rttutiá de saída (b) FIGURA 4.B (a) Qrafo arquilctural da rodo para a r&solu^üú do proble- ma do JtQR. (D) Grato da HuxO de sinal da rede
* Cada neurónio é representado per um modelo de McCulloch-Pitts, que usa uma fiingfo de limiar para a sua fun^áo de atm a^o, * Os bits D c 1 sao representados pelos ni veis 0 e +1, respectivamente. O neurónio dectina, rotulado como 1 na camada oculta, ¿caracterizado como: u?n = «íp = +1 4-2 1 y A inclina^ao da fronteira de dcci sao construida por este neurónio oculto c igual a -1 e pos! Clonada como na Fig. 4.9a. O neurónio de baixo, rotulado como 2 na camada oculta, é caracterizado como: = ídE = +] (•I FIGURA 4_& ja} Fronltira da dacisáo cüri&tKuida palo n&uFónin kuHp i da rtda da Fig. 4.8. (b) Frangirá de deo- Sáú CürtSlrukla pele neun&nfcQ oculto £ da rada- (e) Fr^nielras de d&asio continidu pala reda cúmplala le)
A orientacao e a post^ao da fronteira de decisáa construida por este segundo neurónio oculto sáo como mostrados na Fig. 4.9b. D neurónio de salda, rotulado como 3 na Fig. 4.Xa, é caracterizado como: ?t'j| = -2 wn = +; ^4 A fuñado do neurónio de saída c construir uma combinacáo linear das fronieiras de decisáo forma- das pelos dais neurónios ocultas, O resultado desta computado está mostrado na Hit 4,9c, O neurónio oculto inferior tem uma conexáo excitatória (positiva) para o neurónio de saida, enquanto que o neurónio oculto superior tem uma conexáo inibitória (negativa) mais forte para o neurónio de saída. Quando os dois neurónios ocultos cslao desligados, que ocorrc quando o padreo de entrada c (0,0), o neurónio de saída permanece desligado, Quando ambos os neurónios ocultos estflo ligados, que ocorre quando o padreo de entrada é (1,1), o neurónio de salda é desligado notamente porque o efeito iuibitório do pese negativo maior conectado ao neurónio oculto superior sobrepuja o efeito excitatório do peso positivo conectado ao neurónio ocullo inferior, Quando a neurónio acuito supe- rior está desligado e o neurónio oculta inferior está ligado, que acorre quando o padráo de entrada é (0,1) ou (1,0), o neurónio de saída ¿ligado devido ao afeito excitatório do peso positivo conectado ao neurónio oculto inferior, Desta forma, a rede da Fig. 4.Sa rcsolve de (ato o problema do XÜR. 4.6 HEURÍSTICAS PARA MELHORAR O DESEMPENHO DO ALGORITMO DE RETROPROPAGAQÁO Freqüentemente, é dito que o projeto de uma rede neural utilizando o algoritmo de retroprapaga^o c mais uma arle do que uma ciencia, significando que mullos dos numerosos fatores envolvidos no projeto sao o resultado da experiencia particular de cada um. H<i alguma verdade nesta afirmado. Entretanto^ exislem métodos que melharam significativamente o desempenho do algoritmo de retropropagacao+ como descrito aquí. 1. Atuafisaf ao seqüenciai comparada á atualiza^aopor lote. Como mencionado anteriormente, □ modo seqüencial da aprendizagem por reltopropaga^áo (envolvendo atualriza^áo de padrio em padrau) é computacionalmente mais rápido que o modo por lote. Isto é verdadeiro especialmente quando o conjunto de dados de treinamento for grande e altamente redundante. (Dados altamente redundantes causam problemas computacionais para a estimativa da jacobiana requerida para a atualizflf ío por lolej. 2, Mítximiiafüo da conteúdo de informaban. Como regra geral, todo exemplo de treinamento apresentado ao algoritmo de rctropropagacáo deve ser cscolhido de forma que o seu contcúdo de informaqáo seja o maior pcssfvel para a tarefa considerada (LeCun, 1993). Dois modos de alcanzar este objetivo síar • O uso de um exemplo que resulte no maior erro de Ireinamenlo. • O uso de um cxcmplc que scja radicalmente diferente de todos os outros usados anteriormen- te. Estas duas heurísticas sao motivadas por um desejo de ampliar a busca no espado de pesos.
Ñas tarefas de classiiicaqa.0 de padrees usando a aprendizagem par rctropropagacáo scqücncia], urna técnica simples bastante ui ilizada c tomar aleatoria (i.cM embaralhar) a ordem cm que os cxcm- plos sao apresentados ao perccptron de múltiplas camadas de urna época para a seguinte. Idealmente, a aleatoriedade garante que os exemplos sucessivos apresentados á rede em uma época raramente pcrteiujam á mesma elasse. Para uma técnica mais retinada, podemos usar um esquema deénfaie, que envolvr a apresen- taijáo á rede do um número maiorde padrees d [ficéis do que facéis (LcCun, 1993). Podemos iden- tificar se um padráo particular é fácil ou difícil examinando-se o erro que ele produz, comparado com as itera^ñes anteriores do algoritmo. Entretanto, há dot'i problemas cm se usar um esquema de enfase, que devem ser examinados cuidadosamente: * A distribuhjao dos cxcmplos dentro de uiTiá época apresentada á rede c distorcida. • A presenta de itm exemplo estranho ou mal-rotulada pede (er uma conseqüéneia catastrófica no desempenho do algoritmo: aprender este exemplos eatranhos compromete a hábilidade de generalizado da rede sobre regí oes mais prováveis do espado de entrada. 3. Fuñido de ativagao. Um perceptron de múltiplas camadas I reí nado com o algoritmo de retropropagarán pode, em geral, aprender mais rápido (em termos do número de ileraíóes de treina- mento ncccssárias) quando a funcáo de alnado sigmóide incorporada no modelo do neurónio da rede for antissiinétrica do que quando ela for náo-slmétrica; veja a Sedo 4.11 para detalhcs. Dézc- mos que uma fun^ao de ativa^áo é auti-aimétiica (i ?, fun^ao impar de seu argumento) se <p( -4?) “ ^<P<t') como representado na Fig. 4.10a. Esta cundido nao é satisfcila pela fun^áo logística padrao, repre- sentada na Fig. 4.10b. Uin exemplo popular de uma fursqJo de ativaéioanti-simétricac uma náu-lincaridadc siigmóide na forma de urna tangente hiperbólica^ definida por tpfu) = a tanh(/?0 onde a e ft sao constantes. Valores adequadas para as constantes « e b silo (LeCun, 1989, 1993) a-- 1,7159 e A tangente hiperbólica as&itn definida tcm as seguíntes propiedades úteis: • cp(l)- I eq<-[)- -l Na origein, a inclinado (i .e.t o ganho efetive) da fun^áo de ativa^áo fíca próxima da unidade, Como mostrado por ip(0) = ab = 1,7159x2/3 = 1,1424
FIGURA 4.10 (&) FunQSQ de atrvaijáa anti^imétridÉ. (b) Fun^áD de aliváCáú náO^Simátrica • A derivada segunda de (píl1) atinge seu valor máximo em r 1. 4. Valones-alvo. É importante que os valorcs-al vo (resposta drsejada) scj am cscolhi dos dentro do intervalo da fúnfáode ativa^ao sigmoide. Mais específicamente^ a respastadesejadad para o neurónio j na camada de saida do perceptron de múltiplas camadas deve ser destocada por uma quanlidadc E afastada do valor limite da fundan de ativa^áo sígmóide, dependende se o valor limite c positivo ou negativo. Cuso centrino, oaigorilma de relropropaga^o (ende a levar os parámetros livre da rede
para o infinito c dcssa forma reduzir a ve loe idade do processo de treinamento, levando os neurónios ocultos á saturado. Para sermos específicos, considere a fun^áo de ativa(aü anti simétrica da Fig. 4.10a. Para o valor limite fazemos J,= a f e para o valor limite - a, fazemos J - CJ * € onde e é urna constante positiva apropriada. Para a escolha de a w 1,7159 referida anteriormente^ podemos fazer t = 0,7159; neste caso, o valor-alvo (resposta desejada) pode ser convenientemen- te cscolhido como ± 1, como indicado na Fig. 4.10a. 5* Normalizar as entradas. Cada variável de entrada deve ser pré-processadu de modo que o seu valor medio, calculado sobre todo o conjunto de treinamento ou seja próximo de zero. ou seja pequeño comparado com o desvio padrao (LeCun, 1993). Para avahar o significado pratico desta regra, considere o caso extremo, ende as vari ¿veis de entrada sáo positivas de modo consistente. Ncsta situado, os pesos sinápticos de um neurónio na pruneira camada oculta podem apenas cres- cerjuntos ou decresccr juntos. Conscqücntcmcntc, se o vetor peso daquele neurónio deve mudar de direcáo. ele só pode lázer isso ziguezagueando seu caminho através da supcriicic de creo, o que c típicamente lento e deve ser evitado. Para acelerar o processo de aprendizagem por relropropaga^áo, a normal izaqáo das entradas deve incluir lambón! duas medidas (LeCun, 1993): * As variaseis de entrada cuntidas no conjunto de treinamento devem ser ndn-cfírrelacHifíadax' isto pede ser feito utilizando-so anáhse de componentes principáis, como dctalhado no Capi- tulo R. As variáveis de entrada dcscorrelactonadas devem ser escaladas para que suas covariándíis tejam aproximadamente iguais, assegurando-se com isso que os diferentes pesos sinápticos da rede aprendam aproximadamente com a mesma velocidade. A Figura 4.11 ilustra os resultados de tres passos de normalizadlo: remocho da media, dcscorrelacac c cqualizarán da covariancia, aplicados ncsta ordem. 6. inicializa^So. Uma boa escolta para os valores iniciáis dos pesos sinápticos c limiares da rede pode ser de tremenda ajuda para um prpjeta de rede ser bem-üucedido. A pergunta Chave é: O que ú uma boa escolha? Quando sáo atribuidos valores iniciáis grandes aos pesos sinápticos, é muito provável que os neurónios da rede sejam levados á saturaqáo. Se isto acontecer, os gradientes locáis no algoritmo de retrepropagacáo assumem valores pequeños, o que por sua vez ocasionará uma diminuido da vclo- cidadcdo processo de aprendizagem. Entretanto, se forera atribuidos valores iniciáis pequeños aos pesos sinápticos, o algoritmo de retropropagatfo pode operar em uma área muito plana em tomo da origem da superficie de erro; isto é particularmente verdade no caso de Eimfóes de ativa^áo antissimétricas, como a fiin^áo tangente hiperbólica. Infelizmente, a origem é um pontu de sela, que corresponde a um ponto estacionario onde a curvatura da superficie de erro através da sela é negativa c a curvatura ao longo da sela é positiva. Por estas razóes, o uso tanto de valores grandes como de valores pequeños para a m cializafáo dos pesos sinápticos dev? ser evitado. A cscolha adequada para a in¡cíaíikh?ao se encontra em albura lugar entre estes dois casos extremos.
Rjcnwifio 1$ iricilu C<iitjn«iio otí^iii jL cié pontos de dadas Equal ¡zafio ik covHriárwia FIGU R A 4J i ilustrando da upecagáa de ramojo da média. descofretacáo e equalizar-Éc da «variártela para, um espado de entrada bidimensiocial Para serraos específicos, considere um perceptron de múltiplas camadas que usa a fundió tangente hiperbólica para suas fun^ocs de ativacao. Considere o bias aplicado a cada neurónio da rede fixo em zero. Podemos entilo expnessar o campo local mduzido do neurónio/ como H v, = MI Assuma que as entradas aplicadas a cada neurónio da rede tenham media zero e variáncia unitaria, como mostrado por K “ ¿"[y,] “ 0 para lodo i e Assuma aínda que as entradas sáo náo-correlacionadast como mostrado por
, I p;iru k — i 0 parajtrí e que os pesos sinápticos sao retirados de um conjunto uniformemente distribuido de números com media zero - á|u:a] = 0 para lodos os parcsO',/) e variáncia a; = fjfic.: - gh.):] = í[ wj ] para todos os pares (¿j) Correspondeniemcntc, podemos expressara media e a variáncia do campo local tnduzido como M. = M Uj] = E £«>.,y, = £' I= 0 =>i -i i- = fffC (4.48} onde é o número de concxóes sinópticas de um neurónio. Com base neste resultado, podemos agora descrecer uma boa estrategia para inicial izar os pesos sinápticos de modo que o desvio padrao do campo local induzido de um neurónio caía na área de transifao entre as partes lineare saturada da sua lun^áo de aliva^Ao sigmúide. Para o caso de uma futlfcío tangente hiperbólica com seus parámetros a e freomo previamente especificado, por ejem- plo, este objetivo ó salisfeito fazendo on 1 na Eq. (4.48X ueste caso, oblemos (LeCun, 1993) O . = nflfl (4,49) Assim, é desejável que a distribuido uniforme, da qual os pesos sinápticos silo selecionados, tenha uma media zero e uma variáncia igual ao reciproco do número de concxocs sinópticas de um neurónio. 7. Aprendieron por indicios. A aprenth zagem a pan ir de um conjunto de ejemplos de treí ñá- menlo lida com uma funfáo de mapeamento de entrada^áida dcsconhccida y(-). Na verdade, o processo de aprendizagem explora a informado contida nos exemplos sobre a íún^áu J[-) para inferir uma implcmcnra^áo aproximada para da. O processo de aprendizagem por cxcmplos pode ser generalizado para incúr/r aprendizagem por indicias-, o que é obtido permitindo'sc que a infor-
ma^au prévia que tenhamos sobre a funesto^-) seja incluida no processo de aprendizagem (Abu- Mcstafa, 1995), Tal informaban pode incluir propiedades invariantes, simetrias, ou qualquer outro conhecimento sobre a lun^üo /(-) que pode ser usado para acelerar a busca por sua reab zapito apro- ximada e, mais importante que isto, melharar a qualidade da estimativa fina!. O uso da Eq, (4.49) é um exemplo de como isto pode ser obtido. X. Tincar de aprendizagem. Todos os neurónios do perceptron de múltiplas camadas devem aprender com a mesma taxa. As últimas camadas normalmente tém gradientes locáis maiores do que as camadas anteriores da rede. Assim, devose atribuir ao parámetro da taxa de aprendizagem T| vala- res menores ñas últimas camadas do que nas camadas anteriores. Neurónios com muiías entradas devem ter um parámetro da laxa de aprendizagem menor do que neurónios com menos entradas, para manter um lempo de aprendizagem similar a todos os neurónios da rede. Em LeCun (1993), é sugerido que, para um determinado neurónio, a taxa de aprendizagem deve ser inversamente pro- porcional ¿i raiz quadrada dasconexóes sinópticas fritas com aquele neurónio. Discutimos as laxas de aprendíragem mais extensamente na Se?ao 4.17. 4.7 REP RESENTAQAO DA SAÍDA E REG RA DE DEC ISAO Em teoría, para um prvbiema de ciassifica^ao de Af classes, no qual a unido das \f classes distintas forma o espado de entrada inteiro, necessitamos de um total de M saldas para representar todas as dccisocs de classificacfo possíveis, como representado na Fig. 4.12. Ncsla figura, o vetor x_ repre- senta oJ-éslmopn>wWíW (i.e,t amostra única) de um vetor aleatorio x de dimensáo /n, a ser dosifi- cado por um perceptron de múltiplas camadas. A fr-csima das \f classes possiveis ás quais o vetor x pode pertencer é representada por 'í.. Suponha que seja a A-ésima saida da rede produzida em resposta ao protótipo i., como mostrado por *=1.2..M (4.50) FIGURA 4,12 Diagrama cm hoces de um dassir¡cador de nadrñfis PetceptrcKi de b múltiplas cantadas onde a fundan F*(-) define o mapeamento da entrada para a A-ésima saida, aprendido pola rede. Por conveniencia de apresentacac, suponha que (4.51) onde F() ¿ uma fuñado de valor vetorial. Uma quesláo básica que desciamos abordar nesta sc^ao c: Após um perceptmn de múftiptas camadas ser minado, quai deve ser a regra de decisan ¿tima para ctassificar as M saldas da rede? Claramente, qualquer regra de decisáo razoávcl de saida deve ser bascada no conhecimento da fim^ao de valor vetorial;
Fí ft“ 5 x -* y G R-w (4.52) Fm geral, rudo o que c ceno sobre a Fundo de valor vetorial F() é que ela é uma fundo continua que minimiza o JitnciGnal de risco empírica: (4.53) onde d c o padreo de saida desojado (alvo) para □ prototipo i| || ¿ a norma euclidiana do vetor ai compreendido c .Ve o número total de exemplos apresentados ú rede no treinamento. A oaÉncia do Criterio da Eq. (4.53) é a mesma que a da fundo de custo da Eq. (4.3). A futifáü de valor velaría] HJ é fonemenle dependente da esc o] ha dos exemplos (Jyd ) usados para Lrcinar a rede, de forma que valores diferentes de (x,d i levare de Tato a di ferentes funvocs de valor vetorial F( ). Note que a terminología (x,,d;) usada aquí é a mesma daquela de (x0),d(7)) usada anteriormente. Suponha agora que a rede é treinada com val o res-alvo binarios (que eventual mente corresponden) aos limites superior e inferior das saidas da rede, quando a Fun^ao logística é usada), escritos como; l quandooprotótico i pórtente ¿i classe 7 ( íl quandoo prolclico x nao pcrtcnce á classe (4-54) Com base nesta nota^áo, a classe _ ¿ representada por um velar alvo de dimensio M t— A-ésinnc elemento 1 tentador se supor que um classi tkador por perceptron de múltiplas camadas (reinado com o algoritmo de retropropagarán, enm um conjunto finito de exemplos independentemente e idénticamente distribuidos (i id.), pode levara urna aproximado assintática das probabilidades de classe ¿i fifis teriori subyacentes. Esta propriedade pode ser justificada pelas seguí otes razóos (Whi te, 1989a; Richard c Lippmann. 1991): • A leí das grandes números é invocada para mostrar que, quando o tamanho do conjunto de treinamento A' se aproxima do infinito, o vetor de peso w que minimiza o funcional de custo R da Eq. (4.53) se aproxima do vetor de peso ólimo w* que minimiza o valor esperado da quan- 1 idade aleatoria y||d - F(w,x)|| . onde d é c vetor resposta dese ada o F(w,x) é a aproximadlo realizada por um perceptron de múltiplas camadas com vetor de peso w e vetor x como entra- da (Wliite, ] 989a). A fun^áo F(w,x), que aprésenla dependencia explícita do velar de peso w, c a mesma que a Fundo F(x) usada anteriormente. • ü vetor de peso ólimo w* Icm a propriedade que o veior correspondente das saidas rcais da rede, F(w*, x). é uma aproximado por minimizado de erro medio quadrado do valor espera-
Hidden page
das relaces dos pesos sinápticos conectados a eles (Luí, 1990}. Tai análise, entretanto, náo é npli- cável a uma fronteim de decido formada de acordo com a regra de decisáo de saída da Eq. (4.55), Urna abordagcm mais apropriada ¿ considerar os neurónios ocultos como detectores n¿ío~iifieares de características que procuran mapear classes do espado de entrada original DS"^ onde as cla&es podem nao ser lin carmen te separáveis, para o espaqo de aliva^ccs da camada oculta, onde é mais provávcl que sejam lincarmcnte separa veis. 4.8 EXPERIMENTO COMPUTACIONAL Nesca setfo, usamos um experimento computacional para ilustrar o comporta mentó da aprendiza- gem de um perceptron de múltiplas camadas usado como classificador de padrees. O objetivo do experimento é distlngu:i entre duas classes de padrees Ndimensioiials “superáoslas’1. com distri- buidlo gaussiana, rotuladas como I c 2. Suponha que reprcseniem o conjunto de eventos para os quais um vetor aleatorio x pertence aos padróes I e 2, respectivamente. Podemos cntáo uxpressar as funQdes de densidade de probabilidade condicional para as duas dasses como: Classe'í : onde (4.56) Classe'í p, = vetormédia = (ü.l)f a' = variáncia = 1 Aí*FM = ¿»«xp[HzH= 2 2OZ (4.57) onde Hz=|2.O]r ct2: = 4 Assume-se que as duas classcs sejam cqüiprcvávcis; isto éT 1 Pt = Pi = - A Figura 4.13a movtra gráficos tridimensionais das duas distribuicóes gaussianas definidas polas Eqs. (4,56) e (4.57). O vetor de entrada c 1 = [xr jc^K e a dimensional i dade do espado de entrada é m., = 2h A Figura 4.14 mostra diagramas de espalhamcnto individuáis para as classus c e o diagrama de espalhamunto conjunto, representando a superposicao dos gráficos de espalhamcnto de 500 pontos tomados de cada um dos dois proccssos. Este último diagrama mostra claramente que as duas distribuyóos se sobrepóem significativamente, indicando que existe inevitavclmcnte uma probabilidade significaiiva de classificafáo incorreca.
PeKCEFTRDNS DE MÚLTIPLASCAMADAS 215 FIGURA 4.13 (a) Fu€i;&ü de densidads da probabilidad^ y«hí(bj Fundió da deneidada da profiabilidads Jfjilíj Fronte ira de Decisáo Bayesíana O criterio bayesiano para classifica^o ¿tima c discutido no Capitulo 3. Assumindo que para um problema de duas classes (1) as classes e sejam eqñipnováveis, (2) os cusios para classiñea- C$es corretas sejam jeto e(3) os cusios para claási ficantes incometas sejam íguais, constatamos que a fronteira de decisáo ólima é enconirada aplicando-se o leste da razáo de verossimillanca: A(i)f£ I (4.58) onde A(x) e a ruzüu tie vt'rvssirniííian^a, definida por (4.59) onde é o limiar dt> teste., definido por A (4.60) Para o exemplo considerado» temos
FIGURA 4.14 (a} Gráfica de aspalhamonto da classe ib) Gráfico de aspalhamentú da Clásüu 4S. fe) Gráfico do espalhamento combinado do ambas as classas. “ LO J w Conseqü ente trióme. a fronfcira dedecisáo (baycsiana) ¿tima c definida por ?exp ’ °i < 2{j] 2<>: ou de forma equivalente.
-U-M1 --U-d!=4iO8H ua Ui \aí7 (4.61) Usando manipulares diretas, podemos redefinir a frcnteira de decisáo ólima da Eq. (4.61) sim- plesmente como n nd ü II* - X, Jl- I* -gfa * i ci-g?L °i-°T "°J (4.62) (4.63) (4,64) e A F.quacán (4 62) representa um circulo wm centro x e mío r. Suponha que £1, defina a regi&O comprendida dentro dcstc círculo. A regra de classifica^áo bayesiana para o problema considerado pode ser formulada como segue: Clas.iifique o velor de nfaerva^da x como /jev-fencenfe a clase ¥., je □ mzáo de verossimi/hanfa A(>) far maior qw o limiarE, e á classe caso contrario. Para os parámetros particulares deste experimento» temos uma fronte ira de dccisáü circular cujo centro está localizado em e cujo rato é r^ 2J4 Considere que c represente o conjunto de resultados cornetos de clastificapeo e e o conjunto de resultados ineoíretos de classifica^do. A probabilidad^ de erro (classificacác incorre la), Pe, de um clarificador operando de acardo com a regra de decisáo bayesiana é F, - F.W,) t-p/W (4.65) onde é a probabilidade condicional de erro, dado que o velar de entrada do clasificador tenha sido retirado da distribuido de classe r e similarmente para p1 ep£ alo as probabi- lidades a priori das classes c í-.,. respectivamente. Para o nqsso problema, podemos estimar numéricamente as integráis de probabilidade para oblcr “ 0,1056 e Piefy =- 0,2642
Cortiji'.1. - ¡y = 1/2, a probabil idade de classiPtca^o ¡acórrela, consecuentemente, é P 0,1849 r De forma cquivaJcnic. a probabilidad# da carreta é P¡ = ]-Pc = 0¿l5J Determinado Experimental do Perceptron Ótimo de Múltiplas Camadas A Tabel a 4.1 Li sta os parámetros variáveis de um pcrccptron de múltipl as camadas (M LP, m uítifayer perveptmn) que envolve uma única camada de neurónios ocultos e que é Irtinado com o algoritmo de retropropaga^áo operando no modo MqQcDcial. Como ó objetivo último de um classificador de padrees c alcanzar uma taxa aceita ve] de classifLca^áo correta, este criterio é usado para julgar quando os parámetros variáveis do MLP (usado como um clarificador de padrfia) sfo olimos. TABE LA 4j Parámetros Variáveis do Perceptron de Múltiplas Camadas Parámetro SiiTiboln lltHMkl Tipian Número de nftndúiM muJioh C2,«) Paramdru da Lixli de apréridizigéiTL ’l (0. 1) Cerneante de momento a (0, 1) Número Ótimo de Neurónios Ocultos. Rcfletindo as abordagens práticas para o problema da dcEcrmina^ao do número ótimo de neurónios ocultos, hj . o criterio utilizado c o menor número de neurónios ocultos que produz um desempenho “próximo” ao do clarificador bayesiano - nor- malmenle dentro de I por cento. Assim, o estudo experimental cometa com dais neurónios ocul- tos como ponto de partida para os resultados de simulado resumidos na Jabela 4.2. JABELA 4.2 Resultados da £imulai¿ao para Dais Neurónios Ocultas* Numero du Radüda Tamanho do (. .ir. iiiüú de TreinamerLlc XiirTieru dti Épocas Erro Métlki Quadradu Prubab: 1 idade de CIU*ÍfÍC3Q3n Carreta, P 50ft 320 O,2??5 80.36% 2 2000 so 0.2341 80,33% 3 JWJOü 20 0.2244 80,47% "Pajuineini d.i |K4 de jprL’iLdi/jgLTTl T[ — il, I Lr nkum^nh? / - IJ. Como o propósito do primeiro conjunto de simulafdes é meramente verificar a suficiencia cm náo dos di - is neurónios ocultos, o parámetro da laxa de aprendizagem Y} c a constante de momento a sao filados arbitrariamente cm um valor nominal. Para cada rodada de simulado, ucn conjunto de treinamento de exemplos, geradns aleatoriamente das distribuifoca gaussianas para as classes e corti igual probabilidade, é repetidamente circulado através da rede, com cada cielo de treina-
mentó representando uma época. O número de épocas ó cscolhido de modo que o número total de exemplosde treinamento utilizados em cada rodada constante. Farendo assim, qualquer efeito po- tencial surgido pelas variaí^es dos lamentas do conjunto de treinamento sao compensados pela média. Na Tahcla 4.2 e ñas tabel&s sutaeqüentes, o erro medio quadrada é calculado precisamente como o funcional de cric d clin ido na Eq. (4.5 3). Enfatizamos que 0 erro medio quadrado é incluido nestas (abelas sámente para efeito de registro, uma vez que um emt wMo quadrado pequeño nao implica necesariamente boa generaHracao (1,0-, tara desempenho com dados nlo-vistos anterior- mente). Após a convergencia de uma rede treinada com um número total de N padrees, a probabilidade de classi fiea$3o carreta pode ser calculada, teóricamente, como segue: M WJ (466) onde pt pt 1 /2t e Pk.VN,)- Ádl'Q* J El.í.Vl J O I.M (4.67) (4.68) e O,(N) é a regido no espado de decisáo sobre a qual o perceptron de múltiplas camadas ((reinado com N padrees) classifica o vetor x (representando uma realizado do vetor aleatorio X) como pertencente á classe Esta regido é usualmenle encontrada expelí mental mente pela estimativa da fan^o de mapeamento aprendida pela rede e entáo aplicando-se a regra de dccisáo da saída da Eq. (4.55). Infelizmente, a estimativa numérica de /^c^Vfft]) c ¿ problemática porque nao podem ser encontradas fácilmente expressfies fechadas descreyendo a frenteira Í2(A). Conseqüentemente, recorremos ao uso de uma ahordagem experimental que envolve testar o perceptron de múltiplas camadas cm rcla^áo a ouiio conjunto independíenle de cxcmplos que sáo novamente retirados aleatoriamente das distribuyes para as classes f6( e^, com igual probabilida- de. Suporta que A seja uma variável aleatoria que conte o numere de padrees retirados dos N padrees de teste que sao classificados corretamcntc. Eniao, a razao A é uma variável aleatoria que fomece a estimativa scin bilis por máxima vcrossimilhan^a do desem- penho de classiñcafáo real ? da rede. Assumindo que p seja constante sobre os N pares de entrada* saída, podemos apU i car o /uwjís de C^rnf>ffiÜí\myc, 1991) para o estimador /\.de/>+ obtendo ” J3! e) < cxp(-2ti?V) = o A aplicado do limite de ClicmoíTproduz N ™ 26.500 para e = 0,01 c 3 = 0,01 (i.c,t 99 por ccnto de certeza que a estimativa/» techa a tolerancia dada). Tomamos, entáo, utm conjunto de teste de tama- nho 32.000. A última col una da Tabela 4.2 aprésenla a probabilidade de classifica0p correta estimada para este tamanho de conjunto de leste, com cada resultado sendo a médía de 10 tentativas independentes do experimento. O desempenho de classiñca^áo apresentado na Tabch 4.2 para um perccptron de múltiplas camadas usando deis neurónios Ocultes já í razoavetmente próximo ao desempenho bayesiano =
H] .51 por cent O- Com ¡sso, podemos concluir que para o problema de elassificaffio de padróes descrito aquí □ uso de dois neurónios ocultos é adequado, Para ení alizar esta concluí sáo, na Tabela 4.3 aprescnlamos os resultados de simula^ocs repelidas para o caso de qualro neurónios ocultos, com todos os cultos parámetros mantidoa constantes. Apesar de o erro medio quadrado na Tabela 43 para quatro neurónios ocultos ser um pouco mais baixo que aquele da Tabela 4.2 para deis neurónios ocullos, a taxa inedia de classificagoes córrelas nao inostra mclhoria; de fato, ela c um pouco pior. Para o resto do experi mentó compuiacional descrito aquí, o número de neurónios ocul- tos ó mentido cm dois. * L TASELA 4,3 Resultados da Simulado para o Perceptron de Múltiplas Camadas Usando Qualro Neurónios Ocultos' Número da Rodada Tamanho do Conjunto de Treinamento Número de F.pocss Etto Medio Quadrado Probabilidad? de Clarificado Correta, ] 500 320 0.2 IW 80.íí0% 1 2ü(J:i RO 0,2 LM (Q.R|% 1 HOÚfl 2Ú 0,2142 80,19% PiTiimclnj da. tul de iiprendizii^m T] - IL | e cwstícitiJ Je momento <i 0. Aprendizagem Olí ni a c Consta n tes de Mom en hi. Para os valores LLóti mos** do parámetro da laxa de aprendizagem p e constante de momento ft, pedemos usar uma das tres defini^es: L Os n e ft. que em media produzem convergencia para um mínimo local na superficie de erro da rede com o menor número de épocas. 2, Os p e oc que, para o pior caso ou em media, produzem convergencia para o mínimo global na superficie de erro com o menor número de épocas. 3. Os T] c a que cm media produzem convergencia para a configurado de rede que lem a mcitior generalizafáo sobre todo o espado de entrada, com o menor número de épocas. Os termos “média“ c "piorcaso" usados aquí se referem á distribuiqao dos pares de enlrada-saida de treinamento, A definirán 3 c ideal na pratica; entretanto, c difícil aplicada, pois minimizar o erro medio quadrado é normalmente □ criterio matemático para a otimi/a^áo durante O treinamento da rede, e, como afirmado anteriormente, um baixo erro medio quadrado sobre um con]unió de treina- mento nao implica necesariamente boa generalizaba. Do ponto de vista de pesquisa, a definífáo 2 ú mais mteressanie que a definían I, Em l.uo (1991), por exemplc, sáo apresentados resultados rigorosos para a adapia^áo otima do parámetro da taxa de aprendizagem r[, de modo que o menor número de épocas seja necesario para o perceptron de múltiplas camadas aproximar a matriz de pesos sinápticCK globalmcnle ólima com uma prceisáo desejada, embora para o caso especial de neurónios lineares. Em geral, entretanto, procedimentcs heurísticos e experimentáis dominare a sele^áo ói: ma de tj e íi quando se usa a definido I. Para o experimento descrito aquí, consideramos, perianto, a otimizafáo no sentido da definifáo I. Util izando um perceptron de múltiplas camadas com dois neurónios ocultos, sao simuladas corebinaqocs do parámetro da taxa de aprendizagem r| e {0,01. OJ, 0,5, 0,9J e da constante de momento a g {0,0, 0.1.0,5. 0,9* para observar seu efeito sobre a convergencia da rede. Cada oombina^áo'é trenada com o mesmo conjunto de pesos alealórios iniciáis e o mes ni o conjunto de 500 exemplos, de modo que o$ resultado* do experimento possare ser comparados diretamenfe. O Copyrighted m aterí
proccsso de aprendizagem foi continuado para 700 épocas, após o que ele foi encerrado; esta exten- s3c de treinamento foi considerada adequada para o algoritmo de roiropropas^i^áü alcanzar um mínimo local na superficie de erro. As curvas de aprendizagem médias de ensemble assim calcula- das eslío trepadas ñas Fígs. 4,15a - 4.1 5d, que estío agrupadas por t|. As curvas de aprendizagem experimentáis mostradas aquí sugerem as seguinies tendencias: FIGURA 4.15 Cunes tfs aprendizajem medias de ensarnóte para momentos n va’ iáv&¡s e os seguíntes wateres efe parAmelroe da laxa de aprendizagem: (ai n - 0,01, (b) q = 0,1, (c) n = 05 e (d) n = 0,9
(<} Ejbo quádcadn FlGUHA 4.1 & * Enquanio que, cm geral, um pequeño parámetro da taxa de aprendizagem T] resulta cm uma convergencia ¡neis lenta, ele pode loeali¡car mínimos Locáis “mais profundos" na superficie de erro do que um rj grande. • Para r, 0, o uso de a —> 1 produz um aumento da veiocidadc de convergencia. Por oulro lado. para q —> I, o uso de a —> 0 é ncccssário para asegurar a eslabilidade da aprendizagem. • O uso das constantes iq = {0,5,0,9 | cCH 0,9 causa oscilares no erro módio quadrado durante a aprendízagem e um valor mais alio para o erro medio quadrado na convergencia, sendo ambos efciios tndcseiávcis.
Na Fig. 4.16, mostramos gráficos das “melhorcs” curvas de aprendizagem para cada grupo das curvas de aprendizagem trabado na Fig. 4.15, para determinar a melhor curva de aprendizagem ^global”; "melhor" sendo definido no sentido do ponto 1 descrito anteriormente. Da Fig. 4.16. é aparente que o parámetro da laxa de aprendizagem étimo T|i(l é cerca de 0.1 e a constante de momento ótima a . mii écerca de 0,5. Assim, a Tabela 4.4 resume os valores “étimos” dos parámetros da rede usados no restante do experimento. O falo de que o erro medio quadrado final de cada curva na Fig. 4.16 nao varia significativamente no intervalo de T] C ffl sugere uma superficie de erro "bem comportada” (i.e., relativamente suave) para o problema. Erro midió quadrado FIGURA 4.16 Melhtwes torvas da aprandiíagem seleoonades das qualro partes da Fig. 4.15 TASELA 4.4 Conligurafáo do Perceptron de Múltiplas Camadas Otimizado- Parámetro Símbolo Valor Número olimo de ncurñ:jos ocultos m.í.rio 2 Farimelrü ülirnfl da casa de nprendizagcm 0,1 Constante de momento ólima a iRinr 0,5 A% aliacán do Projeto Otinm de Rede. Dado o perceptron de múltiplas camadas “oti ni izado” com os parámetros resumidos na Tabela 4.4, a rede final é avallada para determinar a sua fronteira de decisao, a curva de aprendizagem media de ensamble c a prohabíIidade de clarificadlo córrela. Com conjuntos de treinamento com tamanho finito, a funQáo aprendida pela rede com os parámetros olimos é “estocas!ica” por natureza. Conscqücnlcmcjuc, estas medidas de desemperlbo sao medias de ensemble sobre 20 redes tremadas indcpcndcntcmcntc. Cada conjunto de treinamento consiste de 1000 exemplos. retirados das distribuíqocs para as classes^ e^com igual probabilidade eqüfi sáo apresentados á rede em ordem aleatéria. Como anteriormente, o treinamcnic se estendeu por
7Q0 épocas. Para a determinado experimenta] das probabilidades de classilicacáo córrela, o mes- m conjunto de teste com 32.000 exemplos usado anteriormente é utilizado novamente. A Fig. 4.17a mostra tres das "melhores*' fronteras de deci&fo piara tres redes do ensemble de 20. A Figura 4. i 7h mostra tres das ''piores" frente i ras de dccisáo para tres cunas redes do mesmo ensemble. A fronte ira dcdccisao bayesiana (circular) sombreada está incluida cm ambas as ti guras FIGURA 4,17A 'Irártco das trés ‘malhorM'fronfalrai de declsáo para as sa^uintes precitífes re classiticaf£o: 80,39.60,40 e 90.43% FIGURA 4.17E Gráfico das tr^s ‘piares" IrpnleirflS de cfecisád para a& soguirttee precisara efe cl&ssificajpáo: 77.24. 73.01 a 71,59%
como referencia. Destas figuras observamos que as fronte! ras dedeo sao construidas peto algoritmo de retropropaga?áo sao convexas em relaqao á regiao onde elas classiñtam o vetor de observapño x como pertcnccntc i classe ou i classe %.. As estatificas dccostmblc das medidas de dcscmptnho, prúbáti i I idade decías* ¡.ficaqio CürTCta e erro medio quadrado final+ calculadas sobre a amostra de treinamento, etóo Lisiadas na Tabela 4.5. A probabilidade de classcíicafáo córela para o classificador bayesiano étimo é 81,51 %. TASELA 4.5 Estatística& de Ensamble de Medidas de Desempenho (Tamanho da Amostra = 20} Medida de Desempenho Múdia Desvio Padrio Probabilidade de dassificacáo correta Erro médio quadrado final 79,70% 0,2277 0,44% 0,0118 4.9 DETECQÁO DE CARACTERÍSTICAS Os neuranias ocultos desempenham um papel crucial na operacao de um perceptron de múltiplas carnadas com aprendizagem por retropropaga^do porque agem como detectara c/¿ características. Conforme o processo de aprendizagem avanza, os neurónios ocultos come^am gradualmente a “descobrif' as características salientes que caracterizan] os dados de treinamento. Eles lazem isso realizando uma transformado nao-linear dos dados de entrada para um novo espado chamado de espado oculto* ou espado de características; estas duas terminologías sáo usadas alternadamente em lodo o livro. Neste novo espado, as dasses de interesse em uma tarefa de classifica^ao de pa- dróes, por exemplo, podem ser mais fácilmente separadas entre si do que no espado original de entrada. Esta afirmafao é bem ilustrada pelo problema do XOR considerado na Se^áo 4.5. Colocando a questao cm um contexto matemático, considere um perceptron de múltiplas ca- madas com uma única camada nio-linearcom m! neurónios ocultos, e uma camada i inear detn,~ Af neurónios de salda. A escolha de neurónios lineares na camada de saída é motivada pelo desojo de concentrar a aten^ao sobre o papel dos neurónios ocultos na operaifSo do perceptron de múltiplas camadas. Suponha que os pesos sinápticos da rede sejam ajustados para minimizar o erro médio quadrado entre a saída-aIvo (resposta desejada) c a saída real da rede, produzida cm resposta a um vetor (padrao) de entrada de dimensao m . com a media de Cnscmble calculada sobre um total de N padróes, Suponha quei^fl) represente a saída do neurónio ocultoJ devido á apresentai^o do padróo de entrada n. z(ff) c uma ñir^áo nao-tincar do padrao (vetor) de entrada aplicada a camada de entrada da rede em virtude da funche de ativafdo sigmóide incorporada em cada neurónio oculto. A saída do neurónio k na camada de saída é „ = l2..w (4.®) onde wh1 representa o bias aplicado ao neurónio k. A fun^ao de custo a ser minimizada c Jf M « ™> = W») - Ai"»’ (4.70) Note que assumirnos aqui o uso do modo de operafao por lote. Usando as Eqs. (4.69) e (4.70), é fácil reformular a funf áo de custo na forma matricial compacta:
í - — IId-wzI? 2 A,'II (4.71) onde W é a matriz Af-por-m de pesos sinápticos relativos á camada de salda da rede. A matriz ¿ é u matriz nq-por-.W das; saldas dos neurónios ocultos (subtraidos os seos valores medios), que sSo producidas pelos ,V padrñes individual?, de entrada aplicados á camada de entrada da rede; isto é. Z - {(z, (w)- p. ); y = 1,2,...,™,: h = Lt2.............Ar] onde p, c o valor medio de z(jt), Crmseqüentenneiite, □ matriz Dea matriz .W-por-.V dos padróes- alvo (respostas desejadas) apresentados á camada de entrada da rede; isto é. D = {«(fr)-nJj); í-l,2...,W: fl-l,2...Ar} onde ó o valor medio de A minimizado de fím . definida pela Eq, (4.70) c rcconhccida como um problema linear de mínimos quadrados, cuja soluto é dada por w = b¿* (4.72) onde Z' é a pseudo-inversa da matriz Z. O valor mínimo de ¥n o dado por (veja o Problema 4,7) = ^1r[ññ'ñ7/(7,Zr)-¿D'] (4.73) onde tr[-] representa o operador tra^o. Como os padróes-alvo represen lados pela matriz D sao todos fixos, minimizar a funijao de citóte em relajan aos pesos sinápticos do perceptron de múltiplas camadas ¿equivalente a maximi/ara fiin^aa discriminarte (Webb c I.qwc„ 1990) a = n[ctc;] (4.74) onde as matrizes C. cC, sao definidas como: E> 1 • A matriz C. rn -por-m(é a matriz de (Watiánefo total das saidas dos neurónios oc ul tos devido á apresen ta^áo dos .V padróes de entrada- (4.75) A matriz C ' é a pseudn-inversa da matriz C. • A matriz CA m ^pOr-WFj ¿ definida como: Ct^ZDr DZ' (4-76) Nole que a fucilo d-acriminante01 definida na Eq., (4.74) c determinada totalmente pelos neurónios ocuIfos do perceptron de múltiplas camadas. Também náu há rcstrifao no número de camadas ocul- tas que couNlnuem a transformacáo nfo-linear responsávcl por gerar a turneo discriminante S&. Em □m pcrccptron de múltiplas camadas com mis de uma camada oculta, a matriz Z se refere ao conjunto inteiro de padróes no espado definido pela camada final de neurónios ocultos.
Para urna interpretafao da matriz C(, considere a escolha específica de um esquema de codificando um-de^M (Webb e Lowt, 1990), Isto é, □ valor-alvo (resposta desejada) em um padrea particular ¿ a unidadc se o padreo escolhido pertence áquela classe, e zero caso contrario, como mostrado em (veja página 210) ü 0 ¿(n) = <- ¿-ésimo elementa, ¿(a) e 0 Assim, se houver Ai classes, A: = 1,2,,..t Af com A; padróes na classe e J- = I podemos cnlao expandirá matriz C, pare este esquema particular de codificaba na forma c, = - HJK, -Hj (4.77) >1 onde o vetor [1 A, m -por-l, é o valor médio do vetor das saidas dos neurónios ocultos calculado sobretodos es A’. padróes na classe<É1, e o vetorg, é o valor médio do vetor das saldas dos neurónios ocultas sobre todas as Arapresenti^oes de entrada. De acorde com a Eq. (4.77), podemos interpretar C , como a matriz de covariancia ponder ada entre cfasses ñas saidas da camada oculta. Assim, para um esquema de codificaba 1-de-jtf, a perceptron de múltiplas camadas maximiza uma funbo1 discriminante que é o tra$o do produto de duas matrizea: a matriz de covariancia pon- derada entre classes e a pseuda-ínversa da matriz de covariancia total. Este resultado é interessante parque ilustra como um perceptron de múltiplas camadas com aprendizagem por rctropropagabo incorpora prioriiariamente as propor^óes das amostras dentro das classes individuáis. A Rela^áo com o Discriminante Linear de Fisher A fim^ao discriminante definida na Eq. (4.74) c única para os perceptrons de múltiplas camadas. Ela tem uma grande scmclhan^a com o discriminante linear de fisher, que dcscrcvc uma transfor- mado linear de um problema mullidimenslonal em um problema unidimensional. Considere uma variivclv formada como urna combinaba linear dos elementos de um vCtcr de entrada x; isto c, cía é definida como o produto interno de x e um vetor de parámetros ajustáveis^ w (que inclui um bias como o sen primeiro elemento), como mostrado por V = wrx O vetor x c retirado de uma de duas populares, e t/. , que diferem entre si pelos seus vetores médios g, e respectivamente. O critérío de Fisher para discriminar entre estas duas classes é definido por
onde Cea matriz de covariancia entreciaiica (^intcrclasscs') definida por e C é a matriz de covariancia no interior das elams (“intraclasse") total definida por c, = X (*, -1¿1 Xwn - Jl| )f + £ - M1- - Hj)' ricf| **^1 A matriz de covariancia intraclassc C, c proporcional á matriz de covariancia do conjunto de tre i ñá- mente. Ha é s¡métrica c defimda nao negativamente c normalmente nao-singular se o tamanho do conjunto de treinamento for grande. A matriz de covariancia ínter dasses CA é também simétrica e definida nao negativamente, mas singular. Uma propriedade particularmente interessante é que o produto matricial C ,w está sempre na direcáo do vetor diferen^a de medias - p.r Esta proprioda- de segué diretamente da definiese de C#. A expressao que define J(w) c conhccida como o quntíenle Rayteigh generalizado. O vetor w que maximiza J(w) deve salisfazer a cóndilo Qw - XCw <4.76) A Equa^áo (4.76) é um problema de a uto valor generalizado, Reconhecendu que no nosso caso o produce matricial t:_ w está sempre na directo do vetor dlferen^a p1 - p constatamos que a soluto para a Eq. (4.76) é simplesmenie w = C;1(gl-pí) (4.77) que é referido como o discriminante linear de Fixher (Duda c Kart, 1973). Retomando A questáo da delecto de características, lembre-se de que a fuñólo discriminante j da Eq. (4.74) relaciona a matriz de covariancia intraelasscs c a matriz de covariancia total dos padrees transformados para o espado oculto da rede. A fiinpao discriminante ffl desempeora um papel sirni lar aquel c do discriminante linear de Fisher. Esta é exatamente a razáo por que estas redes neurais sao capazcs de realizar cao bem a larcfa de classiñca^ao de padrees. 4.10 RETRO PRO PAG A^ÁO E DIFERENC1AQÁO A reiropropagacac (back'propagarían) c uma técnica especifica para implementar a debida do gradiente no espado de pesos para uma rede de múltiplas camadas alimentada adiarte. A idéia básica é calcular eficientemente as derivadas partíais de uma fiinqao aproximaba Hw^x) realizada pela rede em relajo a todos os elementos do vetor a justável de peso w para um dado valor de vetor de entrada i. Aquí se cncontra o poder computación?! do algoritmo de retropropaga^ao? Para serraos específicos, considere um perccptron de múltiplas camadas com uma camada de entrada de nós. duas camadas ocultas e um único neurónio de saída. como representado na Fig. 4.18. Os elementos do vetor de peso w sáo ordenados por camada (comc^ando da primeira camada
oculta), a seguir per neurónios em uma camada, e entao pelo número de uma sinapse dentro do neurónio, Suponha que wj'1 represente o peso sinóptico do neurónio i para o neurónio j na camada 1=0,1,2.....Para / = 1, correspondendo a primeíra camada oculta, o índice i se refere a um nó de fonte em vez de um neurónio. Para f= 3, correspondiendo á camada de saída na Fig. 4.1E5 temos/ = 1. Desojamos estimar as derivadas da fun^áo Ffw.i) cm relapso a todos os elementos do vetor de peso w, para um vetor de entrada específico, x = . Noto que, para ! = 2 (i.e.» uma única camada oculta), a funfáo F(wj) tem uma forma similar ¿quela do lado di re i lo da Eq. (4.69). Incluimos o vetor de peso w como um argumento da fuñado F para concentrar a atembo sobre ele. O perceptron de múltiplas camadas da Fig. 4,18 é parametrizado por uma arqtt ¡tetara (re- presentando um parámetro discreto) c um vetar de peso w (constituido de elementos continuos). Suponha que represente a parte da arquitetura que se estende da camada de entrada (/ = 0) até o nó j na camada l 1,2,3, Consecuentemente. podemos escrever F(w,x)=q»(.í4í|31) (4.80) frimeiií camada Mulla CirtiLkL de «¡da Sígutids carnada oculta Camad¿ devnirtdfi FIGURA 4J B PMMptr&fl dfi miiItiftóG camadas oom duas camada» ocultas 6 um MLKÓfiio d& saida ende tp é a fundió de ativa-pao. Entretanto, eleve ser interpretado meramente como um símbo- lo arquitetural em vez de uma variavcl. Assimh adaptando ás Eqs. (4.1}> (4.2), (4J 1) o (4.23) para □ uso ncsia situarStb oblemos os seguintes resultados ^¡I' )<• <3F(W, i) ”^r = q>'(jg.*n hp'Gtfj11 )W, , i (4 81) C*82) (4.83)
onde «(Té a di vivada parcial da nao-lineartdade u em relapáo á sua entrada, e j é o i-ésimo elemento do vetar de entrada je. De modo similar, podemos derivar as cqua^ocs para as derivadas pare tais de uma rede genérica com mais n turónos ocultos e mais neur&nios na camada de salda. As Equafdes de (4.81} a (4.83) fomecem a base para calcular a scnsibilidade da fúnfác de rede cm rcla^ao a varia^oes nos elementos do vetor de peso wr Suponha que o represente um clemente do vetor de peso w. A sensibitidüde de F(w,x} cm rcla^áo amé definida formalmente por sí — " <Wté (Ufe w É por esta razan que nos referimos á parte inferior do grafo de fluxo de sinal da Fig. 4.7 como um "grato de sen sibil idade A Matriz Jacobiana Suponhaque H' represente o número total de parámetros Irire (i.c., pesos sinópticos o bias) de um perceptron de múltiplas camadas, que están ordenados da maneira descrita para formar o vetor de peso w. Suponha que A' represente o número total de exemplos usados para tremar a rede. Utilizan- do a retropropagaíán, podemos calcular um conjunto de W derivadas partíais da fun^oaproximo- tiva F]w, x(n)J cm rclacao aos elementos do vetor de peso w para um exemplo especifico x(rt) do conjunto de treinamento. Repetíndo estes cálculos para a 1» terminamos com uma matriz /V-por- JFde derivadas paro i ais. Esta matriz c denominada a jacobiana J do perceptron de múltiplas camadas calculada cm x(u). Cada 1 inha da jacobiana corresponde a um exemplo particular do con- junto de (reina metilo. Há evidencia experimental para sugerir que muitos problemas de treinamento de redes neurais bSo intrínsecamente njul-condicionados,levando a umajacobiana J que é quase deficiente em posto (Saariocn et al., l991). O/nu/ir de uma matriz é igual ao número de coluros ou linhas linuarmente independentes da matriz, aquelc que lor o menor. Diz-sc que a jacobiana ú deficiente em posto se o seu posto for menor que irinf.V, IK). Qualquer deficiencia em posto na jacobiana leva o algoritmo de rctroprüpagd^o a obter apenas informado parcial das direí oes de busca possiveis, e causa também longos tempos de treinamento, 4.11 A MATRIZ HESSIANA A matriz hessiana da fundió de custo 7 iw), representada por H, é definida como a derivada segunda de em relaíúo ao vetor de peso w, como mostrado por &wJ (4.84) A matriz hessiana desempenha um papel importante no escuda das redes neurais; específicamente, podemos mencionar o negó inte i6 I. Os auiovalorcs da matriz hessiana (ém uma influencia profunda na dinámica da aprendizagem por retrepropaga^áo. 2. A inversa da matr.z hessiana fomece uma base para podar (i.e., excluir) pesos sinópticos insig- mücantes de um perceptron de múltiplas camadas, como discutido na Se^o 4.15.
3. A matriz bcssiana c básica para a formulado de métodos de otimizacao de segunda ordem come uma alternativa para a aprendizagem par retropropagacao, como discutido na Se$áo 4.18. Um procedimenlo iterativo para o cálculo7 da matriz hessiana é apreseniado na Seqiio 4.15, Nesta sepilo, restringimos nasaa aten^ao ao ponto 1. No Capítulo 3, indicamos que a auto-estruiura da matriz hessiana tem uma influencia profun- da ñas propiedades da convergencia do algoritmo LMS. Isto também acontece com o algoritmo de retropropaga^áo, mas em urna forma muito mais complicada. Típicamente, a matriz hessiana da superficie de erro relativa a um perceptron de múltiplas camadas tremada com o algoritmo de retropropaga$£o tem a seguí nte compos i^io de auto valores (LeCun, et al-, 1991: LeCun, 1993): • Um pequeño número de autpvalares pequeños. • Um grande número de autovalOrúS médiOs. • Um pequeño número de autovalores grandes. Os fatores que afetam esta composiqito podem ser agrupados como segue: • Sinais de entrada com media diferente de zero ou sinais neuronais de salda induzidos com media diferente de zcro. • Corrcla^óes entre os elementos do vetor sinal de entrada e correla^óes entre síullls neuronais de saida induzidos. • Grandes variares ñas derivadas segundas da fun(3o de custo em relajo aos pesos sinápticos dos neurónios da rede, quando prosseguirnos de uma carnada para a próxima. As derivadas segundas sáo freqúen temen te menores ñas camadas mais baixas, com os pesos sinápticos na pe imeira camada oculta aprendendo lentamente e aqueles na última camada aprendendo rápi- damente. Do Capítulo 3 recordamos que o tempa de aprendizagem do algoritmo LMS c scnsivcl a vartaqacs no número condicionante X /X.., onde X é o maior auto valor da hessiana e ¡1 . é o seo menor auto valor diferente de zero. Resultados experimentáis mosiram que um resultado similar vale para o algoritmo de retropropaga^ao, que é uma generalizado do algoritmo LMS. Para entradas com media diferente de zero, a razio Xiui \ é maior que o seu valor correspondente para entradas com media zero: quanto maior for a media das entradas, maior sera a razao X.m (veja o Problema 3.10). Esta observa^áo tcm uma séria implioafáo para a dinámica da aprendizagem por retropropaga^áo. Para minimizar o tempo de aprendizagem, deve-se evitare uso de entradas com media dife- rente de zcro. Agora, considerando-se o vetor de sinal i aplicado a um neurónio na primeira camada oculta de um pcrccpitron de múltiplas camadas (Le., o vetor sinal aplicado á camada de entrada), é fácil remover a media de cada elemento de i antes de aplica-Lo á rede. Mas o que dizer dos sinais aplicados aos neurónios das camadas ocultas restantes e da camada de saída? A resposla a esta questao se encontra no tipo de fun^ao de ativacao usada na rede. Se a ñin^ác de ativafáo for n^o- Siin-étrica, como no caso da fun^áo logísúca, a saida de cada neurónio está restrita ao intervalo [0.1 ]. Uma escolha assim introduz uma fonte de bias listemótico para aqueles neurónios localizados além da primeira camada oculta da rede. Para superar este problema, precisamos usar uma fúnfáo de ativacao anti-simétrica tal como a fúnfáo tangente hiperbólica. Com esta escolha, permítele que a salda de cada neurónio assuma valores tanto positivos como negativos no intervalo [-1, 1], e neste caso é prOvável que a sua media seja zcro. Se a ccnectb idade da rede for grande, a aprendizagem por retropropagafáo com fún^óes de aiiva^áo anti-simétricas pode produziruma convergencia mais
Hidden page
íb) FIGURA 4.19 {a) Dados ajustados adequadanwnte (Coa gefisraltwfáo) (b) DódúÉ ajustados om oxcasso fáanéraliza^o pobro) procurar um mapramcnio nao-linear suave: para retardé* de cntrada^saídii mal-fcrmula<lasT de modo que a rede seja capaz de clarificar coritamente rovos padrees em rela^ao aos padróes de treina- mento (Wieland e Leighton, 1987), Tamanho Suficiente do Conjunto de Treinamento para uma Generalizarán Válida A general i za^íi o ¿ influenciada por i rés fátores: (I) o tamanho do conjunto de treinamento* e o quito representativo do ambiente de íntenesse ele é* (2) a arqunetura da rede neural e (3) a complcxidadc física do problema em questáo. Evidentemente, náo temos controle sobre o último fator. No contex- to dos nutras dois fatores, podemos ver a questáo da general ¡zapito St>b duas perspectivas diferentes (Hushe Home, 1993):
A anqu 11 etu ra da rede é fixa (provavelinentc de acorde com a compl ex i dade fia i ca do problema relacionado^ c a questáo a ser resol vida é determinar o tamanho do conjunto de Ireinamento neccssário para que acorra nina boa generaliza^- • O tamanho do conjunto de treinamento é fixo, e a questáo de intenesse c determinar a mclhor arquitetura para alcanzar boa generalizacáo. Estes deis pontos de visia s3o válidos em seus aspecto'; individuáis. Na presente discussáo, nós nos concentramos no prime i ro ponto de vista. A adequafáo do tamanho da amostra de treinamento ou o problema da complcxi Jade da amostra é discutido no Capitulo 2. Como rcssaltado naquele capítulo» a dimunsáo V-C fornece a base teórica para uma solu^áo bem-fundamentada para este importante problema. Em particular, temos fórmu- las independente/i íitfdiatribui$¿ú e de piur claro para estimar o tamanho da amostra de treinamento que é suficiente para um bom desempenho de generalizacao; veja a $D?ao 2.14. Infelizmente» cons- tatamos com freqücncia que existe uma difcrcntja numérica intensa entre o tamanho da amostra de treinamento realmente nceessária e aqueta prevista por estas fórmulas. É esta diferenp que tem lomado O problema da complexidad? da amostra urna área de pesquisa em aherto. Na prática, parece que tudo de que precisamos para uma boa generalizado é que o tamanho do conjunto de treinamento A' satisfaga a condifáo nn A-' = o — (4.85) \ € / onde W é o número total de parámetros livres (Le-, pesos sinápticos e niveis de bias) da rede c £ representa a fra^áo de erres de elassi fica^áo permitida sobre os dados de teste (como na clarifica- do <le padrees) e representa a ordem da quantidade entre parénteses. Por exemplo, com um erro de IG por cento, o número de exemplos de treinamento necessários deve ser cerca de 10 vezes maior que d número -dos parámetros livres da rede. A Equacáo (4.85) está de acordo com a negra empírica de Jfíc/rnw para o algoritmo LMS, que afirma que o tempo de acomodado para a adaptado na filtrasen! temporal linear adaptar iva é aproximadamente igual á extensáo temporal de memoria de um filtro de linha de atraso com deriva- ^Ses dividido pelo desajuste (Widtw e Stearns, 1985). U desajuste no algoritmo LMS desempenha um papel até certo ponto análogo ao erro e na Eq. (4.85). Ouiras justificativas para esta negra empírica sBo a presentadas na próxima setfo. 4.13 APROXIMADO DE FUNQÓES Um pcrccptron de múltiplas camadas trcinado com o algoritmo de retropropaga<;áo pode ser visto como ura vciculo prático para realizar um ifítipcíimenin nan-Iifiear de entruda-naída de natureza geral. Para sermos espccifíeos, considere que represente o número de nós (de forte) de entrada de um perceptron de múltiplas camadas e \f = ms represente o número de neurónios na camada de saida da rede. A rclacáo de entrada-saida da rede define uin mapeamento de um espado de entrada eudidiano de dunensáo para um espado de saida euclidiano de dimensáo Af. que é infinitamente continuamente diferenciável quando a fun^áode ativa^ño também o for. Para estimar a capacidad? do perceptron de múltiplas camadas deste ponto de vista do mapeamento de entrada-salda, surge a seguí nte quest^n fundameni:il Qitüt i O fíUfítem ntiníato de tamadu.t ftcidsux em ttm perceptmt de fnídtipkis cumadux enm um rtuipeumenle de ftUrudu-xtjjda que fondee \»ma reaJüapw apneiimudti de qifíriquw mapenmetttn euntiriuti /
Hidden page
Hidden page
Hidden page
dcslas tundes. O uso de um perceptron de múltiplas camadas para aproxima^ de fundes parece que oferece uma vantagcm sobre as fúnqócs suaves tradicional;; esta vantagem está, entretanto, sujciia á condi^áo de que o pnmeiio momento absoluto C, pcrmanc^a Imito; esta é uma restribo de suavidad?. A maldigan da dimensinfíülidadc foi iritroduzida por Richard lie liman cm scus cstudos sobre processos de controle adaptad vos (Bel Imam 1961). Para uma mierpretapáo geométrica desta notfo, suponha que x represente um velar de entrada de dimensáo mn e {(ju ¿í)|, i = l„ 2,..., .V, represente a amostra de treinamento. A densidade de urnostruf^em é proporcional a A"m'. Suponha que uma fur>?fo /{K) represente uma superficie contida no espado de entrada de dimensao mn, que passa próximo aos pontos de dados _ Agora, se a funfjo/(M íbr arbitrariamente complexa e (cm grande parte) totalmente desconhecida^ precisamos de pontos de amostras (dados) densos para aprendedla bem. Infelizmente, amostras densas sao di ficéis de se encontrar cm “dimcnsócs eleva- das11, daí a maldigo da dimensional idade. Em particular, há um cresc i mentó exponerieiid na com- plexidad? como resultado do aumento na dimensionalidade, que, por sua vez, leva á deteriorarán das propiedades de preenchimento do espado para pontos distribuidos aleatoriamente em espatos de dinicnsóes mais elevadas. A razao básica para a maldigo da dimensionalidade é (Friodman, 1995): Uma r u n< :¡n definida em um lS|’.i v de ulLt dimenHÚmahdade é provavelnicntr muito mais comple- xa do que unía tucuso definida cm um espiten de tai xa dimcníionalidadc, c estas compl1 calóes sáo mais di ticéis de se perceber. O único modo prático de quebrara maldi^áo da dmnensionalidadeé incorporar con hecimento pre- vio sobre a fundan, além dos dados de treinamento, que sabidamente seja correto. Na prátLca, podc-sc argumentar lambcm que para se ter alguma esperanza de boa estimativa cm um espaqo de alta dimensionalidade, devenios assegurar que a suavidad? da funi;áo dcsconhcci- da seja crescent? com o aumento da dimensional idade do espaqo de entrada (Niyogi e Giro si, 1996). Este ponto de vísta édesenvolvido mais delñlhadamente no Capítulo 5. Considerandos Prátlcas O ten rema da aprox imaqao universal é importante do ponto de vista teórico, porque fomece a ferrü- mcfíta maifiMlica nec'í'-asáiía para á viahilidade das redes alimentadas adianlc com uma única camada acullá como uma classe de solufóes aproximadla?. Sem este teorema, poderiam.es estar procurando por uma solupao que nao pode existir. Entretanto, o teorema nao ó construtivo, ¡sto é. niki especi tica realmente como determinar um perceptron de múltiplas camadas com as propieda- des aproximafivas formuladas. O teorema da aproximado universal assumc que a funqáo continua a ser aproximada ¿ dada e que está dispon ível uma camada oculta de tamanho i lim i cada para a apraxima^do. Estas duas supo- siróes slo v icladas na maniría das aplicares práticas de pereeptrons de múltiplas camadas. O problema com pereeptrons de múltiplas camadas que usam uma única camada oculta e que os neurónios nesta camada tcndcmaintcragir entre si glohalmente. Em S¡tuavóescomplcxast esta interapán toma difícil de melhorar a aproximado em um ponto sem piorá-la em algum outro ponto. Por outro lado, com duas camadas oculta? o processo de aproximacáo (ajuste de curva) se tonta mais gereoL«aveI. Em particular, podemos proceder como segue (Funahashi. 1989; Chester, 1990):
1. As características locáis sao extraídas na primcira camada oculta- Específicamente, alguns neurónios da primcira camada oculta sao usados para dividir □ espado de entrada em regíóes e outros neurónios naquela camada aprendcrn as características Locáis Jaquel as regióos. 2. As carne tcríst icos givhaix sjí o extraídas na segunda cantada oculta. Específicamente; una neurón lo na segunda camada ocuita combina as saldas de neurónios da primcira camada oculta operando em uma reglan particular do espada de entrada, e com ísso aprende ds características global 5 para aquel a regiáo e i omece zero como saída ñas mitras negiues. Este processo de aproximado de dois eslágios é similar cm filoso Fia á técnica spfine para ajuste de curvas. no sentido de que os efeitos dos neurónios sao i sol ados o as aproximares cm regióes diTerentes do espado de entrada podem ser ajustadas individualmente, Um jp/úte é um exemplo de um? aproximarán pohrjomjal por partes. Sontag (1992) fomcce urna justificativa adicional para a utilizado de duas camadas ocultas no contexto dos problemas ítweram. Específicamente, o seguíate problema inverso é considerado: Dada uma fun^aci continua de valor Vitoria] fi R” -> R'í um subconjunto compacto f<! c que eslá incluido na imagem def, c um í > Ü, encontré uma fun^áo de valor vetoríal tp; —► R* tal que 3. seguirte candólo seja gatislleita: |!tp(f(uii - u| < e para u E Este problema surge na cinemática j/jverw {(linámica), onde o estado observado x(n) de um sistema é uma ñuiQÍo das tildes conenles u(n) e do estado anterior x(i? — 1) do sistema, corno mostrado por x(jr) = f(x(íj- 1 ),□(»)) Assumosc que f pode ser invertida, de modo que podemos resolver para u(u) cotno uma fuñico de xOj) para qualquer x(/i - 1). A fundo f representa a cinemática direta, enquanto que a fundan <p representa a cinemática inversa. Em termos prábeos. a motivado é encontrar urna fundo cp que seja computável por um perceptron de múltiplas camadas. Em gcralr para resolver o problema da cinemática inversa sao ncccssárias l'un^ocs (¡> descontinuas. E interessante que mesmu su for permitido o uso de modelos neurais com fun^Óes de aiiva^áo descontinuas, uma única camada oculta nao é suficiente para garantir a soluto de todos esleí» problemas inversos, enquanlu que pcrccpirons de múltiplas camadas com duas camadas ocultas s^o suficientes para todo f, e í (Sontag, 1992), 4.14 VALtDAQAO CRUZADA A csscncia da aprendizagem por retropropagacao é codificar um mapeamento de entrada-saíde (representado por um cor ¡unto de cxcmplos rotulados) nos pesos sinápticos c 1 i miares de um perccptron de múltiplas camadas. Esperamos é que a rede se tome bem-treinada de modo que aprenda o suficiente sobre o passado para generalizar no futuro. Desta perspectiva, o processo de aprendí/agem se transforma em uma cscollta du parametriza^áo da rede para este conjunto de da- dos. Mais específicamente, podemos ver o problema de ¡&eletfSo da rede como a escolha, dentre um conjunto de estruturas de modelo candi datas (paramclri zacóes), a “mclhof1 de acordo com um ccrto criterio.
Neste contexto, uma fcrramcnid padrao da estatísl ica conhevida como vailda^áo cruzada fbr- necc um principio orientador atraente9 (Stone. 1974, 1978). Prinfieiramente. o conjunto de dados disponívd ó dividido aleatoriamente em um conjunto de treinamento e em um conjunto de teste. O conjunto de treinamento é dividido adicionalmcntc cm deis subconjunto disjuntos: • Subcanjtifílo de en¡ma(i¡o, usado para sclccionar o modelo. Subconjunto de vcíficia^do, usado para testar ou validar o modelo. A motivado aquí é validar o modelo com um conjunto de dados diferente daquele usado para estimar os parámetros. Desta forma, podemos usar o conjunto de treinamento para avaliar o desem- penho de varios modelos candidatos c, assim, escolher o “melhor \ Ha, entretanto, uma possibil i da- do consideravel de que o modelo assim selecionado, com os valores de parametros com melhor desempenho. possa acabar ajustando excesivamente o subconjunto de validado. Para nos resguar- damos desta poshibilidade, o desempenho de general iza^áo do modelo selecionado é medido sobre o conjunto de teste, que o di Iérente do subcunjunto de validacáo. O uso de validado cruzada c atrativo particularmente quando temos que projelar uma rede neural grandecuja objetivo seja uma boa generalizadlo- Podemos, porexemplo, utilizar a val idafáo cruzada para determinar o perceptron de múltiplas camadas com o melhor número de neurónios ocultos e quando c mclhor parar o treinamento, como descrito ñas próximas duas subsc^ocs. Selefao do Modelo A ideia de sciccionar um modelo de acorde com a validado cruzada segué uma filosofía similar a da minimizarán cstrutural do risco, descrita no Capítulo 2. Considere cntáo uma estnitura an inhada de classes de funcóes bordearías representadas por iT I_ J -i L ^={^1 (4.91) = {F(in w);WÍ= Wb}, t = 1, Eím palavras, a A-ésima elasse de fun^6es j-, abrange uma familia de perceptrons de múltiplas camadas com arquitetura similar c vetores de peso w retirados de um espado de pesos muli ¡dimensional V,. Um membro desta elasse, caracterizado pela fundió ou hipótese F = F(itw), w t W4+ mapcia o vetor de entrada x era {0,1¡, onde x é retirado de um espado de entrada <j£ com uma probabilidade desconhecida /* Cada perceptron de múltiplas camadas da estrulura descrita é (reinado com o algoritmo de rctroprop3ga^áoT que c rcspcnsável pelo treinamento dos parámetros dü perceptron de múltiplas camadas. O problema da sclcfáo do modelo c csscncialmcntc o de escolher o perceptron de múltiplas camadas com o melhor valor de W, o número de parámetros livres (¡.C..J pesos sináplicos c níveis de bias). Mais precisamente, dado que a resposU escalar deso- jada para um vetor de entrada x é J » {ÜJ h definimos o erro de generalizado como = paraxeSC Recebemos um conjunto de treinamento com exemplos rotulados
O objetivo é seledonar a hipótese que minimiza o erro de generalizado que resulta quando sáo fomeeidas entradas do conjunto de leste. No desenvolvimenta a seguir as su ni irnos que a estrutnra descrita pela Eq. (4.91) tem a propricdadede que para qualquer tamanho de amostra Ai sempre podemos encontrar um perceptron de múltiplas camadas com um número suficiícntemtnie grande de parámetros livres W^.tL(A0, tal que o conjunto de dados de treinamento J possa ser ajustado adequadamente. isto equivale sim- plesmente a refórmala! o teorema da aproximado universal da sc^áo 4J 3. Nós nos referimos a H m Jft} como o numen) de ajuste. A importancia de B m jjV) é que um procedí mentó razoável de selepáo de modelo escolheria uma hipótese Ffx.w) que requeira Ji' ¿ caso contrario, a complexidade da rede seria aumentada. Suponha que um parámetro r, no intervalo entre 0 e l, determine a partifao do conjunto de treinamento & entre o subconjunto de estimare e o subconjunto de validado. Com ST consistindo de Ar exemplos, (1 - r)N exemplos sáo destinados ao subconjunlo de estimado e os nV exemplos restantes sáo alocados para o subconjunto de validado. O subconjunto de estimafáo, representado por 3" \ é usado para tremar uma seqúéncia aninhada de percEptrons de múltiplas camadas, resul- tando ñas hipóteses .rii de complexidade crescenle. Com -7 compcsto de (I - r)Nexem- plos, consideramos valores de W menores que ou iguais ao número de ajuste correspondente JF ((1 -r)2V). O uso de validado cruzada resulla na escclha ffff= min {e/fSFj)} (4 92) í . H|T onde v corresponde a Ffr < lfr_. {(I - r)V), e ^."(S') ° eiTO classiñca^áo producido pela hipótese 3^ quando c testada sobre o subconjunlo de validado ÍT*, consistíndo de rNexemplos. A quesíáo-chave é como especificar o parámetro r que determina a partido do conjunto de treinamento 9" entre o subconjunlo de esiimasáo T e o subconjunto de valida^io Em um estudo descrito por Keams (1996) envolvendo um tratamenfo analítico desta questáo utilizando a dimensáo VC c suportado por simulantes computacionais detalhadas, varias propn edades qualita- tivaa do r étimo sáo identificadas: • Quando a complcxidade da funfáo-alvo, que define a resposia desejada d em lermos do vetor de entrada x, é pequeña comparada com o tamanho da amostra A¿, o desempenho da validadlo cruzada é relativamente msensivel á escolha de r. * Quando a funcáo-alvo se toma mais complexa cm rclacáo ao lamanhc da amostra N. a escolha do r étimo tem um efeito mais pronunciado no desempenho da vatida^áo cruzada, e seu valor dccrescc. • Um único valorfixo de r funciona de forma e ótima para um grande i ntervalo de comple- x idade da fun^So-alvo. Com base oestes resultados relatados por Kcarns (1996), um valcr ñxo de r igual a 0,2 parece ser uma escolha sensata, significando que 80 por cento do conjunto de treinamento ? sáo atribuidos ao subconjunto de estimarán e es 20 per cento restantes sao atribuidos ao subconjunta de valida- 0&O. Anteriormente, falamos de uma seqücncia aninhada de pcrccplrons de múltiplas camadas de complcxidade crescente. Para camadas de entrada e de saida predeterminadas, esta seqüéncia pode ser criada, por «templa, tendo v - p + perceptrons de múltiplas camadas totalmente conectados, estruturados como segue:
* p pcrccptruns de múltiplas mamadas com uma única camada oculta de tamanto crescente A, < 7rn <.. .A„. * 9 pcrccptruns de múltiplas camadas com duas camadas ocultas; a primara camada oculta tcm tamanho <' e a segunda canuda oculta tem tamaidio crescente ft," < A," <.. . Aj. Quando passamos de um perceptron de múltiplas camadas para o seguíate, há um aumento corres- pondente do número de parámetros livres ¡V- O procedimento de selecáo de modele bascado na valida^áo cruzada como aquí descrito nos ibrnccc uma abordagem bem-fundamentada para deter- minar o número do neurónio* ocultos de um perceptron de múltiplas camadas. Apesar de o procedi- mento tersído descrito no contexto de classificafáo hmária, ele se aplica igualmente bem a cultas aplicadnos do perccptron de múltiplas camadas. Método de Treinamento com Parada Anticipada Normal mente, um perccptron de múltiplas camadas trenado com o algoritmo de relropropaga^áo aprendo cm estágiot partindo da realizando de fuñídes de mapeamento razoavelmenie simples para fiutiQdes mais complexas, conforme a sessao de treinamento avanza. isto c ejemplificado pcio fato de que, cm urna situado típica, o erro medio quadrado decresce com o aumento do número de épocas durante o treánamenfo: cíe cometa com um valor grande, decresce rápidamente e cntáo conllliua di mi mundo lentamente conforme a rede segué seu caminho em dire^áo a um míl-imo local na superficie de erro. Tendo como objetivo uma boa generalizado, c muito difícil perccbcr quando é o melhor momento para encerrar o treinamento, se olharmos apenas para a curva de aprendiza- gem. Em perticuldi L-tmi base no que foi dito na Se^Ko 4.12 sobre general iza^So, é possivel que a rede acabe sendo exccssivameateajustada aos dados de treinamento, .se a sesxao de treinamento nao for encerrada no ponto ccrto. Podemos identificar O inicio do CxCcsso de IrtinamcnlO dlravés do uso da validado cruzada, pela qual os dados de treinamento sao divididos em um subconjunto de estimafáo e em um subconjunto de validadlo. O subconjunto de cxcmplos de estimado c usado para treinar a rede na maneira usual, excelo por unía pequeña modificado: a sessao de treinamento c interrumpida peri- ódicamente! i c- aP°5 um número determinado de épocas), c a rede c testada com o subconjunto de validado após cada periodo de treinamento. Mais específicamente, n processo periódico de estima- uáe seguida de validado pHHsegue comu segué: • Após um periodo de estimado (tre mámenlo), os pesos sinápticos e os ni veis de bias do perccptron de múltiplas camadas sao todos ftxos^ c a rede opera no scu modo díñelo, para frente, ü erro de validado é entáu medido para cada exemplo do subeanjunto de valida^ao. • Quando a fase de v;dida0o é completada, a estimafáo (treinamento) é reinieiada para um novo periodo, e o processo é repetido. Este procedimcnto é referido como o de ireinafnenttf corn parada arttecipada.n A Figura 4.20 mostra formus eoncuiluais de duas curvas de aprendizagem, uma relativa ás medidas sobre o subconjunlo de estimaban e a outra relativa ao subconjunto de validaqáo. Típica- mente, o modelo náo funciona tio bem iiobre o subCOnjunto de validado do que sobre o conjunto de sobre c qual o projeto foi bueado. A c'ímtw ríe aprendizagem de estima^ao decresce monolonamcnlc para um número cresccnlc de épocas, da mancira usual. Diferentemente, acwvd de aprendizagem de vatída^aa decresce monótonamente para um mínimo e entilo cometa a crescer
FIGURA 4.20 llUSlrafio da regra cte parada ¡intacipada oa seada na v^lida^ú cruzada. Env média quid rodo conforme o treinamento continua. Quando oIhamos para a curva de aprendizagem de estima- ?So pode parecer que pederíamos melhorar o desempenho indo além do ponto mínimo da curva de sprendizagem de validado. Na icalidadc, entretanto^ o que a rede aprende após este ponto c essen- cial mente o ruido comido nos dados de treinamento Esta heurística sugere que o ponto mínimo na curva de aprendizagem de validado seja usado como criterio sensato para encerrar a sessao de treinamento. O que acontece se os dados de treinamento nao llverem ruido? Como pederíamos entilo justificar a parada anticipada para um cenani> determi nistico? Parte da resposta ueste caso ó que se ambos os erres du estimadlo e de validado nSo podem ser levados a zero simultáneamente, isto implica que a rede nSo tem a capacidade de modelar ratamente a tunero O melhor que podemos fazer resta situado é tentar minimizar, por exemplo, o erro quadrado integrado, o que c equivalente (grosseiramente) a minimizar o erro medio quadrado global usual com uma densidade de entrada uniforme. A teoría estatifica do fenómeno do excesso de ajuste apresentada em Aman el al. (19%) sugere precau^o na utilizadlo do método de treinamento com parada antecipada. A teoría é basca- da na aprendizagem por lote e apoiada por simula^des computacionais detalhadas envol vendo um classificador por pcrccptron de múltiplas camadas com uma única camada oculta. Foram identifica- dos deis modos de comporiamento, dependendo do tamanho do conjunto de treinamento: Modo náo-assintó¡icQ, para o qual N< JK, onde Vio tamanho do conjunto de treinamento e w ó o número de parámetros livres da rede. Para este modo de comportamento, o método de treina- mento com parada antecipada melliora o desempenho de genera! :zafac da rede em relajan ao trei- namento exauslivo (i.c., quando o conjunto completo de exemplos é usado para o treinamento c a sessao de treinamento nSo é inlerrompida). Este resultado sugere que pode ocorrer «cesan de ajus- te quando N < 30IK e que existe um mérito prática na usa de validadlo cruzada para parar o treina- mento. O valor ótimo do parámetro rque determina a partidlo dos dados de treinamento entre o conjunto de estimado e o conjunto de treinamento é definido por , 72íF^T-i " I--------- 20K-1) Para H''grande, esta fórmula é aproximada por
244 Rfr.Ufrí IXkÜkAlS Para IF“ 100. por exemplo, r = 0,07, o que significa que 93 por ccnlo dos dados de tre i namcnlo sao alocados para o subconjunlo de esti ma0o e 7 per cento sáo alocados para o subconjunto de validado. Aítxto assinfótica, para o qual Ar> 30 JE. Para este modo de comportamento, a mclhona no desempenho de general tza^ao produzida pelo uso do méiodc de treinamento com parada antee i pa- da em rclatf o ao treinamento exaustivo é pequeña. Em cutías pala vías, a aprendizagem exautiiva é sahsfatória quando o tamanho da amostra de ireinamento c grande Comparado com o número de parámetros da rede. Variantes de Validando Cruzada A abordagem de validado cruzada descrita ate aquí ¿ referida como o melada de resistencia. Exis- te™ oulras varianies de valida^ cruzada que enccntram seu próprio caminho ría prátiea, particu- larmente quando há uma cscasscz de exemplos rotulados. Nesla situando, podemos usar a validado cruzada múltipla dividindo o conJiUrlo dispon i vcl de A/ exemplos cm K subconj unios» K > I; isto presume que Ké dlvisivel por Ai O modelo é treinado com todos os subconjuntos, exceto um, e o erro de validado é medido trslando-o com este subconjunto drixadode lado no treinamento. Este procedí mentó é repetido para um total de K tentativas, cada vez usando um subconjunlo diferente para a validado, como ¡lustrado na Fig. 4.21 para K = 4. O desempenho do modele é avallado pela media do erró quadrado obtido na vaJidBffio sobre todas as tentativas do experimento. Há urna desvantagem na validado cruzada múltipla: ela requer uma quantidade «cessiva de cálculos, país o modelo deve ser Lrcinado K vezes, onde l < Á" < .V. FIGURA 4 lluslra^-áo do método da validado cruzaos múltipla Rara uma dada tsnlafiva, o subcunjunto oe dadas SCimbr^BtJo é usado para validar o modelo ireinado óam os dados restantes TtncBiiva l 1 cnlai iva Z I«iIb: .va 3 Quando o número de exemplos rotulados dispon i veis, A', fbr severamente limitado, podemos usar a forma extrema de validarán cruzada múltipla conhecida como o méiwh deixe um dejara. Neslc caso, A’- l exemplos sáo usados para [reinar o modelo, e o modelo é validado testandü-o sobre o cxcmplo dcixado de fora. O experimento é repetido para um total de Ar vezes, cada vez deixando de fora um cxcmplo diferente para a valida^áo. O erro quadrado na validado é entelo a media sobre as Ar tentativas do experimento. 4.1 S TÉCNICAS DE PODA DE REDE Para resolver problemas do mundo real com redes neurais, normalmente é necessário o uso de redes de tamanho bastante grande, altamente cstruturadas. Uma questáo préiica que surge ueste contexto é a da minimizacáo do tamanho da rede manteada bom dtsempenho. É menos provável que urna rede neural com tamanho mínimo aprenda as diossiñerasias ou ruido dos dados de Iruinamcnto, c
pode assím generalizar melhor sobre novos dados. Podemos alcafar este objetivo de projeto de duas formas: * Pelo crescimento da rede, enmelando com um perceptron de múltiplas camadas pequeño, pequeño para realizar a tarefa em quesillo, e enláo adicionando um novo neurónio ou uma nova camada de neurónios ocultos sonriente quando formos incapazes de satisfazer as especificares de projeto?1 • Pela poda da rede, come^ando com um perceptron de múltiplas camadas grande, com um desempenho adequado para o problema em questio, e entáo podando-o pela redujo ou elimi- na^áo de certas pesos sinápticos de uma forma setetiva e ordenada. Nesta se$aoT enfocamos a poda da rede, Em particular, descrevemos duas abordagens, uma baseada cm urna forma de “rcgulaiiza^ao^ e outra bascada na 4'elimina^ao" de certas conexoes sinópticas da rede. Regularizado da Compiexidade No projeto de um perceptron de múltiplas camadas por qualquer método que seja, estamos de fato construindo um modela nao-linear do fenómeno físico responsávet pela geraplo dos exemplos de entrada-saída usados para treinar a rede. Na medida em que o projeto da rede é de natureza estatís- tica, precisamos de um compromisso adequado entre confiabilidade dos dados de treinamento e a qual idade do modelo (ie, um método para resolver o dilema bias-vamáiicia). No contexto da apren- d i zagem por retropropaga^áo, ou cm qualquer outro procedimento de aprendizagem superáis i ona- da para aqucíc problema, podemos realizar este compromisso minimizando o risco total, cxprcsso güftlü: S(W) + Xtc(w) (4 94) O primeiro termo, é a medida de desempenho, que depende tanto da rede (modelo) como dos dados de entrada. Na aprendizagem por retropropaga^áo, ela c típicamente definida como um erro médio quadrado cujo cálculo se estende sobre os neurónios de saída da rede e que é realizado para todos OS ejemplos de treinamento, de época em época. O segundo termo, S (w), é a punido da compfexidade., que depende apenas da rede (modelo), a sua inclusáo impoc á solu^áú conhecimento prévio que possamos ter sobre os modelos que estdo sendo considerados. Na verdade, a forma do risco total definida na Eq. (4.04) é simplesmente uma formulado da íeoria da n¡guiuriza<íá<) de Tikhonov; este assunto é detalhado no Capítulo 5. Para a presente discussáo, é suficiente considc- rarmos X como um parámetro de reguíariza^áo, que representa a importancia relativa do termo de punt^áo da complexidad^ em relajo ao termo de medida de desempenho. Quando X é zero, o processo de aprendizagem porretropropagacao é inestrito, com a rede sendo totalmente determina- da pelos exemplos de treinamento. Quando A. é infinitamente grande, por outro lado, a implicado é que a restribo imposta pela punirán da complexidad^ é por si só suficiente para especificar a rede, o que é uma outra forma de dizer que os exemplos de treinamento nao sao confiávcis. Em aplica- ífies prá ticas do procedimento de dccaimcnto de peso, atribuí-se ao parámetro de regularizado X um valor entre estes dois casos limites. 0 ponto de vista aqui descrito para a utilizacao da regulari- zado da compleíxiidade para melhcrar a general izaqác é iníciramente consistente com o prqcedi- mento de minimizaíáo cstrutural de risco, discutido no Capitulo 2.
Kih unía situatáo genérica, unía esecilla do (.enrío de puní cito da complcxidade €((w) é a integral desuavizafffo de Jc-ésima erdein (4.95) onde Hvwj é o mapeamento de entrada-saida realizado pelo modelo^ c )i(x) é uma luirlo de ponderado que determina a regiáo do espado de entrada sobre ;i qual Hx.w) deve ser suave. O objetivo c tomar pequeña a ¿-¿sima derivada de Z'(x,w) em relaja ao vetor de entrada x. Quanto maior for o valor escolhido para (. mais suave (i.e., menos complexa) se tomará a fun^ác F(x,w). A seguir, descreveinos tres diferentes rcgularizajocsdc complcxidade (com cre&cenle sofisti- ca j tío) para perccptrcms de múltiplas camadas. Decaí moni o de Pesos. No prncedimento de tkanmenfü tiepestrt (Clinton, 1989), o lermo de puni- oáo da complraidade 4 definido como a norma quadrada do vetor do peso w (i.e., todos os parámetros livres) da rede, como mostrado por <(*)=M = L «í (4.96) onde o conjuntose refere a lodos os pesos sinópticos da rede. Este procedñnenlo opera forjan- do alguns dos pesos sinópticos da rede a assumir valores próximos a zcro. enquanto permite que [nitro® pesos retenliani. seus valores relativamente elevados. Conscqücntcmcnlc. os pesos da rede sao agrupados grosseiramenle em duas categorías: aqueles que tem uma grande influencia sobre a redo {modelo), c aqueles que tém pequeña ou nenhuma influencia sobre ela. Os pesos desta última categoría sao referidos como ;wrw «'rce.wlMM, Na ausencia de regularizase da complexidade, estes pesos resultam em uma generalizarán pobre, em virtudeda sua alia prohabi 1 idade de as sumir valores totalmente arbitrarios ou causar o ajuste extensivo dos dados pela rede, para produzir uma pequeña redujo no erro de treinamento (Hush e Home, 1993). 0 uso de regularizado deeomple- xidade encoraja os pesos cxccssivos a assumircm valores próximos a zcro, mclhorando assim a generalizadlo. No procedí monto ÓC decaí mentó de pesos, lodos Os pesüs do perceptron de múltiplas camadas sáo tratados igualmente. Isto é, assume-se que a distrihuifáo previa no espado de pesos esteja centrada na oiigcm. Eslri rímente fa lando, o dccai mcnio de pasos nao éa forma córrete de regular i zajáo da complcxidade para um pcrccptron de múltiplas camadas» pois nao se enquadra no raciocinio descri- to na Eq. (4.95). Apesar dis^o. deé simples e parece que funciona bem em certas aplicajdes. Eli minado de Pesos. Ncste segundo prnccdimcnto de regularizarán de complexidade, a punijáo da complexidad^ é definida por (Wcigcnd el al.» 1991) onde w( é um parámetro prccstabelecldo ew. se refere ao peso de uma sinapse j da rede. O conjunto *4|AI1| se refere a todas as concxAes sinópticas da rede. Um termo de punido individual varia com «y ¡r,. em uma forma simétrica, como mostrado na Fig. 4.22. Quando |icj <= ?p{|, a punijáo (custo) da
FIGURA 422 O i&htkj de puní?Ao da ccxnplewtd&da 1 + (w/w ’J1) ira?ado em Funffio de w/wn. complexidad? para aquele peso se aproxima de zero. A implicado desta cóndilo é que, na medida cm que se considere a aprendizagem por exemplos, o f-csimo peso sinóptico nao c confiável c deveria ser eliminado da rede. Por outro lado, quando |ir| ?> ir,., a punido (cusió) da eomplexidade para aquele peso se aproxima do seu valar máximo, a unidade, o que significa que w é importante para o processo de aprendizagem por retrepropaga^ác. Vemos entilo que o termo de puní cao da complexidad?da Eq. (4.97) serve ao propósito desojado de identificaros pesos sinópticos da rede que tem influencia significativa. Note lambóm que o proccdimenlo de eliminado de pesos incluí o procedimentc de decaí mentó de pesos coma um caso especial; especi ricamente, para w (grande, a Eq. (4.97) se rcduz á forma mostrada na Eq. (4.96) excelo por um falor de escala, A rigor, o procedimenio de eliminado de pesos tambera nao é a forma cometa de regulariza- cao da complexidad? para pereeplrocis de múltiplas camadas porque náo se ajusta a describo especificada na Eq. (4.95). Apesar disso, com a cscolha apropriada do parámetro Wj, ele permite que alguns pesos da rede assumam valores que s3o tria lores que aqueles com decalmento de peso (HushT 1997). Suavizador Aprpximativo. Em Moody e Rógnvaldsson (1997), é proposto o seguí nte termo de punifáo da complexidad? para um perceptron de múltiplas camadas com uma única camada oculta e um único neurónio na camada de saida: «,cwi=ixii*, ir J-t (4.98) onde os w sSo os pesos da camada de saida, e v ¿ o vetor de peso para o/-¿simo neurónio da camada oculta; a potenciap é definida por para um suavizador global 2i para um suavizador local (4r99)
Hidden page
Oprocedimento do daño cerebral átima (DCO) (l.eCun et aL, 1990b) simplifica os cálculos fazen- do uma suposi^áo adicional; a matriz hessiana II í uma matriz diagonal. Entretanto, tal suposi^áo n3o é feita noprocedimentodocirurgiaocerebral ótímo (CCO) (HassiSi et al., 1992); conseqüente- mente, ele cantero o procedimenia DCO como um caso especial. De agora em diante, nos seguimos a estrategia CCO. O objetivo do CCO é fixar um dos pesos sinápticos em zero para minimizar o aumento incremenlal de $ , dado na Eq. (4.101). Supnnha que U’/n) represento este peso sináptico particu- lar. A eliminarán deste peso c equivalente á conch^áo Air + ir i = 0 ou 1’Aw + m^Ü (4.102) onde Ico vetar unitario cujos elementos sao todos zcro. cxcClO O /-¿simo elemento, que é igual á unidade. Podemos agora refbrmular o objetivo do CCO como (liassibi et ai., 1992): Minimize a fanna quadiática |Aw Hiw em rcía^w á variadlo incremcuial do vetor peso, Aw, sujeita á restriego que l iw +seja zero, c cnláo nnnimize o resultado cm relajo ao índice ¿ Há dois nfvcis de minimizafáo oconcndo neslc caso, Ima minirniza^áü acOntcCc sobre os vetares de pesas sinápticos, que pennanecem depois que o í-csimo vetor de peso é colocado cm zcro. A segunda minimizado é sobre aquele vetor particular que é podada. Para resolver este problema de olimizafSo com restribóos, primeiro construimos o tagrcingianíi $ — Aw1 11Aw - Aw+ U1,) (4.103) onde A é o multiplicador de Langruge. Entáo, calculando a derivada do lagrangiano 5, com respeita a Awp aplicando a restrifáo da Eq. (4.102) c usando a inversáo matriiial, constatamos que a racditl- cado ólima do vetar peso w é AW="[H^] H 1 (4.104) e o valor ótímo correspondente do Lagrangiano 5 para o elemento W(c s- «’ '"2[¡rí[ <«l0S) onde H 1 c a inversa da matriz hessiana II. c [H ] d c o elemento desta matriz Inversa. O lagrangiano Sr otimizado em relajo a Aw, sujeito á reslri^áo que o É-csimo peso sináptico u seja eliminado, c denominado a safiéncia de ir. Na verdade, a saliéncia 5. representa o aumento no erra médio quadrado (medida de desempenho), que resulta da eliminado de ul Note que a sal ¡encía 5 é proporcional a t/;,!. Assim, pequeños peses tém um cfciio pequeño no erro médio quadrada. Entre- tanto, da Eq. (4.105) c possívcl constatar que a salí encía 5 é também inversamente proporcional aos
elementos da diagonal da inversa da hessiana. Desta forma, se [H '],, for pequeño, entlo mesma pesos pequeños deverao lct um afeito substancia] no erro múdio quadrada No procedimenic CCO, o peso correspondente á menor sal ¡encía é aquele selecianado para a elinunaíjáo. Além disso, as modificalóes chimas correspondentes nos pesos restantes sao dadas pela Eq. (4.104), que mestra que deven am ser atualizados ao Longo da dire^o da r-ésima caluña da inversa da hessiana. Em sen artigo, 1 lassibi et aL relatam que, em alguns problemas padreo o proce- dí menta CCO resultan em redes menores que aquetas obtidas utilizando o procedí mentó de decaimiento de peso. Foi tamhcm relatado que, como resultado da aplicadlo do proccdimcnto de CCO ao pcrccptron de múltiplas camadas do NETtalk, cnvolvcndo uma única carnada oculta c I 8.000 pesos, a rede tora podada a nlc mais que 1560 pesas, uma reduelo drástica no tamanho da rede. O NETtalk, de Sejnawski e RoseJiberg(l9?7), é descrito no Capitulo 13. Computando a inversa da matriz hessiana. A matriz inversa da hessiana H1 c fundamental á formuladlo do proccdimcnto CCO. Quando o número de parámetros livres da rede, c grande, o problema de computar H 1 pode ser intratase l. A seguir, descrevemos um procedimcnto Lraiável para compul ar H'1, assumindo que o perceptron de múltiplas cunadas estoja totalmente treinado para um mínimo local na superficie de ene (HasRÍbi ct al., 1992). Para simplificar a apreveníanlo, suponha que o perceptron de múltiplas camadas possua um único neurónio de saida. Hntlo, para um dado conjunto de treinamenio, podemos expresar a fuñ- ase de custo como 2A TÍ onde «(rt) é a saida real da rede durante a apresenta^o do n-éatmo exemplo, ¿(n) á a respasta desejada correspondente, c jV é o número total de exemplos do conjunto de treinannento. A saida afn) pode ser expressa coma "(ff) * K) onde Fea tiin^ao do mapeamento de entrada-saida realizado pelo pcrccptron de múltiplas Mina- das, * é O vetor de entrada, e w é o vetor de pesos sinópticos da rede. A derivada primeira dc^mn| cm reíanlo a w e portante e a derivada segunda de ®mr. em rela^áo a w ou a matriz hessiana ó
Hidden page
Hidden page
Estas duas propiedades da aprendizagem por retropropagacAo no contexto de um perceptron de múltiplas camadas sáo rcspcnsávcis por suas vanlagcns c dcsvantagcns. Conexlonismo O algoritmo de retropropaga^áo c um exemplo de um /xznuf/gmd c&texionislü que se baséis em calcufos Locáis para descobrir as capacidades de processamento de informaban das redes neurais. Esta forma de reslri^áo ccmputacional c referida como a neítrifdo de localidades no sentido de que a computado realizada pelo neurónio c influenciada apenas por aqueles neurónios que están cm contato físico com ele. O uso de compulso local no projeto de redes neurais artificiáis é normal- mente defendido por tres razccs principáis: 1. As redes neurais artificiiais que reah/am computado local sáo freqüen temen te tidas como me- táforas para as redes neurais biológicas. 2. O uso de coraputa^ao Loca] permite uma degradado suave no desempenho de vi do a erres dos componentes físicos c, perianto, fomcec a base para um projeto do rede tolerante a tal has, 3. A computapáo loca] favorece a ulilizapáo de arquiteturas paralelas como método eficiente para a impl ementado de redes neurais artificiáis. Considerando estes tres pontos cm ordem inversa, o ponto 3 c iriteiramente justificável no caso da aprendizagem por retropropaga^áo Em particular, o algoritmo de retrapropagapdo tem sido implemenlado com succsso em computadores paralelos por muitos pesquisadores, e arquiteturas VLSI tem sido desenvolvidas para a realizado lisies de perceptrons de múltiplas carnadas (Hammerstrom, 1992a, 1992b). O ponto 2 c justifica ve] desde que certas precauteles sejam tomadas na aplicado do algoritmo de retropropaga£íta, como descrito em Kerlirzin e Vailet (1993). No que diz respecto ao ponto I, em relajo á plausibilidade biológica da aprendizagem por retropropagapáo, isto tem sido seriamente qucu i orlado pelas següintes razocs (Shcphcrd, 1990b; Crick, ]989; Stork, 1989): 1. As concxdcs si réplicas recíprocas entre os neurónios de um perceptron de múlliplas camadas podem assumír pesos que sáo excitatór i os ou inibilórios. No sistema nervoso real, cornudo, os neurónios normalmente aparecen como sendo de um tipo ou de outro. Essa c uma das mais sirias suposiíóes nao-realisticas feitas em modelos de redes neurais. 2. Era um perceptron de múltiplas camadas, as comunicacócs hormonals ou nutras tipos de ccmu- nicabóes globals sáo ignoradas. Em sistemas nervosos reais, estes tipos de comunicado global sáo cruciais para as fundóos de ajuste de estado, como o despertar, a atengan e o aprendizado. 3, Na aprendizagem por retroprupagabAo. um peso siináptico é modificado por uma atividade prc- sináptica c um sinal de erro (de aprendizagem), independentemente da atividade pós-siiiáptica. I l:i evidencias da neurübiologia que sugercm o contrario. 4. Era um sentido neurnbíclógico, a implcmentapáo da aprendizagem por retropropagaílo requer a rápida retropropagaído da informado ao longo de um axónio. Parece altamente improvávcl que uma operacáo deslc tipo realmente ocorra no cerebro. 5. A aprendizagem por rctropropagaQac implica a existencia de um "professor”, que no contexto do cérebra seria presumivdmente um outro conjunto de neurónios com propr ¡edades i ínsita’ das. A existencia de tais neurónios é biológicamente implausívcl. Entretanto, estes recelos neurobiológicos náo depreciara a importancia técnica da aprendizagem por nctropropagacao como tarramenta para processamento de informado, como evidenciado por
sua aplícalo bcm-isucedida cm numerosos campos a Llámente diversi litados. incl unido a simulado de fenómenos neurobiológicos (veja, por exemplo, RobiriKin (1992)). Detecqao de Características Como discutido na Sc^áo 4.9» os neurónios ocultos de um perceptron de múltiplas camadas trc i na- do com o algoritmo de retropropagafáo desempernam um papel crucial como detectores de carac- terísticas. Urna forma ¡novadora na qual esta propriedade importante do perccptron de múltiplas camadas podo ser explorada ó o seu uso como um replicador ou mapa de Ident idade (Rumclhart et al.» 1986h; Cottrel el al., 1 987), A Figura 4,23 ilustra como islo pode ser realizado para o caso de um perceptron de múltiplas camadas utilizando uma única camada oculta. A plañía da rede satis faz as seguíntes exigencias eslroturáis, como ilustrado na Fig. 4.23b: • As camadas de entrada e de saída tcm o mesmo tamanho, zn. « O tamanho da camada oculta» .1/» c menor que m. * A rede é totalmenle conectada. Um dado padrúo, x, é aplicada simultáneamente á camada de entrada como o estimulo e á camada de saida como a respnsta desejada. Prctendc-se que a resposta real da camada de saida, x, seja uma 'estimativa** de x, A rede é tremada usando-se o algoritmo de refropropagai;Jo na forma usual» com o vetor erro estima:ivo (x - x) tratado como o sinal de erro, como ilustrado na Fig. 4,23b, O Ireina- mento é realizado de unía man eirá níto^upervlsioitada (i.e., sem a necessidade de um profesor). Em v iñude da estrutura especial incorporada no projeto do perccptron de múltiplas camadas, a rede c abrigada a realizar o mapeamentü de identidade através da sua camada oculta. Uma ver sao codi- ficada do padrao de entrada, representada por s, ó produzida na saida da camada oculta, como representado na Fig. 4.23a. Na verdade, o perceptron de múltiplas camadas total mente tremado desempenha o papel de um “codificador". Para reconstruir uma estimativa X do vetor de entrada original x {i.e., realizar a decfydificasdd'}, aplicamos o sinal codificado ;i camada oculta da rede replicadora, como ilustrado na Fig. 4.23c. Na verdade, esta úl:ima rede desempenha o papel de um “dccoditiuador". Quanto menor Por fui tu o tamanho Af da camada oculta comparado com o tamanho m da camada de entrada/sahla. mais efetiva será a configurado da Fig. 4.23a como um sistema de cumpressdo de dados. - Aproximaban de Fun^ao Um perccptron de múltiplas camadas tremado com o algoritmo de rttropropagaqáo- se manifcsta como um evtfxrt'nrcr uninfimfo signtóide^ escrito na seguíate forma compacta para o caso de mna única saida: (4 113) onde <p(*) é uina futifáo de atívaQáo sigmóide enmuro, é o peso sináptico do neurónio Jt na última camada oculta para o único iteuróiúo de saída o, c assiffl por diantc para os outros pesos sinápticos, e ,v, ó o t-ési mo elemento do vetor de entrada x. O vetar de peso w representa o conjunto inteiro de pesos sinápticos ordenadas por camada, por neurónios cm uma camada e, entáo. por sinapses em um neurónio. O esquema tic fun^óes nao-.incares aninhadas de&crilo n* F.q. (4,1 |J) ¿ Copyright Cu rusten al
Hidden page
Hidden page
Robustez No Capitulo 3, resaltamos que o algoritmo LMS c robusto no sentido de que perturbadles com pequeña energía podem causar apenas erras estimativos pequeños. Seo modelo de observacao subjaccnte é linear, o algoritmo LMS é um filtro ff~ -óiimn (Hassibi et al., 1993. 1996). Islo significa que o algoritmo LMS minimiza o guabo máximo de energía das perturbadles dos erres estimat¡vos. Por outro lado, se o modelo subjacente foroto-linear, Hassibi c Küilalh (1995) mostraram que o algoritmo de retropropaga^ao é um filtro [ocalmente H~ -ólimo. O termo “local11 usado aqui significa que o valor inicial do vetor de peso usado no algoritmo de rctropropagapáo está suficiente- mente próximo do valor ótimo do veior de peso w*, de modo a asegurar que o algoritmo nao fique preso cm um mínimo local pobre. Em termos conccituais, é bom saber que o algoritmo LMS e o algoritmo por rctropropaga^áo pcrtcnccm á mesma elasse de filtros H" 'étimos. Convergencia ü algoritmo de reiropropagafáo usa urna “estimativa instantánea11 para o gradiente da superficie de erro no espado de pesos. O algoritmo c, portante, de natureza estocástiar, isto é, tem lendéncia a ziguezaguear cm lomo da verdadeira dirc^áo que leva a um mínimo na superficie de erro. De lato, a aprendizagem por rctropropaga^ao c uma api ¡cacao de um método estati stico couhecido como aproximafáo esfocá-itica que foi originalmente proposito por Robbíns e Monto (1951). Conscqücn- temente, lende a convergir lenta mente. Podemos Identificar duas causas fundamentáis para esta proprtedade (Jacobs, 1998): L A superficie de erro é razoavelmente plana ao longo de uma dimensáo do peso, o que significa que a derivada da superficie de erro em rclacáo áquele peso c pequeña cm magnitude. Nesia situado, o ajuste aplicado ao peso é pequeño, e conscquentemenle podem ser noccssárias muí- tas itera^oes do algoritmo para produzir uma redujo significativa do índice de desempenho da rede cm relamió ao erro. Alternativamente, a superficie de erro c muito curva ao longo de uma dimensáo do peso; neste caso, a derivada da superficie de erro em relajo ao peso é grande cm magnitude. Ncsta segunda situadlo, o ajuste aplicado ao peso c grande, o que pode levar o algoritmo a exceder o mínimo da superficie de erro 2. A dirc^áo do vetor gradiente negativo (i.c., a derivada negáis a da funche de cusEo em rela^áo ao vetor de pesos) pode náo apontar para o mínimo da superficie de erro: com isso^ os ajustes aplicados aos pesos podem induzir o algoritmo a se mover na dire^áo errada. Conseqüenremenie, a taxa de convergencia na aprendí¿ágem por retropropagacao leudo a ser relati- vamente baixa, o que, por sua vez, pode tornar o algoritmo martirízame do ponto de vista computacional. De acordó com o esludo empírico de Saarincn ct aL (1992), as tasas locáis de convergencia do algoritmo de retropropaga^áo sao /j7tedr,£,.r, o que é justificado pelo argumento que a matrizjacobiana é quase deficiente em posto, assim como a matriz hessiana. Eslas sao conseqüén- cias da natureza intrínsecamente mal-condicionada dos problemas de treinamento de redes neurais. Saarinen et al. interpretara as taxas locáis lineares de convergencia da aprendizagem por retropropaga^áo de duas manearas: * Fsta é uma reivindicacao do algoritmo de retropropaga^to (dcscida do gradiente), no sentido de que métodos do ordem mais alia podem náo convergir muito mais rápidamente enquanto que exigem maior esforzó computacional; ou
• Os problemas de tnrinamento de redes neutíiis em grande escala sao tac irjercntcmmrc di ficéis que ñau existe luna estrategia de aprendí zagem que seja realiza ve], podendo ser ncccssárias outras abordagens como o uso de pré-prncessamento. Exploramos mais profundamente esta questáo da convergencia na Se^o 4.17 e exploramos a ques- táo do prc-proccssamcnto das entradas no Capitulo 8- Minintos Locáis Uma outra peculiaridad^ da superficie de erro que causa impacto sobre o desempenho do algoritmo de retropropagacao c a presenta de mínimos locáis (i.e., vales i so lados), adicionalmente aos míni- mos globais. Como a aprendizagem por retropropagafáo é básicamente uma técnica de “escalada de colina*, ela core o risco de ílcar presa em um mínimo local, onde toda pequeña varia^áo dos pesos sinápticos causa aumento da fun^áo de custo. Entretanto, cm algum outro Lugar do espado de pesos, existe um outro conjunto de pesos sinápticos para o qual a fun£áo de custo ¿ menor que o mínimo local no qual a rede se encentra presa. E evidentemente indeseiável que o processo de treinamento termine em um mínimo local, especialmente se ele estiver muito distante do mínimo global A questáo dos mínimos locáis na aprendizagem por retropropaga<;áo foi levantada no epílogo da cdiQáo es tendida do clássico livro de Minsky c Papcrt (1988), onde a maior parte da atcn^áo está concentrada em urna discussao do livro em deis volumes, fiarullet Díslriba^d /’wceffjOijf, de Rumcihart c McClelland (1986), No Capítulo 8 dcstc último livro, afirma-se que fícar preso em um mínimo local raramente é um problema prático para a aprendizagem porretropropaga^o. Minsky c Papen opóem-se a isiu. sal ientando que toda a hiatória de reconheci mentó de padróes moslra o contrario. Gori e Tes i (1992) descrevem um ejemplo simples onde, embora um conjunto de padróes nao lincarmcntc separáveis pudesse ser aprendido por uma rede com uma única camada oculta, o algor!mío de retropropa&acáo pode ficar preso em um mínimo local.11 Escalamento A principio, os perceptron s de múltiplas camadas [reinados com o algoritmo de rctropropaga^ao lem o potencial para agí tem como máquinas computacionais univenaís. Entretanto, para que este potencial scja totalmente aprovcitado, tomos que superar opmhlema ¿teL^eülíintertlf!, que aborda a questáo dequáo bem a rede se comporta (p.ex., medido pelo lempo necessário para o treinamento ou pelo melhor desempenho de generalizarán alean^ável) quando a tarefa computacional aumenta em tamanho e rompí ex idade. Entre as mu ¡tas manciras possívcis de se medir o tamanho ou acom- ploxidado de uma tarefa computacional, a ordem de predicado, definida por Minsky e Paper! (1969, 1988) fomece a medida mais úül e importante. Para esclarecemos o que queremos dlzer por um predicado, considero que ^(A) represente uma fun^áo que pode assumir apenas duis valores. Norma!tríenle, consideramos os dois valore;; como sendo 0 c I. Mas, considerando os valores como sendo FALSO ou VERDADEIRO, podemos pensar em <b(A) como um preíticada^ ísio é. uma declarado variavcl cuja falsidade ou verdade depende da escolha do argumento X. Podemos escreverk por exemplo, [1 ^CMCUL&í^l q se a figura X for um circulo se a figura X náo for um circulo (4.115)
Usando a úléia de utn predicado, Tesauro e Janssens (1938) realizaran um cstudo empírico envotvendo o uso de um perceptron de múltiplas camadas tremado com o algoritmo de relropropagpp&o para aprender a calcular a funcáo de parídade. A fun^ao deparídadeéum predicado booleano definido por *4* r a h.iMM se | áf | é um número impar caso contrario (4,1 J6) e cuja crdem é igual ao número de entradas. Os experimentos realizados por Tesauro e Jansscns parecem mostrar que o tempo necessário para a rede aprender a calcular a fungia de parldade aumentó exponencúilmenle com o número de entradas 1 i.c., a ordem do predicado da computarse), e que proje^Ces sobre o uso do algoritmo de rctropropagacao para aprender fun^oes complicadas arbitrárias podem ser excesivamente oti mistas. Existe a concordancia generalizada de que é dcsaccnsclhávcl para um perceptron de múltiplas camadas ser totalmente conectado. Neste contexto, podemos levantar a seguíate questáo: dado que um perceptron de múltiplas camadas nao deve ser totalmente conectada, como devem ser alocadas as ccncxócs sinópticas da rede? Esta questao nao c importante no caso de aplícales em pequeña escala, mas é certamente crucial para o sucesso da api i cacao da aprendizagem por repopropaga^ao para resolver problemas em grande escala, do mundo real. Um método efetívo de aliviar o problema do escalamento é desenvolver a compreensiio do problema (possivdmente através de analogía ncurobiológica) c usá-la para inserir engenhosidade no prqjeto arquitetura! do perceptron de múltiplas camadas. Específicamente, a arquitetura da rede c as restriñes impostas aos pesos sinápticos da rede devem ser concebidas de modo a Incorporar informacito previa sobre a tarefa durante a constituido da rede. Esta estrategia de proj etc é ilustrada na Se^ao 4.19 para o problema do reconhecirnento de um caractere ótico. 4,17 ACELERA^ÁO DA CONVE RGÉN CIA DA APRENDIZAGEM POR RETROPROPAGAQÁO Na se^Bo anterior, identificamos as principáis causas para a possível taxa lenta de convergencia do algoritmo de retropropaga^So, Nesta se^áo, descrecemos algunas Aewítffaos que fomecem nor- mas úteis para se pensar cm como acelerar a convcrgcncii da aprendizagem per rctropropagacáo através da adaptólo da taxa de aprendizagem. Os detal bes das heurísticas sao os segu intes (Jacobs, 1988}: heurística i. Cada parámetro niu^tável da funcáo de custo da rede deve ter scu parámetro individual da taxa de aprendizagem. Notamos aquí que o algoritmo de rctropropagacúo pode ser lento para convergir porque o uso de um parámetro fixo de taxa de aprendizagem pode náo ser adequado em todas as regióes da superficie de erro. Em outras palavras. um parámetro de taxa de aprendizagem apropriadü para o ajuste de um determinado peso sináptico náo é necessariamente apropriado para o ajuste de outros pesos sinápticos da rede. A heurística I rcconhccc este Tato atrihuindo um parámetro de taxa de aprendizagem diferente para cada peso sináptico (parámetro) ujustávcl da rede. HEURÍSTICA 2. Cada parametro da laxa de aprendizagem deve poder variar de uma iterafáo para a seguinte.
A superficie de erra n[Ticamente se comporta de Forma diferente ao longo de diferentes regióos de uma única dimensao de peso. Para seguir esta variaban, a heurística 2 afirma que o parámetro de taxa de aprendizagem neceas i La variar de itera^sopam iterado I interessante notar que esta heurística está bcm-íundamenladíi no caso de unidades linearas (Luo, 1991). HEURÍSTICA 3. Quando a derivada da ÍUDfiD de CuStO em rtíatáo <ió peso Sináptico tem O mes- mo sinal algébrico para iterares consecutivas do algoritmo, o parámetro da taxa de aprendizagem para aquele peso particular deve ser aumentado. O ponto de operacao corrunle no espado dr peso pode se encontrar cm uma peruáo relativa- mente plana da superficie de erro ao longo de urna dimensáo de peso particular. Por sua vez, i$to pode ser responsável por fazer com que a derivada da fúncáo de cusco (i.c,, o gradiente da superficie de erro) cm rclacáo ao peso, mantenha o mesinu sinal algébrico e, assim, aponte na mesma tkrecao, para varias iteraQóes consecutivas do algoritmo. A heurística 3 afirma que, nesla situa^ao, o número de iterares necesarias pan atravessar a pon^o plana da superficie de erro pode ser reduzida aumentando-se adequadamente o parámetro da laxa de aprendizagem. HEURISTICA 4. Quando o smal algébrico da derivada da fun^ao decusto em relajo ,i um peso sináptico particular alternarse para varias itera^des consecutivas do algoritmo, o parámetro da taxa de aprendizagem para aquele peso deve ser n duzido. Quando o ponto de operado córrante no espado de pesos se encontra em uma por^áo da superficie de erro ao longo de uma dimensáo de peso do interesse que exibe picos e vales (i.e., a superficie é muito curva), entáo é possfvel que a dentada da funffto de cusid em relajo aquek peso mude o seu sinal algébrico de uma iterado para a seguinte. Para evitar que o ajuste de peso oscile, a heurística 4 afirma que o parámetro da taxa de aprendizagem para aquelc peso particular deve ser reduzido adequadamenle. Note que o uso de um parámetro da laxa de aprendizagem diferente para cada peso sináptico e variável no tempo de acordo com estas heurísticas modifica fundamentalmente o algoritmo de relropropaga^lo. Especifica mente, o algoritmo modificado nlo realiza mais uma busca por dcscida mais íngreme Fm vez disso, os ajustes aplicados aos pesos sinópticos sao bascados (l) ñas deriva- das parciuis da superficie de triTO Cm ida^&D aos pesos e (2) em cSiimativas das curvaturas da superficie de erro no ponto de operacao coirente no espado de pesos ao longo das varias dimerisdes dos pesos. Alcm distas quatro heurísticas satisfazem a restribo de local i dade, que é uma caraclerislica inerente da aprendizagem por retropropaga^áo. Infelizmente, a adcrencta á restricáo de locaiidadt limita o dominio da ut: Iidade dcstas hcurísi ¡cas porque existem superficies de erro para as quais cías nao fuiicionam. Apesar disso, as modificadles do algorílmo de relrOpropagacáo de acondo com estas heurisücas tém valor prácico.4 4.18 APRENDIZAGEM SUPERVISION ADA VISTA COMO UM PROBLEMA DE OTIMIZAQÁO Nesta se^áo. adolamos um ponto de vista sobre aprendizagem supervisionada que é bem diferente daquele seguido ñas se^des anteriores do capítulo. Específicamente, vemos o iTcinamenic supervi- sionado de um pcrccptron de múltiplas camadas como um problema de atímiza^nitmé/ica. Neste
Hidden page
ordem c de ordem mais alia na Eq. (4.1l7) sáo zero), o método de Newton converge para a soluto clima cm urna iterado. Entretanto, a aplka^fio práuca do método de Newton para o treinamento superv is lo nado de um perceptron de múltiplas camadas ó prcjudicada pelos seguí ntcs tatures: • Requer o cálculo da matriz hessiana inversa o 4UC pode ser computad analmente cus- toso. * Para ser computável, EI(ji) deve ser nác-singuiar. No caso em que H(n) é definida positiva mente» a superficie de erro cm tomo do ponto concnte w(/r) é descrita por uma “do pressao convexa11. Infelizmente, nao há garantía de que a matriz hessiana da superficie de erro de um perceptron de múltiplas camadas sempre se enquadre nesia describan. Além disso, há o problema potencial de a matriz hessiana ser dcÍLu.entc cm posto (i.e., nem todas as coiunas de II sao lincarmentc independentes). o que resulta da natureza intrínsecamente mal-condiciona- da dos problemas de treinamento de redes neurais (Saarinen ct al., 1992}; isto &ó toma mais difícil a tarefa computad onal. • Quando a fun^áo de custo ¿ nao-quadrática, nao há garanda para a convergencia do método de Ncwton, oque o toma inadequado para o treinamento de um perccptron de múlti- plas camadas. Para superarrnos algunas destas difi cuidados, podemos usar um nu-iodo quw&Wewftm. que requer apenas unta estimativa do vetor gradiente g. Fsta modi licaijáo do método de Ncwton man té m uma estimativa definí da positivamente da matriz inversa H1 di ratamente, sem invcrsac matricial. Usan- do esta estimativa, assegura-se que um método quase Newton percorre descendentemente a super- ficie de erro. Entretanto, aínda temos urna complcxidade computacional que é (X onde Wé o tamanho do vetor peso w. Os métodos quasc Newton sao, portanto, impraúcáveis. execro para o treinamento de redes ncurais em escala muito pequeña. Uma descrifáo de métodos quasc Ncwton c ^presentada mais adianto nesta scQáo. Uma outra classe de métodos de otiniizadlo de segunda ordem incito o método do gradiente conjugado, que pode ser visto como sendo intermediario, entre o método da dése i da mais íngreme e o método de Ncwton. O uso do método do gradiente conmgado é motivado pelo desojo de acelerar a taxa de convergencia típicamente lenta experimentada com o método da desoída mais íngreme. enquanto que evita as exigencias compulacionais associadas com o cálculo, armazenamento c in- versad da matriz hessiana, no método de Newton. Entre os métodos de otim i za^áu de segunda ordeno, ó aun píamente reconhecido que o método do gradiente conjugado tal vez seja o único método que é aplicávcl a problemas de grande escala, isto é. problemas com centenas ou mí 111 a res de parámetros ajuslávcis (Flctchcr, 1987). Podanto, é bastante adequado para o treinamento de pcrceptr&ns de múltiplas camadas, com aplkitc^ típicas que incluem aproximitcáu de lunqucs, controle eaoálisc de series temporals fi.c., rcgrcssáo). Método do Gradiente Conjugado O método do grad ante conjugado pertence a classedos métodos de oliiiuza(5o de segunda ürdem, conhecidos culeiivamcntc ccrnu rnérodav de dife^ñt) efritjugcfíla. Cometamos a discussflo dcstcs métodos considerando a rTiminiizafSo dA./foipcw qiwdmtica /(xJsix^Ax-b'i + í (4.122}
onde i é um vetor de parámetros JF-por-l, A é uma matriz JT-por-W" sí métrica, definida positivamen- te, b é um vetor FKpor-1 e c é um escalar A mininniza^n da fun^ao quadráticajfx) é alcanzada atribuindc-sc a i o valor único ** - A’b (4.123) Com isso, mimtDizerJU)e resolver o sistema de equa^es lineares Ax* - b sáo problemas equivalentes. Dada a matriz A, dizemos que um conjunto de velones nfo-nuk» 1(0), s( IV-, s^-l) é um wnju- gadú de A (i.e., náo interferem entre si no contexto da matriz A) se a seguirte condiíte for satis leí la; sr(ff)As(/) “ 0 pata lodo n e / tal que n^J (4.124) Se A for igual á matriz ¡dcntidadc, a conjiuga^ac c equivalente á no^So usual de crtogonalidadc. EXEMPLO 4.1 Para uma interpretante de vetores conjugados de A, considere a situa^ao descrita na Fig. 4.24a, relativa a um problema tridimensional. A locaLizafte elíptica mostrada nesta figura corresponde ao gráfico da Eq. (4. i22) para * = iw para um valor consiente atribuido :i turóte quadratica/(i). A Figura 4.24» incluí também um par de vetores de direfte que ste conjugados em reíante á matriz A. Suponha que definimos um novo vetor de parámetros v relacionado a * pela transformante v« A“x onde A"44 a raizquadrada de A. Enlte, a localizante elíptica da Fig. 4.24a c transformada em uma localizante circular, como mostrado na Fig. 4.24b. Correspondenteinente, o par de vetores de direqte conjugados de A na Fig. 4.24a é transformado cm um par de vetares de dire^te urtogonais na Fig. 4 .24b. FIGURA 4.24 Interprelataa de vetores conjugad» de A. (a) LúcatizafAO elíptica na aspado de* pesos tridimensional, (b)Transfor- madlo du tocallzaote elíptica em urna localkafte circuiar
Unía i m portante pnopricdade das vetares conjugados de A é que des san linearmente indepen- denles. Pro vamos esta propriedade por contradif’ao. Considere que um desses vetores, digamos síD), seja expressa como uma combinacáo linear dos JF-l vetares restantes, como segué; ii-1 s(0) = £ j-i Multiplicar por A o cntáo efetuar o produto interno de As(0) com s(0) resulta s' (O)As(O) = X asT(0)Ai(j) = 0 7-1 Entretanto, c impossível para a forma quadratica sr(0)As(U) ser zcro por duas razSes: a matriz A é definida positivamente por pressuposi^áo, e o vetor s(0) é náo-nulo purdefim^áo. Com isso, segué que os vetores conjugados de A sí Isf/F-1) n5o podem ser bnearmenie dependentes; isto c, devem ser I (reármente indcpcndcntcs. Para um dado conjunto de vetores conjugados de A fi(0), s( Is( IV— I )t o método da dire^So wnjifgadíi conv.ipondtínte para minimizadlo irrestritada fun^So de erro quadrática/lx) é definido por (Lueribcrger, 1973; Flctcher, 1987; Bcrtsckas, 1995) zfti + l) = xOO+Tl("Mnh n-0, I.......tfP-l (4 125) onde i(C) é um vetor inicial arbi Erario c q(rt) c um escalar definido por /(ih} + n(«Xrt)) - mjn /(i( ir)+n s( jt) ) (4.126 J O proccdimcnto para cscolha de r¡ de forma a minimizar a fun£áo/{x(fl) + T|s(zf]) Para um n referido como urna busca em linha, que représenla um problema de minimizare unidimensional. Com base ñas Eqs. (4.124), (4.125) c (4.126), podemos agora fazer algumas observares: 1. Como os vetores conjugados de A s(0}, s( ]),..., s( íí-1} sao knearmente iindependenfes, eles tbrmam urna base que cobre o espado vetorial de w. 2, A equaijáo de atualizaglo (4-125) e a minimizarán linear da Eq, (4.126) levam a mesma fórmu- la para o parámetro da taxa de aprendizagem, isto é, Tlí’it = » = 0.1...fr-l (4.12?) S (ji)As(h} onde «00 é o em definido por C(rt)= I(ff)-x* (4.12K) Comeando de um ponto arbiirário z{0), o método da dire^áo conjugada garante encontrar a solucáo ótiina x* da cqua^áo quadrática/(x) ~ 0 no máximo em IFitera^ücs. A principal prnpriedadedo método da direito conjugada ¿descrita como (Luenberger, 1984; Fletcher, 1987; Bcrtsckas, 1995): Em iteracüts suctsHÍvas, o método da direcáo otrn]ligada minimiza a tunero quadrática sobre um espado vetorial linear progrcssivamenle em expansáo. queevenluahnctitc incluí o mínimo local de/lX).
PERCEFTAObS DE MÚLTIPLAS CAMADAS 265 Em particular, para cada iterado tí, o vetor iterativo x(n + !} minimiza a funfáo Xx) sobre um espado vetorial linear que passa através de uní panto arbitrario x(0) e é coberto pelos vetores conjugados de A s(C), sí t(ff), Como mostrado por t(ji +1) — argnún f(i) onde 3¡r í definido por 9. -1 =><oj * ¿nüW) l /-o (4.129) (4.130) Para o método da dire^ao do conjugado funcionar, é necessária adispanibilidade de um conjunto de vetores conjugados de A síO), s(l),..., s( W-1). Em uma forma especial deste método, conhecida corno método do gradiente conjugado,'^ os vetores de dire^áo sucessivos sáo gerados como versfles conjugadas de A dos vetores de gradiente sucessivos da futido quadráticaXx), conforme o método avanza, vindo dai O nome do método- Assim, excelo para n = D, O conjunto de vetares da dire^ao (í(n)) nao é especificado previamente, sendo determinado de forma scqücncijil nOfi pASscs sucessi- vos do método Definimos o residual como a dire^áo descendente mais ingreme: rffl}-=b-Ai(fl} (4.131) Ent&o, para prosseguirmos, usamos uma combinacao linear de f(ji) c s(rr — I), como mostrado por sU) - Krt)4 - l). «= 1,2,- ., H^-l (4.132) onde pírf) é um fatorde escala a ser determinado. Multiplicando esla equA^So por A, efetuando o produto intemo da expressáo resultante com 5(»- l)( invocando a pmpnedadedos vetores de dirc^ao do conjugado de A e entáo resolvendo a expressao resultante para (i(w), oblemos , sr(fl-l)Ar(ff) Ph)=- r, / / ' (4,133) s (n - l)As(n- I) Usando as Eqs. (4.132) e (4.133), constatamos que os vetores s(0), s(l),.,., s(H—1) assim gerados sao de fato conjugados de A. A gerap&o dos vetares de direí3o de acardo com a cquaf áo recursíva (4.132) depende do coeficiente 000- A formula da Eq. (4.133) para calcular p(w j. como está atualmente escrita, requer o conhceimcnto da matriz A. PorrazOes compuiacionais, seria desejávcl calcular fX^) sem o conhc- cimento explícito de A, Este cálculo pode ser obtido usándole uma das duas fórmulas seguí otes (Fletcher, 1987): I. fórmuta de ñriakdlibiérg, para a qual é definido por rtn )) (41M) r («- l)rvt-1) 2. Formula de Ftelcfter-Reeves, para a qual f){n} é definido por
Pí«)=- rr(« - l)r(/t ]) (4.135) Para usarmos o método do gradiente conjugado para atacar a mi! imnii/a^o irreslríia da funféo de cuito % i*1). relativa ao tn.-:namento supervisíonado de perceptrons de múltiplas camadas, faje- mos duas coisas: • Aproximamos a fiioffio de custé ’S^w) por uma funcáo quadrática. Isto éh os termos de terceira ordem e de ordem mais alta na Eq. (4.11 7) sáo inorados. o que significa que estamos operando próximos a um mínimo local da superficie de erro. Assim, comparando as Eqs. (4.117) o (4 122), podemos fazer as associaedes indicadas na Tabela 4.7. TABELA 4,7 Corrospondéncia entre í(k) o '^(w) Funcáo <iund ral ica/C j¡ j Futifáci de cuMc íímcd{’*l Vetor de pubmetn» i(fl) Vfetnr gradiente i)/\i rTlx Malríz A Vplor pcw sináptico w(n) Velar ^radienle- g “ íT# . áw Matriz btttfanL H • Formulamos a computado dos coeficientes fl(rf) e H(rt) no algoritmo do gradiente conjugado de modo a ncccssirar apenas da informapao do grádente. O último ponto é particularmente importante no contexto de perceptrons de múltiplas camadas, porque evita o uso da matriz hessiana H(n), cujo cálculo envolve dificuldades computan ionais. Para calcularlos o coeficiente 3(«) que determina a dire^ao de busca s(n) sem conhecimento explícito da matriz hessiana H(h}, podemos usar a formula de Polak-Ribicrc da Eq. (4.134) ou a fórmula de Flctehcr-Rccvcs da Eq. (4.135). Ambas as fórmulas envolvem apenas o uso de residuais. Na forma linear do método do gradiente conjugado, assumindo uma fun^áo quadrática, as fórmulas de Polak-Ribitn: e de Fletcher-Reeves sio equivalentes. Por outro lado, no caso de uma fungió de custo náo-quadrática, cías nao sao mais equivalentes. Para problemas de ntimizagÍQ náo-quadráticos, & forma de Polak-Kibiére do algoritmo do gradiente conjugado ó típicamente superior á forma de Fletcher-Reeves desle algoritmo, para o que damos a seguinte explicado heurística (Bertsekas. 1995). Devido á presenta de termas de tcrccira. ordem o de ordem m;ds alta na fun^no de custo ^w) c a possi veis iinpmc isoes na busca em linha, a conjugado das diretes de busca geradas é perdida progressivamenlc. Por sua vez, isto pode causar a tLobstrucáo“ do algoritmo, no sentido de que o vetor de dire^áo gerado SÍ/lj é aproximada- mente ortogonal ao residual í(n). Quando este fenómeno ocorrc, temos que r(rt) = r{>r — 1), e ueste caso o escalar j3(«) «rt aproximadamente zero. Corresponden!emente, o vetor de direpac s(n) será próximo a r(/r), destazando a$Mim a obstruyan. DilcnrnLcracntc, quando a fórmula de Fletcher-Reeves é usada, o algoritmo do gradiente conjugado típicamente continua obstruido sob condi pocs simila- res. Em casos raros, entretanto, o método de Polak-Ribicrc pode rodar i ndefi ni llámente sem con- vergir. Felizmente, a convergencia do método de Polak-Ribiére pode ser assegurada escolhcndo-sc (Shcwchuk, 1994)
0*= roaxip^Q! (4.B6) onde 0HK é o valor definido pela formula de Polak-Rihiiire da Eq, (4.134). Usar o valor de [J definido na Eq. (4.136) c equivalente a recomcqar o algoritmo do gradiente conjugado se 0PR. < 0. Reeomcfar o algoritmo ¿ equivalente a esquecer a úllmna direvio de busca e combar novamente na direfao da deseida mais íngreme (Shewchuk, 1994), Considero a seguir a quesiao do cálculo de ¡1(4), que determina a laxa de aprendizagem do algoritmo do gradiente conjugado. Como no caso de p(fl), o método prcfcrívcl para calcular ó aquele que evita utilizar a matriz hessiana Lcmbramos aqi; i que a minimiza^áo linear bascada na Eq. (4.126) leva á mesma fórmula pam t|(fl) como aquela derivada da cquaq^o de atualizagio (4.125). Perianto, precisamos de uma ftusca em finita,14 cojo propósito ó minimizar a fundan ,(w - t)s) em rela^ao a p. Isto é, dados valores tixes dos velares w e s, o problema c variar r| de l'orma a minimizar esta fun^ao. Conforme q varia, o argumente w > qs traqa uma linha no espado vetorial de dimensio W de w. por isso o nomo "busca cm Linha". Um aigarittno de busca em finita c um procedí mentó iterativo quegera uma scqüéneia de estimativas {r(/j)) para cada iterado do algoritmo do gradiente conjugado. A busca em linha leonina quando uma solucáo satisfatóra ó encontrada. Deve ser realizada urna busca em linha ao longo de cada directo de busca. Varios algoritmos de busca cm linha fontm propostos na literatura, eé importante se fazer unta boa escolta porque ele tem um impacto profundo sobre o desempenho do algoritmo do gradiente conjugado no qual está inserido, Qualquer algoritmo de tasca cm linha opera cm duas fases (FIctchcr, 1987): • Fase de segmenfaído, que procura por lint ftgffirtuto, isto é. um intervalo nfc-trivial que con- tení um mínimo. * Fase de xetionamento, na qual o segmento é secfcmodo (i.e., dividido), gerando assim uma seqüéncia de segmentos cujo comprimento ó progresivamente reduzido. Descrevemos agora um procedimenío de afuste de curva que considera estas duas fases de uma forma direta. Considere que :áBiiil(ri) represente a fum;áo de cusco do perceptron de múltiplas camadas, ex- presa como uma funcáo de 1^. Assumt>se que ,(1)) seja cstrilamcnte tutimodai (í.c., tem um único míni mo na vízinhan^a do ponto torrente w(jt)} e é duas vezes continuamente diferenciávet. Iniciamos o procedimcnki de busca procurando ao lotign da linha alé enconirarmos ote pontos T|r q . e rL tal que a seguirte cóndilo seja sarisfci'js: *,Jn । >s - s_A) p«» ti . < nj < n, <4137) como ilustrado na Fig. 4,25. Como '£ i% ¡q) c uma funcáo continua de r|, a escolta descrita na Eq. (4.137) assegura que o segmento [q , q.] contení uin mínimo da funcáo (Ti). Desde que a fun^n ^mnl(ri) suficientemente suave, podemos considerar que esta funqfto seja parabólica na v¡z¡- nhanca :i medí ata do mínimo. CorrespondcnlcmenLc, podemos utilizar a inlcrpota^díi parabólica inversa para realizar o secionainento (Press et al., 1988), Especifeamente, uma funqáo parabólica é ajustada atravea dos tres pontos origináisnrn,cn-,.como i lustrado na Fig. 4.26, onde a linha sólida corresponde a míd(r|) ® a linha tracejada corresponde á primeira iterado do proccdimcnto de secíonamento. Considere que o mínimo da parábola passando pelos tres pomos T| , t| e n . seja representado por r|4. No exemplo ilustrado na Fig. 4.26, temos J ® ^nwdtni) ponto é substituido por na, faaendo com que (qp r| J seja o novo segmento. O proccs-
AGURA 4.26 llusUfifáo da busca em tinlia figura 4.26 Interpaia$ao parabólica inversa so é repetido construindo-se uma nova parábola através dos pontos i] p T| r e r^. O procedimento de segmenta¡;ao seguida de sccionamcnto, como ilustrado, é repelido varías veas ate que um ponto suficientemente próximo ao mínimo de seja localizado, quando enrao a busca em linha é terminada. 0 método de Brent Constituí uma versao mulo retinada do procedí mentó de ajuste de curva por tres pontos aquí descrito (Press et dL, 1988). Em qualquer estágio particular da computa^áo, o método de Bren! segue seis pontos da fui^aó ¥ „ ,(qj. que nSo necesariamente precisam ser todos distintos. Como anteriormente, tentarse aplicar a interpniacao parabólica através destes pontos. Para que a intcrpolaqáo scja acci[ávcl¡, corto criterio cnvolvcndo os tres pontos restantes deve ser salisfeilo. Obtém-se como resultado um algoritmo de busca em linha robusto. Resumo do Algoritmo do Gradiente Conjugado Nao-Linear I ndos os ingredientes de que necesitamos para dcscrcvcr formalmente a forma nao-linear (náo- quadratica) do algoritmo do gradiente conjugado para a aprendizagem supervisionada de um perceptron demúliiplas camadas están agora definidos. Um resumo do algoritmo é apresentado na Tabula 4.8.
TABELA 4.0 Resumo do Algoritmo do Gradiente Conjugado Nao-Linear para o Tre ¡ñame nto do um Perccptron de Múltiplas Camadas Inicializafao A menos qué esteja dispMível conhecimento pré1- to sobre u vetor peso w, escolha o valor inicial w(0] usando un procedimento similar ¿quele descrito para o algoritmo de retroprepaga^io. Coifípuía^ao I. Pura w(Ü), ose relrnpfupagaqso pare calcular o vetor grad ¡ente g(í J). 3. Faía^0)-H0)--g(0) 3. No ínstenle de tempo w, use uma busca cm linha para cnconlrar r|Ot) que minimiza suficientemente representando a tun^áo de custo exprese como uma fifflfiú de i] para valores ííxm de w ? x. 4. Teste para determinar M a norma cuc I ¡diana do residual n| ri) rain ahai xa de um valar cspec iíicada, isto é, uma fra^fto do valor inicial ||r( |. 5. Atualize a vetor pesa: w(rt + i) *</r} + h. Pare wfo + I ), use reiiftpnspag&fio para calcular d vetor gradiente alcalizado g(jr + i). 7. Faga rl'.1? + 1} = -g^rr + l). fl. Use a método de Polak-Ribiére para calcular p(n i i): |J(*i + I) = max- r'i'j 1 l)(Kn+ li_rrJ;}j () r\n)r(n) 9. Atualíze o vetor de d IrecSo: sín + n-rtfl i- L}+ (Krít DsW IO. Fa?a ft = tt + i e volte para o passo 3. Criíério de parada- Encerré o algoolmo quando a seguinte cundid for saiisíeíta! Hn¡>rjM <dlr(0)H onde e é um número pequeño pncdelcnninado. Métodos Ouase Newton Rjesumindo a discussáo sobre mélodús qliase Newton, constatemos que des s^o básicamente méto- dos de gradiente dése ritos pela equa^ao de atualiza^áo: w(w - 11 = w(rt) + r| (ff)s(r} onde o vetor de dirof ao s(r) ¿ definido cm termos do vclor gradiente g(/r) por s(ff)= -S(nlgíff) (4.1381 (4 139) A matriz S(jt) é urna matriz definida posilivamente que c ajustada de uma iteradlo para a seguinte. Isto é feite de modo que o vetor de directo s(n) aproxime a direfíio de Ne^rtoft, ou seja
> mciF * ' mnJ Os métodos quase-Neu'ton utilizam i n formado de segunda ordem (curvatura) acerca da su- perficie de erro, sem realmente requerer ccuihecimento da mati iz hessiana H. El es conseguem fazer isto utilizando dois vetores iterativos sucessivos wfri) e w(n + l}s juntamente ccun os respectivos vetares de gradiente g(n) e r(h । 1). Considere que q(w) = gpí + 1) - g(w) (4.140) c Aw(n) = w(tf + 1) w(jf) (4.141) Podemos entao derivar a infiorma^áo de curvatura usando a fórmula aproximada: q('í)“¡ “ (?(«}] Aw(n) l cJW J (4.142) Em particular, dado JFincrementos de peso linearmente independentes Aw(O). Aw( 1) Aw( W-1) e os respectivos incrementos de gradiente q(0), q( IX q( W'-l), podemos aproximar a matriz hessiana II como: H - [q(OX q( 1} q( WM)] [Aw(0), Aw( 1V-, Aw( W- 1)] (4.143) Podemes tambem aproximar a matriz hessiana inversa como; H 1 =* [Aw(0), Aw(l) Aw(F-4)] [q(0k q(l) qíFT-l)]-1 (4.144) Quando a funtjáo de custo 7 íw) c quadrática. as Eqs. (4.143) c (4.144) sáo exatas. Na classe mais popular de métodos quase Ne^ton, a matriz S(/r +1)6 obtida a partir do scu valor pné\ ¡o S(«) c dos vetores Aw(h) e q(w), utilizando a recursáo (hlelcher, 1987; Bertsekas, ]O9S>: X n - w»u AwQj)Awr(jr) S(n)q(/r)q'(j?)S(n) ' 1 -1 F + L J — ot " f + r r qf(n)q(n) q (n)S(?i)q(j?) + l5(w)[qr(íi)S('0Q(n)][v(n)vr(?;)¡ (4.145) onde . _ Aw(rf) S(n)q(jT) Awt(jí)Aw(hj) qJ’(d)S(n)q(jj) c i1 < ^(/r) £ l para todo n (4.146) (4J47) O algoritmo é iniciado com uma matriz definida positivamente arbitraria S(0). A forma particular do método quase Newton é paramelrizada de acordo com a definido de qO.'l, como indicado a Seguir (Flctohcr, 1987):
• Para “ O para todo fl, oblemos o fl/gw/fffffl ¿te Davldan Ficicher- PtrwcU (DFP>. que é históricamente o primeina algoritmo quase-Newtcm. • Para !^(n) = l para tódo n* oblemos o afgcN limo Bnmfen - Fietcher- Guliifarb—HifarifiQ, que é considerado a melhor torna de método quase-Ncwton, conhoctda atualmcnlc. Comparando entre os Métodos Qua se- Newto n e os Métodos do Gradiente Conjugado Concluimos esta breve di se tissáo dos melados quasC’Ncwton comparando-os Caín métodos do gra- diente conjugado, no contexto dos problemas de olimíza^So n<io-quadráticos (Bertsekas, 1995): • Tamo os métodos quasc-Ncwion como os métodos do gradiente conjugado evilam a neceas i- dade do se usar a matriz hessiana. Entretanto, os métodos qliase-Newton v3o um passo odiante gerando uma aproximado para a matriz hessiana inversa. Conespondentementci quando a busca em linha é precisa e estamos próximos de um mínimo local com uma hessiana definida positivamente, um método quase-Newton (ende a aproximar o método de Newtón. alcanzando com isso uma convergencia mais rápida do que seria pussível com o método do gradiente conjugado. • Os métodos quasc-Newton náo sáo táo sensiveís a precisilo no estáglo da busca cm linha da ntimizazáo quanto o método do gradiente conjligado. Os métodos quasc-Ncwton requervm armazenamento da matriz sl£m do cusió da mullí- plícafáo matriz-vetor associadn com a compulazáo do vclor de diic^ao s(fl). O resultado disso é que a complexidad^ computactonal dos métodos quase-Ncwlün é CJfH*), Diferentemente, a complcxidadc ccmputactonal do método do gradiente conjugado é (X^O- Assim. quando a dimensiln IF(i.e., a tamanho dn vetor peso w) c grande, os métodos do gradiente conjugado san preferiréis aos métodos quasc-Ne^tón em termos ccmputac ionais, É por causa destó último ponto que n uso de métodos quasc-Ncwton é rcstrilo, na pralica, ao projeto de redes neurais de pequeña escala. 4.19 REDES CONVQLUTIVAS Até este ponto, esti vemos preocupados com o projeto algorítmico de purceptrens de mullí pías ca- madas e com questücs relacionadas. Nesia se^áo. enfocamos a planta estrutural do perceptron de múltiplas camadas propiamente dita. Em particular, dcscrcvcmos uma elasse especial de pcTccptrons de múltiplas camadas conhccidas colctlvamcnlc como fvites ctmw/iííivas; a idéia por tras deslas rede» foi apresentada brevemente no Capitulo I. Uma rfftia cfinwiiulivii é um perceptron de múltiplas camadas projetada específicamente para rcconheccr formas bidimcnsiortaLs com um aleo grau de invari áncia quanto a iranslaz^o. esca lamento, inclinazáa e outra» formas de distcrqaa. Esta dificil tarefa é aprendida de uma forma supervisionada por meló de uma rede cuja estrutura incluí as seguintes formas de (LeCun e Bengio, 1995): 1, Extra^at) de características. Cada neu ron ¡o recebe -leus $ । nais de ent rada deum campo recep- local na camada anterior, O que o forQá a extra ir características loes is. Uma vez que uma earac-
terística seja extraída, sua local i zac 3o exata se toma menos importante desde que a sua posi^o em relajo a outras características seja aproximadamente preservada. 2, Mapeamento de camcterí.'iticQX. Cada camada computacional da rede c composta de múlti- plos mapas de características, sendo cada mapa de características na forma de um plano dentro do qual os neuronios individuáis estilo restritos a compartilhar o mesmo conjunto de pesos sinápticos. Esta segunda forma de restribo esirutural tem os seguíntes efeitos benéficos: • Invariáncia a d&iocam&tlo, introducida na operado de um mapa de características atreves do uso de ctMno/ufdü com um núcleo (terne!) de pequeño tamanho, seguido por uma fun^«¡o sigmóide (limitadora). • Redundo do número de parámetros ilvres, obtida através do uso de compariilhamento de pe- sos. 3. Subamostragem. Cada camada convolutiva é seguida por uma camada computacional que calcula a média local e realiza UTna.wfram¿MZrflg£ffl, raduzindo desta forma a resolupao do mapa de características. Esta opera^áo tcm o efeito de reduzir a sensibilidade da saída do mapa de caracterís- ticas cm rcld^ao a dcslocamentos e outras formas de distor^áo. O desenvolvimcjito de redes convolutivas, como descrito acima, tcm motivado neurobidógioa. com origen no trabalho pioneiro de Hubel c Wiesel (1962,1977) sobre scnsibil idade local c neurónios seletivos á orientado no córtex visual deum gato. Enfati zainos que lodos os pesos cm todas as camadas de uma rede convolutiva sao aprendidos por treinamento. Além disso, a rede aprende a extrair suas próprias características automáticamen- te. A Figura 4.27 mostra a planta arquitetura! por uma rede convolutiva constituida de uma cama- da de entrada, quatru camadas ocultas e uma camada de salda. Esta rede é projetada para realizar pmees.tamenro de ¡magas (p.cx., rcconhccimcnlo de caracteres manuscritos). A camada de entra- da, constituida de 28 x 28 nós senscriaís, recebe a imagem de diferentes caracteres que foram aproximadamente centrados c normalizados cm tamanho. Dcpois disso, as plantas eomputacfonais se altcmam entre convolu^áo e subamostragem, como aquí descrito: FIGURA 4.27 Rede canvctutiva pera o priwgggamefltu de ¡rnagem cama por exemplo, a rattOTtaCrnenlQ de caradoras «nanusentos. (Reproduitda com parmissáo da HIT Pro») • A primeini camada oculta realiza convoluqáo. Consiste de quatro mapas de características, com cada mapa conestí indo de 24 x 24 neurónios. A cada neurónio é atribuido um campo receptivo de tamanho 5 x 5.
* A segunda camada oculta reali za subamostragem e ca Lcula a méd ia local. Consiste tambem de quatro mapas de características, mas cada mapa c constituido agora de 12 x 12 neurónios. Cada neurónio tem um campo receptivo de tamanho 2 x 2, um coeficiente ticinávcl, um bias treinável e uma fun^áo de ativa^áo sigmóide. O coeficiente trchiável e o bias controlara o ponto de operado do neurónio; por exemplo. se o coeficiente c pequeño, o neurónio opera cm um modo quasc I incar. • A terueira camada oculta realiza uma segunda convelido. Consiste de 12 mapas de caracte- rísticas, com cada mapa consi'¡i indo de 8 X R neurónios. Cada neurónio nesta camada Oculta pode tcrccncxocs sináplicas com varios mapas de características da camada oculta anteceden- te. De resto. ela opera de forma similar a primeira camada convolutiva. • A quarta camada oculta realiza uma segunda subamostragem c cálculo da méd i a local. Con- siste de 12 mapas de características, mas cada mapa consiste de 4 x 4 neurónios. De resto, opera de forma similar á pn metra camada de subamostragem. A camada de saída realiza um cstágio final de convoluíáo. Consiste de 26 neurónios. sendo que a cada neurónio é atribuido um carácter de 26 caracteres possíveis. Como anteriormente, a cada neurónio c atribuido um campo receptivo de tamanho 4x4, Com lis camadas ccmputacionais sucessivas se alterando entre convolu^ao e subamostragem, obre* mos um efeito “bipiramidar. Isto é, em cada camada comolutiva ou de subamostragern^o número de mapas de características c aumentado, enquanto que a resolufáo espacial é reduzida quando comparada cora a camada antecedente. A idéia de convolufáo seguida de suhamostragem é inspira- da pela ntx;áo de células “simples" seguidas de células “complexas” que foi descrita pela primeira vez por Hubel c Wicscl (1962). O perceptron de múltiplas camada* descrito na Fig. 4.27 cerniera aproximadamente lüO.üOO conexoes sinaplicas, mas apenas cerca de 2600 parámetros livres. Esta draraái ica redujo do núme- ro de parámetros livres é oblida pelo uso de compartilhamcnto de pesos. A capacidade da máquina de aprendizagem (medida cm termos da dimensáo V-C) é. desta forma, reducida, o que por sua vez mel hora a sua hábil xlade de generaliza^áo (LeCun, 1989). O que c a inda mais notávcl é Que os ajustes dns parámetros livres sáo feitos a partir da forma estocástica (seqñencial) da aprendizagem por retroprüpagafáo. Um outro ponto importante c que o uso de compartíIhamento de pesos toma possível a implcmcntacáo da rede convolutiva de forma paralela. Esta éuma outra vantagem da rede con volitiva sobre um perceptron de múltiplas camadas totalmente conectado. A licáo a aprender da redeeonvolutiva da Fig. 4.27 tem dois aspectos. Primeiro, um perceptron de múltiplas camadas de tamanho mancjavcl c capaz de aprender um mapeamento náo-l inear com- plexo. de alta dimensional idade, tvatríHffittcio seu projeto alravésda incorporado de conheci mentó previo sobre ;i [arela consi deracLi. Segundo, os pesos sinápticos e ni veis de bias podem scr aprendí - dos circulando-se o algoritmo de retropropagaíáo através do conjunto de treinamento. 4.20 RESUMO E DISCUSSAO A aprendizagem por retropropaga^o emergíu como o algoritmo padraa para o treinamento de perceptrons de múltiplas camadas, com o qual outros algoritmos de aprendizagem sáo comparados. O algoritmo de retropropaga^áo deriva seu nome do Taio de que as derivadas parciais da funfác de custo (medida de desempenho) em rclafáo aos parámetros livres (pesos sinápticos c ni veis de bias) da rede sao determinados por retropropaga^áo dos sinais de erro (calculados pelos neurónios de saída) através da rede, camada por camada. Fazendo isso, ele resolved problema de acribui^áo de
crédito de uma forma muito elegante. A for^a computan i anal do algoritmo advém dos seus dois principáis atributos: • Utiliza um método foco/ para atuallzar os pesca sinópticos e niveis de bias do perceptron de múltiplas camadas. • F.mprega um método ejicicnre para calcular todas as derivadas parciais da lun^ao de custo cm relapso a estes parámetros livres. Para uma determinada época de dados de treinamento, o algoritmo de rctrepropaga^áo opera em um modo dentro dois modos possí veis: stqücnckil ou por lote. No modo scqücncial, os pesos sinópticos de todos os neurónios da rede sfo ajustados para cada padreo. Conseqüentemente, a estimativa do vetor gradiente da superficie de erro usado na computapao c de natureza cstocástica (al catón a), por isso o nome “retropropagafOo estocástica", que é também usado para denominar o modo scqücncial da aprendizagem por retreprepuga^áo. Por outro lado» no modo por lote, os ajus- tes de todos os pesos sinópticos e niveis de bias sao feitos para cada época, resultando que uma estimativa mais precisa do vetor gradiente ¿usada na computacac. Apcsar das suas desvantagens, a forma scqucncial (cstocástica) da aprendizagem por rctropropaga^áo é a mais frcqücntemcntc utili- zada para projetar redes neurais, particularmente em grandes problemas. Pitra alcanzar me Hieres resultados, é necessária uma sintonía cuidadosa do algoritmo. Os dcialhcs específicos envolvidos no prejslo de um perceptron de múltiplas camadas depen- de naturalmente da aplicado de interesse. Podemos, entretanto, fazer duas dlstinpoesi L Na Classificacáo de padrees cnvolvcndo padrees nao lincarmcntc separaveis, lodos os neurónios da rede sao nao-lineares. A náo-linearidade é ohiIda pelo uso de uma funche sigmóide, cujas duas formas típicamente utilizadas sao (a) a fúnpac logística, náo-s i métrica c (b) a fúnpáo tangente hiperbólica, anti-simétrica. Cada neurónio é respcmsável por producir um hiperphno particular no espado de decisóo. A través de um processo de aprendizagem superví donada, a combmacao dos hiperplanos formados por todos os neurónios da rede c ajustada iterativamente de modo a separaros padróes retirados de classes diferentes e náo vistos anteriormente, com o menor número de emos de clas^ificacáo, cm media. Para a classificaqao de padrees, □ algoritmo de rclrepropagacao cstccástico é o algoritmo malí; ampíamente utilizado para realizar o treinamento, particularmente em grandes problemas (p.ex., reoonhccimenlo de caracteres óticos). 2, Na regressáo I i near, o intervalo de saida do perceptron de mú If ¡pías ca m adas de ve ser su Pici en- temente grande para eonter os valores do processo; se esta infermacao nao esl i ver dispon ívcl, cntáo O mais razoável é a ultlizacáo de neurónios lineares. Como no caso dos algoritmos de aprendiza.- gem, I aremos as segu intes observables: • O modo seqüene iál (tstocáslico) da aprendizagem por rctrepropaga^áo c muiio mai s lento que o modo por lote. • O modo por lote da aprendizagem por retropropagaoao c mais lento que □ método do gradiente conjugado. Note, entretanto, que o último método pode apenas ser utilizado no mudo por lote. Concluimos esta diseuss^ü com algumas obscrvapccs fináis sobre medidas de desempenho. A deri- vafáo do algoritmo de rctropropagapáo apresentada neste capítulo está baseada na miniraizapao da ñinqáo de custo ., definida, de uma forma ou de outra, tumo a media sobre o conjunto de treiñá- menlo mteiro da soma de erros quadrados. A mais importante virtudc dcste critério é a sua genera- lidade c mancabilidadc matemática. Entretanto, cm muitas situares encontradas na prática, ni mu mazar a fun^áo de custo V corresponde a otim izar una quantidade iiitcrmodiária que nao é o
objetivo último do sistema e que, por isso, pode levar a um desempenha abaixo do ¿timo. Em sistemas comerciáis para o mercado de espitáis. por exemplú, o objetivo principa] do imestidor ou de um negociante c maxitnizar o retomo esperado com risco mínimo (Choey e Weigend, 1996; Moody e Wu, 1996J. A ra~an Sharpe ou nzzób de recómpensa pw vvfutilitkidtí como uma medida de desempenho do retomo ajustado a risco é intuitivamente unáis atraente que^^. NOTAS E REFERENCIAS 1. As fúmjóes sigmóides bSo chamadas assim porque seus gradeos apresentam a forma de Hs". Menon et al. (1996) apnesentam um escudo dcialhado de duas clanes de sigmóides: • &gnnWej .ijjnpfef, definidas como sendo tuneóos do uma variávd, impares* limitadas assiiitoticamcmc c completamente monótonas. • SriprtóÁíw Aj/xtÍu/ícím. representando um subconjunlo adequaiio de sigmóides sim- ples e uma generalizarán natural da tunQáo tangente hiperbólica. 2. Para o caso especial do algoritmo LMS, foi mostrado que o uso da constante de inomento a reduz o intervalo cstável do parámetro da taxa de aprendizagem q e pode levar á instabi Iidade se t| nao for ajusiado adecuadamente. ALéni disso, o desajuste aumenta com o aumente de a; para ddalhcs. veja Roy e Shynk (1991)). 3. Para uma deriva^-au do algoritmo de relropropagacáo incluindo a constante de momento nos scus principios básicos, vqa I logizara (1992). 4. Diz-se que um vetor *’ e um ojóróno foca! de urna fundió de entrada^saida F se cíe nao for pior que seus vízínAas, isto c. se existir um £ tal que (Bertsekas, 1995) F[w*) £ F(w) para todo «r com ||w - w* || < < Diz-se que o vetor w* ¿ um nrúuinv gfohtil da fundió F se ele n5o for pior que todos os outnos vetores; istoé, F(w*) < F[w) para todo w ti R" onde J? C a dimensáo de w. 5. A primcira dcscricáo documentada do uso de rtítropropagaclo para o cálculo eficiente do gradiente foi aprcscnladx por Warbos (1974). O material apresentado na Sepilo 4.1 Ü segué o tratamento dado em Saarinen et al. (i 992); uma discussao mais gcral deste tópico é xpresentada por Werbon (J 990). 6. Güiros aspectos do piojero de redes neurais que se benefic ¡am do conhecimento da matriz heuiana incluem (Bishop, 199 5): (1) A hessiana forma a base de um procedimiento para o retreinamente de um perceptron de múltiplas camadas após ter sido realizada uma pequeña mudanza nos dados de trei ñámente. (2) No contexto da apreiidizagem bayestaña, • a invmá da matriz hessiana pode ser usada para atribuir bandas de erro á predico nao-linear teita por uiha rede neural treinada, e • o( autovalores da matriz hessiuna podem ser usados para determinar valores adequa- dos para os parámetros de regularizadlo. 7, Bunr.ne e Weigcnd (1994) apresenlam uma revtsao sobre algoritmos exatOS e aproxima- dos para calculara matriz hessiana, com referencia particular ás redes ncuraig; veja tam- bém o artigo de Battih (1992). O teorema da aproximado universal pode ser v i sto como uma exlensáo natural do fti’tewrrasj (Wcierstrass, 1885). Este teorema afirma que quelquar futi^do conlimia
sabré um intervalo fechada na fixQ real pode ser ÉXpriSSü HúQli€fe iñlervafü eúfttO UtntI serie de polinomios absolutamente e uniformemente convergente. O interesse na pesquisa sobre as virtudes dos perceptrons de múltiplas camadas como dispositivos para a representará*) de fundóos continuas- arbitrarias lalvcz tenha sido pri- meiramente colocado no centro das atcn^ocs por Hccht-Nielsen (1987), que iarocoD uma versanmclhiirada pnr Spnchcr (1 965)do teorema da superposi^áo-de Kolomogorov. Mais tarde. Qallant c Whitc (1988) mostraran! que um perceptron de múltiplas camadas Com uma única camada oculta com limlta^ilo monótona "co-scnoidal" na camada oculta c sem limiia^So na saida se enquadra como um caso especial de uma "rede de Founer” que produz como sua saida uma aproximando por série de Ftjurier pan uma dada fun^áo. Entretanto, no contexto dos perceptrons de múltiplas camadas (radiciraiaisk foi Cybcnko quem demorislnw rigorosamente, pela primeira vez, que uma única camada oculta é sufi- ciente para aproximar unilbimcmcntc qualqucr furnjáo continua com suporte cm um hipercubn uniiino, este trabalho foi publicado como um Relaíót io Técn ico da Universuy oí Illinois cm 1988, c republicado como um artigo um ano dcpois (Cybmku, 1988.1989). Em 1989, dois quitos artigas foram publicados indcpcndcntcmcntc sobre perceptrons de múltipla*» camadas como a próxima dores universais, um por Funabasl» eo outro por Homik, Stinchcombc c Whitc. Para contribuidles subseqüentes sobre <i problema de aproximado, veja Light (1992b). 9. A históri.i do desenvulvimenio da validado cruzada está documentada em Stone (1974). A idíia da valid.i^ao creaada tcm estado presente pelo cnenos desde os anos 30, mas um refinamente da técnica foi realizado nos anos 60 c 70. Dois artigas importantes daqucla era súo Stone (1974) e Geisser (197$)» que a propuseram independen: emente e quase si- multáneamente. A técnica foi denominada "método de validaca» cruzada1' por Stone c "método de reutiliza^áo prcvisivcl de amostras" por Géttter. Ifl. As referencias mais antigas sobre métodos de treinamento de patada antecipada incluem Morgan c Bourlard (1990) c Wcigcnd ct al. (1990). Talvcz a análise estatística mais déla- Lhada do método de parada antecipada para perceptrons de múltiplas camadas esleja apre- sentada cm Aman d al. (1996a). O mudo é sustentado por simula^oes computacionais de um clasificador 8-8-4 com 108 parametros austáveis cum conjunto de dados muito gran- de ($0.000 exem píos). II. A de aprendizagem por eorrelat;do em cascata (Fahlman c bebiere, L 9901 c um exemplo da abordagem de crescimento de rede. O procedimento cometa com uma rede mínima que tem alguns nós de entradas e um ou mais nós de salda, como indicado pelas conjideracocs de cutredíL?5aida1 mas nSo posaui nns ocultos. O algoritmo LMS, por exemplo. pode ser usado para tremar a rede. Os neurónios ocultos sáo adicionados á rede, um por um, obtendo desta forma uma estrutura de múltiplas camadas. Cada novo neurónio oculto recebe uma concxáo smápl¡ca de cada um dos nós de entrada c também de cada neurónio oculto já existente Quando um novo neurónio oculto ó adicionado, os pesos sinápticos do lado da entrada daquele neurónio sáo congelados: apenas os pesos sinápticom no lado da >aida sáo trentados repetidamente. O neurónio oculto adicionado cniao se toma um detector de características permanente da rede. O procedimcnlo de adicionar novos ncucunins ocultos c continuado da maricira descrita, até que se obtenha um desempenho satisfatórip. Em uma outra atwrdagem de descimentó de rede descrita cm Lee et al. (I99ü), um tercxito nivel computacional, denoruinado adapla^ao a nivel eslntíuntk é acrescentado ao passo de propaga^ (adaptado a nivel funcional) c ao passo de retropropaga^ti (adapta- do a nivel paramétricn). Ncstc icrociro nivel computacional, a estniturt da rede é adapta- da modiíicandCFse o número de ncurón ios c a relacSo estrutura! entre os neuroniüs da rede. O critério usado é que, quandp o ctto estimativo (após a convergencia) for muiur que um valor desejado, um novo neurónio é adicionado ú rede em uma jKisí^áo onde ele seja mais necesario. A posi^áo desejada para o novo neurónio é determinada monÍTorando-sc o
Hidden page
Hidden page
Aprendizagem por retnppropagafáo 43 A inclus&o de um termg de momenii) na ¡Ltualiza^ú dos pesos pode ser vista como um mecanismo para satisfazer as heurísticas 3 c 4, que fomcccm normas para acelerar a COrt- VNftacifl do algoritmo de retropropaga^So, o que foi discutido na Se^to 4.17. Demonstre a validada desta afirmado. 44 Atribui-se, normalmente, á constante de momentii o um valor positivo no i Hiérvalo Ú S ú < 1. Investigue a difcrcr^a que faria no componamentc da Eq. (4.41} em relajo ao tempo t, se fbsse atribuido a a um valor negativa no intervalo -I < Ct £ 0- 4-5 Considere o ejemplo Simples de uma rede envolvendo um único peso, para a qual a timólo de custo é ,é(ui) = ^(w-w^+Aj onde A, e A, sio constantes. Usa-so um algoritmo de retropropagaíao para minimizar '¡fi(w). Explore o modo como a inciusáo da conslante de momento Ct influencia o processo de aprendizagem, rom referencia particular ao número de épocas necessárias para a conver- gene i a cm fum;áo de <L 4.6 Na Se$3o 4.7, apresentamos argumentos qual ilativos para a propriedade de um classifíca- dor por perceptron de múltiplas camadas (usando uma fun;£o logística como a náo- lincaridadc) de que as suas saidas fornecem estimativas das probabilidades de elasse tí püsteriari. Esta propriedade assumc que o tamanho do conjunto de treinamento d suficien- temente grande e que o algoritmo por retropropagaf 3o usado para (reinar a rede nüo fica preso em um mínimo local. Completa os detalhes matemáticos desta propriedade. 4.7 Combando com a funcáo de costo definida na Eq. (4.70), derive a soluto que minimiza a Eq. (4.72} e o valor mínimo da fún^ao de custo definida na Eq. (4,73). 43 As Equa^ocs de (4.81) a (4.S3) definem as derivadas parciais da funcSo aproxímaliva F(w,x) realizada pelo pcrccptron de míitriplas camadas da l'ig. 4.1S. Derive eslas equa^íes a partir do seguirte cenário! (a) Fun^ao de Cailü: (b) Sa¡de do neurónio/„ y, onde tü„éum peso sináptico do Ticunonto (pura o nmrtfnio/e^ é a safda do neurónio j; (c) f'iáü-iitKarjdaíie; 1 +e)tp(-ti} Validado cruzada 4.4 Pode .‘¡er argumentado que a validarán cruzada é um estudo de caso da minimizaQSc estru- tural de risco que ü discutida nq Capitulo 2. De$crev& um exemplo de rede neural utilizan- do valida^So cruzada que sustente este argumenta- 4. til Na valida^áo cruzada múltipla, náo há uma separa^úo dara entre os dados de treinamento e os dados de teste (validado)» como no caso do método de resistencia. É possívcl que a validado cruzada múltipla producá, urna estimaciva tendenciosa? Justifique □ sua resposta.
Técnicas de poda da rede 4J1 Ch critérios estatísticcis para, selecto de mode lo. como o criterio do mínimo comprimento de describas (AdCD} de R fcsanen e jííw criterio teórica do informando (CTt) de Aku ¡ke. compartilham uma forma comutn de comporto: 'Critério por complexidades í Fun^áo ,, do modelo J vercissimilhanya Ponido da complexidade da modelo Discuta como os métodos de dcc^imcnto de peso c de climinn^ao de peso usados para podar a rede se ajuslam oeste formalismo. 4J 2 (al Derive a fórmula para a saliendo S dada na Eq. (4105). (b) A ssuma que a matri z hessiana do emi médio quadrado de um perceptron de múltiplas camadas em relajo a seus pesos pode ser aproximado por uma matriz diagonal como segue; ]{ diag[fr:Ph;3..frIHI. | onde 4Fc o número total de pesos da rede. Determine a sal ¡encía 5 do peso W da rede. Acelerado da convergencia da aprendizagem par retropropagafáo 4,13 A negra de aprendizagem delta-barna-deka (Jacübü, US SI representa urna forma modífi- cada do algoritmo de retnopropagat;do que se baseia ñas heurísticas descritas na Se^áo 4.17, Nesta regra, alribui-sc u cada pew sinóptico da rede um parámetro da taxa de aprcri' dizagem particular A funijáo de custo, E[n), d perianto, modificada de uma forma cofres* pándente, Em entras palabras, apesar de F(jt) ser maiEmaticamtntc similar á fun^áo de cu Ato í(«) na Fq.(4 21. o espafo de parámetros relativo á nova ñineSn de custo eovol- ve diferentes tasas de aprendi¿agcin. (a) Derive uma expresado para a derivada patCud d£(n)/<)r|^; t), onde q (h) ¿ o parámetro da taxa da aprendizagem associado ao peso siníptico w jyr). (b) Com isso, demonstra que os ajustes feitos nos parámetros da taxa de aprendizagem bureóos rn> resultado da pane (a) estBo perfeítamentc de acardo com as heurísticas 3 c 4 da Sc^áo 4.1 7. Métodos de otimiza^BO de segunda ordem 4,14 O uso de um termo de momento na atualizaqáo dos pesos descrito na Eq. (4.39) pode set considerada como uma aprorimafáo do método do gradiente conjugado (Battiti, 1992). Discuta a validado desta afírmalo. 4.15 CoflOAfandc cmm a fórmula pura p(rr| n4 Eq. (4.133), derive a fórmula de Hesfeness-Siicfef'. rr(,r)(iVi)- r(ff-])) ir(« - 1M* -11 onde s(jt) é o vetar diretácj e r{n) é o residual no método do gradiente conjugado. Use este resultado para derivar a fórmula de Folak-Ribiére da Eq. (4.134) t a fámula de Flclchen Rccvcs da Eq. {4.I35X Experimentos compulse ¡onais 4.16 [nvEüiigue o uso da aprendizagem por retroprepagacáo usando uma náo-linearidade siguió ide para realizar os mapeamentos um-para-um, descritos abaixo;
Hidden page
Hidden page
CAPÍTULO 5 Redes de Fun$áo de Base Radial 5.1 INTRODUQÁO ü pro jeto de uma rede neural supervisionada pude ser ejecutado de varias formas. O algoritmo de retropropagac^o útil izado para o prajcto de um perceptron de múltiplas camadas (sob supcrvisao), como descrito no capítulo anterior, pode ser visto como a aplicado de uma técnica recursiva confio cida na estatistica como aproximaran extocástica. Neste capitulo, tomamos um enfoque totalmente diferente ao vero prajeto de uma rede neural como umpmbtcma de ajuste de curva (aproximarán) em um espado de alia dimensional i dade. De acorde com este ponto de vista, aprender c equivalente a encontrar uma superficie, em um espado mult i dimensional, que fbrne^a o melhor ajuste para os dados de treinamento, com o criterio de "melhor ajuste*' sendo medido em um sentido estatistico. Cornespcndentcmcnte, general i za^áo c equivalente ao uso desta superficie muí (^dimensional para interpelaros dados de teste. Tal ponto de vista é a motivado per tras do método das íuncocs de base radial, no sentido de que isto o aproxima dos trahalhc» de pesquisa em interpolaíSoestrii i tradici- onal em um espado multidimcnsional. No contexto de uma rede neural, as unidades ocultas fome- cem um conjunto de “fundes” que constituem uma “base” arbitraria para os padrees (velores) de entrada, quando eles silo expandidos sobre o espado oculto: estas fun^oes. sáo chamadas de Jun$óe3 de base radia/.' As fun^óes de base radial foram primcira mente inLroduzidas na sqlufño do proble- ma de interpolado multivariada real. 0 trabalho inicial nesteassunto é detalhado em Powdl (1985), e um irabalho mais recente é examinado em Light (1992b). Este é atualmente um dos campos principáis de pesquisa em análise numérica. A construyo de um rede deftmráo de base radial (R8F> raditd-busisjunctíon), em sua forma mais básica, envolve tres camadas com papéis totalmente diferentes. A camada de entrada é consti- tuida por nós de fonle (unidades sensorials) que concctam a rede ao seu ambiente. A segunda cama- da, a única camada oculta da rede, aplica uma transfarmapáo nao-linear do espado de entrada para o espapo oculto; na maioria das aplícales, o espado oculto é de alta dimensionalidade. A camada de saída c linear, fomecendo a resposta da rede ao padreo (sinal) de aiivaqáo aplicado á camada de entrada. Uma justificativa matemática para a estrategia de uma transforma^áo nao-linear seguida de
Hidden page
Um problema complexo de classifica^Sn de psdrdes disposio itio tacamente em um espade de alta dimens^o tem maior piuhabilidade de ser linearmente separtvel do que em um espade de taita dimensionalidade. Do traba! ho que desenvolvemos sobre percepirons de camada única no Capitulo 3, sabemos que, urna vez que tentamos padrees linearmente separáveis, o problema de classiííca^ao c relativa- mente fácil de ser resolvido. Ccmseqlientemente, podemos desenvolverá nossa compreensáo so- bre a operado de uma rede RBF como um clarificador de padrees estudando a separabilidade de padrees Considere uma familia de superficies onde cada uma divide natura]mente um espado de entrada em duas regí des. Considere que represente um conjunto de N padrees (vetores} x,, ip..., ijp cada um dos quais é atribuido a uma de duas classes #,?<?.. Dizemos que esta dícolomia (panifáo binaria) dos pontos c separável em rcla^áo á familia de superficies, se existir uma super- ficie da familia que separe o pontos da elasse Jaqueles da elasse i 2. Para cada padrao i € defina um vetor constituido de um conjunto de fundes de valor rea] l<Pi(x)b’ 1,m,¡, como mostrado por #>) = (q>!<ic\q»2(xK.. hq>ra (i)f (5 1) Suponha que o padreo x é um vetor em um espado de entrada de dirnensao O vetor <p(x), entilo, mapeia pontos no espado de entrada de dimensao wj para pontos cm um novo espado de dimensáo rrtr Referimo-nos a <p.{x) como uma fungue vertirá, porque ela desempenta um papel similar ao de uma unidade oculta em uma rede neural alimentada adrante. Correspondentemenie, o espado abran- gido pelo conjunto de funqdes ocultas {tp/x)}^ é referido como o espado oculto ou espado de características. Uma dicotomía {3* . 9,} de S é dita ser separáveipor tp, se existir um vetor w de dimensáo n\ ( para o qual podemos escrever {Cover, 1965) *r<p(ií }> 0. x^S;, wTqi(x)<0J xeSfj (5-2) O hiperplano definido pela equaqáo wrqi(x) = <) descreve a superficie de separaf3o no espado tp (i e T espado oculto). A imagem inversa deste hiperplano, isto é. Xt 0 (5.3} define a superficie de separando no espado de entrada. Considere uma elasse natural de mapeamentos ubi idos utilizándose uma combina^áo linear de produtos de r coordenadas veíoriais do padrao. As superficies de separado correspondentes a estes mapeamentos s3o referidas como variedades racionáis de ordem r. Uma variedade racional de
Hidden page
Hidden page
1X3 ' 0.3 - <Pí ÍJÁ - FTDntei ni ' s de dk'tisin 0,4 (0,1) II.i!) (Olí) (11) • (0.0) oa _L_ 0,4 Oj6 <Pi OJS IX) M 0 u (a) <b) Fl GU RA 5.2 {a! Q; quatro pudrías dú prtMfiiTiá do XOH; (b) Diagrama da tomada de dOcisáü TABELA 5.1 Especlbcacáo das Fuñadas Ocultas para o Problema do XOR do Exemplo 5.1 Padreo de Üntreda, X Pnmc:ri Fundan Oculta, Segunda Funfan Oculta, (1,1) 1 n, 1353 (ti. 11 (>.3678 0i367ti (0.0) 0,1353 1 (1.0) 0367 B 03678 entrada, (l, l) e (ü, ü). Por conseguintc, o problema do XOR pode ser fácil mente nsolvido usándose as fungues (p (k) e ip^fr) como as entradas de um classificador linear como o perceptron. Neste exetnplo, nao h:i aumento da dimensional ¡darle do espado oculto, comparado ao espapo de entrada. Em outra!» palavras, a naodincaridadc ejemplificada pelo uso de funcocs ocultas gaussianas é suficiente transformare problema do XOR em um problema lineármele scparável. Capacidad o de Separado de uma Superficie A Equaqáo (5.5) tem um significado importante para o número máximo de padrees aleatoriamente distribuidos que súo linearmente sepa reveis cm um espado mui [¡dimensional. Para explorar esta questáo, considere que xr x1T..., seja uma seqüéncia de padrees (vetores) «ricatorios como descri- to previamente. Considere que V seja uma variávcl aleatoria definida COHio o maior intriro tal que
esta seqüéncia seja separável per onde rp tem m1 graus de liberdade. EnUo, da Eq, (5.5) deduzi- mos que a probabilidade que N = n é dada por ProbfA1’ “ n) = P(/r,m() - P(n + 1,m,) (IW n-1> (56) n = 0,1,2, ffli-lj Para umti interpretado deste resultado, recordamos a definido de uma disfríbuiqdo binomio/nega- tiva, Esta distribuidlo ¿ ’S'34’ » probabilidade que £ falhas precedam o r-ésimo sucesso em uma langa seqücncia repetida de ¡emotivas de Benioui/i. Ncstc experimento probabilístico, há apenas dais resultados possiveis para cada tentativa, sucesso ou falha, c suas probabilidades permanecen! as mesmas cm todo o experimento. Considere que y? c q representen as probabilidades de sucesso c falha, respectivamente, com p + q 1. A distribuido binomial negativa é definida por (Feller, 1968) f(ktrtp) = pfq* r + k -1 k Para o caso especial dep - q - Iti (Le„ sucesso e falha sito eqüiprováveis) e i + r= fj, a distribuido binomial negativa se reduz a Com esta definí^,. vemos agora que o resultado descrito na Eq. (5.6) é apenas a distribuido binomial negativa, dcslncada de m unidades para a dimita, c com parámetros ?tf. c 1/2. Assim, N corresponde ao “tempo de espera" até a nt, ¿sima falha cm uma sDqüéntia de lan^amcntos de uma moeda honesta. O valor esperado da variAvel aleatoria N e sua mediana silo, respectivamente: jEJAQ = 2/71, McdianafA1] = 2m. (5.7) (5.8) Portanto, temos um corolario para o teorema de Cover na forma de um resultado assintótico célebre que pode ser formulado como (Cover, 1965); O número máximo esperado de padrees (vetores) atribuidos aleatoriamente que sSo linearmente se- paráveis em um espado de dimensáo jm, é igual a 2mr Este resultado sugere que 2ml é uma definí natural para a capacidode de separando de uma familia de superficies de decisao tendo m, gnus de liberdade. De uma certa forma, a capacidade de separa^to de uma superficie está intimamente relacionada com a nopáo de dimensio V-C, que é discutida no Capitulo 2.
5.3 O PROBLEMA DE INTERPOLAQÁO O ponto importante que emerge do teorema de Cover sobre a separabilidade de padrees é que, resolvendo um problema de classifica^áo de padrees nao-Linearmente separável, há normalmente um beneficio prática ganho pelo mapeamento do espado de entrada em um novo espada de dimen- sáo suficientemente alia. Básicamente, um mapeamento náo-líncar c usado para transformar um problema de classificacao nio-1 inearmente separável em um problema jnearmente separávd. De urna mar eirá similar, podemos usar um mapeamento nao-linear para transformar um problema de filtragem niío-linear difícil em um problema mais fácil que envolve filtragem linear. Considere cntáo urna rede alimentada adianlc com uma camada de entrada, uma única camada oculta c urna camada de salda consistindo de uma única unidade. A escolha de uma única unidade de saída foi proposita! para simplificar a exposi^áo sem penda de generalidade. A rede c projetada para realizar um mapeamento nao'linear do espaqo de entrada para O espado OCullO, seguido de um mapeamento linear do espado oculto para o espado de saida. Considere que m,, represente a dimen- sac do espado de entrada. Entilo, de uma mane ira global, a rede representa um mapa do espado de entrada de djmensinnalidade w em um capado de salda unidimensional, escrito como j:R’’ii->[Ri (5,9) Podemos considerar o mapas como umahipersuperfíaie (gráfico) Tc IftY1, assimcomo considc' ramos o mapa elementar .v: R1 —> IR:. onde 4*) Jt5» corno uma parábola no espado R:. A superficie r c um gráfico muí [¡dimensional da salda como fundan da entrada. F.rr. uma situado prática. a superficie T édesconhccida c os dados de treinamento estao normalmente contaminados com ruido. A fase de treinamento e a fase de generalizado do procesan de aprendizagem podem scr respectiva- mente vistas como segue (Broomhcad c Lowc, 19&8): » A fase de treinamento constituí a otimizarán de um proccdimcnto de ajuste para a superfi- cie T, bascada nos puntos dos dadus conducidos aprcscntados á rede na forma de exemplos (padrees) de entrada-salida. • A fase de generalizaqáo e sinónimo de interpolado entre os pontos de dados, com a i।iterpolatáo sendo formada ao longo da superficie resf ita gerada pelo proccdimcnto de ajuste, como a aproximapáo óttma á superficie verdadera T. Assim, somos levados á teoría da ¡nterpolapao muhivariada cn)Um espado de alta dimensional idade, que tem urna Innga histeria (Davis, 1963). O problema de interpolado, no seu sentido estrito, pode scr lormulado como: Ducííj rrnz A'púñUtí diferente* {i. e R "111 = A -.jV} .- um conjunto OTiTC&pcHidcnle de .Vtiúmerivi rtais JJ.e R11 i = JV), cncnntrcuma funcáo» Rv-> R1 que satisfaga a cóndilo de iilterpída^an: i-1,2....N (S.W) Para a interpolado estrila como aquí especificada, a superficie de interpolado (i.e., a fun^áoF) c «brigada a passar por iodos os pontos dos dados do Ircinamcnto.
Hidden page
Hidden page
Hidden page
Se qualqucr uma destas candiles náo for sati.ifci.ta, dizentos que o problema é maiformtifado. Básicamente um problema malfcrmulado significa que grandes conjuntos de dadas podem contar urna quanhdade surpreendentemente pequeña de informa^áo acerca da soluyo desejada. No contexto da nossa situará o atuaLo fenómeno físico responsável pela gerayode dados de treinamento (p.ex., voz, imagens, sinais de radar, sinais de sonar, dados sísmicos) é um problema direto bem-fónnulado. Entretanto, aprender a partir destas formas físicas de dados, visto como um problema de reconstruyo de hipcrsupcrficic, c um problema inverso mal formulado pelas seguintes razdes. Primeiro, o criterio de existencia pode ser violado na medida que para toda a entrada pode nao existir uma saida distinta. Segundo, pode nao haver tanta informado na amostra da tre i ñámen- lo quanto realmente necessilamos para reconstruir únicamente o mapeamenlo de cntrada-saída, sendo, dessa forma, provável que o criterio deunicidade seja violado. Terecina, a inevitávcl presen- ta de ruido ou impreu sao nos dados do treinamento reais adiciona incerteza ao inaptamente de entrada-saida reconstruido. Em particular, se o nivel de ruido na entrada for muito grande, é pqssí- vcl que a rede neural produza uma saída fora do intervalo para uma entrada específica x do dominio if; cm outras palavras, há uma probabilidade de que o criterio de continu idade seja viola- do. Se um problema de aprendizagem náo possui a prepriedade da continuidade, emito o rnapeamento de enlrada-saida computado nao tem nada a ver com a verdadeira soluyo para o problema de aprendizagem. Nao há como superar esta dificuldadc a menos que alguma informayo previa sobre o mapeamcnio de entrada-saida esteia disponiveL Neste contexto, c bastante apropriadn que nos lembremos de uma afinnayo de Lanczos sobre operadores diferenciáis lineares (Lanczos, 1964): "Urna falta de infnrmaya nao pode ser remediada pornenhum truque matemático." A importante questáo de como transformar um problema mal formulado cm um problema bem-formulado vía regularizayo é discutida na próxima Seqito? 5.5 A TEORIA DA REGULARIZADO Em 1963, Tikhonov propos um novo método chamado regtdartza$ík> para resolver problemas mal formulados.'1 No contexto de um problema de reconstruyo do hipcrsuperficie, a idéia básica de regularizarán $ estabilizar a soluyo por meto de algum funcional náo-negativo auxiliar que incor- poro informa^áo previ a sobre a su luyo. A forma mais comum de informayo previa envolvc a suposiyo de que a fun^ao do mapeamento de cntrada-saida (i.c., a solucáo do problema de recons- truyo) sejaáiíuvt', no sentido de que entradas similares correspondan] a saldas similares. Para sexmos específicos, considere que o conjunto de dados de entrada-saída (i.e„ amostra de treinamento) dispon i vel para a aproximayo seja descrito por Sinal de entrada: x, s D?”', j = I, 2.jV (5.20) Resposta desejada: rf, g R\ j = 1,2,....N Note que se assumc que a saida seja unidimensional. Esta supes i yo náo limita de forma alguma a aplicabdidade geral da teoría da regularizayo aquí desenvolvida. Considere que a fuñí3o aproxi- maliva seja representada porEYx), onde {por conveniencia de represenlayo) omitimos o vetor de peso w da rede do argumento da fun^ao F. Básicamente, a teoría de regularizayo de Tikhonov unvolvc dois termos; 1. Termo do Erro fiodm. Este pnmeiro termo, representado por^FX mede o erro (distancia) padrao entre a respusta desejada (alvo) d¡ c a rcspnsta real v, para o exemplo de treinamcnio i = I, 2,..., A'. Específicamente, definimos
d-l (5.21) onde mtroduzimcs o fatcr de escala! para mantera consistencia com o material aprcscntado nos capítulos anteriores. 2. Termo de Regularizando. Este segundo termo representado per ^/F), depende das proprieda- dcs ^geométricas" da lun^ao aprpximativa F(i). Específicamente, podemos escrever (5-22) onde D é um operador diferencial linear. A i n formado previa sobre a forma da soluto [i.e., a fun^ao de entrada-saida F(i)] é incorporada no operador D, o que toma naturalmente a selecSo de D dependente da problema. Tambem nos referimos a D como um estabilizador porque ele estabiliza a soluto para o problema de regularizáoste, fazecido-a suave e desta fomn satisfa- zendo a propriedade de COntinuidade. Entretanto, suavidade implica continuidade, mas o inver- so náo é necessariamente verdadeiro. A abordagem analítica usada para tratar a situado descrita na Eq. (5 >22} se apóia no conccito de um espado de fundan,1 que se refere a um espado normalizado*' de funches. Neste espado de várias (cstnlamente talando, infinitas) dimcnsocs, uma fun^áo continua ó representada por um vetar. Usando esta imagem geométrica, estabelece-se uma ligado entre matrízes e operadores diferenciáis linea- res. A anal ¡se de sistemas lineares se tema com i sao traduzível para a anábse de equa^óes diferenci- áis lineares (Lanczos, 1964). Assim, o símbolo I II na Eq. (5.22) representa uma norma imposta ao espado de fun^áo ao qual DRx) pertence. Normalmente, o espado de fundan usado aquí éo espado L . que consiste de todas as funpdes de valor realpara ”ri quais ||Xx)lIIa é íntegrável por Lebesguc. A fun(ác /(i) usada aquí representa a funqáo real que define o processo físico responsável pela gerapáo do con- junto de pares de dados de entrada-salda j| ; veja a nota 7 para maiones deíalhes. A quantidade a ser minimizada na teoría de regulariza^ao c «(F) = st(F) +Aíjf) (5.23) ¿ j.i 2 onde A. é um número real positivo chamado de parame tro de rcguiarizaeao e ¥ (F) é denominado o funcional de 7Uta)Fwvr Um funcional mapvia fundes (definidas em um espado de funedes adequa- do) para a linha dos reais. O mmimizador do funcional de Tikhonov %(F) (i.e., a soluto para o problema de regularizante) é representado por FL(x). Ncstc sentido, podemos considerar o parámetro de regularizado A, como um indicador da suficiencia do conjunte de dado& fomecido como ejemplos que especifican) a sol uceo F^x). Em particular, o caso límite 1 -> 0 implica que o problema é irrestrito> com a solutfo FJx) sendo totalmente determinada petes exemplos. O outro caso I imite, X —*», por outro lado, implica que a restribo pré\ ia de suavidade imposta pelo operador diferencial D c por si só suficiente para espect- Óopvrlqhted mater
ficar a soluto F^x). que é unía outra forma de dizer que os exemplos nao sao confi ¿veris. Em api¡calóes práticas, atribuirse ao parámetro de regularizado X um valor entre estas duas cotidifdcs limites, de forma que tanto os dados da amostra como a informado prévia contribuem para a solii- do F.(x). Assim, o termo de regularizado t (F) representa uma JttngSo twdefo deputii^uu Je complexidades cuja influencia sobre a soluto final é controlada pelo parámetro de regularizado X. Uma outra forma de se interpretar a regularizado é considerando que ela fomece uma soludo prática para o dilema Hias-variancia que é discutido no Capítulo 2. Específicamente, a escolta ótima do parámetro de regularizado X é prejetada para conduztr a saludo do problema de aprend> zagem para um balando salísfatório entro bias modelo r variancia modelo, pela izicorpora^aci da quantidade certa de informado previa. Diferencial de Fréchet do Funcional deTikhonov O principie da Kgi¡lai-¡Ztí$áa pode ser agora formulada como: FfrííW.nt' a/rTiXíSíJ F. (X) que minimiza afitncíunaf t!e TtkhoUüv definida pt>r S(F) «{F> + 1$ ,(F) í í é ü IWMfl íit? QJVD püdrüü. ?! (F) ¿ t> ter/rw de naitlariíO^da ü X é a parámalm de regnfa- fízqgííq . Para prosseguirmos com a minimizado do funcional de custo '&{/’), precisamos de uma negra para avahara diferencial de$(F). Podemos considerar esta questáo usando o diferencial de Fi-échet. No cálculo elementar, a tangente de uma curva é uma linha reta que fomece a melhor aproximado da curva na vizinhanija do ponto de tangencia. Similarmcnlc, o diferene ¡al de Frcchcl de um funcional pode ser interpretado como a melhor aproximado linear local. Assim, o diferencial de Fréchet do funcional '€(/') é formalmente definido pür(Domy, 1975; Dcbnath e Míkusi liski, 1990; de Fígueiredo cChen, 1993): J^(F,/f) = X-U (5.24) ande á(x) é uma futido flxa da vetar x. Na Eq. (5.24), sáo usadas as negras ordinarias da difcrenci- aqáo. Uma condigno necesMria para a fundan F(x) ser um extremo relativo do funcional ^(F) é que o diferencial de Fréchet ¡fi£(F,^) deve ser zcro cm FTx) para todo h e como mostrado por h) - d :£(F, h) + AJ^_(F, Á) = 0 (5.25) onde d%t(F\ h) c J? (Ft A) sao os diferencíala de Fréchet dos funcionáis íF) c respectiva- mente.
Calculando o diferencial de Fréehct do termo de erro padreo SSjfF, A) da Eq. (5.2l), temos = —S,{F + 0A) -t-o ¿ «P !-| (5.26) =-£k-íxx()-wx,)]*(x,)U. I n | = -Ék-f(x,)]A(x.) r=[ Neste ponto da discussao, consideramos instruí ¡vo invocar o teorema da repnsfintíqxfo de Riesz, que pode serexpresso como segue (Debnath e Niikusióski, 1990; Kirsh, 1996): Considere que / seja um funcional linear limitado etn um espado de 1 [liben (Le., um espado do produto interno que é completo)" representado por X. Existe um An e tal que /= (/r, para lodo/r e W Além disso, temos que I.ZIk = IAX onde e o dual ou conjugado do espado de Hilbcrt ¿C. O símbolo (vjr usado aquí representa o produto interno (escalar) de duas funpñes no espado 3t. Assim, com base no teorema da iepncEcnta(fo de Ricsz, podemos rescre^ cr o diferencial de Fréchct tíf® JF» A) da Eq. (5-26) na forma equivalente h 1 = 1 (5.27) onde fiurepresenta a disiríbuieao delta de Dirae de x, centrada ere x.; isto é. B.JiJ-Síi-i,) (5.28) Considere a seguir o cálculo do diferencial de Frichet do termo de regularizado '£ (F) da Eq. (5.22). Procedendo de uma forma similar aquel a recém-descrita, temos
= í Op^D**^ Jtr* = | DFDAdx Jfi* (5.29) onde (HA, 1>F)^ é o produto interno das duas fun^ócs DA(x) c DF(x) que resultara da a^ao do operador diferencial D sobre A(x) e F(x)h respectivamente. Eqna^áo de Euler-Lflg ranga Dado um operador diferencial linear i>. podemos encontrar uin openubr adjunto únicamente deter- minado, representado por f>, tal que para qualquer par de fuñones w(x) e i(x) que sao su fiel ente- mente diferencia veis e que satisfazcm condt^ocs de contorna adequadas, podemos escreverf Lanczos, 1964) n(.r )t>u (x }d x = u( x )Dw( x} di Jr’ Jr" (5.30) A Equapáu (5.30) é denominada idenfidadede Green; ela fomcee uma base matemática para definir o operador adjunto D cm termos do diferencial D dado. Vendo D como uma matriz, o operador adjunto l> desempenha um papel simi lar ao de uma matriz transporta. Comparando o Lado esquerdo da Eq. (5.30) com a quana linha da Eq. (5.29), podemos fazeras seguíates identificares: w(x> = DF(M Dv(x) = DA(x) Usando □ Jentidade deGreen. podemos rescrever a Eq. (5-29) na forma equivalente A) - A(x)DD/»í/x Jr-' = (ah puf] x nt (5.31) onde D c o adjunto de l>
Retomando ¿ condip&o extrema descrita na Eq. (5.25) e subslituindD as diferenciáis de Fréchet das Eqs. (5.27) e (5.31) naquela equapao, podemos agora expressar o diferencial de Fréchet J5£(F, /i) como ( K i * z«(F,*)= * DDF--X(4--PX (5 32) k L AJ-I J7x Como normalmente atribui-se ao parámetro de regularizacáo X, um valor dentro do intervalo aberto {0„«), o diferencial de Fréchet </?(/’, fij é zero para todo h{x) no espado se e somente se a seguíate condi^ao for satisfeita no sentido distributivo: l-l ou equivalentemente, ñDF^i) -J ¿p - F|i,)]5(x - xj (5.33) A l-l A cqua^áo (5.33) é a equa^ao de Eufer-Lagrunge para o funcional de Tikhcnov %(F); da define uma cóndilo necessária para o funcional de Tikhoncv %(f) ter um extremo em A (x) (Dcbnath c MikusiiEki, 1990). Fun^áo de Green A Equa^ao (5.33) representa uma equa^So diferencial parcial para a funfdo aproximativa F. Sabc-sc que a soIuqSo desea equa^o consiste da transformado integral do lado directa da equa^So. Considere que <7(i, represente uma fiinf ao na qual ambos os velones x e £ aparecem em pé de igualdadct mas para propósitos diferentes: x como um parámetro e como um argumento. Para um dado operador diferencial linear L, estipulamos que a fundan <7(i, £) satisfaga as seguintes condi^oes (Courant e Hilbert, 1970): 1. Para um fixo, G(x, c uma fun^ao de x c satisfaz as condi^ocs de contorno prescritas. 2. Exccto no ponto x = as derivadas de G(i+ em relajo a x sao todas continuas; o número de derivadas é determinado pela ordem do operador L. 3. Com G(x. considerada como uma funffo de x, cía satisfaz a equa^So diferencial parcial LG(i, ’ 0 (5.34) em todos os lugares exceto no ponto x - onde ela tem uma singularidade. Isto é, a fun^^o G(x, ^) satisfaz a seguirte equa^ao diferencial parcial (no sentido das distrihui^des): LG(x,É) = 3(x-S) (5.35) onde, como definido anteriormente, 6(x - é a fun^áo delta de Dírac posícionada no ponto x = Copyrighted material
Hidden page
Enlito, podemos usar a Eq. (5.36) para escrever ^W = [ G(i^|l¿[rf1-F(x,)]8U-i1)l^ J R- LA 1-1 A M J»*' onde na última linha trocamos a ordem da integrado e do somatório. Finalmenle, usando a propri- edade de filtragem da fiin^ao delta de Dirac, obtonw a solu^ao desejada da equaqlo de Euler- Lagrange (5.33) como segue: (5.41) 4-1 A Equa$&> (5.41) afirma que a soluto A(x) de minimizado para o problema de regularizado é uma auperposifao linear de Nfundes de Grccn. Os x representara os ceñiros da expansáa, e os pesos [J - F(x.)]/X representara os coeficientes da expansáo. Em cultas palavras, a solicito para o problema de regularizado se encentra em um subespa^o y-dlmensional do espado de funches sua- ves, e O conjunto de fun^oes de Green {Gfx, x)} centradas em x . i = 1,2,..., constituí uma base para este subespafo (Poggio e Girosi. 1990a). Note que os coeficientes de expansáo na Eq. (5.41) sSo, primero, ¿meares em relapso ao erro de csLtma^áo, definido como a diferen^a entre a resposta desejada d. c a saída correspondente F(i) calculada pela rcdc+ c segundo, inversamente proporcio- náis ao parámetro de regularizado X. Determina^ño dos Coeficientes da Expansáo A próxima questáo a ser resolvida é a determinadlo dos coeficientes dcsccmhccidos na expansao da Eq. (5.4 L). Considere tt; = -Ffx.)]. j = 1. A. Com isso, podemos dispar a soluto de mn n i mi zapito da 1 y l-l Calculando a Eq. (5,43) em j,/= 1,2».-, obremos /UG=2>g(i,'1.)' r"L Lntroduzunos agora as segu Entes defíni^ctos: ( X Af (5,42) q. (5.41) simplesmente como: ) (J«) i = l. 2,., .V (5.44) Gopyrlghted maten
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
functas de base radial HGURA 5 J Rada de furxjflu c c base radial 3» A solufáo calculada pela rede de regularizado ó ófima. Ótimo aquí significa que a rede de regularizado minimiza um funcional que mede o quanto a soludo se desvia de seu valor real como representado pelos dados de treinamenlo- 5.7 REDES DE FUNQÁQ DE BASE RADIAL GENERALIZADAS A correspondéncia de um-para-um entre os dados de entrada de treinamento x e a funqfo de Green G(xn x ) para 1=1, 2*»-» ATpraduz urna rede de rcguEanza^ao que pode scr algunas vezes considera- da proibitivanicnlccustDsapflra ser implcmcntada cm tennos computacionais, para N grande. Espe- cíficamente, o cálculo dos pesos lineares da rede [i.e., os coeficientes da expansfo na Eq. (5.55}] requer a inversSo de uma matriz A^por-M que por sua vez cresce de modo polinomial com N (apro- ximadamente com jV5). Além dissot a probabilidade de ntau candicionamentG é maiorpara matrizes tnaiores; o número tondictortañle de urna matriz é definido como a razáo entre o maíor aulovalor e o menor autovalor da matriz. Para superar estas di Acuidades computaciones, a compitaidade da rede deve ser reduzida, o que requer uma aproximado para a solu^ac regularizada. A abordagem seguida envolve a procura por uma soluto subólima em um espado de menor dimcnsionalidadc que aproxime a salu^ác regularizada da Eq. (5.55). Isto é feito usando-se uma técnica padreo conhecida era problemas variacionais como método de Gaterkin. De acordó com esta técnicat a soluto aproximada F*(x) é expandida em uma base finita, como mostrado por (Poggio eGirosi, 1990a) F»(x) = ¿w,<p,(x) (5.67} r-l onde {(p/.xJk = l, 2,.~t m,I é um novo conjunto de fun^ocs débase que ¿asumirnos serrín lincannen- te independentes sem penda de generalidad#. Típicamente, o número de funfftes de base ¿ menor
que o número de pontos de dados (i.e., S c os tí? constituem um novo conjunto de pesos. Tendo cm mente as fuogSes de base radial, facemos ip/X) = G(|1>t-tJ|)s i* 1,2........m, (5,68) onde o conjunto de centros !t('r 1,2..nrj deve ser determinado. Esta cscolha particular de fungóos de base é a única que garante que no caso de m, " A', e t - ir,, i l,. 2 JV a solugan cometa da Eq. (5,58) é recuperada de forma consistente. Assim, usando a Eq. (5.68) em (5.67X podemos rcddmir F*(x) como l-l l-l (5.69) Dada a expansan da F.q. (5.69) para a fungáo aproximativa F“(x)h o problema que enfrentamos agora é a determinagáo do novo conjunto de pesos ( Jüjj = I, 2h...,m } que minimiza o novo funcio- nad Je custo '£(?*) definido por (5.70) O primeiro termo no lado direito da Eq. (5.70) pode serexpresso como a norma euclidiana quadrada í|d- Cw|onde ... ’GfXpt,} G(x,.t2) G(x„ t„) G(s;.t,} í7(xS1t2) - <7{x21t^) G = _G(Vv>t.) G(xA,t,j G(xv,TWi) (5.71) (5-72) (5-73) O vetor KSposta desejada d c ..V-dimcnsional como anteriormente. Entretanto* a matriz G de fuñ- idos de Groen c o vetor de peso w tem dimensoes diferentes* □ matriz G é agora e portan to nán é mais simétrica, e o vetor w ém^por-l. Da Eqr(S.69) notamos que a fungió aproximativa F*
é uma combina^ao linear das fun^Ses de Green para o estabilizador D Conseqüentemente, pode- mos expressar o segundo termo no lado dicoito da Eq. (5.70) como ||DF1|í=(DÍ',DF*)1, X . t,), í> l> X v>,Gi i; t,) r-i j-i , j-i Jit W| W| -£Ew/wMtr,1) y-i i-i = wrGow (5.74) onde na segunda e na tere eirá linhas fizamos uso da definido de um operador adjunto e da Eq. (5.35), respectivamente. A matriz G ¿-urna matriz simétrica m,-por-m(, definida por G(t|,t|) G(tptj) G(t,,tMi) Gd^tJ G(L.t3) G(tIstra) (575) Assim, a minimiza^áp da Eq. (5.70) em rcla^áo ao vetor de peso w produz o resultado (veja o Problema 5.5) (GTG + XG,>' = GTd (5.76) Quando o parámetro de regularizaban X se aproxima de zcro, o vetor de peso w converge para a sclu^áo da pseudo-iuveraa (norma mínima) do problema indeterminado de ajusle de dados por quadrados mínimos para m( < AfT como mostrado por (Broomtread e Lowe, 1988) w G d, X = 0 (577) onde G+ é a pseudo-im/ersa da matriz G; isto é, G*=(GrG)-|Gr (5-78) Norma Ponderada A norma na solu^ao aproximada da Eq. (5.69) c normalmente subentendida como uma norma euclidiana. Quando^ entretanto, os elementos individuáis do velor de entrada x pertencem a classes
diferentes é mais aproprlado considerar uma norma ponderada genérica, cuja forma quadrática é definida pür(P0g£ni e Girosi, 1990a) .^(Cx/fCs) = irCrCl (5.79} onde C c uma matriz de ponderabau de norma % -por- e ffl, é a dimensao do velor de entrada i. Usando a definido de norma ponderada, podemos rescrever a aproxima^ao para a solupao regularizada na Eq. (5.69) cm uma forma mais generalizada (Lowc1 1989: Poggio c Girnsit 1990a) F*(l)=£ttlG(|x-t,||¡.) (5.80) O uso de uma norma ponderada pode ser interpretado de duas formas. Podemos simplesmente vé- le como a aplicando de uma transformando ajan sobre o espado de entrada original. A principio, uma transforrnacáo como cssa nao pode degradaros resultados do caso originaL já que ela realmen- te corresponde a uma matrá ídemidade de ponderafáo de norma. Por outro lado> a norma pondera- da resulta adianle de uma pequeña general iza^áo do Laplaciano de dimensáo na defmifáo do operador pscudc-difcnmcial D na Eq. (5.63); veja o Problema 5.6. O uso de uma norma ponderada pode também ser justificado no contexto das fun^ocs de base radial gausstanas pelas seguimos razóos. Uma fun^áo de base radial gaussiana G'(||x- tj|f) centrada em t. c com a matriz de pondera- do de norma C pode ser expressa como -t,lí.)=«r( (»-t,rcrc(*- •,)] -exJ (S.S1) onde a nutrí? inversa Z é definida por ÍS =CrC (5.82) A Equino (5.8I) representa uma distribuido gaussiana muhivariada com vetor média t. e matriz de covariancia S. Como laL cía representa uma general i za^áo da distribuido descrita na Eq. (5.59). A soludo para o problema de aproximado dado na Eq. (5.70) fomecea fundamentaQáopara a rede de fuñado de base radial {RBÍf generalizada lendo a estrulura mostrada na Fig. 5.5. Ncsta rede, prevé-se o uso de um bias (i.e., uma varifitvel ^dependente dos dados) aplicado a unidade de saida. Isto é feito simplesmente igualando-se um dos pesos lineares da camada de saida da rede ao bias c tratando a fun^áo de base radial associada como uma constante igual a +1. Em termos es. tinturáis, a rede RBF generalizada da Fig. 5.5 é similar á rede RBF de regulari- zado da Fig. 5.4. Entretanto, elas diferem entra si cm dois aspectos importantes: L O número de nós na camada oculta da rede RBF generalizada da Fig. 5.5 c onde ai, é normalmente menor que o número Ade exemplos dispon i veis para treinamento. Por cutio lado, o número de nós ocultos na rede RBF de regularizaQáo da Fig. 5.4 cegatamente .V.
2. Na rede RBF generalizada da Fig. 5.5, os pesos lineares associados com a camada de saída e as posic&es dos centros das funodes de base radial e a matriz de pondera^ de norma sssooiada com a camada oculta sáo lodos parametras desccnhecidos que devem ser aprendidos- Entretan- to, as fiinfdes de alivag&C da camada oculta na rede RBF de rcgularizacao da Fig. 5.4 sao conhecidas, sendo definidas por um conjunto de fun^óes de Green centradas nos pontos de dados de treinamento; os pesos lineares da camada de salda s¿o os únicos parámetros dcsconhc- cidos da rede. Campo Receptivo A matriz de covariancia Z determina o campo receptiva da fuñólo de base radial gaussiana G(||i - t |]r) dada na Eq (5.81). Para um centro predeterminado tl+ o campo receptivo de <?(||x - tj|c) é definido formalmente como o suporte da fun^So (5.83} onde ú é uma constante positiva (Xu et aL 1994). Em outras palavras, o campo receptivo de Gf|x - tj[f) é aquele subconjunto particular do dominio do vetor de entrada x para o qual G(]x - tj|f.) assume valores suficientemente grandes, maiores que o nivel prescrito a. Em uma forma correspondente ao modo como a matriz de ponderado de nertna C foi defini- da, podemos identificar tres cenirios diferentes relativos a matriz de covariancia E e sua influencia na forma, tamanho e orientaba do campo receptivo: 1. E = o1!, onde lea matriz identidade e é uma variáncia comum, Neste caso, o campo recep- tivo de G(||i — 11 (1 consiste de urna hipcrcsfcra centrada cm t c com ra i o determinado por O. 2* E = diag(G| ,<j;..), ondea* é a variáncia doy-¿sime elemento do vetor de entrada i cj = 1, 2,..., jnn. Ncstc segundo caso, o campo receptivo de G(|| x - 11 .} consiste de uma h i per-elipse cujos eíxos individuáis coinciden) com aqueles do espado de entrada e com a sua exíensáo ao longo do eixo J sendo determinada por a., 3+ E é uma matriz nao-diagonal - Por definirán, E é uma matriz definida positivamente. Portanto, podemos usar a transforniafáo de similaridade da álgebra matricial para decompor E como segue: E=QrAQ (5.84) onde Ac uma matriz diagonal e Q é uma matriz de rota^áo ortonormaL A matriz A determina a forma e o tamanho do campo receptivo, enguanto que a matriz Q determina a sua orientadlo. 5.8 O PROBLEMA DO XOR (REVISITADO) Considere novamente o problema do XOR (OU Exclusivo), que resolvemos no Capitulo 4 usando um perceptron de múltiplas camadas com uma única camada oculta. Aquí apresentaremos uma soluto para o mesmo problema usando uma rede RBF. A rede RBF a ser investigada consiste de um par de fiin^oes gaussianax, definidas como:
Hidden page
ende x c um vcior de entrada c d c o valor enrrespondente da salda desciada. Seja ^-6(111,-1,11). j-1.2,3,4, ¡=1,2 (5.88) Entla, usando ús valores da Tabela 5.2 na Eq. (5.88), obtemes o seguí inte conjunto de equafoes escritas na forma matricial: d (589) onde 1 1 0,3678 0.1353 T 0,3678 l (5.90) G = 0,1353 1 1 [o, 3678 0,3678 1_ d= [0 1 0 l]f <5.91} w = [tí1 Té.i 'r (5.92) O problema descrito aquí é supenieterminado no sentido de que temos mais pontos de dados que parámetros livres. Isto explica por que a matriz G nao é quadrada. Conseqüencemenle, nao existe uma inversa única para a malriz G. Para superarmos esta difieuldadc, usamos a soluqao de norma mínima da Eq. (5.78), c assim escrevemofi w = G+d = (GrG) Vrf (5.93) Note que GTG é uma matriz quadrada com uma inversa única. Subslituindo a Eq. (5.90) cm (5.93), obtemos F 1,8292 G' = 0,6727 -0,9202 -1,2509 0,6727 -1,2509 -1,2509 1,8292 -1,2509 1,4202 —0,9202 1,4202 (5.94) Finalmente, substituindo as Eqs. (5.91) e (5.94) em (5.93), ohtemos -2n5O¡K -2,5OÍ8 +2,8404 que completa a espceifica^ao da rede RBF.
Hidden page
(5.W) O X óttmo é o valor particular de X que minimiza /¡(X). Considere que FJi*) seja expressc come uma combinado linear do conjunto de observáveis cspccificado+ como segué: J=l (5.100) Na forma matricial, podemos escrever de forma equivalente F, = A(l)y (5.101) onde (5.102) A matriz A-pop/V A(X) é chamada de matriz de influencia. Usando esta notado matricial, podemos rescrever a Eq. (5.99) na forma 7 aun) jt onde o vetor f Mpor-1 é f-ÜW’J.A3K Podemos avanzar um passo na nossa formulando matricial rescrcvendo a Eq. (5.95) na forma y = f + e (5.104) onde
Hidden page
O erra medio quadrado sobre um conjunto específico de dados, ^(X), entretanto, n3o é uma medida prática porque requer o conbecimento da fun?ao de regressao fií), que é a fuñí So a ser reconstruida. Como uma estimado de £[F(X}], tntroduzi mos a seguirte defínifdo (Graven e Wahba, 1979) ¿(X.) = l||(l - A(X)Jy|‘ + £tr[ A2 (X)) - lr[(l - A(X))2] (5.1101 Esta estimaban nio tem bias, na medida em que podemos mostrar (seguirdo um procedimento similar ao descrito na derivado da Eq. (5.109)) que £1R (X)] = E[£(1)j (5.111) Conscqücnncmcntc^ o valor que minimiza a estimadlo F (X) pode ser tomado como uma boa esco- lta para o parámetro de regularizado X. Validado Cruzada Generalizada Uma desvantagem da estuuaifáo R(X) é queela requer o conheci mentó da variáncia do ruido tr2. Em situa^oes encontradas na pratica, <r3 e normalmente desconhecída. Para tratamos de situares desta natureza, podemos usar o core cito da valida^ao cruzada generalizada que foi proposta por Graven e Wahba(1979). Cometamos adaptando a forma usual de "deixar um de fbra” da validado cruzada {descrita no Capítulo 4) ao problema em questáo. Específicamente, seja FX1*^) a fundad que minimiza o funcional w>=?¿í>i - wi:+ (5.112) onde o A-ésimo termo [y. - F:(jíx)J foi dei íado de fbra do termo de erro padráo. Dcixando este termo de fbra, podemos utilizar a habilidade de de '"prever" o ponto de dado ausente como uma medida da qualidadc de X. Conscqücntcmcnlc, podemos introduzir a seguinte medida de qual idade (5.113) que depende apenas dos dados. A estíma^áo de valida^aij cruzada ordinaria de X é, ponanio, defi- nida como o valor que minimiza K0(X) (Wahba, 1990). Uma propriedade útil de F. ^(jQ é que, se o ponto de dado y. for substituido pela previsto F/*^} c o funcional de Tikhonov original da Eq. (5.98) for minimizado utilizando os pontos de dados/pjj....*/*» oblemos Fa|í|(k1) como soluto. Esta propriedade, juntamente com o futo de que para cada vetor de entrada x o FJx) que minimiza depende 1 i Reármenle de permite-nos escrever:
Hidden page
que, para sua computa^áo, depende apenas de quantidades relacionadas caen os dadas. Uma Propriedade Ótima da Fun$áo de Validagáo Cruzada Generalizada V(X) Considere que X minimizc o valor esperado da luinjáo de validafáo cruzada l'(X)- A incficiéncia da va for esperado do método de validado cruzada generalizada é definida por ,,= min £[/?(X)j (5.122) onde 7?(X) ¿o erro mediu quadrado sobré o conjunto de dados dado na Eq.(5.99). Naturalmente, o valor assintótico de 7* satisfaz a condiíáo Emoutras palavras, para Ar grande. a erro medio quadrado K(X) com X estimado pela minimizado da fundan P(X) deve ser próximo do menor valor possfvel de A(X), 0 que toma H /-) um bom método para estimar X. Resumindo os Comenta ríos A idéia geral é escolher o parámetro de regularizado X de forma a minimizar o erro médio quadra- do sobre o conjunto de dados, J?(X). Infelizmente; isto nao pode ser realizada adiarte, pois Jí(l) envolve a fun^áo de regresado deseonhecida^x). Com isso, hA duas posibilidades que podem ser seguidas na prática: • Se a variáncia do ruido G2 for conhedda, podemos usar o valor que minimiza a estimado R (X) da Eq. (5.110) como a cscolha ótima de X, ótima nn sentido de que ela também minimiza 7?(X). • Se n^ for wnhec ida, podemos u $ar o valor que min i mi za a fuñeAo de val idas ao cruzada generalizada P(X) da Eq. (5.121) como urna boa escolha de X»que produz um erro médio quadrado esperado que se aproxima do menor erro médio quadrado possívcl quando Ar —* O ponto importante a notar aquí é que a leerle que Justifica o uso da validado cruzada generalizada para estimar X c uma teoría assinlótica. Por isso. só podem ser esperados bons resultados quando o conjunto de dados disponível for suficientemente grande para que o sinal possa ser distinguido do ruido. A experiencia pratica com a validado cruzada generalizada parece mostrar que ela o robusta em relajo A ndo-homogeneidade de variáncias c a ruido náo-gaussiano (Wahba, 1990). Entretanto, é bastante provável que o método produza estimativas insatisfalórias do parámetro de regularizadlo X se o processo de ruido for altamente corre! ac i miado. Fmalmcnlc, faremos alguns comentarios a respeito do cálculo da lun^fio de validado cruzada generalizada í,r(X}, Para determinados valores experimentan do parámetro de regular izarán X, en- contrai o termo do denominador [tr(I-A(X)]/Ar']1 na fórmula da Eq. (5.121) é a parte mais cuitosa do opyrÍQhtcd mHterisI
Hidden page
Hidden page
Hidden page
5.11 COMPARADO ENTRE REDES RBF E PERCEPTRONS DE MÚLTIPLAS CAMADAS As redes de fundo de base radia! (RBF) e os perceptrons de múltiplas camadas {MLP) site cxcm- plos de redes em camadas alimentadas adi ante, naol meares. Ambos sáo aproxi madores uni versáis. Portante, náo causa surpresa a constatado de que sempre existe uma rede RBF capaz de imitar precisamente um MLP específico, ou vico versa. Entretanto, estas duas redes diferem entre si em vários aspectos importantes, 1. Uma rede RBF (na sua forma mais básica) tem uma única camada oculta, enguanto que um MLP pode ter uma ou mais camadas ocultas. 2, Típicamente, os nós computacionais de um MLR localizados em uma camada oculta cu em urna camada de saida, compartilham um modelo ncuronal comum. Por curro lado, os nós computan ionais na camada oculta de uma rede RBF site bastante diferentes c servem a um propósito diferente daqueles da camada de salda da rede. 3. A camada oculta de uma rede RBF é náo-linear, enguanto que a camada de sarda c linear. Entretanto, as camadas ocultas e de salda de um MLP usado como classificador de padrftes site normalmente todas na o- lineares. Quando o MLP c usado para resolver problemas de regrésate nfio-linear, uma camada linear para a saida é normalmente a escolha preferida. 4. O argumento da fundo de atívaqáo de cada untdade oculta em tima rede RBF calcula a norma {distancia) cuciidiana entre o vetor de entrada c o centro daquela unidade. Enquantc isso, a fundo de ativado de cada untdade oculta em um MLP calcula o produto interno do vetor de entrada pelo vetor de peso sináptico daquela unidade. 5+ Os MLP? constroem aprex ima^óes gfobafo de um mapeamento de entrada-saida náo- li near. Por □litro lado, as redes RBF utilizando rnte-linearidadcs localizadas com docairncnto exponencial (p.ex., fundes gaussianas) constroem aproximares foozfe para mapeamentos de entrada-saida nlc-lineares- Por sua vez, isto significa que para a aproximado de um mapeamento de enirada-saida nao-linear, o MLP requer um número menor de parámetros que a rede RBF para o mesmo grau de precls3o. As características lineares da camada de saida da rede RBF indicam que esta rede está mais próximamente relacionada com o perceptron de Rosenblatt do que com o perceptron de múltiplas camadas. Entretanto, a rede RBF difere do perceptron pela capacidade de implementar transforma- res náo-lineares arbínárías do espado de entrada. Isto é bem ilustrado pelo problema do XOR, que nSo pode ser resolvido por nenhum perceptron linear, mas que pode ser resolvido por uma rede RBF. 5J2 REGRESSÁO DE NÚCLEO E SUA RELAtJÁO COM AS REDES RBF A teoría das redes RBF apresenlada até agora está haseada na nc^áo de Interpolado. Nesta se^áo, consideramos um outro ponto de vista, o da regressao de núcleo fundamentada na nodo de estima- do de densidadr. Para sermos especlíleos, considere nevamente o modelo de rcgres&ite náo-lincar da Eq. (5.95) reproduzido aquí por conveniencia de apresenta^áo: ^-Xl.)+t., í-1,2...N
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
tí Uma scqücncia de vetores {ij ó chamada uma fñ/aenejú de Caudty se para todo e > 0 cuitir um número M tal que (Dcbnaih e Mikusinski, 1990) |Xn -1 ! < e para lodo (m. n) > M 9. Em Giioti el al. (1995), um método diferente para derivar a Eq- (5-55) c apresentado rclacionando-sc o termo de regulan zapito ^(F) achante á suavidade da aproHimali- vaF^iJu A suavidade é vista como medida da natureza oscilatória de uma ñin^áo. Em particu- lar diz-seque uma fuñólo c mais suave que uma outra funqáo se ela for metra oscilatoria. Em outras palavras, quanlo mais suave for uma furnjio, menor será o seu contcúdo de alta freqüéncia. Tonda em mente esta medida de suavidade, suponha que seja a transfor- mada de Fourier multidimensional de F(x), com s representando uma varié vd da transfor- mada multidimensional. Considere que H{i} represente uma fungto positiva que (ende a zero quando |¡s|| se aproxima do infinito, islo é, I¿H(b) representa a a?3o de um "filtro passa-aitas . Entilo, de acorde com Girasi el ai. í 1995), portentos definir um funcional de suavízalo nepuesentflndo o termo de regularizado como; onde mi} é a dimensáo de x. Em virtude do teorema de Parecvai da teoría de Fourier, este funcional c uma medida da potencia contida na saida do filtra passa-altas l///(t). Assim, dispondoo problema de regularizadlo no dominio de Fourier e usando as propriedades da transformad? de Fourier, a solucao da Eq. (5.55) b derivada. 1<L A forma mais gura I de um operador di fcrcncral linear c D= j?(jL,1^,...rxM ?——j-, a+í>+ + £ = « 1 J ftcfarf onde xt, JEj.sáo os elementos do vetor x, e p(jrp jt»..t^) é uma fim^So desse* elementos. O operador adjunto de D é (Morse e Feshbadc, 1953) 6”H)"’**........................x'‘“+A+'"+*=n IL. Pata obler a validaría cruzad? generalizada a partir de v?]i>da(?5o cruzada oniinária, pode- mos considerar um problema de regressao efe aresfa descrito cm Wahba (1990): y-Xa + t (l) onde X é uma matriz V -por- N de entradas, e o vetor ruido < tem um vetor média nulo e uma matriz de covariancia igual a o-[. Usando a deeomposicito d? valor singular de X, podemos escrever X-UDV pndu U e V sio matrize!; oitogonaig c [i c uma matriz d¡agonal. Seja y=Ury P=VT«
Hidden page
Hidden page
Hidden page
lx||;.=x'C'Cx 5.? Considere um termo de regularizado definido por | pF(xtf¿x = ¿n> í Ja* t>« J<t-“ onde . '«21 e o operador diferencial linear D é definido em termos do operador gradiente V e do operador Lapl aciano V1 como segué; £jií=(Vjr e Mostré que wto-Ét-^W IlH 5.S Na Sef&o 5,5t derivamos a funfSc aproximativa F^i) da Eq. (5.66) usando a relajo da Eq. (5.65). Neste problema, desojamos carrejar com a relapso da Eq. (5.65)c usar a trans- formado mullidimensLonal de Fourier para derivar a Eq. (5.66). Rcaiizc esta derivado usando a segurare definidlo da transformada muliidímensionel de Foutllt da fundió de Gteen Gfi): | G(x)exp(-ísri}íá[ onder = <-í e j í a variível transformada de dimensionalidade 5.9 Considere o problema de regrosar nao-linear descrito na Eq. (5-95). Considere que represente o lí-ésimo elemento da matriz inversa (G + XI) '. Com isso, comeando com a Eq. (5.58), mostre que a cslimafSo da fon^áo de tegress9o /(x) pode ser expresas como 7(x) = b* >1 onde i , é a saída do modele para a entrada xd, e +(x>ij=¿ü(|l»-xl||)íTlt, * = i,2..y l-l onde G(| í) ó a runfio de Groen. 5.1( 1 As spiine slo cxcmplos de aproximadores polinomiais por partes (Schumaker; 1981). A idéia básica por tris do método de splines é a seguinte. Uma r^gtlo de aproxima- do de interesse é dividida em um número finito de subregióes usando nós; os nós podem ser fixos, e nesle caso os aproximadores s3o tinearntMte parametrizados, ou eles podem ser variíveis, c neste caso os aproximadores sáo uno iitfearrwKte parametrizados. Em
Hidden page
Hidden page
(i) Considere urna setenio aleatoria de centros usando irt = 20 centros. Calcule j média, o desvio padrao e ou valores mínimo e máximo da prebabilidade de classificacdo cometa P para diferentes valores de páramenos de regulariza^io Á • Ot 0,1, l, 10, LOO, L 000. Para o cálculo das estatificas dos conjuntos, use 50 tentativas independen- íes. de redes por eiisemble, com cada urna testada em relajo a um conjunto de rete- rene?.! com 100(1 padrees. (b) Constma a frontina de decisáíi calculada para a ccnfiguracjilo descrita na parte (a), para o parámetro de regulan¿0930 k = L (c) Repita os cá leu Los descritos na pane (a1 para m, -10 centres (sclec ¡onados a I caloría’ mente). (ti) Com base nos scus resultados, discuta o mérito da sclc^áo al calón a de centres como um método para o prejetn óe redes RBF e o papel da regularizacSq no desempenho da rede como um classiiicador de padrñes. (e) Compare scus resultados com aqueles «presentados na Sefio 3.13 que foram calcula- da usando o método da interpolacáo estrila. Em particular, confirme que a selecta aleatoria de centros i relativamente insensivcl ao parámetro de rcgularizíi^áo. 5,15 Pode-se argumentar que no can do experimento descrito na Setfo 5,13 errvolvendo a cln^ificaijao de um par de classes com distribuieán gaus-:i:ina. a rede RBF lá considerada tem um bom desempeño porque usa fundóos de base radial gaussianas para aproximar as distribui^ues ctmd icioriai ü gflUSKÍanas de tldSíé subjauérttes. Neste problema, utilizamos um experimento computacional pera explorar o projelo de unía rede RBF gaussiana para iníerpolafdü estrita para distribuÍQóes condicionáis de elasse distintamente deseortlfriLuis. Fspeciticamente, considere duas classes eqüipro v¿vcis m c ¥ cuj.15 distribuidora • ¿'{<onde '< - íl, c uní circulo de ralo r - 2,34 centrado em x [-2* 30]7 * Mpt .X onde :£, C R! é urna regían quud: ud.i centrada cm x. corrí compranen(o de lado Aquí r.l(ÍJl representa uma distr ¡1 Ju.i; ü. ¡ uniforme -obre Í2 C F£\ Estes parámetros 530 escollados de modo que a regido de dccisáo para a elasse^, soja a mesma que no caso da üistTibuiqáo gau5si¿na con-idcrada na Sc^ao 5.13. investigue o uso de regularizado como um meló de melhorar o desempenho de classifica^áo de uma rede RBF gaussiana usando ¡nterpi>la^3o estrila.
CAPÍTULO 6 Máquinas de Vetor de Suporte 6.1 IMTRODUQÁO No Capitulo 4, cstudamos os perceptruns de múltiplas camadas tremados com o algoritmo de retruprepaga^áo. No Capitulo 5, escudamos uma outra classe de redes em camadas alimentadas adi ante, as redes de fundan de base radial. Ambas estas redes ncurais sao aprox i madores universa i s a scu próprici modo. Nesto capitulo, discutimos uma outra categoría de redes alimentadas adianto uní versáis, conhecidas como máquinas de vetor de suporte (MVS), propastas por Vapntk (Boscr, Guyon c Vapnik. 1992; Cortes c Vapnik, 1995; Vapnik, 1995,1998). Como os perceptrons de múl- úplas camadas c as redes de fiincáo base radial, as máquinas de vetor de suporte podem ser usadas para clasificado depadrdes e regressáo linear. Básicamente, a máquina de vetor de suporte é unta máquina ¡intuir com al guiñas propiedades muito inleressantes. Para explicar como cía funciona, (a i vez seja mais fácil comccarcom o caso de padrees separáveis que podem surgir no contexto de classificacáu de padrües. Neste Contexto, a idéia principal de uma máquina de vetor de suporte é construir um hiperplano como superficie de decisáo de tal forma que a margem de separado entre cxcmplos positivos c negativos seja máxima. A máquina aprésenla esta propriedade dcsejável seguí ndo uma abardagem fundamentada na teona da aprendizagem cstalística que c discutida no Capítulo 2. Mais precisamente, a máquina de vetor de suporte c uma implementado do método de rninimixaf&i estrutura! de risco. Este principio indutivQ é haseado no falo de que a laxa de erro de uma máquina de aprendizagem sobre dados de teste (i.e,. a laxa de erro de generalizadlo) é limitada pela soma da taxa de ero de treinamento e por um tormo que depende da d/me/isdó cíe Vapni^Citervaneakis no caso de padnocs separaveis. uma máquina de vetor de suporte prnduz um valor de zera para o primeiro termo e minimiza o segundo termo. Conseqüentemenieh a máquina de vetor de suporte pode fomoccr um bom desempe- nho de gcncralizafáo cm problemas do elassifícacáo de padrocs, apesar do falo de que ela náo incorpora conhecimento do dominio do problema. E7ste atributo é único das máquinas de vetor de suporte. Uma no0o que c central á construcáo do algoritmo de aprendizagem por vetor de suporte é o núcleo do produto ¡memo entre um “vetor de suporte11 xr c o vetor x retirado do espado de entrada.
Os vetares de suporte consistem de um pequeño subconjunto dos dadas de treinamento extraído pelo algoritmo. Dependendo de como este núcleo de produto interno é gerado, pódennos construir diferentes máquinas de aprendizagem. caracterizadas per superficies de dccisáo nao-]incares, pró- prias. Em pamcular, podemos usar o algoritmo de aprendizagem por vetor de suporte para construir os tres seguíntcs tipos de máquinas de aprendizagem (entre outros): • Máquinas de aprendizagem polinoin tal • Redes de fun^áo de base radial • Perceptrons de duas camadas (i.e.. com uma única camada oculta) Isto c, para cada urna deesas redes alimentadas adiante podemos usar o algoritmo de aprendizagem por vetor de suporte para implementar o processo de aprendizagem, usando um determinado con- junto de dados de treinamento, determinando automáticamente o número neecssário de unidades ocultas. Dito de outra forma: enquanto que o algoritmo de reiropropaga^oéplanejado específica- mente para treinar um perceptron de múltiplas camadas, o algoritmo de aprendizagem por vetor de suporte c de natureza mais genérica, porque tem uma aplicabilidadc mais ampia. Organizarás do Capítulo O corpo principal do capítulo está organizado em tres partes. Na prime ira parte, descrecemos as idéias básicas por tras de uma máquina de vetar de supone. Especiticamente, na Se^áo 6,2 discuti- mos a cnnstruqáo do hipcrplanos ót irnos para o caso simples de padrees lincamnente separáveis. A seguir, na Su^áo 6.3. considera-seo caso mais difícil de padróes nác-separaveis. Dessa forma, preparamos o caminlio para a segunda parte do capítulo, que aprésenla uma discussao detalhada da máquina de vetor de suporte para resolver tarefas de reconhec¡mente de padróes. Isso c feito na Sccáo 6.4. Na Secáa 6.5, revi sitamos o problema do XDR para ilustrar a constru^áo de urna máquina de vetor de suporte. Na Se<;3o 6.6, revisitames o experimento computacional sobre classificacáo de padróes que foi cstudado nos Capítulos 4 c 5, fomecendc assim uma avalia-^o comparativa das máquinas de vetor de suporte com os pcrecptrnns de múlti pías camadas tremados com o algoritmo de retropropaga?So e com as redes de funffio de base radial. A última parte do capitulo tratado problema da regressáo náo-linear. Na Seqáo 6.7 descreve- mos uma funqáo de perda que é bem adequada para este problema. Entao, na Sccáa 6.8, discutimos a construyo de uma máquina de vetor de suporte para regressáo náo-linear. O capitulo concluí com algumas considentfdes fináis na Sefáo 6.9. 6.2 HIPERPLANO ÓTIMO PARA PADRÓES LINEARMENTE SEPARAREIS Considere urna amostra de treinamento onde x é o padráo de entrada para o í-ésimo cxcmplo e ¿í é a resposta desejada correspondente (saida-alvo). Para come^ar, assum irnos que o padrao {classe] representado pelo subconjunto J, +1 e o padráo representado pelo subconjunto d =-] sáo “íincarmcntc separáveis‘h. A equa^áo de uma superficie dedoclsáo na forma de um hiperplano que realiza esta separaban é
onde x c um vetor de en irada. w é um vetor peso ajustávcl c b é um bias. Podemos assim escrever pairad = + l wrxr + R0 para 4 = "I (62) A pressupcbiyác de padtáes linearmenle separáveis ú (cita aquí para explicar a idéia básica par tras de uma máquina de vetar de suporte em um ceoário bastante simples; esta pressupnsiyáo sera rela- xada na Scyao 6.3. Para um dado vetar peso de w e bias b, a seporayáo entre o hiperplano definido na Eq. (6.1) e o ponto de dado mais próximo é denominada a margem de separarepresentada por p. O objetivo de uma máquina de vetor de suporte c encontrar o hipcrplana particular para o qual a margem de separaba# p é máxima. Sob esta condiyáo, a superficie de decisáo é referida como o hiperplano ótimo. A Figura 6.1 ilustra a construyan geométrica de uin hiperplano ótimo para um espayo de entrada bidimcnsional. Vclorts dC SAJpKlt FIGURA 6.1 Ilustradla da. Idéia de um hiperplano ótimo para padtóes lirtearmentó separáis Considere que w c b _ represen tem os valores étimos do vetor peso e dobias, respectivamente. Con sequen (emente, o hiperplano ótimo, representando uma superficie de decisao linear multidimensional no espayo de entrada, é definida por w[x + b0 = 0 (63) a que e a Eq. (6.1) rescrita. A fiinyio discriminante £<x)=w^+/ro (6.4) fomece uma medida algébrica da distancia de x até o hiperplano (Duda c Hart, 1973). Tal vez a modo mais fácil de ver arto seja expressar x coma
onde y c a proic^ao normal de i sobre o hifierplano étiuno, e r é a distancia algébrica dcsqada; r é positivo se x estiver no lado positivo do hiperplano étimo e negativo se x estiver no lado negativo. Como, por definí;ao. = C, resulta que SÍ») = + i, = r||w,|| ou £íij Hl (6-5) Em particular, a distancia da 01 igem (i.e., x = 0) até o hiperplano étimo é dada por t/|| wj|. Se > 0, a orígem está no lado positivo do hiperplano étimo; se bti < 0, cía está no lado negativo. Se ó _ 0, o hiperplano étimo ptissa pela origem. Uma inttrpreta;áo geométrica destes resultados algébricos ó dada na Fig. 6.2. FIGURA a.2 Interpretado geométrica das distancias algébricas de pontos até o hiperplano étimo para um caso bidimenslonal A questáo a resolver é encontrar os parámetros e £?., para o hiperplano étimo, dado o conjun- to de treinamento 9" {(x, tí)}. Com base nos resultados retratados na Fig. 6k2, vemos que o par (v. . bt) deve satisfazera restriban: + b,, > 1 para d1 =+1 + bt <—1 para = -1 (66) Note que se a Eq. (6.2) for válida, isto c, os padrees fbrem Hnearmente su-paraveis, podemos sempre escalar c bn de modo que a Eq. (6.6) seja válida; esta operagao de cscalamentn náo afela a Eq. (6.3). Os pontos de dados particulares (X, d) para os quais a prime.ra ou a segunda linha da Eq. (6.6) c satisfeita com o sinal de igualdade sáo chamados de veioivs de suparie, por isso o nome “máquina
MAQUINAS DE VETÜftnR Surt>RTE 353 de vetor de suporte11. Estes vetares dcsempenham um papel preeminente na operario desta elasse de máquinas de aprendizagem. Em termos conceituais, os vetares de suporte sao aqueles pontos de dados que se encontratn mais próximos da superficie de dccisao c sao, portanto, os mais di ficéis de classificar. Dessa forma, tém urna influencia direta na localizado ótima da superficie de decisao. Considere um vetor de suporte xÍJ- para o qual J° = +1. Entilo, por definido, temos g(ió1) = wjx"1 T ba T1 para</l’l=Tl (6.7) Da Eq. (6.5) a Jrstóncúr aígébríca do vetor de suporte x(í) até o hiperplano ótimo é se Jüí = +l se = -l (68) onde o sinal positivo indica que x1^ se encontra no lado positivo do hiperplano ótimo e o sinal negativo indica que xÍJ¡l está no lado negativo do hiperplano ótimo. Considere que p represente o valor ótimo da morgem Je separando entre as duas classes que constituem o conjunto de treinamen- to ST, EntSo, da Eq, (6.8) resulta que (6.9) A Equa^ao (6.9) afirma que maximizaramargem de separa^áo entre classes é equivalente a minimizar a norma euctidiana do vetor peso w. Em resumo, o hiperplano ótimo definido pela Eq. (6.3) é único no sentido de que o vetor peso fomece a máxima separado possível entre exemplos positivos c negativos. Esta condi^ao ótima é alcanzada minimizándose a norma euel¡diana do vetor peso w. Otimizaqao Cuadrática para Encontrar o Hiperplano Ótimo Nosso objetivo é desenvolver um proccdimcnto eficiente do ponto de vista computacional para, utilizando a amostra de treinamento 9" = {(x., )}* , encontrar o hiperplano ótimo, sujeito á restri- d1(WrX. + b) > l para i = 1,2,.*., Air (6 10)
Esta rcstri^áo combina as duas linhas da Eq. (6.6) com w usado no lugar de w. O problema de olimizaban restribo que temos que resolver pode agora ser formulado como; >'}-.i-i j a amostra tte mánamenta {(!_,;()} .. fWíwr/re os wrZores JírMíM tfo vetor peso w e bias b de modo que saiisfaqum as resina tres dfivd* - 6) > L para i = 1P 2..A' e O vefür ptSO W minimite 0 fiin^aíf tfe Luxlti. {b(yt) = O tator de escala JZ2 ¿ incluido aquí por conveniencia de aprcscnia^áo.. Este problema de otimiza^ao restrito é chamado de problemaprimoidiaí Ele é caracterizado tomo segue; • A íijrujáo de cusió <D(w) é uma fun^áo convexa de w. • As restrictos sác lineares em relajo a w. Conscquenlemente, podemos resolver o problema de olimizaqao restrito usando o método dos muitindicadores de Lagrange (Bert&ekas, 1995). Prime i ro, construimos a/wrt<íir lagrangiana: J(w, 6,ü) = — w7 w -^ajrf.íw1».+/>)-]] d-l (6.11) onde as variáveis aumliares nJü-nej¡alivas s3o chamadas de rtidiiplicadores de Lagrangc. A solu^áo para o problema de otimiza^ao restrito é determinada pelo ponto désela da funfSo lagrangian.i J(w, b, a), que deve ser mmfraizada em relajo íl w c a b-, ela lambem tem que ser maximizada cm rclaifao él a. Assim, diferenciando J(w, h, ot) em rela^áo aweaíc igualando os resollados a zero, oblemos as duas seguintes condifdesde _ . ¿tZ(w,6,ot) Cono i cao t: --------= 0 . . ¿E/(w,6,a) Cundí cao 2: ---------= 0 A aplicado da cóndilo de ocimiza^áu 1 á tün^ao lagrangiana da Eq. (6.11) produz (após remanejamento de termos) V w = Xff.4K. (6.12) A aplicacáo da condi^áo de olimizacao 2 á fiin^aa Lagrangiana da Eq. (6.11) produz
¿«4 = o I" I (6-13) O vetorsolutfo w ¿definido em termos de uma cxpuisio que cnvolve os JVexemplos de tiernamen- te. Note, entretanto» que, embora esta soluqao seja única em vi mide da convexidade da lagrangiana, o mesmc nao pode ser dito sobre os coeficientes de l jgrange, a Tambcra c importante notar que no ponto de sola, para cada multiplicador de Lagrange a , o produto daquele multiplicador pela sua restribo correspondente desaparece» como mostrado por a. [rfíwri. + b) - I ] = 0 para i = 1» 2,—» )V (6 14) Dessa forma, apenas aqueles multiplicadores que satisfazem examínente a Eq. (6.14) podem assu- rn ir valores nan-nulos. Esta propnedade resulta das connota de Kuhn-Tucktr da teoría da oliin ¡izando (Flelcher, 1987; Bertsekas» 1995). Como notado anteriormente, o problema primordial i i da com uma fundan de custo convexa e cora rcstrÍQocs lineares. Dado um problema de oliinizaqéo rusirito como esle» é possivcl construir um outro problema chamado de problema duaf. Este segundo problema tem o mesmo valor ótimo do problema primordial, mas cora os muí dpi icadorcs de Lagrangc fomcccndo a sclu^áo ótima. Em particular, podemos formular o seguinte teorema tía dualidad# (Bertsekas, 1995): (a) Se o problema primordial tem uma soluQáo ótima, cntáo o problema dual também tem uma soluto ótima, c os valores ótimos cocrespondentea sio iguais. (b) Para que wn seja urna soluto primordial ótima e o.u seja urna soIuqóo dual ótima» é necessár» e suficiente que wn seje realizável para o problema primordial, e w J = J( wp, , fín) = rriin J( w» b,, ) Para postular o problema dua! para o nosso problema primordial, primeiro expandimos a Eq. (6.11), termo a termo» como segue; । X ff .V J(nr>bta) = — wrw - tfdwrx, -í’Xce4 + (6.15) 2 i-i í-i i-i O terceiro termo no lado direito da Eq. (6.15) c zcro cm vinudc da condifáo de otimiza^áo da Eq. (6.13). Alcm disso, da Eq. (6.12) temos M ,v .v WfW= Tí?/?7!, = fi^^íTíÍZ/JJJXir]£y l-l 1=1 Ccnseqüentemente, fazendo a fün^o objetivo 7(w, b. á) £?(«), podemos reformular a Eq. (6.15) como ¿r | 9 .* 2(ff) = i-i ¿ i-i ;-i (6.16)
onde es a.sfio nao negativos. Podemos agora formular o problema dual: Dutki ii amostra de fftifíamctttü {(* s 4)}._r cumbre W muiiiptitíidoW ift LftffWiige {<*.}._, ¡fue urntímam aftmcaa objetivo & ti) - ¿ X -1 ¿ ¿ x>. jx^ccAa ái nsfrifw? (]) ¿aA-0 {2} u > 0 pura i = Z, 2,,,,rN Note que o problema dual é formulado inTeiramente em termos dos dados de treinamento. Além disso, a fcntQÍfo (J(a) a ser maximizada depende apenas dos padrees de entrada na forma de um conjunto de produl os escalares, {ij x.} _ . lia vende determinado os multiplicadores de Lagrangc étimos, representados por a , pode- mos calcular o vetor peso étimo wm usando a Eq, (6.12) e assim cscrever V w,=y X. jx > .I I > (617) Para calculare bias étimo podemos usaro v* assim obrido c tirar vaniagcm da Eq. (6.7) relativa ao vetor de suporte positivo, c assim esenver = parat^' sl (6.18) Propiedades Estatístícas do Hiperplano Ótímo Da teoría csíatíst ca da aprendizagem aprcscnlada no Capítulo relembrames que a dimensao V-C de uma máquina de aprendizagem determina o modo como uma estrutura aninhada de funfócs aproximar ivas deve ser usada. Também relemhramos que a dimensfo V-C de um conjunto de hiperplanos de separado em um espado de dimensional i dade m ó igual a jft - I. Entretanto, para aplicarmos o método da minimizacáo esrrutural de risco, descrito no Capitulo 2, precisamos cons- truir um conjunto de hiperplanos de separado de dimensao V-C variavel tal que o risco empírico (i.e., o erro de classifica?áo de treinamento) e a dintensáo V-C sejam minimizados ao mesmo tem- po. Em uma máquina de vetor do suporte c imposta uma estrutura sobre O conjunto de hiperplanos de separado rcsLrinyindo a norma cud'-diana do vetor peso w. Específicamente, pedemos formular o seguirte teorema (Vapnik, 1995,1998): Considere que D represente o diámetro Ja menor esfera cnntendn todos M velares de entrada x|4 x,,..., K.. O conjunto de liipcrp]anus ciliniüs descrito pr .i equa^áo
tem uma dimensáo V-C A limitada acima por (6 19} onde o sinal de máximo FJ1 representa o menor mteiro maior que ou igual ao número abnangido por ele, p i a margcm de separado igual a 2/||wj| cmüca dimensionalidade do espado de entrada. Este teorema nos diz que pedemos exercer controle sobre a dimensáo VC (i.e, a complexidade) do hiperplano étimo, independentemente da dimensional idade m( do espado de entrada, escolhendo adecuadamente a margem de separado p. Suponha entío que temos uma estrutura aninhada descola em termos dos hipeiplanos de sepa- racáo como segue: 5t = {wrx + fc ||w|'.r < cj, k = 1,2,... (6.20) Em vjrtude do limite superior h da dimensáo VC definido na Eq. (6.19), a estrutura aninhada descri- ta na Eq. (6.20) pode ser icformulada cm termos das margens de scpaia^ao na forma equivalente + l:p1>úé k = 1,2,*.. (62!) Os a, e ct sao constantes. Do Capitulo 2 também relembramos que. para obler urna boa capacidade de generalizadle, devemos selecionar a estrutura pan acular com a menor dimensáo V-C e erro de treinamento, de acorde com o principio da mmimizagao estrutura! de risco. Das Eqs. (6.19) c (6.21) vemos que esta exigencia pode ser satis feita usándole o hiperplano étimo (i.e., o hiperplano de separafáo com a maior margem de separado p). Equivalentemente, considerando a Eq. (6.9), devenios usar o vetor peso étimo wd tendo a norma euclidiana mínima. Assim. a escolha do hiperplano étimo como a superficie de decisáo para um conjunto de padróes linearmente separareis nao c apenas intuitiva- mente satisfatório, mas tambem está em completo cumplimento do principio de minimizafáo estru- tural de risco de uma máquina de vetor de suporte- 6.3 HIPERPLANO ÓTIMQ PARA PADRÓES NÁO-SEPARÁVEIS A discusslc até agora enfocou padróes linearmente separáveis. Nesta segáo, consideramos o caso mais difícil de padróes náo-separáveis. Dado um conjunto de dados de treinamento como este, náo é possírel construir um hiperplano de separarse sem nos defrontarmos com erres de classifícacac. Apesar disso, desojamos encontrar um hiperplano étimo que mlnimize a probabilidade de erro de classifica^áo, calculada como a média sobre o conjunto de treinamento. Diz'sc que a margan de separa^áo entre classes é strtiv se um ponto de dado (ip 4) violar a seguinte condigno (veja a Eq. (6.1D)); í/XwTl+¿)>+], /-],2...W Esta violadlo pode surgir de duas formas;
• O ponto de dado (s. d) se encontra dentro da ref.iao de separado, mas de todo córrete da superficie de dccisao, como ilustrado na Fig. 6-3a. FIGURA 6.3 (a) O ponto da dade x {pertenoBnls ¿ classe tj se encentra dentro da rogiáo ds sspara^áo. mas ne lado córrelo da superficie de daosao. (b) O ponlo de dado x, (pertenoente á dasw se enconlra no lado errado da superficie de decisáo • ü punto de dado (k , d) se encontra no Lado errado da superficie de decisfc^ como ilustrado na F' ifi. 6.3 b. Note que temos uma classifica^So cerrera no caso L, mas uma classiñca^áo incoireta no caso 2- Para preparar o terreno para um tratamento formal para □ caso do pontos de dados nao-separa* veis, introduzimos um novo conjunto de variáveis escalares nio negativas. {^,}iL_|f na dcfini^ao do hiperplano de separado (i.e., superficie de decisio) como mostrado aquí: ¿(w\ i 6) a 1 - i - 1,2.........A' (6.22) As £ sao chamadas de variáveis so¡¡aah medem o desvio de um ponto de dado da condi^ác ideal do separabilidade de padrees. Para 0 £ , o ponto de dado se encontra dentro da regiáo de separa' í¿ío. mas no lado córrete da superficie de decisto, como ilustrado na Fig. 6.3a. Para > l, ele se encentra no Lado errado do hiperplano de separando, como ilustrado na Fig. 6.3b. Os vetores de suporte sao aqueles pontos de dados particulares que smisfazem a Eq. (6.22) precisamente, mesmo se > 0. Note que se um exemplo com > 0 For dejado de fura do conjunto de treinamento, a superficie de dccisáo nao muda. Assim. os vclorcs de suporte sao definidos chatamente do mesmo modo tanto para o caso I i ricamente scparável como para o caso nao’ scparável. O nossa objetivo é encontrar um hiperplano de separado para o qual o erro de elassitica^áo, como media sobre o conjunto de treinamento, c minimizado. Podemos fuer isto minimizando o fuñe onal <f(O=¿AC-i> cm rclafáo ao vetor peso w, sujeito á restribo descrita na Eq. (6.22) c a restribo sobre ||w|-. A fundan /(ti é uma futi^ao indicadora, definida por
0 se c,< 0 se £>0 Infelizmente, a minimizado de <b(á) em rela^ao a w é um problema de otimiza^áo tiáo-convexo que é NP completo.2 Para tomar o problema matemáticamente iralávcl, aproximamos o funcional <&(£) escrevendo *>(£) = Além disso. simplificamos a computado formulando o funcional a ser minimizado em relajo ao vetar peso w como segue. wrw + C(623) * .-i Como anteriormente,, a minimizacáo do primeiro termo da Eq. (6.23) está relacionada com a minimizada da dimensáo V-C da máquina de vetar de supone. Assim como para o segundo termo ele é um limite superior para o número de erres de teste. A formuladlo da funpáa de custo <3>(w, C,) da Eq. (6.23) cslát portante, cm pcrfcilo acordo com o principio da miniir.iza^ao estrutural de risco. O parámetro C controla o compromisso entre a cumple* idade da máquina e o número de pontos nüo-separáveis; por isso. pode ser visto como uma forma de parámetro de “regularizado^ O parametro C deve ser selecionado pelo usuario. Isto pode ser feito de duas formas: * O parámetro C é determinado experimenfabnente através do uso padrao de um conjunto de treinamento/teste (validado), o que é unta forma grosseira de neamostragem. • Ele Ó determinado analíticamente estimando a dimensáo V-C através da Eq. (6.19) e entáo usando-se limites do desempenho de generalizado da máquina bascados na dimensao V-C. De qualquer forma, o funcional <P(w, c.) é oti misado em rela^áo a w e [^]^|? sujeito á restrillo descrita na Eq. (6.22) e £,.> 0. Fazendo isso» a norma quadrada de w e tratada como urna quanlidade a scr minimizada simultáneamente em rela^áo aos pontos náo-separáveis, e náo como uma rcstrid° imposta sobre a minimizado do número de pontos náo-separáveis. O problema de otimizado para, padrocs nao-separáveis assim formulado incluí o problema de ctimiza^o para padrifes linearmente separáveís con» um caso especial. Específicamente, fazer^, = 0 para todo í ñas Eqs. (6.22) e (6.23) as reduz ás formas correspondentes para o caso lirtearmente separáveL Podemos agora formalizar o problema primordial para o caso náo-separável como: Dada í¡ mwmtra de ireinamento {( K, ,di) j * (, eftctmlre ¡>x valorea ótimav do vetar peno w e do bias b de mt>do que sa¡ixfa$am a restricáo diívfJxi +• 6) £ I - para i = 1.2......?V 4, í 0 para todo:
flfcltto ¿¡Tta.3 ú /WO w e 05 iwíflvrá JülftB raJFrrmrZEAj tj /Sfflrrr.?rF.£j¿ tí? CUSfD 1 -ww + * onde C c 11 •i jwUne/w positivo especificado pelo usuario. Usando o método dos multiplicadores de Lagrange e prócttléndú de maneira similar á descrita na Se?áo 6.2, podemos formular o problema dual para padróes náo-separaveis como (veja o Problema 63): Dada a amenifttt de tfltitfümcniü -i.!..<()} - r ™cauUrt os fítultiplicadores de Lagrauge {a,} '. que maxffítiMm a /iuii'iio objetivo & a) = V ti, - - X £ a,aJ dtdrfxt ¿ ! .-¡jj/eífü ds F^7rrfÍ£".v (O = ° (2} D < « < C para i 1, 2,..., Ar nade C i' f¡in parámelntpOSflivtJ e.’.piLificadtrpelo uxliúrifi. Note que nem as varia veis solías nem os multiplicadores de Lagrange aparecen! no problema dual- O problema dual para o caso de padróes náo-separáveis é dessa forma similar aquele para o caso simples de padróes linearmente separa veis excetc por urna diferente pequeña mas importante. A fun^áo objetivo £(a) a ser maximizada c a mesma em ambos Os castos. O Caso nao-separável diferc do caso separase! pelo falo de que a restribad a. > £l ¿ substituida pela restricáo mais rigorosa 0 < a < C. Exceto por esla modificado, a otimiza^c resfrita para o caso itáo-separável e os cálcu- los dos valores étimos do vetor peso w e do bias b proccdem do mesmo modo como no caso linearmente separável. Note também que os vetores de suporte s^o definidos chatamente do mesmo modo como anteriormente. A suturo ótima para o vetor peso w é dada por (6-24) J-l onde A. c o número de vetores de suporte. A determinado dos valores étimos do bias também segue um precedimento>:mitarao descrito anteriormente. Específicamente, as condicócs de Kuhn- Tucker sáo agora definidas por [rfíw7!. +6} -1 +5J = 0, t = 1,2..........N ¿’l.l..Ar (625) (626)
A Equa^ao (6.25) c nina forma rcscrita da Eq. (6.14), cxccto pela substitu ¡(ao de termo da unidade por (I -1). Como na Eq. (6.26), os kl. sao multiplicadores de Lagrange que foram inlroduzidos para forjar a náo-negatividade das variáveis solt&s para todo i. No ponte de sela, a derivada da fon$ifo lagrang¡ana para o problema primordial cm rcla^áo á variávd solta £, ó zcro, produzmdo (&.27) Combinando as Eqs, (6.26) e (6.27), vemos que 0 se a < C (6.28) Podemos determinar o bias ótímo bu comando qualquer punco de dadu U. d) du conjunto de treina- mentó para o qual temos 0 < aw < C e com isso 0, e usando esle ponto de dado na Eq. (6.25). Entretanto, de uma perspectiva cm umcrica, c melhor [omar o valor media de bn resultante de todos estes pontos de dados da amostra de treinamento (Burges, 1998). 64 COMO CONSTRUIR UMA MÁQUINA DE VETOR DE SUPORTE PARA REO ON REGIMENTO DE PADRÓES Tundo cm máos o mater.al sobre corno encontrare hiperplano étimo para padrees nao- separa veis, podemos agora descrcver formal mente a construyo de uma máquina de vetor de suporte para urna tarefa de rcconhcci mentó de padrees. Básicamente, a ideia de uma máquina de vetar de suporte1 dependo de duas operares mate* máticas resumidas aquí e ilustradas na Fig. 6.4: «lirada {dados] FIGURA 8^4 y liru rtáó-lpnear ] dn aspado de entrada para o espada de CBracl?riEticM L O mapeamento nán-llnear de um vetor de entrada para um espado de características de alfa dimensionalidade, que c ocilllu da entrada c da saída. 2. A construpáo de um hiperplano ótímo para separar as caracterisl icas descobertas no passo I. A razáu para cada uma desta s duas uperaijces ¿ explicada a seguir,
A operario 1 é realizada de acorde com □ teorema de Covcr .robre a sepa rabil ¡dado de pa- drees, que c discutido na Capítulo 5. Considere um espado de entrada constituido dejMrfrtíes nao- Jinearmente separáveis. O teorema de Cover afirma que este espado mu Lt ¡dimensional pode ser transformado em um novo espado de características onde os padrees sao lineamnente separa veis com alta probabilidade, desde que duas condi^ocs sejam satisfeitas. Primeiro, a transFormapao é nao-linear. Segundo, a dimensionalidade do espado de características é suficientemente alta. Estas duas condifdes sSo incorporadas na operado 1. Note, entretanto, que o teorema de Cover discute k o l’.iperplano de separado c ótimo. É apenas pelo uso de um hiperplano de separado ótimo que a dimensio V-C c minimizada e a generalIzafSo é alcanzada. É nesta última questáo que entra a segunda opcraqáo. Específicamente, a operacáo 2 explora a idéia de construir um hiperplano de separado ólmno de acorde com a teoría desea ita na Sefáo 6.3, mas com urna diferen^a fundamental! o hiperplano de scparaqao c agora definido como uma fun^áo linear de vetores retirados do espado de características. em vez do espado de entrada original. O mais importante é que a construyo dcsCC hiperplano c realizada de acorde com o principio da mininiizacaa estrutural do risco que é fundamentada na teoría da dimensao V-C. A construí depende do cálculo do núcleo de um produto intemo. Núcleo do Produto Interno Considere que x represente um vetor retirado do espado de entrada, que é assumido como leudo dimensáo m . Considere que • <pt(x)} represente um conjunto de transforma^óes nao-lmeares do espado de entrada para o espado de características: m é a dimensáo do espado de características. Assume-sc que ip(x) c definido a priari para todo j. Dado este conjunto de transieren aedes n«Lo- lincarcs, podemos definir um hiperplano aluando como a superficie de dccisáo como segue: ’l] JwJip:(i)+¿f = 0 (6.29) .'=1 onde [w.' [ representa um conjunto de pesos lineares conectando o espado de características com o espace de saida, c b c o bias. Podemos simplificara dcscnvolv¡mentó cscrevcndo £u/p.(x) =0 (630) jr II onde foi assumido que lp„(x) = I para todo i, de modo que h . represente a bias \ A Equafáo (630) define a superficie de decisfc calculada no espado de características em termos dos pesos lineares da máquina. A quantidade rp,(x) representa a entrada fomecida ao peso ufravés do espado de características. Defina o vetor q>(x) = (q/x), q>| (k).tpm, (x)] ’ onde, por definido, temos tp tx)= I para toda i (631) (632)
Na verdade. o vetor <p( x) representa a "imagem' induzida no espado de características pelo vetor de entrada x, como ilustrado na Fig. 6.4, Assim, em tennos desta i magenta podemos definir a superficie de decisao na forma compacta; w’ipfx) = 0 <6-33) Adaptando a Eq. (6.12) á nossa presente situa^So envolvendo um espado de características onde procuramos agora a separabilidade “linear" de características, podemos escrever .V w = i-l (6.34) onde o vetor de características qj(i) corresponde ao padráo de entrada x. no j-csimo cxcmplo. Dessa forma1 substituindo a Eq. (6.34) cm (6.33)+ podemos definirá superficie de decisfo calculada no espado de características como: .V w = £ft/,<pr(x;)<p(x) = 0 I I <6.35} O termo tpr(x.)q)(K) representa o produto interno de dois vetores inducidos no espado de caracterís- ticas pelo vetor de entrada x e o padráo de entrada x relativo ao Msimc exemplo. Podemos entao introduzir o núcleo doproduto interno representado por x) c definido por /C(x1xe) = tpr(xMx1) J-fl para i = 1,2..N (6.36) Desta definido vemos i mediatamente que o núcleo do produto interno é urna fungao simétrica de SCUS argumentos, como mostrado por K(x, íj) = K(x} x) para todo i (6.37) Ornáis importante é que podemos usare núcleo do produto interno K(x, x) para construir o hiperplano ótimo no espado de características sem Lcr que considerar o próprío espado de características de forma explícita. Isto c visto fácilmente usando-se a Eq. (6.36) cm (6.35), de onde resulta que o hiperplano é agora definido por > ^a,</f(xTx1) = 0 =i <6.38} O Teorema de Me roer A expansao da Eq. (6.36) para o núcleo do produto interno /f(x, x) c um caso especial importante do teorema de Mercerqee aparece na anílise funcional. Este teorema pode ser formalmente formulado como (Mcrcer, 19D8; Courant e Hilbert, 1970):
Seja £(x. x) um núcleo 'métrico e continuo quu é definido no intervalo fechado a í x í b c da mesma forma para se'. O núcleo K(x, x') pode ser expandido na serie A\x.x') = (639) com coeficientes positivos X,>11 pura iodo r. Para esta expansáo ser válida e para convergir absoluta c uniformemente, é nccessário e suficiente que a eondi^So X(«. x ')1K x )Ú{ x' )¿/xdx' ¿ 0 J b J h seja válida para codo d*(*} para o qual > ‘ (i)Jx < “ J h As fungues tp.(x) sáo chairadasautqfimQoes da expansao c os números X sao chamados autovafores. O fatn de que todos os aulovalorcs sao positivos significa que o núcleo K(x, x1) c definida positiva- mente. Com base no teorema de M creer, podemos agora fazeras seguintes obsena^oes: * Para La j-ésima imagem ^l.tp^x) induzida no espado de características pelo vetor de entrada x é uma autofut^fc da expansáo. * Teori ca men te, a d i m ensioua I idade do espado de caracteristicas (Le., o número de autovalores / autofunfñes) pode ser fe i la infinitamente grande. O teorema de Merca apenas nos diz se um núcleo candidato é realmente um núcleo de produto interno em algum espado, c portante admissivel para uso em uma máquina de vetor de suporte, ou nao. Entretanto, ele nao diz nada sobre como construir as fun^oes tp(x): nós mesmos temos que fazer isto sozuihuí. Da cqua^áo de defin i^áo (6.23 k ventos que a máquma do vetnr de suporte incluí uma forma de regularizado cm um sentido impiieifa. Em particular, o uso de um núcleo Á'(x, x") definido de aconto com o teorema de Mereer corresponde á regularizarán com um operador I) tal que o núcleo A’(\, í é a funpfo de Grcen de f)D, onde Peo adjunto de D (Smola c Schülkopf, 1998}. A teoría da regularizarán ó discutida no Capítulo 5. Pro jeta Ótímo de uma Máquina de Vetar de Suporte A expansáo do núcleo de produto intemo K(x, x) na Eq. (6.36) nos permite construir uma superficie de decisao que ú náo-l near no espado do entrada, mas cuja imagem no espado de características ó linear. Com base nesla expansáo. podemos agora formulara forma dual para a otiimiza^áo restrita de uma máquina de vetor de suporte como segue: Dada t/ iifíjosfra de ¡tvinamcnht etreúnfre or ntn/tiptfcadóres de Lqgftbigé qw l¿ /jdrtlpA?
MÁQL JWAS VI: VeTUR DE SUPORTE 365 V | A g Ota) = Ja - T <6,40) r-| - i'*l /«J iu/Éltús ás resfrifóes: (1) j>X = o 1*1 (2) 0 Ot, £ C para r = 1T 2T..., A' onde C i um parámetro positivo especificado pelo usuario. No le que li restrillo (1) surge da oümizafáo do lagrangiano Q(oí) cm rela^áo ao bias b = para <pf(x) "1.0 problema dual formulado tem a mesma forma como no caso de padróes nüo-separáveis considerados na Sefáo 6-3, excetc pelo lato de que o produto interno x, usado lá foi substituido pelo núcleo do produto interno K(x;h x,). Podemos ver AlXj, i) cojeo o elemento ij de uma matriz simétrica A'-por-N K. como mostrado por K={*<’< «/JlL. cfi4l> Tendo encontrado os valores ¿timos dos multiplicadores de Lagrange, representados por cjt , pode* mos determinar o valor úiimo ootrespondente do vetor linear de peso, wu, que conecta o espado de características ao espado de saída adaptando a fórmula da Eq. (6.17) a nova situado. Específica- mente^ reconhecendo que a imagem qMjt) desempenha o papel de entrada para o vetor peso w, podemos definir como .V *,=.) (6-42> onde qKx.) é a imagem induzida no espado de características devido a if. Note que a primeira com- ponente de vi representa o bias óiimo b . Exemplos de Máquina de Vetor de Suporte A exigencia sobre o núcleo X(x, xj é que ele satisfaga o teorema de Mcrcer. Entretanto, dentro desta exigencia existe alguma liberdade cm como ele c cscolhido. Na Tabela 6.1, apresentamos resumida- mente os núcleos de produto intemo para tres tipos comuns de máquinas de vetor de suporte: a máquina de aprendizagem polinomial, a rede de fun^ao de base radial c o pcrccptwn de duas carna- das. Devemos notar os seguintes pontos: 1. Os núcleos de produto intemo puní as máquinas de vetor de supone dos tipos polinomial c fún^áo de base radial sempre satisfazem o teorema de M creer. Em contrapartida, o núcleo de produto interno para a máquina de vetor de suporte do tipo perceptron do duas camadas sofre alguma restribo, como indicado na última linha da Tabela 6.1. Isto mostra que determinar se um dado núcleo satisfaz ou náo o teorema de Mercer pode ser uma questáo difícil; veja o Problema 6.8.
TASELA 6-.1 fieaumo dos Núcleos de Prcdulo Interno Tipo dq máquina de vetar de supone Máquina de apreflctiíjifcm poLinom ¡il Rede de Funcáo de base radial Pcnceptrim di duaji carnadas Núcleo de produlo interno i,). J = L 2........-V Cnmentarins (x'i * * Lf otÍ—U-iii \ 2<T^ Unh[|luiri * A polénciap é especificada a prifíri pelo usuario A largura. 3J, ramum a todos os núcleos, é especificada a priori pelo usuario O retínenla de Menccr é sa- i isíci Lo apenas para alguns valorea de p5e p, 2, Par«i todos os tres tipos de máquina, a dimensionalidade do espado de características é determi- nada pela número de vetares de suporte extraídos dos dados de trei namcnlc pela solucáo de problema de otiniizafíc restrita. 3. A teoría fundamental de unta máquina de vetor de suporte evita a neccssidade de heurísticas freqúentemente usadas no projeta de redes de fun^ác de base radial e perceptrons de múltiplas camadas convencional s: • Na máquina de vetor de suporte do tipo fuñí3o de base radial, o número de lun^ocs de base radial e seus. centros sao determinados automáticamente pelo número de vetares de suporte e seus valores, respectivamente. * Na máquina de vetar de suporte do tipo pcrccptron de duas camadas, o número de neurónios ocultos e seus vetares de peso sto determinados automáticamente pelo número de vetores de suporte e seus valores, respectivamente. A Hgura 6.5 mostea a arquitetura de uma máquina de vetor de suporte. Independentcmcntc de como uma máquina de vetor de suporta c i ¡nplcmenlada, ela ihiere da abondagem convencional para o projeto de um perceptron de múltiplas camadas de uma forma fundamental. Na abordagem convencional, a complexidadc do modelo é controlada mantendo-se O número de características (i.e., neurónios ocultos) pequeño. Por quito lado, a máquina de vetor de suporte nfercce uma so!u?án para o projeto de uma máquina de aprendizagem controlando a com- ptfxidadcdo modelo independen [emente da dimcnsionalidadc, como resumido aquí (Vapnik, 1995. 199#): • O problema conceitita!. A dimcnsionalidadc do espado (oculto) de características ¿ feito propasi todamente muito grande para possib litar a construíáo de uma superficie de decisáo na forma de um hiperplano naquele espado. Paraum bom desempenho de generalizadlo, a complexidade do modelo é controlada pela imposto de certas rcstrípocs sobre a constru- íao do hipcrplanu de separa^au, que resulta na extraían de uma fraudo dos dados de treina- menta como velones de suporte. • O problema eomptifacional. A otim izaban em umérica em um espado de alta dimensional i dade sofre da ma LdifSo da dimensionalidadc. Este problema compulac tonal é evitado usando a nocíta de um núcleo de produto interno (definido de acorde com o teorema de Mcrccr) c rcsolvcndo-se a forma dual do problema de otimizdíáo retinta formulado no espado de (dados) entrada.
entrada de- de ". níki™ de tjntatihn ora prvdnta interno Inlmn» Fl GU R A £.5 Arquiteluis da máquina do votar do suporta 6.5 EXE M PLO: O PROB LE NI A DO XO R (REVISFTADO) Para ilustrar o procedí menta para c prívete de uma máquina de vetor de suporte^ revi si lames o problema de XOR (OU Exclusivo) discutido nos Capítulos 4 o 5. A1 abela 6.2 apresenta um resumo dos vítores de entrada e resposias desejad&s para os quatro estados possí veis. TABELA O Problema do XOR Vetar de entrada, i Resposla desejada. d í-1,+1) (+1.-1) (+L’I) —1 + L + L ”1 Para proseguíanos, considere (Cherkassky e Mulier. 199&) Á'(x, jQ’O + st'x )2 (6-43) Com x “ [xp v.]1' ei ’ [x:||Fx ]. podemosassim expressaro núcleo do produto interno Á'(x, x) em termos de monomios de vinas ordens como segue: íú(i1 ij) = 1 + + íx^j^Xfl + JCjjrjj + SxpXjT + 2x,xJ3 A imagem do veLúr de entrada i inducida no espado de características é, portanto, deduzida como rp( x) = [i, x V2X|X-, x Víip J7
Similarmcnlc, cp( k ,) = [1, <1,42r, rr, J, x,<, VZr,,J 2xf, ] i= 12,3,4 Da Eq. (6.41) tambem constatamos que "9 I ] l" 19 11 1 l 9 1 1 1 19 A fiin^ao objetivo para a forma dual c portanlo (veja a Eq. (6.40)) ¿Ha) = «! + a, + et, ± a4 -^(9aJ - 2ci|Ci: - 2aaT + 2rilcfJ +9cg + 2íi,a. - 2Oj«4 + 9a^ - Za¿a4 + 9ot‘) .4 otimizaijao de £7(ut> cm rcla^áo aos multiplicadores de Lagrange produZ’SC o seguirte conjunto de eq magues si multan cas; 9a, - a, - a, + a4 = I -a + 9a, + a, -a4 =*1 -a. h-Oj *9a? -a4 = 1 a, - a-, - a, + 9a4 = l Assim, os valares 6tirnos dos multiplicadores de Lagtange sao I i = j = = - c Este resultado indica que nesle exemplo todos os quátró vetores de entrada .V sao vetores de suporte. O valor ótimo de 0(a) c a(«)=7 4 Correspondente mente, podemos escrever ou
Da Eq. (6.42) resulta que o vetar O primeiro elemento de w indica que o bias b c zero. O hiperplano ótima ó definido par (veja a Eq. (6.33)) wurtp(i)=0 Isto éT que se reduz a - X(Xt = (J A forma polinomio] da máquina de vetor de suporte para o problema do XOR é mostrada na Fig. 6.6a, Para x( Xj -] eXj"Xj +L a saiday* -1 ; e para x, -1, xa“+1 ex, =+1 ex2 = -1, temos y = +1. Assim, o problema do XOR ó resolvida eemo indicado na Fig. 6.6b. 6.6 EXPERIMENTO COMPUTACIONAL Neste experi mentó computacional, revi sitamos o problema de classifiea^áo de padrifes que cshrda- mos nos Capítulos 4 e 5. O experimento envolveu a classifica^áo de duas di stribu ipóes gaussianas superponías rotuladas como 1 (classe^) e 2 (Classe j. Os gráficos de espalhamento para estes
Hidden page
Hidden page
Hidden page
Hidden page
Como anteriormente, assume-se que <p .1 \) - 1. de Corma que w _ representa o bias b. A questáo a ser resolvída c minimizara risco empírico '* -I (6.48} sujeito á desigualdade I W||J £ cü (6.49) onde crüé uma consiantc. A funpáo de perda insensível a t, é definida como ante nórmenle na Eq. (6.45). Podemos reformular este problema do olim izaban restrito introduziindo dois conjun- tos de variíhvjjsaltas náo-negativas e tlIJC s^° definidas como: í/j-w^x) < t-r^ í»l,21...iy 16.50} < e + i = l, 2, .... JV (6.51) ^>0, f- 1,2,...,-V (6.52) ?f>0, < = l,2 N (6.53) As variareis soltas e descrevem a funíáú de perda insensívcl a « definida na Eq. (6.45). Este problema de otimizacáo restrito pode ser, portantn, visto como equivalente ao da minimizado do funcional de custo O(w4$) = rr¿(^ + <f) l r + - w w 2 (6.54) sujeita as restribes das Eqs, (6.5C) a (h;53). Incorporando o termo wrw/2 no funcional d>(w. ^') da Eq. (6.54), dispensamos a ncccssidadc da rcstriQáodadesigualdade da Eq.(6.49). A constante C na Eq. (6.54) é um parámetro especificado pelo usiiArio. Conscqiicntcmcnte^ podemos definir a fun^áo lagrangiana: jr | * 4w.^1aT0c\Y1Y') = C^(4 +^) + -wrw - Ja )_*/.+€+^.' J-l * 1*1 .V l-l -I(YÁ, + ?a í-l (6.55)
Hidden page
Hidden page
Hidden page
ría do problema de prograjnaqáo quadrática cresce com o quadrado do tamanho da amostra de trcinamcnio. ConscqücnicmcntCj cm aplicantes da vida real que podem envolver varios militares de pontos de dados, o problema de programado quadrállca nío pode ser resolvido pelo uso direto de uma biblioteca comercial para otimiza^áo. Osuna ct al. (1997) desenvolverán um algoritmo de dccnmposiqao original que realiza a olimizaijao resol vendo uma seqüenria de subpreblcmas muito menores. Em particular, o algoritmo dedecomposii^o lira proveito dos coeficientes dos vetores de suporte que esláo ativos cm ambos os lados de suas froniciras definidas por a-Oea = C. Elcs relatara que o algoritmo de decompositSa tem um desempenho satisfatórlo em aplicares com 100. WO pontos de dados. Em termos de tempo de execu^áo, as máquinas de vetoe de suporte sao atualmcrttc mais lentas que cutías redes neurais ip.cx., perceptrons de múltiplas camadas tremados com o algoritmo do rctroprnpagacáo} para um desempenho de generalizado similar. Há duas razües para este compor- tamento mais lenio: l. Nao há controle sobre o número de pontos de dados sclccionados pelo algoritmo de aprendíza- gem para serem usados como vetores de suporte. 2r Nao há meios para incorporar conhecimento previo sobre a larefa em questáo no projelo da máquina de aprendizagem. Agora discutiremos brevemente algumas modificares da máquina de vetor de suporte com o illtui- to de tratar destas deficiencias. A questáo de como controlar a sclctjao de vetores de suporte c difícil, particularmente quando os padrees a scrcm elassificados sáo n3o-separáve¡s e os dados de treinamento sao ruidosos. Em geral, as tentativas de remover erras can heridos do* dadas antes da treinamento ou de removc-las da expansáo após o treinamento nao daráo o mesmo h pcrplano ótimo, porque os erres sao nccessá- rio* para penalizar a nán-separabilidade. Em Osuna c Giros! (1998), fin investigado o problema da reducto do tempo de rxucuqáo de uma máquina dt vetor de suporte para classifica^áo de padrees. Duas aberdagens ¡novadoras para o f ralamente deste problema sáo descritas: • A própria máquina de vetor de suporte c usada como uma ferramenta para regressiEo náo- lincar para aproximar a superficie de dccisac (separando as classes) com uma precisan especificada pelo usuario. * O proccdimcnto para treinar a máquina de veEor de suporte ó rcformulado para producir exatamente a mesma superficie de decisia, utilizando um menor número de fuñados de base. Na primo ira abordagetn, a soluto é simplificada aproximando-a por uma combinarán linear de um .iubcüfijatitty das fun^ocs de base. A máquina resultante e uma extensáo natural da máquina de vetor de suporte para aproximado de tunean. Esta extensáo c proj ciada para encontrar o mi tilmo de um funcional de custo da seguirte formal =¿ rf, - FM, 2L onde F( ) é uma funcáo aproximativa, ib(')^ unfl funcional de suavizarán e|x|( é a funche de custo instes ívcl a t definida por
Hidden page
NOTAS E REFERÉNCIAS 1, Seja (fl un subconjunft} de R’’. Diz-se que o subconjunto c comr.vo se cít i (I - d) i' c para todo (x, 1} e *8 c ft e [0, I ] Diz-se que urna tundióJt 't —► R é uma convexa se /crjt - (1 -ct).r) < -ajfly) para todo (jr,F)ef¿ e ere [0,1] 2. Sendo a complcxidadc computa r.onal a quisto de interesse, podemos identificar duas clases de algoritmos: • Algoritmos tit- tempo polinomieth que raquercm um lempo de cxccu^ao que c uma funcao polinomial do tamanhodo problema. Por exemplo, o algoritmo da transforma- da rápida de Fouricr (FFL/uv íbrtrár /hon^bnnXusual mcnlc cmprcgado para análi- se espedía L 4 um algoritmo de tempo polinomial pois reqtier um tempo de execu^áo da ordem de wlogw, onde n c uma medida do tamanho d<i problema- • Algoritmos lempa exponencial. que requeren] uiü tempo de ex.ee u^áo que é urna funcáo exponencial do tamanho do problema. Por exemplo, um algoritmo de lempo exponencial pude Levar um tempo 2', onde n é uma medida do tamanho do problema. Com base nisso, podemos vct os algoritmos de tempo polinomial como algoriimos 'efici- entes" o os. ai.i'üriimofi de lempo exponencial como algoritmos “ijwfic ¡entes" Há mu । ios problemas compulacionais que aparecen] na prfttitai, para os quais nenhum algoritmo eficiente pode ser encontrado. Diz-se que mu ¡tos. senáo lodos, estes problemas aparcnicmcnic iírtralávtis pcrlencem a uma classette problemas referida como problemas ^completas. O termo 'NPH significa “náodctcnninisticamcnlcpolinomial”. Para uma discussst) nu i < detalhada sobre problemas NP completos. veaConk (1971). Garey e Johnson (1979) e Gormen el al. (1990). 3, A idcia de um núcleo de produto inlcmo foi usada primeiramente por Aizcrman ct Sil (1964a, 19Mb) na formuladlo do método das fundóos de potencial, que é o percursor das reden de fundarj de base radial. Ao mesmo tempo, Vapr.ik e Cheryonenkéi (19651 desen- volveren! a ideia de um hiperplano ¿timo. O uw combinatlu destes dois poderosos concci- tos na formuladlo da máquina de veiordc suporte foi proposto porVapmk e co autores em 1992; veja Boscr. Guyon e Vapnik (1992) eCoctes tVapnik (1995). Uma anal irse matemá- tica completa da máquina de vetor de suporte foi pninr ramentedescritaem Vapnik (1995) e íiubscquEntemente em uma forma n: u i $ expandida em Vapnik (199R). 4. A teoría minimax de Hubcr c bascada cm víziuhan^as que náo sao globais cm virtude de excluirem distribui^des ass -nétricas. Apesar disso, esta tecn ia trata com sucesso de ama grande parte da eslatisriea tradicional, particularmente a regressáo. 5- Em Sehinrnars (1997). o uso de program acáo I i ncar c explorado adotando-sc a norma £ , w |r no lugar da norma |*¡|,. que c usada cm máquinas de vcior de suporte. A norma £, do vcior peso w c definida por l*l!i = 5>r| onde ir é o j -éslmo elemento de w. Aparentemente, a class ¡ i icario pormargem máxima usando a norma f., lem um víéh em direcaa a hiperplanos com oricntacócs axtas, istoé, em direcáo a vetores de peso com poucos elementos diferentes de aero. 6. Afr bibliotecas comerciáis para programacáo quadratica incluem: • MINOS5A: i Murlagli e Saundera. 1978) • IhSSOL (Gilí eral-, 1986) • LOQO (Vandcrbei, 1994) • QPOPT e 5QOPT (Gilí e Munwy; 1991)
Máquinas de V ltor de. 5.; i k i i 381 PROBLEMAS Hiperplano de separado étimo 6.1 Considere o case de um hiperplano paro padróes Linearmente separávds, que c definido pela cquic&) wri +1 = 0 ande w representa O velar peso, i'? representa o hias e x representa o vetor de enlrada. Diz- sc que o hipcrplaiKi corresponde a umjwr cofflÑiréa {w, ¿) se, para o conjunto de padróes de entrada {i |t for satisfeita a exigencia adiciona] min |wJx +i|= ] J 1 Mostré que cala exigencia causa uma margem de separa^ao entre as duas classes igual a 2f 11*1 • 6.2 Ju.stifique .i wguinte afirma, .i-. । no contexto Jj padróes nao-sepa rávn i;; classi"Ica^ao inconeia implica náti-separahil idade de pftdrúes, mas o centrino tiño é ncccssariamcntc verdadeiro. 6.3 Come cando com o problema primordial para a o:imizafáo do hiperplano do separado para padróes ndo-separavri!^ Tonnule o problema dual cumi) descrito na Se^au 6.3. 6.4 Méate problema, exploramos o “método dtixe um de fora"1, disculido no Capilulo 4, para estimar o erro de teste esperado produzido por um hiperplano étimo para o caso de pa* dróts niiT-sépa.rávéi-i. Discuta lis varias pr^sibilidadex que podem Sürg:r raí usó de Ate mé- todo pela d un i nació de um padrau qu Jqucrdfi amostra de (n.1 inamento c construindo uma soluto baaeada nos padróes restantes. 6-5 A lociilizí^áo do hiperplano lirmri no espado- de dados é determinada pelos pontos de dados sclcc¡onados como vetores de suporto. Seos dados forem ruidosos, a primeira reacio pedería ser questiiinar a mbuíílez da margem de KpWSfiO i presenta de ruido. Contudo. um estado cuidadoso do hiperplano ót mo revela que a margem de sépamelo c realmente robusta a ruido. Discuta a razao para este coinportamenlo robusto. Núcleo de produto Interno h.6 O núckxi de produto intemo K(i, i) í calculado sübte urna amostra de treinamento T de tamanho A'", produzindo a matriz iV-por- Ni K=U;f ftiirig K^V -. ). A mairi/ K ¿ pMili^i. ¡:-. qui: todos OS MtiB elementos tém valores positivos. Ufando a transformrcao de similaridadc: KQAQr onde A é uma mRtrfz diajpmal de auluvalores c Q c uma matriz constituida dos autovetores correspondentes, formule uma expresslo para o núcleo de produto interno Mx., i) em termos dos autovalorcs o dos aulovetom da mstri/- K. Que conclusoes vocc pode tirar desta repnesentaQio? 6.7 (a) Prove a fiFüprivdadc' de inwit iátjciü uHitáriu de núcleo de produto interno A l k, x isto é, = A(Qk, Qi)
Hidden page
Hidden page
de base radial, constma o hiperplano ótimo c identifique os vetores de suporte para este conjunto de dados. fij 5 O experimento computacional descrito na Se(3o 6.6 foi para a classifícafto de duas dis- tribuiQócs gaussianas superpostas. O seguidle pajamciru de “regularizado" foi usado na- quele experimento: C 0,1. A largura comum das fiuiffles de base radial usadas para construiros núcleos deproduto intemo foi o? "4. Repíta o experimento computacional descrito naquela se^áo para os dots valores seguintes do parámetro de regularizado; (s) C-0,05 (b) C=0,2 Comente os scus resultados com base ñas considcra^ócs relatadas na Scijao 6.í> 6.16 Ao aplicar as redes de fiintjáo de base radial a problemas de rcgressáo mío-linear, frcqücntcmcntc constatamos que o uso de uma fundan de base nao-localizada como a cnuliiquÁdrica resulta em uma solu^to mais precisa que o uso de uma furrio de base localizada como a fun^áo gaussiana. Podc-sc conjeturar que uma situado similar surge no caso das máquinas de vetor de suporte, porque o uso de uma máquina de aprendizagem polinumial (ilimitada) pode se mostrar nute precia que uma maquina de funqao de base radial (limitada). Usando um experimento computacional em um problema de regnessáo náo-1 incar, explore a validado desta conjetura.
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
FIGURA 7.4 DesHinpenho da erro conMduai do algoritmo AdaBoost N liiiicm <k ilrrji,vcs de rcíiH^Li ser novamente enfatizado que a análise de margem aprcscntada cm Schapirc ct al. {1997) c especi- fica para o AdaBoost c nao se aplica a cutres digerí Irnos de reforjo. 7.5 EXPERIMENTO COMPUTACIONAL II Neste experimente, explorarnos o algoritmo de reforcé por fíltragem para resolver uma (arela de dastificafflo de padrees razoavelmente difíci I. O problema de classifica^ao c bidimensionak cnvol- vendo regióos de decisáo nao-convexas, como mostrado na Fig. 7.5. Uma elasse de padrees consisto de ponfos de dados que se encontrara dentro da regiáo rotulada como 'í ea outra classe de padrees consiste de pontos de dados dentro da regido rotulada como f€r Ü objetivo é projetar uma máquina de comité que decida se um padrao de teste pertence á classe % ou a clpsse A máqu ina de comité usada para solucionar este problema consi slc de tres especialistas. Cada especialisla consiste de um perceptron de múltiplas camadas 2-5-2 que tem dais nós de entrada, cinco neurónios, ocultos edois neurónios de salda. Foi usado o algoritmo de retroprapaga^áo para realizar o treinamento. A Figura 7.6 moscra gráficos de espalhamcnto dos dados usados para treinar Os trés especialistas. Os dados mostradas na Fig. 7.6a forani usados para treinar o especialista 1. Os dados mostrados na Fig. 7.6b foram filtrados pelo especialista I apos seu treinamento estar concluido; este conjunto de dados foi usado para treinar o especialista 2. Os dados mostrados na Fig. 7.6c foram filtrados pela combinada dos especialistas I e 2; este conjunto de dados foi usado para (reinar o especialista 3. O tamanho da amostra de treinamento para cada especialista foi jV = 1000 padrees. Examinando estas tres figuras, observamos quci * Os dados de treinamento para o especialista 1 na Fig. 7.6a sao uniformemente distribuidos, • Os dados de treinamento para o espec i a 1 ista 2 na Fig. 7.6b ex ¡bem concentrares de pontos de dados ñas áreas A e B que sao aparentemente dificcis de scrcm clarificados pelo primei-
FIGURA 7.5 ConliguraGóéS. de padróes para q experimenta sabré reforjo (c) FIGURA 7.6 Grálitos de ospalnamento pam o ireinamenio de especial, sias no experimento compulacJocal sobre retarvü (a) Especialista 1- (b) Especialista 2. (c) Especialista 3
40Ü REOS N CURAIS ro especialista. O número de pontos de dados fiestas duas regides é igual ao número dos pontos dassificados carrctamcnte. • Os dados de treinamento para o especialista 3 na Fig. 7.6c exibem uma conten tramito aínda maior de pontos de dados aparentemente di Roéis de serem classificados por ambos os espe- cialistas 1 c2. As Figuras 7.7a, 7.7b e 7.7c mostram as fronteiras de deeisáo formadas pelos especialistas lt 2 c 3, respectivamente. A Figura 7.7d mostra a fronteira de decisao global formada pela a^o combinada de todos os tres especialistas, que c obtida simplesmente pela soma de suas saidas individuáis. Note que a difcnznfa entre as nepiúes de decisSo das figs. 1.7a e 7.7b relativas aos especialistas I c 2 define adistribuifáo de pontos de dados da Fig. 7.6c usada para treinar o especulóla 3. FIGURA 7.7 Franteiras de tfecisáD fermgdes pelos diferentes especialistas no 8Mp&rimentó sobre rafbe^p. (a) Espe- cialista 1. {t>> Especialista 2. (c) Especialista 3 (d) Máquina de cemita inl&ira As probabilidades de elassiílca^io cerreta para os tres especialistas sobre os dados de teste foram:
Especialista 1: 75J5 pórtenlo Especialista 2: 71,44 pórtenlo Especialista 3; 6^ ,90 por coito A probabi] idade global de classifieaciio córrela para a máquina de comí le intvira foi de 91,79 por eento, que foi calculada usando 32.000 padróes de dados de teste- A frontera de decisáo global construida pelo algoritmo de reforjo para os tres especialistas mostrada na Fig. 7.7d c uma eviden- cia a mais dcstc bom desempenho de classi lica^áo. 7.6 MODELO DE MISTURA GAUSSIANO ASSOCIATIVO Na segunda parte do capítulo, combando com esta ScQta, cstudamos a segunda classe de máquinas de comité, ou seja as cstruluras dinámicas. O termo “dinámica*’ é usado aquí no sentido de que a integrarán do conhecimonto adquirido pelos especialistas c realizada sob a aqáo do sinal de entrada. Para comcfar a discussao, considere uma rede modular na qual o processo de aprendizagem acontece fundindo de um modo suave as formas auto-organizada c supervisionada. Os especialistas técnicamente realizara aprendizagem supervisionada na medida em que as suas saidas indh kluais sáo combinadas para modelar a resposta desojada. Pcrcchc-sc. entretanto, que os especia lisias estáo tambem realizando aprendizagem auto-organizada: isto c, cíes se auto-organizam para encontrar um boa pariicao do espapo de entrada de modo que cada especialista modele bem seu próprio subespapo, e como grupo modelara bom o espado de entrada. No esquema de aprendizagem rccem-descrito, há um ponlo de afastamcnlo dos esquemas considerados nos tres capítulos anteriores no qual se assumc um modelo específico para a gera^áo de dados de treinamento. Modelo Probabilísimo de Gera^fto Para fíxaras ideias, considere um problema de regresróo no qual um velor de regressáo x pruduz urna reposta representada pela variável aleatoria D; uma realizaqao desta variavcl aleatoria c repre- sentada por d. Sera penda de general idade, adatamos uma furnia escalar de rugrcssáo, meramente para simplificara apresenta^áo. Específicamente, assum irnos que a gerafáo da resposia égover- nada pelo seguinte modelo probabilisticn (Jordán e Jacobs, 1995): 1, Um vetor de entrada x ¿ escolhidn aleatoriamente de urna distribuirán previa. 2, I Jifia regra particular, digacnos a regra A, é sel i>c Loimda de aCordo cora a probabi 1 i tladc condi- cional F(t|x. dado i e um vetor de parámetros a101. 3. Para a regra “ 1,2,..., A’, a reí posta do modelo d é linear em x. com um erro aditivo t( modelado como uma variávcl aleatoria com distribuíi^áo gaussiana com media zcro c variáncia unilán:i; Mí,] “0 para lodo A (7.17) e varfe¡J = 1 para todo k (7.1 &)
Em relajo ao ponto 3. a suposi^ao da variáncia unitaria ó feita apenas por simplicidade didatica. Em geral, cada especialista tem uma variáncia de saida diferente que pode ser aprendida dos dados de treinamento. A geracao probabil feúca de D c determinada pela probabilidade condiciona! = d 1x, w1¡t") dado x c um vetor de parámetros w*/", para k = 1,2,...,K. Náo exigimos que o modelo probabilistico de gerafño aquí descrito de va ter uma correspondencia dircta com urna reali dade física. Em vez disso, apenas exigimos que as dccisoes probabilisticas incorporadas ncle rtpresentcm um modelo abstraía. o qual com precisan incremental especifique a localizapáo da media condicional da rrs- pojta d em uma variedad*.' nito- linear que relaciona o vetor de entrada á saida media (Jordán, 19941. De acardo com este modelo, a resposta Z) pode ser gerada de K diferentes modos, corrcspündendo ás K cscolhas do rótulo A. Assim, a probabilidade condicional de gerar a resposta D í/, dado O vetor de entrada k, ó igual a * P{D = d! = £/>(D = d | x, wf’) /’(*|x, a(í") {7.19} i-l onde G1''' é o vcior de parámetros do modelo de gemido representando a comb i i iai;áo de a'"J c {. O índice Ü em a101 é usado para distinguir os parámetros do modelo de geracao daquclcs do modelo de mistura de especialistas, considerado a seguir. Modelo de Mistura de Especialistas Considere a coniigura^ao de rede da Fig. 7.S, referida como um modelo de mistura de especialistas Específicamente, consiste de módulos supereisionados chamados de redes de especialis- tas ou simptesmeníe especialistas, c de uma unidade integradora chamada de rede dcpasnagcm que desempenha a fun^áo de um mediador entre as redes de especialistas. Assume-se aqui que os dife- rentes especialistas funcionara melhor cm regí oes ditcTcntcs do espado de entrada de acorde com O modelo probabil i st i cü de gera^áo descrito, por isso a necessidade da rede de passagem. Como se assum iu que o problema de regressáo é escalar, cada rede especialista consiste de um liltro linear. A Fig. 7.9 mostra o gralo de Ouxo de sinal de um único neurónio que constituí o especialista*. Assim, a saida produzida pelo especialista í é o produto interno do vetor de entrada x e o vetor peso sináptico w dcstc neurénio, como mostrado por rt=w[x, A = L2,...rX' C7.2Ü) A rede de passageni consiste de urna única camada de K neurónios, com cada neurónio atribuido a um especialista especifico. A J’i gura 7.1 Oa mostra o grafo arqu iletu ral da rede de passagem c a Fig. 7.10b mostea o grafo de fluxc de si nal do neurónio A daquela rede. Ao contrario dos especialistas, os neurónios da rede de passagem sao náo-1 incarcs, com suas funches de ativa0o definidas por _ exp(j<) seKpí,ip J-1 *=1,2...K (7-21)
FIGURA 7-9 Diagrama am blocas do modelo ME; as saídas escalares eos aspeclalistas sSd mediadas púr uma rede de púSSagsm FIGURA ?.& Grata de fluno de ai¡nal de um .jn en neurónio linear que ccnell- tu 0 especialista k onde é o produto interno do vetor de entrada x pelo vetor peso sináplico a: isto é, iit = Afií A = 1,2,...,K (1.22) A transformaqáo exponencial "normalizada11 da Eq. (7.21) pode ser vista como uma generalizado da funqáo logística para múltiplas entradas. Ela preserva a ordem hierárquioa dos seus valores de entrada e é uma generalizado diferenciável da opemfáo "o vencedor leva tudo” de cscolha do valor máximo. Por esta razao, a fun^áo dcativaqáo da Eq. (7.21) ó referida como ¿¡ufimax (Bridle, 1990a). Mole que a dependencia Linear de ut em rela^ao á entrada x toma as saldas da rede de passagem fun^ocs nao-lineares de x. Para uma interpretado probabitístioa do papel da rede de passagem> podemos veda como um “classifícador” que mapeia o vetor de entrada x em probabilidades muitinomiais de modo que os diferentes especialistas seiño capazos de encontrar a respcsla desojada (Jordán t Jacobs» 1995).
Fl G U RA 7,10 (a) Camada única dft neurónios síiFlmax púa u rede de passagom. (b) Grato da lluxo (K sinal de um neurnnÍD satfrnaji Mais importante que ¡aso é o fato de que o uso da softmax como a fundan de ativa^ao para a rede de passagem assegura que estas proba ti kJados satislazcm as seguíales exigencias: 1 para todo A (7-23) (7.24) Considere quej. represente a saida do especialista A- em respasta ao vetor de entrada x. A saida global do modelo ME ó K ‘ = L&Z (7.25) i-l onde, como sal i catado anteriormente^ k( é urna íun^áo nílo-linear de x. Dado que a regra k do modelo prnbahi listico seja solee¡onada e que a entrada seja uma saida individual jr. é tratada como a media condicional da variávcl aleatoria D, como mostrado por = w(i, * = (7.26) Com ii. representando a média condicional de podemos esenever LJi “ .11, ’ 2.........A' (7.27)
A varitocia de D é a mestna de erro c. Assim» invocando o uso da Eq. (7,1 8), podemos escrever var[D|x,*]=l, *=1,2,..,* (7.28) Dado o vetor de entrada k e dado que a regra k do modelo prabab dístico de gera^áo (i.e.» o especi- alista ft) seja selecionada, a funqta de densidade de probabilidade de D pode, portante» ser descrita como: 1 ( = -rtckP 1 M ¿71 \ ¿ / Á—1»2, ...,* (7.29) onde G é um vetor parámetro que representa os parámetros tanto da rede de passagem como dos especialistas do modelo ME. A íún^áo densidade de probabilidade de D, dado x, ¿ a mistura das fundes de densidade de probabilidades »com os parámetros de mistura sendo as pro- babilidades multinomiais determinadas pela rede de passagem. Podemos entao escrever l-t (730) A distribuifáo de probabi! idade da Eq, (7.30) é denominada um modelo de mistura gaussiano associaiivü. A sua contrapartida náoassociativa é o modelo de mistura gaussiano tradicional (Titteringlon et al., 1985; McLachlan e Basford, 1988), que é descrito brevemente no Capitulo 5. Um modelo associalivo difere de um modelo nlo-associafivo pelo Tato de que as médias condicio- náis JJh e OS parámetros de mistura g. nao sao finos; cm vez disso» todos clcs sao fun^ocs do vetor de entrada x. Q modelo de mistura gaussiano da Eq, (7.30) pode assim Str Visto como uma generaliza- £ao do modelo de mistura gaussiano tradicional. Os aspectos importantes do modelo ME mostrado na Fig, 7.8, assumindo que estoja adequa- damenie sintonizado airavés de treinamento, sáo: 1» A saídaj do especialista í fcmccc uma estimativa da média condicional da vanável aleatóriu que representa a resposta desejada D, dado x e dado que a regra k do modelo probabi Estico de geragio seja válida. 2. A saída tía rede de passagem. defíne a probabilidade muliinomial que a salda do especialista * coincida com o valor D = dt bascado no conhceimcnto ganho somente de i. Trabalhando com a distribuido de probabilidade da Eq. (7.30) e dada a amostra de treinamen- to {( i.flf j] , o problema c aprender as médias condicionáis J1, = vA c os parámetros de mistura it L 2,.„t X, de um modo étimo, de forma que f^d |x,6) fome^a uma boa estimativa da ñin£Ío de densidade de probabilidade relativa ao ambiente responsável pela gcrafác dos dados de treinamento.
Exemplo 7.1 Superficie de Regreseáo Considere um modelo ME com dois especialistas c uma rede de pa&sagein com duas saldas repre- sentadas por gt eg? A saída g c definida por (veja a Eq. (7J21)) expfri) CXp(w|) + eSpÍN.) I________ l -i- estpí (Ni-iíj)) (7.31) Considere que a e a representem dois veiores de pesos da rede de passagera. Podemos cntáo cscrever lí = s'a., Jt= l, 2 s-? e com isso rcscrcvcr a Eq. (731) como: _______I_________ 1+expf xr(»r aJ) (732) A outra saída g da rede de passagem é & =1 -a =__________i________ l + cxp(-xr(a: -8!» Assim, g. e g 1em a forma de uma fun^ao logística, mas com uma diferenca. A orientadlo de g c determinada pela diregao do vetor difercnca (a, - a,). cnquanio que a orientafáo dcg} é determinada pelo vetor di feren^a (a - n ). que é o negativo daquele para a porta g Ao longo da atvxta definida por a, = a., temosg. = g2 = 1/2, c os dois especialistas contribucm igualmente para a saida do modelo M E 1 .onge da aresta, um dos dois cspeci¿l islas assume o papel dominante. 7.7 MODELO DE MISTURA HIERÁRQUICA DE ESPECIALISTAS O modelo ME da Fig. 7.8 funciona di vid indo-se o espado de entrada em diferentes subespa^os, com uma única rcdc de passagem rcsponsável pela distribuido da informado (extraída dos dados de treinamento) para os varios especialistas. O modelo de mistura hieriirqttica de especialistas ilustrado na Fig. 7.1 L éuma extensáo natural do modelo ME. A ilustrado é para um modelo MHE de quatro especialistas. A arquitetura do modelo MHE ¿similar a uma cirro re, na qual as redes de passagem estío cm varios pontos nao-termináis da árvore e os especialistas se encontram nas folhas da Arvore. O modelo MHE se diferencia do modelo ME na medida em que o espado de entrada ¿ dividido cm conjunte» uninitadosde subespa^os. com a informado sendo combinada eredistribuida
Hidden page
Hidden page
FIGURA 7.12 Árwre tte decsao blnárJa, dascrila tomo eegue: + Nós í s sito descendentes da n6 • Nte f4« í( fifia cfescartcferttes donóle da rnsuma toma para e /. em re^ác a t,. • As regras para seleciunar divides em íntermed i arios (i.e,, náo-termináis) da CART desem- penham um papel análogo ás redes de passagem do modelo MUE. • Os nós termináis da CART desempenham um papel análogo as redes especia Lisias do mo- delo MHE. Comc^ando com a CART para um problema de classifica^&o ou regressáo de interesse, tiramos vantagem da natureza diseñéis da CART para fomctxr uma busca eficiente entre árvores alternati- vas. Usando uma árvore assim escolhida como passo de nucía tizado no algoritmo de aprendiza- gem para estimado de paramemos tiramos vantagem da base probabil istica continua do modelo MHE para producir urna estimativa “suave” melhorada para a resposta desojada. O Algoritmo CART Com base no que foi dito acima, cabe uma breve describo do algoritmo CART. A describo é apresentada no contexto dcregrcssao. Comeando com os dados de ireinamcnto _|t pode- mos usar CART para construir uma árvore birlária Tpara regressiü por mínimos quail nidos.. prOcc- dendo como a seguir (Breiman et al„ 19&4): L Seie&to de di visees. Considere que um nó t represente um suheonjunto da árvore torrente T- Considere que </(f) represente a médi.i dos ti para todos os casos (i. d.) que se encontrara dentro de í, islü é, (733) onde a soma é sobre todos os d¡ tais que 1 € t e AV) é o número total de casos em j. Defina *W = -77X<d(734) e = (7.35) icr
410 Redes Mecíais Para o nó t, a soma £ (</, - ¡J(f )}J representa a “sonta dos quadrados dentro do nó"; isto é, cía ó o total dos desvíos quadrados de todos os J em t em relajo ás suas medias d (r). Sainándo- se estes desvias sobre t £ T resulta a Rama total dos quadrados do nó, e di vid indo-a por A' produz a media. Dado um conjunto qualquer de divisdes J de um nó carreóte i em Tt a melhor div¡sio s* é aqucla di vi sao cm S que mais reduz %(?"). Para sermos mais precisos, supon tía que para qual- quer divisan s do nó iem ?. (um novo nó i esquerda de f) e t/t (um outro nó novo ii dircita de f)h íazemos (736) A melliar divisito s* é entao estoIh i da como a divisan particular para a qual temos á'8(,r*,r) = max (7.37) Urna árvore de regres sao assim construida c proj otada para maxinuzar a redu^ao dcr£(7). 2. Dcterminítcao de um nó termina/. Um nó- t é declarado um nó terminal se esta condicáo for salísfeita: maxATír,#) < |.i (738) ande |3 é um determinado l imiar. 3. f.sfíwjíifao por mínimos quadrados dos parámetros de um uó terminal. Comidera que f repre- sente um nó terminal na final da añore binaria Te que X(/i represente a matriz comporta de k € t. Considere que d(r) represente o vetor correspondente composto de todos os dt em t. Defina w(t)-X*(í)d(0 (7.39) onde X'{í ; ó a pseudo-inversa da matriz X(r). O usa de w(j) produz uma esli mativa por mínimos quadrados, de dt,t) na saida do nó terminal i. Usando os pesos calculados da F.q. (739), o proble- ma du selecto da divisáo ó resoh ido procurando-se a menor soma de residuais ferros) quadra- dos cm rclaqao as superficies de rcgrcssáo. cm vez de fazer isso cm rclaijáo as medias. Usando CART para Inic i alizar o Modelo MHE Suponha que ü algoritmo CART Icnha sido aplicado para um conjunto de dados de treinamento, resultando em uma árvore de decisáo binaria para esle problema. Podemos descrever uma divi sao praduzida por CART como uma superficie muíndimensional definida por + b = 0 onde x c o vetor de entrada, a representa um vetor parámetro e b representa um bias. Considere a seguirá siluaíiío correspondente cm um modelo MHE. Do Exemplo 7.1 notamos que a superficie de Kgpessfio produzida por uma rede de passagem em uma árvore biriária pode ser expressa como:
___________1________ $ I + cxp(-(arx + &)) que define uma divisáoT particularmente quando g = l.<2. Considere que o vetor peso (diferen^a) a para esta rede de passagem particular seja escrito como onde ||a| representa o comprímento (Le.t a norma euclidiana) de a, e a/||a|| é um vetor de compri- mentó unitario normalizado. Usando a Eq. (7.41) em (7.40^ podemos cntao rescrever uma divisáo parametrizada por uma rede de passagem como: l onde vemos que a/||t|| determina a dinepdo da divi sao e ||a|| determina a sua acuzdade. Da discussao apresentada no Capitulo 2, observamos que o comprímento do vetor a age efectivamente como o recíproca da temperatura. O ponto impórtame a notar da Eq. (7.42) é que uma rede de passagem constituida de um filtro linear seguido por urna forma soñmax de náo-linearidade é capaz de imitar uma divisáo no estilo de CART. Além disso. temos um grau de liberdade adicional, que ó o vetor parámetro a. Em uma árvore de decisao padreo, este parametro adicional í irrelevante porque um limiar (i.e., uma decisáo abrupta) c usado para criar uma di vi sáo. Por nutro lado, o comprímento de a tem uma influencia profunda na acu idade da divisáo produzida por urna rede de passagem no modelo MUE. EspcxificamcnicT para um vetor peso sináptíco a de dire0o fixa, podemos afirmar que: • quando a é longo (i.e., a temperatura é baixa), a divisüo é abrupta, c • quando a é curto (i.e., a temperatura c alta), a divisao é suave. Se no limite tivermos la|| = 0+ a divisao desapareceré e g “ 1/2 em ambos os lados da divisáo (ficticia), O efeito de se fixar ||a|| = 0 é equivalente a podar o nó nao-terminal da árvore, porque a rede de passagem em questáo nao divide mais. Mo caso multo extremo quando ||a|| é pequeño (i.e., a temperatura é alta) em todo nó nSo-tcrminal, o modelo MHE inteiro age como um único nó; isto é, o MHE é reduzido a um modelo de regressáo linear (assumindo-se especialistas lineares). Quan- do os vetores pesos sinápticos da rede de passagem come^am a crescer em comprímento, o MHE cometa a fazer divisóos (suaves), aumentando com isso o número de graos de liberdade disponfvel para o modelo. Podemos assim inicial Izar o MHE proccdendo como mostrado a seguir: 1. Aplique CART aos dados de treinamento. 2. Iguale os vetores pesos sinápticos dos especialistas do modelo MHE as estimativas por míni- mos quadrados dos vetores parámetros nos nós termináis correspondentes da árvore binária resultante da aplkacáo de CART. 3. Para as redesde passagem: (a) fixe os vetores pesos sinápticos de modo a apontarem cm di recaes que sejam ortogonais as divísóes correspondentes na árvore binária obtida por CART, e
(b) fa^a os com pi । 'Tientos (। .e., normas eud । dianas) dos vetores pesos si nápticos iguais a vetores aleatorios pequeños 7.9 PROBABILIDADES A PRIOR! E A POSTERIOR! As probabilidades muJtinonJÍaisgj e g relativas ao primeiro nivel eao segundo nivel das redes de passagem. respectivamente. podem ser vistas como probabilidades a prtor¡> no sentido de que seus valores sao dependenles apenas do vetor de entrada (estimulo) x. Oe um modo correspondente, pódennos definir probabilidades aposferiori Aj e cujos valores dependem tanto do vetor de entra- da x como das respostas dos especialistas a x. Este último conjunto de probabilidades c útil no desenvolví memo de algoritmos de aprendizagem para modelos MHE. Com relajo ao modelo MHE da Fig. 7.11, definimos as probabilidades ap&steriori nos nós nao-tcmi inu:s da árvorc como (Jordán c Jacobs, 1994): = -H^r---------Mr--------------v (7-43) (7.44) O produla de c h define a pmhahitídpfk'canfUnM apriori para que o cspcc ¡alista fy,á) producá a saida .v. que coincide com a resposta desejada d, contn dado por (7.45) i-i .-i v ¿ A probabilidad^ A satisfaz as duas condeces seguinles Ü í A £ 1 para todo (Á £) (7.46) (7.47)
A implicado da Eq. (7.47) ó que a atribui^áo de crédito entre es especialistas se dá de forma competitiva. Além disso, notamos da Eq. (7.45) que quanto mais próximo j1L estiver ded, tanto mais provável que seja atribuida crédito ao especialista (Á i) pela sua saida ter coincidido com d, o que é intuitivamente razoável. Uma importante característica do modelo MHE que merece mentfo especial í irecursividade ñas computantes envolvidas no cálculo das probabilidades apo&iertori. Examinando as Eqs, (7.43) e (7.44), vemos que o denominador de h„. na Eq. (7.44) aparece no em umerador de h. na Eq. (7.43}. Em um modelo MHE, desfijamos calcular a probabilidade aposterior! para todo nó nao-terminal da árvore. É ai que a recursi vidadeé particularmente útil. Específicamente, o cálculo das probabiEda- des aposteriori de todos os nós n&o-tcrmiríais da árvore c cxccutado em um único passo como aquí descrito; • Movendo'se através da árvore em diretfo ao nó raíz, nivel por nivel, a probabilidade a posteriori em qualquer nó n^a-terminal da árvore é ahí ¡da Mtnplesmente combinándo se as probabilidades a posteriori de seus “filtros11. 7.10 ESTÍMA$ÁO POR MÁXIMA VE ROS SI MIL HAN (JA Voltando agora á questáo da estimado paramétrica para o modelo MHE, primeira notamos que a sua interpretado probabilíslica c um pouco diferente daqucla do modelo ME. Com o modelo MHE formulado como uma árvore binária, assume-se que o ambiente responsável pela gerafáo dos dados envolve uma seqüéncia aninhada de decisaes suaves (binarias), terminando na regressao do vetar de entrada x para a saida d. Em particular» assuni irnos que» no modeío pmbabiiistico de gera^do para o MHE, as decistes sáo modeladas como variáveis aleatorias multinomiais (Jordán e Jacobs, 1994). Isto A para cada entrada a interpretamos g.(x,8C) como as probabilidades multínamiais as- sociadas com a pnmeira decisáo, ) como as distribuirte? condicionáis muítinomiais aso- ciadas com a segunda decisao. Como anteriormente., o índice 0 significa valores reáis dos parametros do modelo de gera^áo. As decisfies formam uma árvorede decisio. Como no modele ME, útiliza-se softmax como a funqác de ativa^a das redes de passagem em todo o modelo MHE. Em particular, a ativaf jfo £. do neurónio de saida k na rede de passagem nomvd superior é definida por expK) CXp(M,)+CXp(u?) (7 48) onde c a soma ponderada das entradas aplicadas áquele neurómo. Similarmente, a alivafáo do neurónio de saída/ na rede de passagem á no segundo nivel da hierarquia é definida por x =__«^)___ Ji cxpfM.J+expfMj,)* (7,49) onde w* é a soma panderada das entradas aplicadas a este neurónio particular Para facilitar a apresenia^áo, traballiarenios com um modelo MHE com apenas dois níveis de hierarquia (i.e., duas camadas de redes de passagem), como indicado na Fig. 7.11. Como com o
image not a va i la ble
(7*54) O termo ‘'estimativa por máxima verossi mil harija" com as desejadas propriedades assint óticas* normalmente se refere a uma raíz da equacáo da verossimilhan^a que maximiza globalmcnte a futido de verossimilhan^a /(B). A estimativa é usada na prática, entretanto, pode serna realidadc um máximo local e náo um máximo global. De qualquer forma, a estimativa por máxima vcrcssimilhanca, proposta por Fishcr (1925), c bascada cm uma idéim relativamente simples: DíjfervFTtt.F papulaedes gerani diferentes anwxlrux de dadas e tjuíriquer a/matra de dados especificada é mais ptvvávei de ter viada de uma papula^Ho do que de aún as. Mais específicamente, o vetor parámetro desconhecido B é estimado pelo seu valor maisfilausíve!, dado o vetor de entrada x, Em outras palavras, a estimativa de máxima verossimilhanpa B é o valor do vetor parámetro 0 para o qual a fünvao de dengíilade de probabil idade condicional _/yd|JtT 6) é máxima. 7.11 ESTRATÉGIAS DE APRENDIZAGEM PARA 0 MODELO MHE A describo probabilEstica do modelo MHE na Sefáo 7.10 nos levou á ñing&o logaritmo da verossimilhanpa £(6) como a funfáo objetivo a ser maximizada. A questáo crucial é como realizar esta maxitmza^ac. Como em todo problema de oLimiza^áo, nao ha uma abordagem única para a maximizafáo de ¿(B). Em vez disso, temos varias abordagens á nossa disposi^áo, duas das quais sao resumidas aquí (Jacobs e Jordán, 1991; Jordán e Jacobs, 1994); 1. Abordagem do gradiente estocas!ico. Esta abordagem produz um algoritmo para a maximizapao de ¿(6) em tempo de execufáo- A sua formuLa^iio para um modelo MHE de dois ni veis, como apresentado na Fig. 7.1l, depende de fórmulas para os seguir,tes ingredientes: • O vetor gradiente , para □ vetor de pesos sinópticos do especialista lj\ A). » O vetor gradiente para o velor de pesos sinópticos do neurónio de salda 4 da rede de passagem do nivel superior. O velor gradiente 3¿/áa, para o vetor de pesos sinópticos do neurónio de saida da rede de passagem do segundo nivel associado ao especialista (/, Á). Podc-se mostrar adianie que (veja o Problema 7.9): t—- = Aju(w)^(nX^J) - (7*55) ^-= (n) (7-56) (7.57) A Equa^ao (7.55) afirma que durante o processo de ireinamenlo os pesos sinápucos do especial ista (/\ fr) sao ajustados para corrigir o erro entre a saida c a resposla desejada d, em propongo á
probabilidade conjunta ¿?posteriori hjt que o especialista (j, ¿) produza uma saida que coincide com d. A Fqua<;ao (7.56) afirma que os pesos sinápticos do neurónio de saida A- na rede de passagem do nivel superior sao ajustados de modo a forjar as probabilidades a priori gt(n) a se moverem em dirojao as pnobabi h dados ú posteriori correspondentes Ajn), A Equa^to (7-57) afirma que os pesos sinápticos do neurónio de saída da rede de passagem do segundo nivel associado ao especialista (/, i) sao ajustados para corrígir o erro entre a probabi I idade apriori.s? .(<r) e a correspondente proba- billdade upviteríori b ¿m) ein proparí ao á probabilidade aposierwri De acardo com as Eqs. (7.55) a (7.57), os pesos sinápticos de modelo MHE sao atualizados após a apresentaijao de cada padrao (estímulo). Samando os vetares gradiente mostrados aquí, em n, podemos formular a versáo por lote do algoritmo da subida do gradiente para maximizara fuñido logaritmo de verossitnilhanca /{©? 2. Abtrrdagem da maximi^a^uo do valor aperado. O algoritmo da maximizapit) do valor espera- do (MEh proposto por Dcmpstcr et al. (1977), tornee c um procedimento iterativo para calcular a estima0o por máxima verossimilhanca cm situa^ocs ñas quais, cxccio pela falta de alguns dados, a questáo da estimaL¡cao por máxima Veróssimilhanía á urna questáo ¡mediata. O algoritmo ME deri- va seu nomo do tato de que cm cada ileraváo do algoritmo há dois passos; * Opasso do valor esperada ou passo E, que usa o conjunto de dados observados de um pn&biema de dadas incompletos e a valor corrente do vetor parámetro para produzir dados de forma a postular um conjunto aumentado ou conjunto de dados completos. * O passo de mam izando ou passo M. q ue eons isle em derivar uma no va est ima ti va do vetor parámetro mas i m izando a funjan logaritmo da verossimil lianza dos dados completos pro- duzidos no passo E. Assim, partindo de um valor adequáde para 0 vetar parámetro, o passo Eco passo M sao repetidos alternadamente até a convergencia. As situantes em que o algoritmo ME é aplicável incluem nao apenas aquelas que enval vem naturalmente dados incompletos, mas também uma variedade de outras situares ñas quais a falta do completcza nao ó do todo evidente ou natural para o problema de interesse. Na verdade, o cálculo da estimativa por máxima vcrossimilhanía é freqüentemente muiitú facilitada formulancfci-o artificial- mente como um problema de dados incompletos. Isto c feito porque o algoritmo ME é capaz de explorar a reducida ccmplexidade da csiima^áo por máxima verossinnlhati^a, dado os dados com- pletos (MeLachlan c Krishnan. 1997). O modelo MHE é um exemplo desse tipo de aplicado. Ncstc caso, sao introduzidos artificialmente no modelo MHE dados ausentes na formado certas variáveis indicadoras para facilitar a estimaba o de máxima veross.imillianfa do vetor parámetro desconhegi- do, como descrito na Se^áo 7,12. Uma importante característica da modelo MHE, quer ele seja projetado usando a abordagem do gradiente estocaslico ou o algoritmo ME, aprcscnta-sc de duas formas: * Cada nsde de passagem do modelo está comi unamente calculando a prabah 11 idade aposteriori para todo ponto de dado do conjunto de treinamento. • Osa¡ustesapküadosaospcsossinápticosdoespec:al:staedasredesdepassagcmdn mode- ln, de urna iteraba para a seguintc, sao fuñados da probabilidade apuster ion assim calcu- lada e da correspondente probabilidade a priori. Conscqücntemente^ se urna rede especialista em um nivel mais babeo na árvore falhar em íazer um bom ajuste dos dados de treinamento na sua vizinhanía local,a superficie de rúgrcssáo (discriminante)
Hidden page
O algoritmo é inie i alisado com um valor inicial U1 do vulor parámetro 0 O passo Eco passo M sáo entilo repetidos alternadamente de aconto com as Eqs. (7.60) c (7,61), rcspccúvámentC, alé que a diferenqa entre £( B(iH-l)) c £(0(n)) caía a um valor arbitrariamente pequeño; ueste ponfo a com- putado é encerrada. Mote que, após unta itera^áo do algoritmo ME, a Fundo logaritmo da vcrosscmilhanpa para dados incompletos día diminuí, como mostrado por (veja o Problema 7.10) £(0(a + l)>£Ó(w)) paran =0,1,2......... (7.62) A ifiuaIdade normalmente significa que estamos cm um ponto estacíonáfio da funqáo logaritmo da verossimilhaneE. 7-13 APLICAQÁO DO ALGORITMO ME AO MODELO MHE Tendn nos familiarizado com o algoritmo ME, estamos agora prontos para resolver o problema da esfima^áo paramctrica no modelo MHE usando o algoritmo ME.' Considere qucgj'F cg'1^ representen! as probabilidades mullínomiais (condicionáis) associa- das com as decisóes lomadas pela rede de passagem k do prime i ro nivel o pela rede de passagem (j. k) do segundo nivel do modelo MHE da Fig. 7.11. rcspect vamente, quando ele opera com o ejem- plo i do conjunto de treinamento. Entáo, da Eq. (7.51) vemos fácilmente que o valor correspondente da fdp condiclonal da vari ¿ve] aleatoria D-, dado o cxcmplo ico vetor parametro B, é dado por //¿I -¿¿«¡"¿¿y; < -s* i-i /-i v 2 X (7 63) onde y ¡/ c a saída produzida pelo especial isla (f. A) em resposta ao exempío í do conjunto de tre i ñá- menlo. Assumindo que lodos os A' exemplos comidos no conjunto de treinamento sao cstaiistica^ mente independeníes, podemos formular a fun^áo logaritmo da verossimilhafl^a para o problema de dados incompletos como segue: «oj-fog flAUM (7.64) Usando a Eq. (7.63) cm (7.64) c ignorando a consiantc -(I ;2)log(2n), podemos escrever v í(ff) = £k>g (7.65) Para calcular a estimativa por máxima verosslmilhanca de 0, temos que encontrar um ponfo estaci- onario (Le, um máximo local ou global) de £(61 Infelizmente, a fun^áo logaritmo da vernssimilbanpa £(6). como definida na Eq. (7.65), nao se presta para osle tipo de cálculo.
Hidden page
Hidden page
Hidden page
projetada para preservar a informado contida nos dados de treinamento. Entretanto, usa uma abor- dagem de cal xa preta para ajustar urna única fun^áo aas dados, pcrdcndo com isso o cntcndimcnto do problema. O MUE, representando um tipo dinámico de máquina de comité. é um modela que representa um compromisso entre esteá dois casos extremos, compartíIhando características co- muna de ambos. CART c MLP: * A arquitetura do MU E é similar a da CART, mas difere déla pela parti^áo suave do espado de entrada, em ve? da partido abrupta. • O MHE usa uma forma aninhada de nao-linearidade similar a do MLP, mas náo com o propósito de realizar o mapeamento de entrada-saida, mas sim para partictonar o espado de entrada. Ncslc capitulo, enfatizamos o uso de duas fcrTarncnlas para u projeto de um modelo MHE: • CART como a base arquitctural para tratar do problema da seleQáo do modelo. • O a I goritmo ME para resol ver o problema da estimaban paramcErica pela compútatelo i t erad va das estimativas por máxima verossimilhanca dos parámetros do modelo. Normalmente pode-segarani ir que o algoritmo ME se mova de forma ascendíate em vcnossimilharija. Assim, usando CART para inicial izar o algoritmo ME na forma descrita na SeQáo 7-8, podemos esperar que n algoritmo ME praduza um mcihordcscmpcnho do generalizaban do que seria possí- vcl com a condicáo inicial cstabclec.Ja por CART. O algoritmo ME é importante e fundamental se a aplicado de inieresse for de estimado por m&xima verossimilhanía, como no caso de ffloc/efJcjgtffn- lima aplicadlo mteressanlede modelagem c descrita cm Jacobs, lardan c Barto (1991 b), onde um modelo ME c (reinado pana realizar a tarefa "O quefonde\ hlesta tarefa. deseja-se que o modelo determine o que um objeto c c onde cíe está no campo visual. Dois especia listas foram usados no estudo, cada um sendo especializado cm um aspecto da tarefa. I’ara uma entrada especifica, ambos os especialistas geram saldas. Entilo, a rede de passagem decide a mistura aprepriada para aqueta entrada. Os bons resultados relatados por Jacobs et al. demonstrara que e pGSSÍvel que uma atribuido de tarefa seja determinada de forma inata, náo com base na tarefa em si. mas pela coincidencia eiure as necessidades da tarefa e as propriedades computacional3 do modelo (Elman el al-, 1996). Concluimos esta discussáo retomando á outra elasse de máquinas de comitc cstudada na pri- me ira parte do capitulo. Enquanto o modelo ME ou o modelo MHE se basciam no uso de redesde passagem ativadas pelo sinal de entrada para fundir o conhecimento adquirido pelos diversos espe- cialistas do modelo, uma máquina de comité, bascada no uso da medía de ensamble ou, alternativa- mente. de reforjo, se bascia no próprio algor itmo de aprendizagem para real izara integracao, como resumido a seguir: 1. A media de cnscmblc melhora o desempenbo em relajo a enes de um modo cngcntiosc pelo uso combinado dedoi- efeitos: Rcducáo de erro de^ i do a bias pelo n । usté ©í cessivo propos i la I dos especia li slas ind i vidual s d:i máquina de comité. • Redujo de erro devído á var ilncia pelo uso de diferentes condi^bes iniciáis no tremamen- to dos especialistas individuáis e entáo calculando a média de ensemblc de suas saidas. 1. () reforto melhora o desempenho cm rclafáo a erros de uma forma engenhosa particular. Ncstc caso, exige-se que os especialistas individuáis tenham um desempenho um perneo melhor que a estimativa alealúrra. A aprendizagem traca dos especialistas é convertida em aprendizagem forte, e assim o erro da máquina de vomite loma-sc arbitrariamente pequeño. Esta notável con-
versáü é realizada pela fíltragem da distribuidlo dos dados de entrada de forma que os modelos de aprendízagem fiaca (i.t., os especmlistas) evenlualTtienie aprendam a distribiiicfo inteira, ou por amoxtragem repetida dos exewplos de treinamento de acardo com uma certa disti i huíalo de probabilidade como no AdaBoost A vantagcm do AdaBoosl sobre o reforjo por filíragcm c que ele trabalha com uma amostra de treinarrLenlo de tamanho fizo. NOTAS E REFERENCIAS 1. Qs méludftx par media de ensembie sáo discutidos Bill Pemone {19931, onde urna estlenta bibliografía sobre este assunto é incluida- Outras referencias sobre este assunto inclucm Wolpen (1992) e Hashem (1997). 2. O uso da méd ia de enscmblc para o projeto de uma máquina de comité com um conjunto de ditérenles conduces iniciáis foi sugerido por virios usuários de redes neurais. Entre- tanto, a análise estatísdea apresentada cm NafUly ct al- (1997) c n procedimento lá descrito para treinar uma máquina de comité projetada por media de ensembia sobre o espado das rondices iniciáis parece ser a primtira do seu género Naquele artigo, sao apresentados resultados experimentáis bascados nos dados de manchas solares e em dados de competido para previ-sio de energía. Em ambos Os casos, ó demonstrada uma redu^áo significativa da variáncia tomando a media sobre o espado de condifócs inici- áis. De acardo com Naftaly et al. (1997), o uso de rcstri$3es de treinamenln populares corno o dccaimenlo de pesos e a parada anlecipada ftiíp é recomendado no pnojeto de urna máquina de comité por média de ensembie sobre o espado de condufóci iniciáis. 3. As referencias principáis sobre a teoría de reforjo e estudos experimentáis relacionados, mais ou menos Cm ordem cronológica, s8o: Schapire (1990), Drucker et al. (1993, 1994), Freund( 1995), Breiman (1996b), Freund c Schapire (1996a, 1996b, 1997), Schapirc(1997) c Schapire ct ai. (1997). As primaras referencias sobre as tris abonlagens básicas de refar- qos3o: • Fíltragem! Schapire (1990) * Amostragcm repelida; Freund c Schapire (1996a) « PonderajQáo: Freund (1995) 4 A idéia de usar uma mistura de especialistas para realizar urna fun^áo de mapearocniu complexa foi primeiro discutida por Jacobs, Jordán, Nowlan c Hinton no seu artigo de 1991a O desenvylvimetilo deste modelo foi motivado por (i) urna preposta descrita em Nowlan (1990), vendo a adapla^áo competitiva na aprendizagem nao-supervisionada como uma tentativa de ajustar uma mistura de dislribui^Ses de probabilidade simples (tais como gaussianas) a um conjunto de pontos de dado c (2) ideias desenvolvidas na tese de doutO' rada de Jacobs (1990) usando uma arquitetura modular similar, mas com uma funcáo de custo diferente. 5+ Os estimadores p<ir máxima vernüsimilhanca lém :dgumas prupriedades desejáveis. Soh condi0es bastante gerais, as seguí lites propnodades assitrtóíicas podem ser provadas (Kmenta, 1971): (I) G.s estimadores por máxima wms!¡imifíii«u;a sao conséjenles. Considere que £(0) represente a fun^o logaritmo de vcross::nilham?a eque 8r represente um elemento do vetor parimetro 9 A derivada parcial Si/dfy é denominada uma cortlagem. Dizemos que um estimador por máxima v era s símil harija é consistente no sentido de que o valor que o valor de 0jF para o qual a coniagem e idéntica a zero, converge em probabilidade ao valor verdadeira de & quando o tamanho da amostra usado na esti- ma$to tende a infinito.
(¡L} Üi e.iiimtiíiores por máxima vcra>similham;a .nín axgititaticofnafe eficiente*. Isto é. para toda i onde freo tamanho da amustia, 0, é a estimativa por máxima verossiinilhanfa de / io r-ésimo elemento da diagonal da mveraa da matriz de informarán deFinher. A matriz de informaba de Fisher é delinida por Ü'L düjdO, 3^.1 06* J onde Mé a dimensáo do vetor parámetro 0 (i i i) (Jj ('TfínKKÍWH por máxima vemxximiihain’a xaa a.xxinlüt/cumioHe gMSiiantix. I Sfo é, quando o tamanho da amostra se aproxima do infinito, cada elemento da estimativa por máxima vcrcissimilhan^a B mumC urna ilistr/nui^ao gaiuísiana. ha prálica, constatamos que as propiedades para grandes amostras (i.e.. assinlóticas) dos estinuóoRS por máxima verossimil lianza sáo válidas para tamañitos de amostras Ar > 50. 6. O an i go de Ncwcomb (L 886), considerando a esl i ma^áo de parámetros de uma m i atura de duas distribuidles gaussianas un [variadas, parece ser a primcira referencia a um processo do tipo ME relatada na literatura. O nomc “algoritmo ME“ foi cimbado por Dempster, l.sind c Rubín no seu artigo fundamental de 1977. Naquele artigo, foi apresentada pela primeira vez a formulario do algoritmo ME para calcular estimativas por máxima verossimilhan^ de dados incomple- jas cm virios niveis de generalidad^. O primero relato umtkado sobre a teoría, mclodologiiü c aplícameos do algoritmo M E, sua h istoria e extensoes foi apresentado em forma de 1 i vro por McLachlan e Krishnan (1997). 7, Sob condi^es razoavelmenlb gemís, os valores do verassimilhanca calculados pelo algoritmo ME convergem para valores estacionarios. Wu (1983) apresenta um relato dera- Lhado sobre as prupriedudes. de convergencia do algoritmo ME. Entretanto. O jlgrrilrno MF tre/N .rfMjMT resulta em um máximo local ou global de funcáo de veroMimilhanfa. No Capitulo 3 do lino de McLachlan c Krishuan (1997), sáo aprascnlados dois exemplos eni que isto rufo acontece. Em um exemplo o algoritmo converge para um ponto de sela, e no outro cxcmplo o algoritmo converge para um miairm? local da fundió de veros&im i Chanca. 8. O algoritmo M E pode tambem tratar a máxima estintardo u puxterían (AtA P) bayesiana incorporando mftinnaíáci/véi'wr ao vdor parámetro: veja o Problema 7.11, Usando a regra de Bayes. podemos expressar a fiin^io de densidade de probabilidade puní o vetar parametro 0, dado utn conj nfllci de (ih&erva^ncs X, tomo 40 .)^ Áí1) Desta relacáo, vemos facilmenie que max¡mirar a densidade apr‘joH/ÍJ(G|x) é equivalente a maximizar o produlo/^xIB^tflk pois.£(x) é independen te de G. A funfáo densidade de
Hidden page
Hidden page
onde K(o10(^)=£[hSw1m] Com isso, mostré que i(é(n+1j) - ¿(éw)=4-1), ík» ) - c(é(» x éw) -Ía'(í(»+!),«(-;))-x^é(»Ké(»))] (b j A desiguafdatfe de Jensen afi rma que se /H c urna ñrngáo convexa e n é uma variável ateatória,. etitáo EteM] onde £ é o operador expectativa; além disso, se ¡v j £ escritamente convexa, cnlao a igualdade ntsra nelucáu implica que j< = A (y] com probabi hilado l (Covcr cThomas, 1991). Usando a desígualdade de Janscn, musiré que K(fl(n+1), é(n)) - K(éoi), fl(Fr)) < 0 Com isso, mostré que a Equa^áo (7,62) é válida para n ” Ü, 1,2, 7.11 O algor i uno ME é facJinente mod i ficíxel para acomodar a máxima escimaiiva aponigripri (MAP) de um velor parámetro 0. Usando ¡i negra de Rayes, modifique o passo Eco passo M do algoritmo ME para fomcccr esta estima^áo- 7,12 Para um MHE (reinado com o algoritmo ME e um MLP (reinado com o algor limo de retroptopaga;&} para fomecer um nivel de desempenbo similar para uma dada larcfa, es- peraríamos intuítivacnenle que a complex:i.hde do MHE superasse aquela do MLP. Argu- mente A Pavor Ou contra a plausibilidade desta afirmp^áo- 7J3 Justifique as relajóos entre as varíávcis indicadoras c as probabilidades úposteriori des- critas ñas Equapfes (7.66) a (7.615). 7.14 A Equa£áo(7.75) descreveos mínimos quudrados ponderados para aocÍTniza?aodas redes especialistas do modelo MHE da Figura 7.11d assumindo que a resporta despejada d soja um escalar. Como se modifica «¡ta relajo para o caso de uma resposta desojada multldimensional?
Hidden page
CAPÍTULO 8 Análise de Componentes Principáis 8.1 INTRODUQÁO Uma importante caracteríscíica das redes ncurais é a hábil idade que das tem de aprender & partir do seu ambiente e+ através da aprendizagem, meihorar o desempenho de algum modo. Nos quatro capitules anteriores, o enfoque foi nos algoritmos para aprendizagem supervisionada, para os quais um conjunto de alvos de interesse é fomecido por um professor externo. Os alvos tqmam a forma de um mapeamento de entrada-saida desejado, que a rede deve aproximar. Neste capítulo e nos próxi- mos trés, escudamos algoritmos pan aprendizagem auto-organizada ou aprendizagem náthsaper- visionada. O objetivo de um algoritmo para aprendizagem auto-organizada é descobrir padróes significativos ou características nos dados de entrada c fazer esta dcscobcrta.fem um professor. Para fazer isto, o algoritmo dispóe de um con junto de regias de natureza íocaf, que o capacitam a apren- der a calcular um inaptamente de entrada-saida com propiedades desejáveis específicas; o termo “local" significa que a modificadlo aplicada ao peso sináptico de um neurónio é confinada á vizi- nhanca ¡mediata daquele neurónio, A modelagem das estruturas de rede usadas para a aprendiza- gem auto-organizada tiende a seguir as estruturas ncurcbiológicas de uma mancira muito mais ex- tensa do que na aprendizagem supervisionada. Isto nao deve causar sorpresa, porque o processo de organizado de rede é fundamental para a organizado do cerebro. A estrutura de um sistema auto-crganizável podeassumir uma variedade de formas diferentes. Ela pode, por exemplo, consistir de uma camada de entrada (fonte) e uma camada de saida (de representado), com conexoes alimentadas para frente da entrada para a saída c concxoes laicrais entre neurónios na camada de saida, Um outro exemplo é uma rede alimentada adianto com múlti- plas camadas, na qual a auto-organ izadlo procede na forma de camada por camada. Em ambos os exemplos, o processo deaprendizagem consiste em modificar repetidamente os pesos sinápticos de
Hidden page
Hidden page
PR []M C í PIO 4. Ordem e estrutura nos padróes de i n formaba representare i nfwma^io redundante que ó adquirida pela rede ncural na forma de conhecimento» que c um prc-requisítD ncccssArio para a aprendizagem auto-organizada. Parte deste conhecimento pode ser obtído por observantes dos parámetros estalístiecs como a mé- dia* a variare i a c a matriz de corrcla^áo dos dados de entrada. Os Principios de I a 4 sobre aprendizagem auto-organizada foroecem a base neurobiológica para os algoritmos adaptad vos para a anal i se de componentes principáis neste capítulo e para O mapaauto-organizávcl de Kohonen apresentade no próximo capítulo. Estes principios sáo também incorporados em mu i tos outros modelos auto-organizados que sáo motivados por considerares neurobiológicas. Um desses modelos que merece ser mencionado é o mrwte/fl deLinskerdv sistema visual dos mamíferos (Linskcn 1986). Aralise de Características Auto-Organizadas O processamento de informapáo no sistema visual é real izado em esiágios. Em particular» caracte- rísticas simples como contraste e oríentacao de bordas sáo analizadas nos esiágios iniciáis do siste- ma, enquanto que características complexas. mais elaboradas sáo analisadas em esiágios mais avan- zados. A Figura 8.1 mostra a estrutura geral de uma rede modular que se assemclha ao sistema visual- No modelo de Linskcr os neurónios da rede na Figura 8.1 estilo organizados em camadas bid i mencionáis, com conextes locáis para frente de uma camada para a segumte. Cada neurónio recebe informado de um número linrtado de neurónios localizados cm uma repao correspondente da camada anterior, que constituí o campa receptivo daquele neurónio. Ds campos receptivos da rede desempenham um papel cruc ial no processo de desenvoh imcnto sináptico parque oles tomam possivel para neurónios em uma camada responder a espacian das atividades neurais na camada anterior. Sáo feitas duas prcssuposifdcs de natureza cstrutural: l .rn:nL Camada B C:rn.i.: i c FIGURA fl. 1 Planta de urna rede modular auto-adaptativa
1* As posif fes das conexfes sinópticas sao fixas para todo o processo de desenvol vimcnto neuronal, uma vez que cías tenham sido escolhidas. 2. Cada neurónio atua como um combinador linear, O modelo combina aspectos da modificado sinóptica segundo Hebb com aprendizagem cooperati- va e competitiva de tal forma que as sai das da rede discriminara ottmamente entre um conjunto de entradas, com a aprendizagem auto-organizada sendo realizada cm uma forma camada por carna- da. Isto é, o processo de aprendizagem permite que as propriedades de análise de características auto-organizadas se desenvolvam totalmente antes de prosseguír para a próxima camada, Em Linsker (1986);, sao apresentados resultados de simulaba quali cativamente similares as propriedades en- contradas nos cstágios iniciáis do processamento visual em gatos c macacos. Reconhecendo a natu- reza altamente complexa do sistema visual, c realmente notável que o modelo simples considerado por Linsker seja capaz de desenvolver neurónios para análise de características. Nao se espera que os neurónios para análise de características no sistema visual dos mamíferos se desenvolvam exatamente da maneira descrita pelo modelo de Linsker. O ponto principal é que tais estruturas podem ser producidas por urna rede em camadas relativamente simples cujas conexócs sinópticas se desenvolvere de acordo com a forma hebbiana de aprendizagem. Nosso interesse primordial neste capítulo, entretanto» se concentra na análise de componentes principáis e como ela pode ser realizada usando-se sistemas auto-organizóveis bascados na aprendi- zagem hebbiana. 8.3 ANÁLISE DE COMPONENTES PRINCIPAIS Um problema comum em reconhecimento estatifico de padrees é a seleqáo das características ou extra^ao de características. A jefepao de características se refere a um processo no qual um £.rp¿7^o de dadas c transformado cm um espado de características que» em teoría, tem exatamente a mesma dimens&c que o espado original de dados. Entretanto, a transformado é projetada de tal forma que o conjunto de dados pode ser representado por um número reduzido de características “efetivas” e aínda retar a maioria do conteúdc de informaqao intrínseco dos dados; em outras palavras, o con- junto de dados sofre uma redundo dedimensionaiidade. Para sernos mais especificas, suponha que tensarnos um vetor x de dimensáo m e desojemos transmiti-lo usando i números, onde f < m. Se simplesmente truncamos o vetor x, causaremos um erro médio quadrado igual a soma das varíáncias dos elementos eliminados de x. Assim, fazemos a seguínte pergunta: existe uma transformado firíear inversiva T tal que o truncamente de Tx seja ótímo no sentido do erro médio quadrado? Claramente, a transformado T deve ter a propriedade que aEguns de seus componentes tenham baixa variáncia. A uriáfáe de contpanenta.'i principáis (também eonhccida como a transformacaa de Karhunen-Loéve na teoría da comunicacáo) maximiza a laxa de redu^ao da varíáncia e é, portan- to, a escolha coircta. Neste capítulo, derivarnos algoritmos de aprendizagem bascados na aprendí^ zagem hebbiana que podem realizar análise de componentes principáis1 sobre o vetor de dados de interesse. Considere que X represente um veror aleatárin de dimensao m representando o ambiente de interesse. Assumimos que o vetor aleatórío X tem media zero; £[X] = 0 onde £ é o operador estatistico valor esperado. Se X tiver uma media nóo-nula, subtraimos a média antes de prosseguirmos com a análise. Considere que q represente um vetar unitariotambém de Copyrighted material
Hidden page
Hidden page
(6q}Hq - X(6q)Tq = O ou equivalentemente, (WíRq-Xq) (> Para que valha a candido da Eq. (8.12), é necessário e suficiente ter Rq-Xq (8.13) Esta é a equa^ao que gavenia OS vetares unitarios q para es quais a prova de variártela i|j(q} lem valores extremos. A Equa^áo (8.13) é reconhecida como o problema do aittovaior\ usualmcntc encontrado na álgebra linear (Strang, 1980). O problema tem solufdes náo-trh isiii (i.e., q 0)apenas para valores especiáis de X que sío chamados os aute^aiores da matriz de correlato IR. Os valores assoclados de q sáo chamados auto veten#, Uma matriz de correlato é caracterizada por autovalores reais nao-negativos. Os autovetores associados sáo únicos, assumindo que os auto val ores sáo distintos. Considere que os auto valores da matriz R fft-por-wi sejam representados por Xr XP..,P \ e que os autovetores associados sejam representados porq ., q,,..., q^, respectivamente. Podemos cntáo es- OfflW J-1.2....." (8-14) Considere que os autovalores correspondentes eslejam afranjados em ordem deereseentc X, >\> - - >Aiti (8,15) de forma que X = kmix. Considere que os autovetores assocliados sejam usados para construir uma matriz jw-por-rfr Q = [qp q?,, q? . , qj (8 16) Podemos entao combinar o conjunto de w equa^oes representado em (8.14) em uma única equa$5o: RQ-QA (8.17) onde A é uma matriz diagonal definida pelos autovalores da man iz R: A - diag[kp Xy- , X., -. XJ (8.18) A matriz Q c uma matriz ortogonal (unitaria) no sentido que seus vetores colana (i.e., os autovetores de R) satisfazcm as candi^aex de orronormatitiade'. r i'. /=' =|o, <8 I,)
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
onde > Ar Pan a saida do neuróniotemos o valor limite limy.(Á)=xr(/í)q. = q.ri(n) J - (8.95) Considere que K(n) represente uma variável aleatória com uma realizado representada pela salda y.(n). A correlato cruzada entre as variáveis e fyn) em equilibrio ó dada por WnJE[r/n)rt(fl)] = 4q;X(n)Xr(fl)qJ = _í\f * = J [Q, jt # y (fc-96) Assim, podemos afirmar que no equilibrio o algoritmo hebbiano generalizado da Eq. (8.91) atua como um auío-analisador dos dados de entrada. Considere que x(n) represente o valor particular do vetor de entrada x(n) para o qual as con- di^oes limites da Eq. (8.92) sáo satisfeitas para / = i - I. Assim, da forma matricial da Eq. (8.80), constatamos que no limite r i0í)=Xh0i)q( í-l (8.97) Isto significa que dados dois conjuntos de quantidades, os valores limites q , q.-.-j q. dos vetores de pesos sinápticos dos neurónios na rede alimentada adianto da Fig. 8.5 e as saidas correspondentes y(n), podemos entáo construir urna estimativa linear de ttiínimos cuadrados i (a) do vetor de entrada x(n). De fato, a fórmula da Eq. (8.97) pode ser vista como uma fórmula para reconstruido de dados, como mostrado na Fig 8.8 Note que, com base na discussao apresentada na Sefío 8.5, este método de reconstruyo de dados está su ¡cito a um vetor de erro de aproximarán que é ortogonal á estimativa x(n). FISURA a.S Represe nlHQáa por pala de fluxú da sinal da coma 4 calculado o veior rwonstmíiio i Resumo do AHG Os cálculos envolvidos no algoritmo hebbiano generalizado (AHG) sáo simples; podem ser resumi- dos como segue; z 1. Inicialíze os pesos sinápticos da rede, te , com valores pequeños no tempo n = I. Atribua um pequeño valor positivo ao parámetro da taxa de aprendizagem q.
Hidden page
FIGURA 8.9 (a) Uma imagem de país usada no experimento de codificado de imagom. (b) Máscaras 8x8 representando os pesos sinópticos aprendidos peta AHG. (c) Imagem reconstruida dos pais otitida usando-se as B componentes princi- páis dominantes som quanlizado (d) Imagem reconstruida dos país com razáo de compressáo de 15 para 1 usando ouantiza^áo Para uma variagáo da primcira imagem. aplicamos a seguir o algoritmo hebbiano generalizado á imagem de uma cena de océano mostrada na Fig. 8.10a. Esta segunda imagem enfatiza a informa’ ?áo textura!. A Figura 8.10b mostra as máscaras 8x8 dos pesos sinópticos aprendidos pela rede procedendo da mesma maneira descrita acima; note a diferenca entre estas máscaras c aquetas da Fig. 8.9b. A Figura 8.10c mostra a itnagem reconstruida da cena de océano com base ñas 8 compo- nentes principáis dominantes sem quantiza^áo. Para esludar o efeito da quantiza^áo, as saidas das primeiras duas máscaras foram quantizadas usando-se 5 bits cada, a tcrccira com 3 bits c as restan- tes 5 máscaras com 2 bits cada. Assim, foi necessário um total de 23 bits para codificar cada bloco 8 x 8 de pontos, resultando em uma taxa de bits de 0,36 bits por ponto. A Figura 8. lOd mostra a imagem reconstruida da cena de océano, usando suas próprias máscaras quantizadas na maneira descrita acima. A razáo de compressáo desta imagem foi de 22 para 1. Para testar o desempenho de “generalizacao” do algoritmo hebbiano generalizado, finalmente usamos as máscaras da Fig. 8.9b para dccompor a cena de océano da Fig. 8.1 Oa c entilo aplicamos o mesmo procedimenfo de quantiza^áo que foi usado para gerar a imagem reconstruida da Fig. 8.1 Od.
Hidden page
O resultado desta. reconstruyo de imagem c mostrado na Fig. 8. lOe com urna razio de compressio de 22 para l, a mesma que a da Fig. 8. lüd. Enguanto que as imagens reconstruidas ñas Figuras 8. lOd e 8.10e guardam uma concordancia surprccndcntc entre si, podc-sc ver que a Fig. S.IQd possui uma maior quantidadede informado textura! “verdadeifiT e, portanto, aparenta ser menos “quadriculada" que a Fig. 8.1 te A razao para este comportamento está nos pesos da rede. Para o treinamento realizado com as imagens dos país a da cena de océano, os primeiros quatro pesos xáo muito similares. Entretanto, para a imagem dos país os quatro pesos fináis codifican) informafáo de borda, mas no caso da cena de océano estes pesos codifican) mformacao textura!. Assim, quando ocorre a codificado da cena de océano com os pesos do tipo de borda, a reconstruyo dos dados textvrais é grosseira^ resultando assim uma apariencia quadriculada. 87 ANÁLISE DE COMPONENTES PRINCIPAIS ADAPTATIVA USANDO INIBIQÁO LATERAL O algoritmo hebbiano generalizado descrito na sccjo anterior se baseia no uso exclusivo de cone- xóes para frente para a análise de componentes principáis. Ncsta sc^ao, descreyentes um outro algoritmo chamado de extracao adaptativa efe? componentes principáis (APEX, adaptive pr incipal companents extmeliori} (Kung c Diamantaras, 1990, Diamantaras e Kung, 14%), O algoritmo APEX usa tanto conexfcs para frente como para trás.1 D algoritmo é de natureza iterativa na medida em que, se fbmcccrmos as prime i ras (/ - I) componentes principáis, a J-ésima componente principal é fácilmente calculada. A Figura 8.11 mestra o modelo de rede usado para a derivarán do algoritmo APEX. Como anteriormente, o vetor de entrada x tem dimensáo m, com suas componentes representadas por x.. x..., Jt^. Assume-se que cada neurónio da rede seja linear. Como mostrado na Fig. 8.11, há na rede dois tipos de conexóes sinópticas: FIGURA 8,i 1 Rede com conaxtes para trtrtte e útnftKÓea laLerais páre a deriva- do da elgarttmo APEX Camada de sai i i • Conexoes para frente dos nós de entrada para cada neurónio 1,2,cora j < m. As cone- xocs para frente para o neurónioj sao de particulai interesse: estas conexóes &3o represen- tadas pelo vetor peso para frente w.= [w ,(flK “„,(«)]r
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
FIGURA 8.13 lluelr&pgoda ACP por ni.clHo. (a) Espeje de entrada bidintgnrónaJ, mostrando um«Mijunlo<fe pontos de dados, (b) Espado de características t dimensional, medrando as ¡magens indutidas dos pontos de dados congregadas cm torno de um aulovstor principal. As linfas tracejadas uniformemente espadadas na parís (b) rapre- Mntair contornos de pregóos constantes sobre o aulcwtor; os contornos correspondentes sáo nío-líneares no espado de entrada Para núcleos de produto interno definidos de acordo com o teorema de Mercer, estamos bási- camente realizando ACP cm um espado de características de dimensáo onde a dimensáo c um parámetro de projeto. Todas as propiedades da ACP ordinaria que eslió descritas na Sofito 8,3 ccrntinuam valcndo para a ACP por núcleo. Em particular, a ACP por núcleo é linear no espado de características, mas náo-linear no espade de entrada. Assim, ela pode ser aplicada a todos aqueles demímos onde a ACP ordinaria tem sido usada para extrajo de características ou reduqáo de da- dos, para os quais a extensas nao-linear fafa sentido. No Capitulo 6, apmentamos írés métodos para construir núcleos de produto interno que fo- ram bascados no uso de polinomios, fonjes de base radial e fúnfúes hiperbólicas; veja a Tabela 6.1. A questáo de como sdccionar o núcleo mais adoquado para uma dada tarcfa (i.e., o espado de características apropriado) é um problema em aberto(Schdlkopf, 1997). Resumo de ACP por Núcleo 1. Dados os exemplos de treinamento {* , calcule a matriz por núc leo tf-por-N, K = {X (x.,x, 1!, onde X(x.,x.) -«xJfOp 2. Resol va o problema de autovalon Ka = Xa onde A é um autovalor da matriz de núcleo K c OI é o autovetor associado. 3+ Norraalize os autovetores assim calculados esigindo que afo-jU k = 1,2,.-,/)
476 Redes Neurais onde A c o menor auto valor diferente de zcro da matriz K. assitiTiindo que os autova lores J* estejam afranjados em ordem dccrcsccnte. 4. Para a extrajo das componentes principáis de um ponto de teste it calcule as projef fies 4t-qfc(x) =t=i^,p ?-1 onde f é o j-ésimo elemento do autovetor a . Exemplo 8.3 Para fomcccT um& cfmip'rwnsio intuitiva sobre a opera^íit da ACP por núcleo, mostramos na Fig. 3.14 os resultados de utn experimento simples descrito cm Schólkopf d al. (1998). Os dados bidimensionats. consis- tindo de componentes c.x,. usados neste experimento foram geradoi cuma segué: os valores x, tem uma distribuido uniforme no intervalo [-1, I]. Os valores x, s3o nao linearmciite relacionados com os valores r, pela fórmula; x, = x|] +1? FIGURA 6.14 Exemplo tridimensional ilustrando a ACP por núcleo. Da esquetda para a direita, o grao polmomial do núclM é tf = 1, 2, 3. 4. tte Cima para baixO. sáo mostrados os primeiros tres autovetores np espado da características. A primeira coluna corresponde A ACP ordinána 0 as Dutrus tres «lunas cornespondem a ACP por núclsc com gnu polinomial a' i, 3. a. (FtfiprüduzidO com permissáa do Dr. Klaus-AcUerl Mbller) onde V é um ruido aditivo gaussiano de media zeno C varidneia 0d04. Os resultados ds ACP mostrados na Fi^ í. 11 foTftm obtidos usando-se polinomios de núd«: í(l1Kj)=(XíX.y, ¿=1,2^4
onde d = I corresponde áACP linear, e 2, 3, 4 comeApnitde á ACP por núcleo. A ACP linear, musitada j esquenia da Fig. 8 14, resulta em apenas dois autovalorcs, pnis a diinensíonalidade do espado de entrada é dai$. A ACP por núcleo, bq oontrário, permite a extraído de componentes de ordem mais alta, como mostrado pelos resultados apresentadas ñas colimas 2,3 c 4 da Fig. 8.H, correspondentes ao grau polinomul d = 2, 3, 4, respectivamente- As linfas de contorno mostradas em cada parle da figura {excelo para o auto-valor zero no caso de ACP Linear) representamos valores principáis constantes (i.c., as proje^des constantes sobre o autovetor associado com o autevahr cm quescáo). Com base nos resultados mostrados tía Fig. 8.14. tasemos as seguimos obscrvav&es; • Como esperado, a ACP linear falha cm fceneoer uma Teprcsenlacáo adecuada dos dados de entrada n&c-lLneares. • Em indos o* CMOS, éj prittieira componente principal varia monótonamente ao longo de uma parábola que passa pelos dados de entrada. • Na ACP por núcleo, a segunda e a terceira componentes principáis exibem um enmpurtamento que aparenta ser um tanto similar para diferente-1; valores de grau$ polinomiais d. • No caso do grao polinornia! d = 2, a tercccra componente principal da ACP por núcleo parece captar a variáncia divido m> ruido aditivo gaussiano v, Removendo a contribuioío divido a esta componen- te, estaríamos de futo realizando alguma lumia de redujo de niído- 8,11 RESUMO E DISCUSSÁO Neste capitulo, apreveníamos elementos sobre a teoría da análise de componentes principáis c o use de redes neurais para sua implementa^ao. Agora é apropriado refletinnos sobre estes elementos e perguntarmes: qual é a utilidade da análise de componentes principáis? A resposta a esta questao depende, é claro, da aplicado de interesse. Se o objetivo principal c realizar boa eompressao de dados preservando o máximo possívcl de informacáo sobre as entradas, o uso da anál se de componentes principáis oferece um procedimento útil de aprendizagem auto-organizada. Aquí notamos do material apresentado na Se^3o 8.3 que o uso de um método de decomposi?ao em subespa?o hateado ñas "primeiras / componentes princi- páis” dos dados de entrada fomece um mapeamento Linear, que é ótímo no sentido de que ele permite a reconsttu^o dos dados de entrada origináis, otimIzando em relajo ao erro médio qua- drado. Além disso, uma representa^áo baseada ñas pi imeiras I componentes principáis é preferí ve I frente a uma Tepresenta^ao arbitiária cm subespa^o, porque as componentes principáis dos dados de entrada sao naturalmente ordenadas em auto valor decrescen te ou, equivalentemente, cm variáncia deerescente. Conseqúentecnente, podemos otimizar o uso da análise de componentes principáis para compressao de dados empreñando a maior precuKo em umérica pouhrel para codificar n pri- mcira componente principal da enltada e progresivamente passando a empregar menor precisáo para, codificar as / — I componentes restantes. Urna questito relacionada a isso é a representado de um conjunto de dados constituido de uma agrega^ao de vários agrúpamelos. Para os agruparnentos serení individualmente visiveis, a separa- íño entre eles de ve ser maior que o espalfamenio interno dos agrúpamelos. Se acontecer de existir apenas poucos agnipamentcs no conjunto de dados, cntáo os eixos principáis dominantes encontra- dos usando a anáiise de componentes principáis tenderá a escolher projeqóes de agrúpamelos com boas separares, fomecendo assim uma base efetiva para a extraído de camcleríslícas. Neste último contexto, mencionarnos uma aplicado útil de um analizador de componentes principáis como opré-prucessadar para uma rede neural supervisionada (p.ex., um perccptron de múltiplas camadas tresnado com o algonlmt> de retropropagacao). Aquí a motivado ¿ acelerar a
Hidden page
2, Com base na noQito 1, a extracto de uma forma a partir de padróes de sombra é reduzicia ao problema muito mais simples de estimarán paramétrica em um espado de baixa dimensionalidade. Por exempto, a estrutura grosseira da forma de uma cabera humana é invariavelmenle a mesma» no sentido de que todas as pessoas tém narizes representando protuberancias» órbitas oculares repre- sentando dcprcssccs, c testas ehochechas representando regí des planas. Esta invariineja sugiere que qualquer face dada» expressa como r(G»/) cm coordenadas cilindricas, pode ser descrita como a soma de duas componentes: dú,/) = rHl(0,n + pte»/) onde ro(6»0 representa uma cabera media para uma determinada categoría de pessoas (p.ex.» ho- mens adultos ou mulheres adultas), e p(ü./) representa /wrfur£íici5eff que capturam a identídade de uma pessoa particular. Típicamente, p(G,0 ¿ pequeño comparado com r0(9»í). Para representar p(9,/), Atick el al. utilizare a análisc de componentes principáis, na qual as flutua0es sáo representadas em termos de um conjunto de autcfunqdes (i.e.t a contrapartida bidimensional dos autovetores). Em Atick et al. (199(5), sao apresenlados resultados demonstrando a hábil idade da abordagem hierar- quica de dois estágios em recuperar a superficie tridimensional para uma dada pessoa de uma única imagem bidimensional daquela pessoa. NOTAS E REFERENCIAS 1. A análisc de componentes principáis (ACP) tal vez seja a técnica mais antiga e mais bem confío,ida deanálise multivariada(Jolliffe. 1986; Preisendorfer, 1988). Ela foi introduzida primeiro por Pearson (1901), que a u$Ou cm um contexto biológico para dispor a análise de rcgressao linear em uma nova forma. Ela foi entáo desenvolvida por Hotelling (1993) em um trabalho sobre psicomelria. Ela apareceu novamente c independentemente na for- mulaffiú da teoría das probabilidades, como considerada por Karhunen (1947); e foi gene- ralizada posteriormente por Locvc (1963). 2. As abordagens seguidas por Ljung (1977) e Kushner e Clark (1978) para cstudar o com- píjrtamento dinámico de nm algoritmo de aproximacáo estocistica reduzem o problema ao escudo da dinámica de uma equaeño dilérencial associada. Entretanto, estas duas abor- dagens sáo fundamentalmente diferentes. A abordagem de Ljung envolve o uso de uma fundió de Lyapunov, enquanto que a abordagem seguida por Kushner e Clark envolve um processo de interpolarse linear e invoca o chamado teorema de Arzdá-Ascoli (Dunfbrd c Schwartz» 1966). A abordagem de Kushner e Clark é seguida cm Diamantaras e Kung (1996) para estudar a convergencia do auto filtro máximo bastado na aprendizagem hebbiana. Ai condusóes obeidas al i sáo as mesmas que as obtidas usando a abordagem de Ljung. 3* Foldiak (1989) expand iu a configurado de rede neural para análise de componentes prin- cipáis incluindo conexóes real i menudas anti-hcbbianas. A motiva^áo para esta modifica* qSo foi derivada de um trabalho anterior de Barlow e Foldiak (1989) sobre adaptarán e eliminacáo de correlato no córtcx visuak al i foi demonstrado que se oü neurónios interagirem de acordo com uma regra anti-hebbiacia, entilo u uidat dos ocurónios def’ nem um sistema de coordenadas no qual niu há uurrelaeoes mesmo quando os sinais inci- dentes tenham fortes cnrrelaffies. O uso de inibicóes lalcrais entre neurónios de saida foi (ambém propostú por Rubner e Tavan (1989) e Rubncr c Schullen (1990). Entretanto, ao contrário do modelo proposto
4B0 Rrrwh Nfvhak por Foldiak, a rede lateral considerada por Rubner ct al. nfo é simétricamente conectada. Em vez di>sn, a rede lateral é hierárquica, com o neurónio i (di gamos) ínibindo tockits os ñutiTij neurónios no modelo exceto para 1,2.i - I, onde r*= 1,2.. O modeló APEX escudado cm Kung e Diamantaras (I £?£?D) tem b mesma topología de rede que a do modelo de Rubner ct al.. mas usa a regra de aprendizagem de neurónio único de Dja (descrita na Se^óo 8.4) para ajustar os pesos sinópticos tanto das conexóes para frente como das concxócs latcrais do modelo. 4. Uma prova rigorosa da convergencia do algoritmo A PEX, com todos os neurónios tendón- do a convergir em conjunto, é dada cm Chen e Liu (1992). 5. Para uma discussao de virios modelos neurmü pora análi.He de componentes principáis e sua comparaíéo, veja O livro do Diamantaras e Kung (1996). 6, Os métodos de ACP nao-lineares, excluindo ACP por núcleo, podem ser agrupados em tres cImscs (Diamantaras e Kung, 1996): * Redes hebbúmas. que sáo obtidas substiluindo-sc os ncurón ios lineares nos algoritmos ACP fraseados na aprendizagem hebbiana por neurdmos nSo-lineares (Karhunen e foUtKnudOi 1995). * Redes repticadwas ou wto-codtfkadfirax, que sao construidas em tomo de perceptrons de múltiplas camadas: as redes replicadoras s:l.t discutirki-; nn Capitulo 4. • Gnw principad. que sáo tascadas em uma estimafáu iterativa de uma curva ou superficie que captura a cslrvlura dos dados (Hastie c Stuelzle, 1989). Em Ritler et ai. (1992) e Cherkasslcy e Mifier (1995), é mostrado que o mapa auto-orijamzável de Kotanen pode ser visto como um prooedimento computacional para encontrar uma aproximaban discreta d.js curvas principáis; ns mapas auto-orgariizávcis sao discuti- dos no próximo capítulo. PROBLEMAS Autofiltro máximo fraseado na aprendizagem hebbiana 8.1 Para o filero casado considerado no Exemplo 3.2, o autovalor X, e o autovetor amociado q sao definiJns por X, - l4<72 q.~5 Mosto: que estes parámetros satisfazcm a relapso básica Rq, - onde Rea matriz de correlacáo do vetor de entrada X. 8.2 Considere o auCnHltro máximo cuide G vetorpeso w(u)cvolui de acordo com a Eq. (8.46). Mostré que a variáncla da saida do filtro se aproxima de X|iti quando n se aproxima do infinito, onde i o maior autovalor da matriz de correlato do vetor de entrada- 83 A íwír^ürí de cattiponentes menores (ACM) é o oposto da análise de componentes princi- pal5- Ma ACM, procuramos encontrar aquetas dire^des que jHüiüMjfant a variáncia da proje^áo. As diretes que s3o assim encontradas sao os auto vetaros correspondentes aos menores (mijiimas) autovalores da matriz de oorrela^áo R da vetor de entrada X(n) Neste problema, exploramos a fbrms de modificar o único neurtnio da Se^&o 8.4, de modo a encontrar a comp<incnlc menor de R. Em particular, trocamos o sinal na regra de aprendizagem da Eq. (5.40), obtendo (Xu et al., 1992)
wj(n + I) = -tv<-w}[xj(hJ Mostré que se o menor autovalor da matriz de correlacáo R fot A, com multiplicidad? I, entio líjTLwfn) = ijq^ R —b" onde qn é a autovelar associado com Análise de componentes principáis fraseada na aprendizagem hebbiana 8.4 Canstrua um grafo de iluso de sinal para representar as Eqs. de valor vetaría] (8,87) é (8.RS). 8.5 A abordagcm por cqua^ao diferencia] ordinaria para a análise de convergencia descrita na Se$Ao R.4 nio se aplica adiante m algoritmo de aprendizagem bcbbiana genera I izado (AHG). Entretanto h expressando a matriz de peso sináptico W(jt) na Eq. (8.91) como um vetor constituido da* colima* individDua de W(íj), podemos interpretar a turneo de atualizafño na maneira usual, e entáo aplicar o teorema da estabilidad? assinldlica. Assim, com base no que foi dito aquí, explore o teorema da convergencia para o algoritmo de aprendi- zagem hebbiana generalizado. fl .6 Neste problema, exploramos o uso do algoritmo hebbiano generalizado para cstudar os campos receptólos h id imcnr i unáis producidas por uma entrada al caló lia (Sanger, L 990). A entrada alearán ¡a consiste de um campo b id i men&íi mal de ruido gaussiano indcpcndenie com média zcro c variáncia unitána, que c convoluido com urna máscara (filtro) gaussiana e entáo multiplicado por uma janela gau^isna, A máscara gaussiana tcm um desvío pa- dreo de 2 pontos (pixeis), c a jancla gaussiana tcm um desvio padráo de 8 pontos. A entra- da aleatoria resultante jrfo s) na posifSo (r* j) pode assim ser escrita como segue: Xa s) - Ma í) * «Ha j)] onde w(a j) e o campo de mido gausslacio independente e idénticamente distribuido, gfr, j)é a máscara gaussiana e m(r,5) é a fundió da júnela g^usi-iana, A convolu^áo circular de g(r, j) c v», j) é definida por * -I ,v -I f-h onde assume-se quejar, r) e n-ifr, jj sáo periódicas. Use 2000 ejemplos da entrada aleatoria x(r,j) para treinar uma rede alimentada para frente de camada única utilizando a algoritmo hebbiano generalizado. A rede tcm 4096 entradas afranjadas tomo urna grade de 64 X 64 pontos, e E 6 saldas. Os píisrui 5 ínápt ¡COS resultantes da rede [reinada sáo representados como um siranjo de 64 x 64 números. Rct- iiae os cálculos descritos aquí c mostra 0$ 16 arranjos dos pesos rináptKDS como máscaras bidimensionais. Comente os seus resultados. 8.7 A Equacáo (8.113) define a versSo transformada du de atualizacao 06) para calcular o vetar de peso realimentado t^n). A transforma^íto ¿ bascada na definido do vetar pesa sináptico wy(n) cm termos dos modos principáis da rede dada na Eq. (8.109). Derives Eq.<8,113). 8.8 Considere a matraz da sistema da Eq. (B. 116), representada pelo grafo de fluxo de sinal da Fig. 8.12 que corresponde a 1 £ fr £j - I. (a) Formule a equa^áo característica desia matriz 2x2. (b) Mostré que a rtiáLriz tcm um auto-valor duplo. F
(c} Ju sti fique a ufi rma^io de que todos 0.4 modos prioc ipai s da rede tém o mesnio autovalor. 8.9 O A II G usa apenas conexóes para frente, enquanto que o algorilmo APEX usa tanto cono xocs para frente como conexocs latera^. A pesar dffites difamias, O ciimpurlamcnto de convergencia a longo pra?o do algoritmo APEX é, cm teoría, cxalamcntc o nicsmo que aqueta de AHG. Justifique a v&lidadc desta afirmado. ACP por núcleo 8,10 Considere que K.. represente a conirapartida centrada do y-esirno elemento K .da matriz de núcleo K. Mostré que (Scholbcopf, ITO7) | ' I * a.. = x; -—£</(*., toy.1 "tS'pí1. )<**-.5 " wl A — I +-¿r¿ Subirá uina representaban compacta desta relatácj n.i fiirma malricúil- 8.11 Mostré que a normali /af ño do autovdor a da matriz de núcleo K é equ i váleme á es ¡gÉní i a de que a Fq. (8.15?) seja satísleiia. 8,12 Resuma as prapriedades da ACP por núclcc
CAPÍTULO 9 Mapas Auto-Organizáveis 9.1 INTRODUCTO Nesle capí tu Lo, continuairiüs nusso cstudo dos sistemas autO'Organizávcis considerando uma elasse especial de grades neurais conhecidas como ¡napas aiLlO’Organizáveis. Estas grades sao bascadas na aprendizagem competitiva; os neurónios de saida da grade competem entre si para serem ativados ou disparados, como resultado que apenas um neurónio de saida, ou uní neurónio por grupo, está Ligado em uní instante de tempo- Um neurónio de saida que vence a competido é chamado de um neurónio vencedor leva tuda ou simplesmente um neitninto vencedor. Urna forma de mduzlr urna compctiglfo do tipo "o vencedor leva ludo” entre os neurónios de saida c usar conoides latcrais inibitórias (i.e., caminhos de realiinentacao negativa) entre ules; esta idéia foli originalmente pro- posla por Roscnblatt (. 195B). Fin um mapa attíty-organitíivel, os neurónios estilo colocados ern nós de uma grade que c normalmente unr ou bidiincnsional. Mapas de dimensionalidade mais alia sáo também possíveis. mas náo sáo 15o ccmuns. üs neurónios se tornam sefesivamente sintonizados a varios padrees de entrada (estímulos) ou classes de padrees de entrada nn decorrcr de um procedo de aprendizílgem. As local izares dos natrón।os assim sintonizados (i-C.. 05 neurónios vencedores) se tomam ordena' das entre si de forma que um sistema de coordenadas significativo para dübrciitcf de entrada é criado sobre a grade (Kohonen. J99üa}. Um mapa auto-argíirtizávd é, portante, caracteri- zado pela formadlo de um mapa topográfico dos padrees de entrada no qual as locidiza^oes espa- ciáis (i.e.r coordenadas/ dos netiránios nu grade sito indicativas das características estatisficas intrínsecas comidas nos padrífa de entrada, da i o nume "mapa auto-urbanizó vcl'1. Como modelo neural, o mapa auto-organizável tornee e urna ponte enire doí s niveis de adapla- C^o: • Rcgras de adaptado formuladas ao nivel microscópico de um único- neurfrnio. * Forma?5o de padróes de sel e I h i dade de caraüterísticas experi mentalmente mcl boros o fi s i - cántente accssíveis ao nivel miefiMCópico de camadas neurais.
Devulo a um mapa auto-organizável ser inerenteincnte nao-] incar, ele pode ser visto como uma generalizadle náo/incar da análise de componentes principáis (Ritter, 1995). O desenvolví mentó de mapas aulo-org¡anizáveis como modelo neural c motivado por uma característica distintiva do cerebro humano: o cércbru está organizado cm vários lugares de modo que entradas sen sonáis diferentes sáo representadas por naipes wmputacionats ordenados tDpologieameftfe. Em particular, entradas MMOriaiS como a táctil (Kaas eL al., 1983), a visual (Hubel c Wiescl, 1962,1977) c a acústica (Suga, 1985) sáo mapeadas para áreas diferentes do córtcx cere- bral de uma maneira tcpulugieamenle ordenada, Assim, o mapa computacional constituí um bloco constnitivo básico na ii’.fra-escrutura de proccssamcnto de informaQáo do sistema nervoso. Um mapa computacional ó delirado por um arranjo de neurónios representando praeessadores ou filtros ajus- tados de forma um pouco diferente entre si, que operare paralelamente sobre os sinais que carregam informafáo. Con&eqüentemenie, os neurónios transformara sinais de entrada em uma distribuido de probabilidade codificada por JocaUxa/tfo que representa os valores calculados de parámetros por posifóes de máxima atividade relativa dentro do mapa (Knudsen el al., 1987), A informadle assim derivada é de uma forma que pode ser fácilmente acessada por prncessadores de ordem mais elevada usando esquemas de concxáo relativamente simples. Organizará o do Capítulo O material apresentado neste capitulo sobre mapas computacianais está organizado como regué. Na 9.2, dcscrevemos doi> modelos de mapeamento de características, que de seu modo pecu- liar sao capazas de explicar cu capturar as características cssenciais de mapas ccmputacionais no cerebro. Os dois modelos diferem entre si na forma das entradas utilizadas. O resto do capitula c develado a considcra^ucs detal hadas de um desics modelos, usual mente referido como um “mapa auto-organizável" proposto por Kohonen (1982). Na Sc^áo 93, usamos considerables neurohiológicas para desenvolver um formalismo matemático do modelo de Kohonen. Um resumo du modelo é apr estrilado na Se^áo 9,4. Propnedades importantes do múdelo sao descri- tas na Se<;áo 9,5, que é seguida por simulaboes computacional na Sefáo 9.6. Finalmente, o desem- penho do mapa de características pode ser ajustado finamente atraves de uma técnica supervisiona- da conhecida como quantizíu^o vetorial por aprendizagem; esta técnica é descrita na 9,7, A Sccáo 9.8 dcscrcvc um experimento computacional sobre dassilicacao adaptativa de padióes que combina o uso de quantizabáo vctonaJ por aprendizagem e o mapa auto-organizaveL Na Sft?áo 9.9, dcscrcvcmos a quanlizacao vctorial hicrárquica construida cm tumo do mapa auto-organízável para compressáo de dados. A Sebáo 9.10 descreve uma outra aplicado do mapa auto-organizável para construir mapas contextuéiis que encontrara aplicacócs cm catcgonzaqao náo-supen corada de clasaes de fonemas a partir de texto, sensoriamente» remoto e explorado de dados. O capítulo con- cluí core algumas considcraqocs fináis na Scyáo 9.12, 9.2 DOIS MODELOS BÁSICOS OE M APE AMENTO DE CARACTERÍSTICAS Qualquer um que examine um cerebro humano fica impresionado com a extensSo que o córtcx cerebral ocupa no cerebro. O cerebro é quase totalmente envolvido pelo córtcx cerebral, que obscu- rece as outras partes, üo ponto de vista apenas da complexidad?, o córtex cerebral pro va vel mente supere qualquer um™ estrutura conhtcidd no universo (Hubcl c WicscL 1977). O que é igualmente imprcssionantc c o modo como diferentes entradas sensoriak (motora, somestésica, visual, auditi-
va. etc.) sao mapeadas para áreas correspondentes do córtcx cerebral de uma forma ordenada-, para avallar este ponto, veja os mapas cito-arqu i tetarais do córte* cerebral na Fig. 2.4. O uso de mapas computacionais oferece as seguíntes propiedades (Knudsen et al., 1987): * Em cada eslágio de representado. cada parte da informado incidente é mam ida no seu próprio contexto. • Neurónios que lidam com parten relacionadas de informado estío próximos entre si de modo a poderem inlcragir atraveft de concxocs sinópticas curtas. Nosso interesse se concentra na construyo de mapas topográficos artificiáis que aprenden! através de auto-organizado tima mancira inspirada na ncurobiologia. Nestc contexto, o ponto que emer- ge da breve discussao sobre mapas computación# is no cerebro ¿ o principia da formando de mapas topográficos, que pode ser formulado como (Kobonen. 1990a): A Idealizad"' espacial de um neurónio de salda tm um nutpa topográfico corresponde a um dominio ou característica particular do dado retinado do espado de entrada. Este principio Ibrneceu a motivado rteurobiológica para dois orw/e/o.v de otopeomertía de caracte- rísticas* diferentes descritos aquí. A Fig. 9.1 mostra a planta dos dois modelos. Em ambos os casos, os neurónios de saida cstao anranjadas em uma grade bidiniensiQnal- Este tipo de topología assegura que cada neurónio tenha um conjunto de vizinhos. Os modelos diftrcm entre si no modo como os padróes de entrada sao especificados. O modelo da Fig. 9.1a ibi originalmente propusto por Willshaw c von der Malsburg (1976) sobre bases biológicas para explicar o problema do mapeamento relinotópico da retina para o córtcx visual (nos vertebrados superiores). Específicamente, hti duas grades bidimensionais separadas de neurónios conectadas entre si, uma délas se projeiando sobre a outra. Uma grade representa os neurónios pré-sinápticos (de entrada) c a outra grade representa os neurónios pós-sinápticos (de saída). A grade pós-sináptica utiliza um mecaitismo excitatórío de curto alcance bem como um meccur ¿fino ¡nihüfiria de it>ngu ateunee- Estes dois mecanismos sí o de natureza local es£o cruciais para a auto-organiza^aa. As duas grades sao conectadas entre si por sinapses modificavéis do tipo hebbiano. A rigor, ponan to, os neurónios pós-sin aplicas náo sí o do tipo o vencedor leva ludo, cm vez disso. é usado um I imiar para asegurar que apenas paucos neurónio® pós-si nápt i eos dispararlo cm um determinado instante. Alcm disso, para evitar um constante aumento dos pesos sinápticos que pode levar ;’i instabilidfide da grade, o peso total associado com cada neurónio pós-sináptico é limitado por uma cundirán de limite superior? Assim, para cada neurónio, alguns pesos sinápticos amnentam enquanto que nutras diniinucm. A idéia básica do modelo de WdLshaw-von der Mahburg c que a proximidade geométrica de neurónios pré-sinápticos scja codificada na forma de corrch- fócs na sua atividade elélrica, c usar estas cürrdaQ&S na grade pos-sináptica de forma a conectar neurónios prc-sinápticos vjzinhos com neurónios pós-sináplieos vizinhos. Dessa forma, um mapeamento lopclogicamente ordenado é produzido por auto-organizólo. Note, entretanto, que o modelo de Willshaw-von der Malsburg ó especializado cm mapeamentos nos quais a dimensáo de entrada é a mesma que a dimensáo de saida. O segundo modelo da Fig. 9.1 b, introducido por Kohonen (1982), 115o pretende explicar dota- Ihes neurobiológicos. O modelo captura as características essencíais dos mapas computacionais do cerebro c aínda se mantera tratávcl do ponto de vista compulse i onal? O modelo de Kohonen apa- rentemente é mais geral que o modelo de Willahaw-vofi der Malsburg na medida cm que ele c capaz de realizar ccmpressáo de dados (i e., rcdutjáo da ¿irncnsionalidadc na entrada).
vcrnudor Ncurórtifl ali'pjdu Arranjn bidimensincial de fKurdriüE pós-sinaplicos Peine de MMMAM uklpCtM, (Ib um l«m tirniljrdk WMKtal siniptkas nrigiiudn deúiicroj nciiróriios prSsi nápticos.’ I i) M«feki de Wj I Ishiiw -víhi dirr Mu Ixbur^ (b'i MihJl*Ici de k •!:•. ’ici. FIGURA 9.1 Dois mapas auto- organizados en caracteríslicas Na real idade» o modelo de Kohonen pcrtencc á elasse de algoritmos de ct>dificíi<;áf> vetorial, O modelo produz um mapeamento [opológico que localiza üEimamcntc um número íixo de velones (i.e., palabras de código) em um espado de entrada de diniensionalidade mais elevada» c desse modo facilita a compressao de dados. O modelo de Kohonen pode, portanto, ser derivado de dois modos- Podcmos utilizar as ide as básicas da aulü-Ofganiza^O. motivadas por considerares neurobiulógicas, para derivar o modelo, que é a abordagem tradicional (Kohonen. 1982,1990a, 1997a). Alternativa mente, podemos usar urna abordagem de quantizacao vetorial que usa um modelo en vol vendo um codificadme um decúdificador, que é motivada por considerares da teoría de comunicado (Luttrcl I, 1989bt I99la). Neslc capítulo, consideramos ambas as abordagens. O modelo de Kohonen receben multo mais aten^So na literatura que o modelo de Willshaw- von der Malsburg. Ele possui certas propriedades discutidas mais adiantc no capitulo, que o tornam particularmente interesante para a comprccníáo c a modelagem de mapas corticais no cerebro, ü restante do capitulo disdica-se a derivante do mapa aülo-ar^M^ável^ sitas propriedades básicas e ram¡ri calóes. 9.3 O MAPA AUTO-ORGANIZÁVEL O principal objetivo do mapa aulo-organizável (SUM. yeij-wxanizmgmap) c transformar um pa- dráü de sinal incidente de dimcíisáo arbitraria cm um mapa discreto uní- ou bidimenslonal e realizar esta transformaban adaptat ivamente de uma maneira topvldgic amen te ordenada. Copyrighted material
A Figura 9.2 mostra o diagrama esquemática de uma grade bidimcnsional de neurónios nor- ma Imente usada come a mapa discreto. Cada neurónio da grade está totalmente conectado com todos os nós de fontc da camada de entrada. Esta grade representa uma estrutura alimentada adianto com urna única camada computacional cotisistindo de neurónios afranjados cm linhas e col unas. L'ma grade unidimensional éum caso especial da configurare representada na Fig. d.2: neste caso especial, a camada computacional consiste simplesmentc de uma única coluna ou linha de neurónios. Cada padrao de entrada «presentado á grade consiste típicamente de uma regían localizada cu “foco** de atividade contra um fundo em repouso. A localizacao c a natureza deslc foco usual mente variam de uma realizado do padreo de entrada para outra. Todos os neurónios da grade devem, portante, ser apostas a um número suficiente de diferentes realizantes do padrao de entrada para assegurar que o processo de auto-organiza^áo ten ha uma chance de amadurecer apropriadamente. (> algoritmo responsávcl pela formacao do mapa auto-organizávd cometa primeiramente tnicializando os pesos sinápticos da grade, isto pode ser fciio atribu indo- lites vu/aner pegueras AwnadcH c/e wffl gerudttr de números aleatorias] fazendo dessa forma, nenhuma organizado previa c imposta ao mapa de características. Lima vez que a grade lenha sido apropríadamcnlc inicial izada, há trés processos essenciais envolvidos na fonna^áo do mapa auto-organizáveU como resumido aquí; I. Críflijjcffofo. Para cada padrao de entrada. Ofi neurónios da grade calculara seus respectivos valores de uma fundan discriminante. Esta tangAo discriminante Comete a base para a competi- ese entre os neurónios. O neurónio particular com o maior valor da funijáo discriminante c declarado vencedor da compctiijáo. 2+ Cooperaban. O neurón io vencedor determ ina a loeali zapito espacia I de uma vi ¿¡ nhanfa topol ógica de neurónios excitados, fomcccndo assim a base para a cooperaban entre os neurónios vizinhos. 3. ^óiíí/wk'ít. Este último mecanismo permite que os neurónios excitados aumentara, seus valores individuáis da fun^áo discriminante em relajo ao padrao de entrada atraeos de Copvriqhted material
Hidden page
Hidden page
figura s.a Fuix^o da vifinharipe gnussian^ onde 0 vetor discreto r define a pósito de neurónio excitado/ e r define a posado discreta do neurónio vencedor í\ sendo ambos medidos no CSpapO de Sñidu discreto. Uma ouira característica única do algoritmo SOM é que o tamanho da vizinhan^a tipológica diminuí enm o tempo. Esta exigencia c salisfeita tazcndo-sc com que a Largura a da fttnfio de vízinhanca (tipológica A . diminua com o tempo. Uma escolha popular para a dependencia de a com O tempo discreto néo decaí mentó exponencial descrito por (Rítterct ai-, 1992; Oberrnaycr ct al., 1991) = O(l exp zr = ..., (9.M onde o c o valor de o na inteialiafio do algoritmo SüM, eré urna constante de lentpu, Conse- qüememenle, a vizlnhanp tipológica assume uma forma variável no tempo, como mostrado por - 2^}} n = 0,lt2,,.., (97) onde CT(h) c definido pela Eq. (9.6}. Assim, quando o lempo n (i c., o número de itcra(6cs) aumenta, a largura a(n) decresce a uma laxa exponencial e a vúinhai^a apológica diminuí de uma maneira correspondente. De agora cm diantc, nos referiremos a h( como a de vizinfian^a. Um nutro modo útil de ver a varia^áo da fun^áo de x izinhanqa em torno de um neurónio vencedor j(i) é como segue (Luttrcll, 1989a). ü prepósilo de um A (w) largo c essenc¡almente correlacionar as dirc^óes das atualizaqóes dos pesos de um grande número de neurónios excitados da grade. Quando a largura de hó diminuida^ também diminuí o número de neurónios cujas di reines de atualiza^ao sao correlacionadas, Fste fenómeno se (Or- na particularmente obvio quando o treinarnenlo de um mapa ñulo-organizávcl ¿ cxccutado cm uma tela de computador. É um desperdicio de recursos eomputacionais mover um grande nó- mero de graus de liberdade em tomo de um neurónio vencedor de forma correlacionada, como no caso do agoritmo SOM padráo. Em vez disso, c muito melhnr usar urna forma de treinamen- to SOM normalizada, na qual trahalhnmns com mn número bem menor de grma de Hheaiade runtnaltxadím. l.-sta upera^ao é fácilmente realizada na forma discreta tcrido uma funqao de vizinhanca Ai>Si.(n) do largura c-misturiif!, mas gradualmente aunienfando o número tolal de
neurónios, Os noves neurónios sao inseridos na mciade da distancia entre os neurónios amigos, e a suavidade do algoritmo SOM garante que os novos neurónios se insiram na adaptado sináptica de uma maneira suave (Lultrell, 19S9a). Um resumo do algoritmo SOM normalizado é ¿presentado no Problema 9.13. O Processo Adaptativo Agora chegamos ao último processo, o processo adaptativo sináptico, na formado auto-organizada de um mapa de características. Para que a grade seja auto-organizáveL é necessário que o vetor de peso sináptico v do neurónio j da grade se modifique em relamió ao vetor de entrada i A questáo é como fazer esta mcdificafio. No postulado de aprendizagem de Hebb, um peso sináptico é aumen- tado com uma oconéncia simultánea de atividades prc-sináptica c pós-sináptica. O uso de tal negra é muito adequado para aprendizagem assoctaliva. Entretanto, para o tipo de aprendizagem nác- supervisionada considerado aquí a hipo tese hebbiana na sua forma básica náo é satisfatória pelas seguintes razoes: as modificares das concciix idades ocorrcm apenas cm uma dirc^ao, o que leva no final todos os pesos á saturado. Para superároste problema, modificamos a hipó tese hebbiana incluindo um terma de esquepimenta— gtyjWf onde w c o vetor peso sináptico do neurónio / c gi¡j ) é uma fun£áo escalar posiiña da resposta y. A única ex i gene.:i imposta á tunado é que o termo constante da expansáo em série de Taylor de giv) seja zero, de modo que podemos escrever =0 para_v“Ü (9.S) O significado desta exigencia se tomará aparente brevemente. Dada esta funpao, podemos cntáo expressar a modificado do vetor peso do neurónioj da grade como seguc: A V nv/- fi0$wy (9.9} onde q é o parámetro da (axa de aprendizagem do algoritmo. O primeiro termo do lado direito da Eq. (9.9) í o termo hebbiano e o segundo termo é o termo de esquecimente. Para satisfazer a exigen- cia da Eq. escoliemos uma fún^áo linear para gíj^)t como mostrado por aio) Podemos simplificar mais a Eq. (9.9) íazendo = P'1) Usando as Eqs. (9.10) e (9.11) em (9.9), oblemos Aw; = - wj) (P-12)
Hidden page
Hidden page
Hidden page
computadonais de uma grade. Suponha que<b represente unta transformado niío-linear chamada de mapa de caraClei'i-'cticSS, que tnapfia ín füpa^u de urllnada f para ü espj^O de saída COÍOO mostrado per (9.151 A Equa^áo (9.15) pode ser vista como uma abstrae; áo da Eq. (9,3) que define a IocaIizaqjiQ de um neurónio vencedor /(x) surgido em resposia ao vetor de entrada x. Pur exemplo, em um contexto neurobi 0 lógico, O espido de entrada ¿t pode representar o conjunto de coordenadas de receptores somcstcsicos densamente distribuidos sobre a superficie inteira do corpo. Correspondenfemente, o espado de saída ai representa o conjunto de neurónios localizados naqutla camada docórtex cere- bral á qual os receptores somcstcsicos eslao confinados. Dadoum vetor de entrada x, o algoritmo SOM primeiro ¡den tilica um neurónio com o melhor casamento ou neurónio vencedor j(x) no espado de saida ¿-í, de acardo com o mapa de característi- cas d>. C) vetor peso liniptico w, do neurónio r(x) pode entSo serv isto como urnpt»rferro para aquele neurónio no espado de entrada 3?; isto c, os demonios sinápticos do vetor w podem ser vistos como as coordenadas da tmugern de neurónio r projotada no espado de entrada. Estas duas opera^óes sao mostradas na Fig, 9,4, O mapa de características <P tem algumas propriedades importantes: FIGURA 0.4 llustrecáo da • u □una entra 0 mapa de característica $00 vetor tfe paso w, 00 neuránin venced» i Pmprit tladí 1 ► Aproximadlo do Espado de Entrada, O mapa de curacterislica.'i <D, representa- do pela canjunro de ve/r>rt?.v de pesas sinópticos {w } no espado de saida .?íT ^tí®m fwa apiTfXitnafdü pura O enpa^u de enüTlda 9f. □objetivobásico do algoritmo SOM c armazenar um conjunto grande de vetores de entrada x E 3t( encontrando um conjunto menor de prototipos w E SÍ, de modo a íbmuccr uma boa aproxima-
Hidden page
Hidden page
¡377 =-f ¿Vi(x)n(c-e(K))(x (C) J *. (9.21) Asgnn, corrí basdí ñas Eqs¿ (9.20) e (9.21 ), as condi qócs 1 c 2 formuladas anteriormente para o algoritmo de Lloyd generalizado devem ser modificadas con» seguc (Lutircll, 1989b): Cufídi^aa I. Dado o vetor de entrada x. escullía o código c “ c(x) para minimizar a medida de distor^áo D2 - dv~(v )|s - x'(c( i) + vf (9-22) Candirán II. Dado ú código c, calcule o vetor reconstruido ir(c) para satisfazer a condicao íh/^KjJtfC -C(X))X (9.23) A Equa^áo (9.23) c oh ti da iázcndo'Sc a derivada partía! t)P ¿)x'(c) na Eq. (9.21) igual a zero c cniao to$alvcndo-se para x'(c). O modelo descrito na I ig. 9.5 pode ser visto como um caso especial daquele mcslrado na Fig. 9.6. íim particular. se tlzertnosa fun0o de densidade de probabilidade jtfrjdo ruido v igual a uma tunero delta de Di rae as condenes I e II se reduzcm as condicócs 1 c 2 para o algoritmo de Lloyd generalizado, respectivamente. Para simplificar a cundido I. assuminiosque n(v) é urna fun^áo suave de it. Com isso poderse mostrar que. para unía íiproxitnasáo de segunda ordem. a medida de disto^áo />, definida na Eq. (9,22) consi*te de duas componentes (Lutlrcll, 19S9b)t • O termo de distarlo conreiwitfnal, definido pela disiorfáo de erro quadrado |i — xr(c)||3 * Um termo de curvatura que surge do modelo de ruido ir(t?) Assumindo que o lomo de curvatura seja pequeño, a condi^áo I para o modelo da Fig. 9.6 pode ser aproximada pela condi^áo i para o modelo sem ruido da Fig. 9.5. Por sua vez, htc reduz a cóndilo I a uma regra de codifiea^áo por vizinho mais próximo, como anteriormente. No caso da comli^Bo II, podemos realízá-la usando aprendizagem por dcscida cstocáslica. Em particular,, cocol hemos vetores de entrada x aleatoriamente do espado de entrada ÜT usando o fator ¡í/x/K(x) c acUtilizamos o vetor reconstruido x(c)C0[rLÜ ^^gue (Lultrell, 1989b}: (9 24) onde neo parámetro da taxa de aprendizagem e c(x) c a aproximado da condiffto 1 por codificado por vizinho mais próximo. A cqua^áo de atualizando (9.24) é obtidn por níspero da derivada parcial na Fq. (9.21). Esta otualDa^Ao ¿ aplicada a todo c. para o qual temos
M a paí Auto-Okaneávf.is 499 7t(c - c(x))> D (9-25) Podemos considerar o procedí mentó de descida do gradiente descrito na Eq. (9.24) como um modo de minimizar a medida de distor^ao D, da Eq. (9.19). Isto é, as Eqs. (9.23) e (9.24) sfc essenelal- rrienle do mesmo tipo, exceto pelo fato de que (9.23) é por lote e (9,24) é continua (i.e.. na forma fluente) A equa^o de alualizaQüo (9.24) é idéntica ao algoritmo (continuo) SOM da Eq. (9-13), leudo em mente as correspondencias lisiadas na Tabela 9,1, Cociseqñentemente, podemos afirmar que o algoritmo de Lloyd generalizado para quantiza^áo vetolia! c a versan com trvii.amento por lote do al geni mu SOM com tamanho de vizinhaoQa zctol para vizinhan^a zcro, ?c(0) “ I. Note que para obtermos o algoritmo de Lloyd generalizado da versao por lote do algoritmo SOM, nao ncccssita- mos fazer qualquer aproximadlo porque os termos de curvatura (c os termos de ordem mais alta) nlo contríbuem quando a vizinhanqa tem largura rera. TABELA 9.1 Correspondéncía errfre o Algoritmo SOM e o Modelo da Fig. 9.6 Modelo de Cedí íka^iü e Deeodificafto da Fig. 9.lí Al^ricmo SOM Codifiodor cta} Ntürtni-u cúrti ¡re.-i:i casamento j(i) Vetor reconsirviíli'níel FimcSri de densidade du pnsba.dude lt(t - C(.x)) Vetar peso sináplko w Futido de vizinhanca ^.kl. Os pontos importantes a notar da discussao apresentada aquí sao: » 0 algoritmo SOM é um algoritmo de quantizaeño vetor-al, que fomece uma boa aproxima- dlo para o espado de entrada 3f, Este poíno de vista fomcec uma outra abordagem para derivar o algoritmo SOM. como exemplricado pela Eq. (9.24). • De acordo com osle ponto de vista, a fundan de v izinhanca A i i? no algoritmo SOM tem a forma de uma funcao de densidade de probabilidade. Ein Lutlrell (199 la), um modelo gaussiano de media zero é considerado apropnade para o ruido t no modelo da Fig. 9.6. Temos assim tambem uma justificativa teórica para adotara fundad de t i/inhansa gaussiana da Eq. (9.4). O algoritmo SOM por tote* c mcramenic urna reformula^o da Eq. (9.23), com os somatónos usa- dos para aproximar as integráis no numerador c no denominador no lado di rci lo da equaqau. Note que nesla versáo do algoritmo SOM a ordem na qual os padróes de entrada sdo apresentados á iede náo tem efeito sobre a forma final do mapa de características, c nao há nocessidade para uma vari- a^fio da laxa de aprendizagem. Mas o algoritmo aínda requer o uso de uma funfáo de vizinhan^a. Propriedade 2. Ordenarán Tipológica. O mapa de características O calculada peto ¿ligérrimo SOM c ordenada de nwdu tipológico. no sentido de que a IvcaUsac&o espacial de ttífi rteurwvo na grada corresponde a urn dominio parí icitiar ou curuetcrfaiica dos padrees de entrada. A propriedade de ordenadlo topo]ógica,'c uma consequéneia dircla da cqua^ao dcatualiza- £áo (9.13) que fnn^a o vetor poso sináprco w do ncuror.io vencedor i(x) a se mover em dire^üo ao vetor de entrada x. Ela tambero tem o efeito de mover os veloces de pesos sinápticos w dos
neurónios mais próximos/junto com o neurónio vencedor í{x). Podemos, portante, visualizare mapa de características <l> como uma rede elástica ou virtual com a topología de unía grade uni- ou tridimensional como prescrito no espado de saida .4, o cujos nós tcm pesos como coordenadas no espado de entrada (Ritter, ] 995). O objetivo global do algoritmo pode assim ser formulado como: Aproximar n expapade entrada jKirpnnfÉ'/m.v impnrtótifKi.'i na forma de ventrei de pt'Sos sirtáplrmv M'. de tai forma que O mapa de carocferíslicas ferne^a uma reprexenfOfliOfal dan uaraelerixtii. aa importantes dos vetares de entrada x e em termos de im certa critirio. O mapa de características d> c normalmente mostrado no espado de entrada SE. Específicamente» todos os ponteirus (i.c.„ vetares de pesos sinápticos) bío mostrados como pontos, e os ponte i ros dos neurónios vizinhos sao conectados com 1 inhas de acorde com a lapo logia da grade. Assim, usando uma linha para coneciar dois penteiros w c w, estamos indicando que os neurónios corresponden- tes j cj sao neurónios vizinhns na grade. Propriedade 3. Casamento de Deitsidade. O mapa de caracteñslicas O refale vartaifas na es* tafistica da disfribrtiifa de entrada: regióos no espada de entrada BE de ande velares de amostra x sw rut&ados com tana atta probabilidade de ocorréncia sao milpeadas para dominios matutes do espado de senda ¿4, e paríanla eom melhor nesalufai que regioes em 9f das quais vetares de amos- tra x óy/d retirados com ama baixa probabilidade de ocurrencia. Considere que /jx) represente a fdp mullidimcnsícmal do vcior de entrada aleatorio X. Esta fdp. integrada sobro todo o espado de mirada 3f, deve ser igual á mudado, por dcfini^áo: | /x(í>fit=l Considere que represente o Jalar de rnugnifieaifa do mapa, definido como o número de neurónios cm um pequeño volume rfx do espado de entrada 3t. O fator de magnificando, integrado sobre o espado de entrada SC deve contcr o número total Ide neurónios na rede, como mostrado por m(x}íh=i (9.26) T- —W Para o algoritmo SÜM cletuar o casamenta exata com a denstdade de entrada, é necessário que (Anuui, 1980) rtí(x)MA(30 {W} Esta propriedade implica que se uma regido particular du espado de entrada conté™ estímulos que ocorrem freqüentcmentc, ela sera representada por mna área maior no mapa de características que uma regiáo do espado de entrada onde os estímulos ocorrem menos freqüentementc. Geralmente em mapas de características bidimensionais, o fator de magnificftfío m(x) nao pode ser expresso como uma funcáo simples da fun^o de denudado de probabilidade \(x) do vetor de entrada i. Apenas no caso de um mapa de características unidimensional é possívcl derivar tal relajo. Para este caso especial, constatamos que, ao contrario da suposicao anterior (Kohonen,
1982), 4 fator de magnificado j«(x) jw é proporcional a /x(x). Dois resultados diferentes sao relatados na literatura, depeudendo do método de codificado defendido: 1. Cüíiifi&tCüO por mínimo dis tonudo, pela qual sao maní idos os terrinos de curvatura c lodos os termos de ordem mais alta na medida de distorpáo da Eq. (9.22) de1, ido ao modelo de ruido fc(u). Esto método de codifícalo produz o resultado 3Í*) (9.28) que é o mesmo resultado obtido para o quantizador vetorial padrao (Luttrcll, 1991a). 2. Codificacaa por vizlnho mais próximo t que emerge se os termos de curvatura ferem i gnorados , como na forma padrao do algoritmo SOM. Este método de codificado produz o resultado (Ritler. 1991) ’(x) (9.29) Ainda é válida a nessa ftfirmafto anterior que um agrupamento de estímulos de entrada frcqücnicmcnle ooorrenlc é representado por uma área tnaior no mapa de características» embona em uma versan distorcida da condifáo ideal descrita na Eq. (9.27). Como regra geral (confirmada por simulaqócs computacionais), o mapa de características calculado pelo algoritmo SOM tende a representar excessivamarte rejnftes de baixa deittidade de entrada e a representar insuficientemente regieres de alta densidade de entrada. Em outras palavras, o algoritmo SOM tal ha cm fcmcccruma representarán fiel da distribuido de probabil idade intrín- seca dos dados de entrada.10 Propriedade 4, Selefio de CMaeierfctica^ A partir de dados do de entrada com uma disiribuicao nao-linear, a mapa autO’Or^antzáveí é capaz de seccionar um conjunto das mcihores característica* pura aproximar a dístribidcáo subyacente. Esta propriedade é uma culnunáncia natural das propnedades 1 a 3. Ela nos faz lembrar a idéia da analise de componentes principáis que c discutida no capitulo anterior, mas com uma diferenca importante como ilustrado na Fig. 9.7. Na Fig. 9.7 a, mostramos uma distribuido bidimensional de pontos com média zero resultante de um mapeamento de entrada-saida linear corrompido por ruido aditiva Ncsta situado, a anal i se de componentes principáis funciona mu .tobera; ela nos diz que a melhor describo da distribuido “linear” da Fig. 9.7a é definida por uma linba reta (i.e., um "hiperplano” unidimcnüional) que pMM pela origem C com.* paralelamente a» autavetor asscciado cora o maior auto valor de matriz de correlato dos dados. Considere a según a situado descrita na Fig. 9.7b, que é o resultado de um mapeamento de entrada-saida nao-linear corrompido por ruido aditivo de média zero. Nes:a segunda síluafdo, é impossível para uma aproximado por linha reta calculada por análise de componentes principáis ibrnecer unía descrí^áo aceilável dos dados. Por mitro lado, o uso de um mapa autn-organizável construido sobre uma rede unidimensional de ncunonios c capaz de superar este problema de aproximado cm lirtudc de sua propriedade de ordenacáo topológica. Esta última aproximacáo c ilustrada na Fig. 9.7b. Enn termos precisos, podemos afirmar que mapas de características auto-organizáveis fomc- ecm urna aproximarán ^¿vcTieifcr das auim chamadas cmívo.í principáis" ou superficies principáis (Hastie o Stuctzlc, 1989), c podem, perianto, ser vistos como uma generalIza^áo nio-lmear da análise de componentes principáis.
FIGURA 9.7 () Distribuid Oidirr^nEÍDnal produzida pór um mapeamento de entrada-saída linear, (b) Diginbu^aü bkÜTTienEional prcdu^ Já pór um mapeamento de «nmfa-fiAHa rkáü-linear 9.6 SIMULAQÓES COMPUTACIONAIS Grade Bidimensional Aclonada por uma Distribuirán Bidimensional llusiramos o comportamc-rtlü dü algoritmo SOM usando simulares eomputacionais para cstudar uma rede com I0Ü neurflnios. afranjados na forma de urna grade bidimensional com 10 linhas e 10 colimas, A rede é t re i nada com um vcior de entrada bidimensional k, cujas elementos.y c.r^ cstáo uníformvmcnie distribuidos na regiao ((-1 < ,r. < 1): (-1 <-r, < H) |. Para inicializar a rede, os pesos Miiápiicns sáo cscol'lndos de um conjunto aleatorio. A Fig. 9.8 mcslra tres cstágios do trci namcnlo atraves do qual a rede aprende a representar a distribuido de entrada. A Figura 9.8a mustra a distribuirán de dados usada para treinar o inapta de características, A Figura 9.8b mostra es valores iniciáis dos pesos sinápticos, cscoíhiJos aleatoriamen- te. As Figuras 9.8c e 9.8d apreveníamos valores dti?i veto re h de pesos .‘iinúpticos. inundas tomo pontos no espaqo de entrada, após a ccnclusáo das Fases de ordenarán c convergencia, respectiva mente. As '.mitas desenbadas na I :g. 9.K concclam iieuronios viz.mhog'tatreves de liabas e colimas) da rede.
FIGURA 9.S (a) Distribui^áo dos dados de entrada, (b) Cene if üü inicial da grade bitírmensional. (c) Condiíáo da grade no final da tase de ordenado, (d) Cond ipáo da grade no final da lasa de oonvergéncia Os resultados mostrados na Fig. 9.8 demonstran! a fase de ordenado e a fase de convergencia que caracterizara o processo de aprendizagem do algoritmo SOM. Durante a fase de ordenado, o mapa se efesdobm para formar uma i nal ha, como mostrado jia Fig. 9.8c. Os neurónios sao mapeados na ordem correta ao final desta fase. Durante a fase de convergencia, o mapa se estende para prccn- cher o espado de entrada, Ao final desta segunda fase, mostrada na Fig. 9.8d. a distribuido estatifi- nca dos neurónios no mapa se aproxima daqucla dos vetares de entrada, cxccto por alguns efe i tos de borda. Comparando o estado final do mapa de características na Fig. 9.8d com a distribuí váo uniforme da entrada na Fig. 9.8a, vemos que o ajuste do mapa durante a fase de convergencia capturan as irregularidades locáis que podem ser vistas na distríbuiqáo de entrada. A propriedade de ordenado topológica do algoritmo SOM está bem ilustrada na Fig. 9,8d. Em particular, observamos que o algoritmo (após a convergencia) captura a topología intrínseca da distribuido uniforme na entrada. Ñas simulares computacionais apresentadas na Fig, 9.8, tanto o espado de entrada como o espado de saída sí sao bí dimensional s.. Grade Unidimensional Acionada por uma Distribu ¡cao Bidimenslonal Examinamos agora o caso quando a dimensao do espado de entrada é maior que a dimensáo do espado de saida ¿í. Apesar dcstc dcscasamcnto, o mapa de características é freqüentemente capaz Copyrighted material
Hidden page
11 LO 20 30 40 SO 60 70 80 90 100 (c) Fl G U RA fi.l 0 (a) Dscaimenlb HKponÉncial do parámaind da runfie da vizintianpa □( n). (b) Dacaimertta expíinfincial do parámetro da laxa de aprendizagem T|(n). (c) Forma inicial da Furtfáo de vizinhanca gaussíana. ! d! Forma da I.jf*q3o de vizinharipH no Final da fase da onfenagSa {i. a., inicio da lase de convergencia) uma grade unidimensional. O parámetro da ñtn^áo do vizinhan^a mostrado na Fig. 9,10a, cometa com um valor inicial CT. = 18 c cntáo diminuí para aproximadamente I cm 1000 itera^óes durante a fase de ordenaba Durante esta mesma fase, o parámetro da tasa de aprendizagem ti(fi) contera com um valor inicial H,= 0,1 c cntáo dccrcscc para 0,037. A Figura 9,10c mostra a distri- buidlo gaussiana inicial de neurónios em tomo do neurónio vencedor localizado no ponto méd lo da grade unidimensional, A Figura 9. lOd mostra a forma da iün^áo do vizinhan^a no final da fase de ordenado. Durante a fase de convergencia, o parámetro da taxa de aprendizagem dccrcscc linear* nenie de 0,037 a 0,001 em 5000 itera^óes. Durante a mesma fase, a fundan de vizinhan^adecresce esencialmente a zcro. As cspccifícagócs da fase de ordenado e da fase de convergencia para as simulagóes, computacionals da Fig. 9.8 envulvendo a grade bidimensional sao si mi lares aqueles usadas para a grade unidimensional, exceio pelo fato de que a fungáo de vizinhim^a é agora bidimensional.
O parainctron(jí) cometa com um valor inicial 5 e cntáo docrcscc para D,75 em 1000 iterares. A Figura, 9.11 mostra o valor inicial da fun?áa de vizinhan^a gaussiana bidimeriB tonal A,úi), para ah - 3 e uin neurónio vencedor centrado no ponto (7, S) dentro da grade bidimensionaí de 10 x 10 neurónios. Mcumnin i-enccdef FIGURA S.11 Condlpfc inicial da Fur^áo de vifintinn^ gaussiana bidimsniÍDrál téntráda értl um PiAurórtió vénefi- düf iccaliiaOQ no pomo (7. B) em uma grade bidimensiúr^l tfe 1ü * 10 nouiMo* 9.7 QUANTIZAQÁO VETORIAL POR APRENDIZAGEM A qttafít izando vetorial, di se ui ida anteriormente na Se^áo 9.6, ó uma técnica que üxpicra a cstrutura subjaccnte dos vetores de entrada para o propósito de compressáo de dados (Geraho e Cray, 1992). Pispe ciñe;) mente, um espado de entrada c dividido cm um número de rcgiócs distintas, c para cada rcgiáo é definido um vetor de reconsinitfo. Quando um novo vetor de entrada é aposentado ae quantizador. c determinada inicialimente a regiáo na qual o velor se cncontra, c cía c cntáo represen- tada pelo vetor de reprodujo paraaqueh regiáo. Com isso, utilizando unía vento codificada deste vetor de reprodujo para armazenamento ou transmissao no lugar do vetor de entrada original, poderse cbtcr uma considcravcl economía cm armazenagem ou Largura de banda de transmissáo. ás cusías de algunia di store. A colecto de possiveis vetares de reprodujo ó chamada de livro de código do quantizador, e seus niemtiros sáo denominados patarras de código. L'm quantizador vetorial pom mínima distorqao de codificado é chamado um quantizador de lómnol ou por vlzinko mais próximo. já que as cc/m/úi.s' de Vóronoi cm tomo de um conjunto de pontos cm um espado de entrada coiTospcndem a uma partido daqueie esporo <le acorde com a regia dt¡ vizinhn mais próximo bascado na métrica euclid ana (Geraho e Gray, 1992). A Figura 9,12 mostra um ejemplo de um espado de entrada dividido em qualro células de Voronoi cora seus vetares de Vbronoi associados (i.e.» vetores de rcconstrucáo). Cada célula de Voronoi coiitém aqueles pontos
AGURA 9.12 Diagrama do Voronoi fliwptwendp cuatro células. (Adaptado •de R.M. tjffly, 198'1. ot m pemissáo do IEEE.) do espado de entrada que sfó os mais próximos do vetor de Voronoi dentre a totalidade dcstcs pontos. O algoritmo SOM fomece um método aprox i i nativo para calcular os vetores de Voronoi de uma maneira nao-aupervisi onada, com a aproximado sendo especificada pelos vetares de pesos sinápticos dos neurónios no mapa de características; isto é sitnptesinente a rcformuEacáo da pro- priedade I do algoritmo SOM discutida na Se^áo 9.6. O cálculo do mapa de características pode, portanto, ser visto como o primeiro de dois está&ios para resolver de forma adaptativa um proble- ma de claSAifica^áo de padrees, como mostrado na Fig. 9.13.0 segundo cstágij c realizado pela quantizacac vetorial por aprendizagem, que fornccc um mecanismo para ó ajuste finó de um mapa de características. Professor FlüuRA 9.1 S DiagraniB am ¡Mocos da classiücaqSo adaptaEiva co padres, usando um mapa cü caractarístoas auto-organlzáual e CjuáMiUdOr vfilbriál por apr&ndizagairi I Rdtntot fdc duw A quanti¿cfí¿av vetoriui per aprentlizagent'- (LVQ, learning vector quafitriarton) é urna técni- ca de aprendizagem supervisionada que usa a informarán sobre as classes para mover hgeiranKnte os vetores de Voronoi, a fim de melhórar a qualidade das regiocs de decisáo do classificador Lím vetor de entrada x é lomado aleatoriamente do espado de entrada. Se os rótulos de classe do vetor de entrada i e de um vetor de Voronoi w concordarem, o vetor de Voronoi w é movido em dire^áo ao vcior de entrada x. So* por outro lado, os rótulos de elasse do vetor de entrada x c do vetor de Voronoi w discordaren), o vcior de Voronoi w c afastado do vetor de entrada x.
Considere querepresente o conjunto de vetores de Mxonoí e que{i.}'* represente o conjunto de vetores de entrada (de cbscrvacáo). As&unlimos que há muito man valores de entrada da que vetares de Vorunoi, o que i típicamente o caso na prática. G algoritmo de quanti zapito vetaría! por aprendizagem (LVQ) opera como segue; {i) Suponha que o vetar de Varona i vi scja o mais próximo do vetor de entrada i. Considere que :-£m represente a classe associada com o vetor de Voronoi w c c€i represente o rótulo de classe do vetor de entrada h . O vetor de Varona i w. é ajustada como segue: • Se = '£ , entao w/n + l) w (n) + ot, | v - w(n)] onde 0 < a, < 1. * Se, por outro lado, 11 , entJo w(n f lí-w^fll-otjx-w/n)] (9.30 (9.31) (¡i) Os cutros vetores de Voronoi nao sao modilicados. F dcscjávcl que a constante de aprendizagem a dccresqa monótonamente com o número de itcracocs ji. Perejemplo,£tqpode inieialmenteser 0,1 ou menor, eentaodecreseer linearmentecom n. A pos varios pastos alravés dos dados de entrada, os vetores de Voronoi típicamente convergen!, e o treinamento está completo. Entretanto, podem aparecer dificuldades se o método fer aplicado sem o cuidado adequado. 9.8 EXPERIMENTO COMPUTACION AL: CLASSIFICAQÁO ADAPTATIVA DE PADRÓES Em classirLc^áo de padróes, o primeiro e mais importante passo é atetefito (extrajo) cántete- rfclietis, que normalmente é realizada de uma mane ira nao-supon isi onada. O objetivo dcstc primei- ro passo c sclccionar um conjunto razoavclmcnlc pequeño de padróes, no qual está concentrado o canteüdo de informaba essencial dos dados de entrada (a ser clasificado). O mapa auto-organizável, cm uiludo da propriedade 4 discutida na Sc^áo 9.5, c bem adequado para a tarefa de sclccao de características, particularmente se os dados de entrada forem gerados por um processo náo-linear. O segundo passo na clarificado de padróes é a cíassij¡cítt;ao propiamente dita, onde as características sclccionadas dos dados de entrada sao atribuidas a classes individuáis. Etnbora um mapa auto-organizavcl scja equipado tambem para realizar a classifica^áo, o procedimcnto reco- mendado para se obter o melhor desempenho é acampanhá-lo com um esquema de aprendizagem supervisión ¿nía para o segundo estágío de classi ficaqáo. A combinacáo de um mapa auto-organizávcl e um esquema de aprendizagem supervisionada forma a base de uma cla.'iS0¡caf3o adapiativa cíe padrón de natureza híbrida. Esta abordagem híbrida para classifíca^áo de padróes pode tomar diferentes formas, depen- dendo de como o esquema de aprendizagem supervisionada for implementado, Um esquema sim- ples é usar um quantizador vetaría! por aprendizagem, que é descrito na $e0O anterior. Dessa forma, temos o classiÍ1 rador adaplativo de padróes de dois estáglos mostrado na Fig. 9.13. CopyrÍQhted mstensl
Neste experimento, revisilaníos a dassif¡ca?áo de padrócs bidimensionais supeipostos com padrócs de distríbuifocs gaussianas com rótulos I (elasse 'íí () e 2 (elasse *€ que foi descrita inici- almcnte no Capitulo 4 envolvetido o uso de um pcrccptron de múltiplas camadas [reinado com o algoritmo de retropropagacao. Os gráficos de espal ha mentó para os dados usados no experimento sáo mostrados na Fig, 4.13. A Figura 9.14a mostra o mapa de características bi dimensional de 5 x 5 neurónios após o treinamento com o algoritmo SOM estar completo. O mapa de características foi rotulado, com cada neurónio atribuido a urna elasse ou a outra dependendo de como ele responde a dados de teste retirados da distribuido de entrada. A Figura 9.14b mostra a fronleira de dccisáo realizada pelo mapa de características operando sozinho. A Figura 9.14c mostra o mapa de características modificado após ser ajustado de uma maneira supervisionada usando LVQ. A Figura 9.l4d mostra a fronteira de decisño produzida pela a^áo FIGURA 9.14 (a) Mapa aulMrganizável apns rotúlela ib) Fronteira de decisáe ennetruíde pelo mapa de características da parle a.{c) Mapa rotulada após quantlzBfAo vetonal por aprondizag&m. (di Fmnieira de dpcisáp construida pelo mapa de caractedslicas da parle c combinada dos algoritmos SÜM e LVQ. Comparando estas duas figuras com as su as contrapartidas mostradas ñas Figs. 9.14a e 9.14b, vemos, de uma maneira qualitativa, o efeito benéfico oblido pelo uso da LVQ, A Tabcla 9.2 aprésenla um resumo dos desempenhos de classificacán do mapa de característi- cas sozinho e do mapa de características traba Ihando junto com o quantizador vetorial por aprendí-
Hidden page
Hidden page
FIGURA 9.15 (a) Querubzadqt vetorial de aslágia único cam entrada de cfimMisionalidade quatro (tú Quambuador velrxial hnrárqukxi de dois eSlágidS usarlo quarttizadorts Miaríais de duaa entradas. (De S R Lutireii, iW9a. direiioa amarais de Brrtisn Crown.) (ah listiigici I L;5Ü|;ia3 l -l.i i-.r 2 Eblágiü I Ib) ía) I------1------'-------1------1-------1-------1------f-------1------1-------1" É I I I I (Cj Reconstructo Original (d) FIGURA 9.1 b Resultados de oodrfHispáaMHCDdiFiwpéo em aois eslavos para entrada da nildo gauaseno cofrelprónada Coeficiente de correlato p = 0,95 (De S.R Lutlrell. !9fí9a, direitgs hirierais de Bntah Crown,)
onde peo coeficiente de AR e os vfrt) s3o varia veis aleatorias gaussianas indepcndentes e idénticamente distribuidas (iid) de média aere e variáncia unitaria. Assim, podemos mostrar que jt(«) é caracterizado como segue: ^("}]= 0 (9.33) (9.34) (9.35) Assim, p pode ser visto tambem como o cfiejiciente de cnrreiaqáo da serie temporal . Para iniciar a geranio da série temporal de acorde com a Eq. (932)t foi usada uma variável aleatória gaussiana de media zero e variáncia 1/(1 - p-) para ri/J), e para o coeficiente de oorrelacáo, foi usado o valor p = 0,85. Para a quantiza^áo vetorial fbi usado um codificador hierarquico com um espado de entrada de dimensionalidade quatroT como a árvore binária da Fig. 9.15b. Para a serie temporal AR , a simetría de transíanlo implica que sáo necessárias apenas í/uíu (abelas de consulta distintas. O tamanho de cada tabela depende exponencial mente do número de bits de entrada, e depende linear^ mente do número de bits de saida. Durante o treinamento, c ncccssário um grande número de hits para representar os números de modo a se obler uma computado carreta das atualizafdes descritas na Eq. (9.24); por isso, as tabclas de consulta nao sao usadas durante O treinamento- Uma vez que O treinamento estela completó,, entretanto, o número de bits pode ser reduzido ao seu nivel normal, e as posiqdes da tabela preenchidas correspondentemente. Para o codificador mostrado na Fig. 9.15b, as amostras de entrada foram aproximadas usando quairo bits por amostra. Para todos os estágios do codificador, foram usados .V (= 17) vetores de código, de modo que o número de bits de salda para cada tabela de consulta foi tambán aproximadamente quatro. Com isso, o tamanho do espapo de endere^amento das tabclas de consulta, tanto do primeirc como do segundo estágio* é 256 (= 2***K o que significa que a exigencia de memoria global para representar as tabelas é modesta, A Fig. 9.16 mostra os resultados de codi licaqáo^dccodificayo obtidos com jr(ff) como entra- da, A metade inferior da Fig. 9.16a mostra os vetares de código para cada um dos dois cstágios como uma curva inserida cm um espado de entrada bidimensional; a metade superior da Fig, 9,16a apresenta estimativas das matri/es de co-ocom£nci¿i correspondentes usando quadrados com forma- to 16 X 16. A Figura 9,16b apresenta, como fragmentos da serie temporal, o seguí n te: • O vetor de código calculado pelo primeiro estágio do codificador • O vetor de reconstruyo calculado pelo segundo estágio que minimiza a distorfáo de qua- drados mínimos, maniendo todas as entras variéveis fixas A Figura 9J6c apresenta 512 amostras de ambas as series temperáis uriginais (curva superior) c a sua reconstruyo (curva inferior) na saída do último estágio do codificador; a escala horizontal na Fig. 9J6c é a metade daqueta da Fig, 9,16b. Finalmente, a Fig. 9.16d apresenta uma matriz de coocorréncia criada a partir de um par de amostras: urna amostra da série temporal original c a sua
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
terísticas remecer uma representado Reí da distribu ic3o de entrada. Lin et al. íI 997) segueni um caminho similar introdu/indo duas modificares no algoritmo SOM: • A negra de atualiza^o é modificada para extrair a dependencia direta em telar o ao vdor de entrada i c ao vetor de peso do neurona J cm questao- * A partujño de Voronoi c substituida por uma parido com variafáo homogénea pmjetada especialmente para d i Htribui^oes de entrada separúvtis. Esta segunda moditicafao permilc que o algoritmo SOM realizo uma separado sega de fonte. {Separarán cega de fonte c discutida brevemente no Capitulo I e-¿ discutida em jnaior dclalhe no Capítulo 10.) As modi Eeaqóes, mencLonadas se baseisin no algoritmo SOM padrin de uma forma ou de outra. Em Linskcr (1989b), c seguida uma abordagem total mente diferente. Específica- mente, é derivada uma regra de aprendizagem global para a formado do mapa topográfico maximizando-se a infonnacáo mutua entre o sinal de saida c a parle do sinal da entrada corrompida por raido aditivo, (A nof&o de infannaqSo mutua, bascada na íeorin da infor- macSo de Shannon, é discutida no Capitulo 10.) O modelo de Linsker produz uma dislri- bui^áo de neunónios que coincide exatamenie com a distribuirán de entrada. O u$n de uma. abordagem bascada na teoría da mforma^ao para a formateo do mapa topográfico cm uma maneira auto-organizada é também seguido em Van Hulle (1996, 1997), 11, A relaqSo entre a algoritmo SOM e as curras principáis é discutida em Ritier et al. (1992) c Chcrksssky c Mulicrf 1995). O algoritmo para encontrar uma curra principal consiste de dois petaos (Hastie e Stueízl, I9R9): I. Pmjefao. Para cada ponto de dado, encontré a sua proje^5o mais próxima ou o ponto mais próximo sobre a curra. 2, I4ifc>r esperado condicional. Aplique uma suavizado dos pontos de espalhamento aos valares projetados ao longo da extensáo da curra. O proccdimcnto rccomcndávcl é in íci±r a su±vizac3o com urna grande extensáo e entSo decrescé-la gradualmente. Estes dois passos sáo similares á quanfiza^ao vetorial e ao rceozimento da vizinhan^a realizadas no algoritmo SOM. 12, A idéia da quantiza^áo vetorial por aprendizagem foi proposta por Kohonen em 1986, tnés versees dcstc algoritmo s^o descritas em Kohonen (I99üh; 1997a). A verslo do algoritmo discutido na Seqáo 9.7 é a primeira verseo de quantizafáo vetorial por aprendizagem, referida como LVQI por Kohonen. O algoritmo de quantiza^So vclorial por aprendizagem c um algoritmo de aproxima- rán estocáslica. Saras e LaVigna (1990) discutem as propriedades de convergerá ia do algorilmo usando a abordagem da equa^áo diferencial ordinaria (EDO) que é descrita no Capitulo 8. PROBLEMAS Algoritmo SOM 9,1 A fun^&O c,rlr I represenUí uma fun^aa nao-linear da rapmSta que é usada no algoritmo SOM como descrita na Eq. (9.9). Discuta a implicacao do que poderia acontecer 9C O termo wmslatitc na séric de Taylor de g(v.) for diferente de zcro- 9.2 Assuma que ic(u) é uma órnelo suave do ruido u no modele da Fig. 9.6. Usando uma expansáo de Taylor da medida de dislon^in da Eq. (9.19), determine o termo de curvatura que Surge do modela de raido 9J Algymas veza diz-sc que o algoritmo SOM p/vscnw as rclacóes topológicas que editan no espado de entrada. A rigor, esta propriedade pode ser garantida apenas para um espaqo de entrada de igual ou menor dimensionalidade que aquele da grade neural. Di sema 41 validade desta afintia^áo.
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
CAPÍTULO 10 Modelos Teóricos da Informado 10.1 INTRODUCTO Em um artigo dásstco publicado em 194fi, Claudc Shannon cstabclcccu 05 fundamentos da teoría da informando. O trabalho original de Shannon sobre a teoría da infbnnacao1, c scu refinamente? por mitres autores, foi urna resposta di reta ás necesidades de engenheiros eletricisus para projetar sistemas de comunicado que sejam tanto eficientes como confiáveis. Apesar de suas origens prátí- cas, a teoría da informado como nós a conhecemos hoje c urna teoría matemática profunda preocu- pada com a csscncia do processo de comunicarán. A teoría fomece uma estrutura para o estudo das questóes fundamentáis como a eficiencia da represenla^áo da informado c as lim¡tambes envolvi- das na transmissao confiável da informado através de um cana] de comunicado, Além disso, a teoría engloba uma pnofusáo de teoremas poderosos para calcular /imites ideáis de representa^áo ótima e de transmissao de sinais portadores de informa^ita. Estes limites sáo importantes porque fomecem parámetros de referencia para o projeto aperfeifoado de sistemas de processamento de informado. O principal objetivo dcstc capitulo é discutir modetos teóricas da informando que levem á aulo-orgatiizaváo de uma forma fundamentada cm principios. Neste contexto, um modelo que me- rece menino especial ó o principio da máxima informando mútuá1 formulado por Linsker (1988), Este principio afirma que as conexdes sinópticas de uma rede neural de múltiplas camadas se desen- volvcm de forma a marúnizara quantídade de informando que é preservada quando ocurre trans- formando de sina'ut em cada e&tágio de processamento da rede, su/eila o certas resfrif oes. A idéia de que a teoría da informado pode ofcreccr uma explicado para o processamento perceptivo ruto é nova? Podemos mencionar, por exemplo, um amigo artigo de Altneave (1954), no qual é proposta a seguirte fundió da teórica da informado para o sistema perceptivo: Urna fundió principal da maquinaria perceptiva é retirar alguma redundancia da estimulado. para dcscrever ou codificara ínforniacáGem urna forma mais económica queaquela com a qual ela atinge os receptores.
A princ i pal idéia por tras do artigo de Attneave é o reconhccimcnto deque a codificado de dados de uma cena com o proposito de redupáo de redundancia está rclac ¡orada ú identificado de caracterís- ticas especificas na cena. Esta importante constatado está relacionada a uma visáo do cerebro descrita em Craik (1943), no qual é construido um modelo do mundo externo que incorpora as regularidades e restricóes do mundo. Organizado do Capitulo O corteado principal do capítulo está organizado cm duas panes. A primeira parte, consistíndo das Sc^6e* 10.2 a 10-5, fomece uma revisao dos fundamentos da teoría da informapao, Na Se^ao 10.2, discutimos o concento de entropía como uma medida quantitaliva de informado, que Leva natural- mente ao principio da máxima entropía discutido na Se?5o 10.3. A seguir, na Sl\3o 10.4, discuti- mos o conceilo de infonna^to mutua e sum propriedades, seguido por urna discussáo da divergen- cia de Kullback-Lcibter na Scpao 10.5. A segunda parte do capitulo, consistindo das SefAes 10.611Q. 14, trata de modelos teóricos da informarán- para sistemas auto-organizáveis. A Scqáo 10.6 ressalta a ínformacáo mutua como uma fun^áo objetivo a ser oümizada. O principio da máxima informado mutua é discutido na Sajáo 10.7, que é seguida por uma discussao da retarán entre este principio e o da redu^áo de redundancia na Sccáo LO.S. As Sebees 10.9 c 10.10 tratara de duas variante!» du principio da máxima informaoac mutua que sáo adequadas para diferentes aplicaqócs cm processamento de imagen*. A* Se^fies i 0.11 a i 0.14 apresentam tris métodos diferentes para resolver o problema da separa^ao ccga de falles. O capítulo concluí com algumas considcraqocs fina?, na Scqáo 10.15. 10.2 ENTROPIA Segundo a tcrmnologia normalmente utilizada na loor i a das probabli dados, usamos uma letra maiúsculla para representar uma wiávelatetuóriu, e a letra minúscula correspondente para repre- sentar o valor da variável aleatoria. Considere entáo uma variável aleatoria Af, cm que cada realizarán (apresentafáo) sua pode ser vista corno- uma nienisugern, A rigor, se a variável aleatoria X for continua cm seu intervalo de amplitudc, entáo ela carrcga uma quantidade infinita de iuformafáo. Entretanto, do embasamento físico e biológico reconhecemos que náo íáz sentido pensarmos cm termos de medida* de amplitu- dc com prccisáo infinita, o que sugere que o valor de X pode ser uní formemente quantizadn cm um número ñniíti de ni veis discretos. Conscqiicntcmcntc, podemos ver Jf como urna variável aleatoria dhcivtíi, modelada como segue: A - (jJA--0,± I.+ X} (10,1} onde é um número discreto c (2K +• I) é o número total de níveis discretos. Assumc-sc que a scparaqáo ói entre os níveis discretos seja suficientemente pequeña para o modelo da Eq. (10.1) fomecer urna representado adequada para a variÉvel de interesse. Podemos, c claro, passar para o limite continuo fazendo &c se aproximar de zero e Ar tender ao infinito, e neste caso temos uma variável alealória continua c (como veremos mais adían te ncsia sc^áo) os somatónos se tomam integráis.
Para completar o modelo» considere que o evento A = ocorm com probabilidade Pi=^r=^ com a cxigcncLíi que (10 2) * OSp < 1 e Z A = 1 (30.3) Suponha que o evento X=a. ocoira com probabiliiladept = l , o que por sua vez requer que= 0 para todo 11- k. Em tal situado nio há “surpresa" e, portento, nenhuma “infonuaijáo11 c transmitida pela ocorréncia do evento X - xk, pois sabemos como a mensagem deve ser. Se, por outro lado, os vários ni veis discretos oconerem com diferentes probabilidades e, em particular» a probabilidades for baixa, entao há mais "impresa" c portento "infarma^áo" quando X assumir o valor .rx em vez de um outro valor .v. com maior probabilidade p . i k. Assim, as palavras 'incerteza", “impresa" e "informando'1 estío todas relacionadas. Antes da ocurrencia do evento X = xe há uma quantidade de incerteza- Quando o evento X = ocorre, existe uma quantidade de surpnesa. Após a ocoméncia de = x, há um aumento na quantidade de información Estas tres quamidadea sao obviamente a mesma. Além disso, a quantidade de informafáo está relacionada com o inverso da probabilidade de ocorrencia. Definimos a quantidade de informacáo gacha após observar o evento X=j. . com probabilida- de pt come a fundió logarítmica I(xt) = log = -]cSA (104) P*r. onde a base do logaritmo é arbitrária. Quando o logaritmo natural é usado, as unidades de informa- ffio sáo nals, e quando o logaritmo de base 2 é usado as unidades sao bits. Em qualquer caso, a definido de informado dada na Eq. (10.4) ex ¡be as seguintes propriedades: 1» f(x1)= 0 para/j^ = I (10.5) Obviamente, se esllvermos absolutamente cerros do resultado de um evento, nenhuma inferma- cao c gacha pela sua ocórréncia, X /(xj > 0 para 0 <pt < 1 (10.fi) Isto é, a ocurrencia de um evento X fomece alguma informa^áo ou nenhuma informadlo, mas nunca resulta cm uma perda de informacao. 5. i(xi)>l{x)^p,<pl (10.7) Jslo é, quanlo menos provável for um evento, mais i:iformado é ganha através da sua ocor- réncia. A quantidade de informacao c uma variávcl aleatoria discreta com probabilidade p.. O valor médio de /(*,) sobre o intervalo completo de 2K + I valores discretos é dado por H(X) = £[/(*,)] = X * -- (10.8)
A quaolidadir ff(X) ó chamada a entropía de uma variável aleatoria Xque pode assumir um conjunto finito de valores discretos; c chamada assim cm rcconhccímentó a analogía entre a definirán dada na Eq, (10.8) e aquela da entropía na termodinámica estatistiea4. A entropía WCY) c uma medida da quant idade média de informaban transmitida par mensagem. Note, entretanto, que o Zem HI.X} nao é um argumento de uma funqao, mas sim um rotulo para urna variável aleatoria. Note também que na definidlo da Eq, (10.8) fizemos OlogO scrO. A entropía //(Af) c limitada como segue: log(2K+ l) (10.9) onde (2/í 4-1) é o número total de níveis discretos. Além disso, podemos lázcr as seguimos afirma- fdes: L H(X\ = D se e somonte se a probabil idade p = l para algum í, c as probabi lidades restantes no conjunto sáo todas aro; este limite inferior da entropía corresponde a nenhuma freertteza. 2, A/(A") Jog,(2A¿ + l), se e somente se L'(2K + 1) para todo A (í.e., todos os níveis discretos sáo cqüipnovávcis); este limite superior da entropía corresponde á incerteza mírm. A pro va da propriedade 2 resulta do seguí nte lema (Gray, 1990);: Dadas duas distribu¡cíes de probabilidad? quaisquer {p l e ! para urna variável aleatoria discreta Y, cntáo >0 (10.10) que é satisfeita com a igualdad? se ? sementé s? para todo A quantidade usada neste lema é de tal importancia fundamental que fazemos uma pausa para d ispoda cm uma forma adequada para uso tic estudode sistemas cslocásticos. Considere que/\(x) e ^(.v) representen! as probabilidades que a variável aleatoria Áresteja no estado x sob duas condi- 9fcs de opera^áo diferentes. A enrroprá rtí/úrivu ou rfveig/ftcta (Ufanera) de KidfbacA-Leibter entre as duas¿¡es de mansa da pro/wbifidade pjx)e ?/J) é definida por (Kullback, 1968; GrayT 1990; Cover cThomas, 1991) = S/’rWoS r*r c*)1 (10-11) onde o somalório c sobre todos os estados possiveis do sistema (i.eM o alfabeto 7C da variável alea- toria discreta X). A fun^áo de massa da probabíIidade q/.r) desempenha o papel de uma medida de referencia. A Entropía Diferencial de Variávels Aleatorias Continuas A iliscussáo de concentos teóricos da informado aic agijracnvolvcu conjuntos do variávcii aleato- rias que sáo discretas tm scus valores de amplitude. Agora estendemos alguns desses conccitos para variáveis aleatorias continuas.
Mócelos Tbóuxs da InpoumacAo 529 Considere urna variável aleatoria continua X com a fwiqao de densidade de probabilidade fjx}. Por analogía com a entropía de uma variável aleatória discreta, introduzimos a seguíate defi- nfeáo: A(A>- /^xjlogf/jrjrfr (30.12) = -£| log Xrf1)^] Nos referimos a A(A) como a entropía diferencial de X para distingui-la da entropía ordinária ou entropía absoluta. Fazemos isso per reconhecerque, embota h{X} seja uma quantídade matemática útil de se ccnhecer, ela nao é de forma alguma uma medida da aieatoriedade de X Justificarnos o uso da Eq. (10J 2) como segué. Cometamos vendo a variável aleatoria conti- nua X como a forma limite de uma variável aleatoria discreta que assume o valor e = ASi, onde k = 0¡, ±1, ±2^+., e &x se aproxima de zero. Por definirán, a variável aleatoria continua X assume um valor no intervalo [x^ i - i&x] com probabilidadc^l.t.fe. Assim, pernri lindo que 5x se aproxime de zero, a entropía ordinária da variável aleatória continua Xpode ser escrita no limite como H[X) = - lim ui —I- U , A(x)<ir (10.13) 4(jr)log fx(x)dx - lim logñx - fr(Jf)- bm logáx Br-pfl onde na última Linha fizemos uso da Eq. (10.12) e do fato de que a área total sob a curva da fiin^áo de densidade de probabi i i dadt/Aíx) é unitária. No I imite quando &r se aproxima de mío, — logSx se aproxima do infinito. Isto significa que a entropía de urna variável aleatória continua é infinitamente grande. Intuitivamente, esperaríamos que isto fosse verdade porque uma variável aleatoria continua pode assumir um valor qualquer no intervalo (- »,=<*) e a incerteza associada com a variável tende ao infinito. Evitamos o problema associado com o termo lo@8x adotando como uma entropia diferencial, com o termo - log&c servindo como referencia. Além disso, como a informado proccs- sada pelo sistema estocástico como uma entidade de interesse é realmente a difieren?a entre dois termos de entropía que tem urna referencia comum, a informa?áo será a mesma que a diferen?a entre os termos de entropía diferencial correspondentes. Com issojustífícamos perfeitamente o uso do termo Af(A'), definido na Eq. (10.13), como a entropia diferencial da variável aleatória continua A' Quando temos um vetor aleatorio continuo X cansí si indo de n variáveis aleatorias Xp X¡v,., A definimos a entropía diferencial de X como a. integral fn vezes) múltiplo *(X)=- ¿(ijlog/jx^x <IQ.14) = -gpog/w]
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
e o vetor aleatorio nr-por-1 X é definido em termos de U por X-At- onde A é uma matriz nao-diagonal. Considere que/*. (Ji) represente a íunfáo de densiíLadc de pro- babilidade marginal de cada A que é derivada de/^x). EtiüSo, a divergencia de Kullback-Leibler entre/j.x) c /’(x) admite a seguidle decomposiQStf por Pifágonts', DMh (10.45) Rcferimcbnos a esta elássna relajo como uma decomposiíSu per Pitágoras porque ela tem uma inicrprctaQáo geométrica sobre a informado (Amaría 1985). Na nota 8 é apresentada urna prava desta decompusieSo. 10.6 INFORMAQÁO MÚTUA COMO UMA FUNQÁO OBJETIVO A SER OTIMIZADA Agora que desenvolvemos uma cainpreensao adequada sobre a teoría da informacao de Shannon, estamos prontos para discutir o seu papel no cstudo de sistemas auto-organizáveis. Para prosseguinnos com a discussáo, considere um sistema neural com múltiplas entradas o saldas. O ubjciivu principal aqu¡ é que o sifitenM $cja aulo-ti-Tganizável, pmjelado para uma [arela especifica (p.cx., modclagcm, extrafao de carácter isbeas estalis ticamente salientes ou separado de sinais). Este objetivo pude ser satisfeitu escolhendo-se a informacao mullía entre certas vana veis do sistema como ajiimpáo a ser elimizada. Esta escolha particular éjustificévcl pelas seguía- les coTisiidcracocv • A informado mútua tem algumas propiedades únicas como discutido na Sc^áo 10.4. * E la pode ser delermi nada sem a necessidade de um professor, de modo que sao natura I men- te dadas condifSes para aulo-organiza^áo. Com isso, o problema recaí em ajustar os parámetros livres (i-e,, pesos sinápticos) do sistema de modo a ohmixara informarán mútua. Dependendo da aplicado de interesse. podemos identificar quatro diferentes canarios como ilustrado na Fig. 10,2, que podem surgir na prática. Estes cenários s3o descritos como segué; * Mo cenarlo 1 representado na l;ig. 10.2a, o vetor de entrada X é cumposio pelos elementos Jfp .V,....A'm, c o vetor de salda V c ccmposto pelos elementos O objetivo é tiiíixfmizar ü infwntíwtto transmitida para a saitki V do nisientu aobrt; a en fruda X do sis te- ma. • Mo cenário 2 representado na Fig, 10.2b, um par de vetores de entrada X X c derivado de regides adjíceníes, mas nSo-superpostas da imagem. As entradas X^ c X,, produzcan saidas escalares K( e Yv respectivamente. O objetivo í maximirar a ¡nformueti^ fnnixrídJtdapara X snh/v l^c vice-versa.
Hidden page
Hidden page
Hidden page
Hidden page
--(1 + 2m;.) 2 M (10.53) Assim, usando as Eqs. (10.49) e (10.53) em (10.47) e fhtio simplificando os Ltnnos, oblemos (Linskcr, ima) ,ir:x,=HdM Com a restricto que a vanáncia do ruido c; seja mancida constante, a informado mutua 1{Y} X) é agora maximizada pela maximiza^3o da relajo oJ / Y W*r onde n: ú uma fundió de ir. O que podemos deducir dos Exemplos 10.4 e 10.5? Primeiro, vemos do material apresentado restes dois exemplos que o resultado de aplicamos o principio Infomax depende do problema. A equivaléncia entre mas ira izar a informado mutua /(f; X) e a variáncia de salda que se aplica ao modelo da Fig. 10.3 „ para urna variáncia de ruido predeterminada . nao se aplica ao modelo da Fig. 10.4. Apenas quando impomcs a restricto Y wf = 1 ao modelo da Fig. 10.4 que ambos os modelos se comportan de maneira similar. Em gcrall, a determinaban da informaban mutua Z(¥¡X) entre o vetar de entrada X e o vetor de saida ¥ é uma tarda difícil. Nos Exemplos 10.4 c 1Ü.\ temamos a análisc matemática tratável assumtndo que as distribuinfles de ruido em um sistema com uma ou mais fonics de ruido sao gaussíanas muitívariadas. Esta suposi^o precisa ser jusnlicada. Adolando-se um modelo de ruido gaussiano, estamos esencialmente invocando uma infor- nnacáo mutua ''substituía'1 calculada sob a premissa de que e vetor de saida ¥ de um neurónio tem uma distribuí^ gaussiana mu Lti variada com o mesn» vetor média e a mesma matriz de covariancia que a distribuido real. Em Linsker (1993), a divergencia de Kullback-Leibler é usada para fomecer uma justificativa fundamentada em principios para o uso de uma tal informa^ao mutua substituía, sob a condi^ao de que a rede tenha armazenado iriformacáo sobre o vetor média c a matriz de covariancia do vetor de saída Y, mas náo sobre eslavísticas de ordem mais alta. Finalmente,, a análisc apresentada nos Exemplos 10.4 c 10.5 foi realizada no contexto de um único neurónio. Tsio foi feito de propósito com uma idéia tspécilica em mente: para o principio Infama* ser matemáticamente tratável, a otlmiza^o deve ser realizada em um nivel neurona! local. Este tipo de otimiza^áo é consistente com a essencia da auto-oqganizarán. Exemplo 10.6 Nt)i Exemplos L0.4 e 10.5, consideramos neurómus ruidosos. Nesle exemplo. consideramos uma rede sem raído que transforma um vetor alealóric X de distribuido arbitraria em utti novo vetor alealório V de distribuí' fto diferente. Reconhecendo que /(X; V) - f(Y: X) e esiendendo a Eq. (I0.2B) á situado descrita aquí, pode- mos CXprcssar a informa^ín mutua entre 17 vetar de entrada Xrf» ictor de saidu V como st^ur:
Hidden page
do Infomax. É ínteressante notamos que o compromisso rcdundáncia/diversidade é em parte aná- logo (apesar de diferente) ao contpromisso viés/variáncia discutido no Capitulo 2. Modeiagem de um Sistema Perceptivo Desde os prímórdios da teoría da informado, tem sido sugerido que a redundancia de mensagens sensorial s (estímulos) c importante para o entendí mentó da percepqáo (Attneave, 1954; Barlow, 1959). De falo. a redundancia de mensagens sensorials fomece o conhecimento que permite ao cérebro construir seus “mapas cognitivos” ou “modelos de trabalho" do seu meio ambiente (Barlow, 1989). As regularidades ñas mensagens sensorlais devem ser codificadas de alguma forma pelo cerebro para que ele saíba o que acontece normalmente. Entretanto, a reJupw Ja reJimddrtda é a forma mais específica da Aipotósc de Büt-low. Esta hipótese diz que o objetivo do processamento primario é transformar a entrada sensorial altamente redundante em um cDí/igA/aroría/1 mais efici- ente. Em outras palavras, as saidas ncuronais se tomam esfatfsrteaffiente ifídependentes quando condicionadas na entrada. Inspirados pela hipótese de Barlow» Atick e Rediich (1990) postularam oprincipio da mínima redundancia con» base para um modelo teórico da infortnafáo do sistema perceptivo mostrado na Fig, 10,5. O modelo consiste de tres componentes: o cana/ Je tffl/naJa» o jijeara de codif¡ca$uo e o canal de saída. A salda do canal de entrada é descrita por Cajttl de entrada Cel/iiíI Je isldj (ftcrvi* ótico) AGURA 10.6 Modeto Ce um sistema p&rMptiutx O velor sirUl * e w vítores de ruírto e sáü valores dos vetares al&aiórios SP N, e N5, respectivamente onde S é um sinal ideal recebrdo pelo canal de entrada e assume-se que N. seja a fonte de lodo o ruido na entrada. O sinal X £ a seguir transformado (codificado) porum operador matricial linear A. Ele ó cntáo transmitido através do ñervo ótico. ou canal de saída, produzindo a saida Y, como mostrado por Y - AX + N2 onde N. representa o ruido intrínseco após a codificado. Na abordagem seguida por Atick c Rcdlich, observa-se que sinais de luz que incidem na retina eontém informado sensorial útil cm uma forma altamente redundante. Além disso» levantarse a hipótese de que o propósito do processamento do sinal da retina é reduzir ou eliminar os bits redundantes de dados devido lanío a correla^ocs como a ruido» antes de enviar o sinal através do ñervo óptico. Para quantificar esta noQáo, é definida uma medida de redundancia por
i i p cñi (10.56) onde /(Y; S) o a i ntorma^áo mútua entre Y e S, e C(¥) é a capac i dade do cana] do itervc ói ico (canal de saida). A Equatjau (10.56) é ¡uslí finada com base no argumento de que a informado na qual o cérebroestá interessade é o sinal ideal S. enquanto que o canal físico atravesdo qual esta infomna- $áo precisa passarc na realidadc o ñervo óptico. Assumc-sc que nao baja redujo de dimensionalidadr no rnapeamenlo de entrada-saida rea lirado pelo sistema perceptivo, o que significa que C( Y) > /(Y; S). O objetivo é encontrar um mapeamento de cntrada-saida (i.c.„ a matriz A) que minimiza a medi- da de redundancia J?, su;e i t :í á restricáo de nao haver penda de informacao, como mostrado por /(Y;X)-/(X; X)-t onde í é um parametro positivo pequeño. A capac idade do canal C(Y) c definida como a taxa máxima de fluxo de informacao possívcl afra ves do ñervo óptico, cstcndcndo-sc sobre todas as Llistrihuicócs de probabilidade das entradas aplicadas a ele c mantendo fixa a potcncki media de entrada. Quando o vetor sinal Seo veior de saida Y tem a mesma dimensional i dade e há ruido no sistema, o principio da mínima redundancia c o principio ínfbmax sao matemáticamente equivalen- tes, desde que uma restribo similar seja imposta á capacidade computacional dos neurónios de saída em ambos os casos. Para sermos específicos, suponha que a capacidade do canal seja medida cm ¡termos do intervalo dinámico da saída de cada neurónio do modelo da Fig. 10-5- Entao, de acordo com o principio da mínima redundancia, a quantidade a ser minimizada é /(Y;S) C(V) para uma dada perda de informacáo pcrmissivcl, e perianto para um dado /(Y; $), Assim u quantida- de a ser minimizada ó csscjnciiilmcnto F^Y; $) = £(¥) -UV;S) (10.57) Por outro lado, de acorde com o principio Enfbmax a quantidade a ser maximizada no modelo da Fig. 10.5 é F/Y; S) = /(Y; S) + kC(Y) (10.5S) Embora as funcocs F(Y; S) e Fa(Y; Si sejam diferentes, suas otimizacóes produzcm resultados idénticos: ambas s3o fomulaqües do método dos multiplicadores de í.agrange, com os papéis de /(Y»S)cC{¥)simplcsmcnte trocados O ponto importante a notar desta dlscussáo é que, apesar da diferenca ñas forrmilafóes, estes dois principios teóricos da informarán levam a resultados similares. Em resumo» a maximiza^ao da iníormacáo mútua entre a saida c a entrada de um sistema, iicuril Leva de falo á redu^ao da redun- dancia. ’
10.9 CARACTERÍSTICAS ES PAC ÍALM E NTE COER ENTES O principia Infotnax, cama postulada na Se^o 10.6, aplicMO Mmafio na qual a informadla mutua /(Y; X) entre o vetor de saida ¥ de um sistema neural e o vetor de entrada X é a fuii^áo objetive a ser muícnizada, como ilustrado na Fig. 10.2a. Com modiilca'^ócs apropriadas na termi- nología, podemos estender este principio para lidar com o processamento náo-supervisionado da imagem de uma cena natural (Bcckcr c Hinton, 1992). Um elemento fjñxeí) náo-proccssado de uma iinagem assim eontém urna riqueza de intbrma^fies sobre a cena de interesa^ embona cm forma complexa. Em particular, a hiten sidade de cada elemento e atetada por parámetros intrínsecos tais como proñindidadc, rcflexibilidade c orientarán da superficie^ bem como pele ruido de fundo e FIGURA 1Q.6 Processamento de cuas regióes vizinhas de uma imagem da aidrdo úom a primBÍra variante cj Infama» dumina^áo. O objetivó c projetar um sistema aulo-organizávcl que scja capaz de aprender a codifi- car esta informaváo complexa em uma forma mais simples. Para sermos mais específicos, o objetivo é extrair características de ordem mais alta que exibam caeréncííi simples eiravés dn espada de tal forma que a representarán da informaeáo cm uma rugían espacial mente localizada da imagem tome mais fácil producirá representado da informado em recibes vizinhu; uma regido se refere a uma colccao de elementos na imagem. A siluacáo descrita aquí c relativa ao cenaría ilustrado na Fig. 10.2b Podemos assim formular a prtmeira variante do principio Infernas19 como segue (Recker, 1996: Recker e Hinton, 1992); A transformare de mu par de vetores Xd e X5 (representando regifcs adjacentes, náo supetpostas de unía imuyem por um sistema neural) dirvü (ef e$C0l.n-.l¿L de muda que 3 saída escalar Y do sistema devido i entrada Xf maxmtee a informa?So sobre s segunda suida escalar devido a Xp. A futido objetivo a ser maxiTni/adjt é a informa?áo mutua /(í^ entre as saidas F. c Fy Rcfcrimo-nos a este principio coma uma variante do principio Infomax no sentido de que nao é equivalente a Infomax ou derivado dele» mas curtamente funciona de urna maneira similar Para «emú» específicos» considere a Fig. 10-6 que mostra duas redes (módulos) neurais a c¿ recebcndc as entradas c Xhi de regí oes adj acontes nao-superpostas de urna imagem. Os escalares f c representara as saidas destes dais módulos causadas pelos respectivos vetores de entrada X e X1. Considere que 5 represente tima componente de sinal comura a ambos ¥u c Yhi que c represen- tativa da cocrencia espacial atrases das duas rc^LÓes pertinentes da imagem original. Óopyrighted inaterí
Podemos expressar 1 e 1‘. como veraces ruidosas do sinal comum S. como mostrado por (10 59) i;=s+n (10.60) N uN. sao componentes de ruido aditivo» assumidas como sendo varia ves aleatorias de distribuí’ váo gaussiana de média zero. estal isticamente independen tes, Assume-se que a componente de sinal S c também gaussíana com uma distribuido propria. De acordo com as Eqs. (10.59) e (10.60), os dois módulos a e b da Fig. 10.6 lomam as suposipocs consistentes entre si. Utilizando a última Linha da Eq. (10.30). a informaQao mutua entre K c c definida por +*(>;)-Mí;.*? (10.61) De acordo com a fórmula da F.q. (10.22) para a entropía diferencial de uma varié reí aleatoria gaussiana. a entropía di ferene i al A( >’ ) de Ya c dada per MK) = -[i + iog(¿™í)| 2 (10.62) orden ’ é a van Oficia de K, Smiilarmenlc, a entropía diferencial de V é dada por *01)-1(1 + 108(211^)] (10.63) onde o é a varilncia de F Como para o caso da entropía diferencial conjunta A() „? ), utilizamos a fórmula da Eq. (10.24) para escrever *( = 1 + log( 2 TI) + | log|dct( E)| A matriz E, 2-por-2, é a matriz de covanáncid de >'u c Yb; é definida por I=r < _p,.^.rcíA ol (10.64) (10.65) onde é o cncficicHte de correla^áo de e que c (10 66) □ d
Com isso, o determinante de S é detffi) = ^(l-|¿) (10.67) e assim podemos rescrever a Eq. (10.64) como J*) -l + M2jt) +1 log|d;o; (I - p¿)] (10.68) Substítuindo as Eqs. (10.62), (10,63) e(10.68) em (10.61) e entSo simplificando os termos, abre- mos í(Wt) = -|tag(l-p’) (10.69) Da Eq. (10.69) deduzimos ¡mediatamente que maximizar a i n formado mutua /(K ;/^) é equivalente a maximizar o coeficiente de correlato pJT o que é razoável intuitivamente. Note que, por defini- íñojpjs I. Maximizar ti informado mutua /(}' J . 'i pode ser visto como a generalizado nao-linear da correla^áo canónica da estatística (Beckere Hintun, 1992). Dados dois vetores (estímulos) de entra- da X^ e Xt (nio necessariamente da mesma dimensional¡dade) e dois vetores de peso corresponden- tes* wa c wp o objetivo da análise da corretajea canónica c encontrar as combina^oes linea- res 1 = e = w^XA que tem máxima correla^ita entre elas (Anderson, 1984}. Maximizar /(Yj y. l £ uma gencraliza^ao náo-linear da correlato canónica cm v.rtude da náo-lineandade in- corporada no projeto dos módulos neurais da Fig. 10.6. Em Becker e Hinton (1992), ó demonstrado que ao se maximizar a infcrma^áo mutua /( F ; 7,1 c pcssívcl extrair a disparí dade relativa i profundidade de c¡»[crcogranias de pontos aleatorios. Este é um problema difícil de exirado de características que nao pode ser resolviólo por uma rede neural linear ou de uma camada. 10.10 CARACTERÍSTICAS ES PACI ALIVIENTE INCOERENTES O pruccssamento nio-supen isionado de urna imagem considerado na sepSo anterior trata da exirado de características espacial mente coerenies de uma imagem. Consideramos agora a situado oposta á descrita ali. Para sernos espec ¡fíeos, considera a Fig. 10.2c, onde o objetivo é acentuaras dlferen^ jas espaciáis entre um par de rtgi-óes correspondentes derivadas de duas imagens separadas. En- quanto que a informado mutua entre as saidas dos módulos e maximizada na Fig. 10.2b, fazemos cxatíimciitc o aposto na Fig. 10.2c. Podernos assim formular a segunda variante do principio Infomax como segue (Ukrainec e Haykin* 1992, IW6): A (ransfbnna^o de um par de vetores de entrada Xd e XM representando dados derivados de regides correspondentes em um parda imagens separadas, por um sistema neural deve ser escolhida de modo qi*c a suida escalar Y do sistema drvidp á entrad* x minimizc a informaijáo sobre a segunda saida escalar devído a Xrt, A fiincSo objetivo a ser minimizada é a intbrmaQdo mutua /(entre as aaídu V c K. B r
Aquí, novamcnlc nos referimos a este principio como uma variante do principia Inferna* sendo que ele nao r equivalente ao Infomax ou derivado dele, mas cortamente funciona inspirado nele." A segunda variante do principio Infomax encentra aplicado cm polarimeíría de radar* por exemplo. onde um sistema de vigilancia por radar preduz um par (ou mais) de imagens de um ambiente de interesse transmiLindo cm uma pulariza^áü C reetbendo o espalfaamenlo retomado do ambiente na mesma polarizado ou em uma polarizado diferente. A polar!za^áo pode ser vertical ou horizontal. Podemos, por exemplo^terum par de imagens de radar, uma imagem representando a polarizará o paralelafp. ex., horizonial-horizonLal), c a outra imagem representando a polarizado cruzada (horizontal na transmissao c vertical na recepto). Urna aplicado assim é descrita em Ukraincc e I laylcin (1992.1996). que se refere ao realce de um alvo por poiarizaedo cm um sistema de radar de pnlariza^áo dual. A amostra da cena do radar usada no estudo ó descrita a seguir. Um radar incocrcntc transmite de uma maneira polarizada horizontalmenle e recebe retornos de radar em ambos os canaise horizontal e vertical. O alvo de interesse é um re/fetar de desvio depaisriza- tw cooperativa prejetado para girar a polarizapáo incidente em 90 graus. Na operado normal de um sistema de radar, a detectan de um alvo como este se toma difícil devido ás iinpcrfei^oes no sistema bem como por rcücxocs de alvos polarimétricos indesejáveis no solo (i.e, “desoridem" de radar). Pcreebemus que é necessário um mapeamenton^o-linearpara levar em coma a distribuidlo nfio-gaussiana comum dos retornos de radar. O problema de realce do alvo ó formulado como um problema van ac tonal cnvolvendo a minimizafáo de um funcional de custo quadratico com rcstri- cccs. O resultado liquido é uma imagem com pelancruzada processada que exibe uma me- Ihora significativa na vísíbilidade do alvo, muito mais pronunciada que aquela alcanzavel airavés do uso de uma técnica linear como a análise de componentes principáis. O modelo usado por Ukrainec c Haykin assumc cstatísticas gaussianas. para os dados transformados, já que uma estimativa inde* pendente de modele da fu «cao de densidade de probabilidade é uma larefo computacionalmente desafiadora. A inforttup&o mútua entre duas variáveis gausstanas Fue Y’, ¿definida pela Eq. (10.61). Para aprenderos pesos sinápticos dos dois módulos, c seguidauma ahordagem variacional. O objetivo c suprimir a dcsonlcm de radar que c comum as imagens polarizadas horizontal c vertical mente. Para satiihfazer esta exigencia, a informare mútua j ó minimizada^ sujeiL;i a uma rcstri^áo impasta aos pesos sinápticos como mostrado por /’ (ir[WTWJ - 1): (10.70) onde W é a matriz de peso global da rede, e tr[- ] é o tra^o da matriz dentro dos cólcheles. Um ponto estacionario c alcan^düu quando temos vw/(y;jy+xvt/ = ü (io7i) onde X c o multiplicador de Lagrangc. Fui usada uma retina de otimizafáo quasoNcwton para encontrar o mínimo; os métodos quasc-Ncnlon sao discutidas na Capítulo 4. A F igura 10.7 inostra a arquitetura da rede neural usada em Ukrainec c Haykin (1992, 1996). Uma rede de funqáo de base radial (RbF) foi escoltiida para cada um dos dois módulos porque tem a vaniagem de fomcccr um conjunto de funcoes de base radial (t e., uma camada oculta náo- adaplativa). Os dados de emrada s3o expandidos sobre as fuñados de base c cntáo combinados usando camadas de pesos íjrtt'eric.v; as luí has tracejadas mostradas na Eig-10 7 representara as cone* xoes de acopli&mentO cruzado entre os dois módulos. Os centres das fun0es gaussitinas foram
x Efltndl i ^;'.iií l\5GT1 poLaria^ crinada (bQffiiMiiHlAenkab Etandl dfl radnr C<'TT1 polaH¡¿jfio paralela (trerLZünral-liüf izontil i IkSW hnyarm Ritiftei jjaiiisimíK de buc radial Minimoar a íniarniafiü ITlÚlUiJ FIGURA 1Ql7 Disgrama sm b+ncúí d& um pfüCttMdOr riBuraL sujo objetiva ¿r suprimir dHordam de luneta usando um par de entradas rta radar na&^M- rén(&& polarimétriúáS; a suprtsiác du dascnfem 4 álcári^adá miftimizáftdó a informegáQ mutua entre 53 5? líes das <Jq¡5 mMutos cacolhidos em intervalos uní firmemente espadados para cobró todo o dominio de entrada, e suas Larguras foram escullí idas usando uma heurística. A Fi gura L0.8a mostra as imagens brutas de radar horizontal mente polarizada e verticalmente polarizada (ambas no receptor) de uma con figurado semeltunte a um parque ñas margena do Lago Ontario. A coordenada do alcance está ao longo do cíkd horizontal década .magem, aumentando da esquerda para a direita; a coordenada do azimute está sobre o eixo vertical, aumentando para balso na imagem. A Figura 10.8b mostra a imagem combinada obtida minimizando a informadlo mutua entre as irnagens de radar polarizadas horizon- talmcntc c vcrticalmcntch como descrito acima. A mancha brilhantc claramente visível nesta ima- gen corresponde ao retomo de radar de um rcflctor de desvío de polarizaba cooperativo colocado ao longo da maigcm do lago. O desempenho de suprcssáo de desordena do modelo teórico da íllfor- mab^ descrito aquí supera aqtiele das pmje^ñes normal mente empregadu utilizando anal ¡¡se de componentes principáis (Ukrainec e Hayll^iin. t992, 1996).12 10.11 ANÁLISE DE COMPONENTES INDEPENDENTES Desviunofl agora, nessa atenQSo para o último cenárío dMcrito na Fí¿s. IO.2d. Para adicionar mais especificidade ao problema de processamento de sinal Lá formulada, considere o diagrama em blo- cos da Fig. 10.9. A operado inicia cam um vetor fonte aleatório U(a) definido per
FIGURA 10.8a imagens brutas de radar de valedu- ra B (azimuto (rapado em tunpáo do ateance) para polanzapóes horizontal, horizontal (acima) e hori- zontal-vertical (abaixo) Rellet» Refletor FIGURA 10.8b Imagem composta calcula- da pela minimizado da informado múlua entre as duas imagens de radar polarizadas da Fig. 10.8a
Ambiente dcwunhetlda FIGURA 10.9 Diagrama em Ñocos de processadof tara o problaíTia de saparaqáD cet¡a de fúnleí. 04 vetaras ur x e y sSq valores dos vetares alea- tót ios- respectivos U, X e V V [V,. Vt....u„]r onde as m componentes sáo suplidas por um coi ¡unto de fantes itidepefídiínie-i. Aquí sao considera- das scqüéncias temperáis; de agora em diante, o argumento fl representa o tempo di soneto. O vetor U í aplicado a ucn sistema linear cuja caractcriza^áo de cntrada-saída c definida por uma matriz m- por-w nao-si ngutar A, chamada de matriz demistum. O resultado é um vetor de observando rtr-por- 1 X(r,l relacionado a U(n) como segue (veja a Fig. 10. IDa) X=AU (10.72} la} FtG u RA 10.10 Descripto delalhatfa da (a] matriz de mistura e (b) da matriz de separado onde X-[Z(,X..V O vetor fonte V e a matriz de mistura A sáo ambos dcsconhcvidcs: a única i:ifonna^o dispnnivH para nós é o vetnr de observado X. Dado X, o problema e encontrar uma morriz de separando W tal que o vetor iberio original U possa ser recuperado a partir do vetor de saida ¥ definido por (veja a Fig 10.1 Db> V-WX (10.7?)
onde Y = [yl>r1...rj Normalmente, assume-sc que es sinais de fonte £7p í . sáo smai$ de media zero, que por sua vez significa que as observa veis A\ Xm sao também sinais de media zcro. O mesmo é verda- deiro para as saídas do separador Y . )' . Podemos assim formular o pmblema de separando cega deJimies como segue: Dudas jV natizcn;ües independentes do vetar de observado X. encentre m estimativa da inversa da matriz de mistura A. A separaban de fontes explora fundamentalmente a divenidade capadut pela qual sensores diferen- tes que fbmecem as real i zacees do vetor X carregam diferentes misturas de fontes, A divergí dade espectral, se existír, pode também ser explorada^ mas a abordagem fundamental para a separa<?ao de fontes c esscncial mente espacial, procurando por estrutura através dos sensores e nao através do tempo (Caldoso, 1998a). A solu^áo para o problema de separado cega de fontes érealizável, exceto para um esealamento arbitrario de cada componente do sitial e permutado de índices, Em outras palavras, é possível encontrar uma matriz de separa^áo W cujas 1 inhas individuáis sao escalamentos e permuia^oes da matriz A. Isto c, a soluto pode ser exprtssa na forma Y - WX - WAL -> DPL onde D ó urna matriz diugonal nifo-singular ePé urna matriz de permutacAo. O problema descrito aquí é normalmente referido como o problema de separado cega das fontes (de sinal\13 onde o termo “ccga ' é usado para significar o Tato de que a única infotrna^áo usada para recuperar as fontes de sinal origináis está con ti da cm uma realízalo do vetor de obser va^áo X1 representada por i. O principio fundamental envolvido na sua soluto é chamado de análise de componentes independeníes (ACI) (Comon, 1994), que pode ser visto como urna exten- sa© da análise de componentes principáis (ACP). Enquanlo a ACP pode apenas impor independen^ cia até a segunda ordem resb inundo os vetores dedire^áo a serem ortogonais, a ACI impoc inde- pendencia extatistíca sobre as componentes do vetar de saida Y e nao tem restriba de ortogonalidade. Note também que, na prútica, uma implcmenta<¿ao algorítmica de análise de componentes indepen- dentes pode apenas buscar as componentes “tifo eslatisticamente independentes quanlo possívcl". A ncccssidadt para separafáo ccga de tontos surge cm diversas aplicares, indurado as se- guí ntes: • Separaban de voz. Ncsta aplicado, o vetor x consiste de varios sinais de voz que foram misturados lincarmentc, e o objetivo é separá-los (Bell e Sejnowski, 1995). Uma forma di tic ¡I desta siiua^Ao, por exemplo, aparece cm um ambiente de tclccontorcncia. • Processamento de amnfo de antenas. Ntsta segunda aplicado, o vetor x representa a saída de um arranjo de antenas de radar produzida por varios seríais incidentes de banda estrena originarios de fontes de d:rendes desconhecKlas (Cardos© c Souloumia, 1993, Swindlchursl et al., 1997). Aquí novamente o objetivo é separar os sinais de forte. (Um sinal
de banda cstreita significa um sind passa-banda cuja largura de banda é pequeña compara- da com a frcqücncia da portadora.) • Regis tms Immálicos midiisenswuis. Nesia terce ra api i ca^áo, o velor x cons। ste de regí sitos constituidos por uma multidáo de sensores usados para monitorar sinais biológicos de ime- resse, O objetivo pode ser, por exemplo. separar o batimento cardíaco tic um feto do batimento da máe(Cardosc\ 1998b). • Anáiij¡ede dadas da mercada finaneeira. Nesta aplicaban, o vetor x consiste de um conjun- to de dados diferentes do mercado de a0es, c o objetivo c eximir o conjunto subjaccntc de componentes dominantes independentes (Back e Wcigcnd, 1998). Nestas aplica^óes^ o problema da separado cega de fontes pode aínda ser composto pela possível presenta de atrasos de propagac^o desconhccidos, pela filtragem extensiva imposta ás fontes por seus ambientes e pela contaminado ineviláveI do velor de observado a por ruido. Estas deteriora- res signlficann que (infelizmente) a forma idealizada de mistura instantánea de sinais descrita na Eq. (10.72)c raramente encontrada cm situa^óos do mundo real. No que segue, entretanto, ignora- remos estas deteriorares para ccmpreendermos os aspectos fundamentáis do problema de separa- do cega de fontes. Critério para Independan da Esta List Ica Sendo a independencia cslatistica a propriedade desojada das componentes do velor de saida ¥ para a separado cega de fontes, qual é a medida prática que podemos usar para da"? Uma passiMidade óbvia é escolher a informado mutua AHf) entre as varia veis aleatorias e f que constituem quaisquer dois componentes do vetor de saida Y. Quando, no caso ideal, /(^r;^) c zcro, as ccmpo' nenies K e Y sao cstaLislieamcntc independentes. Islo sugere minimizara itifortnafáo mutua entre iodos os pares de varia veis aleatorias que constiiuem o velor de saida Y. Este objetivo é equivalente a minimizar a divergencia de Kullback4_eibler entre as duas seguintes dislribuicóes: (I) a fun^ao de densldade de probahi kdade^.(y,W) paramclrizada por W c (2) a distribuicáo fatorial corresponden- te definida por A (yT w)=I! 0,TW) 11 o_74) d"k onde , W) é u. fun^o de densidade de probahilidade marginal de K. Na verdade, a Eq. (10.74) pode ser vista como uma restricto imposta ao algoritmo de aprendizagem, for^ando-o a contrastar 7|j(y,W) com a diBlribuifio fatorial [ L, W) Podemos assim formular a lerccira variante do prin- cipio Infomax para a análise de componentes independenles como (Comon, 1994): Dado um vetor m-por-1, X rcpresentHodiT umtComhinaeao linear de ni h i ruis fiuile independenles, a cransformaedo do vetor de observado X por um sistema neural em um novo vetor ¥ deve ser realiza- da de tal forma que a dh-crgétieia de Kullback-Leibler entre a funcáo representante da probabilidade paramclrizada /^yfW)c a distribuido fatorial correspondente jy(v.W) «ja nunimizada cm tela- Cío á matriz paramétrica dcsconhecida W. A divergencia de Kullback-Loiblrr para o problema descrito aquí c considerada na Scqáo 10.5. A fórmula que estamos procurando ó dada pela Eq. (10.44). Adaptando aquel a fórmula á nossa sdua-
Hidden page
Hidden page
560 RnniisNiLLRACs K1 ¡MT log/j. (y,) = tagotfy,) 4- log 1+" ^(y,) + ?! 4! x (10.83) Para prosseguirmos, usamos a expansáo de um logaritmo: !og(l + r) V =- v-:— 2 (10.84) onde todo® os termos de ordem trés e de ordem mais a ka sáo ignorados. Da nossa discussáo anterior recordamos que a fórmula para a entropía marginal de Yf é (veja a Eq. (10.43)) .A (y,) log/r i = l,2 m onde rfí é o número de fontes, Utilizando as aproximaQocs descritas ñas Eqs. (1 0.78), (10.83) o (10.84) e mocando certas integráis que envolvem a densidade gaussiana normalizada ct(y) e váritra polinomios de Hermite H i l i. oblemos a seguirte fórmula aproximada para a entropía marginal (Madhuaranth e Haykin, 1998): ft( l'J- - logpire) • — - — ' 2 5 12 48 1440 3 i . «í4O h " K I 1 J "1" 8 1(3 w 24 24 + 4^ + ioQ* + <_++ io<,)] 64 16 432 (10.85) Substituindo as Fqs. (10.76) c (10.85) cm (10.75), oblemos a divergencia de Kullback-Leibler para o problema considerado: ?(W)=- - A(X) - log|def(W )|+ y log(2tre) (kiJ4 + 10^,) 1440 3 2 --K;..K,4 l" + K. JKc6+[^) 24 ’ 24 64 16 432 (10.86) onde os acumuladores sáo todos fun^oes da matriz de peso W.
Hidden page
onde W"re a inversa da matriz transpasta W< As derivadas parciais dos outres termos (que depen- den de W) na Eq. (10,86) com relajan a HL sao (Veja as Eqs. (IC.8Ü) a (10.82)) ^=341^1 te,. L 1 ^d-44íX]-l2mu4X-*;] 1^. “(«,. + IO*Í.) = «[ti’Xt ] - 3Cm ,44W I -60»^ £[ ifjrJ +180^4^ ] Na deriva^cío de um algoritmo adaptanvo. a ahordagem usual ó substituir 0$ valores esperados por seus valores instantáneos. Assim, Riendo esta substituirán nestas tres equa^ocs, oblemos os sc- yw.ules resultados aproximados: atcJ3 _ i (10.89) T * 3r. Ti (10. «O ÜlFj + " y6^ (10.91) Substituir as Eqs. {10.88) a (10.91) na expressio para a derivada da Eq. (10.86) em retablo a w. produz A íyw)-- (W\+1p(.L.}I1 (10.92) onde <00'.) ¿ a/iwfw r/e afñwfw náo-monóluna do algoritmo de aprendizagem, definida por (Madhuranaih c Haykin, 1998) rfr — I.'í + I2811’- — v" 3 ' Zí 3 J (10.93) A1- ligara 10.11 tra?a a fuiujáo de ativa^áo opív) para valores de v no intervalo -1 < l. Isto cobre r> intervalo de valores da saída do separador;; para os quais a operado do algoritmo de aprendíza- gem está normalmente confinada. É in(encasante notar que a .itcllna^áo da futifAo de alivaqáo c pos i 1 iva no intervalo { 0É734, 0,734); esta é urna exigencia para a estábil idade do algoritmo como discutido man adíame tiesta sc^áo.
-1 -Oí -0,6 -Ü,J -0.2 0 0,2 0,4 0j6 0,8 1 y FIGURA 10.11 Funf&o de a!iyapfio oO) da Eq. (10.93) Algoritmo de Aprendizagem para AGI O objetivo do algoritmo de aprendizagem é minimizar a divergencia de KulIbackLeibler entre a furrio de densidade de probabilidade de V e a distribuido fatorial de lepara í = 1,2,..., m. Esta minimizado pode ser implementada usándo se o método da descida do gradiente pelo qual o ajuste aplicado ao peso é definido por (10.94) onde f| é um parámetro da laxa de aprendízagem. Esiendendo a fórmula da Eq. (10.94) para toda a matriz de peso W do separador, podemos expresar o ajuste AW aplicado a W como segue: AW = r|(W '-OYh'i onde xr é o transposto de vetor de observaban m-por-1 K, c «Pty >=190,), tpO'p,..., ipti1 j]r (10.95) (10.96) A fórmula para AW dada na Eq. (10.95) pode ser rescrita notando que
Hidden page
Hidden page
W(n+ l) FIGURA 10.12 Grato da lluxo de sinal do algoritmo de aprendizagem para separado cega do Jantes descrita riá Eq. Í1C 13-1) * A expando de Gram-Charlicr usada para calcular a nao-lincaridade <íH j incluí um número suficiente de termos para produzir uma boa aproximado para a entropía marginal /i(X); esta exigencia c satisfeita, por exemplo. pela ftincáo de ativa^áo da Eq. (10.93). • A taxa de aprend izagem p é pequeña o sufici ente para que a s csti i nací vas dos ac umuladones de P sejam confíáveis. Cansidoraqoes sobre a Estabilidad? Urna discussao do problema da separado cega de fontes seria incompleta sem a considcrapao da estabilidade do algoritmo adaptad vo descrito na Eq. (10.104). Em Amari et al. (1997), ¿ apresenta- da uma análisegeral da estabilidade deste algoritmo para uma funpáo de al i vacan arbiirária tp(-). A análisc ó realizada no sentido da convergencia assintótica do algoritmo para o ponto de equilibrio desojado onde c garantida uma separapao de fontes bem-succdida. A Equa^ao l LO. 104) c uma describan em tempo discreto do algoritmo de separaban cega de fontes bascado no gradiente natural. Para o propósito da análisc de estabilidad^ o algoritmo c neformulado cm tempo continuo como segue:
W(/) = n(/)(l-íp(y(0)yrU)]W(0 (10.105) ende / representa □ tempo continuo, c W(í)= ¿W(/ydt. O parámetro da taxa de aprendizagem F|(r) é positivo para todo tempo f. Considere que ai — £[.'*?] frpCi',) 3.r. dfe) < = ¿ (10.106) (10.107) (10.108) Entáa, de acorde com Amari et al. (1997), a sólufáo para a separado ó um ponto de equilibrio cstávcl do algoritmo adaptativo da Eq. (10.104) para urna fun^ao de ativafdo ariritrária q>( ) se e sementé se as seguí rites condiQdes forem satisíeilas +1 > 0 fr. >0 >1 (10.109) (10.110) <10.1I1) para todo (¡j) com i £/ As Equa^oes (10.109) a (10.111) sáo as condeces necessárias e suficientes para a estábilidade do algoritmo adaptativo da Eq. (10.104). Considerandos sobre a Convergencia Dado que techamos satisfeito as exigencias de estábil idade das Eqs. (10.109) a (10.111), o que podemos dizer sobre c comportamento da oonva^éncia do algoritmo de aprendizagem da Eq. (10.104) bascado na futido de aliva^o da Eq. (10.93)? Com base em um estudo experimental relatada em Madhunanath e Haykin (1998), podemos dizer, gresso modo, que há duas fases no processo de convergencia: • Na fase k a variánciau^(¿r) da variável aleatória X na salda do separador passa por um periodo de ajuste» após o que ela as inge um valor razoavetmente estável. Durante esta fase, os acumuladores K^» Ki 4 e permanecen! essenciai mente constantes. • Na fase Il? os acumuladores K .., k . e x . passam por um periodo de ajustes específicos, após o que atingem valores razoavel mente estáveis, Heste ponto» podemos dizer que o algoritmo ccnvcrgiu. Parece assim que uma estimativa da variáncia c dos acumuladores de ordem mais alta das saidas do separador (i.e., sinais separados de fbntes) forma a base de um procedimento para estudaro comportamento da convergencia do algoritmo de aprendizagem da Eq. (10.104). É tambem inte- rcssantc notamos que é apenas na fase II que o algoritmo conforma-se á expansáq de Gram- CharEier.
Hidden page
Hidden page
onde P = *p ¡' = WA. O índice de desempenho óf é uma medida da diugortuhMe da matriz P Se a matriz P for perfeitamente diagonal J " 0. Para urna matriz P cujos elementos nao están concentra- dos na diagonal principal, o índice de desempenho 5 será alio. Para as formas de onda mostradas na Fig- 10.13, # 0,0606. 10.13 ESTIMAQÁO POR MAXIM A VEROSSIMILH ANQA ü método da análise de componentes independen tes (i.e., a tercera variante do principio Infomax) descrito na sefáo anterior é apenas um entre varios métodos que foram propostos na I ireratura para separapáo cega de fontes. Em um contexto teórico da informacáo, entretanto» há apenas dois outros métodos para realizara tarefa de separado de fontes de uma maneira náo-supervisi onada: a máxi- ma verossimúhan^a e a máxima entropía. Nesta sec-ao, discutimos a máxima verossimíllianija- A máxima vcrossimilhancacum procedimento bcm-cslabclccido para a cstimacáo cstaíistica com algumas propiedades desejáveis; veja a nota 5 do Capítulo 7. Neste procedimento, primeiro formulamos uma funcáo logaritmo da verossimilhanca e cntáo a otimizamos em relafáo ao vetor de parámetros do modelo probabilísliw considerado. Da dliscussSo apresen tada no Capitulo 7, recor- damos que a fundía de verossinnlharija éa fumjáo de densidade de probabilidade do um conjunto de dados em um determinado modelo, mas vista como uma fuñado dos parámetros deseonhccidos do modelo. Rcfcrindo-nos á Fig. IO.9t considere qucy’(') represente a furu^áo de densídade de probabilidade do Vetoralcallário fontc U. Enláo. a lurn^áodeden&idadcdeprobabilidadudo vetorde observado X » AU na saída do misturadoré definida por (Papoulis, 1984) /x(s,A)-|det(A) /JA x) (10.112) onde det(A) c o determinante da matriz de mistura A. Considere queJi= represente um conjunto de Ar realizantes independentes do vetor aleatorio X. Podemos cntáo escrcver x (10.113) K mais conveniente 1 rabaIliartnos com a versáo ttormalizaífa (dividida pelo tamanho da amostra A ) da funcáo Logarismo da verOssirrii 1 han^a, como mostrado por 1 1 — log/x(¿,A) - — JJog/jifXpA) A -1 = 77S,0SÁÍA',atJ_ fog|dct(A) '* i*l Considere que y = A seja urna realizado do vetor aleatorio V na saida do separador c que podra- mos assim escrever I ] r — A) = — X (y*) - log|dct(A)| (10.114) A A ;.|
Considere que A"’ = W e que/^.(y, W) représenle a funpao de densidade de probabilidade de ¥ parametrizada por W. EntJoT recqnhecendo que o samatóno na Eq. (10.114) é a média da amostra de log/L(yJ, óblennos da leí dos grandes números que» com probabilidade I, quando o tamanho da amostra V se aproxima do infinito: Z{ W) = Um 1 V bg Mi,) + log|det( W> = £[1oBX(yj]+1cg|det(W)| (10.115) /v(y.W)log/Jy) + log|del{W)| onde o valor esperado na segunda linha é em relajo a Y- A quantidade £(W) é a fun?3o logaritmo da veras si mil han qa desejada. Escrevcndo podemos expressar £(W) na forma equivalente £(W) = f" f / (y) Á(y-w)ioe ¿y+ J - A.My-W)) Á(y1W)log/v(y»W)rfy + log|dct(W)| = D,J/l - A(¥,W) + log|del(W)| (10.116) onde A(¥,W) é a entropía diferencial do vetor aleatorio ¥ parametrizado por W, e í é a diver- gencia de Kullback-Leibler entre y^(yT W) e(y), Usando a Eq. (10.76) em (10.116). podemos simplificar a expressáo para a funq^o logaritmo da verossimilhanpa £(W) como seguc (Cardoso, 1098a): £(W) = -DJs|íi -A(X} (10.117) onde A(X) é a entropía diferencial do vetor aleatorio X na entrada do separador. A única quantidade na Eq. (10.117) que depende do vetor de peso W do separador c a divergencia de Kullback- LeíblerZ) . . PortantoT concluimos da Eq. (10.117) que maximizar a fun^ao logaritmo da verassimilhahca £(W) é equivalente a minimizar a divergencia de Kullback-Leibler^. isto é, casar a distribuido de probabilidade da saida do separador Y com aqueta do velar fonle original U, o que é intuitivamente razoável. Relapso entre a Máxima Vemesi mil han qu o a Análltte de Componentes Independentea Aplicando a dtcomposicáo de Pitágoras descrita na Eq. (10.45) ao problema considerado, podemos expressat a divergencia de KulIback-LeibLerp ( para a máxima verossimilhanqa como segue:
(10.118) A primeirá divergencia de Kullback’Lciblcr/^ |¡> no lado dircilo da Eq. (10.] 18) é uma medida de dsscaxamcnin wtrufarül que caracteriza o método de análise de componentes independentes. A segunda divergencia de Kullback-LeibterD^ «urna medida de dexeasamenta margina! entre a distribuido marginal da salda do separador Y ca distribuicác do veto? fonte original U. Podemos assim cxprcasar o criterio “global” de casamento da distribuida^ por máxima verossimilhanqa como segue (Amari, 1997; Cardoso. 1998-a): Descasamento 'j f DcscasamcntoA ^Descasarncnto total ) l. estrutural J i margina! total ) l estrutura! (LO.! 19) O "descasamento estrutura!” se refere á estrutura de uma distribuiqáo relativa a um conjunto de variáveis independen tes, cnquanlo que “dracasamento marginal” se refere ao descasamento entre as distribuyes margináis individuáis. Sob a condi cao ideal W = A (i.e., separacao ccga perfidia de fonlcs), tanto o dcscasamcntc estrutura! como o descasamento marginal desaparece™. Neste ponto, a máxima venossimilbanca e a análisc de componentes independemos produzem a mesma solu^áo. A rela^aci idealizada entre a máxima verusMm.llian^a eaanilisede componentes independentes é mostrada nú Fig. ID. 14 (Car- dóse, 1996; Amari, 1997). Nesta figura, íf é o conjunto de todas as fuñares de densidade de proba- bilidade y) do vetor aleatorio Y na saida do separador; Jco conjunto de todas as distribuí i i^nes de probabilidade independentes, isto é, aquelas na forma de produto. Ambos £f e & sSo de dimensáo infinita. O conjunto & “ {/¿(y,w) r ® 0 conjunto finito de distribuyes de probabilidade medidas na saida do separador. O co-njunUj S} tem dimensionalidade m:, onde m é a ditncnsüij de Y, e a matriz de peso W é um sistema de coordenadas dentro dele. Da Fig. 10,14 vemos claramente que tanto £>Á o como£)- |fi sáo minimizados cm W = A1. É interessante pravarmos que os conjuntos S) e # sao mesma onogonais no seu ponto de interseco definido pela ftmtfci de densidade de probabilidade /v(y). Um algoritmo para separado cega de fonles baseado na máxima verassitni 1 hanpa deve incluir condiqocs para estimar as dislribuicocs relativas ás tontos quando sao desconhecidas, o que é típica- mente o caso. Os parametros para esta estimado podem ser adaptados assim como adaptamos a matriz de peso do separador W. Era outras palavras, devemos realizar uma cstima^üo <,:tinfama da matriz de mistura e (algumas caracterísrcas) das distribuyes das fontcs (Lardoso, 1997, 1998a); urna ahcrdag.ein elegante e bem-desenvoh ida para esta estinHffo é apresentada cm Pham et al. (1992, 1997). 10.14 MÉTODO DA MÁXIMA ENTROPIA O méiwfa da máxima eníropia para a scparaqáo de fbntes foi proposto por Bell c Scjncwski (II995). A Figura 10.15 mostra o diagrama em blocos do sistema bascado neste método. Como anteriormen' te, o separador opera sobre ú vetor de observarán X para produzir uma saida Y = WX que é uma estimativa do vetor fonte original U, O vetor Y ¿ transformado em um velor Z passaodü'O através de urna nao-linearidade de múltiplas componentes representada porG(-), que c monótona e pode scr invertida. Assim. aoconlrário de Y. garante-se que o vetor Z tenha uma entropía diferencial limitada /?(Z) para um separador arbitrariamente grande. Para uma n3ü-]inearidadcG(-) predeterminada, o
FIGURA !(kl4 UifJraf&ú da relapso entra a máxima veroesiinilhafífa a a análise da comportantes inoe- pendenles pana separíi^áo caga da tontos. A máxima varossimilbanca minimiza O . soquanto que a Hná istj de compnr.Rntes independe ntEsi minimiza D método da máxima entropía produz uma estimativa do vetor Fonle original U maximizando a entropía A(Z) em relajan a W. Com base na Eq. (10.55) derivada no Exemplo 10 6, vemos que O método da máxima entropía está intimamente relacionado ao principio Infbmax. A náo-linearidade G é um mapa diagonal descrito por r&Oi)i r^i _ *Í (1DJ20)
Hidden page
A(Z)^-E[log/,(z)J - - /< log -£-+rzi = -D , . calculada em u = *P(z) (10.126) Vemos assim que maxímizar a entropía /r(Z) é equivalente a minimizar a divergencia de Kullback- Leibler entre/Ju) e uma fun^to de densidade de probabilidade de L de funda por |det (J(u))|, Suponha agora que a vartávcl aleatoria Z (i.c., o j-csimo demento de Z) seja uniformemente distribuida dentro do intervalo [0„ 1] para todo í. De aconto com o Exemplo 10. lt a entropía A(Z) e cntáo igual a zcro. CorrcspondentCmcntc, constatamos da Eq. (10.126) que jyu) = |det (J(u))| (10.127) Scb a condi^áo ideal W = A-1, esta rcla^áo se reduz a para todo í (10.128) í. ’fi > De modo invcra3t podemos diaer que, se a Eq. (10.128) for saliste i la t cntáo maximizar A(Z) produz W - A-1 e a separado cega de fonies é assim realizada. Podemos agora resumir os resultados obtidos sobre o método da máxima entropía para a sepa* ra^c cega de fontes como segue (Bell e Sejnowski, 1995): Considere que a itiodifiearidade na saída do separador da Fig. 10.15 seja definida em termos da distribuicao original das fontes como A !.«, Je/tí, para i = 1,2,. (10.129) Maximizar a entropía do vcior aleatorio Z na saida da náO'linearidadc G é cntáo equivalente a W A-1, o que produz a separarán perfeira das fonie*. Os métodos da máxima entropía c da máxima vcrossimilhan^a para separaban cega de fontes sto de falo equivalentes sob a condi fio de que a variável aleatoria Z seja uniformemente distribuida dentro do intervalo [0, I] para todo i (Cantoso, 1997), Para provarmos, esta relajo, primeiro usamos a regra da eadeia do cálculo para rcscrcvcr a Eq. (10. 125) na forma equivalente (10.130)
A matriz jacobiana J pode assim serexpressa como J = DWA onde D é a matriz diagonal / D = diag Sv. * Si * I K í "’ih' & Assim, idct(j)i=|dOt(WA)in^- J-l (10.131) Urna estimativa da fun^to de densidade de probabilidade./J/u) parameo izada pela matriz de peso W e a náo-linearidade G, com base na Fq. (10.131), pode ser escrita formalmente como (Roth e Bañara. 1996) .4. (I1| W ,C) =|*l(WA)in J«1 Vi (10 132) Vemos assim que. súb esta cóndilo, maximizar a funffio logaritmo da verossimilhaoca logyj.(u |W,G) é uqu i váleme a maximizar a entropía A(Z) para a separado cega de fontes. lato é« ©s métodos da máxima entropía e da máxima verossimilhanjfa sáo equivalentes. Algoritmo de Aprendizagem para Separado Caga de Fontes Com referencia á segunda í inha da Eq. (10.126), notamos que, como a distribuidlo das fontes c típicamente fixa, maximizar a entropía A(z) requer maximizar o valor esperado do termo do deno- minador log |dct(J(u))| cm relapso á matriz de peso W. Te nd o como objetivo um algoritmo adaplatívo para realizar esta compntacño, podemos considerar a objetivo instantánea di - log det(J)| (10.133) Substituir a Fq. (l Q. 131) em (10.133) produz (10.134) Assim, diferenciando d* cm rclaQáo á matriz de peso W do separador, oblemos (veja o Problema 10.16) (10135)
Hidden page
¿W = Tj- - = ihw r+(i-ii)xr) (10137) onde T| c o parámetro da laxa de aprendizagem. Como no caso da análise de componentes ¡ndopen- dentes, podemos eliminar a neccssidadc de inverter a matriz de pesos transpostaVi 'usando o gra- diente natural, o que é equivalente a multiplicar a Eq. (10.137) pelo produto matricial W^W. Este escala mentó étimo produz a fórmula desejada para a modi Reacio dos pesos; AW = n(W’r+(1 2z)ir)WrW = q(t+(l-2iXWl)r)w = níJ+(l-2z)yr)W (10.138) onde o vetor y c a saida do separador O algoritmo de aprendizagem para calcular a matriz de peso W c com ¡sso W(n + l l W(w) + T1([ + (l - 2í(pr»yT(re))W(«> (10. B9) O algoritmo é । nicial i ?ado com W(0) sesionado de um conjunto uniformemente di si ribo ¡ido de números pequeños. Considerantes teóricas o investigantes experimentan mostraram que o algoritmo de aprendi- zagem da Eq (1 0. 139) é Limitado u separado de fontes com distribuidles supergaussianas (Bell e Sejnowski, 1995); para a definido de distribuyes supergaussianas, veja a nota 18. Esta limitado é urna conseqüéncia d:rcta do uso de uma fundan logística para a nao-linearidade no terminal de saída do sistema da Fig. 10.15. Em particular, a fun^úo logística impoc euntiecimentó previo, isto c urna forma supergaussiana, sobre a distribuido da Ponte. Entretanto, a restribo no miitcdo da má- xima entropía á fundan logística nao representa nada a mais do que a restriban do método da máxi- ma verofisimilhíuica a algum conhecimento prévío. A aplicado de método da máxima entropía pode ser amp i ada para um espectro mais largo de distribuyes de fente modificando-se o algoritmo de aprendizagem da Eq. (10.138) de modo a considerar a estimativa conjunta da distribuyo relati- va áx fontes e A matriz de mistura. Esta exigencia c similar aquel a discutida para a máxima vcrossimilhanca na sc?áo anterior. 10.15 RESUMO E DISCUSSÁO Neste capítulo, eslabeleccmos a informarán mutua, fundamentada na teoría da luforma^áo de Shan non. como ferramenta estatifica básica para a auto-organizaíáo. A informado mútua entre um processo de entrada e um processo de iaida tem algumas propriedades únicas que sugerem sua adn0o como a funfáo objetivo a ser otimizada para a aprendizagem auto-organizada. De fatnT alguns principios importantes para a aula-organiza^ao emergíram da discussáo apresentada neste capitulo;
• O principio da máxima informa^iio mutua (infomax) (L inskgr, 1988). Este principio, na sua forma básica, é bem adequado ao desenvolví mentó de modelos auto-organizados e mapas de características. • A prímeira variante do infomax, de Decker e Hinton (1992), é bem adequada para o processamento de imagens onde o objetivo é a descoberta de propiedades de uma entrada sensorial ruidosa exibindo cocrcncia através tanto do espado como do tempo. * A segunda variante do Infomax, de Ukraíncc e Haykin (1992), encentra aplicares no processamento dual de imagens no qual o objetivo é maximí zar a diferenciado espacial entre regíaos correspondentes de duas imagens separadas (vistas) de um ambiente de intere&se. * A tcrccíra variante do Infomax para anáiise de componente^ independentes foi proposta por Comen (1994), embora suas raizes remontem a hipótese de Barlow (Bariow, 1985, 1989). Apesar disso, em Comen (1994) foi apresentada pela primeira vez uma formulacáo rigorosa da analise de componentes independentes. * O método da máxima entropía de Bell e Sejnawski (1995), que está tambem relacionado com o principio Infomax. A máxima entropía é equivalente á máxima veiossimilhanpa (Cardóse, 1997). A análise de componentes independentes e o método da máx ima entropía fornecem dois métodos alternativos para a separado ccga de frutes, cada um ofcrcccndo atributos propnos. Um algoritmo para separado cega de fontes bascado no método da máxima entropía é simples de implementar, cnquanlo que um algoritmo correspondente bascado na anal i se de componentes iindepondentes é mais elaborado na deriva^áo, mas pode ter uma api icabil idade mais ampia, Uma motivado neurobiotógíca que é freqüentemente citada para a separa^áo cega de fontes é o fenómeno da festa de coquetel. Este fenómeno se refere á notável hábilidade humana de sintoni- zar seleti veniente e seguir uma entrada auditiva de inieresse em um ambiente ruidoso. Como expli- cado no Capitulo 2, o modele rieurobialó¿iico envolvido na soluto deste problema muito di fie 11 de processamento de sinal é muito mais complicado do que aquilo que está envolvido no modelo idealizado descrito na Fig. 10-9- O modelo neurobiológico envolve as formas de processamento tanto temporal coma espacial, que sao ncccssárias para i i dar com atrasas dcsconhccidos, reverbera- ban e ruido. Agora que temos um entendimento razoavdmente fírme das questóes básicas envolvi- das na solufáo neural para o problema padreo de separado cega de fontes, talvez seja oportuno atacarmos problemas da vida real cm uma escala comparável ao fenómeno da festa de coquetel. Uma OUtra área de pesquisa em aherto, merecedora de ateneo detalhada, é a deconvoitt^ao cega, Deconvolufáo é urna operado de processamento de sinal que idealmente desfaz os efe i ios da convolupáo realizada por um sistema linear invariante na tempo operando no sinal de entrada, Mais específicamente, na deconvclu^áo ordinaria tanto o sinal de saída como o sistema sao canhecides, c o objetiva é reconstruír aquíIo que o sinal de mirada deve ter sido. Na deeonvolucáo cega, ou em termos mais precises, deconvolu^áo náo-supervísionada, apenas o sinal de saída é conhecido e pode haver tambem mfrrmapao sobre as eslatisticas da fonte; o objetivo é encontrar o sinal de entrada, o sistema, ou ambos. Claramente, a deconvolucáo ccga é uma larefa de processamento de nial mais difícil que a decanvolu^o ordinaria. Embora a deconvolu^áo cega tenha de fato recebido bastante ateneo na literatura (Haykin, 1994a), o nosso entendimiento de uma abordagem teórica da informapBo para a deconvolupSo cega quando comparado ao problema da separacao ccga de fontes está em um estágio inicial de desenvolví mente (Douglas e Haykin, 1997). Além disso, uma soluto efetiva em termos de cusios para a equalizacáo cega de um canal hostil tai como o canal de común i- ca^ao móvcl é Cao desafiador quanto o problema da festa de coquelel.
560 Redes Nsuraih Em resumo, a adaptaba» cega, seja nu contexto da separaba de fo rites ou da deconvolu^ac^ tem um longo caminho a percorrer antes de alcanzar um estágio madura de desenvolví menta cora’ patfvel ao da aprendizagem superviví anacía. NOTAS E REFERENCIAS 1. Para um traiamenio deialIrado da teoría da informado, veja o livro de Cover e TbomM {1991); veja também Gray(199O). Para uma colecto de artigas sobre o desenvolví memo da teoría da informado (incluindo o artigo clássróo de 1948 de Shannon), veja SLepim {1973). O artigo de Shannon está também reproducido, com pequeñas. reviso», nos livres de Shannon e Weaver (1949) c Sloane e Wyner (1993). Para uma breve revi sao dos importantes principios da teoría da infornia£áci (eruto em mente o processamenlo neural. veja Atick (1992). Paraum tratamento da teoría da infor- de urna perapetkva biológica, vejaYockey (1992). 2. ü prme i pío da máxima informas w mutua de Lróslwr pama auto-organiza^ic nao deve ser confundido com a regra da preservaciío do contenido de infonnasáo para lomada de deci- sao, urna regia prática que é brevemente discutí ila nú Capítulo 7. 3, Para uma revis&o da jIit;í!ijt.i sobre a relajan entre let ria du iuforma^io e percep^io. veja Linsker (1990c) c Atick (1992). 4. O termo "entropía”, em um contexto de teoría da informado, deriva seu nomo da analogía com a entropía na termodinámica; esta última quantidade é definida, por (veja o Capitulo 10 onde é a constante de Boltzmann o pa é a probabil ¡dade de que o sistema esteja no estado a. Exceiopclo fator Ar a fórmula para a entropía /fnu tenntxlinámiua tem exatamente a mesma forma matemática da definido de entropía dada na Eq- (1 D.&) 5. Em Shore e Jotinson (1980), prni-se que o principio da máxima entropía é córrete no seguróte sentido: Dado fonhccimentn previo na forma de rrxtri^oc^ há apenas uma distribuirán que satisfaz estas rcstrícocs que pode ser cscolhida por um proccdimcnto que satisfaga os Axiomas de consistencia"; esta distribu ¡cao única c definida como a entropía de maMmizafáo. Sin quiltro us axiomas de COnsistincia: L Unicidade: o resollado deve ser único. II, linnriinci a; a escol lia de coordenadas ruto deve alelar o resultado. III. IrtdeperidértCij do sislema: tláo deve faaéT difeninca K é levada em tonta infuma- v :lo independente sobre siiteow ¡ndependentes separadamcnit. em termos de dcti' sidades diferentes, ou de forma conjunto, cm tenues de uma densidade conjunta. [V. Indepcndéncjj de subconjumo; náo deve importar se um subcoojunto- independente de eslados do sistema é tratado ein termos de orn# densidad? condicional separada ou em termos da densidad? total do sistema. Em Shore e Johnson (L9R0),émnütrado que a cnlropia relativa oua divefj>jrócia de Kullback- l.cihlcr também wtisfaz os axiomas de consistencia. 6l Para uma discussao do método dos multiplicadores de Lagrange, veja o livro de Domy (1975).
7. O [enno /(X; F) era originalmente referido como a tara de transmissav de mformafáG por Shannon Moje, contado, este termo ¿ nannalmcnlc referid^ como □ informaijao mútua entre as variáveis aleatorias X e F. 8. Para pro var a dccompos^ao da Eq. (10-45). podemos proceder como segur. Pdr dcü n i<;so temos (I) Das deíini0es de / í i) temos que Considere que & represente a integral na última linha da Eq. Ü ) Podemos cnüo rscrever (2) onde naülLima linha usamos a definido da Eq. (10.39). A integral na Eq. (2) é a divergen- cia de Ku!]báúk-Ltibltfr £kpara i= 1, 2...., m. Par? colocar 3 OQHUlfo psni /í na sua ícHrna fínaL noLamos que b área sah de | i ,) é unitaria, c portanlü ncrcvcrnoH
jF=X riÁ.tTJ iog ,., ruco -77------------ i n < w (3) onde na primeira linha usamos ¿1 definii,jiF til dxjttlP como descrito iki, Sc^io 10.? Assim. substitumdo a Eq. O) cm {I}, obtemos a tiedOmpíisi^ desojada: D . D .. + D. t Wí 9. Nadal e Parga (1994, 1907) tambem disculcm a relajo cutre o Infomax c a redujo de redundancia, chygando a uma concluido si nadar de que a maximiza^ü da ¡nibrma^ün mutua entre o vetor de entrada c o velor de saida de um sistema neural leva a redujo de dados. Huir e van Hemmen (J 99B) discutan a imple mentado de filtros Infomax para a retina. FltS mostram que a redundancia é cssencial pitra alcanzar robustez contra ruido de urna representado interna do ambiente como ela c producida por um sistema como a retina. 14. Beekcr e Hincón (1992) usam a acrosscmid ]1(. para se referirem á primeira variante do principio ínlbmax 11. E m Un I cy 11970) considera- se um cuminhn fia negativa para ot i n . izar o nega- 1ivo da informaban mútus entre Bináis na entrada e .i saida de) caminiio. Mostra-sc que um sistema assim se adapta para se tomar um di serien inador do padráo mais freqüente que ocurre no con ¡unto de sinais de entrada durante a adaptado. O modelo é chamado de "informen", que se relaciona iradamente com a segunda variante do principio Infomax. 12. O sislona descrito cm Ukraineu e llaykin (1996) incluí um procesMdbr de detecto q posterion que utiliza intorma^áo previa sobre a localizado do rcfictor ao longo da borda entre agua e Ierra ifo cu rao d’Ayua. Uní pKKWiCitftJf tit? lógica nabuiwa (fuzzvj Combina o desempenho da detecto primaria com a saida de um delector de borda bascado cm visño para remover cfclivamcntc alarmes falsos, resultando assim cm uma melhoria extra do descmpenlio do sistema. 13. A separado cega de fonl.es remonta U íirtigu fundamental de I léniuh. Jutten e Ans (19Í5). Para Util relato hisforico <10 problema de separacao liega de fontcü, veja Nadal C Raiga (1997); este amigo umbúm enfatizaos aspectos ncunob ^lógicos do problema. Para uma '. isáo gcral aprofundada da separaráo cega de fontes, com ¿nfosetuH principios relaciona' dos com o processamento de cirial, veja CardiíHo (1998ft). 14. Aprtuiniiis'áo da l-'un^áo de Densidade de Proba bi lid a de (a) A f.r/IrTFKíJfl rfe Considere que ’O^di) represente a fun^üít de uma vari.ivd aleatoria Ytendo a ÑncAo de densidade de probabilidade/¡(r). Por ddiniQáo temos <Pj (m) - (]) onde j = e w c real. Em outras palavins, a fun\-so cSHCterística tp^co) ca transforma- da «le Fourier da fuñólo de densidade de probahi I i da de/Ur), cxccto por uma troca de sinal no expoente. Em. geral, a fundió auacterif nca é um número complexo cujas panes
real c imaginaria sSo imitas para todo íd. Se o t-ésimo momento da variável aleatória Y existir, cnt&o qj,(toj podo ser expandida cm urna serie de potencias cm uma viíinhanpa de to = 0 como segur (2} onde wí é O ¿-¿simó momento de Ordem da variivtl ileatónu Kh é definido por (3) Deriva-se a Equaqáo (2) simplesmente substituido a expansSo da fun^o exponencial e™ na Eq. (]), trocando a ordem do somatón» c da integral c cnl&o invocando a definí ^ÉSo da Eq. (3). Se a fun^So característica tp^tu) puder ser expandida como na Eq. (2), entAo pode- mos também expandir o logaritmo de (p/toj como segue (Willu, 1962): log q>y (u) = Y II-1 Cuide K_ é dtflúrTi ¡ iIímIü ü doran .VEffri-dTivíiFJM/e de urdprn uda vsripvcl aleatoria K A Equa?ao (4) é derivada cxpandindo-sc o logaritmo de rf/.w) cm uma serie deTaylor em yuj cm tomo de tó = 0. Para simplificar o deseiwolvimento, a partir de agora Ruemos duas £uposi0es: L A variável alratória Y tem média zcro. isto c. H = 0. 2. A varíincia de Y é normalizada em relamió ú unidade, iílo é,a:“ I. Conespondcntemenle, temos kl- 0, Kj = Lea expansSo na Eq. (4} se toma 1C lof^(m)i=-(jny + J-K/tt)" 2 Agora, considere que (5) Podcinos cntSn ramwv a cq. (5) como lOg^G») = y (jd))1 + F-ÍO» Ts.tií é, a Tundió característica tpT(to) pode ser expressa como o produto do dois termos expone ociáis; = EM| (6) Usando a expandió em sénr de potencia para o termo exponencial cxp(r<to)), temos
। x l" (í.’>) exp(r([j») = L + Y—— í-1 o SubstiíuíTida a Eq. (7) ein (6} c apupando os termos com potencias iguais de (/w) no somatóno duplo resultante, obtemos novos coeficientes da expansao Je cp.tcu} tais como estes mostrados aquí: £ f. = 0 = 0 —___ 6 _ " 24 --S- 120 = — (k\+]0k?) 720 * ----ÍK + 35k.kJ 5040 T J 1 —-—-{k. + 56k.it, + 35kÍ 40320 c msiin por diante. Podemos agora fazer a transformada inversa de Fnuricr de para obter uma expansáo para a fuñólo de densidade de pnihabilidade /Jp), Em particular, podemos escrever Z<r)’<Ky) 1 + Sc/fAv) (8) onde ctíj) é n fim^io de dcnsiJadc de pnihahihdadt de urna variávei uleuióriu gumíxiana trormuli-udade média zero e variinda unitaria; tx(.i') = _ e*1'1 (9} A expansao da Eq. (ft) é conhecida como a .rerfe tí? (iram-CItar-irer de uma fun^ao de densidade de probabil idade em termos da fundió gaussiana c de suas derivadas (Síuart e Or<k 1994), Uma cxpamSo desie tipo tem uní apelo intuitivo. Em particular, sea variável aleatoria Y consiste da soma do um número de vari ¿veis aleatorias independen te e idénticamente disErihuidas, entáo quando o numero dessas \-ariáveis aumenta, o teorema do l imiic central nos diz que a variável aleatoria K éassmloticamcnlc gaus'nana. O pnmei- ro termo da serie de tiram-CharLier é de tato gaussiann, o que significa que para e$la soma O rosto da serie su aproxima de zcro quando o número de variáveis na soma aumenta. O pfíUfiófítia de Henuite íf/j') que aparece na Eq. (B) c ítefinido cm termos das k~ ¿simas derivadas de ab ) por (10) Alguns polinomios de Hermiie típicos sáo
"□Cc) = i tíiíy) = / - 15/ -+ 4 s>7 -15 Uma relaqáo recursíva para estes poliridmlos é (H) Uma propriedade particularmente útil dos polinomios de H emite é que ^(j1)c a rtt-ésima derivada da fim^So gau$siana a^r) sin binritjgwwi.'i, como mostrado por (12) 6Am c o delta de Kroneckcr, que c igual á unidade se = m c zero caso contrario, É importante se notar que a ordem natural dos termos náo é a melhor para a serie de Gram-Chariicc Em vez disso. os termos listados aquí em paréntesis devem ser agrupados (Helsirom< 196») i- (0), O),(4,6),(5, 7,9) (13) Os elementos destes grupos sáo normalmente da mesma ordem de magnitudc. Se rctrer' tdos termos até 4 = 4, por ejemplo, devemos também incluir □ termo 6. (b) A Expamao de Edgeworfh Como anteriormente, considere que ra(j?) representen func&ode densidade de probabilída- do de uma va riiávd alcotón .i normalizada para médi;s zero e variincia unilfru. A expansio de Edgeworth da fúñelo de densidade de probabilidade de uma variável aleatória cm tomo da aproximado gaussiana cíó) ¿ dada por (Cotnon, 1994; Stuarí e Grd, 1994) " 1 + HM + W + w W+«.(»+HM + /! 9 ür N. 35*; „ t . 2IQ0KÍ^ u s . I5400KÍ „ . . +-rtf<w ~íw^H”t-'’* —í^"'í(-’>+ • (14) onde te representa o acumulador de ordem í da variável aleatoria escalar padronizada K, e fí representa o polinomio de Hermite de ordem i. A Equaijáo (14) é chamada de serie de Ed^mrtk
A caractcri s1 i ca-chavc da expensan de Edgewórth é que KIH coeficientes d«TOceni unirnrmemenie. Por outro lado, os termos na expansao do Gram-Charlicr da Eq. (8) nao íendem uniforme ni ente a zcro do ponto de vísta de enos numéricos; isto é, em geral ne- nhum termo é dcsprozfvtl comparado com um letmo precédeme. É por esta razio que o precedimenlo recomendável para truncar a expansáo de Gram-CharlicT c seguir o agrupa- mente de termos descrito na Eq. [13). 15. A idéia de usar V*D (VDJW'W em vez do ^radíenle usual V¿) para resolver o problema de separado de fcmics é descrita em CSTÓOSO e Laheld (1996). Lá. V*D é referido como o gradiente relativa. Eslc gradiente c exatamente o mesmo que o gradiente natural, cuja definido resulta de uma perspectiva geométrica da informadlo (Aman. 1998; Amari et al. 1996). Ihn algoritmo similar foi descrito anteriormente cm Ciehocki c Moszczy iiski (1992) e Ck-hm.ki (ti al., 1994). 16. No espado iiemanniano de dimensao d, por exemplo. a norma quadrada de um vetor a é definida pm IHf (inde üüg sais fun^íieji (Luk CMFdflUUlM x., .vj dn C3pb$O ritmg.nni-ariün gL, = g, C O Lado dircito desu eqnesslo c scniprc positivo. Eau expressto é unía generalizpflo di fórmUila eucLidiana pura uma tIúttIU t|uadraJu: l|a||3 = ¿^ Para ujna di&cussáo da eslnitura riemanniana, veja Amari (1987) e Murray e Rice (1993). 17. Bell c Sej nowski (I995)se referem a ¡¡cu método de separado ccga do fortes como Infomax com base na Eq. (19.55) que define a relajo entre a entropía fl(Y) e a informado mútua /(V; X). Entretanto, a tenninologia prcfcrivcl c “mclodo da máxima entropía" já que en- volví a max¡m¡za(jáo da entropía A(Z), onde Z - G( Y). Urna nota de ¡.dverténuiii: o méto- do da máxima entropía para a separado cega de fontes de Bell c Scjnowski nao deve ser confundido com o método de máxima entropía ÍMMEj de Burg (1975) para y enálire espectral. 18. Diz-sc que uma variável aleatória Xé fubgmmfcinu (Benvenisle ct al., 1987) se; * ela for uniformemente dislribuida, ou * a sua fuñí 3o de deiuidade de probabilidade /^.v) puder ser expreua na fomia exp(- t^xjj ondear j é uma fun^jj par que é d i fcrenciávck cxcclo possívcl mente na origem < £(r) e g '(xji'x sao csiritarncmc crcsccmcs para O < r < Podemos tcr. por exemplo. jrf.t) com p > 2. Entretanto, se £ ( v).'i forestriiamente dccreüccntc para O < a <*» c as demais prapri- edades mencionadas furem válidas, a variável aleatória X c dita ser .¡nfKr}fí¡f¡.,r.,tiinta (Beiiveniste l! al., 1987). Podemos tcr, por exemplo gf.x) = .rl* cora p < 2. Algumas vezes (talvcz de um modo abusivo) o sinal ¿a cuitóse de uma variável alea- tória é usado como indicador de sua sttbgauss1 an idade ou supergaussianidadt:. A curta» de uma variável aleatoria A'é definida por Buscado mito, a variável aleatoriaXédita serisubgau&jiami ou supcrgaussiuna se a curióse Ajíx) fcf negativa tr.. positiva, respectivamente.,
PROBLEMAS O Principio MaxEnt 10.1 O suporle de uma variável aleatoria JT(i.c„ 0 iutenralo de valores para os quais ela ú náo sera ) é definido por [‘a, b]; nifo há nenhuma outra restri^ao imposta a esta variável aleato- ria, Qual í a distribuid de entropía máxima para esta variável aleatoria? Justifique a sua res posta. A Irforma^áo Mútua 10.2 Derive as propriedades da informad mútua !(X; >'l entre dois valores aleatónos com valores continuos Jl" e Y como descrito na Sepao 10.4. 10.3 Considere um vetor de entrada aleatorio X constituido de uma componente primé i ¡a X, e de urna componente de contexto X,. Defina X = <X, 2, = b.rX. Como a infonnflj^ao mutua entre X{ e X, «ci relacionada com a informado mútua entre Y e Assuma que o modelo de probabilidade de X é definido pela distribufoáo gaussiana multivariadah onde |1 é o vetor média de X e £ é a matriz de covat i Jncia. 10.4 Neste problema, exploramos o uso da entropía relativa ou divergencia de Kullbaek-Leibler para derivar um algoritmo de aprendizagem supervisíonada para perceptrons de múltiplas camadas (Hopfield, 1987b; Baum c Wilczek, 19SR). Para sermos específicos, considere um perceptron de múltiplas camadas consistijido de uma camada de entrada, uma camada oculta e uma camada de saida. Dado um caso ou exemplo a ^presentado na entrada, atri- bui-se á saida do neurónio í na camada de saida uma interpretadlo probabil Istica: -Vjtift Pt.n +(l-g1¡1I)IO£ Cornspundeniomente, considere que y n represente o valor reai (verdadeiro) da probabili- dade condicional que a propo^icao fr seja verdadeira, dado o caso de entrada a. A entropía relativa para o perceptron de múltiplas camadas é definida por D F onde í & prcib^bil-dade ¿z prMw¿ da ococrtocU Jo cua ol Usando como a fun?ao de custo a ser otimízadi, deríve uma regr^ ir para treinar o pcitepífl>n de múltipla# camadas. O Principio Infomax litó Considere dois canais cujas saldas séo representadas pelas variúveis aleatórias X c Y. O objet i vo ¿ maxim izar a infonTLÉnSo mútua entre JC e Y. Mostré que este objet¡vo é alcanzado quando duas condi^oes forero utitfeitM:
Hidden page
Modelos Teórecs d a Informado 589 onde Nue Nb tfa as componentes ruido em e respectivamente. (h) Demonstre a interpretado desta informacSo mutua como uma relajo entre sinal- man-ruido para ruiiki. Análise de Componentes Independentes 10. R Papa urna OCfnparaySo JcUlhaJa entre a análisc de componentes principal i s (discutirla no Capitulo 8) e a análise de componentes independentes (discutida ueste capitule}. 10.9 A análise de componentes independen fes pode ser usada como um passo de prc- proccssamcnto para a análisc aproximada de dados antes da detecto e da classifica^So (Coman, 1994). Discuta a propriedade da anal i se de componentes independentes que pode scr explorada para esta aplicando. 10.10 O ¡íímffrra de Durmoii' afirma que a soma de variáveis i ndependemes pude ter disírihuicao gau^iana apenas se estas variáis tiverem tlasmcsmas rlisiribuyocs gaussianas (Darmois, 1953). Ut¡ 1» a analise de componentes independentes para provar este teorema. 10.11 Na prática, uma implementayáo algorítmica da análise de componentes independentes pode apenas buscaras componentes lLt5o estilísticamente independente quanto posslvel". Centraste a soluc^o para o problema da seperapao cega de fontes usando este algoritmo com a soluto obtida usando um método de decorrelafio. Assuma que a matriz de covariancia do vetor de observa;áa seja nio-singular. 10*12 Com referencia ao esquema descrito na Fig. 10.9, mostré que minimizar a informayáo mutua entre quaisquer duas componentes da saída do separador Y é equivalente a minimizar a divergÉnciiL de Kullback-Leíbler entre a fundió de densidade de probabi 1 idade parametrizada^Jy, W) e a distribuiyao fatoriai correspondente í^(y, W). 10.13 O algoritmo adaptar i vq para a separado cega de fontes descrito na Eq. (10.104) tem duas propriedades importantes; {I} a propriedade cquivariante e (2) a propriedade que a matriz de peso W é mantida nüü'Singular. A propriedade {I) é discutida com algum delalhe na pane final da Sc?áo 10.1II. Nesle problema, consideramos a segunda propriedade. Desde que o valor inicial W(ü) utilizado no inicio do algoritmo da Eq. (10.104} saris- faya a condir;ao | dcl(W(0)) | * 0, mostro que | del(W(/r)) | £ Ü para todo a Esta é a condiylo necesaria e suficiente para ¡asegurar que W(>¡) seja nSo-aingular para todon. 10.14 Ncstc problema, formulamos a veraao por lote do algoritmo de scparay&o cega de fontes descrito na Eq. (10.104). Específicamente escrevemos AW = rj^l-A-dKYjV'jv,r onde >i(l) r(2) - Y- v,(l) r,(2) - Ia(I) r„(2) -
Hidden page
CAPÍTULO 11 Máquinas Estocásticas e suas Aproximares Bascadas na Mecánica Estatística 11.1 INTRODUCTO Para a nossa última elasse de sistemas de aprendizagem náosupcrvisionados (sistemas auto-arga- nizados), nós nos voltamcs para a mecánica estatística como Fonle de idóias. O lema da mecánica estatística abrange o estudo formal das propriedades macroscópicas do equilibrio de grandes siste- mas de elementos que estío sujeiios as ieis microscópicas da mecánica. O principal objetivo da mecánica estatística c derivar as propriedades termodinámicas de corpas macroscópicos partíndo do movimenta de elementos microscópicos tais como átomos e détrons (Landati e Lifshitz, 1980: Parisi, I988). O número de graus de liberdade encontrado aquí é enorme, tomando obrigatório o uso de métodos probabilísticos. Como no caso da teoria da informacilo de Shannon, o concertó de entropía desempenha um papel vital no estudo da mecánica estatística: quanto mais ordenado for o sistema, ou mais concentrada for a sua distribuido de probabilidade, menor será a entropía. Do mesmo modo, podemos dizer que quanto mais desordenado for o sistema, ou mais uniforme for a sua distribuido de probabilidades maior será a entropía. Em 1957, Jayncs moslrou que a entropía pode ser usada nao apenas como ponto de partida para a formulafáo da inferencia estatística como descrito no capítulo anterior, mas também para gerar a distribuido de Gibbs que é básica para o estudo da mecánica estatística. O frrtCRHC na Util ¡zapito da mecánica estatística como base para o estudo de redes neurais remonta aos trabadlos iniciáis de CraggcTcmpcrley (1954) c Ccwan (1963). A máquina de Boítzmann (Hinton e Sejnowski, 1983,1986; Ackley el al., 1985) talvez seja a primeó-a máquina de aprendiza- gem em múltiplas camadas inspirada pela mecánica cstatisiica. A máquina é assim denominada em nxonhaómcntoá equivalencia. formal entre o t rabal ho original de Boltzmann sobre a termodinámica estatística e O comportamento dinámico próprio da rede. Básicamente, a máquina de Boltzmann é um dispositivo para, modelara disiribuifáo de densidade de probabi Iidade de um determinado con- junto de dados, do qual as distribui^des condicionáis para uso cm tarefas como complcmcnta^áo de padróes e classifica^áo de padrees podem ser derivadas. Infelizmente, o processo de aprendizagem da máquina de Boitzmann é dolorosamente lento. Esta deficiencia motivan modifícacaes na máqui-
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Se a probabilidade/ for menor que 1. diz-se que o estado i é um estado transiente (León-García, 1994). Se a cadeia de Markov camelar em um estado recórreme, aquele estado ocorrerá novanienie um número infinito de Vczcs. Se iniciar cm um estado transiente, aquele estado ocorrerá apenas um número finito de vezes, o que pode ser explicado como segué. Podemos ver uma nova ocorrcncia do estado i como urna tentativa de Bemculh com uma probabilidad? de sucesso igual a/. O número de retomos ¿assim uma variável aleatória geométrica cora uma media de (I Sc/J< 1. cutan segue que o número de um número infinito de sucessos é zero. Com isso, um estado transiente nao pode acorrer novamente após um determinado número finito de retornos (L.eon- Garcia. 1994). Se uma cadera de Markov iiver alguns estados trans Lentes e alguns estados recurrentes, entáo o processo tenderá a se mover apenas entre os estados recorrientes. Caricias de Markov Irredutiveis üizemos que 0 estado j de uma cadeia de Markov c acessivel a partir do estado r se houvcr uma seqüeneia finita do transados de i para j com probabilidade positiva. Se os estados i e j forem acesaíveis entre si., diz-se que os estados ¿ ej da cade i a do Markov se camufticarn entre si. Esta común icaí 5o é descrita escrevendo-se i < > j. Claramente, se o estado i se comunica com o estado J e o estado j se comunica com o estado it, isto é, r o j c f A, cntáo o estado i se comunica com o estado A, isto Se dois estados de urna cadeia de Markov se comunican! entre si. diz-se que eles pertencetn á mesma clusse. Em geral. os estados de uma cadeia do Markov consistcm de uma ou mais elasses disjuntas. Entretanto» se todos os estadas conststircm de uma única classe, diz-se que a cadeia de Markov é índecamponive! úu imdutivel. Em üulras pala veas, iniciando rm qualqucr estado de urea cadeia de Markov irrcdutívcL podemos alcanzar qualquer outro estado com probabilidade positiva Cadeias redutiveis tém perneo interesse prátLeo na maioria das áreas de api ¡cacito. Conscqücntemcn- te, restringimos a nossa atencáo as cadeias irredutíveis. Considere uma cadeia de Markov irrcdutívcl que inicia cm um estado recorriente j no tempo n = 0. Considere que 7 i ír) represente o tempo que decorre entre os retamos (k l) e A para o estado j. O íejFr;w de recorrencia médio do estado j c definido como o valor esperado de sobre os retamos A pmbahiiitiíide de esiado eítMionárift do estado i, representada por é igual ao reciproco do tempo de recurrencia medio E[77£)], como mostrado por 1 "'“flrt*)] Se E[Tfk)] < isto c. ft. 0T diz-se que o estado í é um enlodo newrettte Ípetaistettíe)positiva. Se f[7j(A)J *», isto é. fij. “ (), diz-se que o estado i é um estado recwrerue (persistente) ñifla. A Lmplicaqáo de ?t - 0 é que a cadeia de Markov eventual mente alcanza um ponto cm que um retomo ao estado í é imposrfvel. A recorrerteia positiva e a ncocrtncia nula sao propriedades de ctasse diferentes,, o que signiiiea que urna cadeia de Markov com estados recorrente^ positivos e estados recorrientes nulos é redutivel.
Hidden page
Hidden page
A distribuifáo de probabilidad? é chamada de uma dialfibuiiáo invariante cu estacó Ofíária. E chamada assim porque persiste para sempre uma vez que tenha se cstahelecido. Com base no teorema da crgodk idade, podemos afirmar o scguinlc; • Parí indo de urna distribui<;ao inicial arbitraria, as probabi I .dades de transí cao de uma cadcia de Markov convergiráo para uma distribuido estacionaria desde que exista uma tal distri- bmfáo. * A distribuido estacionaria da cadeia de Markov ¿ [ütaímen te indcpendentc da dístribuicáo inicial seacadeia for ergodica. Exemplo 11,1 Considere uma cudcia de Markov cajo diagrama ¿e frfljtrifaíi rfp estado está representado rta Fig. 1 l .l. A cadeia tem dois estados a, c xr A matriz es toe As tica da cadcia é que satisfaz as candivóes das Eqs. ii 1.14) e (11.15), FIGURA 11.1 Diagrama efe tr-pnsiiy&o dn estado da oadeia de Markiy.1 para o simplk> 11.1 Supprth^ qut a inicial stja Da ]\:. (I ] .21) constaten»» que o vertir da JitEnhicicao de estado no tempo h = L é .0 .24 22’ 24. 3 4 2 2 tlevando a matriz cstocáslica F á potencia 2,3, 4, temos
Hidden page
Resolvendo estas equa^ftcs para ítp It, c Jt<. oblemos 1C. = 03953 1^ = 0.1395 0,4652 A cadcia de Markov dada i ergtklica C(im sua discrihui^Ao e^tacicniria definida por n , jc, e 7ry Classifica^áo de Estados Com base no material apresentado aquí, podemos desenvolver um resumo das classes ás quais um estado pode pertcncer como mostrado na Fig. 113 (Fdlcr, 1950; Lcon-Garcia, 1994). Esta figura tambem incluí o comportamcntu a longo prazó assüciado do estado. FIGURA 11.3 ClassifrMfSo ckiE afilados dé urna cadaia de MarKov e mu componamento a longo pnaw assoclado Apmñdicn lim nJWfl -jr r o J qnarvdlhj —* o* fcríódkM lihkp^"1 — rJJí QiElJki> íi Jétn ¡JlhL-Ri mainri!(üe L Principio do Balando Detal hado As Equaqdes (11.25)e(l1 -26) meramente enfati/am o falo de que os números rt. silo probabilida- des. A Equa^áo (11.27) é a cquapao crítica porque também deve ser satisfeita para que a cadeia de Markov seja irredutível e, portante, para que exista uma distribuí cito estacionária. Esta última cqua' Can é urna reformulaqáo do principio do balando dctaltiado que surge na cinética das realces de primeira ordem. O jvfrttpúj dt> butufiw dniuJhúciú afirma que, ein equilibrio térmico, ti taxa de ocorrízncid de qualquer transito é igual á laxa corresponden ce de ocurrencia da transmito inversa, como mostrado por (Reif, 1965); Pt ^¡Pj¡ (11.28) Para derivar a relajo da Eq. (11.27), podemos manipular O SOtnatório no lado dimito desta cquafito como segue:
l = Étflr)^ J-l = JT. Na segunda linha desta expressao, utilizamos o principio do balando dctalhado, c na última Enha usamos o lato de que as probabilidades de transige de unía cadeia de Markov satis&ZEtn a condi- íáo (veja a Eq. (IL15) com os papes de i ej trocados): * S>,. = । para todo / Note que o principio do balando dctalhado implica que a dis1 iribú iqáo i TC} se ¡a uma distribuido estacionaria. 11A O ALGORITMO METROPOLIS Agora que comprcendemos a composiqáo de uma cadeia de Markov» vamos usá-la para formular um algoritmo otocistico para simular a evdijtfo de um sistema físico para o equilibrio térmico. O algoritmo o chamado do algoritmo jUe/ro/M/if (Metrópolis ct al., 1953). Ele ó um método do Monte Cirio modificado») ntroduzido nos primordios da ciéncia da computado para a simulado estocase ica de uma cole^áo de átomos cm cqui I¡brío a uma dada temperatura. Suponha que a variável aleatoria An representando uma cadeia de Markov arbitraria estoja no estadox IW tempoH. Geramos aleatoriamenteum novo estados , representando uma realizado de uma outra variável aleatoria 5C Assume-sequca gera^áo deste novo estado satisfaz a condi^áo de simetría: Pi Yr r r;) - A > - jrj Xa - x.) Considere que AX represente a diferen^a de energía resultante da transigió do sistema dn estado = x para o estado Z =.r, Se a dilcrcnqa de energía A£ for negativa» a transido leva a um estado com energía mais haixa c a transirán é aceita. O novo estado é cntáo aceito como ponto inicial para o novo passo do algoritmo, isto ó, fazemo® A^™ Se, poroutro lado, a difcrcn^a de energía A£ for positiva, o algoritmo procede de uma mancipa probabilíslica naquetc ponto. Primeiro, selecionamos um número alcatório C, unii urmemente distribuido no intervalo Id 1 ]. Se £< expf-AE/T), onde Fc a temperatura de operasáo» a transí^áo c aceita o fazemos t|= F. Caso contrario, a transirán c rej citada e fuemo& X* AJ isio é. a configuradlo antiga c reutifizada para o peóximu passo do algoritmo. Eacolha das Probabilidades deTransiqáo Considere que a cadeia de Markov arbitraria tenha probabilidades de tranüifáo a prian representa- das por t . que satisfazem tres eondi^ñes:
604 RrD£5 Metras ] h ,\riifí-negíilividade: > 0 para todo (e\j) 2x Nornwlinit^o: Tyj = I para todo j 3. Simetría: para todo (i, /) Considere que ít represente a probabil idade de estado estacionario que a cade i a de Markov esteja no estadoxr iM 1, 2,..., Xr. Podemos eniao usar os T,, simétricos c a razáo de distribuicoes de proha* bibJadc n/i!. a ser definida, para formular o conjunto desojado de probabilidades de transifio como (Bcckermaik 1997):: para P..- = (11.29) para Para asaegurar que as probabilidades de transido sejam normalizadas para a unidade, introducimos esta definirán adicional para a probabilidade de náo-transi^áo: onde a ó a prohabil idade de moví mentado definida por (11.31) A única exigtocia importante ¿como escolher a racáOTr/rr . Para satisfacer esta exigencia, escolte- mos a distribuí vio de probabil i dade para a qual desejamos que a cadcia de Markov conviija como sendo uma distribuiíáo de Gíbbs, como mostrado por
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Maquinas EstocA-sticas. e su *s AFKnauAQOe Basi íadas ka Mecánica EsrAiIsncA 611 complententafdo depudive*. Específicamente. quando um vetor portador de informado está preso a um suhcnnjunto de neurónios visíveis, a rede realiza a complementaba sabré os neurónios v¡¡si- veis restantes^ desde que ela tenha aprendido adecuadamente a distribuidlo de treinamento (Hinton, 1989). O objetivo principa] da aprendizagem de Boltzmann c produzir uma rede neural que modelo corretannenle padróes de entrada de acardo curo uma distrital ;0o de Boltzmann. Aplicando esta forma de aprendizagem, sáo feitas duas suposi^óes: • Cada vetor (padrón) de entrada do ambiente persiste lempo suficiente para permitir que a rede alcance o equilibrio térmico. • Nto há estrutura na ordem seqüencial na qual os vetores do ambiente estío presos ás um da- dcs visíveis da rede. Diz-se que um conjunto particular de pesos sinápticos constituí um modelo perfeito da estrutura do ambiente se ele levar exatamentc á mesma distribuido de probabilidade dos estados das unidades visíveis (quando a rede está funcionando Livremcntc) que quando estas unidades cstáo presas aos veiores de entrada do ambiente Em geral. a menos que o número de unidades ocultas seja exponencial mente grande comparado como número de unidades visíveis, ¿ impossivcl atingir este modelo perlcLto. Se. contado. o ambiente tiver uma estrutura regular, e a rede utilizarsuas unidades ocultas para capturar estas regularidades, ela pode alcanzar um bom casamento com o ambiente com um número aeeitávcl de unidades ocultas. Amostragem de Gibbs e Re coz i mentó Simulado para a Máquina de Boltzmann Considere que x represente o vctOr de estado da máquina de Bollzmann, Com sua Con)ponente .v representando o estado do neurónio i. O estado x representa nina realizado do vetar aleatorio X. A conuxáo sinápiica do neurónio i para o neurónio j é representada por ir , com para lodo (ij) «^0 para todo/ (11.37) (11.38) A Equafáo (11.37) descreve a simetría e a Fq. (l1.38) enfatiza a ausencia de auto-realimentafáo. O uso deum bias é permitido utilizando-seo vetor um nó ficticio mantído .i -H econeciando-o ao neurónio Jpara todoj. Por analügia com a termodinámica, a energía da máquina de Boltzmann é definida por Invocando a disiribuicáa de Gibbs da Eq. (11,5), podemos definir a probabilidade de que a rede (assumida estar em equilibrio á temperatura 7}está no estado x como segué:
Hidden page
Hidden page
Considere que .7 represente n conjunto de cxcmplos de tre mámenlo relirados da distribuido de probabilidade de interesse. A ssume- se que os cxcmplos sao todos híñanos. E permití da a repeti- do de cxcmplos dt treinamento na propor?So tía (reqüénciaconhecidade sua ocorréncia. Conside- re que um subcon unto do vetor de estado x> digamos y(, représenle os neurónios visiveis. A pane réstame do vcior de estado x, digamos representa o estado dos neurónios ocultos. Os vetores de estado, x, xl( e silo realizares dos vetores alealórios X, Xit e X-, respectivamente. Há duas fases para a operario da máquina de Bfiltzmann: * Fase positiva. Nesta fose, a rede opera na sua condiqño presa i. i.e., sob a influencia do conjunto de treinamento 33. • Faxtí Hí^íívn. Nesta segunda fase, permite^se que a rede opere Livremente, e pártanlo sem entradas do ambiente. Dado o vetor de peso sináptico w para toda a rede, a probabilidad^ de que os neurónios visiveis estejam no estado xfj é *„) Considerando os diversos valores possíveis de xn contidos no conjunto de treinamento íí, assumidos sercm estatisticamcntc independentes^a distribuirán de pno- bahil idade global c a distribuí cao falorial |~[. jF(X re = ia). Para formular a fun^ác logaritmo da vcnossimilhan^íi £(>*), tome o logaritmo desta distribuido raterial e trate w como o vecor de parámetros deseo nheci do. Podemos assim escrcvcr ¿(w) = log f[ ftX,, = xj 1.1 «J = 2 (11.45) Para formular a cxpressáo para a probabilidade marginal P(X x j em (erraos da fundo energía /?(«}. utili7amos o segúrate: • A probabilidade P(X = x) c igual a — exp(-/?(x) > T) da F.q. (11.40), • Por definido, o vetor de estado x é a combinado conjunia de x t relativo aos ncurónms visiveis crelativo aos neurónios ocultos. Assim, a probabilidadede encontraros neurónios vlislveis no estado x(i com qualque: x é dada por (11.46) onde o veior aleatórlo X c é um subconjunto de X. A fundo de partido Z c ela mesma definida por (veja a Eq. (11.6)): ^=¿explI i v / (11.47) Assim, subsiituindo as Eqs. {11.46) e (11-47) em (ti.45), oblemos a cxprcssao desejada para a funcáo logaritmo da verosímil fianza;
Hidden page
n = f (11.54) A regra da subida do gradiente da Eq. (11.53) é chamada de negra de aprendizagem de Boífzmann. A aprendizagem descrita aquí é realizada em lote; ou seja, as modificadles dos pesos sinápticos sáo [citas após a aprésenla^5o do conjunto i metro de exemplos de treinamento. De acardo com esta regra de aprendizagem, os pesos sináplicos de uma máquina de Boltzmarui sáo ajustados utilizando-sc apenas observares disponíveis Iccaltnenie sob duas diferentes condi- íjóes: (l) operando presa, t (2) operando livremcntc. Esta característica importante da aprendizagem de Bohzmann simplifica enormemente a arquitelura da rede, em especial quando se líela com redes grandes. Uma outra característica útil da aprendizagem de Bcltzmann, que pode parecer uma sur- presa, é que a regra para ajustar o peso sináptico do neurónio r para o neurónioJ c independente do Tato de estes dois neurónios serení ambos visívcis, ambos ocultos, ou um viaivcl c o culto oculto. Todas estas características da aprendizagem de Bollzmann resultara de uma análise fundamental de Hinton e Sejnowskl (1983, 1986), que vincula o modelo matemático abstrato da máquina de Boltzmann ás redes neurais usando uma combinando de dois latores: • A distribuí^áo de Gibbs para descrever o quáo eslocástioo é um neurónio. • A funcáo de energía bascada na física estatística, dada pela Eq. (11.39), para definir a distrí- bu ¡cito de Gibbs. Do ponto de vista da aprendizagem, os dois termos que eonstiluem a regra de aprendizagem de Bollzmann da Eq. (11.53) tém significados opostos. Podemos ver o primeiro termo, correspondente :n condífáo presa da rede, como csscncia] mmlr uma regra de aprendizagem hübbLar'ui!, c Vúf O mí* gunde termo, Qonespcndcndo á tendí vito de operado livre da rede, como um termo de "desapnfídizagem" ou esquecimcnto. De falo, a regra do aprendizagem de Boltzmann representa uma generaiizacáo da regra de eaquecimenio repetido e reaprendizagem descrita por Poppcl c Krey (19g7) para o caso de redes simétricas sem neurónios ocultos. É lambcra intcressanle notar que, como o algoritmo de aprendizagem da máquina de Bollzmann requer que OS neurónios ocultos reconh«;am a diferen^a entre atividades estimuladas e atividades operando livremente, e desde que haja urna rede (oculta) externa que sirializc para os neuromes ocultos que a máquina está sendo estimulada, temos uma forma primitiva de um mecanismo de alendad (Cowan c Sharp, 1958). Necessldade da Fase Negativa e suas Implicadles O uso combinado de uma fase positiva c de uma fase negativa cstabiiiza a distribuido de pesos sinápticos na máquina de Boltzmann. Esta neceas i dade pode ser justificada de oulro modo. Intuiti- vamente, podemos dizer que a necessidade de uma láse negativa bem como de uma fase positiva na aprendizagem de Boltzmann surge de vi do á presenta da funqáo de particáo, Z, na expressáo para a probabi Iidade de um vetor de estado de um neurónio. A implicado desla afirmado c que a directo da dése ida mais ingreme no espado de cncrgia niio c a mesma que a direfáo da subida mais lógreme no espado de probabil idade. De faro, a fase negativa no procedí mentó de aprendizagem é necessáría para levar cm considerarán estas discrepancias (Ncal, 1992). O uso de urna fase negativa na aprendizagem de Bollzmann (cm duas grandes desvanta- gens:
Hidden page
Em omrsa palomas, pa(¥) ¿ n menor subconjunlo do vetor aleatorio X para o qual temos PiXj = J |X, = jtp = vAI} - P(X, = Jfjpa(^}) (11.55) (H-56) Urna virtudc impórtame das reda de creída sigmóide é a sua habilidad? de ex ib ir claramente as dependencias condicionáis do modelo probabi] istico próprio dos dados de entrada, l .in particular, a probabilidade de que o i-ésitno neurónio seja atibado ó definida pela fuñí5c sigmóide (veja a Eq. (11.41)) (H.5?) onde Tí.' ó o peso sináplico do neurónio i para o neurónioy, como mostrado na Fig. 1 1.6. Ou soja, a probabilidade condicjoml ÍVC Aj j depende de pe(J0 únicamente através de uma sema de entradas ponderadas. Assim, a Eq. (1l.57) fomece a base para a propagado de érenlas atreves da rede. Realizando-sc os cálculos de probabilidade da rede de cíenla sigmóide, nclam-sc os dois pontos seguintes: 1. ir — {J para todo ó ’ nao pertciCcntc a pa(A') Z. ir. 0 para todo t > J O primeiro punto segue da delinco dos país. U segundo ponto segue do fato de que uma rede de crenifa sigmóide c um grafo acídico orientado. Como o notnc implica, as redes de Cten$a sigmóide pcrtcncem á classe gcral das redea de cww? cstudadfls extensivamente na literatura (Pearl, I4ÑS). A operado estocástica das redes de crenca -¡iigmóide é algo nuil complexa que a máquina de Boltzmann. A pesar disso. olas se adaptam ao uso de aprendizagem por subida do gradiente no espado de probabilidade, baseado na informa- do disponivel localmente. Aprendizagem em Redes de Crecida Sigmóide Considere que £T represente um conjunte de exemplos retirados da distribuido de probabilidade de micTcsse. Assumc-sc que cada cxcmplo scja binario, representando ccrtos atributos. É permitida a repei i^áo do exemplos de tre mámenlo, na proporííío da freqüéncia de acorrencia de uma combina* íáo particular de atributos. Para modelar a distribuido da qual '3~ c retirado, procedemos como segué: 1. Dcc idease por um tamanho do vetor de estado, x, para a rede. 2. Scleciona-sc um subconjunto do velor de csiadu, digamos x , para representar os atributos dos casos de treinamento; ou seja, xrd representa o vcior de estado dos neurónios vtatuéis (i.e., os nós do evidencias).
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Quando a temperatura Jé redil/ida no per curso através do roteiro de recozi mente, o sistema sofre urna seqüéncia de tratiB^óes de fase, que consiste de d¡visees naturais de agrupamentos ñas quais o modelo de agrupamento crcscc cm tamanho (i.*,, número de agrupamento) (Rose et a]., 1990; Rose, 1991). Este fenómeno é significativo pelas razóos a según ; • Forilece uma ferramqnta Útil para controlaro tamanho dn modelo de agrupamento. • Como no necozimentó físico ordinárió, as transiges de fase sao os ponina críticos do pro- cesan de recozimentó determi ni Etico onde se deve ter cuidado com o rccozimcnto. • Os pontos críticos sao cafotltiveis, fomeccndo com isso .nforma^áo que pode ser usada para acelerar o algoritmo no intervalo entre transiges de fase. * Pode-ge identi ficar um tamañito de modelo ólimo acopl ando u m procedí mentó de valida^áo a sequera; ia de solu0es producidas em varias fases, que representan saludes de tamanhos de modelo crescentes. Exemplo 11.4 As Figuras II.LOelL.LI ilusiram a evoluc Ao da soluto de agrúpamela atraes de reeazimencu detemiiTií.HlicD cm váriiLH fases tiHifiinne a temperatura Fe rtzdivida nu a temperatura reciproca. Ü = l 'c aumentada (Rose 199]). O conjunto de dados utilizado para gerar estas figuras é unía mistura de seis distribuidles gansearas cujos centros estío mancados com **X". Os centros dos agrupamentos calculados eslío marcados com ”cT. Como as solucóes de agrupamento a temperaturas diferentes de zero nao sao duras, esta parti^áo aleatória c mostrada por coiUornos do igual probabi idade - por exemplo, probabilidade b'3 de pcrtencer a um agrupu- nicnto pan icular. Este processo inicia com um agrupamento natural contando o conjunto de treinanienEO (Fig. L LIO»). Na primcira tranüiQáo de láse, ele se divide cm dois agrupamcnlos (Fig. ] ]. ]0b) e entilo passa por unía scqücncia de transitóos de fase até alcanzar o comunto Natural” de SÉÍ.taijnjpaTncnE(j$r A próxima fran- FIGURA11.1Q O processo de agrupamento om várias fases. As linhas sáo contornas ^qúrprOvávsis, p= 1/2 em (bj e p = 1/3 nos cutres-: fe) i agrupamento iff«0) (b) 2 agrupamentas íH= D.OQ49), (C) 3 ágrupamenCDS ¿ B = Ó.OÚ66), (d) 4 agrupamentos íB= 0,0100), tfi) 5 agrupaméntos (0= 0,01S6), :t; fi agrupamanlns (B = 0,0347) e {g) 19 agrúpamenos (£? = 0,0605)
Máquinas Estocásticas r &uas AfrcwmaqGk, Babeadas na Mecánica Estatifica 639 FIGURA 11.10 (corabnuafáa) si^ao de fase resulta cm uma “cxplpsa<jH quando todos ns agrupp.mcn!Q5 se dividen»- A Figura 11.11 aprcsenta o diagrama de fase, que mostra a comportamcnto da distarlo media durante todo o processo de recozímento e o número de agiupamentos naturais em cada fase. Nesta ñgurah a distonpáo média (nomalizada em relajo ao seu valor mínimo} é trabada em fun^o do reciproco da temperatura,. ou seja £ (nunnalizado em relajo ao seu v&lor mínimo). Ambos os rixos sao rotulados iras sitas formas logarítmicas relativas. FIGURA 11.11 Difama [fe fase para o exemplp da mistura de gausslanas. O número tfe e grupamentos etetiwe é mostra- do para cada fase
Hidden page
Hidden page
642 RFDE3 NkURAJS Embota enfatizamos neste capitulo o uso de técnicas de ctinl izando e máquinas estocas ticas para resolver rarefas de aprendizagem nac-supervisicnada, das também podem ser usadas para tarefas de aprendizagem supervisionada, se assim for desejado. NOTAS E REFERÉNC1AS 1. O temió ''distribuidlo canónica" como uma describo da Eq. (11.3) foi cimbado por J. Willart Gibbs (19021 Na página 33 da Parte Um (ffemeflíarr Principies fir Staris/fonl jWecftflwcs) desta coletánea de tratoalhús. ele cscrevc “A distribuido representada por... *=°4V) onde 7/ e y $*0 constantes e // é positivo, parece representar o caso mais simples coiicebivcl, pois ela tem a propriedade de que. quando o sistema consiste de partes com energías separadas, as leis da distribuidlo cm fase das partes separadas sáo da mesma oalurezu — urna propriedade que simplifica enurmemenle a discussao e que representa a fundamentado das relajees extremamente importantes da termodinámica... Quando um enscmhlc de sistemas í distribuido cm fase da mane ira descrita, i.e.+ quando o índice de probabilidade (P) e uma fon^áo linear da energía (t X devemos dizer que o ensamble tem uma cnadnica e chamar o divisor da energía (77) de módulo da distribuido Na literatura de tísica, a Eq. (11.3) é normalmente referida como a distribuido canónica (Reif, 1965) mi distribuida de Gibbs (Landau e Lifscliitz, 19S0). Na literatura de redes neurais, ela é referida como a distribuido de Gibbs, distribuíyan de Bollzmann c a distri- buido de Efoltzmann-Gibbs. 2. A idé ia de introduzir a tem peratura e o recozimento simulado em problemas de ot imizacíio combinatoria dcvc-sc a Kirkpatrick, Gclatt c Vacchi (I983)c indcpendenlemente a Cemy (1985). Em um contexto físico^ recozimento é um processo delicado por natureza. Em seu artigo de I9R3, Kíritpatrick et al- discutcm a notjao de Hfundir" um sólido, que envolve elevar a temperatura a um valor máxime no qual todas as partículas do sólido se arninjcm "aleatoriamente" na láse líquida. Eniáo, a temperatura é reduzi.la. perm .lindo que todas as partículas se arranjem no estado fundamental de baíxa energía de uma estrutura cristalina correspcndetiie. Se o resfriamento íor rápido demaiji — rttú c. nao se permite que o sólido tenha tempo suficiente para alcanzar o equilibrio térmico a cada valor de temperatura - o cristal resultante tena muilos defeitos, ou a substancia pode formar um vidro sem uma ordem cnstalina c apenas cstvuturas metaestáveis locaimenie ótimas. A no^áo de "fusáo” pode ser o caminho cúrrelo para se raciocinar sobre vidros e tal vez sobre problemas dcotimiza^io combinatoria em um contexto computac innal cor- respondente. Entretanto, ele é engañoso quando se discute muitos outros dominios de api i' ea^áo (Beckermann. 1997), Em processamento de imagens, por cxcmplo, seelevarmos a “temperatura" de mndo que as partículas se anranjem aleatoriamente, perdemos a imagem - ela K loma uniformemente citiza. Em um sentido metalúrgico correspondente, quando realizamos a recozimento do ferro ou do cobre, devemos manler a temperatura do recozimento abaixo do ponto de fusáo: caso contrário, arruinamos a amostra. Há varios parámetros importantes que govemam o recozimento metalúrgico:
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Invocando oslas duas suposivbcsh mostré que (c) Dado que t. # (X use o resultado da parte (a} do problema para mostrar que l (d) Finalmente faca uma troca de varia veis: i’, -T IcgTU. + 7* □mié Fe F* kBd constantes arbilrárías. Com isso4 derive os seguintcs resultados; ÍÍIl> l+eip(-AF/ T} onde DE “ E^-E^. (c) Quais as OQnclusóes que vocú pode tirar dcstcs rebultados? 11.10 Na Se^So । L ?, utilizamos a máxima verossimtlhan^a como crilfrio para derivar a regra de aprendizagem de Bolizmann, descrita m Eq. (L L53). Neslc problema, rev [sitamos esta negra de aprendizagem usando um oulro criterio. Da discurso aposentada no Capitulo 10, a divergencia de Kullback* Le. blcr entre duas dnlribu aoes de probahi. idade p'tí e pa c definida por k T onde o somarário é sobre todos os estados possKeis a. A probabilidade p~ representa a probabilidad? d? que □» neuninioj \ isíveis. eslejam no estado CL quando a rede está na sua condicao presí (posiliva), e# pnihabiiidsde pa representa a probabilidad? d? que os TDCS- mos neurónios estejam no estado u quando a rede eslá na sua condifáo de operado Hvre (negativa}. Usando D, derive novamente a regra de aprendizagem de Boltzinann. 11.11 Considere uma máquina de Bollzmann Lujos neurónios visiveis sáo dividido» em neuriinici» de entrada e íUWCniM de saida. Os estados dcstcs neuiónios sao representados por fi c Y, respectivamente. O estado dos neurónios ocultos c representado por p. A divergencia de Kullbach-Lciblcr para esla máquina é definida por onde p^ é a probabilidadc do estado a sobre os neurónios; de entrada; P.._ ¿ a probabili- dade condicional de que os neurónios de saida estejam presos ao estado a dado um estado de entrada a;e PTaéa probabilidade condicional deque os neurónio» de saida estejam em
Máquinas Estucásticas e su as Apeoxima^óes Babeadas na Mecánica EstatIsitca 649 equilibrio térmico no estado y, dado que apenas os neurónios de entrada esiejam presos ao estado úl Como anteriormente, os índices superiores mais e menos representan! as condl- ?óe$ positiva {presa) e negativa (operando livre), respectivamente. (a) Derive a fórmula de D para uma máquina de Boltzmann que incluí neurónios de entrada, ocultos c de salda. (b) Mostré que a regra de aprendizagem de Boltzmann para ajustar o peso sináptico uj nesta configuTH^áo de rede pode aínda ser expressa na mesma forma como desculo na Eq. (11.51), com novas interpretares para as correla^des e pj. Redes de Crenga Sigmóide 11.12 Resuma as similar idades e ditéren^as entre a máquina de Boltzmann e a rede de crenqa sigmóide. 11.13 No Problema 11.9, demonstramos que a máqu i na de Boltzmann é descrita por um modelo de cadeia de Markov de dois passos. Uma rede de crcnga sigmóide admite um modelo de cadeia de Markov? Justifique a sua resposta. 11.14 Considere que represente o peso sináptico do neurónio i para o neurónio j cm uma rcdc de érenla sigmóide que utiliza +1 para o oslado ligado e -l para o estado desligado. Con- sidere queir ' représenle o peso sináptico correspondente de unta rede de érenla sigmóide que utiliza 1 para o oslado ligado de um neurónio c 0 para o calado desligado. Mostré que tu. pode ser convertido em w ' utilizando a transfórmacSo: '! u< = —- para 0 < i < j w’.*=h> = |L *% A última Imha c relativa ao bias aplicado ao neurónioj. 11.15 Em uma rede de crcnija sigmóide, identificamos a probabilidade P(Xp= xj X,, = xn) como umadi^tribui^áodc Gibbs, c a probabilidade = xn) como a fun^3o de partidlo corres- pondente. Justifique a validado destes dois modelos. A Máquina de Helmholtz 11 *16 A máquina de Helmholtz n&.i tem realimcnia^ao cm ambos os modelos de rcconhccimcn- to e de gerai^o. ü que poden ¡t acontecer oom a operado desla rede se fosse permitida a utiliza^áo de realimenlíi^ars em um dente s dois modelos? Máquina de Boltzmann Determlnístlca I L17 A máqu; ría de Boltzmann real 1 ¿a. desoída do gradiente {no espado de pesos) sobre o espado de probabilidades, COMO discutido no Problema L 1.1-0. Sobre qual fuTi^aq a máquina de Boltzmann dctcnniní&tica realiza a dcscida de gradiente? Vocfi pode se referir a Hinton {1989) para uma discussáo desta questáo. 11.18 Considere uma rede reconcnte que c assimclrica com te # til Mostré que o algoritmo de aprendizagem de Boltzmann detenn místico torna a rede automáticamente simétrica, des- de que após cada alúa liza^áo de peso, cada peso decaía em dire^áo a zero em uma pequeña quantidade ptupereional á sua magnitudefHinton, 1989). Rede de Cren^a Sigmóide Determlnístlca 11.19 Mostré que a diferenca entre as expretS&S iWt lados csquctdo c direito da Eq. (I L.77) é igual á divergencia de Kullhack-Leibler entre as distribuigóes ij X »i ) e í^X
Hidden page
CAPÍTULO 12 Programado Neurodinámica 12.1 INTRODUQÁO No Capítulo 2, identificamos dois paradigmas principáis de aprendizagem: a aprendizagem com um professor c a aprendizagem sem professor. O paradigma de aprendizagem sem professor c subdividido em aprendizagem auto-organizada (náo-supervisionada) e aprendizagem por reforjo, Nos Capítulos de 4 a 7, sao cobertas diferentes formas de aprendizagem com um professor ou aprendizagem supera isinnada, e nos Capítulos de 8 a II sáo discutidas di retentes formas de apren- dizagem náo-supervisionada. Neste capítulo, discutimos a aprendizagem par reforja. A aprendizagem supervisionada é um problema “cognitivo” de aprendizagem realizado sob a tutela de um professor: cía dispoc de um conjunto adequado de exemplos de cntrada-saída que sao representativos do ambiente ope racional. A aprendizagem por reforjo, ao contrario, é um problema de aprendizagem bascado em “comportamcnto'1: c realizada através da interacao entre o sistema de aprendizagem e o seu ambiente, dentro do qual o sistema procura alcanzar um objetivo específico apesar da presenta de incertezas (Barto et al., 1983; Sutton e Harto, 1998). O fato de que esta intereso é realizada sem um professor toma a aprendizagem por reforjo particularmente atrativa para situares dinámicas em que é custoso ou difícil (se nüo impossível} reunir um conjunto satisfatório de exemplos de entrada-salda. Há duas abondagens para o estudo da aprendizagem por reforjo,1 resumidas como segue: 1, A abortiagem cíassica^ na qual a aprendizagem acontece através de um processo de punfeáo o recompensa com o objetivo de alcanzar um comparíumento ültámente t/ttalificado. 2, . ? abordagem moderna t que se fundamenta cm uma técnica matemática conhecida como pro- gramacáo dinámica para decidir sobre o curso de a?áo considerando estágios futuros possívcis sem realmente experimentá-los; aénfase aquí está no plonejamento. A nossa discussao enfoca a aprendizagem por reforjo moderna. A programando dinámica2 é uma técnica que trata de situares era que as dccisdes sáo toma- das em eslágios. cora o resultado de cada dccisáo sendo pre\ isível até certo ponto antes que a
próxima decísáo seja tomada. L’m aspecto-chave destas situares é que nenhuma decisán pode ser tomada i su I adamen te. Lm vez disso. deve-se ponderar o desejo de um ha i «o custo no presente em relaqáo a altos costos indesejáveis no futuro. Este é um pmblema de atribuirán de crédito porque deve-se ah i bu h crédito ou culpa a cada dccisao de um conjunto de dccisocs intcrativas. Para o planejaincnto ótimo, c ncccssário se terum compromiso eficiente entre os cuscos i medíalo c futu- ro. Tal compromissoé realizado de fato pelo formalismo da programado dinámica. Em particular, a programarán dinámica aborda a questáo: como um sistema pode aprender a mclhorar o seu de- sempenho a longo prazo quando istn pode raquercr o sacrificio do desempenho a curto prazo? Seguí ndn a terminología da Bcrtsckas cTsitsiklk (1996). nós nos referimos á abordagem moderna de aprendizagem por rtlbrco comoneuraxlinámica. Fazcmos isso principal- mente por duas razies: • A fiindamentaffio teórica é fomecida pela programarlo dinámica. • A capacidade de aprendizagem é fomecida pelas redes neurais. Podemos definir sucintamente a programado neurodinámica como (Rertseltas eTsilsiklis, 11996): A prograinacáo neurodmáinica permite que um sistema aprenda a lomar boas decisóes observando o scu próprio comportamcnto c a mclhoraras sufts asocs alravcsde reforvo. ulil izando um mecanismo incorporado. A observado do cornporíamento ó realizada fora do tempo de execiiráo {c/f'díw) atreves da técnica de simularlo de Monte Cario. A melhot ia das apScs através de re forro é realizada atreves do uso de um esquema iterativo de otimizB^fto. Organizado do Capítulo A programar áo dinámica tem duas características principáis: um sistema dinámico suhjacentc de lempo discreto e uma funqfo de custo que é aditiva em relajo ao tempo. Estas duas características sáo discutidas na Sc^áo Í2.2. Isto é seguido por uma formularán da cquaijáo da ctiiiuzacáo de Be II man na Scqao 12.3, que dcscinpcnha um papel importante na programado dinámica. Mas Seques 1 2.4 e 12.5, discutimos dois métodos di Fcrentes para calcular uma política ótima para programarán dinámica, ou seja, iterarán de política e iterarán de valor. Na Seqáo 12.6. aprcsentamo& uma visáo gcral das questbes envolvidas na programarán ncurodinámica. Esta visan gcral leva á discussán da iterarán aproximada de polilica e da aprtndi- zagem Q. o que El ItimEi Etdcquada ao uso de redes neurais para aproximarlo de fundes. Estes dois algor niños sáo discutidos ñas Seques 12.7 e 12.8. respectivamente. A Scijáo 12.9 apresenta um experimento compuiaclonal sobre o uso da aprendizagem Q. O capíinln concluí com algumas considerarles fináis na Serán 12.10. 12.2 PROCESSO DE DECISÁO MARKOVfANO Considere um Jív/emú <le apKttttiza^cm ou agente que interage com seu ambiente do modo ilustra- do nn J-jg. 12.1. Q sistema opera de acorde com um prncesao dtp decis^ü mar^oviafitf de tempo diacreío firrito que é caraclcrizadn comn segué:
PrI ICRANAQAjO K’F.UbllllJlNÁMIl'A 653 FIGURA 12.1 Di-agrama am blocas do um sistema da ap<endizagem interag iido ctlm d fifiu ambiénte * O ambiente evolui probabilistkamente ocupando um conjunto finito de celados diséñelos. Note. enl reíanle, que o estado mío confém estilísticas passadas. embona estas estilísticas pudessem ser úteis para o sistema de aprendizagem, • Para cada eslado do ambiente há um conjunto finito de a^ocs possívcis que podem ser reali¡cadas pelo sistema de aprendizagem. * Toda vez que o sistema de aprendizagem realiza uma iujác, ele incorre etn um certo custo. • A observarse dos estadas, a real iza?ao de a^óes e a i nc dáñe i a de custos ocorrem cm tempo discreio. Nc contexto da nossa presente discussáo, o do ambiente c definido como um resumo da experiencia pomada total do sistema de aprendizagem ganha a partir da stta intera^ua cara y ambiente, de moda qne a informaban neecssária para o sistema de apretidizagem predizer o com- pon amentó fútum da ambiente está comida neste resuma. A variável aleatória representando o eslado no passo de tempo n Ó A' e O estado real no passo de tempo n é representado por s(ít). O conjunto imito de estados é representado por í.\ Um aspecto surpreendente da programado diná- mica é que a sua api icabi] ¡dade depende muito pouco da natureza do estado. Podemos, portante, proceder sem fazermes qualqucr supesi^áo sobre a estrulura do espado de estados. Para o esiado f, por exempla o conjunto disponivel de a^aen (i.c.t as entradas aplicadas ao ambiente pelo Sistema de aprendizagem) c representado por pt = |ú ¡, onde o segundo índice k na aqao a realizada pelo sistema de aprendizagem meramente indica a dispotllbil idade de malí que uma a^áo posslvel quando o ambiente está no estado/. A transí cao do ambiente do estado i para o novo estado/, por exemplo, devido á a^&oa. édenfiiurczaprobabilistica. Entretanto, o inais impor- tante é que a prerhabiiidade de tmnsigwdo estada i para o estada j depende inteiramente da estada córvente i e da tt$t¡o correspondente u r Esta é a prapriedude de hfarkaw que é dj seu: ida no Capitu- lo 11. Esta prupriedade e crucial porque significa que o estado comente do ambiente tbmece a informado necessária para n sistema de aprendizagem decidir qual aqáo realizar. A variávd alcíitória represemando a otfo realizada pelo sistema de aprendízagem no passo de tempo n é representada por Considere que A/Vl represente a probabilidade de transijan do estado i para o eslado _/ devido á a^au realizada ti o passo de tempo n. onde " a. Em virtude da propriedade de Markov, temos 'W.., •'K-M. -a) (12.1) A probahi I idade de transipñop satisfaz as duas conJ ifóes seguíntes que sao impostas pela leona das probabilidades. para todo r c / (12*2)
2. I para lodo i J (123} Para um dado número de estados c probabilidades de transido, a scqücncia de estados do ambiente resultante das aijtes realizadas pelo sistema de aprendizagem sobre o lempo forma uma vudeia de Markov. As cadeias de Markov sao discutidas no Capítulo 11. A cada transido de um estado para outro, o sistema de aprendizagem incorre em um c-terto. Assim, na n-csima transifáo do estado i para o estado/ sob a afáo « o sistema de aprendizagem incorre cm um custo representado por y“g(r, onde^í.......) é urna futido predeterminada, e Té um escalar com 0 < y < 1 chamado de [atar de descanta. Ajustando y, somos capazos de controlar o grau com que o sistema de aprendizagem está preocupado com as consecuencias a longo prazo de suas pnóprias a$tes em relajo ás consecuencias a cuno prazo destas a^tes. No limite, quando y" 0, o sistema é miope no sentido de que está apenas preocupado com as con sequen cías ¡medíalas de suas a^oes. No que se segue, ignoraremos este valor limite, ou scja, restringiremos a discussao a U <y <1 Quando y se aproxima de 1, os custos futuros se tomam inais importantes na detcmiinacao das a0es ótiroas. O nosso inlcrcssc está na formulado de uma potinca, definida como um mapeamenta de ¿-.siadnt para ofóes, Fm cutías pala vías, urna política é uma negra usada pelo sistema de aprendiza- gem para decidir o que Inzer, dado o conhecimentó do estado atual do ambiente. A polínea c repre- sentada por (12.4) onde é uma fun^áo que mapeia o estado X ™i em uma aqáo A* = ít no passo de tempo n = 0,1, 2..Este mapeamento é tal que pv(j) € ,7Íj para todos os estados i € at onde £di representa o conjunto de todas as a?ocs possívcis realizadas pelo sistema de aprendizagem no esiado i- fais políticas sáo denonlinadas üdrwXsj/MeJj. Urna política pode ser nio-estacionária úu estacionaria. Uma política náostacionária é variável no tempo, como indicado na Eq. (12.4). Entretanto, quando a política c independente do tempo, oiiscia, n - ji. ji„ diz-se que a política c esfaeionária. Em nutras palanas, uma política estacionaria especifica exatamente a mesma a^án cada vez que um estado particular c visitado. Para uma política estseto* noria, a cadeia de Markov relacionada pode ser estacionaria ou nao-estacionaria; é passivel utilizar uma política estacionaria sobro uma cadeia de Markov náo-eslacionária, mas nao c recomendare! K íhzer isso. Se uma política estacionaria Ibr empregada, cntáo a seqüéncia de estados {A'... n - 0h ], 2,...J forma uma cadeia de Markov com probabilidades detrans¡íííop..(ti(/)kondc]iO) significa uma a^áo. É por esta razáo que o processo é referido como um prvcesxa de deciiáo de Morios
Hidden page
Hidden page
que representa a forma ótima da Eq. (12.9). Reccnhecendo que TT" = 7Cfl+:) c cxpandindo parcial- mente o somaterio no lado direito da Eq. (12.10), podemos escrever min (Ki i*"1 H An ..Jx-ir +4t(W+ I ^-rl + l = min £{gJXn,lln(A-_).X„.1) H, A„, £-1 J— n-n| = min E [g,(X„,|t„(), A,+l) + jL(-^1+i )] JJ , J»-|L 1 (12.11) onde na última linha usamos a definido da Equapáo (12.10) com n + 1 no lugar de n. Agora assuma que para um dado n e para todo tenhamos (12J2) (12.13) EntSo podemos rescrever a Eq. (12.11) na forma j; (X,) = min E [g. (X,, ¡i, (X.) X,) + ✓„, (X,.,)] 1°. Se a Eq. (12.12) for válida para todo A __ cntáo claramente a equa^áo também é válida para todo Conseqüentemente, deducimos da Eq. (12.13) que M. A-..' Podemos assim formalmente formular oatgarifma dedinámica como segue (Bertsekas, 19?5b): Para todo estado inicial o custo ótimo do problema básico de horizonte finito é igual a OüdC A fundió J.t £ üblid¿j da último passo do sq^uintc algoritmo: ¿(X,)-min£[sia,g,(JQ),X1) + ¿.1(X.)] qur áge pura tris no Lempo, enm
Alcm d¡55Q, 5C minimiza o Lado dinrití] da Eq. ()2J 4) pwa 0 rr, entlü a política H* [g*n, P*!..Jéótima. A Equafáo de OU miza cao de Batimán Na sua temía básica, c algoritmo do programarán dinámica [rata de um problema de horizonte finito. Etlamos interessados em estender o uso desfe algoritmo para tratar do problema descontado de horizonte infinito descrito pela fun^áo de custo para avanzar da Eq. (12.5) sob urna política estacionó ría Jt = (p, ¡.l. p,... j. Tcndo este objetivo cm mente, podemos lazer duas coisas: * In verter o índice de lempo do algoritmo de modo que corresponda ao problema descendido. • Definí r o custo U (A',.). () como ftíY,, > (12.15) Podemos agora neformular o algoritmo de programado dinámica como seguc (veja o Problema 12.4): (X,) = mi n A[«(4. (i(X,). X) + yJ. (X)] <12.16) que «meca a partir das condiqóes midáis /.(Á) - 0 para todo -Y O estado é o estado inicial, Af, é o novo estado que resulta da a^áo da política pt e y é o fator do descomo. Considere que Jé(í) represente o cusió ótímo de horizonte infinito para o estado inicial A\ = r. Podemos cntáo ver J*(í) como o limite do custo étimo de K estágios correspondente i) quando o horiiznnte K se apcwíma do infinito; i alo ó. J*(i) = ]¡m JK(i) para todo í (12.17) l-sia reheóo c o do de contMao entre os problemas descontados de horizonte finito e de horizonte infinito. Fazcndo n + 1 A' e f na Eq. (12.16) e entáo aplicando a Eq. (12.17), oblemos (12.18) Para estimar o custo ótímo de horizonte infinito J*(i\ procedemos em dois estágios;:
1, Estimamos o valor esperado docustop.(0» A'}cm rcla^áo a A^ escrevendo ), A¡ ] = É^gO’igÜ'M) j-i (12.19) onde Neo número de estados do ambiente ep.. é a probabilidade de transido do estado inicial Ar. = í para o novo estado A( = Jr A quanlidade definida na Eq. (12.19) é o cusió esperado tmedioío incorrido no estado i por seguir a a$ao recomendada pela política p. Representando este custo por c(¡, p(i))> podemos escrever N tfw)}= (12.20) /-I 2. Estimamos o valor esperado de J*^) em relajo a A",. Aqui notamos que se conhecermos o custo J*(X() para cada estado A' de um sistema de estados finitos, podemos determinar fácil- mente o valor esperado de J*^) em termos das probabilidades de transido da cadeia de Markov subyacente escrevendo (12.21) j-i Assim, utilizando as Eqs. (12.19) a (12.21) na Eq. (12.16), oblemos o resultado desejado J*(0= min c(r,p(O) + (12 22) para i = 1,2,...,N A Equa^áo (12.22) é chamada a equacao de otimizafao de Be timan. Ela mío deve ser vista como um algoritmo. Em vez disso, representa um sistema de .Vcquapccs, com uma cqua^ao por estado. A soluto deste sistema de equa^oes define as fundes de custo para avanzar ótimas para os N estados do ambiente. Há dois métodos básicos para calcular uma política ótima, Bles sáo chamados de iterado de política e iterarán de valor. Estes dois métodos sáo descritos ñas Sc^ócs 12.4 e 12.5, respectiva- mente. 12.4 ITERAQÁO DE POLÍTICA Para estabelecer a base para uma dcscricao do algoritmo de ítera^áu de política, cometamos intro- duzindo um conceito chamado de fator Q por Watkins (1989). Considere uma política existente ¡u para a qual a fun^áo de custo para avanzar 7^(0 é conhecída para todos os estados ¿ OQ para cada estado i € SC e afáo a e ¿4. é definido como o cusío ¡mediato mais a soma dos castos descon- tados de todos os estados sucessores que seguem a política p, como mostrado por e’(f.a)=e<í.«)+xt/>({<i)Mn J“l (12.23) onde a a^áo a = ]4(í). Note que os fatores Q, ^(L tr), contera mais informarán que a fun^áo de custo para avanzar ^(j). As a^oes podem, por ejemplo, ser ordenadas com base apenas nos fatores Q+
enquanto que ordenadas; com base na fun^áo de cusió para avanzar rcqucr também o conhecimento dos cusios c das probabilidades de transi^áo de estado. Podemos ganhar um maior entendimento do significado do fator Q visual ¡ando um novo sistema cujos estados sao constituidos dos estados origináis 1+ 2,.+M Afc de Codos os parca cstado- acáo a) possiveis, como representado na Fig. 12.2. íl;i duas posibilidades distintas que podem □coner: FIGURA 12.2 IbuEtrafáD de duas transieres possíveis: a Irunsi^áD de estaca (j, á) para ú estado jé probabilística. mas a transifáo de estad? ípaia (i. a) ó daterminísllca • D sistema está no estado (/, «)„ onde nenhuma a0o é realizada. É feita automáticamente a transiqáo para o estado/. digamos, com probabi I idadep (u); c incorrc-sc cm um CUSIO tJ.y). D sistema está no estado i, digamos, e a ai^ao a € ó í c realizada. O próximo estado é (/, a), determini st icamente. Diz-se que a política |1 c gu/aeo cm nclacáo á funcao de cUlsio para avancar.^fr) se* para codo» os estados, p.(i) for uma a^ao que satisfaz a condifüo (F ( j , p (i)) - m in (íT a) para todo r (12.24) As duas observares seguinles sobre a Fq. (12.24) sáo dignas de nota: • É possível que mais de uma a^ao mimniize o conjunto de falores Q para um estado, e neste caso pode haver mais de uma política gulosa cm nclaqáo á funcao de custo para avanzar pertinente. * Uma política pode ser gulosa cm rda^o a mullas fungues de custo para avanzar Alcm J'.shk o seguinlc lato c básico para todos os métodos de programaqao dinámica; &1 '< * (0) = niin ¿TV rr) (12.25) onde ]4* é uma política ótima e J* é a funcao de custo para avanzar ótima correspondente. Com as noqoes de faror Q e política gulosa á nossa disposíQáo, estamos prontos para dcscrever o afgoritfíift de iteFift¿üu tiepolítica. Específicamente, o algoritmo opera alternando entre dois pas~ sos (Bcrtsekas. 1995b): 1. Ptf.r.ro de avafiacav da política, no qual sáo computados a lurujáo de custo para avanqar para uma pobliua corrente e o falor (í correspondente para todos os estados c a^ñes.
Hidden page
Hidden page
ramente calculadas uti!izándose a Eq. (12,29). A seguir, uma política gulosa em relagao aquele conjunto ótímo é obtida come unta política ótima Isto é, p*(i)=argnjbi0*(j,ír)> j = L,2.....N (12.30) onde jí 0*(e'1j3)=c(jJ£T) + 7^pií(o)l J*(j) í=1,2,..mjV (12.31) J-i Um resumo do algoritmo de ilerafáo de valor, bascado ñas Eqs. (12.29) a (12.31), é apresentado na Tabela 12.2. Este resuma incluí um criterio de parada para a Eq. (12.29). TABELA 12.2 Resumo do Algoritmo da liera^ao de Valor l, 2 l, Comecc com um valor inicial arbitrario Ja(j) para o estado i “ I, 2,..., 2. Para ji = Ü, i, 2,..., calcule ¿+1(0=nrip J-' j = l,2, Continué este cálculo até K.(ü)- ¿(í)l< E pura cada estado j onde e ll um parámetro de EolEranciaprEdeltTmLnado. Aflune-K que e su;a KiiíiciéncertltrLle pfiquCftG pata 7 (:) ser piísimo g Kuficfeníe da de custo para a^nfar Podemos assim J (f) = J *fi} pAffl ludoj ün. eS-Udos r 1. Calcule o Palor Q G • íO = -i- YX * 01 j-i Ü E5Í, C j=L2»P..h^ Com ittg; determine ¿ política ótima como unü pdUticA gelosa J (j); ¡i * = sfxininG*(t^) 3<
Exemplo 12,1 O Problema da Diligencia Para ilustrar a útil idade do fator £) em programaban dinámica. considerarnos <y problema da diligencia. Um cavador de fortunas em Missouri dccidiu partir para o ocslc p^ra se juntar ú corrida do nuro nu California em meados dn sécalo dc/enové (Hiller e Lieberman. 1995). A jornada ex iglú viajar cm diligencia atraves de regines desocupadas, o que impói mn sério risco de ataque por saqueadores ao longo do caminho. O ponto inicial da jomada (Missouri) e o destino (Califonda) eram fixos, mas baria uma cscoltia considcrável cnvol- vendo nutras dito osladas que puderiam ser atravessados no roteiro, como mostrado na Fig. 12.4. Neste figura, temos o seguidle: FIGURA 12.4 Grata de IluxO para O prObtema da diligencia Um total de IU estados, cada um representado por uma letra. • A directo da viagem é da esquerda para a direita. • Há qualn» eslágios (i.e,, COflidSS de diligencia) do pdrtEO de embarque n.¡ Catado A (Missouri) alé O destino no estado J (California). • Na transito de um estado para o seguróte, a a^áo realizada pelo calador de Fortuna é se mover acima, á Frente, ou abaixo. • 1 Li urti total de 18 rote i ros postras do estado A para o estado 7. A Figura L2.4 incluí tambem o custo de uma apólice de seguro para lomar qualquer cánida de diligencia bancada em uma . ivaliaijáíi cuidadosa da neguranca daquela corrida. O problema C encontrar O rolcíro do estado A para o esludo J ccftl a OpóliCC de según» mais barata. Para encontrar o roteiro étimo, consideramos uma scqücncia de problemas de horizonte finito, come- bando do destino no estado Je trabalhando no sentido retrógrado. Isto está de acorde com o principio de otimizn^So de Bellman descrito na Se^So 12.3. Calculando os latines Q para n último estágio antes do destino, constatamos fácilmente da Fig. i2.5a queos valores (> termináis sáo 05 seguróles: ahaixo) “ 3 £?(/, acima) 4 Estes números cstáo indicados nos estados// e/, respectivamente, na Fig. ] 2.5a. A seguir, movendo para Itíh um estágio c utilizando os valores Q da Fig. 12.5a. temos os seguimos valores
FIGU R A 12.5 Pasaos envcívktos no cálculo dos la lores O para o prottema da dilkjGr: ¡a Q(E, á frente) = 1+3=4 Q(E, abai^o} = 4+4=8 £J(F, acima) — 6+3-9 abaixo} — 3 + 4-7 @((7, acinta.) = 3 + 3=6 i frente) = 3 + 4=7
Hidden page
Hidden page
668 REDES NeUMB Entretanto, c importante se rcconhcccr que uma vez que sejam i:itroduzidas aproxima^ocs, nao se pode esperar que a lún^áo de escore J( „ w) convirja para a fun^aü de custo para avanzar clima Isto se deve ao falo de que-/*<) pode nao estar den tro do conjunto de funíoes represen- tadas estala mente pela estrutura de rede neural escolhida. Ñas duas próximas sepóes, discutimos dois proccdi mentas de programado dinámica aproxi- mada com aproximares da tuiisdo de cuelo para avanzar. O primeiro procedí mentó, descrito na Scijáo 12.7, trata da ileracáo de política aproximada, assumindo que esteja disponivcl um modelo raarkoviano do sistema. O segundo procedimento, dése rito na Sccao 12.8, trata deum procedí mem lo chamado aprendizagem Q, que ufo faz qualqucr supositáo. 12.7 ITERAQÁO DE POLÍTICA APROXIMADA Suponlia que tentamos um problema de programado dinámica para o qual o número de estados possiveis e afdes admissíveis seja muito grande, tomando o uso de uma ahordagem tradicional impraticávcL Assumimos que disponías de um modelo do sistema; isto c, as probabilidades de transicuo pJn) e os c listos observé veis g(j, «,./) sáo todos eonhucidus. Para tratar desea situando, proponías usar uma aproxi ma^áo para a iterarán de política, baseada na simulando de Monte Cario c no método dos mínimos quadrados, como descrito a seguir (Bcrtsckas c Tsilsiklis, 1996). A Figura 12.7 mostm um diagrama em blocos simplificado do (iigarUmv^mxmado tie iiera^iío de política. Ele c sitn: larao diagrama cm blocas da Fig. 12.3 para o algoritmo tradicional de iterarán de política, mas com uma di lerenda importante: o passo de avallado da política na Fig. 12.3 foi substituido por um passo uproximuth. Assim, o algoritmo aproximado de iterado de política opera alternando entre um passo de avalizo aproximada da política e um passo de mcihoria da política como segué: FIGURA 12.7 Diagrama em blocD^ aimphücfido tfo algoritmo aprodmade da teraí-áo ds política CuhCü para l r PíJ.í.ío Je tiJútp^i'i.'iCúr. Dada a política corrente m calcula-si: uma fun^ao de custo para avanzar J*(í, w), que aproxima a funíáo de custo para avanzar real ^(í) para iodos os estados i. O vetor w é o vetor de parámetros da rede neural utilizado para realizar a aproximado. 2+ Awa <te melhoria dapalifiija. Utilizando a funqáo de custo para avanzar aproximada w), c gerada uma política melhorada p. Esta nova política c pnijctada para ser gulosa cm rela^ii'i a w) para todo /.
Para que o algoritmo aproximado de ibera^áa de política produza resultados satisfatários+ c importante escolher cuidadosamente a política utilizada para iniciar o algoritmo. Isto pode ser feito aíravés do uso de heurísticas. Altemativamenie, podemos comear com um vetor de pesos w e utilizá-lo para derivar uma política gulosa, que por sua vez é utilizada como política inicial. Suponha cntáo que, além das probabilidades de transirán c cuates observados conhcridos, tenhamos os seguí ntes jiens: • Urna política estacionaria p como a política inicial * Um conjunto de estados representativo do ambiente Opcraiional • Um conjunto de MO amostras da finito de custo para avanzar >'(0 para cada estado / e Sí; uma amostra é representada por Mj, m), onde m = 1,2...., Af(j) Considere que j1*^, w) símbolize uma representadlo aproximada da funpao de custo para avanzar A aproximaban c realizada por uma rede neural (p.cx., um pcrccptron de múltiplas camadas tremado com o algoritmo de rctropropagacáo). O vetor de parámetros w da rede neural é determina' do utilizándose o método dos mínimos quadrados, isto é+ minimizando a fuñado de custo; Afín *(w>= Hw,™) (12.321 rtf Tonda determinado o vetor de peso ótimo w c portanto a íunfáo de custo para avanzar aproximada 'v). determinamos a seguir os fator» Q ulilizando a fónnula (veja as Eqs. (12.20) e (12.23)) g(í,uTw) = pv («Xg(taJ') + W)J (12.33) jeí ondepj,a) é a probahilidade de transiese do estado i para o estado j sob a a^áo a (conhecida), g(i, j) é o custo observado (também conhecido) e y é um fator de descontó específico, A iterapáo é completada utilizando-sc estes faíorcs Q aproximados para determinar urna política melhorada ba- scada na fórmula (veja a Eq, (12,28)) p(¡)= argmingíAfljW) (12.34) « É importante notar que as Eqs (12.33) e (12.34) sáo utilizadas pelo simulador para gerar a^Ces apenas nos estados que sáo realmente visitados pela siinulabáo, cm vez de gerádas cm todos os estados. Dessa forma, estas duas equaoAes náo sofrem da maldicáo da dimensionalidade. O diagrama em blocas da Fig, 12.8 aprésenla uma describa mais detalhada do algoritmo aproximado de iteraban de política. Este diagrama consiste de quatro módulos conectados entre si (Bertsekas e Tsitsiklis, 199¿): L O timufüd&r, que utiliza as probabilidades de lransibáo de estado dadas e os cusios observados cm um passo para construir um modelo substituto do ambiente, O simulador gera duas coisas: (a) estados em resposta a afdes para i trinar o ambiente c (b) amostras da fun^ao de cusió para avanzar para uma dada política. 2. O gerador de a;áo, que gera urna política melhorada (i.e.. seqüéneia de affies) de acorde com a Eq,(l 2.34),
Hidden page
Hidden page
Hidden page
Teorema de Convergencia* Suponha que o parámetro da taxa de aprendiiagem q/r. a) satisfaga as condifóes XnAa)' * e P«St[itlo(M (12.4]) a vil '«n EnJuü, a rfí^j/anerj {J ¿r.J/ ^raJxr jWrj ¿r^ürifmo de 0 converge epm prü&cródúÁadí? / pjra a vaJor ¿íifh# £>*(jp depara fadas m poner ¿sfato-apfo f¿ a.»1 </ir¿rrttfc> ú flíjfltn? déJfe-navfies- nj£ aproxima do úr/rnírp, desdeñeforfa? íkparar arfeadü-flfáoj^'aflf WiíadtW ífl/¡rJÍfflS VCS. Um exemplo de um parámetro de aprendizagem variável no tempo que garante a convergencia do algoritmo é n"=p7P ”'-2"" (12.42) onde a e p sáo números positivos. Em sumat o algoritmo de aprendizagem Q c uma forma de aproximado eslocáslica da política de iteraofio de valor. Ele armazena o fator Q para um ¡Mico par estadoa^áo a cada iterado do algoritmo, isto c, o estado comente c a a^ao realmente cxccutada. Mais importante é o fato de que, no limite, o algoritmo converge para os valores Q olimos sem formar um modelo explícito dos procesaos subjaccntes de decisño markoi ianos. Uma vez que os valores Q olimos csícjam disponí- veis, pede-se determinar uma política ólima relativamente com pouca computado utilizando a Eq, (12,30), A convergencia da aprendizagem Q para uma política ólima assume o uso de uma representa- í3o por tabela de consulta para os fatores Q Qa(lr £*) Este método de representado é direto e computacionalmente eficiente. Entretanto, quando o espado de entrada consistindo de pares estado- a^ao for grande ou as variáveis de entrada forcm continuas, o uso de uma tabela de consulta pode ser proibitivamente custoso devido á neccssidadc de uma memória muito grande. Ncsla situado, podemos recorrer ao uso de uma rede neural para fiiu de aproximado de fuñico. Aprendizagem O Aproximada As Equaqócs (12.38) c (1239) dcíincm as fórmulas de atualiza^ao para o fator Q para o par cstado- a^áo corrente (<, aj. Este par de equacfcs pode ser rescrito na forma equivalente +n„ (4 ) g< i^n JJ+Y mm Q, üB, 6) - fi. (4, a„) - r (12.43) Tratando a express^o dentro-dos colchen»» no lado direita da Eq. (12,43) como o sinal de erro envolvido na analiza^5o do fator Q corrcntc h.. ún)T podemos identificar o fator Q alvo (desoja- do) no passo de tempo n como:
Hidden page
TASELA 12.4 Resumo do Alg Dril m d Aproximado do Aprendizagem Q 1. Comece com um vetar pesa :ntLÚal wH, que resultu nú (atíxr Q @0,,. pu« Wj; o velor peso wn se refere a uma rede neural utilizada para realizar a aproxima^ to. 2. Puto a irera^&o ft = I, 2,,.^ faga c seguróte: (a) Para a configurado w da rede neural, determine a a^ao ótima: a, = imnQl(fa,an,w) (b) Determine o faict Q alvo Cf" «A, - S(<n, ) + Y ¿n ÜtfU*) le) Alualize o fator Q w) = Í?J > a,,w) + w) onde ÍV4^XÍZ,’(f-(^w)-£iaA^)X M = 0, caso contrario (ó) Aplique p ) como entrada para a rede neural produzirtdo a salda Qjj*, ar, w) como uma aproximacSo para o iator Q alvo í2^™(i,1a,hwk Modifiqué o vetar peso w levemente de modo a traztr a*, w} para maja próximo do valor alvo í?"''(j. .¿¡.. w). r el Volts para o passo (a) e repita a computaba. Explora; ao Na iterapao de política, todas as partes potencialmente importantes do espado de estado deveriam ser exploradas. Na aprendizagem Q, temos uma exigencia adicional; todas as atftes potencial mente vantajosas dever ¡aun lambém ser tentadas. Em particular, todos os pares cstado-acao admissíveis deveriam sur explorados com frcqücncia suficiente para satisfacer o teorema da convergencia. Para uma política gulosa representada por p, apenas os pares cstado-a^o 0\ p(¿)) sao explorados. Infe- lizmente; nao há garantía de que todas as a^fies vanta josas sujam experimentadas, mesrao se o espado de estado inteiro for explorado. O que neceas i tamos é de unta estraté^a que expanda a aprendizagem Q fomcccndo um com- promisse entre dois objetivos confutantes (Ttirun, 1992): • A expiora^da, que assegura que todos os pares estado^atfo admissíveis sejam explorados com freqü encía suficiente para sai i sfazer o teorema de convergencia da aprendizagem Q. • O apmveiiamento, que procura minimizar a fun;3o de custo para avanzar seguindo uma política gulosa.
Hidden page
Hidden page
A Figura 12.12 aprésenla os resuliados correspondentes obtidos utilizando um perccptron de múltiplas camadas com dois nós de entrada. 10 neurónios ocultos o um neurónio de saida. Um dos nós de entrada representa o estado e os outros nós representare a a^áo realizada para se mover do utn estado para o seguinie, A saída do perceptron de múltiplas camadas représenla o valor Q calculado pela rede. A rede foi [reinada utilizando o algoritmo de rctropropagacáo padrao. O valor O alvo utilizado no tempo rr foi calculado ulilizando-sc a Eq. (12.44). O parámetro da laxa de aprendiza- gem foi forado em 0,012 e n3o foi utilizado o falor de momento. A rede foi tremada com 10.000 tentativas para cada par estado-apáo. A Figura 12.12 aprésenla as historias de aprendizagem para os valores Q 0Í/1, acima), Q(C, i frente}; á frente) c Q(I, acima). O rolciro ólimó encentrado pela rede foi TL-titaij'.-j (* 100) TlilIjIÍv¡i (k |íKI) FIGURA 12.12 Curve? es eprendizagem para o problema da diligencia utilizando uma rede neural. {a) Curva de aprandizagam para O{A. acima}, (b) Curva de aprei’dizagem para O (C, u trente). (e) Curva de aprendizagem pare Q (E, á frente), (d) Curva d& aprendizagem para Q (/, acim?) o qual s.c reennhece como um dos reteiros óiimos enm um custo total de 11. As exigencias ccmputac loriáis para os dois melados de implemenla^áo sao resumidas como segué:
Hidden page
Na aprendizagem Q aproximada, é utilizada uma rede neural para aproximar as estimativas dos falaces Q de modo a evitar a necessidade da exigencia cxccssiva de memoria quando o número de estados possí veis for grande. Em resumo, a aprendizagem Q aproximada c um algoritmo fraseado em simulado para resolver um problema de dccisao markoviano quando um modelo do sistema náo estiver Jisponívci c a exigencia de memoria for um requisito adicional. Claro que ela pode ser aplicada mesuro se um modelo do sistema estiver disponíveL e neste caso ela fomece uma alterna* ti va á iterado de política aproximada. As técnicas de programarán ncurodinámica sáo particularmente cíclic as na solufáo de pro* hlemas de larga escala nos quais o plancjamcnto é uma preocupado importante. As abcudagens tradicicnais para a programarán dinámica sáo difícilmente api ¡cavéis a problemas desta natureza por causa do enorme tamanho do espado de estado que deve ser explorado. A programadlo ncurodinámica de falo tem sido aplicada com sucesso para resolver problemas di ficéis do mundo real cm muilos campos diferentes, que incluein o jugo de gamáo (Tesauro, 1989,1994), a otimlzacao combinatoria (Bertsekas e I silsiklis, 1996), o controle de elevadores (Crilcs c Bario, 1996) c a aloca^áo dinámica de canal (Suigh c Bertsekas, 1997: Nie e HaykínT 1996, 1998). A seguir, a apli- cado ao jogo de gamáo é descrita com algum detalhe. O desenvolví mentó de um programa de computador bascado em rede neural para jogar gamao, primciramenle relatado cm Tesauro (19891 e mais tarde aperfei^oado em Tesauro (1994), é uma historia de succsso particularmente impressionante que tem sido uma fonte de molivaqáo para a pesquisa em programado neurodinámica, Gamito é um jogo amigo de tabú leí ro para dois .rogado- res. É jogado efetivamente ao longo de um caminho unidimensional. Os jogadores re\rezam-se j Ogando um par de dados c movendo corrcspondcntcmcnlc suas pojas cm d •.rendes opostas ao tongo do edminho. As jugadas válidas feitas porcada rogador dependem do resultado do lance dos dados C da confígmafáo do tabú leí rn. O primeim jngadnr a mover Indas ¿is suas pc^as para frente ate O final do tabule i ro c o vencedor. Ojogo pode ser modelado como um processo de dccisáo maricoviano, com um estado sendo definido por uma describo da configurado do tabuleiro. o resultado do lance dos dados o a identidade do ¡ogadorque está fazendo a jogada. A prime ira verrio do neurogamáo construida por Tesauro (1989) uLilizcu aprendizagem supervisionada. Ela fbi capaz de aprender em um nivel intermediaria forte, dada apenas urna describo "grosseira11 do estado. Tal vez a dcscobcrta mais interesante relatada ten lia sido o hont eempertamento em relajo ao esta lamento, no sentido de que, conforme o tamanho da rede neural c a quantidade de experiencia de treinamento ¡am crescendo, foratn observadas inelhorias substanciáis no desempenho. A rede neural utilizada no estudo fu ¡i um perceptron de múll ¡pías camadas (MI. P) Ireinado com o algoritmo de retropropagaqán. O mclhor desean penho foi cbtido utilizandO'Sc um MLP com 4(1 neurónios ocultas, e o treinamento foi realizado sobre um total de 200.000 jogos. Ein um estudo subseqlíente relatado por Tesauro (1994), urna forma de iterado de política chamada de X) fílinn'atíi foi usada para tneinar a rede neural; DT vem da expresan (rpnntiiZitgentpoHliJmHfu Itfftp&füi, adotada porSutlon (1988). A D I (A.) ot¡mista é um método bascado em simulado para aproximar a fun^áo de custo para avanzar J*, no qual a política ¡i é substituida par tuna nova política p que é gulosa cm rclaqáo á aproximado de a cada transido de estado (Bcrtsekas c Tsitsiklis, 1996). O programa de computador babeado neste método de programado ncurodinámica é normalmente referido como gíiinao DT. Tesauro adicLODOu fundes manipuladas do estado (Le,, feifoes) á representado da entrada da rede neural, posibilitando que a gamáo DT jügasse em um nivel de mestre forte, extremamente próximo ao inelhor jogador humano do mundo. Entre as indícapdes que contribuirán! para esta avallando están cm umerosos testes do gamáo D ] jogando contra virios grandes mestres humanas de classe mundi- al (Tesauro, 1995).
Ftoai*MAi;ÁD Meurudin amicx 681 NOTAS E REFERENCIAS 1. A abordagem cEássiea para a aprcm::/agcm por reforjo ó fundamcniadá ng psicología, remontando ao trabalho inicial duThnmdike (|911) sobren aprendizagem animal e amuele de PavJov (1927) sobrecondicionanientú. Conlribuijócs á aprendizagem por reforjo clás- tico também inclucm n trabalho de Widniw ri al. (1973); naquelc artigó, foi introduzicla a no^áo de ert/rcíí. A aprendizagem por reforjo clástica é discutida no livro de Hampson (1990), Contribuicóes importantes a aprendi™*gem par reforjo moderna incluem os irabalhos de Samuel (1959) sobre O seu celebre programa de jago de damas, de Barbo el al. (1983) sobre í-istcmas críticos adaptalivos. de Sutton (I9S8) sobre métodos dediferen^a temporal ede Watkins (19R9) sobre a aprendizagem Q. O manual de controle inteligente de Whitc c Soígc (1992) aprésenla tnaicrial sobre wiitrúlc ólimo por Whílc e Jordán, sobre aprendi- zupem por refbfQOC métodos erítjcos adaptantes por Barro c sobre programado dinámica heurística por Werbos. Bertsekas o Tsilsiklia (1996) apresenlam o primeiro iratamcuto da aprendizagem por TClbiyo moderna na forma de livro. Para um reí ala h i Hlónuu sobre aprendizagem porrelbr- $o. veja Sutton c Bario (1998). 2. A prcii>ramaQáa dinámica foi desenvolvida por R. E. Bel Imán no final dos anos 50; veja Reliman (1957), Bcllman e Drey fus (1962). Para uma expon i^áo detalhada sobre c asían- te. veja o livro em dois vol limes de Rertsekas (1995 b). 3r A Icrajáo de política C a itflttfiO de vplor sao as dais méladoH principáis du programaban dinámica. Há dois outros métodos de programado dinámica que merceem ser menciona- dos: íj méfi7í/rj ¿j'é1 í ruM.xv-.StiJt'/ e aprogroma^ut? dinámica tiSSiriíTürta (BartO el aL. 19951 Bcrtsckas, 1995b). No método deGauss-Scidel, a íunfEodecuito para avanzaré ¡Mualizadá cm um estado a cada tempo cm uma vatru Jura scqüirncial de todos os estados, com a competijio para cada estado sendo bascada nos cusios mais recentes dos outros estados. A programarán dinámica astinctOM di tere do método de Caiifis-Seidel na medida em que nao é organizada em termos de varreduras sucess:vas sistemáticas do conjunto de estados. 4. Na p j i11 na 96 da sua tese de doutorado. Watkins (1989) faz as seguinles observares sobre a aprendizagem O; “O apéndice I apresenta uma pro^a de que este método de aprendizagem luncicma pura os procesos de decisio markovianos finitos. A pro va também mostra que o mé- todo de aprcnd./Jigem convergirá nipidamenle para a funG^o de valor de a^áú ótima. Embora esta seja uma idéia muito simples, tanto quanto cu saiba, cía nao foi sugerida antes. Entretanto, deve ser dito que os processos do dcci^áo markov lanos c a progra- macáu dinámica cstccásücii lém sido extensivamente CStUdftdQS pm" mais de trinlu anos para sem usados cm virios campos cifcrcntcs. e c improvávcl que nmgucm tenha levado cm eonsideracio antcrionTieiitc o método de Monte-Cario.” Em um cumcntária de rodapé sobre estas ObKtVAfda, Baria et aL (1995) xalientam que, embota a idéia de alribtur valores a pares csmdo-íiíáo forme a bdsc da abordagem da programarán dinámica cstudada cm ]>cnardn 119fi7), cíes nao encontraran; algoritmos como o da aprendizagem Q para esl i mar estes valeres que anteccdesscni a tese de Watkins de 1949. 5. Em Watkins {1989) foi apresontado o esbozo da uma pro va do teorema de convergencia para a aprendizagem Q. que fei mais tarde reinada em Walkins e Gayan (1992). Em Tsitsíklis (1994) foram apresenlados resu hados miis gerais sobre a convergéneiu do apren- dizugem Q; Veja latilbém Bensekas e Tsitsíklis (1996).
Hidden page
Hidden page
Hidden page
CAPÍTULO 13 Processamento Temporal Utilizando Redes Alimentadas Adiante 13.1 INTRODUJO O lempo constituí um ingrediente essencial do processc de aprendizagem. Ele pode ser continuo ou discreta. Independientemente da sua forma, o tempo c uma entidade ordenada que c básica para muitas tarefas cognitivas encontradas na prática, como a visic, a tala, o processamento de sinais e o controle motor. E atravta da incorporado do lempo na operado de uma rede neural que ela é capacitada a seguir as variantes estadísticas em procesaos nao-estacionarios como os sinais da tala, fiituis de radar, siria ls adv indos do motar de um autcmávcl c flutua^ocs cm presos do mercado de apdes, apenas para mencionar alguna dcstcs procesaos. A questáo come pedemos incorporar o tempo na opera^áo de uma rede neural? A resposta a esta questáo fundamental se encontra em uma das duas seguintes possibil idades: • Repnesenfítwv implícita, O tempo é representado pelo efeito que tem sobre o processamenlo de sinais de uma maneira implícita.1 Por exemplo, o sinal de entrada c amostrado uniforme- men¡et c a seqüénda de pesos sinópticas de cada neur&nic conectados ú camada de entrada da rede safra urna convoiufao com uma seqüene i a diferente de amostras de entrada. Fazen- do assim, a estrutura temporal do sinal de entrada c inserida na estrutura espacial da rede. * Representando explícita. O tempo recebe sua prdpria representafáo particular.3 O sistema de ecolocaliza^ao deum morcego, por exemplo, opera emi lindo um curto sinal de frcqüéncia modulada (FM), de modo que o mesmo nivel de mtensidade é manttdo para cada canal de freqiténcia restrilo a um periodo muito curto dentro da varredura de FM Sáo realizadas múltiplas comparaQocs entre várias ftcqücncias diferentes codificadas por um arranjo de receptores auditivas com a finalidade de exirair in formado precisa sobre a distancia (al- cance) até o alvo (Suga e Kanwal, 1995), Quando um eco é recebido do alvo com um atraso desconhecido, um neurónio (no sistema auditivo) com uma linha de atraso casada com este sinal responde, fomecendo dessa forma uma estimativa do alcance de alvo.
Neste capitulo, estamos preocupados com a representado implícita do lempo, pela qual uma rede neural “estática'1 (p.ex.. um perceptron de múltiplas camadas) e suprida com propiedades rfnámkttf. Isto, por sua vez, toma a rede sensivel á estrutura temporal dos sinais portadores de .nfomna^ao. Para que uma rede neural seja dinámica, ela deve ter mflrrdrrcr. Como satientado no Capitulo 2, a memoria pode ser div >dida cm memoria de "curio prazo" c de “longo prazo", dependendo do tempo de rctcncáo. A memoria de longo prazo é inserida em uma rede neural através de aprendiza- gem supervisionada, pela qual o contcúdo de informacao do conjunto de dados de treinamento c armazenado (parcial mente ou totalmente) nos pesos sinópticos da rede. Entretanto, sea tarefa con- siderada ti ver uma dimensáo temporal, necessitamos de alguma forma de memória de curto prazo para tomar a rede cinámica Uma forma simples de inserir memoria de curto prazo na estrutura de uma rede neural é íi través de afntíós tic taftpu. que podem ser i ni pie mentados a nivel Sinóptico dentro da rede ou na camada de entrada da rede. O uso de atrasos de tempo em redes neurais tem motivado neurobiológica.. iú que é bem ccnhecido que atrasos de sinal sáo 0111 presentes no cércbro edesempenham um papel importante no processamento neurobioló^codainfonnasMfBraitenberg, 1967. 1977, 1986; Miller, 3987). Organiza;ño do Capitulo ü material neste capitulo está organizado em trés partes. A primeira parte, consistindo das sebees 13.2 e 13.3, trata das estruturas e modelos de rede. Na Se;áo 13.2, apresentamos uma discussao das estruturas de memoria, seguida pelaSe?áo 13-3 sobre uma descrlfáo de duas diferentes arquiteturas de rede para o processamento temporal de sinais. A segunda parte do capitulo, consi$Lindo das Scqócs 13.4 a 13.6, trata de uma classe de redes ncuraiü conhecida cómo redes alimentadas adianto, focadas c atrasadas no tempo; o termo “focada" se refere ao futo de que a memoria de curto prazo está localizada inleiramenle no terminal frontal da rede. Um experimento computad onal sobre esta estrutura é descrito na Sepáo 13.6. A tere eirá parte do capítulo, consi si indo das Scpocs 13.7 a 13.9, trata das redes alimentadas adiante distribuidas, atrasadas no (empu, ñas quais 1 inhas de airase sao distribuidas alravcs da rede. A Secan 13.7 dcscrcvc modelos espa^o-temporais de um neurónio, seguida de urna diseussáu na Se^áo 13.8 sobre a segunda classede redes neurais mencionada acima. Na Scqáo 13.9T desenevemos o algoritmo de rctropropagacáo "lemporal" para o treinamento supervisión ado de redes alimenta- das adiante distribuidas, atrasadas no tempo. O capitulo concluí com algumas obsen-a^óes fináis na Se;ác 13.10. 13.2 ESTRUTURAS DE MEMÓRIA DE CURTO PRAZO O papel principal da memoria c transfrjt'mar1 urna rede extática em uma rede tiintimica. Em particu- lar, incorporando memoria na estrutura de uma rede estática como um perceptron de múltiplas camadas ordinario, a saída da rede se toma mna fun^áo do lempo. Esta abordagem para construir ura sistema cinámico nao-linear é di reta porque fomece uma clara separaban de responsabilidades: a rede estática é responsável pela náo-lincaridade. e a memória é responsável pelo tempo, A memória de curto prazo’ pode ser impfomentada cm tempo continuo ou em tempo diséñelo. O tempo continuo é representado por/, c o tempo discreto é representado por ti, O circuito resistivo- capaciiivo da Fig. 13.1 c um cxcmplo de memória de tempo continuo, que c caracterizada por urna
Hidden page
Ulibdtde L Unidade 2 U nid-ade Sinal de en.1i3da Twuniütii de flkfa FIGURA 13r2 Memoria de linha de atraso derivada generalizada de ard&m p De agora cm diante. gííri será referida como o núcleo gerudor da memoria de tempo discreto. Com base na Fig. 112, podemos fonnahnente definir tima memoria de lempo discreto como um sistema linear de única entrada c múltiplas sai das (SIMO, single tnput-nndtipleautpití} invariante no tempo ciijo núcleo gerador satisfaz estas propriedades. Os pontos de júntelo, aos quais os termi- náis de saida da memoria sáo conectados, sáo normalmente chamados de derivagoes. Note que para uma memoriade ordem/', háp + l deriva^óes, com uma derivado pcrtcnccntc á entrada. Os atributos de uma estrutura de memoria sao medidos em termos de profundidad? e resolu- 9Í0. Considere que g hi) represente a resposla global ao impulso da memoria, definida como p convolutjdes succssivas dcgói), ou. equivalentemente, como a transformada r inversa de G^z), A profiuididade dameniória, representada por D, é definida como □ primeiro momento temporal de g. i n)„ Como mostrado por 0=¿í®/rt) (13.5) i-i4 Urna memoria de baixa profundidad? D manlcm o scu contcúdo de informado so mente por um periodo de lempo relativamente curto, enquanto que uma memória de alta pro fundí dade manlcm seu contcúdo de informarán muito mais longc no passado. A da mefítória, representada por R. é definida como o número de deriva^oes na estrutura de memoria por unidade de tempo. Uma memoria de alta resoluto R é capaz de manter informado sobre a seqüéncia de entrada em um nivel fino, cnquanle que uma memória de baixa rcsolu^ác pode fazer isso somonte cm um nivel muito mais grosseiro. Para um número fixo de deriva^oes, o produto da prefundidade de memoria pela resoluto da memoria é uma constante igual á ordem da memória p. Diferentes esqnlhas do núcleo geradorg (ff'J naturalmente resultam em diferentes valores para a profundidad? £) e resolu^áo /?, cómo ilustrado ñas duas cstruluras de memoria a seguir. Mcttiória de linha de atraso derivada. A Figura 13.3 mostra o di agrama cm bíneos da forma mais utilizada de memoria de curto prazo chamada de memoria de linha de atrasa derivada. Con- siste de p operadores de atraso unitário. cada unn caracterizado por G(z) = z-1. Isto ót o núcleo gerador ég(n) = fi(rr - I), onde &(?i) c o impulso unitario: ^P1 " = ° (13.6} |0, A resposla global ao impulso da linha de atraso derivada da Fig, 13.3 é g.(/j) = 5(n -p). Substituir este L¡^(n)na Eq. (13.5) produza profoiulidAdetUmcmária D=/j, quee razoávcl Liiluitlvamentc. Da Fig. 13.3 vemos que ha apenas uma derivado por unidade de lempo; com isso, R =• I. Assim, a
Hidden page
Hidden page
Hidden page
Hidden page
Unidades ocultos ¡ Umdndcs de saidü L'mdaduK ck triLlrada 16 fki? de mirado S unidades ocuILbf. c-ada unta íúncctada a ilhílis íta ñus de eiUrtLlu. - unidades de salda, cada unía conectada a liidaM Ulm kld:kw QCLikláK AtHMfl de Ipnpo-dv 1.13. A|MB df 'bvmpu de L2. J. 4.5 Cortes Lúinporais dci especcú^rama ibl FIGURAIS? {a* Uma rodo cujjos nourónios ocultos o nourtmos do saida sio repli- cados alravés do tempo. (b) RepreEantaQáo de rede neural de atrasos de tempo (TDNN}. (Ralirado de K.J. Lang e GE. Hinton. com permissáo) es seus estados ocultos; veja a nota 11 no Capítulo 11. Mullos sistemas híbridos de TDNN e HMM foram estudado1; na Literatura.1 13.4 REDES ALIMENTADAS A DI ANTE FOCADAS ATRASADAS NO TEMPO A útil i za^ío prototípica de uma rede neural estática (p.eJt.. perceptron de múltiplas camadas e a rede furif J-o lJu bsK radial) ó no tflruwnil pcuAifeF» O t/c patirik'a. ao contrario, requero processamenlo de padrees que evoluem no lempo, com a resposta em um instante particular de tempo dependendo nao apenas do valor presente da entrada, mas também de seus valores passados. A Figura 13.8 mostea o diagrama em blocos de um filtm ndo- linear bascado cm uma rede neural estática (Mozcr, 1994). A rede é estimulada atraves de uma memoria de curto prazo. Especifica mente, dado um sinal de entrada consistindo do valor presente jr(*r) c dep valores passados.rfn - 1-p) armazenadmí cm uma memória de linha de atraso de ordem por ejemplo, os parámetros livres da rede neural sáo ajustados para minimizar o erro médio quadrado entre a saida da nede,.i^?}T e a respusta desejada dí^). A estrutura da I ig. 13.8 pode ser imp(ementada ao nivel de um único neurona ou de uma redo de neurónios. Estes dois casos eslío ilustrados ñas Figuras 13.9 e 13. W, respectivamente.
FIGURA 13.8 Fillrq náD-linsar canstruidó cflrrt uma rada naural asiática FIGURA 13.9 Filtro rwural tacado Para simplificara aprésentelo, utilizamos unta memoria de linha de atraso derivada como a estru- tura de memória de curto prazo ñas Figuras 13.9 e 13,10, Clanunente, untas as figuras pederíam ser generalizadas utilizando-se uma unidade com fintfáo de transferencia G(z) no lugar de z ’. A unidade de pfwessafnentü temporal da Fig. 13.9 é composta de uma memória de linha de atraso derivada com suas derivares conectadas ás sinapses de um neurónio. A memória de Linha de atraso derivada captura a informaban temporal contula no sinal de entrada e o neurónio insereesta infbnnafáo cmscus próprios pesos sináplicos. A un idade de processamento da Fig. 13.9 é chamada de /r/rm neural focado,, focado no sentido de que a estrutura inteira da memória e localizada no temíLiiíil de entrada da unidad?. A saída do filtro, em resposia á entrada e aos seus valores passados .v(;r - i).r(.n - p), é dada por .V, (n) = <p -¡) + h¡ M-3 f
Entrada E> - j(n -1) 2. f{rt - p) Saida y(") Xn - Z) FIGURA 13.10 Rede neural alimentada adianto focada atrasada no lempo (TLFN focada): os niuei» (fe bias forarn omitidos por conveniencia de representado onde (p(0 é a fun^Bo de ativa^Bo do neurónio y, os tul/) sao seus pesos sinópticos e b. é o bias. Note que a entrada para a fon^ao de ativa^ao consiste de um bias mais a convolu^ao das seqúen cías de amostras de entrada e pesos sinópticos do neurónio. Vol lando-nos a seguir para a Fig. 13,10, referida como uma rede alimentada odiante focada atrasada no tempo (TLFN focada,time faggedfeedforward network), temos aquí um filtro nao-! inear mais poderoso» consistindo de urna memoria de linha de atraso derivada de ordem p c um perceptron de múltiplas camadas. Para (reinar o filtro, pedemos útil i zar o algoritmo de retropropaga^io padrao descrito no Capítulo 4. No tempo n, o "padrao temporal'' aplicado ó camada de entrada da rede é o velor sinal x(/r) = (x(n), - ।)....- p) ]r que pode ser visto como uma describo do estado do filtro nóo-linear no tempo n. Uma época consiste de uma seqiténcia de estados (padróes), cujo número é determinado pela ordem da memó- ria p c o tamanho j¥ da amostra de ireinamcrUOr A salda do filtro náo-linear, assummdo que o perceptron de múltiplas camadas tem uma única camada oculta como mostrado na Fig. 13. 10, c dada por " A-P \ k r=<i } (13.12)
Hidden page
PRDCLSAaMEMTO TEMPORAL Uri1.tZAN]X> RH>Hí ALIMENTADAS ADrANTE 697 figura 1a.11 Rabilado de estporimenio «iTipuiMíortat softra previsto de um pesw. (a) Suparposi^fiodas termas de onda real (continua) e prevista (Uace|ada). (b) Forma de onda do erro de previsto Banco de núcleos de caivolufío (ñlirrts Ilttk- rJo-ltlKHT Hlálúa FIGURA 1315 Eetmtyre genérica para o teorema do mspeam&nlD miope uniwrsal Por invariante a destacamento*' consideramos: sej(n) é a saída do mapa devido a urna entrada x(n), entac a saída do mapa devido á entrada deslocada - h( j éjpfn - iQ onde O deslocamenlc temporal é um inteirO. Em Sandber% e Xu (1997b), £ uinda mostrado que para qualqucr mapa por memoria com decaimenu) uniforme, de variável única* invariante a deslocamcntos e causal* existo uma me- mória gama e uma rede neural estática, cuja combinado aproxima o mapa uniformemente e arbi- tranamcnic bem.
Podemos agora forma]meóle formulare teorema do mapeamenfo miope universal' como se- gué (Sandberg e Xu, 1997a, 1997b): Quitlquer mapa dinámico miope invariante a destacamentos. pode ser unifonnementc aproximado arbitrariamente bem par uma cstmlura cnnyisiindo de dais hincos- luncionais: um banco de fillrus lineares alimentando urna rede neural estática. A estrutura incorporada neset teorema pode tomar a forma de uma TLFN focada. Deve-se notar tambem que este teorema é válido quando osabais de entrada e de saída sao fundes de um número finito de variáveis como no processamento de imagens» por exeimplo. 0 teorema do mapeamento miope universal tem aplicantes prát i cas profundas. Ele nao apenas fomece fl jUfft i fi cativa matemática paran NETtalk c sua possívcl ex ten sao atraves de uma memória gama, mas tambem eslabekce a estrutura para □ pr ojete de modeles mais elaborados de procesaos dinámicos nao-lineares. As convolucdes múltiplas no termina! de entrada da estrutura na Fig. 13.12 podem ser impl ementadas utilizándose filtros lineares com resposta a impulso de dura^áo finita (FIR./mjft’-í/^rdjtfofl impulse responsé) ou com resposta a impulso de dura^áo ir.finita (IIR, infinite- durati&n impulse responve), No caso da rede neural estática, ela pode ser implementada usando-se um perceptron de múltiplas camadas, uma rede de fun^áo de base radial ou uma máquina de vetor de suporte (reinada pelos algoritmos descritos nos Capítulos 4» 5 e 6. Em oufras palavras, podemos naturalmente nos bascar no material apresentado naqueles capítulos sobre aprendizagem supervisi- onada para construir filtros nao-lineares ou modelos de processos dinámicos náo-llneares. Mais importante que isso, a estrutura da Fig. 13.12 é ineiwitemeNtc e&távef, desde que os filtros lineares sejam oles mesmos estáveis. Temos assim uma clara separarán de papéis cm rclafáo a como consi- derar a memória de curto prazo e a náo-lin earidade sem memória. 13,7 MODELOS ESIRAQO-TEMPORAIS DE UM NEURÓNIO 0 filtro neural locado da Fig. 13.9 tem uma interessante inLurprctaqáo como descrito a seguir A combinu^áo de elementos de atraso uni¡tário e pesos sinápticos disociados pode ser vista como um filtro de respaata a impulso de durazno finita (FIR} de ordem como mostrado na Fig. 13.13a; o filtro FIR é um dos blocos construidos básicos em processamento digital de sinal (Oppenheim e Schafcr, 1989: Haykin c Van Vccn, 1998). Conscqücntcmcntc, o filtro neural focado da Fig. 13.9 é, na rcalidadc. um filtro FIR n3o-1inearh como mostrado na Fig. ]3.13b. Podemos nos bascar nesta representa^Bo e com isso estender o poder de processamento do neurónio em um sentido espacial atraves do uso de entradas múltipias, jwh cm número» comu mostrado na Fig. 13.14. O modele espado-temporal da Fig. 13.14c referido como um filtro neurai de mtdiiptax entradas, Ainda um outro modo de dcscrcvcr n modelo da Fig. 13.14 é imaginá-lo como um filtro neural distribuido, no sentido de que a a^áo de filtragem está distribuida atraves de pernios diferentes no espado. A caracteriía^áo espado-temporal do modelo ó representada con» segue; * (} neurónio tem jrrH sinapses "primárias '. cada uma consistindoi de um filtro linear de tempo discreto implementada na ferina de um filtro l1’IR de ordcin p; as sinapses primarias Sáo responsáveis pela dimensáo espacial do processamento de sinal. • Cada sinapse primaria tem (p +• l) sinapses "’-e/iindárias11 que sao conectadas á sua respec- tiva entrada c ás dcriva^ocs de memória de seu filtro FIR, sendo com isso responsavel pela dimensáo temporal do processamento de sinal-
Hidden page
Hidden page
Hidden page
Hidden page
Góes do conjunto completo das stnapses representadas neste modelo (i.e., somando sobre o índi- ce 0» nós podemos descrever a saida j4n) do neurónio j pelo seguínte par de equapócs: + h> = X *í M«>+ bj 1=1 1=1 (13.23) (□24) onde v (rt) representa o campo local induzido do neurónioj\ b c o bias aplicado externamente e (pv) representa a fontfo de ati^So náo-linear do neurónio, Assume-se que a mesma forma de nio- lincaridadc é usada para todos os neurónios da rede. Note que se O vetor de pews w c o vetor de estado \(w) forem substituidos pelos escalares n e .t, respectivamente, e se, correspondentcmcntc, a operario produto intemo for substituida pela multiplicado ordinaria, o modelo dinámico de um neurónio descrito ñas Eqs. (13-23) e (13 24) se reduz ao modelo estáheo do perceptron de múltiplas camadas ordiiiúrio descrito no Capítulo 4, 13.9 ALGORITMO DE RETROPROPAGAQÁO TEMPORAL Para treinar uma rede TLFN distribuida, necessiíamos de um algoritmo de aprendizagem supervisi- onada pelo qual a resposia real da cada neurónio na camada de saída é comparada com unta resposia desejada (alvo) a cada instante de tempo. Assuma que o neurónio j se encontra na camada de saída com a sua resposta real representada porrúi) c que a resposta desejada para este neurónio seja representada por í/VrX sendo ambas medidas no tempo n. Podemos cntáo definir um valwinstantá- nea para a soma dos erres quadrados produxidos pela rede como: 2 f {13.25) onde o índice / se refere a um neurónio na camada de saida apenas c e (n) c o sinal de erro definido por tfo*) = - vjn) (J3J6) O objetivo é minimizar uma fuñado de custo, definida como o valor G(/í) computado para todos os tempos; n (13.27) O algoritmo que temos em mente para computar uma estimativa do vetor de pesos étimo que alcan- za este objetivo ó bascado cm urna aproxima^So do método da descida mais íngreme. Um modo óbv» de prosseguir com este desenvolví mente é diferenciar a funfáo de custo da Eq. (13.27) cm relajo ao vetor de pesos e com isso escrever (13.28)
Hidden page
r-^---“ *=(«} (13.31) onde x/.n) é o vetor de entrada aplicado a sinapse i do neurónio j. A km disso, podemos definir o gradiente local para o neurónio/ como fiy(n) = - dv/n) (13.32) Conseqüentemente, podemos rescrever a Eq. (13 30) na forma familiar w (n + 1) = wA(n) + qfi (n)x(ff) (1333) Como na derivado do algoritmo de retropropagatfo padreo descrito no Capitulo 4, a forma explí- cita do gradiente local $f(/i) depende se o neurónio j está na camada de saida ou na camada oculta da rede. CASO 1. O neurónio/ c uma unidade de saida Para a camada de saida, temos simplesmente 6/n) = - 3^, ¿Fé(ff) (1334) onde£ 00 é o sinal de erro medido na saida do neurónio/ e ) é a derivada da fun?áo de ativa^io ip(-) em relajo ao seu argumento. CASO 2.0 neurónio/1 uma unidade oculta Para o neurónio / localizado em uma camada oculta, definimos ¿’i como o conjunto de todos os neurónios cujas entradas sáo alimentadas pelo neurónio/ de uma maneira para frente. Considere que v/n) represente o campo local induzido do neurónio r que pertence ao conjunto jí. Podemos entilo escrever 5?0r) = - (13.35) y y (^iaui ¿4 i onde Utilizamos O índice Arrio lugar de ra niquelas posicocs que sao de particular intcrcssc. Utilizan- do a definifáo da Eq. (1332) (com o índice r no lugar de/} na Eq, (13.35), podemos entilo escrever
Hidden page
Hidden page
MeurónLoE r mi conjunto ?J FIGURA 13,17 Fteiropropag&Gáo de gradientes locáis através de uma TLFN dislnbuida obtida utilizando-sc o método do gradiente instantáneo, Enlodante, estas discrepancias sáo normal- mente mínimas, Para um parámetro da taxa de aprendizagem n pequeño, as di lerendas entre as características de aprendizagem desfes dois algoritmos sáo despreziveis para todos os Í1ns práticos. Restribes de Causal i dade Uin ex a me cuidadoso da Eq. (13-42) revela que a computado de S hi) c naa-cinwií porque re- quer conhecimento de valores fui uros dos 6s e dos ws. Para tomar esta computarán causal, nota- mos priiineiramcnEe que a referencia temporal exata usada para a adaptaban nao c importante. Além disso, as estruturas sináptlcas empregadas na rede sáo todas filtros FIR. Conseqüenlemen- te, a causal i dade requero uso de armazenamento adicional para guardar estados intemos da rede. No que segué, requeremos que a adaptado de lodos os vetores de peso seja baseada apenas nos valores correntc tpassados dos sinaís de erro. Podemos com isso imedlatamente estabelcccr6 (ff) para o neurónio j na camada de saida e assim adaptaros pesos do filtro sináptico nesla camada. Para a próxima camada anterior (i.e., uma camada oculta anterior á camada de saida), as restri- fñes do causalidade implicara que, para o neurónio / Desta camada, a computado do gradiente local 5.(« - p) -~ P))X rUt (IJ.4/J é haseada apenas nos valores torrente e passados do velor A; isto é, AH[5(j¡-p), 6r(n t I -p). (13.46)
Hidden page
* A propagado retrógrada dos fis permanece simétrica em relagSo ;i propagare di reta dos estados. * A ordem dos cálculos é linear em reía? áo ao número de pesos sinápticos da rede como na abordagem do gradiente instantáneo. A TLFN distribuida é naturalmente urna estrutura mais elaborada que a TLFN focada descrita na Sentía 13.4. Além dissoT o algoritmo de rctropropagííáo temporal necessárxi para treinar a TLFN distribuida c computacionalmente tnats costoso que o algoritmo de retropropaga^áo padráo que é adequado para tremar a TLFN focada. Na análisc final, a cscolha de urna ou de outra destas duas abordagens ó determinada pelo lato de a tarefa de processamento temporal que precisa ser solucio- nada ser rel&liva um ambiente estacionario ou a um ambiente nao-estacionario.1 13.10 RESUMO E DISCUSSAO A necessidade de processamento temporal surge em em umerosas aplicantes que incluem as se- guí ntes: * PtiSir'i.wo e modefagem de series temperáis (Box c Jcnkins, 1976; Hay km, 1996) • Cattceíamenio de ruido, cm que o objetivo c usar um sensor primári o (fomcccndc um sinal desejado contaminado com ruido) e um sensor de re Ter ene la (tornee en do uma versio correlacionada do ruido) para cancelar o efeitodo mido (Widrow e Stearns, 19$5; Haykin, 1996) • Eíftialtea^iia adaptativa de u m cana l de comu nica¡?áo dcsconbcc ido (Proaki s, 1989; Hayki n, 1996) * Controle adaptalivo (Narcndra c Anuaswamy, 19 59) • identificando de sixtemu» (Ljung, |9R7i Já temos leorias hem-desenvolvidas para resolver estes problemas quando o sistema sob estudo ou O mecanismo físico subyacente de intcrcsscc linear; veja Mlivros citados acima. Entretanto, quan- do o sistema ou o mecanismo físico for náo-linear, temos uma tarefa mais difícil em nossas máos. É oestas situantes que as redes neuritis tem o potencial de fomecer uma soluto viável e com isso fazer uma di fe re no a significativa na sua api ¡cacao. No cocne^tc das redes neurais^ remos duas redes candi datas para o processamento temporal: • As tvdt'x tifimeniadas adiattíe atrasadas uta femptt • As tvdes tví'anvnte-a Nos próximos dois capítulos sáo discutidas as redes recorrentes. Neste capitulo, descrevcmcs duas classes de redes alimentadas adiantc atrasadas no tempo (TLFNs): a focada c a distribuida, Em urna TLFN focada, a memória de curto prazo está localizada inteiramente no terminal frontal de uma rede estática, o que a loma simples de prnjetar. O treinamento da TLFN focada é realizado utilizan* do-se o algoritmo de retropropagacáo padráo, assumindo que um perceptron de múltiplas camadas seji¿ uti Iizado pana implementar a rede neural estática. No leorvnia do mapeamento mwpe universal de Sandberg c Xu (1997a, 1997b), temos um teorema de existencia no sentido de que fomece a jusliiicativa matemática para a aproximado de um mapa miope arbinario (i.ühl um mapa causal com memória com decaimenco uniforme) utilizando um cncadeamento de dot'i blocos funcionáis:
um banco de filtros lineares e uma rede neural estática. Uma estrutura assim pode ser implementada utilizándose a TLFN focada, fomecendo com isso uma realizare física deste teorema. A outra classe de TLFNs, isto c+ as TLFNs distribuidas, se bastí am no uso de um modele espado-temporal de um neurónio, no caso, um filtro neural de múltiplas entradas. Este modelo utiliza filtros de resposta a impulso de durarlo finita (HR) como filtros sinápticos. Como tal, o filtro neural de múltiplas entradas fomecc um bloco funcional poderoso a seu modo particular para o processamento espado-temporal de sinal, construido em tomo de um único neurónio. Para treiná- k\ podemos utilizar o algoritmo do mínimo quadrado médio (LMS) descrito no Capitulo 3. Entre- unto, para treinar uma TLFN distribuida, precisamos de um algoritmo de aprendizagem elaborado exernplificado pelo algoritmo de retropropaga^áo temporal descrito na Se?£o 13,9. Uma caracterís- tica distintiva das TLFNs distribuidas é o modo pelo qual a representado implícita do tempo é distribuida par toda a rede, advindo daí a hábil idade de 1 idar cora ambientes náo-estacionários (i.ct, variáveis no tempo). Em uma TLFN focada^ ao contrário, a representa^i implícita do tempot por deñniqaO', está concentrada no terminal frontal da rede, o que, púrtanto, limita 0 seu USO práti.CO para ambientes estacionários {i.e., invariantes no tempo). NOTAS E REFERÉNCIAS 1. Para uma diwussSo sobre o papel do tempo no process^menio neural, veja o artigo cítal- os intitulado "Fioding Stnicturc in TimcH, de Elman (1990), 2. Em Hopfield (1995), é descrito um método para a representado explícita do tempo no processamento neural. Em particular, a infonna^Sa analógica ó representada utilizándole a marcad* de tempo dos potenciáis de af3o em relajo i um padrao de alividade coletrvo oscilatório progresivo, para o qual ú citada e^idéncia neurobii. ilógica; as potencia i s de a^Sa sao descritos no Capitula 1. 3+ Para uma revisia das estruturas de memória de curto prazo e seu papel no processamento temporal, veja Mozcr (1994), 4. Para uma di$£U5s3o sobre sistemas híbridos de TDNN e HMM para o rcconhecimento de voz, veja Bourlard e Moigan (1994), Kalagiri c McDcnnott (1996) c Bengiq (1996). ALguns híbridos de TDNN-HMM combinara o uso de uma TDNN codificadora de quadros (i.e., mapcnndo um “delctor dr atributos acéticos11 em um “código fonético”) e um HMM roteadorde palavras/sentcn^as (¡A, mapeando "símbolos fonéticos" cm "das- ses de palavras/sentenfas'1), onde o codificador e a toteador sdo projelados separadamen- te. Em alguns híbridas TDNN-HMM avanzados, a runcho de penda de erro quadrado para o sislcma inteiroé usada de modo que uma perda relativa j coniagem de envs de palavras/ senlcn^as pode ser minimizada. Um exemplo dcslc último esquema t a TDNN de múlti- plos estados descrita em HalTner et al. (1991) e Hafíher (1994). Um híbrido simples de módulos projetadas scparadamcnlc causa frcqücntemcnlc um dcsc&samcnto entre as de* sempenlios de treinamento e de leste do sistema. A TDNN de múltiplas estados tem me- lhor desempenho neste quesito. Em um sentido fundamenta], ;ls redes recurrentes (discutidas no Capitulo 15) tem uma capacidad^ maior para modelar a estrutura temporal de sinais de voz que as redes '‘replicantes'* como a TDNN. Entretanto, como os sinais de voz sáa significativamente náo-estacionários e nSa-linesre^ mesmo as redes necoirentes podem por si só ráo ser suficientes para o roconhccimcnto preciso de voz, S, Para uma discussío sobre as arigens do teorema do mapeamenta miope universal, veja Sandberg(l99l). 6, Para uma derivado diagramática alternativa do algoritmo de netruprapagacSo temporal, veja Wan a Beaufays (1996).
7, Em Wan (I 994), o algoritmo de reltciprnpagaQio temporal fo.i usado para realzar prev ¡sao hlo-Lmear sobre uma serie temporal náo-cstacionária cxibindo pulseóos caóticas de um láser de NH,. E-sia serie temporal particular fez parte da Competicáo de Séries Temperáis do Santa Fe Instituto que acontecen nos Estados Unidos cm 1992. A solüflo de Watt para esta tarefa de proccssamento temporal vencen ;i competicio entre uma lista diversa de snbrmssfes que iiicluiam redes neurais reconcntcs c nao-recorrentcs padrao, bem como mu i tas técnicas lineares tradicional s (Win, 1994). O caos é discutido no Capitulo 14, PROBLEMAS Redes alimentadas adianto focadas atrasadas no tempo (TLFH&) 13,1 Resuma os principáis atribuios de uma TLFN focada usada para modelar um procedo dinámico nio-linear. 13,2 ATLFN focada representada na Fig. 13. IQutiliza uma cncmória de linha de atraso deriva- da para implemcntar uma memória de curio prazo. Quais sáo os beneficios e deleites de uma TLFN focada que utiliza uma memoria gama para implementar a memoria de curto prazo? 113 No Capitulo 2, descrecemos qual ¡tal ivameme uma abordagem dinámica para imptemcntar um llllro adaptalivo náo-linear. O método envolve o uso de uma rede neural estática cuja e^iimula^áo provécti da alimentario dos dados de entrada através de uma ¡únela deslizante. A júnela ¿movida na chcgnda de cada nova amostra de dados, com a amostra arrti.iia dentro da janela sendo descartada para dar lugar á nova amostra. Discuta como uma TLFN focada pode ser utilizada para implementar esta forma de aprendizagem COntinui. Modelos espa^o-tem porais de um neurónio 13.4 Considere um filtro neural cu o campo local induzido tílr) ¿ definido pela Eq. (13.16). Suponha que a funcáo temporal A (f) fiesta equacío seja substituida pelo impulso imiiário deslcicadu tyn-(5-T) onde r é um atraso üxo. Descreva o modo pelo qual o 11 lira neural é modificado por esta substituido. 13.5 Usando o algoritmo LMS. formule um algoritmo de aprendizagem para o filtro neural de múltiplas entradas da Fig. 13.14. Retropropagacao temporal 13.6 A Figura 1' 13.6 ilustra o uso de umajowífl de rempo tteformagataaiariú como um método para o processamento temporal (Bodenhausen e Wai’nel. 1991). A jarcia do tempo assocíada com a sinapse i do neunmifr / ¿ representada por B(ij, 1 . O i. onde t. ea sáo medidas de mrtLta de lempa c ínj^uríT das janclas, respectivamente, como mostrado por Com isso, a saldado neurónio./¿modelada como
Hidden page
tes nao-lineares de ordem crescente. Em gcral, a estudio dos aiefioeflte* de Val térra é considerada difícil, principalmente por causa de sua relajo nao-linear com os dados, Neste problema, consideramos a cxcmplo simples r(n} i (ír) + |htrr - I — 2) A serie temporal (cm méd i a zero, é nío-cot rcLi iionada e. portante, tem um espectro bran- ca. Entretanto, as amostras da serie temporal nao sao independentes entre tí, e perianto poderse construir um pre^ ¡sor de ordem mais elevada. A variáncii da saida do modelo é dada por o? = a' + P:a? onde c a van ánc i n do ruido branca. (n) Construa um perceptron de múltiplas camadas com uma camada de entrada de 6 nós, uma camada oculta de 16 neurónios c um único neurónio de studa- Uma memória de linha de atraso derivada é usada para alimentar a camada de entrada da rede. Qs neurónios ocultos usam fun^óes de af.vavao sigmóides limitadas ao intervalo [0, I], ettquanro que o neurónio de saida opera como um combinador linear. A rede é trema- da com o algoritmo de rctropropaga^áci padreo tendn a seguinte descri?ao; Parametrn da laxa de aprendizagem r ~ Ü?DO! Constante de momento a = 0,6 N únten.) total de amostras procesadas 100.000 Número de amostras por época 1.000 Número total de épocas 100 A Vlri&ncia do ruido braneo cr- í ¡cita igual á un idade. Assini, com b - 0,5, constata- mos que a variáncia do saida do provisor c C* “ L25. Calcule a curva de aprendizagem do previsor náo-linear, com a variáncia da saida do previsor .r( rr) trabada COflW um a fundan il r n únten» de ¿pocas de amostres de Trci- namcnlo até 200 ¿pocas. Para a preparado de cada ¿poca utilizada para realizar o i™ mámente, explore os Kfuinla dois modos (i) A ordenado temporal da amostra de treinarnento ¿ mantida de uma época para a seguinte chatamente da mesma torna como c gerada. (¡i) A ardena^ai» da amostra de Cremamente é tomada aleatória de um púdran (estado) para um outro. Além disso, uliliz# a valida^ño cruzada (descrita no Capitulo 4) com um conjunto de vali- dafáo de IW) amostres pare monitorar o comportamCTilo de aprendizagem do previsor, (b) Repita o experimento utilizando o algor Ltnio LMS projetado para realizar uma predi- qzajti sobre Uma entrada de seis amostras. t) paramelro da taxa de aprendizagem do algoritmo c ajustado para f] - 10’’. (c) Repita o experimento inteiio para P L, 2, e en tari para p¡ 2. ítJ “ 5- Os resultados de cada experimento devem revelar que imc-llmcntc O algoritmo de retropropaga^in c o algoritmo l-MS seguem csscnciaImente um caminho similar, e entao o jlgontmo de retroprop^g^áo continua a mclhorar, finalmente produzlndo tuna previ>¡ao de variáncia próxima ao valor prescrito de a!.
Hidden page
1 inri', tados (RrnganT 1985). O criterio de estábil idade BIBO c bem adequadu para um si sienta diná- mico linear. Entretanto, c inútil aplicado as redes ncurais penque todos estes sistemas dinámicos nao'lineares sao «táveís pelo ctitérió BIBO de v ido á saturado da náo-lineai idade incorporada na confititui-(j5o de um neurónio. Quando Talamos de estábil idade no contexto de um sistema dinámico liño-linear, normalmen- te pensamos cm esfahiiidade no sentido de Lyopanov. Em uma célebre di ¿seriado datada de 1892, Lyapunov (um matemático e erigen heirci russo) apresentou os conceitas fundamentáis da teoría da estábilidade conhecida como o método direto de Lyapunov.' Esto método c largamente utilizado para análise da estábilidade de sistemas lineares e nio-lineares, tanto invariantes no tempo como variantes no lempo. Como tal, é d ¡netamente aplica ve] á análise da estábil idade de redes ncurais. De falo, muito do material apresenlado neste capítulo diz respeito ao método direto de Lyapunov. En- tretanto, a sua aplicado nao c uma tarefa fácil. O estudo da neurodinámica pode seguir um entre dois cam inhos, dependendo da aplicaban de interesse: * A neurodinámira determinístíca^ na qual o modelo de rede neural tem um enmportamento determi Dístico. Emtermos matemáticos» ¿descrita porum conjunto de equa^óesdiferenci- áis nao-lineares que deíinem a evolu^áo exala do modele como uma fuñado do tempo (Grossberg, 1967; Cohén e Grossberg, 1983; Hopfíeld, 1984). • A neurodinámica esfatistica, na qual o modelo de rede neural c perturbado pela presenta de ruido. Neste cajio, devemos lidar com equa^iies diferenciáis nao-lineares es tocón ticas, cx- pressando assim a solufáo cm termos probabilisticos (Amari el al., 1972; Pcrelto» 1984; Amari, 1990). A combinante de náo-'hnearidadecom tratamento estocástfco torna o assun- to mais difícil de tratar. Neste capitule, restringimn-nos á neurodlnámica determi Dística. Organizado do Capitulo Neste capítulo,o material está organizado em tres partes. Na primcira parte do capítulo, consistmdc das Seríes 14.2 a 14.6, fomecemosum material introdulório. A Sepilo 14.2 introduzalguns cancel- toa fiiodamentais sobre sistemas dinámicos, seguidos por uma discussao da cstabiliidade de pontos de equilibrio» na Sc^ao 14.3, Na Seqao 14.4, descrevemos vários tipos de atratares que surgem no estudo de sistemas dinámicos. Na Se^áo 14.5, rcx ¡sitamos o modelo aditivo deum neurónio que foi derivado no Capitulo 13. Na Sc^áo 14.6, discutimos a manipulado de atratores como um paradigma de redes neurais. A segunda parte do capítulo, consistindo das Se^óes 14.7 a 14.11, traía das memorias a&sociativas. A Se^áo 14,7 é devotada a uma discussao dctalhada dos modelos de Hopfíeld e do uso de modelos de Hopfíeld discretos como uma memoria enderclavel por conteúdo. A Se^áo 14.8 apresenta um experimento computacinnal sobre esla aplicante da rede de Hopfíeld. Na Sccao 14.9, apreveníamos o teorema de Cohcn-Grossberg para sistemas dinámicos náo-lineares que incluí a rede de Hopfíeld c outras memorias associativas como casos especiáis. Na Semita 14.10» deseneve- mos um outro modelo neurodinámicci conhexido como o modelo do estado cerebral em uma eaixa que é bem adequado para a forrnapao de agrupamentos. A Sepilo 14,11 aprésenla um experimenta computacional sobre «le segundo modelo. A última parte do capítulo, consisliodo das Sorbes 14.12 até 14.14, traía do tópico sobre caos, A Seqáo 14.12 discute as características invariantes de um processo caótico, seguida na Secáo 14.13
por uma discusáAo do tópico da reconstruyo dinámica de um processo caótico» que é relacionado com o assimto da Setfo anterior. Na Se?áo 14.14, é apresentado um experimentó computacional sobre reconstruyo dinámica, O capitulo concluí com algumas considérameos fináis na Seqáo 14.15. 14 2 SISTEMAS DINÁMICOS A tim de prasseguirmes com o estudo da ncurodinámica, ncccssitamos de um ihen/c/ci matemático para descreyera dinámica de um sistema nao-linear, Um modelo naturalmente mullo adequade para este propósito é o modelo do espado de estados. De accrdo com este modele, pensamos em termos de um conjunto de wvtíwic de estado cujas valones (em um instante particular qualquer de tempo) sáo assumidos como contendo informado suficiente para prever a cvolu^áo futura do sistema. Suponha que.x|(í),.x,úL,,.,.x>(4 representen! as vari ¿veis de estado de um sistema dinámico náo- linear, onde o tempo continuo t é a wridw/ indepéndete e Vé a do sistema. Por convenien- cia de notadot estas variáveis de estado sao agrupadas cm um vetor A-por-1 i(f) chamado de vetar de estada do sistema. A dinámica de uma grande elasse de sistemas náo-lineares pode entáo ser especificada na forma de um sistema de equa^ñes diferenciáis de primeira ordem escrevendo-ae como segué: = j = ].2.....N (14.1) onde a funyo FY-) é, em gera i, uma funyo nác-linear de seu argumento. Podemos por este sistema de equafoes em uma forma compacta utilizando notacao vetorial» como mostrado por 4-3t(í)-F(i(f)) (14,2) al onde a ftin^áo nao-linear F tem valar vclonal. com cada um de scus elementos operando sobre um demento correspondente do velor de estado: i(/) = [*,(>}, x?(/)»...»x5(0]r (14.3) Diz-se que um sistema dinámico nao-lincar para o qual a funqáo vetorial F(i(/)) nao depende explí- citamente do tempo í. como na Eq. (14.2), énuronomo: caso ccntrib io, ele é ndo-autónwno.1 Iremos nos preocupar apenas com os sistemas autónomos. [ndcpcndcnlcmcntc da forma csala da funqao nao-linear F( )» o vetor de estado x(í) deve vari- ar com o tempo ft caso contrario» x(/) c constante c o sistema nao c mais dinámico. Podemos, ponanlo, definir formalmente um sistema dinámico como segué: (Att sistema dinámica é wm sis tema cuja estado varia com u lempo. Alcm disso» podemos pensar cm diidt como um vetor “velocidade", n3o no sentido físico mas em um sentido abstrato. Entáo, de acordo com a Eq. (14.2), podemos nos referir á fun^áo vetorial F(x) como um campo vetorial de vclocidade ou simplesmente como campa vetoriíd.
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
A presenta de ruido demanda o uso de um tratamento probabiiístico da atividade neural, adi- cionando um outro nivel de complcxidadc á análisc dos sistemas ncurodinámicos. Um tratamento dctalhado da dinámica cstocástica está fora do eseopo deste livro. O efeito do ruedo é, perianto, ignorado no material que segue. O Modele Aditivo Considere o modelo dinámico, sem ruido, de um neurónio mostrado na Fig. 14.7, cuja base mate- mática foi discutida no Capítulo 13. Em termos físicos, os pesos sinápticos wt|,represen- tara coflduftmcúu, c as entradas respectivas a\V) representan]/»teflcuzí$; Ár é o núme- ro de entradas. Estas entradas sáo aplicadas a umaJunpdo «c/j/íw de córreme caracterizada como segue: Fnirtadas sinópticas. "* X|(0 xa(0 Saida neural FIGURA 1<7 O modelo aditivo de um neurónio • Baixa resistencia de entrada • Gan ho de corrent e uni tari o • AI ta resi stetic ia de saida Ela atua como um nó ad itivo para as corremos de entrada. A corrente total fluíndo enr ztifefáó ao nó de entrada do elemento náo-linear (fun<’áodc aiiva<jao) na Fig. 14.7 c portanto > i-i onde o primeiro termo (súmatorio) se deve aos estímulos x^Z), agindo sobre os pesos sinápticos (condutáncias) w p w^.., w „ respectivamente, e o segundo termo se de ve á fonte de córtente / rcprcscniando um bias aplicado externamente. Considere que represente o campo local induzido na entrada da fundió de ativu^áo nao-linear <pf). Podemos entáü expressar a corrcntc total fluindo para Jbra do nó de entrada do elemento náo-l incar como segue:
p/0, r Aj//) /?, 1 dt onde o primeiro termo se deve á resistencia de fuga A ec segundo termo se deve á capacitancia de fuga C Da /cí' Jos cúrrenles de Kirchoff* sabemos que a corrcnte total entrando em qualquer nó de um circuito elétríco é zero Aplicando a lei das correntes de Kirúhoff ao nó de entrada da náo- Linearidade da Fig. 14.7t obtemos SwJ.-'1W+< í=l (14.14) O termo capacitivo CJv (/J/d1/ no lado esquerdo da Eq. (14.14) é o modo mais simples de acrescen- tar dinámica (memória) ao modelo de um neurónio. Dado o campo local induzido v^í), podemos determinar a saída do neurónio j utilizando a relajo náo-lincar x/i) = <XP/í)) (14,15) O modelo RCdescrito pela Eq. (14.14) é normalmente referido como o múdete aditíwt esta termi- nología é usada para discriminar o modelo dos modelos multiplicativos (ou de derivado) onde u „ c dependente de x. (Grossberg, 1982). Uma característica distintiva do modelo aditivo descrito pela Eq. (14.14) c que o sinal x.(r) aplicado ao neurónio/pela conejo com o neurónio / é uma fun^áo lentamente variável do tempo r. O modelo assim descrito constituí a base da neumdinámica dássica* Para prossegy irmost considere uma rede recórvenle consistindo da interiiga^ao de N neurónios, onde se as&ume que cada neurónio tem o mesmo modelo matemático descrito ñas Eqs. (14.14) e (14,15). Entilo, ignorando o tempo de atraso de propagado entre os neurónios, podemos definir a dinámica da rede pelo seguinte tJjímm efe prime/ra <Wem acc^Wcrs: 7 di R} (14.16) que tem a mesma forma matemática das equa^óes de estado (14.1) e que resulta de uma reordena^ao simples de termos na Eq. (14.14). Assume-se que a fun^áo de attvacSo q>(-) relacionando a saídaxp) do neurónioj com o seu campo local induzido v(/) c uma funcao continua c portanto diferenciáve!, Uma fuiiQáo de ativafíio normalmente utilizada ó a fun^&o logística )=---------- l + exX-i»P / = 12, .,„N (14.17) Uma condi^áo necessária para que os algoritmos de aprendizagem descritos ñas Sefóes 14,6 a 14.11 existam é que a rede recorriente descrita pelas Eqs. (14,15) e (14.16) possua pontos fixos (íe.t atratores pontuais).
Modelos Relacionados Para simplificar a cxposicáo, assumimos que a constante de tempo T “ /?C do neur&nio j na Eq. (14.16) seja a mesma para todo,/. Entilo, nortina lazando o tempo t em relapáo ao valor comum desta constante de lempo e normalizando os ir e í em rela^áo a A , podemos rcscrevcr □ modelo da Eq. (14.16) como segue: =-M'>+S W>»X'B+6. y - U-, * (14.18) onde também incorporamos a Eq. (14,15). A estrutura de atrator do sistema de equa?5es diferenci- áis n5o-lineares de primeira ordeno acopladas (14.18) c básicamente a mesma que aqucla de um modelo intimamente relacionado descrito por (Pineda» 1987): (14.19) No modelo aditivo descrito pela Eq. (14.18), os campos locáis tnduzidos t’iíf),..., t\V) dos neurónios individuáis const iuem o vetor de estado. Por outro lado, no modelo relacionado da Eq. (14.19), as saidas dos neurónios• j^/)* .x xjr) constituem o velor de estado. Estes deis modelos ncurudinámicos sáo na verdade relacionados entre si por uma transforma- do linear inversiva. Específicamente, multiplicando ambos os lados da Eq. (14.19) por u ... soman- do em relajo aj e entao substituindo □ transformarán i obtemos um modelo do tipo descrito pela Eq. (14.18) e assim constatamos que os termos de bias dos dois modelos s¿o relacionado; por 4 = J O ponto importante a notar aquí c que os resultados que dizcm respeito á cstahi kdade do modelo aditivo da Eq. (14.18) sáo aplicáveis ao modelo relativo á Eq. (14.19). A relajo intima entre os dois modelos ncurodinámicos descritos aquí c também ilustrada nos di¡igramas cm Hocos mostrados na Fig. 14.8. As partes a c b desta figura corrcspondem ás formula- qdes matricúle das HquaQóes (14,18) e (14.19), respectivamente; W e a matriz de pesos sináptico;, v(í) c o vetor dos campos locáis induzidos no tempo i e x(/) é o vetor de saidas neuronais no tempo f.A presenta do nealimMia^ao cm ambos os modelos c claramente visivel na Fig. 14.8. 14.6 MANIPULAQÁO DE ATRATORES COMO UM PARADIGMA DE REDE RECORREME Quando o número de neurónios, .V, é muito grande, o modelo neurodinátnico desuri lo pela Eq. (14.16) possui, excelo peto efeito do ruido, as propriedades gerais delineadas anteriormente na Secáo 14.5: muitos graos de liberdade, náo-lmcandadccdis^ipacao. Conseqüentemente, um mede
Hidden page
Hidden page
NhjbodnAníca 733 Para estudar a dinámica da rede de Hopficld, usamos o modelo neurodinámico descrito na Eq. (14.16), que é bascado no modelo aditivo de um neurónio- Reconhecendo que x/r) = podemos rescrever a Eq. (14.16) na forma J = 1 n (14.20) Para prosseguirmos com a discussao, fazemos as seguí ntes supo siróes:: 1, A matriz de pesos sinápticos é símé/y-jeo, Como mostrado por Ui = u;? para todo i eJ (14.21) 2. Cada neurónio tem uma ativa^So wo-Uwar particular - dai o uso de íf/-) na Eq. (14.20). 3. A inverso da fun^áo de ativa^ao nao-linear existe, e assim podemos escrever «=<p;'(.r) (14.22) Considere que a fun^o sigmónlle cp.(v) seja definida pela fun^áo tangente hiperbólica . x l- exp(-tf.v) x = ip.(t) = tanh ——í— \2J 1+eTtp(-uJu) (14.23) que tem uma inclinapao de a/2 na origem como mostrado por d _ íícjlj 2 ¿fe «.» (14.24) Daqui para frente^ nós nos referimos a a como o ganho do neurÓmo /. A relajo inversa de entrada-saída da Eq. (14.22) pode assim ser rescrita na forma v = <p/(r) = — log|-—1 at Al + KJ (14.25) A formajPdJran da relajo inversa de entrada-saída para um neurónio de ganho unitário é definida por <p-’(.i) =-- JogT-J—— \1 + jc ¡ (14.26) Podemos rescrever a Equa^ao (14.25) em termos desta relajo padráo como <P7'U) =—ip_| (x) ¿7 (14.27) A Figura 14.10a mostra um gráfico da náo-ltnearidade sigmóide padrao ipfvb e a Fig. 14.10b mos- tra o gráfico correspondente da náo-linearidadc inversa tp ‘(jc),
Hidden page
Hidden page
excetc cm um ponto fíxo (14.34) A Equa^ao (14.34) fomecc a base para o segu inte teorema: A f'nn¡,ui> fíi' tfWgiQ (de Lwipiinuv} E de uma nula ele ffopfieíd é ama fitn^da monatanamanle dacra*- eente do tempo Consecuentemente, a rede de Hopfíeld é global e assínt óticamente estavel; os pontos fixos atratores sao os mínimos da funcáo de cncrgix c vicc-vcrsa. Rela^áo entre as Estadas Estávels das Versees Discreta e Continua do Modelo de Hopfíeld A rede de Hopfíeld pode ser operada em um modo continuo ou em um modo discreto, dependendo de modelo adotado para descreyeres neurónios. O modo continuo de operacao é bascado em um modelo adi tivo, como descrito anteriormente. Por outro lado, o modo discreto de opera^&o ¿ basc- ado no modelo de McCulloch-l’itts. Podemos fácilmente cstabclcccr a rclafao entre os estados estóveis do modelo de Hopfíeld continuo e aqueles do modelo de I lopfieId discreto correspondente redefíninde a relajad de cntrada-saída para um neurónio tal que possamos satisfazer duas caracte- rísticas amplificadoras: 1. A Raída de um neununio tem cü valores assintóticos para ? = » para v - » (14.35) 2, Q ponto medio da funcáo de ativa^áo de um neurónio $c cncontra na origem, como mostrado por <PíO)-O (14.36) Conscqücnicmcn(cL podemos focar o bias 1 igual a zcro para lodo/ Na formulario da fonp3D de energía E para um modelo de Hopfíeld continuo, permile-se que os neurónios tenham auto-reaI intentares. Por outro lado, um modele de Hopfíeld discreto nao deve tcr auto-real imcnta^ocs. Podemos, perianto, simplificar a nossa discussao fazende w, =*0 para todo/ cm ambos os modelos. Com base nestasobservadnos, podemos redefínira fundan de energía deum modelo de Hopfíeld continuo dada na Eq. (14.28) como segue: i * v w । £ = -2SÍ”j.Ví + E4- ¿ J-l >1 j-l «. j u (14.37) A fiin^3o inversa <¡f ( t) é definida pela Eq. (14.27). Podemos assim rescrevera fun0o de energía da Eq, (14.37) como segué;
Hidden page
Hidden page
Hidden page
Com o modelo de Hopfield utilizando o neurónio formal de McCulloch e Pitts (1943) como a sua unidade básica de proceramente, cada um dcstcs neurónios tem dois estados determinados pelo nivel do campo local induzido agindo sobre ele. O estado “ligado" ou “disparando11 do neurónio i é representado pela saida x = +1, e o estado “desligado” ou “quiescente" é representado por x - —1. Para uma rede constituida de V neurónk>5* o ¿ufado da rede c aspira definido pelo vetor «-[jtpA..X,.]r Com x -11,0 estado do neurónio j representa um bit de informai?ao, c □ vetor de estado A’^por-1 x representa uma palavra binaria de Al bits de informado. O campo local induzido v do neurónioj é definido por Y i-l (14.40) onde £ é um bias fixo aplicado externamente ao Hurón»/ Assim, ú neurónioy modifica sen estado .y. de acorde com a regra deierministica +1 se Vj > 0 1-1 set'?<0 Esta relajan pode ser rescrita na forma compacta x. si nal [r] onde "sinal" ó a funeao sinal. O que acontece se r for exatamente zcrol Ncslc caso, a a^ao a ser realizada pode ser arbitraria, Por exemplo, podemos fazerx "±1 se v 0. Entretanto, usaremos a seguínte conven^ñoi se i¡? forzero, o neurónio /' permanece no estado anterior, independentemente se utiver ligado ou desligado. O significado desta suposifáo é que o diagrama de flux o resultante ó simétrico, como será ilustrado mais adíame. I l.i duas fases de operaban da rede de Hopfield discreta como uma memoria enderefável por contcúdo. a fase de armasen amento e a fase de recuperado, como aquí descrito. L Fase de Arnua&wtmettlo. Suponha que deseje iros armazenar uní conjunto de vetores de dimensionalidade .V(palavras biliarias), representado por | p = 1, ,A/}. Denominamos estes ,W velones como as memúrias fundamentáis, representando os padróes a screm memoriza- dos pela rede. Considere que ¿ f represente o t-csimo elemento da memoria fundamental onde a elasse 2,..., ,W. De acordo com a regra de armazenamenío da produto v.'tterno, isto c, a generalizadlo do postulado de aprendizagem de Hebb, o peso sináptico do neurónio / para o neurónio/ c definido por (14.41)
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
756 Redes Nfurae íimita^ütfile arnpiititde. Consistedcum conjunto de neurónios altamente i.nterl irados que realimcntam. a si próprios. Este modelo opera utilizando a rcalimcnlu^au positiva incorporada para ampliflcar um padráo de entrada até que lodos os neurónios no modelo sejam levados a saturare- Desta forma, o modelo BS B pode ser visto como um dispositivo para identificar categorías, pois, dado um pñdróo de entrada analógico, fbrnecc uma rcprcscntacao digital definida por um estado cstávcl do modelo. Considere que W represente uma nrafriz de pesos simétrica cujos maiores auto valores tcm componentes reais positivas. Considere que x(0) represente o vetar de estado iniciai do modelo, representando um padráo de ahva^áo de entrada. Assumindn que existam Ar neurónios no modelo, o vetor de estado do modelo tcm dimensao ,V. c a matriz de peses W ¿ uma matriz .V-por-Ai O algcri Lmo BSB ¿eolito totalmente definido pelo seguínte par de equafóes: y(w) = x(rt) + pWi{«) (14.63) sfr + l)-tp(yOO) (14.64) onde P é uma constante positiva pequeña chamada de fator de reaiimenta^aa c x(w) é o vetor de estado do modelo no tempo discreto í?, A Figura 14.12a mostra um diagrama cm blocos da combi- nafáo das Eqs. (14.63} e (14.64); o bloco rotulado como W representa uma rede ncural 1 incar com uma única camada, como mostrado na Fig. 14.21b. A funqáo de alivafáo <p é uma/wfl<í7o linear par partes que opera sobre y(n). a j-csima componente do vetor y(íi )n como segue (veja a Fig. 14.22): FISURA 14.21 (a) Diagrama em dimos do modelo tto estada cerebral em uma carra i BSB). ib) Gfb1d de fluxq de Sinal do associador linear representado pela matriz de pesos W
FIGURA 14,22 Fun^Ao de atlvacáo linea r por parles uliízñPa nO mr4ekj BSB se se-1 £>/„)£+] SC v;(if)<-l (14.65} A Equa^üo (14.65) restringe o vetor de estado do modelo BSB a se encontrar dentro de um cubo unitário de dimensionatidade N centrado na origem. Dessa forma, o algoritmo age como segue. Um padráo de alivaváo i(0) é apresentado na entrada do modelo BSB como um vetor de estado inicial, c a Eq. (14.63) c utilizada para calcular o vetor y (Ü). A Equa^ao (14.64) c cntáo usada para truncar y(0), oblendo-se o vetor de estado atual izado x(l). A seguir, Jt(l) é circulado através das Eqs. (14.63) e (14.64), obtendo-se com isso x(2). Este procedímento c repetido até o modelo BSB alcanzar um estado estove! representado per um vértice particular do hipercubo unitário. Intuitivamente, a r cali mentas So positiva no modelo BSB faz com que o vetor de estado inicial x(0) crespa em comprímento (norma) euclidiana com o aumento do número de iteraefies até ele atingir uma parede da caí xa (hipercubo unitário), deslizando entáo ao longo da parede C terminando cventualmcntc em um vértice estável dacaixa, onde sc mantém sendo “empurrado", mas nao pode sair da caixa (Kawamoto t Andcraon, 1985), viudo daí o nomc do modelo. A Fun^áo de Lyapunov do Modelo BSB O modelo BSB pode ser redefinido como um caso especial do modelo ncurodinámicn descrito na Eq. {14.16) como segue (Grossberg, 1990). Para constatamos isto, primeiro rescrevemcs a /-ésima componente do algoritmo BSB descrito pelas Eqs. (14.63) e (14.64) na forma
Hidden page
Hidden page
Hidden page
Hidden page
762 R±uti5 Neuxais Em um ambiente de vigilancia por radar, nao se conhccc apriori as desencóes detalhadas dos emlssores operando no ambiente. Típicamente, centenas de milhares de pulsos de radar sao reccbi- dos para o processamenio em fraudes de segundo. Assim nao há escuscz de dados; o desafio como encontrar sentido nos dados. O modelo BSB é capaz de ajudar aprendendo a estrutura de microondas do ambiente do radar através da sua propriedade incrente de formar agrúpamenos. Sáo formados agrupamcnlos cm lomo dos atracones ponluaís do modelo BSBfi.e., vértices estáveis do hipercubo unitario), com cada acrator pcntual representando um emissor particular. O modelo BSB pode assim identificar pulsos recebólos como sendo producidos por um emissor particular. 14.11 EXPERIMENTO COMPUTACIONAL II A Figura 14.25 apresenta os resultados de um experimento realizado sobre o modelo BSB contendí dois neurónios. A matriz de pesos dcs-por-düis W é definida por ' 0,035 -0,005 -0,005 0,035 que é simétrica, positivamente definida e que satisfaz a Eq. (14.75). As quatro partes diferentes da Fig, 14.23 corresponden! a quatro configuradles diferentes do estado inicial s{0), como segué; (a) k(0) = { OJ. 0¿r (h) MGJ-I-CU. 0,3]r íc} Mfi) ’ [ o,a. • o,4]r (d) i(0) *L 0,1 r As áreas sombreadas mostradas nesta figura sáo as quatro bacías de atraco que caraccerizam o modelo. A figura ilustra claramente que quando o estado inicial do modelo se encentra em uma bacia de atracáo particular, a dinámica Subjacenle do modelo Conduz a matriz de pesos W(n) com o aumento do número de iterapóes w, até que o estado da rede x(n) termine no atrafor puntual fixo (i.e., um vértice do quadrado dois-por-dois) pertcnccntc aqueta bac ¡a de atracáo. Um caso de parti- cular inleresse é a irajetóría mostrada naFig. 14.23d: a cnndl^So inicial x(0) se encentra no primeiro quadrantc, emboraatrajclória termine no vértice (+1, — I) no quartoquadrantcporque caí que está o alrator pontual relativo áquela bacia de atracáo. 14,12 ATRATORES ESTRANHOS E CAOS Até este ponto na nossa discussao sobre ncurodlnámlca, concentramos nossa alenfSo sobre o tipo de compartimiento exibido por sistemas dinámicos náo-lineancs caracterizados como atratores pon- : . s fixos. Nesta sc^aoT consideramos uma outra elasse de atratores chamados de atratores estra- nhofi que caracterizan! certas sistemas dinámicos nao-lineares de ordem maior que 2. Um atralor cstrariho exibe um comportamento caótico que é altamente complexo. O que toma o estudo de atratores estranhos e do caos particularmente interessante c o falo de que o sistema em questáo é tieí^rministia} no sentido de que sua eperafáo é govemada por regrasfixtut embora um sistema dcstcs com apenas poucos grausde kherdade possa exibirum comportamenEo táo compli- cado que parece ser aleatórío.
FIGU H A 14.23 Trailló*lac pan a &xpannwito eompulactónal sobra o modelo BSB; os resultados mostrados ñas partes (a) até (d) corraspondam a diferentes condados inida» De falo. a característica aleatoria é fundamenta! no sentido de que as eslatl sticas de segunda ordem de uma serie temporal caótica parce um indicar que ela é aleatória. Entretanto, diferentemente de um fenómeno realmente aleatorio, um sistema caótico pxibe um cnmpnrtamenia aleatória que nao de- saparece com a coleta de mais informado! Em principio, o componamcnto futuro de um sistema caótico é totalmente determinado pelo passado. mas na prática qualquer incerteza na escolha das condi^ócs iniciáis, nüo importa quáo pequeña scja, crcscc exponencial mente com o tempo. Conse- qíientemente, embora o comportamento dinámico de um sistema caótico seja previ sível a curto prazo, é impossivel se prever o campcrtamento a longo prazo do sistema. Urna sórie temporal caótica é, portantoT paradoxal no sentido de que a sua gera^ao é govemada por um sistema dinámico determinístico, mas tem uma aparé neta aleatória. É este atributo de um fenómeno caótico que foi originalmente enfatizado por Lorcnz com a descaberla de um atrator que leva seu neme (Lorení, 1963). Em um sistema dinámico náo-linear, diz-sc que o sistema possui um atrator estranho, e neste caso o sistema é chamado de caótica quando as órbitas em um atrator com condeces iniciáis na sua
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Hidden page
Alspqctor. I.. A. Jayakurnar, and S_ Luna, 1992. '"Exprr.menCaL evaluación oricaming in a fisura] fiñCrúEysiCrfi/1 rn i^irrrjJ J°Zwejy^i^ ^'.wiTt.sL vg|.4, pp.H7]-S78, San Mateo, CA: Morgan Kaufmann. A Ispéelo?. J., R. Mcir_ B. Yultfi, A. Jayakuinar., and D. Lippc. 1993. HA parallcl gradicnt desceñí mclW for |»rning in anaLug VLSI neural netmnkl* /uvu-tccj fri A'crira/ A^nMíftM Si-j-Jtflrj. v-ol. 5, pp.836-844. Su Mlteo, CA: Morgan Kaufmann. Amari, S., 199fl. "Natural ^radicnt wnrks cfticicnlly an Lraming."1 Afenra/Ccr?ipi^rj^"Lr/K Vül Wa pp’ '1 276. Amari, £., 1997. Privan? cnmmuncalion. Atoan. £., 1991, HA universal thcoirm on Lcaming cunes," A'frj^u/ .Vcftiorki. vol.6, pp.lói -1 b&. AimiÍtS-, 1990. HMathcmatiea] faundaions ot' neurocomput mg.’* rracwc/úrgKifjftr J£EE( VbL "?&L pp. 1443-1463. Arturo 5-, 19R7. '"DifTercntial gcíimciry ufa paramctric íamily oí invcrtahlc systcms-RicirLanLan melhcL dual affinc tonncuLiorii and divergen»,” iVdrtfflflíic^ Sr^cw.í Ííecuy vol.20, pp.53-í2P Aman. S-, 1985. Z>i,^círn/ra/-(jÍÉCTliíJraJuf Miflfedf ín fruJjyjjcs. Ni^York: Spriikgvp Verlas AniflrL S., 1983. HFidd thwry cf selt'-firgani7ing neural neis/' iEEk' Jraíi.wcnans m ír.Tfcjnr, Afcrn, úrhrnjtffíej% rol. SMC-i3.pp.9J 1-748 Aman, S_h 1980. "Tupti^raplik urganizaiiüfi of nene fteldli” Jhdfefiha c/Aft/r^c'rTicrríwí ™L ^2, pp.3 39*364. Aman, S.F L977é_ "Neural thcory ttf assixiatiwi and uuncrpL-rurmillieu? tfíflAflgfai/Crívrjrrn'cj. vul. 26^ pp. 175-185. Aman, S.. L977h. 'Dynamics ofpaticm formalion in latcral-inhibimn lypc neural ficUs,"1 Uiüíngjcaf Cvhenretícs. val. 27h pp.77*sr Amari, SH 1972. ,l€haracier¡sLi<t cí randúiib neti oí analog nwnm-lifce ekineíii^r ÍE£E ritmsíKift™ lmi Íi3/cr?iv. .Mcu?. ernu1 Ci'fiL'.rrjrrícs. voí SMO2. pp.6434557. Amari, S., 1967. **A rheury of adapte piittent dlss¡fi<Ts_lfl f££E IhMf. £ÍL<7™rk CanrprrJ'rrj. vul. EC-bó. pp.299-307. Amari, % and M.A. Arisib, 1977. “Compefii-m nnd coopcraLiun in neural neta," in J. Mrtzler, cd., Sl'jííwtj Atwraírí-LNretf. pp. 1L9-L65. New York: Academic Press. Amari, S_, and J.-F. Lardosa-, 1997. "Blind source scparatinn.-Smipara.TTiclri£ statiitical anfroach,” /££"£ Dun«uc:^újr.f rwi Síl’i'jlTj1 Pjwííijhj’. vdI.4S+ pp.1641-2700- Amari, S_. T-P. Chen. and A. Ciehoki, 1^7. "ülability arLalysisof Icamingalgonthiiis íbrhiind snurecscparatirm" vol. 10, pp. IJ45-1 ] 51. Amari. S.. A- Ckhflk. and H.H. Yanc;, 1996 ’A new Icaming al_gnri1hm for hl-ind s¡£h¡d KfHHÜM” jj? Ncírref Pmc'fíJÍni’5ysfer?i5_ val.E, ppk757-76J, Cambridge, MA: M1T Press. Aman, s., and K-. Maginu. L9fl.fi. ”Sta1 is.1 ¡cal ncu.mdynamicx ofhsamiarive tiicmory,1" .Vc^nJ iVrr'Lfi^'. vol L pp.63-73. Amari । SM K. Yosbidi.and K.-l. Kansiani, i 977. -’A mathcmaiical rmindatinn for statiHicaL ncurodynamicsh,15fílA/A|rjr™/ AfaíftfliMfíEl> vol,33. pp.OS'llfi. Amari. S., N. Mutua, K.-R MÜIIíí, M. Finkí.ind H. Yangh l^96a “SMütictl ihewy ofcwlnintag k cnuss-validation asymplülieaLLy üffitcttvt7“_4íAuñefi rn Afeunií A^rnrarfaji ^raccjjwg vq|. 8, pp_L76-182, Cambridge, MA: MlTFrw Anihiw-1 ngmon, J.. R. GmgerB and Cí. l.ynch» 1990. "Simulaiiníi of piloc-cortu perfonm ftiurartliial clusLenng-1' St rcKT-L'. wl.247, pp 1344-13^8. Amil. D -l. L9H9 .t^c^ng í'nj/n Fbrieridrtr 7S* Hbnltf t>/ A'ii'-irnTÍ iVí'fM.ünlw. Ns* York: Cambridge Univcrsily PTess. Aruislasio T.J., 1995. "VcilibuL-n-ócular rcflcx: Pfcrt'armancc and plasticily.'" En M.A_ Ariíih, cd.„ 7?jd« qfEwfr AmO'Atora!A'eriwrfa. Camhndgc, MA: ME E' Press. Anaslasio, T.J.. 1993. "Modeling vestíbulo-ocular reflex dyiLBmics: Fnom elassical indyfK m nturai MtWüridaH in F. Eeckman, ed., AfewwJ' 4 wi/tjú .IfbJffiqg. pp.4O7-4.30, Korwcll. MA: Kluwcr. Anutuiou T.J a 1991. L,A recurrent neural Mtwttk model of vdoctty storage in 1hc vestíbulo-ocular reilcx " rATww.c ín Alrurii/ /j^jmrfl/rcj^r ArMtiüÑfg Ívrícmj. vol.3, pptJÍ-JÍ, Su Mateo, CA: Morgan Kauímann. Anderson, J.A^ 1995. jl? .-Vcnaj/ .Vtfrunfkf. Cambridge. MA. M1T Pmíi Anderson, J.A.. 1993. "The BSElmodel: A simple nnnlmearauinaRSüciarive ncuraE nelwcirk.’' in itawtatfH Aíenwrfrr (M 1 lassoun. cd. 1 pp.77-lÜ3p Oxford: Oxford Univcrsity Press. AndkrscTkJ.A., 1988. "Ccnera' intreducLionCAfeiírarajflvwJft^jr ííjHÑcÁTfífltii (J,A- AndefWflUHÍ E RüsCnfiílki, cds.J, pp. xíii-xxl. Cambridge, MA: MIT Press. Andenson. J.A., I^R.l. "Co^nirivc ifld peycholü^ietl iXmlpuliiliun i^ilh ntural modi-ls.1'' f£E£ F^njcTríj'üur eur Afoid. izidJ Qrfwwffcj; vol. S-M( I ?, pp 799-815. Afldctscrk J.A L 1972 "A simple neural m.1wnrk gencratmg an Interactive memory," fifarefíncej. VUÍI4. pp.197-220. Andcrajn, J.A.. and (i.L Murphyh !9Rfi. Toncepls ¡n CHUKCtionist modelar ¡11 Ahmí /yr Cyr?rprjJj>rg. J.S. Dcnkcr. cd_, pp. 17-22, New York: American Ensíleme <ii'Physics Andrrsem, LA., and t. Rnsenfcld. cds.. I9fl8. J^unKWffpufí^g.1 EnirJFü'ujjíWh.f a/’rtr.w.tot7j. Csííihridgs, MA: MIT FYkís.
Andmum J.A., A. Pcllwnisz, and E. Roscnfcld, cds.h 1990a. 2. Djjtfcrjíww,/ór Cambridge. MA: MIT Prws, AnderwnJ.A., J.W. Silveratrin, S.A. Ritz,and R.S. Jones, 1977. "'Dislinctlvc fcalUTCs,categ1oricíl pcrceplion, and pcobabilily leaming: Same applicalions of a neural model,’1 ffevfw, vol,84, pp,413-451. AndtnsíwiJ.A., and J.F. Sullcm. 1995. "A rtctmnküFnctwmfcs: Computación and neurobLcIngy,"' Fffoi¿ríOfiArnrr??¿ M-rnur+j. VüL I, pp. 561 -568.. Andemo. J.A^ M.T Gaiely, F.A. Fenz. and D.R. C ol líos, 1990b. "Radar signal calegonzaron uhíu^ a neural ntíwork" FttMwdtagj flfrfcc /EEE. raL78a pp. I64fr-I65*t Andense T.W., 1984, Mfrodki^M i'í-1 Mu/JjL*ciricrJeSfa/j5/k'A/ Jua/rjú, 2nd exlition, New York: Wiley. Andreou, A.ü^ 1994. ’XDn physics! modclscf neural ccwnputalion and their analog VLSI implemertiaúün.r /7i?ccet/jj?gs a/ rAí 75W Ffonbftop m PZjvsdcs CorttpfcfdLÍcw?. 1 EEE Computer Soctety Press. pp.2S5’264, Los Alam¡los> CA. Andrcou, A.G., K.A. Roahen. P.O. Pouüqaeín, A Puavnk* RE. Jerikins, and K Slr-ohbchn, 1991. -'Currenl-mode KutHhrexhold MOS circuiis for analog VLSI neural s^slcms/1 fEEE rrfHwcKfiuw cw Ncwcd A'rfiiTurfo. wL 2, pp. 2Ü5-2L3. AndreftuuA. G. ,R. CrMeil7lerhK. SlTühbelbiksiiid K A.Bwihen. 1 W5.*fcAnalog VLSI Deunomorphic Imagc acquisitionand prc-proccssingsyitemi." .Ví’iiftrJ Mrhwrbj vq|.S, pp 1323-1347. Andreses, Ru and J. Diedericli, edL. 1996 Enictvr/írg* q/'fíe Jhr£ífrwtfm Jíbiu 7raüieJ XrryScícr/ .VeiFruí Afeftwfc (Juvenil? ofSusrex, Brighcun, UK. Ansaklis, P.J.B M. Lemmon» and J A- Stiver. 1996. "Liwirmng lu be auL-unomous,'’ Jn h£D. Ciupla and N.K. Sinha, cds., MrMfCffl1 CúírJmJ1 StafrW, pp.28-62, Ntfw Y<ii4c; IEEE- Ptvss. Ansari. N., and E. Hcu 1997. Jwft'ttfgtvRX'í^V^rrrdfiltMíh Nonvcll, MA: Kluwcr. Anthony. M., and N Biggs. 1992. CoflrpNftrn&Jui/ ¿nrrnrág TTwote Cambridge: Cambridge LFnivcrsily Press. Ainsaklls. P.J.. and K.M. Passine^eds., 1993.4n AifriNfactiajv to Hfeí/ígenf .4¿rfüPiíJtíc Cnunuí, Norwcllh MA: Khiwen Afbib, M A.. 1989. Fhr índ ediliun, Níw York: Wítey. Afbib, MA, 1987. Epítíím. MfrúAíttX cine/ríes. 2nd cdilien, New York: Springcr-Vcriag, Afbib, M A., ed. I99S. TStf JftwdbMtqfíhj^i TAran1 aire/A'íu/ct/Wenrertr. Cambridge, MA: MÍT Press. AmiwsimLhL D.IC.uand C.M. Place, 199Ü. .íñ ¿vfhvjú/jrfwLSys’Aw.f, Cambridge: Cambridge Ufl ¡verei Ly Press. Arlóla, A,, and W. Singcr. I9R7. Xng-tem poteflÜBtHHl md NMDA receptan in ral visual curie* ” A'a^rn?. voiJíO, pp.649-652. Ash, R..líp L965. ^¿nntfrroFJ TAcon', New York: Wi|eyr Ashby, W.R., L964J. Dcsjgjijhra ^rudFJ. 2nd edition, New York: W¡leyr Ashby, W.R., L952. Díijgji /ür¿r ¿raiFj, New York: Wiley. Aspray. W., and A. Burks, 1986. Ripeas n/ Jriíur i'-üfj Afevflipip! i ?jj Cm/mIÚV Cbfflpkfcr nrcon-1. Charles Babbagc JnslituCe Repnnr Senes for [he Hislory of Compuling, vq|J2 - Cambridge, MA: MIT Presó. ÁeLtooh, K.J.,andlJ. Me Avoy, L992. '“InlelLigenLcnjitmE An meniew and evaluación T In ffcrJNÍÍi wA o/Mleífrgcnf Cojrtrot D.A. While and D. A_ Sofgc, eds., New York: Van Nostrand RemiuiLd.. Albcrton, D.P.,1981. SrabJ'íirp Chichcscer, UK: Research Studies Press. Atick, J.J., 1992. "‘CouLd inromiatmn theory prmide an ceofogicnl rheoiy oFSíflwrv' Processing?'1 A'efnurJt.- CompiF/ff/j^n id .VciiniJ-"^SÍCflU, vflL.3, pp-213-251, AiickJJ.,and a.N. RcdJieh, 1992. ’^Tiac docs ihc retina kncw abom nmtfll seenesrjVírrrcr/Comprj^aífoH, toI .4, pp. L96-2I0. Al ¡ck, JJ-h and A.N. Redi icll, 1990. ^Tüwands a llieuTj- of e*riy viisua I procesa! ng? Vcjíra/ í awpjfforirur. vqI.2, pp.308- 3 20. Atick, J.J.* P.A. Grilfin, and A.N. Redhch, 1996. ^Slalislicil appruai."h Co shape from shading: Rccnnstruclfon of ihíwdimensitmal face wrftcs Frvin single iwodimcnsional images."'borraj Cflurpújtrrforj, vol. 8, pp.].12l-l34Or AtiymA^F^ 19R7, "l.úftriñn^uma general iiecsvicjTk/1 InA^tt//.'r1i,.:jir^JÉrj,Jtwr/JrucíWdÍJ?gSrsf™5_ £J.Z. Andcram,cd.,pp.22-30, New Yúricr Afuetean laaliLucc orPhytiEi. Aliya.A.F.. andYS. Abu-Mcutlfii. l9S3._tAn analogfecdback ossociaLitc mrnwry,” IEEE ThwactiomOfl Ari*uríií .Vi'Mxjrfcj, wlApp L17-126. AHneavt, F., 1954. "‘So™ infonruEiizmiil aspeéis úf visual pcrccpMon,1' P.ri fi^rjdhi; vcl,6la pp.lb3-L93. Back, A.EJ. and A-S. ^'tigend. 1998. L,A Firsl applicalicm of mdcpendcnl ceimponcnt analptií ta cjtlracling scruclurc ffom stock refonisJ’ frttrFMÚMdT/cní™/ü/.VcwnjJ1 S>mrt«. «I. 9. Specill Ihhuc on Data Mining m Finante, a ser lancado. Back, A.D., and A.Q Twia |99|. '"FIR and 1ÍR Syflúps^, A m.'*- neural ndwurk archilecLure t'or time series modeling ” Atara/ GoffTjWíJftcwT- vol.3a pp.373-38S. Baek, A.D., and A.C TsoÜ 1998. “A low-Ktuitivlly recumnt neunil ttHHtrfcf*Maura/CtwqpjrfaffoFj, vol. 10, pp.l65r|RR. Baldi, P., and K. Hornik, 19S9. “Neural nei^órk^. and priik ¡pal CompuncnC anatysis: Lcamlng from ctamples wlLhcwt local mínimum."'.VeidroZ Atíuw¿r, voi. 1, pp.53-58. Bantinr, W.L., and A.S. Wclgcnd, 1994. '"Cnniputlng second dcr¡tai¡vc$ ]n feud-fonvard nclwiwks: A twiew* TniMS£?rrí<?ns OF» Acwraf Acniw^, vuUh pp.4B0-488.
Hidden page
BeiLvtibisce. A.h M. Méüvier, and P. PriükinJL 1987. J/gwj'íArpis 4íh J Sfeeioitfc ^pjxro.rjjnarráñ, New York: Kpringcr-Verlag. Bcrtcro, MUTA- Poggio, and Vr Tone, I98ÍI SIRS "[ I t-posed prohíems in wty visinn," Fjtj^'íyí^.y qftte fEEE* YCL76, pf>.SiS-«j-R8^. HcrtRCkaR. D.P., 1995. PLÑLTflJJC.Ph^rürtírtríW^ JWrfflprrnidrí CWbV/. tol. E and tul. II, BíbíiCirt^ MA; AUWftt^ SííeOliflC. HertRckaR. D.P.. 1995, T^qgmwvJ>9 Bc-hnnnr, MA: Alhenu SíiernifiC. HcrtRckaR, D.P., and J,N. TsíesíUí^ t996. A'd'rjJij-OrrJü/irrí" /tyúWffltoí. Reí moni, MA: AlhefWS S^itifrtíík Bflymcr. D.i -and T Pqggjo» [ 996. Hbnige repreaníilions lor - i>ual leamnig? Scú'orc. wjL.272, pp. 1905-1909. BíeneMtMkj E.L., 1..N, Cooper, and P.W. Munro. 1982 "Theory for Ihe developrnent oí nwren ¡setectivity: OrkniiUi-in spccifirifr' and binocular intHKfkm in visual concjcr Jmi™/ (/MtwwtffewM, ved .2, ppJ2-48. B¡shoplC M h 1992. “Emci calculaúon üfthü Hesitan tMtrix foriliLpmuki-la¥erpereLpiren,H.VcNrfT/Cojr?/?jrr4z//mr. vol.4, pp. Í94-501. Bishúp. CAI.. 1995. Atara! AAfAW^ ihr ftfttrn OxíónJ: Clarendon Press. Black, I.DJp 11991. J^npiírrrán rn rííJrain^ Afr ^ctfvlar AnpKtfve. Cambridge, M A: MIT Press. Blakc-, A., 1983. 'The Icast-d.is1urbüncc principie and ucck enrístralas/' Pdjrcwi JteupgrttfM vol. 1, pp. 393-399. Bhss,']'_VP., and!. Loma, L97J. H]_ong-las1inij poccntialion üisynapttDlfansndssion in thc-dc-ntalc weaoíthtanacschcrizcd rabbit foi leming s!imula(ion qf thc perioratant palto/' 7. FJji.-í^!, va|.232, pp.331- 356. Blumcr,A.,A. Ehrentcuchl, D. Hausstcr, and M.K.Wamiuth, L9S9. '"'I.caniahilky and cheY^apriik-QwrwmeflldlDimcn&ion/ «foKFMf Jjf J"1^ .4v.fneí¿?rr^d /uj1 Crwj-wrrjjrg MtKfrírtPy, vol.36, pp 929-965. Blumcr, A., A. Ebrenfcncbt, D. Haussler, and M.K.. Warmuth, 1987. ’,Occam's w/1 Píwwfeg iíffPX vol24,f^.377-3M. Boahen, k.A., L996. "A rctincimoiptoic visión systrm/' JEE£ Artero. vol.16, ikjlÍ, pp.30-39. Bcrahcn, K.A., and A.Ci. Andreou, 1992. ,LA contras! stórtEilivc Silicon relina wilh reci precal synapses/' AAflWCTfe JVeurü'i1 Zn/n.^HLT/Jü'jj P^üecs.Tr^p-STííertis, voí_4. pp. 764-772. San Malea, CA: Morgan Kauhnann. Braticn, K.A., RO Puul:Qi*cen, A.Ci. Andnc£iun and R.E¿. Jcnkins, L989. "A hcl€TassocL3.1¡ve mciliory US¡ng CWTHfrmodc analojt VE.s! c-iicuilfl,"1 /EFE Thcmutitortm On-Jru.r rw?Jvcl. CAS-36, pp.747r 75?. Rodcnh.iuwn, U., and A. Wjiibcl, 199]. “Thelempo 2 algonchra: Adjusiin^ dnie-deliysby supervued loamii^J’iWtaMitMf fe P^cv.v.vj^ ral. 3. pp, II55-161, Sin Maltu, CA: Morgan Kaufmum. DuhíjnaniL. L., 1872. ^¡Im flludien Ílber du ^annegleichgwicht unlcr gaMMkkülenhBI Srfz/rn^hmcfcFe Ar AÍCTf+cJNírfísc/r-A'urjmLfssL'gsLÍqrtfrrArJr Af Eflrscrík Arjr Jííj^r^rc' í/rr vo-l. 66, pp. 275-3 70. Bosut, B.. 1. GnyOTi, jnd Vjpnik, IM2. “A training algorithm fot aptimal maegin classificen,"J+'isnLTÑ¿?p gh CoffyHiftirtGJisí Zftc&n-. pp. I44-L52. han Matea, CA: Morirán Kaui'mann. Horct. B.E., L. Sackingcr. J. Bremlry, Y. LcCun. and L_ü. Jackcl, IW2_ "Hardware requiremems tbr ncnral nccwnrk pallcm c lassi fiers? /EEE Afwl. 12. pp.32- 0. HourLard, H.A., and N. Morgan. 1994. CaMwlinnÉsrEccngHí/j^i?. J/rfri í¿i4fTVEUC^- lioslon: Kluwcr. Bourlard, II.A.,and C.J. Wtllckens, L99C1. "LinksbtfweetiMufcúvmodclsand inull]]ayerpcTLncplrons,,L?f¿E Tnumrerñuu1 ¿jfj Fd?ililm qjk/íWíw/iprr /jrrrV/jgííicc1. mi. KAMI -12. pp.l 167-1 ] 78.. Hoi, G-L.R, and C.M. Jcnkms, L976. Time &ne.Y .4rjci/irírr and CtaftvJ. San Francisco: I lnJde:i Day_ HraLtcnbcrg, V„ LCJ67. **laIhcccrebcüa cortes a hiological dock in thc millisccand range?" an T^e Gpftfíllfira. fe fffüjTr fles-Krreft, C.A. Fói and R.S. Snidcr. cds._ vql 25 pp. 354-346, Amslcrdam: Elscvicr. Hraitcnherg.V., 199Ü. '"Etcadini; 1he strudure oíbrains." MefwoHt1 fe *ol-1, pp. 1-12. HrnLLcnber^ V, 1986. " l'wo -\ ie^í ot the ccrelm.1 cortea,"' in tf/crúr THwn; Cr. Palm pnj A. Acdsfn, cd$-. pp.S1-9Ó. New York; Springcr-VcrLBg. [IraLLL-nhcrg, V., L9ü4. Pt'/ikJv.Y. AperlrtWtíf fe .Vrd Jjt frf PjF>cA*tojJ-. L álllh: dg- BMA; MIT PrtM. RfaLtcnhtr^, V., L977. Únfee TttiW qfJfrufef, New York: Springcr-Vcrlag- ñregnian, A.’S., LMÚL &ene E^l' A'JtL'p/wffí Onpr'Jdzaíícj? Sarjjrrf, Cambridge, MA: MIT Press. Hreiman, L., 1996a. ^Baggmg prcdiiloní" .V<rr/ifer AcwntÍHg. vol M. pp 123-14(1 BníntlU Lia |996b “B¡m» wimcía ítnd arciiiLT ctaífifieWa11 Th Jj/uc rjí ÑrpurJ «Jrift SUIlncíci Deparríneúi, Upiviindiy of OI i fixrpa, Bflfcdcy, Cal if. Bit imán, L, J. Frkdmflíi, R Olihea and C. Stone, 1984, CtarstffMrffer ¿feí Bwi> New York: Cheprnin HaII. F+ndle. J S-, L990a ""Probabi listic inlcq^rclaEionpríicdforwVFdüIasR i fica1¡LWi j^ctwnri ompm^wich relitHMHlupfl ios.ia[iR[LC^] paiicmrctogniñmi," in A'cuftj-^jrfi^Jrrj'jtfl.^í^w-j'rfi/tTV, 4^7uJr¿LJtJrt<vnínf4^j¿rjYrncwf.v. F. Fougtlman'SchdiCJnid J. Ifiraní], «ta .Ncwftft Springcr-Vcrlíg. B-Tidle.LSi, J990b. "TrainingtlOCJustiú ilbódel rVCOgriincn algürilhnuu net^OTks tai! Itad tomáximum mutual informalioñ estimation oí piirumrlers? ¿drtMS fe Mtamí fil^HWWridft 5l a7##h kI.2, pp-211-217. CA: Morgan Kíufmanib.
Rrodal, A., b94 L. .Víidm^fl^JcaJ^najtwni' ín AeArfr.au ío CfflflrorJ\Avirrrjrirc. 3rd edición, New York: Oxford llftivcnity Prtes. Brodmann, K.L 19Ü9. kéKH^je/jen^eLDLaírsflrioffJÍcAxerf'crGnaíJÍJj^í/'fnde. Leipzig: J.A. Barth. BrogmJVL.. L9S-5, .'.fi-.i1:.".- Cúum^TTicrm- Zndeditian, Englrwood Ulifl's, NI: PTrnlicE-l-Ln.ll. &R!-Limhem1. D-S.a Hld D Lowí, L9SB. hMu11 ¡variable Funcrional interp. «Ia1 ion and adaplive nclwarks,” Crwp/ev Sl'jííwtj. wLl pp 311-355. Crown, TJI.u E.W KnirisS.indC.L. KflMA, 1990. “fMJbiusynapscs: ñinphyHieal mechanismE and algorilhmE,'’^wiJM/ ícifn*- q/",Ycjfrr^crcTOp. vol. 13. pp-473-511. BruoL J, 1990 "CMl ll>C cemvcrgcncc prnperties n-fihe HopíieL-d model," RirjceetfjTfgí c/lta I£E£. vol. 73, pp.l 579-1585. JJryson. A.E., Jt.l andY.C- Hfr, 1969. Blaisdcll. (Rcviñed prinling, L975, Hcmisphcrc Publishing, Washinglon. DCi. ñurg, J.P., 1975. Atadena ¿jwcEni/ üjffpwfrán, Ph.lh ThttlSt Stanford Univeraity, StUlfbrd, Gilíf. ByrgísL C J C., 1996- L,A luLorial cm supporL Verter machines for pillé rt b fCCúgibi I iM," JWlM^g dflri Ario Drj^krni t<i a.ppcar. CflC&üÜM; T, 1906, ‘TfiliniatiíHi pf a muh: varíale denELty,” Xwiét/.t &f ííjc ¿BJíMfc ¿r/ííLTffrfrcjr/ fTdhüJ, val. 14, pp. 179-1R?. Caianidlu, E. R., 1961. "Otj-11 ÍIK of : dwoiy of [hQU[(h|- piwcsscs and 1 hi nking machines,” Jm»/ CjfHfrwtÚCdf ¿to/úgr, vol. L pp.2CW-235. Cameron, S. L L, L960. Toeh. Repon 60-600, Prottftíífigs£¡f'Ai Bíontelpp 197-212, Wri^kitAir Dvvelupmem División, Diyton. Ohíui CanJoso, J.-F.u 1998a. "Rhnd sitial Hptnlion: A rrviw," ftwwtftqp 0/7^ J£E£, vol .86, a ser latinado. CanJuso, J.-F., 1998b. L'\1ull ¡dimensional ¡ndependentíímponenLanfllysi^^^mí^Jí^s /£££JCtóSÍ SciXtfe, WA. May. Lardoso, L-F.. 1997. ‘'Inferna* and inasimuiti LBteBhMd íor hlind nuce KpntinC1 IEEE Srg#wf Pmctuütg LtMrf, toI.4, pp.l L2- 114. Cande™, J.-F^lO^b. ‘"Lnlcup t: MdtfMtl for ajurorseparaLiem," AprcsenLücbi naNIPS 96 lliir^rAc^wi fihWSrgíiír/ PrtKCMrng organizado por A. Cachoki al Snomabü, Cuín. Slf;i um capítulo do Livro tvuj/pmTJirfFiiíeriírg, i. Kaykin, cd., New Yortc: Wiley. Cardóse, 1-E, and H. I.aheld, 199fi. "EíquivBrisnl adapenr hnunre «paralum/ i££E Trtniwcfrn/rs ou Pmw.w7|gh vcl.44rpp. 3017-3030, Lardoso, I.-l-' B and A, Soulnuiriiü. IV93 - "Hhnd beusfofmktlf í« nL’rtL-trü.iiNfimji si^iial^,"' JBff iflxj^rdtJ^. ¿tK.r /? vul.LJO, PP.3Í2, 37» C arpciiier, G.A., and S. Groutaqi, I9®7/'A maHÍn^y pial Id uchátKtiin far a Hlf-cipidiing ncunl pacccm rítójtniikm nuichilH1-,'' tVrnr^niJtr H3ÍEML GrajrArr.v, íinj /muyr Prrjce.Y.vrrjjíf, V0137B pp.$d-L 1.5. CflTWivT, Cr.A., Xd.A. C^hcii.atki R. Gmfiibcpg, L9S7. TcchnicaLcomineéiscm ,7Ccimpiítmg wi1h neural MW<irkí,"S( f^cr. wl^S^ppi 1226-1227. ( arpcnrírHG.A., flfld S Gnüssbtrj, L995- "Adaplive fwnmM ihnty (ART),” in M.A. Arhih, cd., ftf Hd/riJAr.^ [jfíhnd TÁc^n' Md Atara? AfitfWWlte pp.79-82, Cínibrid^tc, MA: MIT Pícsr. Casclagli, M._ 1989. "hTortíflwpndkctian ofchaotic t¡iTW-Ber¡4"^v*04i voL33D, pp.33í-.1S6 w Ccdjy, V-, J9S5. "Thcrniüdynamic approach lo Ihc travrlling -talesman pr-oblem,” íy tJpjj>N¿e¿rn'od Túcon- m# volr45, pi1 1-51. Changcux. J.P., and A. Danchin, 1976, “ScléCii^ <iahib¿^:i<in oF devtlopingayfiiptei ¡AS a raeduníim Fot thv spot-i Ficalion of neural iwlworks."1 jVfffN^c1. TOl 264, ppi705-712 Chaltcri-cc- C . VP. RoychcwddlUrT, and F.KnP. rhtKrt^t 199fi. ,LOii r^litlveMnrafenK pwpcrlivsúf principal componcnt íi|gnr¡ilimN,L' IEEE Thwsdfaiu m Atan*? Netwwfcf, wlr9P pp.319-329. Chcn. H-. íind JL-W 1-iu, 1992. ''Adaplive disiribuied crthofomli^imn pwessing for principal componen^ analysis? u?Gcu^fcwwf t'iu dowticr. ana!.íjjfjiírf Akcvíh^ vol. 2, pp, 29.1-29^ San Fnncucoi Chcn, S., L99S. ""Non', near lime |eri<4 modelling and predacticm usinfl Gausfiian RBF ndwnrkí w¡lh cnhjnctd cluSteriilg and Rl.S Icaming,” f íve/rorjía iíffeni vol.31. Mo.2, pp.l I 7-L Ifl. Chci\ S. Billings, and F. Gran!, 199Ü. "'Non-linear Eystem identific-alion using neural neLwnrksr Znr^rjíúJj'Mfl/AHfflof o/ Co?rrjT?¿ vol.51, pp ] 191-1214. Chen, S., B. Mulgrew, and St Mcf a^gjllin,, 1992. "Xdaptivr UayeEÍan tccd.ba.ck cqu3(. :<ertiascd on a radial hasis fuKtMK nehvrrk," IEt£ AiXcnrarráno'/ CwVfonKtf1 twr Comfflr^iJcuXJOrtí, vol.3a pp.L267-L271, Chicago. ChcrkaiElcy, V, and F. Mulicr, 1995. '"Sclf-organizalion as an ilerativc kcmcL Hmoothing procenT jVrtrraí C^mprírtr/Tcn. i'ol.7T pp.l 165-L177. ChcrkaEEky. V., and F. Mulier, L994. .Dffíj.- Co^rcepü, TTieürv ¿znJ A/erAndr, New York: Wilcy. Chcny. EjC., 1953. ,LSomrcspefimmt5 Dnlherccognitiem of 5pc«hrwLth onc andwith iwn e-ars,'1 4cwsfta? Socjffr ¿ifArimcú-n wL.25. pp.975-979,
Cherry, E.CL. irtd W,K. Tííylo*, I9J4- “Sane furil^r expííimciiis upan íhc nccagfiiricMi af spccth, with anc and wich 1wo cars? JbwitóJo/^¿tMíforiSbcÑVi_4f4F?icric4?< \ol.26, pp.554-559 ChesEcr. D.L., 1990. “Why (wo hidden l-iyer> ¡vrebciivftbaii LHhj,'1 AtltyiMtibftrfJWta Cari^n^n^1 Sfl Atalffll Ali,ifmTJir¿Y_ vqL 1, pp.2-)5 -yfi'<. ^hdümton. D.C. Chimngjueflf. C, and C-H. SAqilin (L 794 j. "'OpcimaL adaplivc k-mcans algonthm with dynamie .idjuslmc-nt of leaming ríle." ÍEEE Tramocrwrii mjífaira/jVcJMxJrt^ wl.6. pp. 157469. Choey. M., and A.S. Wtig^íld, 1906 "bfonlihfa* IríuJi-ng. modcN Lhraugh Sharp racin maKimization,1' m A. WcLgcnd, Y,S- Ahu-MosLafa, ¡uid A.^P.N. EUrfcnes, cds.,DMÜfon Fecíwe?tog¿fí,/ím1 financia/Engfrwüig, pp.3-22. Stngipcn: World ScicTjtiíic. Chunahland, P.S., 1986. AAHfH^Mtoi^Ay.1 Ibwmfa Lfa/fled Sc/mcc ó.ülw Mfr^Enúii Camba dgcn MA: MIT Press Churchland. ES., and ['.I Sejnowski, 1992. JSí Cm^jrrcTffcriúí Cambridge MA: MIT Press, C'íchock-i, A., and R. Unbchaucn. L996. "RobusL ni-uraL neLwtnks. wrlh 0O*lilW lean! hg (ri blind ídcnliflutíún and blind separation o-f sources," /EEE ftwuac/roflj twi Cmaíts and FtadfflNftNM? 7hw> Offltf wl.43, pp.894-906. Cíchncki, A., R. Ubcnhaucn, and E. Rummed, L 994. "Kobusl leaming alguri Lhms fw blind Kptntion of signáis,M EhtMnñA J.iW. voL-IO. pp.l 386-I3H7. Cklwcki. A., and I-- MüRMsynski, l.., 1992, “New leaming algonthm for blind separation of sauncT5,,-L7ecr«w?rc£ ¿eltaT TOLM^ppi 1986-198 7, Clceremans. A.. D. Strw>S<hrehbcr. and J.l McCIeUind, 1989- 'Finiie Riaieaclámala and simplq rwuildlnttwwta? Acj/raJ GMipirtffltíaii volt, pp.372-381. Cohén, L._ 199S. JriFie-EM-rpr^rQ ^nnAirs. EmJewaod CliíTs. NI PPtfflke-Hlll. Cohén, M.A., 1992a. “Thi.'synLbe&is or^rbiirary sUiWedyrmiuks in no«i -I i pear neural ndwarls [1; Fwdhsck aiiJ universal hy? ZnAenufícNu? Jbntf Canfifratfü cr-r MfwrtiJNflHtVÍi, vol 1. pp I 41-Mí» BtUiiitfih;. Cohén, M.A., 1992b. "Tlrt mHÜUCtÍDfl rfarbiirary ilabU dynamies m nonlincar neural neiwarkR." Mwnl AtanTJirihr. TOl^pfkBJ 103. CohcnP M.A., and S Grussberg. 1983 "AWluie q?Nlily nf global paitan formalion pnd prallcl menwfy by cunijwtiiive neural nei^'wks/ IEEE Tniír.tiJrJtow A^jjr úhiíF vni. SMC-1^, ppiBI 5-Í126. LohrttD-.andG. Tw¡jutp, 1992. “tfaw ú^hc areiltt Vafpnik-ClKTVüntnJíisbound^" CdiiTj/^w^i. «14L pp.2d9-269. Camón, P., 1995. “SupcrviwdduslIílMliOfV* prvhiibilisCieípprL'síühJ £i/FTY-,(J4^1.yrni/^itírj^4in .V?jfiWAfitfiWfifcri pp. L ] 1-128. BntHdBt Bdgivnt Camón, P., 1994. '"IndrpHident tumpwwnl unulysis: A n£w «D«pt?”-í/g.|r<J jPnJCÉSTÍNg. vnl 36, ppi2i7- 314. Camón, P., 1991. " Independen! componenl analysisi" ?RJLíT-Jfrj^ü- uf Jrí/L'MCTffúMrtfí Sjgntrí llbr^jfrop Ai pp. I L1-120^ Chamrousse. 1-rance. CoriStanrinc-Patnn, M., H.T. Clinr, and E. Ltehski, 1990. "PaLtemed tófvttfr syiwptie eonvergencc, and ihc NMDA recep- l<ir ¡D devcloping. visual pathvmys,*Anden cf Nevmmencr. vüL 13. pp.l29-154. Cooki A S-, 1971. HThc complciity oí Lheorem-proving prouedures," rfie Jn/J/rw/ JCAÍ Sii?rpü£jjrjTj m FAron- flfCunípirfmg, pp. 1514S8. New York. CüuIí, PA.. 1986. MwJfawXJiiiíJrtTrc-drí l.ondon: Pncnlicr-Hill IntemaLional. CtMper. I..N., IJ73. "'A posible organization üf animal mnnofy and leamingr' ou CÓffiKrftt ftvpc/tta o/ Syj/ewfj, B. LundquisL and S. LundqiiiEl, cds., pp.252- 2&4, New York: Academia Press. ConmitT.H^C hZ. l.ciscnKin, and R.R. Rivesl, 1990. rt? J/ifonfr^rmf. Cambridge, MA: MCT Press. Corles, C., aabd V, Vapnik. 1995. '"Euppnít vectnrrwtwwta/ jUavAí^e ¿wnj^g, rol.20, pp.273-29"?. Cotrrell, H._ and J.C. Fort, I 986. "“A ¡stnchasLi-C jnodL"l orMÍÍMKpyr A í*ul f Lirgaíiizjiig pTOCOM^1 iJwfüXJL-af Ci-í^mcrJCJ, VQ1.5J, pp.^Ü5^!l. Cottrell, M., J.C. Pon, and G- P^gCs. 1997. ''PicarLii.aL aspeéis eif [he SC1M algúrilbiii,''' FjiMt'í/ífrJg-.v ü/jJíc ¡VívfaAr^ rtrj M^pt, Espeja, Finland. CoCtrell. GlW h and J. Met^líe. 1991. -EMPATH: Face, emolían, and pender Tccognition using helons,1' ru iVrwnrj/ AwusMg1 .ÍL.-ídL'jri.í-, vni. 3, pp. 564-571.* San M aleo, CA: Morgan Kjufmann. Cottrell, 6 W., P Munro, and D. F.ipscr, IÍR7. 'l.caming inrtemal rrprcscntaLions írom gray-scalc images: An cxampLc of CAKnswmJ programa:ing,'-'/tawpdjqgr RtA Ajwim/¿^emwi? (J'rfie CagÑJJire 5'cjfrjcí pp.46L-473. Cnurant, R., and □. Hilbcrt. 1970. vd. L and [1, New York.: Wilcy Inlcrscicnce. Cover. T. Mr, 1968. "'Capacily prob-lems for linear machines? ín J_. Kanal,cd.,/trWerTJ Jtrtúpgirjftrwr. pp.2 63-289,Washington, DC; Ibompson Uook Co. Cavcr. T,M-, 1965. "'Gcomctrieal and slatistrcal propcrtics ot'sysLcms oi'linear incqual ¡1 ¡es wilh applkations in pattem nccognition," /EEE Traír5¿?cíJG.ní ofj E'acftuH/c Cbfqpwtax ral. EíC-14, pp.126- 334.
Hidden page
Hidden page
Fcldkamp,LJLF and G.V Pmkúrím. 1997. “Adiptiwbehavioir frwi Tixcd wcighr nerwürksC/^rÍjmüféfljr Sctott?, val,9$^ pp.217-235. Fcldkamp, L.A., and G.V PxtókorinS. 1998. "A squl pnonil frumvffc bascd on dynímic neural wtwurio wilh application tn prohlcms :n adaptalionP íillcring and classificalion? F c?f tfre tEEE. vüI.86l a Ser lanfftdDi Fcldkamp, L.A^CLV Puakuriu^ and PC. Mowe, 1997. -Adaptaiion ffCMU ftnd weighl nciworkn." JtftouJto Sctowi vi>m. pp.217-235. Fcldmaj-i, J.A., L992. ^Natural cwnpuiacwd and artificial intdligvnec." Plcnary LkVuv prcflcnlcdfli ihe MenMftoaAMrt m Afeunií A'cAiívís, BalLimure Fcilcr, L9&K. iln JjTrxDrfrícrrán rt? ftutah'frr nkwpúrtfiix dj^ftrtírríidíP vol, 1. Jrd DditHn. New York: John W¡lcy¡ Lst cd-hion, |95ft. Físchlcr, M.A., and O, Firschcin, 193.7a ArJW¿rig&rFCf.- 7icE"i^. jT'Vctf™7rP mrJ/JrcCmnpu/cr; Reading, MA: AdÚLaun-WesIcy. Fisher RJL. J925- -Thcnry af slalislical CHtimation..’' (?/ fie Cambridge PÜfaio-phieaJ í&cicA: v-ol-22, PF700-725. Flx, E.i and JJ.. Hongos, 195 L. "Diacriminacnry analysif; Nonparamctric dÍFCTimination: Cons-islcney proponies,'1 ¿j'SHF SdkMÍ «/^víufrrj^r A/cvírtíiiü-. Prc? icct 2 L-49-004, Rcporl na.4, pp-261 -279, RanduLph F:c-ld,Teias. Fltlchcr, R., 1987. ^rfjajíMlífcaA rjuíJcrtóM. 2nd edil ¡en, New Yorte Wílqf. Fndor. J.A., L983. .t/ütirtorijy qf.VmtL Cambridge, MA; MIT PrtSs. Fndor, J.A.j and ¿AV. Pylyshyr. 1988. ‘Connecticmism and cugnilivu archilcclun;: crilical arwlysis^ Cügmíjan. vol.28, pp3-?2- Fáldialí, F, 1989. "'Adaplivr nrtwork fcroptimal linear feaCurcexirtCtiom" /EEE/nJenjjA-Ma/JadFjrCüJ^emrrfl twr jVejrra! AAefhwfe, «I. L pp.4O !-4O5. Washington, DC. Fricada, M.i- i and R-C- Carrasco, 1995. ‘"Leaming 1hc inilaal Hiato el a sccond-ordor rcourrcnt neursl netwnrk duiiiij regular- languagfi míiewKí," Atírra^ Cüfflpufürirur. vüL7, pp.923-93Ü. FOTtty. G.D., Jr„ 1971 ‘The Vilerbi aJgorilhm," FraectfJjTifli qfíAj IEEE, rol .61, pp.2óE-27& Forte. J.C.. and G. Pagés, L995. ,lÜnlhca_5. com-rf^rnce ofihc Kabcmen algonttini witha general ncighbofhood FuncliouiC of .4pp/j'ed FrobodiJíA; wL5, pp. LI77-1ÍL6- Forlfi, JjC.b andG. Pagos, [99fi. ^CímrerBcnccofstnchastjc algorithm: FromlhcKushner and Clark thconcniiodic Lyapan&v runeticnaL.” .1.,'...í|l । .i Aubtfbr/rr}: vd]_28, pp. 1072-1094. FfeBKGUa P*. M G0riL □i™.!-íj. Sodtv L 992.I ..d ícedhaclc mu-lliJayErEd nEtwmrks^Afaw'v/Cmi^TJfi'.p^cur.. VOl.4, pp. 1-20-130. Fraswmi, P., and M. OcriB iWfi. XomputatíMil cípíbiliiies ofloal-&edbMk nseumne itviw^ks actmg ¡h fínuc-siace rnfiehhn^Nj17EEE TVwudCttoltt NtWflí AfehWfífat vol7P pp--1521-1524. f'rascL, A. M. । 1989. L,lnfümi4ilit>n and cnlrupy in slramjcflllraíhXrsJ’iEEE Dtmmc^NUcn? AT/ljrwarj'cw Tirar, vol. 35. pp. 245-262. Freeman, J.A., and D.M_ Sakpura. 1991. ™íPragrarTrmbrg TírAjir^uíj. Eteeding, M A: Addis<jn-WesLey. Freeman, WJ.. IÍ95.. &ctaí^o/E™>f5. H.iiljdale, NJ: Lamente Eribaum. Freeman, W.J., I W2_ "J utofiaiem neunobL-üIngy: Prora single netirons Lu brain chajus,1" .ftrAv™frQ^ Janr™/¿^'Ejyirned'nün ü-wJ Ckw jTt .4p/>ZíHf Atoan1 jwb voL2, pp.451-482. Freeman, WJ., 1971. “The physLülogy of percrpCiOft.’' ícjo/rAjSc ^merfraa. wi.264 (2), pp.7ñ-S5. Freeman, W.J., L78R. n,Why neural nctwnrkñ dom’t yei fljy; Inqu.ry intolhe neumdynamiDS-nfhiologital ¡ntcl|¡¡cnce/' fEEE ¿Rfpmtoal Cmr/c/rnce m A’ramí A'ífHwis. wl. II, pp. L-7, "sin Dipyo. CA. Freeman., WJ.. 1987. -Simulación of ctuolÍG EUG paLlems wich 1 dynajnie modcl of ihe nlfactory systcmT Ejúfojjjídí Cy&í/vrríjei. wi.5t_ pp. L39-150. Ficoman. WJ.,L975. Afü.w^rifl/r ftr rfií jVenuiu New York: Academic Press. Frrgnac. Y, and D. Schuh, 1994. L'Modrls of symiplic pl-aslicbty and. tellular analogs of learzimg in ihe dwvhjping and adult vertébrate visual cortes,” ^íAunrej rn Aterira/ ¿rnd Jeiavrora/ Eteitffo/wnerU voL 4, pp. 149-2)5, Ncwwoüdh NJ: Neural Ables. Frtund. Y„ 1995. -BoosCmg a Wttk leaming algorithm by majorily/ /^bnwflfw^r compríJA-an. wl. 121_ pp.25G-2S5. Freund, Y. h and R..E. Schupi ret I 997. ,LA dccisi-on-lbccireLic gcncralizatinn otf on-lior Icamipg and an appJicaticn lo boosling." Jbunu^ qf Cn/jrpirr^ mí íi'jfra Atocix vti| .55, pp. 1L 9- L 39. Fícundí V.l ííuJ R E. Schipn, 1996a "ExptriineaLS wilh a new boosiing algorithm? Aí¿K/u'j?e ¿eflmAqg; rbt fttiWKtftow/ Cdín^nrmíí'. --r 148-156. Bad, Híily. Frcund. Y., and R E. Schapinc, |996b. 'flanie theocy; Ondine prediclion and bousí ng," /Trcccrfújgs o/rfje AMA Cbf^bvncv oñ Cm*ípjrj,flrú^iJÍ ¿furjun.ij TjfrjftNy. pp,325-3J3^ Defltnzanü del Gfrrda. I ualy. Friodman, J 1995. -,,An nverview of prcdbction leam ¡njj and funcl ion approí ¡iskíi ion? I n V. ChcrkasskyH J.ll {. Friedman, and H. Wechsler íds., Erm toj-rla ftr Nrarcri Ndwrtf; TAíün1 M:/ JtacgnUiMNeu' York: Sprlufef-Vtri^g
Fukunaga, K., L990. ¿ítríisíica! fíaffern «Rett^nífrflM. 2nd cd-1:.-an, New York: Acadcmic Press. Fukualiims. K., 1955- '’Ncocognilrein: A model fbr visual paliem rceoínitinn,” in M.A. Arhib, cd., 77jí^F/ít/w/Aímíérr/"F™m TTÍKrVdlw/Nnraí Mtftawte, Cambridge. MA: MET Press-. Fukushima, 1L, 1988a ’A hierarehical neural oetwfk modcl íbrRcIcctivcanculicm” in Nnrra/ CoNpvftn R. Eckmiller and € vuri der Mallburg. cd*- pp-Sl -M, NATO ASI Serien, N<hv Yurk. R-prinjjer Verla g. Fukusbimíl. K-, PRSbi '’Ncoccignirnjn: A hicrarchical ncurat ndwnrk capahlcn/visual jWetti recognitipn^Atrdrtj/Jfcftrorib; vol-1. pp-119’ 130. F Liküshirtlíi. K-. 19RÜ. "NHKQgnitnn- A sctf-nrganizmf neural nccwíirk niodcl ior a mechan ism uf paLIcm pccflgíliticiti tmfltotcd h>- sh-i'i in pojiiin 'n,** 0taA3gfm/ C^hfrtií/fej. vol .36, I93-2D2- F □kuih¡ni¡Jt K.-, ]9?5- L,Cogni1-rcm: A scLf-organizing mulii-laycred neural rictwork.'-' Qfrenwf/Cfi vd.20. ppJ2L-l3t Fukushinm, K., S. Miyifce.ind T. 11c. IQ83. Itaogniiw A neural network modcl fo* a mechauism of víiual paticni recognición," Í££E Ihutfaüriúttf tiri irire™. Mwr. üttd Crherwíic’ü. Vfll SMC* 13t pp. 826-834. Funahashi, K.., L989. “Chi ihe approajmate realización flf COnlinUMU mappinyf by neural nclworks?1 A'rartrl A'dlwnkr. vtf,2, pp.l 83-192. Ciabnr, D., 1954. “CommuniDalion iheory and cybcmcrics? //¡ti' 7>¿7niff¿7mrj tw Cj'jtfjj/ vnl. CT-L, pp. 19-JÍ. G-abor, W.P.L. Wilby, and R- Woodcock, I96E). *A universal non-linear Glltf. prediclocand simulator which oplimizes ilsclf by a Irarmng proerss? PriwMwiínjp q¡frirf /njfjJzríÍM qj'E/ctrriai/ Eírgmccrs. Londonr vol.lÜS, jfp.422-415. Cialland, C.C., !993-L,The limilations oí determinaseis Bohzmann machanc Icaminp," A'tfwí. vü1.4,pp.355-J79- Gallam, A.R., and H. Whiic, L98S. "l"herecs]st!io neuraliMtWMkthlldocs not makeaYoidablc mistakes,"1 /£'££'fn/c.i™/tfiN£d CrtFj/cra'rtceoHi .Venria/ iVcftranki, vol. I, ppj&57-664, San Diego, CA. GalLant, A.R., and H. Whitc, 1992. '"On Icaming 1be derivativas of an unknown mapping wilh muLtiLayer fcediorward nctwork^r Mturaf KrniwjLr. vn-1.5, pp. U29-I3S, GuLLanE. S.l, 19^3. Mura/Míhw* ¿ramA1^ Mr/ F^rj-r Camhíid^c. MA: MIT Pkk GalListelf.C.R.11990. O^dniariiM Cambridge. Ma MIT Fren. Gardner, L., 1907. “Masimum ftúflge cjpíüity iniWunil iiCliMjrk<L £Avfir?Jp/jr.iíí,j Íeífw. vtl.í, pp.4KL-85 Garey. M.R.. and D.S. Johnson, 1979. Co^^flSúftdMnfJcrtfWf(K New York: W,| |. Fh-rman. Gce, A.H., L9W. "Ptublcm solving with upcimizüliwi ncCurrlís." Ph D. disscrtalion, Univ;rs¡Ly -oíCambridge. Gce.A.H^SlV.B. Aiycr, and k. Pragcr, 1993 ^Ananaly-Lul írarncwüTk roroplimizLngneiíralMlWfflta?1 A'rarfl/MftiwAj, vol .6, pp. 79-97- Geisttt, S., 1975. "The praliiiive-jínmplc reufe meflnd wích jpphcacio<B1,,-^?i/r/i4r/^f rtí'/rrcrjcrj-j? volTÚ, pp.320-324. Gclftnd, A.E„ and A.F.M. ímhh, 1990. ,LSampling-bii3ed jpprüiiihcs 1o calculating marginal Aurao/ t?/’íftt' ^mcFdMFj i'rjíjYxjíffy^rjíM-jíjrrán, wlJ85, pp.398-409. Ccirnan, S., and □. Gcman. 1994- ^tochasCic relaialion. Gibbs disIrcbuCion-s, üthI the Dayesian restoniLion of images,” IEt£ 7'ransacíions on Auítfffl 4ncrA5j"scinrf .VucAmc fn/c/íígruív. vol. PAMM, pp.721 - 7d I, Goman, S._ L. Dienenstock, and K. Dou-reaL 1b'Ne.irdl ndwurkN and ihebíuAwfincedilemnwTAVwírf CíJflrpw-fírfrí^r.. vol.4, pp.l-38. Gcrsho,A., 1982. ''On Ihc stnKtknrofvectorqiMnlizcTS-'Jt'ÁL'Jhf/njírc^üFrjío^fanmaJtovi JfrcíJH', toI. ET-28, pp.l 57-L66. ¿jcrího, A,, and R.M. Liray^ 1992. FfecfcryNa^XJZírrjM rtnrfSi^naí Caoipre-jjj'ñi?. Norwcllr MA: Kluwer. Gcrsrcin, G.L,, P. Bedenbaugh, and A.M.H.J. Acndcn, 1999. "Neural asscmblics,-1 JEEE 7)\ifísaeíío?r5 4W volJÍ, pp.4-L4P Gibbs, J.W.,1902. 'Tlementary principies in stalislical mcchuica,4* reproducid in vúl.2 of Cfl//crferf irorAr J (7/Hf ftt fijarme.-.y, Nltv Yiwk. Lúúyirianh, Green and Cu.. 1928. {jibión, tj.J.B andCrKN. Cow-bíi, L990. 'Tkn rhc ctecLsinn regíons of inultiLayei pcrceptrans” o/'rÑe fEE£r xrtl.TRtpp.l5W-l5W. <j idas, B_, 1985. "Global opíimizalion vía 1he LangeL'in equalion? '2ííA C<irj/rrericc mr eroJ pjk774-778h Fe. Landerdale. FL. Giles, C.L., LL>96. "UyiLamically drivenrecurran nevnil neLworks: Modcls. leaniing al^orilhmsi and applllMlions/'hrtDrill M, fwi'u/riLUJi^ri/ Cc^/tWKe ON .Vl’j™/Afe/Mwrtr, Wasbinglon. IX?. Giles, C.L., D. C"hen, G.Z. Sun. E1.H. t'licn, Y.C. Lee, and M.W. Goudreau, 1W5. "ConsInjctiYC leaming ofrecurrenL neura.1 ndwnrks: Limitations of recurrenC cascadc correlalion w¡1h asimple *úlidiímtH/EEE OnAfeura/.^ni^rtr, wl.6, pp.$29-836. Giles, C-T.., T. l-inh and B.G. Home, 1997. '’Rcmcmbertnj. rhc pase: The rote of'anlwdded mcmory n mmnt neural nciwürk arehiiectiircs," At.ii,,,' AtrMV?rjLR V1E, Pracccdings of (he 1997 EEEE Workshop- EEEE Press, p.34.
86fi Bwm.hiCxaHa GilesnC.L, ind T. MnwdL IftRT. "Lvarning, invariancc. and gfncrahzalinn in hi^hcr-ordcr neural ndwark^' ¿pptied r ?. u'i. . vqI.261, |ip.4972-4?7-R. Giles. CI.., and B-G- Home, L 994. "Representa-:inn oflcaming in rccurrent neural ndwurk arcj.lttcCuT^sB,, o/' fhr £^*/A Jlfaidtfftftp üJiíUd^fJVü úhmjfii? SVsrettfj. pp. 128-L34,Yalc UnivcrsLty, New Haven, Ct. Giles, C LC B MLllci, D. Cher^ H HrChen, G.Z. Sun. and Y.C. Lee, 1992. ^Leaming andextracting Unitr State autómata witli wcond’flrdcT recuncnt neural ndworks" Atara! CtepitfarfwL tal,4. pp. 393-405. Gilcs,C.L.tGjí. Sun, il H Chen.YjC. Lee, and D-Cbcn, 1990.^HigbcrwJwncumnlndwürtssndflramtnatLcal inferenc< Jí/v^-re* 9t Atara/ Fnicariqg tal- 2h pp. 38O-3S7. San Miteo, CA: Morgan Kaufmanu. Gilí, P„ i. J lunuriing, W. Murny. M. Sauoden» and M. Wright 19M. "'Uscr’i piide fcrLSSOLTTtahakal Report 86-1. Systems Üptimization LaboraLory; Slanfcnl LnAens ty Slñnford, ( A- Gil! P, and W. Mumy. 1991. ‘"liKTtLiL-ccinlrülling mclbods for general ^uadralic prOgrtmm¡-ug¿ SMM Rcvfrw. vol.3X pp.l-36. Girosa, F., and G. AnzclluLti, 1992. '"Raies of Mn^ergenec úf apprüxiitkfliiün b>- iran^líiies,"1 Ai Meno JJfiS. Artificiad Intelligencc Laboralorji MITCambridge^ MA. Girusi, F-h M. knHi and T. Ryg^io» 1995. “Regulariraii&n theory and neural netwofki udñtccturai,” Atara! Con?pNftrftta. wLT.pp 219-269. Girusi, F„andT Puggiú. 1990. L,Net^rksand Itiebesl appraximaLioii prvperty "Ewfcígfrw^CvÍK'rTiL'rfrs. ^ol.63,pp. 169-1 76. GlauberP R.J., 1963. L,,[jmc-dcpe™JcnC sUiAtfcl ot ihc [sing model'1 Jbünu/ dfJUfrftMdftai/ P6rjfcjP vol. 4P pp.294-3Ú7. troggin-. S.D.D.,K_M. Juhnstm, ¡md K. GüftaSofh 1989. ’Trianacy Mdraceocy efTecrsdueiúihümenrurn iukrack-prup^gaüon leaming/ ÜCÓ' /écAi?íí¿?/ flíporf Í9-J5, Büultkli CO ; Uñitarsily of Ccloradu. Guldcn, R.M., 1996. .WirrAcJwtrrí™/ Ne/HuríMflo$BÜ rnw/ Cambridge, MA: MIT Preut Cruldcn, R.M._ 1986 *The 'Bnun-SlaLc-in-u-BoC neurahnwlel is ¡ifrvbnt dcsiXnL algóriLhrn/'^JNnwJ^fAíerfócJTiCTfrcer/ vuL JOp pp.7340. Goles, E., and S. Martínez, 199Ú. A'cüjjí anrf^NFomflfo AfeffiMwfa; Dondrechl, The Nethorlands: Kluwrr. trcdub. tr.ll. andC.ü. Van Loan. L996. Idofrfr Gjrwpifta/rDCTS, 3rd ediliem-UalLimore: Johns Hopkins llnivcríity Press- Güftdinan, R.M.. C-M- Higgtns, 1W. Millcr, and P. Smyfh, L992. '"Rule-based neural networi^ for classifieatinn ..ird prftbabililj.'esiimaciím,’'Ccirtt^hfdJJíMf. vol.4, pp.7Kl-SCh4. GoríT M-. and A. Twi. 1992P rilCn ihe problem of local mi nima in hadcpropagatL-ün," /££E 7hW0Cf*Pffll jji'r iPíLri'i'i/.rn jiljJi'.rá flJíjf .IfflcArnr tal. pp.7-6-«IÍfi. Gorin. A.. 1991 "Ncl^ürk *iTucruK"i generílv-ímoii íatd adapiive la-nguage Kquílíttoa” í?/fíe íei'Cj?rA Ht/í MwfatapJííjiímjlcmí/¿r<rrníflg5'.jiv pp l55-160.YaleUnivCTsity, NewHavenrCT. GMidrciiu. M.'W t andC,LGÜei. 1995.'"‘IJsin^nKurrenc neuffll nelworkN DO tttim ihcslnicmre of inKrttinFicction nd^rits’- j^Atmw*!1. wl.RL pp.793-8W. Góudíeau, M.W., C L. Giles. S.T Chilndhu1. and D. Cheik JW4. "Fnt-onier vs. second-wder Híigk-layer nxunent neural neLworis<1 /EEE TnifíMcfwns tM A'crifcií A'crtwrfcj. V0L5, pp.5l 1-513 Gnrnger. R., J_ Whítsun. J Lu«aand G. Lynch 1994. "Nwi-HAbiu-n proprnies ofLTP enable higb-capacÍLy cncodingof temporal NEquettMÍ1* Prací'rrf¡í.ogj íj/-fAr A'trJj'owl/^Mdíffllvqf ícj'cntcjf UEA r a ser tardado. GfUsher^er, I., and I. FtoCKCÍl. I9A3P “McMinm Lhe sirzngcncu qf strangí aUraAnT" £X wl 9. pp. 18^-208. Grauband. S.R.. cd., IMS. fát1 Jrnyícj'üí Zijte/fljgnRZfetate: ftta^ora. Eeu/íbEjíwiüfjrNtr. Cambridge, M'A: MIT Press. Cray, R.M., 1990. EhfrtfTp h^tinnidM New York: SpringcT-VerL-ag. Cray, KM., L9SH. AaniíApnr Pnscé'ijfj. amí £>tfn/j£ fro/WFricj, Neu'Yorli: Sprinjjer-Vcrlag- Cray, R.M., 1984. "Vaciarquanlizalion." vol.l, pp_+-29. Cray, R.M.. -and LD. Davis-stm, 1986. Aandbn! Eraccjjcj.-jí Englewnod ClilTs, NJ: ^il'! dice-Hall. Oreen» M . ind DJ.N. Lii^ebeer, 1995. £JjiftirjJi:±.^yr Cmfrnt Etylewud ClIff^NJ: Pmuitc-ílall GíMítbcrg, Hl. J9R8 “Eqifl-iJihrLa of ihcbflin-Ultedn-í’h&s (ftSR) neucül mixta!'" A'cwrai .Vcrtkarír. vol.l, pp_32J+JM- GfeflOfy. R.L., 1970. r^cE^t-. Wiedefeld and Niclwlson, London. Crruandec, L1-. 19R?. TijruF-jLr? jn ñrrr^rji R-tO^H Uni^tr^iiy. Pro^jdcnce, R.L Gfpval, M.S-i and A.P AndrcwsL 199J. FjJjmog- n»?d^/W7j.X CnglwcKxl Cliffs, NJ: Frantíce-Hall. tjiiíTithfi, 1..J., and C.W. Jim. 1982. "'An fiktmalive approaeh 14 line^rly CúnSLrilflcd uptimum beunforming" JEEE Thwactiow*' .4jjrí?flFjLTjLindvq|p AP-]0.ppJT^Ji Gftwbs^ S>L 1W0. -CnnWnl-addrcsMblc memciry stüffl^e by neural networkM A general modrl and jk-h;il LLapunm incthod.'" In Cí>rripkrüfdrj™/ArdJzrjTi.Y¿ítnc^ E L ScbwartZ» cd.ipp $6-65, Cambridge. MA: Mil Press. Gn- sbcrgi S., 19E3a "Competitivo leaming: From interaccivc activation ra adaptive motunT In okf Afeitara!AufcMtanicr. 5’ Grossbcrg, cd., Cambridge, MA: MTT Press. CiTLKhbiir^ £., L98Ah. .V™jTa¿ WfflfwfcrdfttfA'jrwrn/ Cambridge, MA: MITFrcss.
BllMJDCkftl-IA &67 GíüSSbtr^i S.h !9B8c. "NünlLniMj Mural ncLworks: PnncipSc-F.. mcehanisms, and uchitectuits;" .WtVflflí M'/hvtíó; vol. I, pp.17-61. GnKsbrng. S., 1982. Snuries ú/'.tfúi¿f ¿r«J Hrdi.it Bosíon: Re iIqL Cjmssherg. S., 19H0. HHow dxn a hraLn buitd a crigjiilive cade?" flírííHr vul.87p pp. L -51 _ GfwbfflB, $., L97Ra. ‘"Decisión- pallems. and oscilkiioih in ihe dvnuniks of compciiiivr systrms wilh spplLcaiion lo VoltCITa-I.OLka S.yRtEinR,'L J. FrhL'-r.irrJJCi'Jj' Hjívol .7 \ ppL IQ L -1 Ml üTKsbcrg, S.. 1978b. nlCompctltlon, decisión, and cüíiscilíus," J. .,Wtjj/i£rma/ré¿?í^FrcT^,5J>flFjcf/F^fíYTfíoNJ. vul.66« pp.470- «3. Crrossbcrgp S., 1977. ’Tatlcni formalion by che global limha nf u nun linear rcimpetitivc interadion in n dímctisions/' J MtíJtaiwrfñfl /íii.-i'j^i. toI,4h pp.237-256. Gmcuberg, &. 1976a. “Adaptivepattem clíiss i ricaliortUWl universal rtMUing: [. Paral Id dcvelopmcnt and. cadinguf neural ddcctors1,L Rídiúlfcvf CL-AürtFúrk'j. vo|.23? pp-121-134; <jmss.bcr^,&., 1576b. HAdjplivcp3llcrTidaAh¡!Ka[ionand universal róCCJiny U Fwdbaük, rapectaLiun^lfarlion- illtiiionsC fiírjJrjjid^ QAtfNNW.f. vftl 23, pp. l!8-"->2?02 CÍTüEíSberg, S.. 1972. ,LNeural tapccliilien: Ctrebelthi and riMinal analogs □frclls fired by l-ramablc of unlcanicd [wnem clttKS," wl. 10. pp.49-57. Groiísbcrg, £., '969a. ,LA prrdi.rL¡ün Lhcory fnr somc noníinc-ai t'uMlional-ditTcrencc cquatifMW,”'JjrJ^rfqfAÍ£rf^rni<?rrér?¿ 4naATJ£a/w/.4^p/j?ajdmr.T, toI.22, pp.49D-522. GmfcRbcrft,S-, 1969b. "u-leamingandenergy-wrtiopy1 dependan ¡ntecunentand winrcvurrent sipned MCworks/* Jomad flf.íLarr.frrttzf Pín.térif. vnl.l, pp 319-] Sil. CrmsRhcrg, S., LQ6B. **A prcd.ieiior thcoty íbr SOITK nonlinear fonctiOíuMíífeftíKe equfltkins" ^mul ¿Hffhyü d^4r^íkdiií?.tiF vqI.2|, pp.-M3-694^vnl.22, pp.490-522 CiroEsbcrg. S., 1967. L,>Jon linear diiltTcncc-díllercnlial cquaiions in predicción ¡uní leani-iiig Ümjrv/ q/ ríe A'tffKWdr/ 4-Ljíít'mv qf&ñPWL US A, v-ol.58, pp. 1329-1114 Crupls, M.M., andN.K. Sjnlui, ed«. 1996 Cwri^^^.Vrni.v.- TAívn1 ífo /f^kuíjcwpj. New York: lizEiL Pfcrr. Ciuyon, [.. 1W0, At-J^Ti1 A,ffi'.wr¿Tdtt¿í/i^j?íi^njr.T. Gwnpuccr Physcs Repone Ainsctrúaiii: Ekevler- HalTncr^R, I99J. "A probabi hfljcfiimewwi Ílw CüiukíCIÍuiuM Ümealignnii^,-,ft™™^gJí^7C5LP pp.1559-1 562, Y^kobanu, lap-n HafTueTi ?-i M Ftanzini and A. WhibeL 1991. "'Incegrattiig time aliignmcTiL and neural netwarks for Hgh períbnniticc cmttfintnu tpeech reragnitíoa" AtíOMdwjgr c//Et'E JCáSSP JtJ. pp. 105-108. Ha.fl. M., and. J .L. van Henuncfi, L . ,L-I"hcory and ímplcnicntalinns ot' i nfbmu filtcR for ihencl i naiVcfm-chrJt.- CwvnJa'J'jMS m jV™f¿?í íy^siix toI.9. pp.39-71. Hagiwara. M„ 1992. “ Thctiretical derratLon üfnionieivLum 1crm in back-prApagatinn,” CíiFr/m.'ncL' JVievnii Afernwis. vol. 1, pp.O82-6ÍIO. líaltimürc- Hajck. El., 1985. HA tucrenal surveyofthcory and spplicaüons ofsamulatedamealíllft.1'Prweer^rgr q/ fAc2-T/A Ct?^fcre^ í?jj Ifeer.írnft 0KÍ CúÑirnJ. EFEE Press, pp.733-760, Fr. Lauknfalea Fia. Hajck. B.. 1988-‘‘Coolíng schcdulcs foroplinHl ^nncaling^ 4Yi?f^jc r?idrrír.í ü/íj^-wrjjjnr vol. l_\pp. 3l 1-319. Hammentram. D., L99Ja. "'Nrural networtcs at work." í£"¿£ ¿/jerO j/i?!. vol. 30. no. ó, pp_ 26-32. HammErsIrom, D . 19Wk "A'urkinp witb neural nel^rrkE.'" /jEE£"ijwcO j/r?i1 vnl. 30_ no. 7, pp. 46-53. Hainmeralium. D., andS. Rahíusi. 1992. "NeurwompuLm^ hardware: Preserttind future,"' S'Lr-crff.Tfi Afa/ftwi^ í'njríí^HKie cw? CbffnrtctiowsH» Skuvade, Swcden, Scplembcr. Hamps-harc, J.B., and B. PcarlmuLter, I99D. "Equivalen^? pnxiis for inullilayer pefetprrofi dwiflen and Büycsian discriminan! ñuwtfon^ Pnjeecrffrjís qf/Ae 7JIW Cwwí/MÜF Mcdeú Awwr pp l,S9-172, Su Mateo. CA: Morgan Kuuftnann HanipsoíL. S.E., 1990. C"a'Hvfrórju'£éc - Brr in: Birkhauscr. Haiieock, P.J,B R. J. BadoklL^ and [..$. Rnñih, 1992 “The pTrttip^l cwnpuncnls of nalurat imagesr- Aforrar*, wl.3. pp.til-70, Hansnn, L.K., and P. So-laman, 19W. ''Neural nctwnrk cnscmblcs?' fEEE Tram;fjeífo*r5-caji ftrWc^ /TutrAy-ró' <?r?c/ Afcrc/rjnr /nreíñgcjrec. val. PAMI-12, pp.991-1002. Hürdlc^ W.. 1990. .Jppíiúí Atenparamelrú1 Lambndgc: Cambridge Univcnsily Fren Hardy. R. L., 197J. "MiLltiquadric equaüons oflopographv and ffther irregular Rurfaee*,',-^j/irj?íJ^/"fT^Jinjcr ffr.TCflFí A. vüI.76, pp. 1905- 1915- E-larel, D., 1987. "jlfgBntAjH/cs: 7/ic 5pj>ií q/ Cowpüjpr^.'' Rcail íig. MA: Addífon-Wfesky. Fian liilc, H.K., 1940. "Tlw rcuirplive íifil-ds of oplic nfitVc tebens-^' /fff-cj kijjr vnl. 130, pp. 690-699. I Eurlinan. E., 1991- *A high sturuge capacity neural neLwork content-addressahlc jncmcry,11 AfohW*. vnl. 2P p[\ 3 L5-3.14. Hsrtman. EJ-, J.D. Kcílcr, and J.M. Kowalski. 1990. “Laycredl neural ntLwtnks wilh Gansean hidden units as universal apprOKinLaitíríC Ar4?ur¿íir G*mpiííxj.r¿nn. tól 2, p[k 21(^21J.
Hashürlk S.B 1997. "dpi i mal linear comh-inaíionE ot' neural nrLwEwks? A'cujctJA'chntwCs Yol. LO, pp .599-614. Jlassrbi, DJBA.IL Sayvd. andT Knilíiih I99R, ÁJ/fj-úiirf /fw Tftwríry. SlAM Hassihi, B-. A.H. ¡Saycd, and T. Kai l-nth, 199^ "The I E" oprimal ¡1y óf ÜW LMS llgorKhmB" IEEE Truír.vuerrOír.f ¿ut .íiftrjüí Pracrjfírrj^. v&l 44, pp.2fi7-2Klk Hass-ihi, El., A.H. Sayed. and-T. Kuilath, 1993 “LMS i-s upiirLftl?'fjTwc^Irr^ríjf^Jí /EEE CjpH/iwjsevon Deeismi and Crtírfroí- pp.74-79, San Anlor-c, Texa? HflSAÍhi, R.t D.G Slork, and G J. WoLÉT, LíK?2. ^C>plim-al brain surpron and general MtWtKfc prunirtg,'1 IEEE AMmaftMOf Cwift/wreon .Víurul .Venvorkí. vol.l, ppJM-lM. San Francisco. HttSibk B.Pand T. Ksilailv 1995. “H" fiplimal traininj algorich™ and tbar rclatron Lo back propag^tLon.’-traces ú? /n/íwTTiórfíí'-'n -^i'Y^-rhJíi vciL.7. pp.l9L-l9K. I [asLie, T B and W Srutule. 1989. "Principal curves," -. jA-l?¿rjrcrjfdjr Sjaíisíka//fjs¿wjafíorj. vol. 84. pp.502-516. I EaSlEflgl,W.K..l 1970- '‘M&nílc Cario sampLing mcthndi mdng Markov chains and Lheir applienIions7‘ tf/omrfrito. vol .87. ppi97-l09 lhujier, D., 1988. "Quanrifving inductrve biu Al ícmiob ilDoriÚuiv íiuJ Ifeliím's Icaming framvwwV vol .3^ pp.l 77-121. Hmfcirit, R-D., and-G.H- Bnwcr, cds.. 1999- CcwvwMrtwiflJJWoífebÉ^ica/jrnjjinSrjNp/í Atwra/ÍTsfcm^ San Diego, CA: Acadenüc Press. Híykin, S,B 1996a. Jr/a/irr^ FWn?r Tfiepr^ 3rd edil: .un. Englcivond CliiT's. NI: Prenticc-Hall. Haykin, S.B 109611. ,lNquíhI MfWtfcl expaikl RP's bonzwu." fEEESgnul PrvMX.í^g Mfl®tní<Wf vdJ3. no.2, pp.24-r29. Hay km, S., ed. 1994a. EJmd DúamolirtióJi. Englewood Cl i rTs, NJ. Prenticc-llall. Hayk.:i, S., 1994b. CcHumuncujirNi iy.TXcwrj. 3id cdÍLÍon, Nrw York: John Wilcy. Ifúykin, S., 1992. uBlind equali^^tíun fbrrnulnc^ u a scir-organizcd Ic-jmiíng procesé Fitwwijj ofrtw /JjtfftMMr ftr? Sígncr/v. Swww. fldrf CMiputor, pp.Mft-350. Pííific Grove, CA J-Laykin, S.. and C. Deng. 1991. “ClíissiíkariMl i>F mular cluLier usirtg nínral iiei-wOTks," IEEE Thj^ó-flt ffcHró- c?n A'cNrfj/ Atrwwtr. vol .2, pp.589-6<lU-. HsKykiíi, S.. and E. KíhJíd, cds.1998- Spccial (ssue nf /^rKíc/írpgj / Jjí It'L'E on Súpan/ vnl.SS, a HF lanzado. EKybfjTi. S .. nnd J. PrinLÍpL", 199& ‘"MakinJ KHM OÍft CLunplcT wlifU: lJ>in^ itcurul nizLwr?rk^ Lu dyiiainiiziil ly [dímÍeL lzIi¡mj[ll~ WCntt fUth M K9 cLueelt.'1 IEEE Sr^ntii PrxKf$}ÍHf .Vúisftrzrizü-. vü!. L5, a Mr Lajeado. Híykinr S,B 'A SlvtiwaunL l1 Wfeber. C- Deflg» fl-nj Lí, MannL 199Í. “ClkHificvthiri of lí^Jar cluttcr in air -;ii'_'il- ítmcrol rnv ronmcnir' E^L'íVLÍprgí ü//Sí f£E£, vül.79_ pp."?4L-772. Haykin, 5., P. Yec, and E. Drrbcz. 1997. "üpi mum nonLincín tlltering," /£££ Transuclioju o?r Signa/ frocíS-Tijig. vol.45, pp.2774-2 7S6. Haykin, S., and Q. Van AA:cn, I 99fl.. SjjpuhSureffjj. New York: Wilcy. Hcbh, D.O., 1949. Jíe a/'0fA¿rvj^.*.4 .Vírj^p-si^nlngj^dí Ttwj. New Vori: Wilcy H<chi-NicLscnt R., L995. 'RcplkaRX ncaral nclwwkg foruniversal úpamaLscurce wding/' Atoict, v&l 269hpp. 186d-1863. Hcehi-NiclsoiL R., 1990. .VridnJ^jrtr/jrjjjriv. B.cíd.in^t\lA:Add¡snij-Wcs|tyB Hcehi-Niclson. R.t 1987. '’KolmcgOTflv's mappiflg neural nctwork sristencc Lhwrcni,Vr^r/EEE/ri¿tY^r¿rfrürwfCffli^n!!w nri jVt-wn#} vol Eli, pp.l 1-H, Sun Diego. CA. Jlrklroin. CW.. 1968. Srarúrrra/ ¿kíccrrárj. 2nd ediliun, Perganuon Press. I LeraulL J., and CL Juílcn, 1994. Asww AfeunuwuF rr Jrrrj7ci?ic^rr t/jr Sígrju/. Ptrta; I Lemes Puhlishera. I Leraulr, J._ and C. Jullcn. 1986. '"Spacc ortime udaplho signat prcKTSsrng by neural net^ork models," in J_S. Dcnker, cd., /Yeuraf AfatHwfcJfcrr CDmpirrrng. Procmlings üf ihe A1P Cünfrrence, American Insl iulc of Fhysics. New York, pp.lM-211. I lerault, J.+ C JuHcn, Md 13 Ans, 1985. "DelecLion de grundeur&prímilivcsdans un messiigetoTnposiLepiir unearchiIccíurE de cakul ncuromimeliquc un apprerilisragü non supen iít" jP'fwbo’w/es GA£7S¿ Nrcc, Francc. Hettz, J.,A. Kjugh. and k.G. Palmer. 1991. AiftuArctiMltortw7fewy<3fAfeifra/Cor?r/?Nf^frí?n. Reading, MA: Addiscm-fttsley. L teslenes- M.R. _ and C. Slicfd, 1952. '"McIívlhJs üf conjúgate grai.1 ents for sol -: ng. I mear systcms," Jnmul n/EfSíajrA ¿j/ rAr Mtttaiurf Íhfiytn StandandFr voE.49, pp.469-436. Hcthenngton, P.A.. and M.L. Shapiro, 1993. '’SiinulaLing Hchb ücII ssscmblics: The ncecssicv for parliliontd dcndriiic Lroes and a port-not-prr LTD nilc,"1 MeftHHit; voL4. pp.l35-1 53. hhller. ES., and ü.J. Licbcnman. 1995. C^ervU^nj 6ih edición, NcwYník: McGraw-Fiill I linum. O E B1989 W-innectionisI leaming pmnlurca,"íÍf-^/ícJb/ vol_40. pp.l 85-234. Hinton. <j.E.,1989.n"DetenninÍRdc Bollzmann machine IcamLng prrFnnns jlccpcsi ÍCíWUf ¡P wcighb spflíe/' i¥nraf Conyh/trj/füjr. vol.l, pp. 143-156.
HiriEonh (j.E„ 19R]. "Stupc rcprc&cntaticin in parallcl systcmsr o/thf Jtk inlematitmül J&int Catiferciwc t»t /frtf/rrrtfj /ni,(’íífp7J?rr1 VjinCOuvin-, Eh r..^'i Columbb J-Emion, G.E., P. Dayan. BJ. Freyh and R.M, NkiI. 1995. “The "wikMleep1 dfccriHhm fbr unnpervircd neuí&i networiu?1 iYrcurc, vol.lóS, pp. L158-1L61. H.nton, Cj.L.,and Z.-Cihahramani, 1997. ^XJtrtertiírrt mudéis fbtf dittúwrií^g hparyedistrihuC«lrípreéCil1a[¡cnsJLFArycwcipfl/cflí ftwUQttfPlW q/ fifi ^íJjwrfÁtMderr Áíftcs F. vnl.152, pp.] 177-1190. HiniM^GÉ, and SJ. N-nwlan, 1990. "‘The hoclslrap W idraw-HuíT rule As C luslcr-formation alguridim,L| Nrorcrf Ct?mpuíaIímrP vol.2. pp.355-361 Hifllflti, G.E., snd S.J. Kowlan, L9S7. ,_How Icaming can guide nxsluiiün/ Comp/ei Susíems, vol.l, pp.495-502. G.E.,aridTJ.S4jnmwki, L9S6Ln,ljeamingand nelcamingin Boltmunn machines/in HrrcTWííDis/RÍJNícYfrtnrmíi^: jft .tfrrm.uflrvrirrf c?/'Cr]i_í#íjJ6'N1 D.E. RumeELhari and J.L. McClelland, eds., Cambndgc, MA: MET Press. Hárten.GJE..HMT.J.&cjnmvRkiL 1 -9K3_"'Opr.mal pcrccplual infcrencc^ Fjneci»Jj^jsflfjrEffiC¿?j?jpNfcjíficr4?íi: Cn^r/¿NUJ?cc (íj? Gcjmppiírr Urtoft ürfJ fljiJt'FYi pp. 443-45 3-. Wash nglon. DC. Hirach, M.W., 1989. ^Cüiiver^ntaclivition dymnúcs ¡11 cvrilinwus lime ndwürkR/Afew^MMwta, wl 2bpp.^bJd9 IJirsch-j M.Wh 1987. +±Coirver[eMe hi nete," Ffraí /Ej..1, l/tíffíwtiwtíií m iVtjrna/ Afefrurtj, vnl. IIL pp. 115-125.. San Lhcgu, CA I Iih<,¡iM% . ; r ¡1 5. Simle. 1974. EpJnrrjHriv JwTPW. ¿ínJ Sl\v York: AcadcmLc Prest. Huchraitcr, S.p 1991. £j,Hr/crTrírAji,Jigx,níiJ^wrPij1írA^r^4'rjmnrj/r^ Wrtfíri, Ripluiii^Tlb^iN^Tuctiahij^hc EJnivCrsitai Munchen. Clcrniajiy. Hochrri-Ler, S., and J. Schrnidhub-cr, 1997. "LSI M Can ttilvt hnrd hmg nmc lji(prabk^ns'M-r/r^r<-ej: Ñí A'cñtct/ Í^rnr«í?oj? Processing Svsfcms. vul.9_ pp.473-479. Ciihbridgt, MA: MET Press. I Eudgkin, A.L., and AJ. Hvtttey. 1952. "A quamilitivc denripckin of nbcmbratie cwrent and ib ípplkadon 1o condición r-:! ttcdUtÍM in ntTve/ ^JurJT{7? Vfl|. I I 7, pp.SM-5J4. H&lden, S-B., and M. N ¡Tanjan, 1995r HOn Ihe practicaL applicahility üfVspnLk-Chen'cmcnkis dimensión bnundH/ Newnf CGM^HrtdíÍM. to17b pp. 1265’1280, Hi>llandi J ifl Cambridge» MA: MIT Pjimr. I IfipcreifL J.i and U. Ullmu^ 1979 MtrodtoJM 4u^j-mrjj<j Tfrewj-, £tí®sflger G^j^i^íÜottP Rcadin(h MA AddittO-Wcslry. Hopfietd, J.J., L995. ‘"PalCent nreo^niciem computa-litro using airliün poícntial Ümd^g for stimulus tcprrrenlalitm/ wUTOBpp3í-3fiT Floplield, JJ.l 1994, "Neurfins, dvnamics a^díoaupuiniion/ FAiwhm vnl.47, pp.4CM6, Fefnuaiy Hopíirld, J J.t 1987^. ^NíC^irlí^i CtwnpUiíJlinns, 1 jogic, and Noisc?' JEFE//tJdrviLrJj^riüj1 Cu^í.tojíl.'í rwr .Vt^uru-j1 .V^íiiyj^Av, vy| la pj^lQT-liL,. San ETíújjú-, CA. HopfMd. JJ,, LM7h '-[.eaming al^nfithms and pnohabiEicy distribuí ions in íced-íorward and íccd-twcfc nctworkfi/' r^"rftí AüfrflÑJÍ^edJe/ur ií/'Scdenccj, CY4_ vnl_K4, pp.8429-H433. Hopfield, J J., 19H4. "‘Neurcms with graded respernse have collcci: ', c computal lotnal propcTlics like ihore of Lwo-JTLaCc -nrurans," ¿f/Wjd jS¿?rÑJrli1jjl ^LúLfeNj1 oj1'5<d£Fjecs, Í--S4. vol.81, pp.3ÜH-E-3<JP2. Hopfield, J.J., 1983- ,LNcural neL^oriísand jihyBical syslems WLLhímrrpentíúllteiiMt üüfflpuLaiiünal dbiliüiüs/ALicwJjjrgr qf 'rftí ArjarrcMwri 4ccrrfcjnr d/ ftipsoes. IÁ£4, wL.79. pp.2 554-255 B. HopticlcL J.J., and D-W. Tank, I98fi. "LompuOng wilh neural cireuils: A modcl,"- Scfcjfcc, ™l.233, pp.625-633. Hoptield, ÍJ-^and llW- Eiinlc. 1935. Neural' compuCalion ofdecisions ]n optiiniEation probtcms/ií^I^c»/ C'L^c^nefícsP vol.5Ípp.l41-L52. Hopfivld, JJl-n [>X FednMin, and E^GPainw; J983- ILIUnLcarnLngbhas a scabLLizin^ efTecl i 11 wHwtjvc mcmnííei,’ VükW,pp.|3S459. Hom, B.K.P., 1977. HUnderslanding intage intensitics/ vol_S, pp.201-237. HíhiilIc» K_, M. SUnchcombc, and H. White, 1990. "Universal appnoymi'li.in ofanunknown mappLngand lis derivativos using mullilayrr feedíunvind nctwürksr' Atjrrof Aífuurfa, yüL.1» pp.55 L-560. Hornik, K., M. SlincEicombe, and H. Whíte, 1939. '"Mullilayer fwdfonvard nctwürJtE are univcral appnosimators/jVcwnaf A'ehLUHfcr, vúlJ» pp.359-366. Ikiueliii^, ]-[,,. 1933. LAnaly^ !i ofaeomplcn of sJ3E.jjic.31 wsrisbks inm ^i.cieipal cúenpüúenís/Amr™! Fs^a^v, vol.24, pp.4 L 7-441,49ÍI-520. Hubclr D.H_P 19flL £jw, Fra/n, crnJ Hrim New York: Scientifie American Librare. hubeL D.H., andT.N. Wiesel, 1977. "FimcLiónal dütecftreofmacaqüe visual dflrtest^^raccfflJjngi úfffte Fcn aí &crrn: B, voi. L 93, pp. 1-59, London. Hubcl, D.lí, and T.N. WiescL 1962. “Ruceptive ficlds, binCurulur IrttHUlkm and funcional arehiífiCftire in llic tufa visual Dudes,hl ÁHrrocr/ ü/’FArsjo/og)'. vol.1.60, pp. 106-154, LumJun.
870 ESrñi itx;x * fi * HuberT PJ.19R5. “Prajecikfi pyrsuii,” ¿ifSAjfjj.fjLit, wl. 13, pp.435-473. Hub¿r. PJ.,l9Al. jÍ/jÓniJ SftrJjjVjei. New YiJfk Wíley Hube?, F.J., 1^64. “Etubusi esiimiiiiün uf locací-on paramclcíT Aunáis rf Mathwtatiad Statistia, vol ,35. pp. 73-101- Hudl. D.R. 1997. "[.Mining fcom cxamplcs: Fram Hicory m poetice" Tnlflfíll J4L /997 /nff'rjaíuvwí CctnfWiCf iVfirnfJ AfeftKflb; Hnuslon, June. Hush, D.Jtj and U-CL Honnep 1993 "PrOgress ¡n nperviwd íwural natwurfo: What’s new since Lippmann'.rr JEEE Signa/ JWétjojíft^ vol. HJ, ppJ8-39. Husti, D.R., and J.M. Salas. 1988. "Im-proving (he le-anung tuLc oí bjick-prüpagfllión svillb (he gf-adieiit ncu.sc algorilhm? ÍEEF Jjtiemartwaí Cflufcmice orj Aíeunuftafnio/'b, vol. 1, pp.44]-^, S» D Cgo. CA. Illings wurilk V., E,L. filasen, and l.C. Pylc. 1939. üie/rafijn' ^Cdrpiprrrrig. New York: Osfurd Univírsily Press. InCralor, N.. 19^2. “Figure cutracLion ming an unsupervised neural nelwoik? JVírircrí CíJrtpüíírtdh, voL 4_ pp.98-107. Jíiakkol-ii. T.. tad M.l Jiwdan, 199fi. ^Gomputn^ uppcrand lowcr bounds on I i krl iboods in inlracublc ntlworks? in C. HorwítZ' «L, lf?^.tí/wp ufl UriCi^^ríJA' ftj Jfri/f-chi/ ÍJífrf/igenco. Portland, Or. Jackson, ti. A.- 19B9 flP^ptCÜW^WMWwor Pljiqjhjcí vol. I. Cambridge: Cambridge Universlly Prtst Jnckson, E. A., 1990. fltrtpftXÜW? qfMMfltasr PiJkrjriJot. vol .2, Cambridge: Cambridge Umveraity Eta. Jack-sun, L.K.H.. 1919. "An arder of convincente Ibr some radál basü functions? JAf.4 Jbu/nof rjffjjaít, vol 9. pp. 5Ú7-5B7. Jheksüql. J A 1975- C^.-=í/r¿2¿ Fteefiw^iflnqfcs. 2nd cdhion. New York: Wilcy. Jacobs. ELA., 1990. ^¡ut DccOfTipcsilKW ThfoughCompulatmn ¡na Modular ComwctMfflist-Aríhircctuno;" Ph.D.Thp¡ÍRt U:nvcrsily trf MuuchUMtts. Jacobs. R. A., 1988. "Jncreiised nrtesof convergente ihnJugh leammgfale adapcaliflnrMewmí iV<-jMiyr+á. vol. I, pp. 295-307. Jacobs. R..A., and M.l. Jordán. 1091. '"Lcaming pirLtwisc control slTuligies in ü medular neural ntlwurk inohilrrlura? JEEE TíwiMCítonf cw Si .wau. Vfafi. ¿?fjJ Crfjcnacfjcs. vfll.23. pp.33 7-345. Jiootet R. A.» and ML Jordán. L99L ila.competitivo modularcmmcctionisi ardhiteciwvT’^^^* V.-i.'.-.i1 Atwrsyprg Smtvny. vcl.3. pp.767-77}, San Macc<\ CA: Moqpn Ksufmanri. Jacobs. k.A.+ M.l Jordán. S.J- Nowlin, and G E HiiHonJ99la. "Adapib e nifflluYel OÍ Local eyptrts/'Afeírtr/ vd). 3. pp. 79-17. Jacobs. K..A., M.l. Jordán, and A.G. 1 Jarlo. 1991b L,Tusk doLomposition Lhrough compet liun in a modular conncrtíonisC üTL-hiLL-eiuie. The whar and whene víhíoíi lasks," -C^rJ/rAr 5c¿7icf. val. 15. pp.219-250. Jayanr. N.S., andP. Noli. 198< Huve/ánnj, Englcwood CLLíTs, NJ: Prcntiec-HalL JayncH, E.T. 1982. "'Qn Ihe rationale afnuDíinium-cnlJDpy methods.” Pjocccíñ.1^qf-f.be f££E. vol. 70, pp.939-952. Jayncí\ EPT, 1957. '"Informalion Lhcory and Aliniral morhanics," Mjnku/ Aevíenc vol. 106, pp. 62Ü-Ó3Ü; "[nfonnation thcory and stalislical mechante II" vol. 108. pp.l7l-lc?0. Juwinsíi, a H.% 1979. StactofEf ftaw.rcr owrf FWferiwg Tiraiyt York: Aeadcmic Press. Jelinck. F J997. Srtíí.víj'cíjI MMwh J6r Ax^rín'wr. Cambridi^ M A MIT Press JohMUOn, &.M.> L U. lKiwl;t. md D-M. Ghim.íiii^]i. 19^0. ,LR.íi£k-pcvipa^iiion Icaniln^. for rnuhi-layer FeídfbTw-iiTd ncuial MfwofkK usingtlie coftjnavteiiadimt methMVRflportVCRL.-JC-104839^ Ijwihkc LivcníMnc Na:¡onal Laboratciy. CA. JohnBon. D.S., C.R.. Aiaüüíi. L. A M'cGeocti, udC. Schc^on, 3989. "OplimiHiion by simulaird annealing: An cipcrimcn- lfl| cval nal ion." ÍJfiem/mis vx?l..17. pp.365-H92. JolUña. I.T.. JÍRri fWflC^ptrf .4j|fllr.f¿f. NcwYwk; $pnngcr-Vqrl?g. Jones. J.P.hand L.Al Palmer. 1987a. “Tbe two-dimensionaL apaliil Etrucbnof simple ncepdve ílelds in cat suiaic corles? -Jrjrífflflf fj/ iVj zr.rrijrif.'i-.TR.iM.i^L: Vül 58. pp IIB7-I21 L Jones. J. P. híiid II A. Palmer. 19p7h “An mlu JtÍM of ilie two-dimemi hhí G abor fiker modal off siin pie receptivo ficlds in ut sItíMcOHtex.1" JrJN-rwííj/AfewistpAjtifdflüigi-. vúLÍB. pp. 1233-1258. Jones. J.R.A SíajKNHki. and L.A. Palmer. 1987j "The tWO*dimeittiortÉl spcctral slrucruTc ofsimple neceplivc ñelds in cal s1íiale c<inú!i.?.Júurj?ijJ ¿jf iVí^jTí^j^i.YfoJrj^i.: v(il. JSa pp 1212-1232 Jordán. M.L. 199-5."“A Flarisrical approach lodccifiifHLtrwmodclin^"fWMÍiífSwwtrt JCI/CcíJFfcJíñce on r/jcofT. New Yori: ACM PrcR< Jordiintl-1.l.. 19^h. ‘'AlirtEtórdynainL-cs and paralleljwri ina LViinicerionL^tiquchiiaLilLí chine? TírcE.'gAx/r^jprjrjcTyCtwr/éfc/Fcc o/Wk1 C"oi[jrífíL<'¿cííjiíl'Spcfeíjí pp.531-544. Amher¥t>MA Jordán., M.l. cd.. I9M. hj CjxrpJuc-rjJ1 BMltn: Kluwer Jordán. M.L. ¿. Ghiibramam, T.S. Jakkolla. and L.K.. Saúl. 1998 'An irnrLHiuccivn Lo v^riarivnal methods foi gjaptiicaL modelar In MI Jordun. od..¿mm!Íng jfi Gn^AícHf Mbde/y, Hüsron: KLuwei. JordíUiuM-L. and El.A. JK0hah 1995- '’Modularand Hicrarcbica: I .caming Syslcmí? in MA. Arbib, ed., Tfirífcrndbonitof flíiii.’t rjjínri-jZÑLf A'd'rjrti/pf>i379JR3B Cíirnbndge- MA: MIT Ptess..
Jordán, M.IH and R.A. Jacobs, 19M. 'Hícranchícal mixluncs of «pífll andthe EM íilgorichan,” A'crjín/ Coírr^rj/erfiorj, vol.6, frp. | SI -2 14. Jordán, M.1.hand ELA. Jacobs, 1992. ,-EiicrarchtcsofadajílivúexpertS,,L.4íA Tercer fe AbaraíJn^ixniHtfhM vol.4. pp.9E5-992, San Maieo, CA- Morgan Kiivfmana. Joscph, R.D.> L 9641. "The numbtr of Orthants in n-B|MCe InttrtttLtd by an s-dimensional subspacc,’' Tcdmicíl Mtihü d, Projod PARAi Cortwll Aertmauiical Lab.. Bu fíalo. N. Y. Junen. C.B and J. HetaulL 1991. -Blind sL-pumlion of sdutccs, Part 1: An adaptivc algorilhm bascd on neuroinnniíLk KUtKtUR;" Srgraf Fnm'JsZng, vol 24, pp. 1-1-0. J .1L.. M.M. Mcrzenich, and El.P. Killackey. 1983. "The rcorganizattnnof sorrisrosctisory wrlex íbllüwing pcriphcral iwtve diimagc m idult and dcvrLeipmg mammals,"' Ziuruol /íci jíh' q/"Afeawc/fflWE, *üL 6. pp. 325-3 56. Kailath, T.k L9M.. ¿¿irarS^JeHU. Englcivcod Cliffs, NI: Prcnliec-Hall, Kailath, T.d 1974. \A virwofthrec decadcs-nf linearfttteringlheory,"1/E££ TrafWfJtíru^ryo//^,fijri^rni7í?.ir T6coft. vol. LI-2Ü, pp. 146-181. Kai larh, T.p 1971. *TUCHS appr-Daehlo dctcetion and cslimalion prohlcms - Parí I: DetermrnisÜC sigitak in Gaussian noLser" ÍEEE TkttrtMOkMt q/V^íirwflfrcui JXrwy ral. IT-17, pp. 530-549. Kailath, T., 1968. “Afl innovations approach tD Irasl-squares cstiniation: Part 1.1.incar fihering in addíthv wNte notsc,'" ÍEEE Ínr/Tjflcrwrjj qCíiF/oflf-aric Confro/P vnl. AC-13, pp. 646-655. Kalman. R.ÍLP 1960. ,kA ncw approach 1o linear iiltcring and predtclion problema" Ttwwffforu qf Jdííjtjq/q/' jS-qíj'l EfigjjuMnng, vol. B2, pp. 3 5-4 S. Kandel, E.R_, and J.H. Sehwartz, 199]. Fríncjpfts eíf.VewraJScrcnce. 3 rd mí, New York: lilscvicr. Kan£ashJ.,T. Kohoiwn, and J. 1.absorten. 1990,“Vari-imlsof self-urgínizingmaps.,’/¿"£¿'7>UÑ.wcl,Jrwp.f om .VtTjm/ Vdtfuwjtj.- I, 93-99. Kanter, I., and H. Sonrpdiuky. 1987. “AíSOCiKlve nealI OÍmemciry wilhouE errurs;' Wprícii/fcvtaM voLJ 5. pp.380-392. Kaplcn. J.L», and J A. Yorkc. 1979 ,LCh¡>.ii i c bchkvior ofm ulli dtmensiona I di flfcncnce cqual ions," ín H .-□ Pcitgen and H .-O Wülker, eds.n frJrtfriciiwiffhfltvit'Hfttt/ EqwricMrj uarf4pjn¿uvf.r?itfLíom o/pp.204-227, Berlín: Springer Kuppen, UJ^índ F.B. Rodríguez. 1098. "Eflkicnt Icaming in Boltzmann machines usin^ linear respciise Iheory?1 jVrwna/ CtwnpN/rjJÁur. vol 10, a ser Infido. Karhunen. K., 1947. “Uber I intare methoden ín der WaJi^sclKl^lLchkcLlsTlKhn^Jlg1’, □fwifl/tif ^¿hfrwrr.uT- .SdeWtaHMtF^Puajc1. SericrXI: MtrrJren»í4iK'«-PhvriüOt voL 37. pp. 3-79, (Traittl: RAND L'nrp., Sania Ménica, CA, Rcp. T-131, Aug. 1960). Kartiunen, JLP and J. Joutsmsalo. 1W5. "General izations nf principal compnneni ansJyiÍB. opcimiziiliun prcblcms, and neural ndworks^ Mnrraftfeftmdkr, vol.ü, pp.549-562. Karpinski, M.,and A. Macintyrc, L997. "Polynütrii*| bnuiids for V-C dimensión tlfisi-gmoidal and general Fia litan neurona! nelwoiks,"1 JbunuJ o/ Canijndar cifiJ Ji'.fkvH Acjídcf.v, to].54, pp.S69r I 76- Kalagin, S., and E. McDcnnott, 1996. ''Disertminalivc tnining - Receñí prx^rexs inipeech nx-ognilion.''' in CJ4. Chcn, L.F. E^au, and P.S.P. Wang, cds., q/ PiJirerd £c.‘-Cf^rJÍtiort¿¿íjíJ CnmpH/fr Ejyínn. Jnd edilion^ Singaporc: World ScKfltífk Publishing. Katz, B., 1966. AferMe. Aftcreíe¿uní 5j Mapíe, New York. MeGsaw-HilIr Kawamoto, A.H^and J.A. Andcrson, 1985. ’A neural nciwftrk nu^lel ofrnuliÍKEíihl<-peT<xp1ionk,,'/lc/¿rFiTí'A£i/ogjefl1 vol.59, pp. 35-65. Kawato, M., H. Hayakama. andT Jnu], L993. '"A ÍDmard-imerse c-ptics model of reciproca] ccnnectíoftt bvlwvcn visual ourlicaE arcas?' vcl.4+ pp.415-422. Kayp J-+1992. "Fcaturc-discovery under cnnlestuaL suprnistníi using mutud informatiücii” /nJe^rírrwntry ^?rj?r Ccw/rfCFrcf dff A'fNFYTj1 Nanvorfa1, vol. IV. pp.79-84, Ballim-Dre. Kcajnt, M1996. ,bA hound on tfw CTW oí ero» vjlidaiiuai ming i he apprvs iination and cstímaLion ratea, with conscqucnccs for 1he 1ra¡ ning-letf split/ xfc#wwtc¿j fe /AffWHcnfen /^ucr.^ÍJrg Srj/cr?u. vol .S, pp. 183-189, Cambridge. MA: MET Press. Keamsk M . inid L.G. VHiuií. Í9R9. "Cryptographic hmitattons on leaming Hocican fonnulac and i inhe flitlnnwa," Pmrívz/rng.r Bwfflfp'firtr 4whíi/ 4CJW Symywfeffi í?rj Jfrrory q/'CrwpÑ/úr^. pp.4 33-444, New Yurk. Kcams, M.J., and U.V. Vazirani, 1994. .4^ femMfecrfett M CampHtarfeinu/¿eíiFvrúrg Tftcwv. Cambridge, MA: MET Press. Kcchrioli^ G., E. Zcrvas,and E¿. Manolakos. 1994. “Ufing ncunent lu-nnjd ndwurks íbrüdaptivc tommun calionchanncl cqualtzaCiorC 2£EE Ihuiracrfons twr Nevrof .VefwflHb. vol. 5, pp. 267-27A. K.eclc^ J.D., 1986. "Hasans of aclraetiün of ncurat nclwcrk modeh™ in .Vl i/a-jJ VrrMY?r¿< ftr J.S. Licnkcr. cd.. pp.259-264, New Voris: American [nslilulc ci’Fhysics. Kcllcr, JR.t 1976. *lnvern; pnbleQH," jfanyiaur AfaJfcjmrtnxrf iW^drfi/i, val. 83, pp. LO1?-] IE. Kclsop A.H. Gancng, and T.FL Broun, 1986. ,fcElchbian synapsrs in hippocampuR.,n Proetfíí/jjrtfjí q/‘//rt Mtí/ow/ .frniteNB1 q/'.Seíffice.í. í.'.V4, vqJ.83. pp.5J26-33M
Ksind. M.B., ft Brown. and HJXl. Abaibanci. i 992. ''DeLermining mínimum tmbrdding dimensión using a gcümetncal COUtHKtWDL1 PJiLiJía/íírfflwX vol-45, pp.3^01-3411. Kürlirtn. P., and F. ValLrt, L W1 HRübustness in mullilayrr perceptrons;" .Yrura/ Camptírtr/j-arj. vol.5, pp.473-4B2_ KiikpalricK S., 19M. L,0p(irTnza1iern hy simularcd annealing. Quanritativc StW&H," AwnM? vnl. 34, pp. 975-98*. Kiripatnck, S.. and D. Shcrrington, 1978, “Inliniie-Tunged tnoddl of spán-fJtnBT EÉJíTÍíMV ffcwm Svrics B. wul. 17, PP.4384-44O1 Kiripacrick, S.,CLDl Gelatl, Jr.,and MAVecch.. 1983. L,Qptimizaliwiby simulaled ajmcalLTig,,LSr^cmrc. wl.220,pp.671-680. Kirsch.A-, IW6- -^J to MrtbBHfrtfaif H«jryo/AnCT'jf FraWer?up New York: Sprimgrr-Yrrlag. KImk, S.Cb 1956. '"Rcpresentation oFevcnts in nenmets and fínile autómata?1 in CIE. Shannon and. J. McCarlhy, eds.. SrkJjiS.í, Princcton, NI: Prinoelon Umvrrsity PresF- KmcntH, J.J97L o/ £"codL?mefrrcjP Mcw York: Macmillan. Knudsov F•>• S, dul.sc, and S.D. Estcrly, 1987. “CompiítaJional maps in the brain/ ^jíunlJi1 Ñci^k üf AfeunwinK val. 10. pp.41-65. KocK C , ind Ir Segfv, cds., 1989. wrA*CWM¿ Afade/úrg: Fhüai m AfefHWjtr. Cambridge, M A: MIT Prast, Kocb, C . T Poggin, and V. Torre, |9B3. n,Nímlinear inlcractions in a dcndritic tree: LíKatizalicm, timing, and. role in in formal fon Frr^t'ú'jirÑX.f í?/jVíifMííJíj/jlL'a^wrv cj/'Jcrvwítfi. t/S4, vol.80, pp.2799-28Ü2. Koch. C.. and R Mídiur, 1996 -'KcurnmcHphic visión ehipsC/jEEE^wc-jrjírTi, vol-33, iickS, pp.JS-46. KíihrtafcCn, T, I997l “ExptoflUion vtry large datahanes by self-íHganizing niípi/' JJW7 Afftmrttaiw/ CwyfenMC# frn .VíN^j/ífenrtrtr, vol. l+pp. PL1-PL6, HfflHkn. Kohonen J'.,1997bi-íc^-í^r^wnjzjTrj; 2nd cjitinn, ñírlhr SprfagH^Vüda^. Kohonen- T., 1996. 'Tmergencc of invarianí-feilure deítCLCra in (he adaplivr-subspaec sdf-mganizing maps," Siofogical Qrteiwffcíj vq|.75t pp.281-291. Kohonm, T.J993. "Fhysiolo.ccal ¡inerpfflanon oflbeseiRcitjtaniHii^map alj$oriiln>CWeNnr^ M'mvr+j. voL6rpp. 895-905. KohHfiU T., 1993- "T'-iiigs p«l havcn'l heard about thü Mlf-orga^i.-i-ig Íimp/" ¿i/j+c /EEE /nícmcrtionaí GMtftnwiítpfJd rtnraf «miwifcy. pp 1147*1156L San Francisca. Kohcmen, T.. 1990a L,Tht sdf-orgjnizing map,"1 PnJLínt/jTrgi íj/tfc AktfftWf o/" Eictíricoí úttd EJccfrunrcs Ej?g¿?rfen. VL>LT(,pp-l4*H4ÑÜ KnJKinen, T., I 990b. "[mprovEd yctrichií oflearairig vector quanEizalitm/" JEjK-Jíiúj/ MwW ,\úTh íínLv. vol. I, pp.5^5-5501, San Diego, CA. Kobonen, T., I988u. “An iirtrodiicdfln (& neural eompuiínj? iVr-irnuf Afefhwfcf. vol. kpp.3-16. KoJwnen, l98Sb ¿mr? 'iAWfatftaf .WcffK?n'. 3rd «JÍL¡onh Ne* York; Springer-Vcrlag. Kobcmcn.T.JSSRc, The 4mhT pbúnetk !y¡K-*T¡ief.w votlli pp. 11 -22. Kohorwn. T. 1086. "I.^rnin^ ^-ector quuHultni Íbí (uehíh hmojíi i: .i in? 7brtRÍCUÍ/í(7™-f ÍXflf-FvIóíM, Helsinki UflivcrMly i>f TecbiHilotíy. Finland. Kohcmen. T.. 1982. '“Sclf-orpanizcd íormat cm of topoiogically corrcct íeature maps,” volAl, ^p.S9-fi9. Kohonen- T., 1972. "fonrclarion maírn. mentones,H J£E£ Íhutoí^bnu «i CarwpNfm-- vol. C-2 LP pp.353-359. Kohonm- diul E. Oju, 1976. “Fasl Miipttve fcnhílion of uílhuEínalizing íilteni and associative mcniory in nccurrcnl networiu for neuwi-lihí etemenur ‘-oULpp. 85-95. Kchcinen. T, F. Qjar D. Simull, A- Visa, jnd J. Kangas> 19%. "EngñHTIlg applieaciLuts of ihc seif- orgamzmg map." JEEEi vol.S^, pp.]350-1334. Kflhonen, T., E. RcuhlalaL K- Mákisara. and 1- Vamip, 1976. 'AMOCiaUiffl mil flf ilMfles," Efoíygjraí Criemefre.T, V0122, pp.l59L)6í. Kohcmcn. T.,íj. Barcia,and R. Chnslcy, 19S8. '^laristiea! pademfKQpílHnWÜh neural nelworia: BendimarlcmgstudiM" J£EE faaprMftonaí Lcw/tzipirp ñii Nea^uí Mftawfc «□! I, pp- 61-6R, San Diegus CA Kohonen, T., J. KangaE. J- [.aakEüncn, and K._ Tnfkkola, 1992. ",[.VQ-«PAK: Th¿ !c:n-ii: g vecUN" iqu-iinLizaEini Prograin Pac! aj^.” Helsinli Eniveraiiy of Toehnology, Fínlflnd. Koiran, P.. and F,D. Seinrag, 1996. "Neural Mtworiu wilh quadnbc V-C dimensión;- fa .Vfrjrtj/ vol.fl. pp. 197-203, Cambridge, MA: MITPw- Kolen-i J.F.,and J.E3-. Follack, 1^90. "tíaDkpcqpagalicmissensitivoEoiniiial cnndilions”vol4^ pp.269-281 *. Kíilliín, S t y.nd D Anuturiou» 1989. ,LAn adapLive least squaTCE aLgorilhm for thc cílicicnr tninhlf of artificial neural nelwüjks,"' fEEE Thwoctfw oq Cfrndfr ¥0136, pp.1092-1101. KüíLlis. S., and D. AnaíLasiiou. L98K. "Adapcivclraning of mullíIfijer neural MlWttrfcl using A Leasl sqnarcs estimation lechniquc-'" /£££ JíUeniafional fifam/ M/HW*Ir «I. I b pp.3 83-390. Í¡jn Diego.
Krlmcigürüv, A.S.d 1942. "Intcrpuhü-ün and wcir^potalion of Mac ühíit? Tándem sequenwsr Iriruliíed by ihe Rand Corporal ion, Santa Mónita* CA., Apn) I Qfr? Kcsko. 13., LOT7. Fuzzl Ejrgmcmjrg. Vppcr S;i - J' Rivrfh NJ: Preiuke-I Cali. K.flsko, B., 1992. AtjrnfJ AfefUwfa fidrf ^nzzt ^V.r/euu. Englewüod CliíT^NJ: PrenLicc-Flall. Kbflkah B_, 19S8. ‘Bidirrelional MUCÍativt: memoria," JEEE TrcTUír-icífí^ry cW Srjft'w. lifrw, ítfjJ Cinfrcnrr/rcj. vul.18, pp.49-6fl. Km.lamen, R, 1993. L,SirnulatiMB and implcmcncnlions t>f netiral nci works For principad conponent analyiH," EZcrPwírj /íc/mf? J-PJ, Tampre UniversiLy oí Technolcigy, Fiidand. Kr&iijvcld, MA, and R.P.W. buin, L99l. -Genera QCiM Ctplbllítbs OÍ rrtimrnal kerrid-bu sud networiu/1 M-RwRTfídM/ -forrjf roí I. pp.84 3-848, Sealllc. Kthhwt,AH, andA_ SajigL-ovajini-Vincrntclh, I9M. LLftkienC parallel leamingalgünEhms tor neural nc!wvrk5,lhXifHim» Al Ht^Fdr^j/íWHúJJíMj FrTXtfiíJÑtf Sl'.wíjis. vq!. I, pp_ 40-18, San Mateo. CA: Morgan Kauímann. Krtimer, S.C„ I Wti. “Cocnments wi cansí rucdoc Icaming of recurren neural nclwnrkñ: LimiLBlions of recurrcnt caseade COnrlatÍM iArtd ¡I ainiplc SOlUfliiC»^1' Trunxfic/mfiA r.i/r .VcHraí Arfu jíri-Y. Vftl.7, pp. L047-« 1049. Knmer, S.CL, 1995. “Chi ihe compulBiíonal powef of ElmarbMyle rKUiml wtworiw," IEE£ Th^^crúiJw m ¡Vtaraf A’^wis, Kd.fLpp. 1000-1004. Kreys-tig, E , r-;S8 j4</raftced EtygfeMttfeg Afofeffidflfa 6ch ed., New Ynrk: Wilcy. KrifhnamurEhy.A.K...S.C.Ahalt. D.E. Mellon, and PiChcn. 1990 “Nttmi nelworks fbr YtCtorqUMíizvtiauof speivh and ¡ntlgesr IEEE-JcWJT-i?/ C'f StItGMÍs4 r(tÜt jn CiJPimwíHCüIífijrx, vol .XB pp. 1449-1457. Krr>iak, A., T. Lindcr- and C. LuguL, 1996 "Nunpflmiielrie rSIíiAéiíoH tnd cltt*^ffca1 ¡M USÍRg nadijl ha*™ Fumeímh™ IEEE TrcTFjscrci’íyn.v M Afetraí voL7, pp.475487. Kufih । C.-M.i íind K. FfcnuJc, 1991 .'Xeinraipnceofkarinnj algcrilhmf widi ccfisUitt lotmbri p^’’ /EEE TíYur^ettaM Afi'wncrf ^i>L2, ]jp.484-4A9. Kuan. C.-M., K. Horaik,ind H. White, 1994. "A «Entfgence rernlt Inr L-cflmmg ¡n rceurrent ncu^l nclwprks" Afama/ Garjrpüícrfítfn. toI.ó. pp.420-440 Kutller, S.W.. J.G. Nicholls, and A.R. Marlin, 19Í4- Erewi Afautirt ft> ftaAt; J fr JAtf Fwr/ícrf c/fAc jVcn^ids Siifcjw. 2nd ediLion, Sunderlandi MA: Sinaucr AMOdites. Kullback, S., L9&41. A^Hmiiíán ¿rw/ Sfu/rr/úy- G loucestfif, MA: Pelcr Smith. Kung, S.Y., and K..I. Dianianlarafi, 1990- **A ncunl nrlwork Lcarmngalgonthm t'or adaptive principal componen! citraetion (APEXJ,"JEEEAJ^FrJdJjfl^ CflFj/írcrjccíJíXc^N.írícj. .Sjjl'lyA, dffl/S(gM!F,Jocr.™?j?. v^ol.2, pp.dóL-KM, Albuqucrque. Kushticr, Hl.,-and D.S. Clark, 1978. fiwAMífc Jpj7jn>nN^™i .VrfAoJj/ir CcrimTajJwrfnjrí 6>rcíP5/ra/nerfí,i,5fevíu1 New York: Spangcr-Xtrlag. Lacoumc, J.L^ R.O. Arablard, and P. CdrtWü, 1997. StariMgutt rf SHperú'i/rjMUr fe r^r-Tc^rí^r <fe Mfisson Puhlishcni- l .antüJ, C-, I9S4. J-rNíürDijjéjvíjfiü/ íJpL’rífoFí, l.ondon: \-^n NoKtrand. l .andíiuL Y.D., L979P Cflttfmí: Tke Wo.Jp/sjnncJj, New York: Mancel Drkker. l .flúJí.uL 1 ..D., aiidE-M [.ifshilz, 1980. SkpJíjJfWAní /. 3rdedilion, London: Pcrg^mon PneHF. l .aciFurd,O H-, 19SI rittnKtonandin H.L. Swinncy and J.P. GolLuh, edfi., /Avfí&A'rjüJUde Avftifrlfofa Md rh- Trtfri.t^hir ¿o HfftataKe. New York: SprinircT-Verljig l_3ngtKJ.tlimd GLE. I firtlon. 198 R, “The dível^pincni eif[hc liine-dclny ncaml nrlwnrk HJchíteChmfbf ípccch rcco^niti-on," Tochnical Rfiport CMU-CS-884J2, CanKhgi«jMdlün Univmiiy, P [isbwjh, PA. Lapedts-, A., <ind R. Ftrb-et, 1986. LPrúgTa.nLinLaga rnaHí-utiy pmllel, wnputiliofi unrvíc^l *yvtem: Slhiíc Betavinr,^ 1h A'crj/Tj? .VcEHTjrJL^ /tjf J-í*. Dentar-, ed., pp. 283-298, New York: American Ii^eíeuic of Physicfi-. LtifsupIi J., und ti Lyik'hi [^*9, “ I :-<[ jiínchb siinulíunn and ihe indueiion of E.'ER: The sequcncc in whách sytiapscs anc Btimukiitd decemiiiiís che di groe co which (hqr polsiiiate," ffcmcí, val. 4g9, pp,49-5S. LaSalki J., »d S. Le&chelz, NewTforic Acfldimk Pn*$&. l .í*t'|LnLY, 1993. E/Krrrírí ?.r^FYij>rjtJ .írr.Mjnd-africT .Wcffrür/v. / JVWÍS 9J, D^nvur I .cCllu.^ 1989. "Cicncratizarion and ticruork design fitrarcgics^Tcehnkal Repon CRCr-TR-Ñ^M, DcpanmctUofCnmpurcr ñciencc, UnivBisity ofToronlo, Cañada. LcCun,Y., L985. '"Une proccdure d’appncntiFHagc pour rescau a fcuíE assymcLnquc_" Co^íj^ív-q, vol. 85, pp.599-6D4. LeCun. Y, and Y. Bcngio, 1945. ,X"on^olu1ic™il ndworks for ¡mayes, speech, and time «ia* in M_A. Aibib^cd., 77ie /fandbaat n/Aura and Al’ihuJ AtJnwfc. Cambridge, MA: MIT Press. LtCia^Y^ B. Uoscr Dcnker, D. iHcmk-níon. R-E. Hüward, W. Hubbard. and L.D. Jackcl, 1990a. "Handwritlcn digit rtCúgii iiürl ^¡1li n baük-prYiplgíiion IHCWoric* fe A'erjra-V /jr/brwrcTfrorj Pnicrn-fe^. wU, pp.39fr404t Sun Maceo. CA Morgan KaufiPaim. [.cCun,Y., [.. Boiioti, and Y. Bengio, Í997,-,Rcadidgdwcí»^ith tnukilicyer firaph ti^nsfLimwriWtwwiu^’/EEFJjrjír^jrjrtrJú! Cn^/CFerjei? oh /íeÉMtiTfcs, ¿ywecA ¿uníÍY^piltí PíWííJfr^g, pp. 151-154, Munich, ¿lennany.
LoCun, Yn Bollou, Y_ Bcngio. and P. Haffner, L99E. ''Gradient-based Leaming applied to document recognición," a/"Ju JE££P val-86, a ser lanzado. LeCun, Y> J.S. DsnktrLflfl<J S-.A. Solía. 1990. lLOp4iiníLhni:n d^magc/1 ilffrwKOJJitcííjhs. yi>1.2, ppJSHUSW, 8an Macea, CA: Margan Kauímann. LeCuih Y„ T. Karter» .and S .A. Salla, 1991. HSeecmd order properties of crear surfaces: Leaming l imc and general ization,” /jtf/vflncr.Y jh .VjiuftrJ JtybrwMtfM Atw.'.rAfje Sv.Trem.f. vol. 1. pp. 918-924, Cambridge, MA: MIT Ptess- Lee. D.D . and SLS- Seung, I "97. HUnsupcrviscd leaming by eorrwx and conic coding," dqXrwm/ fttffrmfllÍM vol.9, pp.-515-S21, Cambridge, MA: MIT Pies, Lvé, Ti 1997- Ccwri/wri(?n¿ Hrcri-ry if^/fcurjrwf.í. Ph.D. Tbcsis, Tech ni sebe Uní versitit, Berlín, Gemuiny. Lee, l'.-C., A.M. Petrrccm and J.J-C. Tsai, 1990. HA mutliliyeT íwd-íctwartl neural rWlwwk witii dynamiully adjustablc strucEures," JEt'E J/ríf nrwrfona/ Ctw^frrence o/r SkTftvw jp Afcn. ¿mí Qtanwflter. pp. 367-169P Los Angclcs. Lcc, Y. and R.F. Lippmann, 1990. “Pracliual charactenStLGS OL nóural DEtWOria and convenEiona] pattem ciasstíicra on anificial and spccch problema," 4/Awei ín Ar«rai Jrt/i?™¿rífon Processing iys/wifs. val-2, pp.l 68-177, San Maleo, CA: Morgan Kaufniann. I .ee, Y., S. Oh. and M. Kint. 1991. HTbc ctfect of initial weigbts on prematuro saluration in back-propaga1ion leaming,” Jdj>iX Cmr/érrnoeon .Vénto/ AfaMvdb Vol. l.lpp.765-77{J, Seattlc. l .ce.Y.C. Cl. Doolen. H.H. Chao, GZ_ Sen, T Maxwell, J-t.Y Lcr. and t.L. Gi!esP 1986. -Machine leaming usinga higber order corrciation ndwark," FAi'sreo, D22. pp_27ó-289. LefebvrVi V.'.C .1991 Cibjer-r Ortentef Ai /hr /Erjo^iii fl/Mewaf Nc/hwíj; Muter^ Theui, Universiiy of Florida. Gt&uvilk, FL Leon-Garcia, A . 1W4 fttótóifíiy drtd flfflÍMl ftwowEfi-cfrícn/ fiqgfaHríqg, 2nd rdilion, Readiitg, MA: Addfe»-Weitey LcuntanEcs- [.. and S. Bílliñgs. 1985. "íñpuL-OulpuC paramelriú ittüdels fürnürtlLñeár sysiems: ParE I: Detcrministic nnnJincar systrms? AuttHúJñNU? Árwnqff/ q/"Cúifffro/. nl.41p pp.303-328. Leí. .¡i, A.V._and JCS. Narrndra, 1996. LCojirtFolüí"nonlirirardynamw;aL systems- using neural netwofks - Part [I: ÜbsrrvnbilLty, identiftc-alion. and conlrol,lh /£££ Tmnicrííjc™ orf Y™hí?¿ jVc^wfa-, wl.7h pp.30-42. Levin. A.V., and K.S Narendra, 1993. "Control of nonli-nrar dynflmital syslrms u-sing neural TirVworks - Control lábil ¡1y and stabilizationC iEEÉ IrcrffMcfwns gít MtwttJ NtfWdU Wl A pp. L 92-206. Lrvinr. M., 1985. Aícrn dffldJWtaftíM tíídort. NwYort: MiGraw-Hill. Lewas, F.L., and V_L. Synnas, L995. Opírmí/ Cc?nfn?íP 2ndedilionl NrwYorft WlUfy {tnleracjencc). [.cu-is, F.L., A. YeRtLdircfc, and K.Ltu, L996: "'MuLEtlaycrneuraL-net robot controller with.guarantccdtraekingpcriflcinancer /£££ Tfwuactións cw Mnn/MrftMTfr, vol.7P pp.l-12. Lichtcnberg, A.J., and M.A. Lirbcrnian. 1992. Íísu/crr emí Chaoíjc QpuHÍdx 2nd edition, New York: Springer-Vcriag. Ligjit. W.A., 1992a. "'Some aspecEs of radial basis funclion approsimaCiDn." an rfpywxjMUtdOff TAmpt. /7kKttHK JJ?JDir¡i¿,i!?i,rDiiii- SA Siingh, cd., NAID ASE voL 256, pp. 16J-190, Boston: ICluwrr Acadrmic Publishcrs E.ight. W.. 19U2h ,hRi.igc ftmeti-.ms, sigmoidal fiinctions and neural netwüAs,1' in E.Vr' Chxjítcy, C-K- CbuL and LL Schumaker. cds„ 4pp™™¿rfWÑ TAeori' K/J. pp.tó3-2O6P Bos-lon: Academie Press. Lin, J.K., D.G. Grier, and J.D. Cowan, 1997. "Tailhfu.1 repmentaEion nf separable distribuí ion a,” Crinrpniufínn. vol. 9, pp. 1305-1320. Lin, S., 1965. “Cumpuler Solutions üflhecravelingsalrsmanproblcm,,,-^c//Si3f?/Ti JecAnrca? Jwmpi vflLUppp-23i5-2269. LiaT„B.G. I [unnei P. TinaandC.L. Giles, 1996. "Leaming long-L-eim drprndenciesin NAfcX recurren! neural networksT ?EEE ThjJtiíZÉrirNW m Nttíraf MfhwAi; vul.7L pp. 1129-1338. LindcuY.Á. Buzfl.and R M. Cray, 1980- ,LAn algoi :thm for tkvEurquanlizerdtsigflC/Ei'ETrnjiMcríDnr oñ CtNWMfEHijeajdf^tr. wJ. COM-28. pp84-9J Linsker R , 1993 "DefivingrtCtplr- e fields uing In Optima] eTKüdijxgcrilrnünC^rfíUJTCé's ú? A,ízjMff//n^jnn¿?fjrtrj Avk¥XR*A£ óri/í'^iy- vol 5. pp 9.5 3-960. San Maleo, CA: Morgan Kaut'mann. Linsker, R.. 1990a. '-Ücsignirig a sensory processmg syslem: What ean he Leamed from principal componcncs MÍyiÜ?F1 rftf /HijtfrÑjfírtfjcr/-forrar ^>|fÍnEKC n-fl Aruj-ij/MtftWFibk vol 2. pp. 291-297, Washington, LK . Linsker. R., iHOh.wSclt:-organtzaCian in a pereepcual Ryslcm: Hcviv nclwark models ;n"l irtfofffiutidn iheury may shed light un neural MgMidlbMiJ* Chapter 10 ín Vad^rru BmjTt S.J. Hammand C.R. QlfMU edL. pp.351 -392r Cambridge- MA: Mil Press. Linsker. R.. L 990c. "Tcreepiual neural o^pidatixn: ¡Lpproiwhcs based 00 nclwork modcCs and informal ion theny” /CcTrí'H'o/’AeHraicfcjrce. vol. 13. pp.257-281., Linsker R.. L989a. "An appttraEian of the principie ofmáximum infbrmation piwrHlñn 10 linear sysCerris,H fu frWi'SJíng Srs-fc'rnx vtd. I, pp. 186-194. San Malea, CA: Morgan Ksufmínn.
BrauoGRAFiA 875 Linskcr, R_, ]989h. ''How lo generarte onJened mapa by mminuzkng the mutual information hdwecn input and Qu(pul¡ sígnala*” Míwjtíí wL L pp.402-111. Lirisker, R., 19JJ8*. “Self-organiiíticn ¡n a perceptual nenvorV CtaptM; vol .21, pp. i OS-117. Lindter, R.< 1988b. 'LTowírds ari «ganiang principie Tora laymd perceptua.! network/1 in Atara/itytaiMtiM Procrarúrg SpttH». D.Z. Andttwn, ed.< pp.48 5-494, New York: American Instituto of Physits. Lmsk-rr, R_F 1987. ""Towaids nn ojgptnizing principie for percepción: Mrbbian synapses and 1hc principie of optímal ncuraJ cncoding/ Á5.W JteidarcA Ae^orr JFCJ2E2Q. IBM RrsramhFYiuktnwn Heighls, NY. Unsker; R., 1986. Trom hfl^ic neftvort principies to neuraJ arehilecture” (series), o/ rfií Nd-Jj'tíripy/Íeíjffc^i' c/ &ÜH«> üStf, voLSJ, pp.7508-7512, 8190-8394, 8779-S78J. Lippmann, R.R, 1987. “An introduation to compuling wtth neural neis,” JE£E ASSP vol.4, pp.4-21 Lippmann, R.RP 1989a_ -,Rcview of npuraE netwcrks for spceeh rteognition,” jVíirrtí^ CúmyiNürttan, vol. ], pp. ]-3ít. Lippmanu,R.rn 1989b- ,LRattemcla5Sificfft¡Qn uiipg neural DtiwwiV J£EE w¡LZ7app.47-64. Linle, W. A ., 1974. ‘The Bürta» of perriítenl tintos in dw bonT JMoKtaw, wL19, pp. 10 i - i 20. Liule, W.A., and GL. Sltaw, 1978. "Analylic study of 11>c memory sterage capaeity of a neural nctwmV MfeíJbeiiaJtad írásrreflcrj. vül.39, pp. 28 i-290. Liule, W.A., and C.L. Shaw, 1975. "A siarisrieal theory of short and long, term metnory™ Aduitara/ fiWqgy; vol. 14, ppjií-m. Livewy, M.? 1991. HlClampíng in Bollzmann machines? ¡É££ 77¿™arfwns tur A’euraJ Networks, val. 2. pp. 143-148. Ljunjr L.? 1987. MtagtatftaJt1 TSmft/>r /fre Ltotí Englewood CliETs, NJ: Prenlíct-Hall. Ljung, L.i 1977. "AnflJysLR of rceunne stachsstic algoriüims" fEE£ TrartSücfionr tw Caít/raí. vqI. AC-22, pp-53 L-575. Ljong, L., and T. Glad, 1994. r/ZtyHOfltfc EfiglewMKJ ClifFs, NJ: Premití-Hall. LkytL&R, 1957. "LeasE squares quanrtizaticn in ROM “nata técnica nao-publicada do Bell Laborawri«. Publicado postr- riwwienlc sob O momio titulo cm /EE£ Trau.wcXhww üh Jtt/¿FfflüfraíJ TAeon1. vol. ]T-28, pp.117- 115,1982. L04 Z.-P.. M. Fujila, and B. Rayarían,. 1991. "Analysis oí ncighhorhood inleractLon in Kjohnncn neural nctworks" 6i¿- JhtfmartoW AndW Fr^ísing pp.247-2^9, L« Alamiins, CA. 1A Z.-P.,Y Yu iir.d B. Bavarian. 199J. "Analysis ofthc convergente prapertM of topology prcscrving neural netwnta;” I£E£ TrattsacXioni ofj NeoraJ NeAvarks. wL4> pp.2fl7-220. Lockery, S.R_? Y. Fang. and T.J. &rjnow3Jdh 1990. “A dynamical rmmjd MtMHk m&díl OÍ sin^rirrwlOrljnnsfijnnatiuns in the Leechr /níemo'J'júJMf Gw^&rtn« tw? Nraral NchLOífe. vol. I, pp. 181-188, San Dicguh CA. Loíve, M., 1961. PraÍMrbihTy ÍAeürj'. 3rd «lÍLÍan, Ne* York: Van Nútifind. Loncnlz, G_G.n 197&- hThc Hth problrm of Hir>ert.’,'Fracccirfprgr jTt /Jnrt Warfrcm-aflcj. vol. 28, pp.419-430. LoncnlZ, G-G-, 1966. ^/TíinarjaiaJ'jrN! ¿^r Funefrans. Orlando, FL: Holc, RinelwrL A WinsboiL Lüríriz, E.N., 19fi3. ^hstoraÜDÍtik non-periodíe flows,”-AjÉrrrtfl!flf^fJTJ¿?sp!jer¿e Scja^es. vol.10. ppJ3ü-l4l, Luwíh D., 1989. “AdifMive radial basis function nonlincariliM. and Iheproblcm ofgcncrHlisalion;" Fr-irf f££ JnferrjffíJüFJd'í M ^rr¿/?rí¿rí Neurcií Nefworki. pp. I 71 - i 75. London. Lom D., 1991 a. lhWhat have neural ndworics toofler stalrlical paLLcm pracessing?" Pwcedrngs<i/;hcSP/E Con/crcncc Xffepfrvtíigwípp. 460-471, San Diego. CA. Lüwí, D.h 1991b. llOíl llw iierative ínwnin ni RBF ndwarks: A stalislical inlcrprciation.^ Seronrf /££ ynfernffn'üna'? Oíu/LT-L Jkv on drttyfctaf NcwraJ MAwrte pp. 29-3], RoumcmouLh, Engjand. Lowe? D.? and A.R_ Wfcbb, )99lt *Tlme urbes prtdidi&u by adaptive neíwoffci: A dynamical lyslemi pcrspecti ref f£E Pt&MeJütys íLoñ¿fon¿ AifíFr voL 118, pp. L7-2J- Lowc, D_p and A.R_ Vfcbb, 1991b. "OptLrnLzEdfeaEurecstractiüo und [he Buyes cteeisLü[liiL fecd-fortvárd cl&ssirierncCwvcks?* /E£E TFartMeftflíis tw Fu/tern amf Msriíw ^rrtffigirritr. FAMI-13, 3-S5-364. Lowe, D., and A-R- Wcbb, L990. "T¿sploLting prior knowltslgr in nct^urk úptimlailon: íiü illuSEffilion frMi medical prognosis" Nerworfc. vol.], pp.299-323x Lowc, D., and M.E. Tipping, 1996. “Neurobcale: Novel lopographic fruLurC c^LrícCiún using RBF networti;” FroeeMÍng SVsícjfisp *oL9, pp. 543-5^9, Cambridge, M A- MIT PrCSS- Luenbergcr. D.G.P 1984.Eúrear ffmiMjFi/jTrcar 2nd editian, Reacing, MA: AddLwn-WcRlcy- I u¡,H_C., L 990. "Analysis ofdecisión conrtour ofncmal neLwork wilh sigjooidnl núnlineftriLy” GNfftafflK üti NfUrtj/ NfrH'OMtE. vol. I, pp.655-659. Washington. DC. Luo, Z., ]99L ’XTn tbe convcrgcnce of thc LMS algonLhm with adaplivc Iwming raLc für linear ftedfcirward nrE^crits?1 jVf^raí Camptiíffnon. vol .3, pp_22ó-245. Loo, F., and R_ Unbchauen, 1997. j4ct?/j'ctí jVcurat ftweixftw NcwYorií- Cambridge IJnivc-nicj1 Press. LuCCrrl I, S.F_P 1997. “A uoiíínJ rheory úf dwtsily mcdíls and aucü-enroders," TícAwcíi/ ffqpfltr 97J0X Dcfcncc Research Agency, Círcat Malvem, UK. Luttnell, S.P., 1994. MA Bayesian analysis of sclf-organizing maps/1 Mnira/ CampirfflffWT. vol.6, pp.767-794.
I । i । < L S. 11. I Wl fl. LlCüdcvwtwdcnsily in tnpojjrapli i_: mapptngs: Scalar case,11 f££EThansartióm mMtvni/AfanKw4% wl.2. pp.427-436, l.uttrell, ¿!R, 199 Ib. "SdtfltperviKd irainingúfHeiiKhkil vector qmntlzn/* Jínd tomarioMÉjí AAnral Mnwdbi pp.í-9n Houmemouth, língland. bullidI, S.F-. |98?a. "Hierarehica! vcelor quantizaEiün;' /FE Pracw Jíqp val. 11& (ParL I), pp.4Ú5-4l3. Lunrell, $.P., I SOTb. '’Sclf-nqjaiiization: Adcn\ation ftom firslprncipleofacLassof Leaming algarilhms,1 "/£££ Cm/erence Wl Mntraí Jftftwrfa; pp.495-49IJL Washinglon, DC. M.iaSíu Wu |99). hRoundB for thc compulaliíMul powerand LcammgeonipLndly nf analog netiral nets," n/ffre 25f 6 Xnnitcri ,4CM 5)w|pm^MK rih TJttíyj.i-i- ú/-üiiítptjjwj pp 3 35-344, Ncv. York: ACM Prk Mubs W„ 1993. -Vapnik-Chcrvoncukis dhnmfon of neural networksr in M.A. Afbib, cd., Fite ffaíjrfñflút ü/ Jrarir .j .-/Nnraf jVcjMxarV Cambridge । MA: MIT Press. Machi E.i I865. L,(rher di< Wirkung der raumlichtn Vcncitung des Lietnreizes auf dio NetzhauL L Sitzungsbcrichlc der Mathemalisch-Nalurwissenschafilíchcn Klassc der Ka-iwlichcn Akadcmic der WisscnschaEtcn,” vd.>2, pp.303-322. MacKay, D, 1992a. “'Daysían interpohliMC Cy^rcrJirfícrJ, Vül.4, pp.415-447. Mac<a>', D-i 1 W2K*A practica] Bayesian framework forbairk-propagaliQniHMw-LirksJ" Ahnra/Ct?ffjpjFfüritNL wLApp.44S- 472. MaeKaVi D.J.C.. Jnd K.D. Milita [990. "Analysiseif Linskcr',fi fiimulalicms nf Hehbjan rules * AVwraí CbfliprriaíteM, vüL2, pp. 173-L 87. Maeintyre, A.J., and E.D. Sontag. 1993. "Filness rrsults for sigmoidal ‘neuronal’ ndworks,"' F/ucecrfj'^s rfte 25j/i jlrtHtjd-? .íCV JvjFipüíiuHrt ofj Nwry o/ C í'mpwffffg, pp. 325-134, New Yode: ACM Press. Macíjucen, J., 196?. “Sume mdhodh for rLassificaticw and analysis of multiv^riale □bsm'ation?1 in ftwecrilrnj^ o/rAe JíA ¿tapeta1 ¿wMatAffnflAcufStatirttes¿?ndPrafrabríín'- L.M. LrCun and J. Neyman, cds., vol. L, pp.281-297. Berkeley: UniversLty úf California Press. Madhuranath, H.., and S. Haykin, 1WB. ILlmprevrd Aclivalion Funtlions for Bíind Scparation: Ddails of Algebra: l DcrivationsC Cffí fn/erna/ /?epo^? A'¿?. ÍJÍi Communicalacms kcscareh Laboralory, MoMaster UnivErsity, Ramillón, Omario. MdWMÜd. M.A., and Q McadL l9KÍ, HS¡lioan retina,"' in4rjü/üfl (C. Mead}, Chaplcr 15. Reading., MAí Addiwri’WcsIey. Mandelbrot, 13. El., 1982. TAí Sm RmcÍMíí: FrteiHM. Mañé, R., E 9J¡1, 'Xhi ihe dimensión of Lbe Dom¡ract invariant stEs (rf ccrtain non-linear maps?1 in D. Rand and L.S. Young, cds., Ehvwrpikay amí TbfÓHÍc^cf. Lectura: Notes in MachcmStics, vo]_8M, pp. 230-242, Berlín: Springer-Verlag. Marr, □., I9B2_ J7írojr_ New Yoric:: W_H. I rremai: and Company. Martineta, T.M.. H J. Rilter, and KJ. Schulten, LWft '"I tirrc-dimensional nmral nd for leaTning vlsuoonolaTcocirdinatiDn. OÍ a robot arm.,n JEEE ThtDwfhuu o?j Abura J j\rcJ>i wir, vo L P pp. 15 L ‘116. Masón. SJ., L953_"'Fcedb3c-k Lbcory-Some propertiesoí'signal-ílcFwgraphsr1 ÍYwecrfrjrgro/j'Ar /nsfiJuíí o/Kíkíw tírgíneen. vol. 41. pp. 1144-1IH. Masoni SJ., 1956. “Fttdbldf thwry Funher píoptnies -úf Mgn&l-Étow grapbsJ" qf^^e Aurihríf i?/-íac/jc? Eo^íriccfr.Y, 44, pp. 92H-926. Maybtcki E*.SU I9K2. J|/n^rJí, E-íHinyrrzm, é.i.-:/ wl2^ NüwYüik: Academic Fw? Maylwckn p,5.1 1979. .frtthuwfcífríLftíü, Esriimirrófl, ¿tjícj1 Cmh4 vnl.l, New York: Acadcmic Press. MnZáik^i P K- 1987 "A :n.iilicin:ii:¿31 modíl rfthf Eíh L i: ;ir.n machine," JEFE FInf fitttfltdtfM&í Ca^r/r^t'ncc ou? íVcirrof Nefworte. vol. 1 [], pp.]57-1 ti3, San Diego, CA. McBridc, L.E^ Jr., and K.S. Narendra, 1965. '^Oplimization of timc-varymg systems,” /EEE B-arutu^nriní pn AUoftWíic Crttffroí, vol. AC-LD, pp. 289-194. McCullagh, P., and J.A. Ncldcr, L9H9. .WnMl 2nd edición. London: Chapman and Hall. McCulloch, W-S., 1988. Jjbrcfffs o/Afdnrf. Cambridge, MA: MIT Piras. McC^ulLochu WA.índ W, PÍU, 1941. **A lugical cakulus oflJie ideas imrnanenC en nrrvmisartivity," Rúsp^vfcs1! vflt.5, pp. 115-133 McFlicec, RJ,, Et C- Pc^ntr. EJL Rixlflftlich.ind S.S MsnkatesK 1987. "'Thecaplcicy of the HopfirldasMJcialivc memory/' fEEE TVwuatiton tur Aybrnutffoft wL IT-33P pp.461-482. Mel-athlan, G.J., and K.F., Bufbfd, 1988. iWf.rftíre jWctÍc/j.- /q/cnenccanJiípp^jbjntwts fo New York: Martí! Dckkcr. McLachlan, ü.J., and T. K.rishnan, L997. Efe¿- EAf4f^wj7Ajn nú New York: Wilcy (Inleracimcc'). McQum, J., 3967. “Sane rmnhnds fnr classificatLon and analysis of nivIlKarííte obsertíliúnsj' /Yoceerfrr^'j o/ rite StffifalAgf 5vrnpaj/um on ,Wariter™tic¿ri írurúrtej úmJ Fmñafrririx vol. 1, pp. 2SI -297, Berkclcy, CA: Univcrsity of California Press.
Mead,C.A_h 1990. "NrurümüqjhLe dectnníc syslcms-" jRnM**írjígJ ofíte AtíJífírtf </ ElcrtrráJ crmf EJcclnjírksEfíEÍncm. vd.7S,pp.L619-lS36. Mead. C.A_, 1989. XjeJdj HUdTdndAfamrf iysfcmj, Rrading, MA: Addison-Wcslry. Mead. C. A., and M.A. Mahownld. 1918. "A silletín modcl ofrcTly visual proccssinEi/ iVtrmrf A'c^lü/-^, voLI h pp.9l-97. Mead. C.A., X_ Arreguit, and J_ Lazzano, 1991. "'Analo^ VLSI modcl of ^nwural. beaniig," /EFE frniuacriáos ofj Jtairo/ jVrni^HLf. vol.2, pp.232-2"!--. MccklenbraukcT, VA, and F. Hiawalsch, eds., 1997- TX iHgrjfrDüftiAvflíwi. New York: Elscvicr. Memmi. ] 9H9. HCünnectionism and arLi ficial intel hgence? Afewv^Mmes "Í9 HExHUk^ ofj Aci/raJMtfuivdb dÑ¿f ¿frjN>^7^fie¿rfJürii. pp. L 7-34, Nirncs. T rance. Mendtl, J.M., l995.¿UWfflr Jfl£rfteMten7AwnjJ^' C<Mqwu/H?üjj^Hs<nu/C!m^v>/r Englewnod ('lillk NJ: Pividiíe-Fíall. Mendcl, J.M., and R. W- McLaren» 1970. LIRe¡n(bfvefnenb Icamrag conlrcl and pflMcm recqpulion syslems r in Hí^priW, Ltvmr^g. ltwÍftrfJt'm íw^mrívirSvóR'mi" wl 66,J.M. Mentó and K S. Fu,«ds.tpp.287-3I8, New York: Aeademic Press. Mefinon. A_h K. Mchrotra. C.K.. Mohán, and S. Rlflkl» 1996 “ChüTiHlcncaLi-ün of a class OÍ sigmuid fimflions ^ílH applicatL-nns to neural Mtwditartaw'fl/ A'cnktfnl'i. voh 9+ pp 819-835. Mcfecr, J., 1909- "Tuncrions of pOíiLivc and negativa type, and ihcit connecílon w¡ih thc llwüry of inlcgnil «lualiuns,'1 nwiw/JMi tjfxAe Pfiihsup/iíca/ SocrrJT vúL2OTh pp.4 15-446. Mcs-iilam, M.M . I9U5. "Attvn1ionhcoiifu¥ioRül líate*. and nugkcC" in Wncrp/c.vnEJc^NTr-rjnj/A'crJA-J^Jgn M.K1. Metol-íim, cd., Phi ladclphia: F.A. Davis. MeLrapDli.5- 14^. A. RoscnbLuth, M. Rüwnbluth, A. TcLIlt, and L Tclkr. 1^53. "Eiqwiliomí of State calculan* ms by fas1 eomputing machines/ Jbvnu/ o/ Chemfcu/ Fr*?vjjlcfr yoI.J L pp. 1087-1092. Mhaskar- H.N._ 19961- "Neural netWOfka foroptimnl apfnoximatcon orsnUMthandanalylic ftlttCtLouT A'cw¿r/ CtiwrpN/íiJj'™. vd.B,pp. 1711-1742. Mhaskar, H.N., and CLA. MícchelCL 1992. "AppTusiin^taun b) jíupcrjHijíiriMi of si^moidal and nidiaI buü funtlionií/ -Atañera rn .íppfkd iWcrf^cmerÑcj. Vúl.l3_ pp.350-373t MiccheJIi, CjV. L986. "'Interpolación uf watLervd data: DktMCe mairica and candiliunally positive definito fimctions?' CtauftiKtiw vtL2. pp L1-22 MlÍrrP D.. A.V- Rao, K-Rose, and A. Gersho, ]99fi. "A globíl optifflittkLúnltduiique fcif SlfiCÓ'-.eíd Cla^íificrdísignr /EFE Trffjrj-acrránr dhi Sígm? AzjccwjTte. l'olJ4, pj>3IOB-3122 MÍIICR K.D., J.B. KeLLer. and M_P. Strykcr, )989_ " Ckiiljr deminancc cnlumn developincnt: Analysis and simnlaLÍon/ íefrwc. ^qI,24Jb pp.605-ci],S. MiLIúf, D.rand K. Rnae. 1996. “Hicranchical. un¿upcrv¡Kd leami nu w ich grawlng vía plus? tranELtionEr1 Afeara/Cpi^aMfcm. mi, S, pp. 425^50. Millcr, D., and K. Rene, JÍW. "'Combincd seurec-ehannel vector qu-anlizatiem usLng delcrministic annealinj'/ /£££ Frtrticdcddrtrt.f iJJF rüftJFJtuFiJídJJrNtf. vol_ 42, pp. 347-356. MíIIer R , 1^7. ^bepnKntltion üf hcrLcr temporal psttems. Ilebbian BympM^ and Lhc- Lcft-bciniKphercdnmi nance for ™^ni[iüíir'rtjirtoWpJpjx vqLI5, pp. 241-247. MiíLai, ArA-h and R.J, Williams, L99Ü. "'Back-propagaiion hcuri -Lies: A alud? of 1he cxlendcd deha-bar-della alEonthni/ /£EEJ^r^hjrieFJd/ttavC^j/lwfjíc on Afewra?Afemw4rr vol. I. pp.595-MXL San Dic^o, CA. Minsky. M_l.., 1986. Socicty ül Mind, New York: Simón and Schuslcr. Miíuky. M.L., 1967. GM^nmrián? Anteo^/FjtfnteMkJWíks1. tn^Le^Dod CliOs. NJ: FrcnLiec-Haíl. Minsky. MI.. 19&1. riSLepE towtide aflj-Ticial inLtl1]ge^cLL., Erc^c'iv/mgs /Fr.rfííjrfc E¿t4íü £>iirri?wr. vol.49. pp. 8-3Ü (Rciinprcsso cm: Feijjenbaum, Eí.A_, and J. Fddman, eds.. Gbffptifien d?rjJ pp. 406-430, New York: McGraw-HiLL.) Minsky. M.L.P 1954. "Thcory uf nrural-analog rcinfoncemenL syslcms ¡ira! lis applLLatiDn to thr briH -modet problcm/ Fh.D. thcHis, Princcton Llnivenity, PnnceLond NA Minsky. M_L., andS.A. PapcrL 1988L tarqrtftw, expended edición. Cambridge, MA: MU' Press. Min5ky+ M.L.. and 5.A Paprrt- 1969- Cimbndge. MA: MI i PrtSS. Minskyi M.L.l and O.Gt Sdftidge, 1961 -|Aíiniin£ in random neta/ Tfreon.-. Lofldcn: Buncnvortht MiiehcEL T.M., L997. New York: MeGraw-Hill. Milchison. G., 19M. "Leaming algorilhmií and neLworks ül nrunony/ in 77ie ONfyiuriAtewwi [R. DurtiinjC. MiaEL and G. Michison. eds). pp.35-53, Rwdin^. MA: Addison-Wrj¡lcy. Moller»M.F. 1993. “A ^alcd«(^|mite^íd ¡ínfl iluTari iln» fur fasi superviví lendng»" iVcjíjít/ jVc/utj^. VDk^pfkSlS-SM- Moody, L. ímd C.J- Carfctn. 1989. -'Fast leaming in THtWfki ef L-neally-tuncd prnccssing unics/ .YíTj^j? CMjwrJjFfrrtHr. vihlJ.pp^SMÍM.
M-ondy, J., and L.Wu. 1996. "'Optimizarían oftradmg syítems and portfolios/ in A. Wcigcnd,Y. Abu-Mi?sufa, and A.-P.N. Elefcneí, eds.b Drajjbn TecAna/tfgrcsjtxr /‘¡fjo'^cjlTJ1 iffgdneerfflg, pp.23-35, Singaport: World Scicnlific- Moody, J,E., and T. Rógjrvatdswn, 1997. HISmootlr.ng negularizrrs lur prpjective basis íundion ndwarfcs,11 Áhjmcfl ¿n Abura/ Fn?cv?jsj>rg Snícm. wl 9h pp. 585-591. Mr?ray, N., 19S9. “AWttiw ín dícboti^ I¡stcningi Aflectivc cues and the influencie af instructions," JbjdFFJj! úf Fjir^úJúípí. vol.27, pp.56-60. Morgan Ni and H- RaufLard, 1990. X'fmtinunuE spccch recognición using niuLtilaycí [rercepírons wiíh hidden Markov modelar IEEE fiUmaffoMf Cüriféjüflce rtM jtowrtfls; Sjptttaíl MÍ Sjffrtfl J /’íwííír^ff, val. L. pp_413-416, Albuquerque. Moriia. M.a l99?. ^Awctatiw memciry with nonmanotonic dynamLes,1' jVfKra! MrfuwJj; val.fi, pp.l 15-126. MDHnvaV.A,a 1991. .VerAnif/n#1 J//-/bsarf Fruite/ttí, Boca Ratón, FL: CRC Press. MgfsCh P.M.ind H-Fcshbach, 195?. 7j. : r-u-,-,:,-,:' Pfrr.rá.r, F'.irt 1, New York: McClraw-Hill. Müztrr, M C.i I994 "Neural íKI architcciures for temporal sequcficc prnccssing/' in A,S- Wcigcnd and N.A. Geruhcnfcld. cds., JJjire Senes PftdtaÜM: firtCdíi^rg f&c Firfujv tfnJ UidmAMdbv ttí ftxl. pp.243-264h ReacJíng. MA: Addisufi-Wfeakjr Ktpicsos. G.J., 1990. ,LChíWs in bfiin fnncüon and thc prohkm of KnAtHmarily: A conmcntary” in Ctaw M Arata ¿Mic/jan. E. Basar, rd., pp.l 62- L76. New York: Springcr-^srlag. Müllcr. El, and J. Reinhandt, 1990. .VfrwoFifc5.-4n Jff/raJjFcn¿wi, Neiv York: Springer-Verlag. Mullir, D, and Cr. l.yneb. 198S 'Lw^+tq :*otentíaliun diñorentially affeets lwo romponenls of synaplic responses in hlppacampus,” ?/£ * ¡Yí.c v ^¿^JHyc/StJíFicís, USA, voLU-J^ pp.9346-9350. Mvmforü, D., L994. "Neural nn&-'r.t L-rc., fri.- (ratt-cTn-theorette prablcms/1 in C. Koch and J. ftavis, oda.. Lorgr-Sco/t Thwrio <¡/'iAe CrtfÑyf, pp. 125 1 «'SÍir ükc- IM A: MIT PrtiSH. Murray, M.K.t and J.WL Rice; 1993 Djffi pi nbd OÍMWrty onjNt* Yúik: Chípman and Hall. Murlagli, H.. and M Sil-andera, 1978 i. d.'gfr-1 i:a IrI it.i-- i- ly wnsCrtincd api i mi-wiricma" AíniJrcwfteflJ fir?gn?m*o1.14, pp.4l-71. Musrlli, M._ 1997. LOft canwíígwKe propenies of poeta al^úfiihm/ /EEE Duuw^aKf í^t NtwuiNtfMribi val. H, pp. 623-619. Nadal, J.-R* and N. Pat]ML 1997, ,LR<dtindfiíiíy pedudion and iudcpendent compneot analyxlaL CondiLions h tumulanis and adaplive apprMúhíS/ .Vinar! wl. 9,pp. 1421-HSfi. Nadal, J.-P., and N. Purga, 1994. "Nl-ni inear neurona in the low-ncisc hmit: A Factori3E€0dcnLax¡nLÍzes Informarían transfer," Afernwt «I. S+ pp. 565-58]. Nadaraya, L.A., 1965. "'On ".inr:r:i: \ :r; cslimaCrun of dcnsily fumílions and regresaron tunes," I^coft p/'.PrafrafiiÑrv ojuí ib 4f^culfauu, vol. JÜ, pp. tS6-]90. Nadaraya, EA-. 1064. _,C)n estimaling irgression,” TAeory ¿?/ FmfeaÍKVdh' rK vol,9, pp. 141-M2. Nafisly, L"., N. [n(ra1orLand D. Homp L997. "□ptimal cnsembtcaveragingofneural nelwoits,” vol.fi, pp.2S3-296. Nakano, K., L97?. /AsROCLatím - a model of assocíative mernory/ /EEE TraíisacotNFS on Si iiím.?, .Wdítr jjnJ QqfrtHMtftar, wl.SMC-^pp.380-388. Narcndra- K.S., I995. .Ueuraf AAHmdb_í?r /dcnff/írarjCT? Cbwml N1PS 95, Tutoría I Pnagram, pp. I- 46, üerwer. Nanendra. IGSta, and A.M. Annaswamy, 1989. Sftji/cTfc/erpfri^Englewood CLiíls, NJ: Prvntiirc- Ha!l_ Narendra. K.S., and K. Parütósarailry, 1990. ,L!dtn1ifieaiion and control of dynainicat systems using neural nelwoiks/1 ÍEEE ThiittMfkMtt oj? Mrwni MrfMrie, vol. 1, pp.4-27. Nataraiin^ BJC.a 1991. IfatAñír £eíjr^rrj?g.d Tfaoratfad/ /ipprucrc-V San Mat«h CA: Morgan Kaufmaxin- Neal, R-M a 1995 flfjvcjfíjn ¿unti^.^ A'i^rtrf Acrwcrfcs. Ph.D. Thesish Lhdwniiy oíToronto- Canada. Nral, R.M., IW3, L,Ba>fsiari leanring vil siochasiic dynanriaT ¿Ammi m Mttrraf Ancenúqg ^vttwr vol S, pp Í75-4R2. San Mac», CA: Morgui Kíufinanit. Ncil, R M a 1992 "Canneciiaii-st Itamin^ of bdief neiw^rW vol.56, pp.71 - J13. Ne^coinhu S., I 886 “A generalÍ’¿ed llkeory of drt Cumbinalion of observations so es lo otnarn (he best resuLtJ" Juvwf qfWn^rcmj/rró-. VoLL pp.343-366. Newe]]. A., and I [.A. Simón, 1972. ftjrnfrn £*rai/ri?i tngtrw-Düd CIiíYe^ NJ: Frentiec-Elall. Ng, K.-andk.R Lippmann. 1991. '"PraclicaJ charactrnstics ot'neuralnelwork and conventional psEtemela^LÍi^/1 dt/trrmrej Ai Wcjír?/ FracL'jjrng Vül3k pp.97U-97ó, Sún Malea, CA; Margan K.aufmann. Nguyen, D..and ü. Widiow; 1989. ,LThc truckhaeker-uppcr: An c3tampLeofse[rLíanñng.irtTWiiral DttWWfcl^ÁrXevwarirWM/ Jaútf CoiyfentfMt M Mtunlí MfNwfe. wl. II, pp. 357-361. Washington, DC. Nic, J., and S. Hjykiii. 1998. lbA Q-learn-ing-bíisíd dynarnrc channel üsíignmcnl tcetmíquc for mobile HxmmmlcitíK syslcms,** i£££ rf uníacífoíis twr FfeMfvfczr .i ser Lanzado. Nic, J., and S. Haykin. L99&. L,A dynamic channel assignmcnt policy ibrough Q-learníRL” Cft£ Ar^úirf Ml 334, Communkations Rcscsiíb Laboraiory, McMaster (JmvcniLLy, Hamilion, Ontario. NillSM^ N J h 1980. PnTrtípít'j o/rlrfr/jcraJ1 ^r^gence, New York: Springer-Verlag.
Nilsson, 1965. Leomr^gAf¿Bornes: fijun^flfwFis^fTrffjmrüe JízfXe^ff-C/asrj^F^ívsfeflis. New York: Mc<jtbw-HlII. Niyogi, P.r and F. GirasL 1996. HCh Uk relatkmship bcfwccn generalizan w envr, hypothn cümpkxily, and samplc ccmpkaity foi radial basii íunctioniT Ar<*ww/ CMgwftnftm. wLS, PP.8Í9- 842- NovikoíT, A.B.J., 1961. “Cm convergente ptoúís íútperMpLrórts™ in PrtKrc'i^Vrgj qfxfrr5™püsfem o/r xfrr AÍCTiftíYUffXinry Tíewy ü/jíuftNwo'ía, pp.ól 5-022, BrtioklyiK NY: Pólylechnic Insimule of Brooklyn. Nowlan, SJ_. 1990. “Muirmrni likdihood compcfÍErvc Leamrng,H jlrfLwmrfí ín AenraíA|bnMÜM Processing St^Xems. voll. pp574-582b San Mateo, CA: Morgan Kauñnánn. N envían, S.J., and C.E. Hinton. 1992. '‘AdapCÍve soft wrigjiít ly ing using Gaussian ni uUltts/1 Jim^s jfj A'euraí fn/ormaXion Pmce.wing 5ysrems. wl_4p pp.993-IDOÜp San Maten, CA: Morgan Kauírnami. NiWF'lfln, S J, íii:dG-F-. H¡nbqnp J991. “Evalualkinnfadapávemixturesnfcompetingexperta,'"4rftujKí.Tj> AtirmJfjF/kzmj/j'rírt wL3, pp.77J-r7Wp San Maleo, CA: Morgan Kauímsnn. Qberrnaytrp K.p H ñiittr, and K. Sctmltcn, 1 Wl_ HhDeve]opment and spacial stmeiurc of cortical (tature mapsi A modtl study,1" rfííwirttíj fe Atara/ /j0™wricwt f’hwewfef 511^ vol. 3, pp. 1 bl 7b San Mateo, CA: Morgan KsiÚnuiL Ojah E.p 1992a_ ^Principal ccwponenlí, minor compwwnts, and linear neural netwudaT^tarafMnwrfa, «15.927-936. Q¡ah E.< 1992b. “Sel f-organizing mapa and compete viitan." in.Atamf AVnithrjjj^tt^rxtui. vol. I. H- WedxCa; eJ.n vol. I, pp.368-385H Sin Diego, CA: Academk Pre» Oja, E_. 1991. "Data compresa ion, fcaturt exrmcti&rt,and auteassociaiiM in reedfofvarct iwm al net^orks,",drxj^cxfl¿A,cxíra/ Vshuorití. vol. I, ppP737-746, Amslrrdam: North-Holland. Qja, E-, 1989. uNem^-l wiworfcsh principal wmpünenis, and sutaspaccsr- feterrtarinFwJ Jbarrta/fl/^eura/ Sjsrtím.r. volt 1, 61-68. Ojl, E-, ]9R3- SuAf^wce AfeXArkíí Ldchivorth, England: Research Sindica Press. Ojtu, E-, L9S2. >LA simplificó neuron m artel as a principal compcmenl analyzer,'’Jíjuffm? of.WjaXXjímariM^ JftoXú.qr, vol. 15p pp. 267-273. Oj-tL, Eh and J. Karhunen, 1985. “A JtwhMlic appraxiniation Of [he cigcnvtctara and cigcnvaluefl oí thc experlalion of a randorn malrix,H Jaur™/ qf AíffX^íviwricfl¿4FMjJvjrj (rnr/ J/^?ífccrJJc™. vol. It>6, pp. 69-84. Oj-1, E.,andT. Kobcncn, l?8fl. ‘The suhspacc Icamingalgonthm as formajsm íorpattem recugnition and nCural itrtwnrks. /E£E JjiftFrtóffOMl Coq/mnce üh Mürrof toL I, pp.277-2H4, San Dí^ed, CA. OfldlHt C_W.H and C_L. Giles, 1996. “Ccxislflictingdjctcmiínifllic finiEc-slatcatilíMnala in rccumenl neural nctwíwfcFkT o/xAe4jjocfúfrán /or CífflpwJíng wl.^3, pp.937^72. Oppcnhcim, A.V.P and R.W. Schafrr. 1949. Drjcjrfo-nww Sí.g™i PraccwiTrg. Engle*tx>d ClíifíK NJ: Pmtíce-Hall. OfLpndo, J-, R- Mano, and S. Hay km, L99ü. ^Cl-assificati-nn of BMrkx us-ing a dvál-polírized rartar,'1 J££E Áwrnn? c/ OflMHk vol. I5P pp.228-237. Osher^on, D.N_P S. Wcinslcin, and M. Stoh. 199ü. '^Modular lr¡íniingh,L CcwrrpirXiTXrcníj/MttmKtoKC E.L SchwuUi ed., ppJGÍ-JTT, Cambridge, MA: MIT Press. Osuna, E., 1998. JLSupport Vector Machines: Tratning and Applications,” Ph.D. Thrsis. OprraCwns Research Ccnlífi MTT. Osuna, E., and F. Gns. E99R. “Rcducing Ihe run-time rcimplex i.v of support WCter machines,'1 ICFR 98, BrisbarHi AustnÜL Osuna, E , R. Fíwnd, 3-nd F. Girtwi, 1997. '"An improved iTainLngalgonthm forsupport vector mathLrtts/^VcKrw/jV^wfiIj SígjwlPvwtssMf Vil, Píocccdii^s of thc 1497 IEEE Worishop, pp. 376-285, Anielia kland, FL. Ou, E_, 1993. Cfeoar fe Cambridge, MA: Cambndge (Jnivcrsity Press. N H , J.P. CfuEChfield, J.D. FafflWf, and R.S. Shaw, L98Ü. “Gcomelfy fran a lime series," Pfr/jjrff/ímÉwLcXXcxr, voL45, pp.712-716. Pfcjm, O., L932. .Veuraf Assemó/res.An J1JlJcFTlfN,M, NwY«fc Springcr-Vcrlag. PaJmjcri, F.,and S.A. Shah, 199Ü. wFbsI trainingofmHLli1avcrpcrceplTnnítu-,1inEniuLLi Linear parüjnerH-u.air.un.'1 Jjr/íímtrJj'oriüf Jafef CoFj^Fwrcr on jVewraf \cXHwr±jr Vol. 1, pp.696-699t Washingion, DC_ Palmicfi, F., I. ZhiL and C. Chang, 1993. “Aitíi-Híbbiao tarnirig in lopolnjically constraincd linear neiworka: A tutorial," f£E£ IraFmcXj'MJ en Ncjrra¿ ^cVwtvds; Vol. 5. pp.748-76l_ PajxxiJis, A., 1934. AobdMÜQ^ AancAwr fMflHtr, «ntf Sx«7Affjrj£ ftvosw, 2nd cdilion, New York: McGraw-Hill. Pariai, G.P 1988 Sdfofrsffcff/ Rdtf Tftcm; Rttding. MA: Addino-WWeyn ParL, J., and I.W. Sandhcrg, 1991. “Universal approxiiTiation using radial-hasiR-runcEion ntfworfcs"JVejdraf vo(.S, pp.246-257. Parker, D.B., 1987. JlOplimal algwiíhm» fw adl^rvc netWOfta Sccond onder hack propagatmn, scoond arder direel propagador!, ¿nd anod order HebbUn leanúng,"' IEEE /sf AtfenufltaM/ Ctwtfenfncí ¿m AfarW Afexworts, vol .2. pp.593-6Ú0. San DiígrX CA. Parker, D.B., 1985. “Lcaming-lügLC: <¡i--I¡:l (tic CüCWX <rfthc human brain in Silicon," IfcAndco/XíepflFX TjR-d7, Ccnlcr for ComputalionaJ Research in Ecotnolci and Mngen«l Sí ¡erice, Cambridge, MA: MIT Plesa. Parker, ES., and LjO_, Chua< 1989. ftudfeo/ /hr CbúoXJí^SfiM* York: Spnnger_
Paraen, E._ 1962. "On OÍ a prcb&hilíty dcnsity fimctinn and mnde,H JÑjr¿?¿TqfMaífiema?¿co/SíJíjj/jcj, vol.33, pp. ] 065-1076. Pass-inu, K.N., 1996. “Tü*lrti bridgLhglJw pcrcei^dgapbcTwccri cflnvcntmnai and .nlclligent control/ in M.D. Gupla and YK. Srnha, cds., /¿rrcffigrnJ Cíj^t-T/vJ ppJ-27h New York: IFEF Press. Pavlov, E.P., 192"?. Cíndj/ÜNrfl/1 Ac/jiTcy .íj? /nhi^fígwJJwn íf/"fl/'rAí? Círt^raJ Coranr, {Traduzulo do ndiE-o por Ü. V. Annq>X New York Oxford Uh .vcts.i j- Press. Pcarl, J., 1988. AotobÜ^c AñWAÍqgta AiteMfgfltfSklíflttJ. San Mateo,CA: Mor^n Kaufmann. (Rcviscd 2nd printing, 1991 jr Pcarimuttrr, H.A., 1989. -Leaming stale-spacc tnffiCtfiriei in raumibL MUnl neLwwks/ ¡Vfiinrí G^pirfíJftcrj?. vel, 1. pp.263^69. RetHOfl K., 1901. "On Unes and planes oiclíBcst fit to systems of points in Epate/ /Vij'fejopArceTÍ jWogaz¿M. toL2, PP.559-J72. Peretto. P. 1984. -(JolIcCtivc propcrl k1* of r.r i-i : ' Mtwwtr A $misiital physics approach/ Cytorwrtcj. voL.50B pp.5 L-62. Frretto. RB and J.-l Nltt, 1986, "-Sioclusiic dynamies nf neural nctwnrks," JEEE Thwacffcmf m Sw/p^rj, Aíüfj, d/wf CyScnic/ki. voíL SMC-1 6l pp.7J-8?. Pcmn, D., 1990 "Fiuile auc^nsis/in J van l.ccuwcn, cd.L//dffJ/wútú/TAeünewea? CnuijMrJírHÜJ0K ff. frtpw:! Mftteü and Sí-Tilica; Chapcer I. ppJ-57. Cambridge. M A: MU Press. Perranc, MLP., 1993. "Impruving regrtssiüíi eflirutñii: Averagina mribod* fcir vníun radwtkn with etietifticins, lo general tumi* mea-buns opiimization/ Ph.D. Thcsís, Biown Uníwníly. Rhodc talan! Personnaz, L., I. Guyon. and G. DneyftK» 1983. ,Lln formal ¡on sioragc and retñml in spift-glasa lita wural «twati/ Jira™/ c?/JJAryí<fHít LeJJen. Oftdy. Flun. vol .46, L-3S9-L-363, PcLcrson. C, 1991. “Mean field iheory neural neiuwks for ftatm fMognition. contení iddiwibte memwy and oplimization/ Gwifítófl Scrra-r. ^ol. 3,. pp.3-33- Pcterson, L.. and J.R. Andenlo. 1987. "A mean field ihiXicy Leaming aLgüriihrtt for iKvral necwmtT,1' GNipta Srjfrurj. vol. L. pp.W5-LU19. PctcrñDn, C.. and E. Uartman. 1989. ^Exploración of Lhew<an field iheory leaming algoriihm/Ataraí wlJp pp.475^LJ4. I’l-iephji^ (". „ and B. SLkkrbcí^, 14A9. “A ncw mechod of mappíng optlfULzaLion problema orno neural rKtworki,"' Jbvmoívol. I, pp.j<22. í3hamJ D.T.i and p. Carral, 1997. "Blind scparatLnnofrniaiuiitírf incfcpcfufcnítsüureefi ihrnu^h aquasi- máximum hkeiihood apprrhflth/ fFEE T^SftMCltoJtf OH ¿PfwwIa^. vol .45, pp 1712-1725. Pliam, D.T-i P^GvnL and c. 1992, ILScpsralionüf a mixture oF independen! sourecí Ihmughs máximum likelitaod íppnfraúh/ Ph-jr.^'úíwtjíí í^EUSIPCO, pp.77 1-774. PtñUiiH, D.. 1962. HA iccbniqnc for ihc numerical wludnn of ccrftiin inicgral equídems of 11>C firsl kindT Ánttw? qf ilEHHráfnkn J&r toI.9¥ pp.S^^T, Pineda, FJ., 1989, '-RKurncíil backprapagalion and Che dymnñcal afipnndi lo ídspiive neural campal ion/ ATomF CduyNíti/fM, VOl i. |i? Ifil’i 72. Pineda». FJ., tífica. ' íicncralizattün ofbaekprcipaga: on to rccurrcnC and hi^herorderneural nctwntrks/ in AfeÉjnjí/ri/ÚJWJfú/r Awwáqp 5TJ/L7W.T» Ü.Z. Andenein, cd., pp. 64)2-6LI, New York: American Lnslrulc of Fhysies. Pineda, F.J., I9tíí1h. ^Dynamics and architrclurr in cicunil computación/ Joirma/ a/Comip^ri,1 wl. 4, pp.2E6-245_ Pincda, F.J._ 1987. -Generalization of back-prupagítion tú recurrrnt neural nctworis»11 Misíca/' fleL'jfkv ¿f/rtrrí, vol.59, pp 122^1233. Pilis, W._ and W.SiMcCXdtotti, 19^7/'] [<i^ wt know universals: ThcperctTiLLon ofauditury and visual formn," Eidtfitfm (jf AAtítanUtáo/JffpAkj/cj. wl.9, pp.l27-14 ' Plumbley, M.D., and F. Fallsidc, 1969. "Sensor} adaptation: An informalAm-theorrli-j vicwpaanL'' /^ferrj¿rrjüFJd-í Awff Gj^trwí OFt .VaiFp/ .VeOrorLí, icl.2, p.59fí, Washington, DC_ Plumh-lcy, M.D., and F. Falkidc, 19EK- "An mformation-lbcorctic appr-uaeh lo unsuperhised cünnceliqníst models/ iü AüCTfli/flíJ <?/ r^c /9SS Cüñ/rcc/FüjrÍjr MbdeJj ÍHni7w¿r 5'efttwA D. Touictzky, G. Hinton, and T. Scjnnwski, cds.. pp 239-245. Sin MU«t CA Morgan Kiufiuann. Poggio, T., L99fi. “A ihecry nf how rhe bnun mi^hr woric/ CoM.í/7rj>rg /tortor$4qpo±íiriN czo (JNMfrffl/íw tfj'a/ogyP vol. 5, PP.899-JIQ. P-Dggio. T., and □. Beymcr, L9M. ''Liiaming io secf ÍEEE SJpectrWL vol .33, nO-5, pp. 60-69. l\i^gLLh, r„ and S. Eddfmflr 1990. “A nctwork thal tetruA Ip recognizc ibrec-dimcnsionaL ofcgctfi/1 .V¿ujíñ?L vflL.343, pp2e3-166r Pogjio.T, and F. Gira&i, I 99Qb_',,Nciworks (brspproximiiíia md teaftiing," voi.78, pp. 1481-1497.
Foggio.TM*fld F. GiHH^mOh "RcgulanzalicmalgonLhms forlcaminglba! are Hjuivalcnt tomullilijyrintíwürkR/Sic^flWj volJJ?. pp.97K-9K2. Poggio, T., and C. Koch, I9S5. "lll-posed problona in carly visión: Frnm-coinpLilariúnal Iheory lo aiulngue Mfwcrfsr PlDcwJjjrgi o/Aí Kü.i'flfSarkfi' o/'/.njirfíHr. Series E, vol.22fi, pp. 103-12 3. Poggio, T-. V. Im, and CT ECoch, I9-K5. "'Cnmpütalional visión and Rgulnri^rinn. (ticoryr VOÍ Jl7h pp.3 14-319. Pnlak, E., andíL Ribiere, L969.,lNütesuT la com-ergpnct de ifterhLX¡sdcdiftie1ioiisco<i¡.i^DCí$h,t A’eiiJí-Fo'J^rrm'se fepfcerafe ™rinjwL?yí4; vol. 16, pp.33-43. PíippcL <r,p and IJ.. Krcy.KS"’. ‘'Dynanrical learning prncesA Cor rec^nidofi of coirclíilcd piUenu in ajnlmctrk spin glosa modcls,” EwnytAv.fíjL.í£tífef3, «1.4, pp.979-5R5. Pmvell.M.J.D., 3992.'"The thcnryof radia I has is tunctinn apprnxiinaiion in IP9QlMinW LigllLed.L^J^W<Mff//TNHmcrfrc7/ /íri¿rAwj'.t lili ¿f; .íuAr/hj'.vjNN xügWiWWU'i ítríÍ flrJíJrrJ .'Íij.vj.v FjfjacN'^rjj. pp. I0S-210,. Oxford-: Oxford Science Pvb' i :d¡QPS- Powtll, M.J.D., 1988. "Radial bask fluwlion appnjximiHiMB lo pelvnomials,11 Mnnfrfrii/j4jw6,tít ¡M? Ffiaewii-.'.!.'- «021^1, Dundee. UK. Powdl- M.J.D., 3 9R5. "Radial basis íunutions for mbltivariablL* inlcrpnlaLmm A revjEW,"rJrjW>í Gwtfbwwc W? Jígflrrf^ri: Jfer Ai 4pp?nxrjw¿rfforj o/FtacrftNi*r ¿?rjJ JlofiOL pp.l4j-l 67n RMCS, Shrivenhan, Fngíand- PüwdL M.J.D., 1977. "Rwtart procedim for thc urenjusate ^radienl medwd,’1 Emeniivwj1^ ™i.l2a pp.241-254, Preiseiidorfcí, R.W... I9ÑS. Pr¿w¿píiJ Xrtdfrjrv í>r Mw4n>J4£v riW OvtvTÑag-rJip/ir. New York: Llscvirr. Press, W.Hn B.P. Flanntry, S.A. TcLLkolsky, and W.Tr ^fterling, I9RÑ. MwtterícaJ ff-nfpe* A C: 77rtf/írf qf ó'crcjrfr/ji Cfljjywrriwg, Cambridge: Cambridge l'nivcrsiry Ptkü- Prrakis, J.(i„ I9R9. ConmNn^Cflrfwu; 2nd cditioiuNtfW Yflrt: McGflW-HilL Prnkhom*; D.V., and D.C. Wensch, I'. 1997. ’Adapi ieei¡|¡iL dwiyJH” ÍEEE ThíHlMtínMS Ofl Vcnhi/ Vfll.8, pp.997-[M7. Puskorius, G.V., and LA. Feldkamp, 1994. 'Neurvccnlrcl of rnnlinw dyniniical fyrtemfl wdlh Kílman fílrcr-Lrained recumnt rwtwwici^ JEEEítaiuocfiom ujt Aí-haj/Ate/wflrifcs; vüI.5h ppt279-297. Fusküriusi G.V, md L A. F<ddkimp_ 1992. "Model rtfiMnce ¡idapLivc control with rccurront nctworfcs trained by ll&e dynamic DEKF íilgüriüim,1' ^rfmícTfrárifl-y Ja/nt Ctn^íTencc t?1? A'ewwf toniwfc, vtiL II, pp. 106-1 13, Ballintütc. Fuskíinují, G.V.i L.A. Fcldkamp, Uld L L. D*V^t Jr._ 1996, L í>>namit n^unil nrLwtnk methods app-licd lo on-vthicLc idle sfHwd ccnirol? AwMdbgf /EEE. vol.84lpp. I44>7-I42Dl Puslí<iriLL\ G V, síid LA. Ftldtsmp, 1991, “Decouplíd «tended Raiman filCcMrdining oí íbedíbrtrtfll layeredrtctwftrtaT* ffltenu/fMafJbM Cvjt/í-^'Nlt ga Afeltra/ .Vchiwfa. voí Jh pp.771-777+ Sealllt kabiner, L.R., 1989. “A lulorial on hidden Markov modcls." F/T.i<cr^i>?g5 ^fAc JEE£ toI.73, pp. IM9-1387. Rabiner, L.R... and B.l [. Juang, 1986. "An intróduction Í0 hidden Markkuv nvudelsF Ji'Ei^íkSA1 jWci.íiazjwe, vü|Jt pp.^-16. Rail, W.t 1989. “Cable llieory Tur dimdrilie neurona." in jWí/!iw/s ü A-ínrarjof .4foííe/j>rg. C. Koch and 1. Sc^ev, eds.t pp.9-62. Cambridge, MAj MIT Prtss. Rail, W-p 1990. '"Sume hislonujl nutes" in CDmpN/ffn'üfl'flFAkwreBuwfflí^ LL. Schwartz, Ed.^pp. 3-E, Cambridge: MN Press. Ramón y Cajni, S., 1911. í/rsfaíogk ¿Íh .VenvitK rfe ? I^mijneef uprtjftw. Fai i<! Maloine. Rao. A., D. Miller, K. R-dsc, and A. Gentío. 1997a. "Misture oTcxpcrts irgrossion modelinghy dcEcmimisric annealing."" í£EE ThanMcJnvu oh vol .45, pp.2Kl I-2S2Ü. Rao, A.. K. Rose, and A. Ciersho, 1997b. "A ddrnmnistú: mnalíng approaeh te discrimijLalivc hidden Marli<iv nwdd desigp* JtteflFfl/ A'igW FTí. Pwt'i-Jlljyí rirv íflP7 ÍEEE WbrfciTrop. pp 266-275, Aineli-a btand. rr.. Rao, C.R., 1973. EJtwarSÍLrrí.Yríj.u? írjfOTdcv ltjtJ to 4ppJJíYj¿/rwr\ Nw-York: Wilcy. Rashevjikv-N„ L93E. .*/nrfií^i¿?rrL\7f fifiqpJtjKÍís, Chicago: Universiiy ofChieíiLtn Press. Raviv, Y t ¡md K tnirdior. I 996. '"boctstrappiiig wilh nmse: An cilcctivc regulariza! ion tcehniquc,'1 Atatm vol,8hppJ55-372. Rcctf, R.h 1993- “Phming atgOT¡[hm&-A survey." 7EEE DwtttKfitMtí CM Afevra/ .Ví/iiruÁs, vol .4, pp.74D-747. Recle.! G.N- Jru [,.H FinkúliindG.M. Edclmun. 1990.‘‘StlectRe Teco^mtinn julomaLa,1' in Xñ ÍHflOíÍJrejjíWj ín Aj:\!iTjj!cr.izij1 EA írrnwL1 Aenvciris, S,FP 7omc1zcrt J I. Dav -.t and C. Lm* edk pp. 2Ü3-226, New York: Academic Press. Etcif, 1965. n/SCíitíjficof ¿rrid rferTDidr/í’Ar.vrry. Ntw York; McGraw-Hill Renal?, ^i., I9ft9. "'Radial basts function nelwork forspcccb pancín clttf[1íaltan7a£HKfritaic£¿r-f-fcHT, i'ol.25.pp.4J7-439. RonykA. 196Ú. “On measures of entropy and infa^maLio^,,,u/’rAí? ^W(pwArni m MdAAM/ñx Statftrfts, ¿rod /’njfvrh^rrv. pp.547-561. R¿ny¡. A , 1979 fWwAf/fn- TAran-, North-Holknd. Amslerdam.
Hidden page
Ecblkkrafu 883 R.umelhart, DPE., Ci.L. tiinlon, and R.J. Williams, "Leaminu rcpmcntaCioni af hack-propa-cíTora,” .VtrfHíe fÁrwrJrwrJ, Vüi.323, pp-533-534P RumeEharl, DE^G. Eh Hintan, and R J. W^lhams, L9?i6b. "Tcaming inlcmal reprcficnÉati-nnsby cnm prnpagir.en” in D.Rr Ruffielhad and J.1. McGíland. wí*., vol I.Chapler 8, Cambridge. MA; MIT Press Russcll, SJ.,and P. Níwig, Wthfcríf JflprtMdl, UpperSaddlí R-Lyct, NJ: Prcnlkc-HllL Ruhso, A.P., 1991. lulonal No. S, IEEE Confiraux cfj Afewu/AcrHW^/íir Octfüff £ngji,re¿,Fi!iijr1 Washington, IX'. Ruyck, D.W._>£.K_ R-agcrs, M_ Kabrisky, M.E.Üxlcy, and Ü.W. SliLct, 1990. "The muIlilaycTperceptron asan appnMÍmation te a Hayes óptima! doscnmiiLant fijnc I ion," IEEE íbrnsa<ricui,.T qfh'amrl Nefworis. vúl. I, pp.296-298. Saarinrn, S., R.B. Bramtcy. and ü. Cyhcnku. IÍ92. '"Neural niMworks. backpnjpagaLinn, and automal c dilíercntiation/" in J¿íf¿jr?itTfk£^exenftíTJ,jc?j? HftJtJ. yíFjp/cttMJiMriófl; ¡Wid ,4/p/rntfítro. A. Gricwankiind OT. Curlis-5Pcd5., pp.3 1-42, Philadclphia: S1AM. Siarinen, S.H R_ Bfunl^ and G. Cybvnko. L991. “The numérica! SúluÜon of neural ncliMjrk training probleras/- CfliE* Jfcpcrf Afe. /A99, Center for Supmjumpulirig Rcscaroh -and Lk-vluprncnL Univcrs (y oí Illinois, Urbana, IL. Saekingfr, F-, ñ.E. Ekiscr, J. Brcrfnlcy,¥. IjcCun, and [..□. Jactd, 1992a. ’Applicalinn of thc ANNAncurzl nclwofk ehip [0 high-speed charactcr rtMgn ilion/" IEEE JtanpotitaJEf aje .V^h/uI N?wfer vol_3, pp.49íl-505. Sfckhger, En BF. Bceer, and LD Jackcl,]99jh. "A neurocomputef bwd based on (he ANNA neural necuurk chip,1' /Irfiwiccj v? A'cntoI AwtfUftg Srírt'iwA-., vol. J, pp 773-780, Sun M¡Hco, CAl Morgan Kaufmann. Sureña, M-,.iridA- Rímjuci. 1991. '"Nüucal cohirollet on baelt-propejattai alfOfUhm/ fEE /Vwrwí'rKs ftrtf1vol.l]8tpp.55-ftí. Sfl^e, A P-ed., 1990, Gnwím¿n .íi-vcttis .j.-.- IYork; Pcrgamon. Salumon. R., and J.L van Hemúicii, 1996. 'Acui/leníling huckprüpagacioo ihpduglb dyiiaihk qwir-adiiphlliurk1 M'iíju/ Atnw^i.-;, vnl.9. pp. 5 89-601. Samuel, AI l 1959. "Snmc Hdüm in machine Icaming using ihe gamc of chcckcr^” íB.tf Arawl vnL.J, pp.2 11-229, Sandbrrg, t. W., L 90 L. **StrtiCture íbMKflM for nunlincniT syitemsb'L .Ifflftrí/^nnrsíünn/ írsírJNS ct/kí Srgraí Prorcssijíg, vcL 2P pp. 2ó7‘2S6_ Sandbrrg, I.W., L.Xil, 1997a, ’Uaiíbnn approxiinji(iMlüíinullidimi'n-. onjil myopicinapsJ'/£'££' ?Attiíerei'pq-.T-j oñ Cíjtí'jj/j ¿?nrf SkTltrnsP v^l.44, ppA?7-4M. Sandbrrg, C.W., and Ll Xu,L99?b. ^iJniforrri approxunarion and gamma rtttmnkl¿ .Vcwra/jVcAiwnl'.T. vol. Iü_ pp.7Sl-TWP Sangcf, T_D., 199Q, '"AnaLyñJS ofthe [wci-dimcnsional rereptive ticlds Icamed by thc Hcbbian algor Ihm Ln rcsponfic 1o Tándem inpuV Jfo'oVogrcvr/ Cvícmcfrcx. vülufiJ. pp. J21-22S. SUgH1^ T.D.b I9lí:-l;i ",A]b upi malily ;">i ii lúiple fúr UnJUptfVLKd ItMnfnjfl" .-IflvirnLír.Y dJr .'VíTiriUJ1 /nyfwmrrJj'M P^JCCíí^rg t-ol, 1. pp- 1149, S*fl Mvteo, CAl ki'iufmíLiirt. SangW. T.D., |9S9h. "Xbpliiftal unsapervised Icunñtgin amn^lfrlaycr linearfeed&rwdneural vül..l2,pp.«9-473. Ssnncr, B.M., and 1.,-J.E, ¡Slotinc, 1992. '’Claussian ncEworkí ibrdinxl adaplive cerniré!" ¿EEE JFUHrwclJüWi m Neumí iVífin-íírksr, voUxpp.S37-S63. Saticr, bJ_. 1972. ""On the dcnsilics of tamil ios □íscts/AMinwí'p/'CflfllfJ^icrfoFTüI TThwr, vol. 1,1, pp, 143-172- Saucf, T_, J_A. Vortic, uiid M. CasdagEi, 1991. "Efnbedplogy~^nhm?qf&arirfrarf PAi'.úcs. vol.65, pp_579- 617. Saúl, UK., T Jakkolla, and M,). Jordán, 1996. "Mean Held Ihcory ibr ñigmoi-d hcLicf nctworfcs/' -fajóla! rtf.4fi,ífr¿?iüí jÑaQfegíÑíe ArareJk vol .4, pp_61-76. Saúl,. LJÍ.t and M.L Jordán. 1996 "ExpkÑling Iraclable wbsinJchMi in ¡niiíKiaMfl ílí1wuTk&/, ¿tfMwnr fr? Acr^ ^i/órrwcrrwN VOlríh pp.4#6-4W, Cíimbndgc, MA; MTT Press SauL LK, ¡iTid M.l. Jorduk 1995. '"Botanum chaímuid hidden M-iftov modela/1 ¿¿tanra ín jMtwuf ftKCUfjJiX EiwfrrtiA,, vol."L pp.4 35-442. Schapifí, R E., E997. ‘"Using üuiput endefi toboasr inultklutleunim prcihlemR^MicAhr¿«minifr En^r^íJiA Jjjfírwdjjhndl Ca^biffiMiF. NashvüLc,TN. Schapirc, R.E,, 199£L'"Tbc-fiirwijjth üfwcak kamabitiLy? Ifctf&Jt1 Ld^rjírjjg, vol.5, pp. 197-227. Schapirc R.E., Y. Freund. and P. BartlcttP 1997. "Boosling 1hc nuirgin: A ncw ciplanat on for thc cTcctivcrtcss oi'voiing mclJwdsr 4f¿?cArei? ¿eo^vrñrg: ftwwdútgi □/fie fóNF/LVJtjA /jrtBHHtffrMffll C^i/cFrjnre. Nashvilk, TN. Schiffman, W.FL, and W. W. Ccffm, 1993. '"Adaplive conlrol of dynamk üysiems by back propagalien HEtwqrfc?/ A'ewreí Mffliwfa; vol .&, pp. 517-524. Schníidtr, C R., and H C. Cud. 1998- “Andog hardware implemenunion issuts in deiemimiBlk Boiízmiiwi machines/ IEEE Ttomctiónr w G^fjrírj otó Er-írr^^ JZ. h>I.45. a ser toncado. SchneúderhC.R., and H.G CanL 1993. ^Anadxv CMOS cIcrcnnEnisiic BdOrnamcircutA/* fEEE^Hrtw/SWJ^EiHtt üát^i «1.28, pp.907-914.
8B4 BCKUWIIAHA ScholkopL D._ 1991. JflKWPXramííig. Muniíh, Germán/; R Oldcnbuuqj Vértag. ScholJcopC B., P. Kimard, V. Vapník,and A.J. SmoJa. 1997. "Improving theaccuraGy and spced ofsupport vedcr machines/ jtóWCJ rri .VríJrrüJ JttíírtflJrrflH Apee3JÍJ|f Vü!.9. pp.3 75-381. ScMVwpT, B., Au Snida, and K.-R. Muller, IW8. ’'Nonl incar componen! anal vele as a kcmel cigc-nvalue probit m/ iVenra/ CúmjjuJLrJjdJri. vol. Ifl, a ser lanzado. ScHMkopf, B-, K.-K Sung, C.J.C. Burgts, F. Girosi. P. Niyogí, T. Pnggio. and V Vapnik, 1997. "Comparing suppnrt vector machines ^ilh Gaussian kcmcls io radial buu Túnel ¡on classifiers,” JEEE ThwstflfcNU au PrncísiJír^. vol.45, pp^75a^7h5. Sehesudolpli, N.M., andTJ, Skjtiovi'ski, 1996. ""Tempcring hack propagaron nctworka: NlH all wcights are c-neatcd cquaJ," Je Ai^raí frwvnftjgSi'Jíem.r, vol.8, r-p.563-569. Cambridge. MA: MIT Press. Schumakcr, L.L.. 1981.5/r/me FNJtttíMf; taire TAcz?n-. bfeu Yixk- Wilcy, Schurmani_ 1997. "'Alltmalivrinclrics furmav itiunl margin clásSillMíion/jWÍ Wwfcrt^Jfln SwpporJ krrfcr MkMms; Bcckcnhiidge, Cü. ^chuEtcT, H.G., 1988. DeftHOÑüttfe CAnui.'^Pi ffftHNÍucJ'Jon, Wcinhíim, Grrmany: VCH. Scoñeld, C.L., and L.M. Cooper, 1985. "□cvclopmmt and propendes of neural nrtwotrks.^C-an/rrTipDHnn' PAitícj. voL26. pp.]25-L45. SvüLCAjC.. 1977, A'euiTjj-JinJc-v, Nw York. Wilcy. R.E., and MJ Cancr, L99L. ,LFau][ lolcranee oF proned multU-aycr nctivorls/1 /rjnrrfjajjünd/ JWoí Cfr|^nc¥ rwr .VcrJ^-r/MtfWCribf, vol. IL pp.447--45Zi Scarrk. Sejhowski,T J., 1977a. ,n^ifong covariante witti nonlincariy inLcfacting nturons/vol. 4, pp. 303-321, Sejnowski, T.l.k t977b. 'ílatístí-cal canEtrainCs on synaplic plaslicity/Jonhwi/ q/77i<wrfr™? vql. fi9+pp.3S5-389. ScjnowKki, T.J., 1976. 'X]n global praperties ot'nmronal mlerartion/ flotagjarf CiAenic/JU, vol.22, pp.85-95. Scjnowski, T.J., and P.5. Churohland, 1989. '‘Hiain and ragjiilionT in Fn^m/ü/JcNtí M3. PoffTKr, cd h pp. 30-1-356, Cambndgc, MA: MET Press. ScjrviWfiki.T.J., P.K. KirakWfSndEi.E. Hintnn, 1986. HLcajningEynunctry gmups with hidden uniis: EcyondlhcpencepcrwJ" PJji.ífCiJ, vol.220, pp.2601-175. Sejnüwski, TJ.tC. Koch, and P.S. CbuRNud^ 1988. “CompuEdiional rtjeuíüsciwce? Scjlesfifi vol. 241, pp. 1299-1306. Sejrii^vsk], L.J., and C.R_ Rosenbcr^, 1987. '"ParalLel nelworks :tut Jmjti 1o pronounoc EngLish lesi?' Crw^pícA Sj'Uíwu, vol.L, pp.l45-E6K Sv'inou'ski, T.Lk D.P. Yutus, Mil. Uo!ds1einH Jru and R.E J?nkin&i 1994. "Combimng viflttl and acoustic spcech. signáis with a neuiHl nctwork improbes intrlHgibLliiyH./trfraH¿Ti ín A'cnhj//n/r¥7T?aíítwr JTucciirpgÍvjI'cwí, rol.2, pp.232-239, San Maleo, CA: Morgan Kauftnann. Sclfridge, C).G., KS- SutEon, and C.W. Anderson, IMS. ''Sclccíed bibliography on conneclioniñin/ íiwíjdrmjr, CtagHÍríófi, Y.Cl LceP Ld., pp .391 -443, Rivrr Ldge, NJ: World Seicnlific Publashing, Inc. Scung, H., 1995. "'Anncaled Iheones ot'Jeaming/ in J.-H Oh,C K.won, and S. Cho, cds., AfatraJMffNw4j.r TSc Süf.arúuL'dJ .Vcc/un/íB ArapBcJrw; S ngapore: World ScienCific. Srung. H.S. . IJ. Rkhaidsnn, J. C. Lagarióa, and JJ. Kopííeld, 1998. "Saddlc point and Hannltemían siructuTe in eM-itatory-inhibilory netwürkH-'" JcAuncej Jid Mrirra/' Svjíems, vol.JÜ, a ser lanzado- Shah, S-, and F. Palmirn, 1990. _tMLKA-A fasl, local algonthm for Lraining fcedfcirwand neural ndworks/ AitáraoflEMd uÁprn? Gan/cmirc oh Acuna/ iVerH-antr. vol.Jp pp.41-46, San Diego, CA_ Shamma, S., I 989. "SfMtial and Icmpora] pnK^HELng in central auditnry nelvorfcsT in .Ve/AnA hfj Mwn/ C Kúcb and 1. Segev. Lids., Cambridge. MA: MTT Prrsa. Shannu. D.E. 1978. "'Conjúgate gfMÜSYt melhuds wilh incxact hne scanchcs/jWjfAcjnaíJci Jfr.whrní/j, vol 3, pp.244-256. Shannon, C.L., 1948. LA mathcmatical thcory of commumcalioo/Sujcjfj 7?cArjde¿2¿ Jhüwri3¿ voL 27, pj*.379-42X 3-656. Shantion, C.E., and W, WeaverT 1949. TActfd/hHMíínaf í-/Cc|mflTNmccrJ/oir. Urbana, IL.: The Umvcrsity of Illinois Press. Shannon, CE., and J. McCarthy, eds., 1956l YWrL-.-r. Prineetnn, NJ: PrinccLfln Uiíívíísíev PitH Shephcrd, ü.M., 19Í8. 2rid edición, New Yofl: Ortfofíl l.mivír^ity Press Shephcrd, ü.M., 1978. "Microcíncuits Ln thr nerwufi syslcm/ £ctatf(¡0c jlffMriwiL vol.238> pp.92-IO5. Shephcrd, <ÍJb(.. cd., 19lXJa. 77jí A'i'jiflfwj? JtdfdítiOfUNew YMc: (hitad Univcraly Press. Shíplrurd, G.MU 1990b.,L Itie significante nf real ncumn architerlunes For neural nctuort limulfllitxns/ ¡n Cftjn/?uftrJ,jc?riíj/ A^jrwcjcritr. L.L. fkhwartz. ed.. pp.82-96P Cambridge: MIT Press. SheplkCTd, G-M., fifld C. Koch, 1990. '"[rilrenjueliun lo syniipLic circuito,'" in Tíie 5yjr¿^xrjc Ajwiizoffm Smí*r. G.NL Sheplieni, «L, pp.3-31 N^w Yo<k; Gritad Uni^mity Prcas
Sherringtfln, Q$-h 1906. 77rv XcTíon A't'nwjj Si j/ctj, New York: Oxford Univcrsily Fress. SherririjfKiti, C$.H 1913. TÍk Eaj-j'/i dnírf.JjjjWecJhuiiyw, [.imdon: Cambridge Emvcrsity Prcas. SherrÍEi|ftfln, Dl, and s. Kirkpalnck. 1975, "Spin-glasEcs," PAivjedJ E¿?vfew£cffln> vol.35, p-1972. Sbewchut JJLa 1994 íIjt ftftvdtacriÍM to (Ai fíra¿fi>nf jlfcrhrrtf iHWíüf í!jí ^íúri^^j^RrÍJí, Schnfll oFCompulcf Science, Camele Mellon Vihv&sily, Piccshurgh. PAt Augure 4J 994. Sbore, J.E.h and R.W, Union, 19MJ. “Auomatic ofthe principte <f rnuimun empy and thc principie of mínimum cmss-rntropy?1 /£££ TrMttctlMr tW wl. FT-26, pp.26-37. Shustorcivich, A., 1994. |LA suhspaee projection appraach L-o triture1 citractinn: Tht Lwo-dimensional Gabortransfarm far chUKter rcíognitH'in/1 Atara/ AímwrJtt, vol .7, pp. 1295-1,391. Shustnrovich, A. andC. ThiLLsher, [996. nl Neural nrtwnrk position. igandclassiñcati-on ofhandwTLLLenchaTBClers/jVcjrjTa! Ntfuvril. vqt,?, PP-.6ÍI5-69’ Shynk, J.J. 1990. '"Pcriórmance surfaces rifa singlc-laycr perceptron," j1 L'i'E T^r.racXhw en .Veidra/ 1.26K-2"4 Sbynkj J J^and N - Bershadt I Wl. ^StalinnafJ' poinls and performance Rurfaees of a pcrcepOnn Icaming algorilhm tora nonstationary dala modcir AticnutioM/ an iVrjrr¿?/ A'íwnrts, wl. 2» pp. 13 3-139, Hihinujre. Shynit, JJ.t írtd N.J. Bcnhad, 1991. “Steady^staK! analysiR of a single-laycr pcircplron bascó em j systcm iduUificatLon model with bias Icrrns/ /EfE rwjjpcr/rw m Círca/lr ¿mrf .Si.wujj, voLCAS-38, pp.l030-1042. Sívgtlinam^ H.T.a B G. Home, and C.L. Gücs. 1997 “Computilknil apobitilic* ofrecuncnt NARX neural oetwwiar Si jJrr?i£. Mnt ¿rnJ Crtrnicrrcr. A; Cybmwifc^ vol 17, pp.206-21 5 StEgelmann- i!.["., and'E.D. Sunlag, 1991. "Lfvnng CWnpüUbihiy wíih flcurll mi*»'1 irffrrjr YOl < pp. 77-60. SimardP F., Y. LcCun, and J. Denker, 1993. ,fctíffic"cnL pjOcm recogntion uaing a tiew In-nsformalion distancc,” JdwA«s frr Atañí/ Si'jPtwj. vol. 5, pp. 50-58, Sm Matw. CA: Morgan Kiiufmunn. SimardP F., B. Vicíorri, Y. LcCun, and J. Denker, 1992. "langent prop-A formal ism for spccifyíng ¡idrclcd invanancrE in an adaptiwnctwortCiíAuncai ¿n Abura/A^EmoAñn Sj’sJmr, vd. 4, pp. 89-5- 903, San Maleo, CA: Morgan K.aufmann. Simmons,A 1989, ,LA vwwofitic wcwld thmughlhe hal"fi car: TheformatínníifacMsiic imajjcs in ecbnlncatmn,"CcgnítÍM, Wl.33, pp.L35-|99. Sjmnwnitj J.A., P.A. SaiLlant, and S.P. Drai, 1992, "l'hrciugb a hafí ear?" I£L£ ^pecfnm. voL.29(3 ! pp.46-46. Singh, S.P., cd., L992. j^rnifaurtravi 77imT-i Spíine fmcfÜHU LTnr/^^p?KÉJJjmrj- Dordrechtj hc NciticfLands: kluwcr. Singh, S., and D. Bcrlsckas, 1997. L,RcLnforcrmcnt Lcaming for dynamic channcl allocation in ccllular t^lcphím^^£y5Ccms1,, rn Mnvp//fi/&™j.fjün ^ncc.rjf^S^TBBX vol. 9, pp. 074-960, Cambridge, MA: MU' Pites. Singhath S.B and LP Wu, 1969. **TmLning fred-íbnvard nctwnrks wtLh thc entended KaJman filter,"' f££E C¿--|riftlrc--rTíi,-4M j4c0ttf//cf, ^NKfrh pp.l IR7-119ílL CdflSjtQW, SontLand- Siílgtelernh R.C t 1962. ,fcA test for Iíiiüt wprzbi I Í1y as apphcd M sel f-nr]ganizi ng machines " in M.C, Vcvití, C¡T, Jacobi, and G-D. Gddstein. eds., frjfíhBanüftE ín/ciny. ppJ03-324aVtahvi||on DC: Sparfan Books. Sjobcrg, J^O íhang, L. Ljung, A. lk-nvtnisLc_ B. Dejyurc P.-Y. GtorennOe, II FljúlmarSSOrt, and A. JwlilslyL 1995. “Nonlincar blíkLk-bcn ir.iiLlc.-ng in >y>icm ideniIflcvtÍH A uiiifiod ümhview/' 'vol. 31 a pp- I 691 > I 724. Slepian, Dla 1973. Á'o'ptrpm- ftt íj>yj/rí?rjr]frjj>^j Nw Vcwlfc; 1I F-.E Press. Sloanc, N JJl.l and- A D. Wtncr. 1993, CfinHÍrfAvwiM Crjürj.-n11/Apcn; NcwYíirk: H IT Press. Smilh- M., 1993. .Vcnftj/ lY^rn^Ht-v Jíar5r.sff¥rrrTj7 .ifor/r^rrjt;, bJew York: Van NiKíiíaiid Reinhold. Sanóla, A J ind R. ScHIkopC 1996. ^Froui regularijalinn opcrarnrí t-n suppnrt vcecnr kcmcls,” A/mwej ¿n A^Jífu/ fjTJí t'.Y.YrrJ^-^rtflWl1! vnl. Iflt ro appcM. Smolensky. P.b 1988. “Ou 1lw proper ircacmcnc cf Mnncciiflnism7 Setamr, wl H, pp 1-74. Sontag, E.D., [996. ‘"Rccunmt neural nelwocks: Some tetmk|gand sysCeins-chcorctii-aspeéis,M De[\idinentofMachemalici, Rulgen l-'nitersiiy, Hnjíiswick, NJ. Sonra^, E.D., 1992. '"Fctd.baek stabihzalion URing twn-h ddcn-Eaycr ncL<' i£E£ cm A'cwihW'Xx vol.3, pp.93j-99QL Sontag, ÉJ>, 199D. Mz/^nufíáo? Coitírn/í^/L’nw^riffJ/cFuHiftD/fliMiÍQna^'i'ífcjrií, NcwYori: Springc-r-Vrrlag. Süntag, li.D . 1969. “Sigmoids disLÍnguish inore fifflctefltly [han. Havisides,' ’ .'Vt'Nra/ Co/T^rf¿rrfoít vu]_ I, pp.470-W2r Southwcll, R. V., L946. JtebnraTÜNi Aífe/Aiorff m TWkw/íciW 77ivjj?j. New York: Oxford. Univ-m.iy Prcss. Spccfo, b.l,-.t 1991. LA genenl regressiun ncurd.! net^ork?' Jt'EE 7rüín<?cfjüuídn Acr/raí vol. 2, pp.5&8-57&. SpwdiLii, A a 1997, L1Oa che«fuputatifflul püwer iif rwnfrrvnl neural n^Cv-nrks for !ímlcLure&1", A'roral Nrfwwfe, wl. 10, pp.395-4OO- Spcfdu:i, A., and A. Slarila. i 997. ''Supervired ncura.1 nctuorks ibr Iba classiñealiún of sinjctures," fEEE r^jj^úiL ^n^.Y mjj A'mmí MAiwfer» wl.8. pp.-? 14-735- Spwher» Ü.A^ IMS “Orí ihc slnicttm -of coniinuous foncLfons of several variables,1" 7rajrjínc//cíj!,j p/’íAc 4r?icrfc¿ro .VíjlAc/narjcíj/ SoríL'fv. voLl I5> pp.340-355. Sfceinhucli„K.a 1961. Lemimlrix vol |a ppJ6-45
686 Bibliografía Siem, G.S.h 1973. “A physiúlogjcal m&chanism ibr Elebbs populare of lEarnirigJ^racreJjffjp o/JrcAfafwfluMciKfcmr of Jcrenccj. LÍM, víd.Tfl, ¡^997-1001. Sberiing, P„ 1990. ‘"Retina,'"in Ttatf Spruptic Jrarn, U.M. Sheptierd, rd., 3rd edilion, pp. 17EklL3t New York: Oxford Univcrslty Pira. StcvcnwEi, M., R. Winte^andB-WwinKY, 199D. ^Scnsitivily aflayered neural nctwcrlcR la htoth Inlbcwcights^/wYú^iLTrjortü^ Ji-.ijni í1*! Nturaf A'^OiTirtr, vnl.l, pp.337-34'Jr Waslñi'i^ioiL DC. Sime, M._ I97JI, ' l u ---.-\ .iltdalinn: A review," .WarüfjHdJÍri.^ C^mtttajq^ncAuitf jtatff/trdtalL vüLV, ppill7-l]9. Store, M - 197^. ,'CrfflA-valida1ary choice and asscssiricm of Rta1 istical pf cdlcl inns " Jfltarvwí rtffAf 5Ydrrr.rrr.ftJ SbírcJn vd D36, ppill-J33 Stock, D., 1989. b1s bíLGkpropíigíitiüTi btologitally plausible?" MlWWCitMMÍ Au-tJ Qn^IWKe1 un Mwnri Ncftwrfc. vol.2, pp.2í I -246. Washington, DC. Slrang, G-, I98Ü íWbJ rr.fl^pftiMrtoíu, Ntw York: Academia Prcss. SJukLA-, and K. Ord, 1994, KrWrJnddttrweJ voL |, hth editioa New York: Halsted Press. Su, H/I, and T. MtAw% i 991. 'Tdeniification of Chemical proceses usinj? recurren! nei^rfcsr^ract'Crfrrígjf c?/dre JM jímerfean Cwtfwíi vnl.3> PP-23 Ld‘2319, Bitsion. Su, H,-T- T- Me Avoy, and P. Wcibos, ] 992. "Long-lErm pred ic 11 dos of chrmlca] [wtmessk ustng TECunrnl neural nctworks: A paraLLcl ii jiniruj app™ch,,n YnJir.rrrr.af £"FJXÚMtfrifl£ and CAemíca! fle.íesnc/j. val. 3 L. pp. IJ3H-1352. Süga, N. | 99Q3.. "Cortical cflmputalicmal maps forauditaiy imajing," A'furaJ .¥pfu,nrtr, vol-3-, pp.3-21. Sug¡i, N., 1990b 'CcTnipuiadüíis of uelwfty and ratigc ¡n che S.r «uditny syslcm fcr echo local ion,L| in CuropirüiJü™/ JVHrfwcíAKCp F ln Schwirtz, ed-, pp.2I3»23l, Cambridge. M.a: MET Pkhl Sugd. N a H111---' "Bk^nar ¡ir.il ñ^urel COVQNItltion in hatS."Spto||^f Xmrrj\.-£J^T. tol.262, pp.60-68. Suga, N, L9HS. “Theexime lo whichbiKmrinfanutÍM ¡a nepresemed in ihe bal audítoey cortea,"siiWiwc <?/" G M- Eddman. W.F.. Gall, and WM. COMO. edL pp. 653-695^ Nt1*1 Vwk¡ Wíley (EnicrícicfKcK Suga, N.b and J.5. Kuml. 1995. ’-Bcbolocalion: Crcaóng «arpadlñnil impía" M-A órbita, ed., TAe íín^íwt af Anta ffican- flnJAfititfaJA'cmcrfcj. Cambridge, MA: MIT Press- SuLiun, J_P., and J.A_ Andenn* 1995. “CompíitaiiMisl and neuíobi&logLcal feaiures of i netwófk af netwurks,1" in. J.M. Bowcr, ed., TRe MwvMpJqgy o/ Ctw^ptrrjrj'ün. pp.3 L7-322, Bastón: Kluwcf. SuttMa R-^-, L,1 jesniirig. Clt pr^diel h\ che IhúlhúdM af temporal AftHnCMa*4 ‘WúK-^ífjí1 wL 3a pp.y^J, SuttMl, R.S p 1986. "Twkr problema wich hack-pnopHgfñMi and ctber atMpcsl-dtswfit Icaming procedurcs for netvmlHa" /^tíítíATtsj qírAe ^Hiuraf CH^WKeqftff GspitfK Sr-íewiM ^ i- oí pp- 82J- S3I- HiUsdalc. NJ: barrenee Lrltrnum. SuLLOn, R .Stp ed-, 1992 Spccial 1WB on Re i nfonoement Lcaming, KkMk £wnilt£ vol. 8. pp, l - 395 - SuLlon. R-S.t 1984. “Temporal Credií assignmenc inreirtfofeement leaming,'" Ph.D. Disscri-íiliwi, llnkírstly of Massachusolls^ Amhersl, MA. Suttan, Et S a and A G- Bí-tlo, 1998. Jfriír/íwi rjntmJi^.r-.raÉnjf.-.-ljt1 MhMÓKlfiMl Cambridge MA: MIT Pneis. SuykenS, J A.K-, J-P.E- Vflndcwalle, and H.I..R. DcMoar, 1996. Afetrr¿r? dVíl^ritr /ñr MMdfrtJ flwrf Ctafrv/</ Dordiccht, The Ncrhcrlands: KLuwer. SwiiwiLchurst,. A_L_, MJ. Gons, and B. ÜtbmtEn, 1997. "‘Some «.perimenis- wilh irray daia túlIcctEd in actual urban and suburban enviranmentR,"' /EEE ttbrftih&p m Signaf Prvcessing Acfcattes fn Híreírjs Cümmwnicaíionr, pp_3UL-3ÍM, Parí?, Francc. Takatiafihi, ¥., |993. ^General¡zallan and appnox.matLün capahilif.es úf multilayrr nrtwrirks/" A'raraf Compu'íúfTnff,. vol.5, pp-132-139. Takens, F-. 1981. L,On ihe numcric?] ddcrminatLqn of thc dimcfiiion of an attraeior" in D. Rand and US- Ycwng, eds., Drrajnjtu/ Sj4Aw umf rirn&wAwc- Annuíl Nolcs in Mathcmalics. vol 898, pp. 366- 38], Bcrlm: SpnngepVetlag. Tapia. R.A., and J.R. Ilwmpson, 1978. Mh{pdFiMMrít F/üAfltM/íA' Ociurry Ejíj'^aft'tr/T. Baltimore: The Johns- Hoptins Umverbtty Press. TaylcM, J.G.. 1997. ‘'Ncurel computación! The híAOCKll haakgrnund,” in E. Fichen and R. Reale, etK, ffrrfJAtiwA (j/j¥™m/ CtefptftatiM, New York: Oxfcrd L'mveniily Pncsfi- Taylor.W.K., 1964. '"Cortico-Ehalaniic organizaron and metnory," ü/ ífctf ftpví SocríXt; Lnjhírwf. .íerj'tT fl. vol.]59Lpp.46647 R. Taylor. W.K_ 1956. HE]ectricaJ RimulatÍMi of^ame ncn'ous syRtcm funccinna] accivities/' 7W0^. wl. 3^E.C. CticfryL ed.L pp. 3II41-328, Locidon: Bucttrivúflhs. Tesauro, ü h 1995. '"Temporal di-íferencc learning and TD-gnnuTW,” CawBttJvtaart«u of rte .IfSrTeddJXM./íAf .l/íjrÍHMO; vul. 38, pp. 58-68. Tesauro. 0 b 199*1. 'TD-Gammort, A sdí-ieaching EJickgununofi prugram, •cWwesmzsrer-level play,” A'fura/Co^Mrtóftóíj, vol. ii, pp. 2(5-219.
Tcs3luü, Ci., 1992. '"Practica] isaues in temporal diflereftec IcanainaJ’ MkMhc Lt'úrnitig, vol.A, pp,257- 277. lüSSurü, Ci., 19R9. “NnirOg¡i.TlrtrrtL'in wLrts ^LWpulcr rtlympLiid,11, CowipH/fl/'ííM. vol ]. pp.? ? I -313 Tesauro, Cr. andTJ. S^jnowvfcir I9S9. ”A parallel ndwnrk chai lurnt loplH-y bKkpinnoni** /I n1 r/rcítrí ^rír,rJígcuct,l toL 39, pp. 357-390. Tesauro.O-. andR. Janssens, L9SS.TSotvilrtl&1¡ondlÍ¡BÍnIndc-pNpipítiMleming,’1 CMHptotírjtrw^y. vuJ.2hpp. 39-44. Tcylcr. T.J.l 19116. EIccLrophysiolcgk’al anatagffTin £«mr^$ oi^ ¿tierfegríY^ LÍfh; J.L. Martínez, Jr. and R.3. Késíicí, edsn pp 237-165, New York: Actdemíc Fren TlbOfrtdiltf, E.L.i I9| l. Jhft'/A'gtwiK DeriervCT: I liflur. Thrunt S.B., 1992. "'The rote ofapfontiüH in Lesan!.:íoncricil in JjifrJfigrní Ca^rJ^u/. D. A. WHtCand DA. SoFgeLcds.L pp.$27-559, New York: Van Mo^irand RrinholcL Tiktbnnfflí. A.N-, 1973. '^On rejutartarinn of ill-poscd fwnbleni/1 JÍMÍ tZ-S-íR. wL Lfl?h pp.49-52 Tikhnno^, A.N.L 1963. ,LCti Aükárijj i nenrícet]y pnsed problema and mechad oF nc^ulari ^EÍLiab/1 ZhjJtfrjdi-^Wenrir .VrwA L/.™, vol. 151, pp.501-504. Tikbcmov, A.N., and V.Y. Aracniti, 197?. Pnjfttaiii, Washíngion, DC: W.H. Winsion. Titterington, D.M., A.F.M. Smith, and V,E. Makov, 1935. Sjjji.wkü/ .Jjnafr.ffr o/Hmífí? A-íurrurt? Di.wríftkrrflrií; New Yorl Wiky. Tnurclxlcy, Dí¡._ and D. AP Fomerfeao» I5W, "WhaL i| hidden ín che liiddcn Lyers?" R^c. «1.14, pp-227j 333- TsilíikRsL J.NP.. 1W. “AsysdllOMUl ftodwtit MpprysLn^iitinimdQ-leamin^.WíTrfjwÍDsnq^rg. vol. lí-. pp.18-5-.202. Trtfii, A.C-, and ArO. R*ck, 1994, "1 J0üálly rtiCurpL-rtC gjobllly fttdfÓCWird rWlwtirks: A CTÍtiCtl K¥ÍeW,H/£úEE 7Vtintó£tí(>flí M Nhwi Jítfworfcj, *Ql.S, pp.229-239. Turing, A.M., L952. ‘The Chemical hasis üimorpliogcncsisr- PArtara/j-Ajed/ TrtJn.SdFCJj'owrt/'jA-l? .^eow/ükIíO'. R- vol .2 3 7, pp.5-72. Turing, A.M., 1950. "Compuiing machincry and inlclligcncc,” A/jW, vol.59, pp.43 3-460- Turing, A.M., 1936. n,On compulahlc numbers wkh an appLication to thc Enischeidungs prablem," Pfúl-lil1 Jj^í- rAt- ÍMdofl Afd-rAemdJJí?üJ.$oc<e(ft Sc-ncj 2, vol. 42, ppP 130-2)05. Corre^ü publicada cm vol.43, pp.544-546. Tspi, A.C-i and A, Backt L994. "I jficflllj- nofiirT-cnL^lnbally FDfdFnrw-ard nclwcwka: A crilicaí review,” Thwwribflf Neurni A'cíiiwis, wUr pp.2 29-239, TzeFcstaí, S.ü.,cd., IW1 AdrfAüJj újrrf4pp/j?HtíoBr í^/fífr//¿g€íií CdhiPu/, Boston.: Kluwcr. L'din, SB.,and J.W. Fawcctt. L^tf/Tomalion of [c^graphie map^'/fHjrNa/RcTfc^'t^A'rNramcJícc, vol.2, pp.289-327. Ukraíncc, A.M^. and S. Haykint 1996. kA mndulíir neural «hrttft For eflhmcertttií of effiíf-políiT radíir Ungeís? AfaimT AtaiMiribL vol .9, pp.,143-168. UkjBincr, A__ and S. Haykin, 1992. **EflhUttinevtt <if ™Jiir imaycH using mulu-nl n forran ion bíised unsuprrviscd neural nctworks," Gm^tan Ca^rsicc o^r ¿krfrTíY^ and Gi^rprjJer pp. MA6.9.1 - M Aó.9.4P TurontQ, Cañada. Uúley, A.M.i 1979. A^&rwwfikm ?)wjwrpu>jf<|n m ¿A# AtenVoi Aiwfr-jn, Lofidfln- ÁctdenUc Fn^s. Ullley, A. Mi. 1970. "Tlw infonnon: A tKlwi¿*k for kdtpcive píillíni neetnidonT-feknu/ »l 17» pp 31-67. Uuley»A A1n 1966. “Tbe tnmÍBBKn^F information and (be cITccl ofloca) fcedback in theontiol and nc-uraJ licLuMOíks? ffirtrin RerranrA, vnl. 102, pp. 23-35. LJlllev, A-M., I9$éí. "A Iticory of rhc mcchanism qf leaming hased on thc computaron of canditional pirihabiIitics/' ftwwttivr n/Me Fj^.'ü AlfimdtkwM on Lj towrtcv- Namur, Cr-auibLcr-VÍJlara, París. Vaillint R., C. kítitirocq,. =i id Y. l.eCun, L 994. '^Original approach Fürlhc Eacalizadraiofobjccts in imagci,1' JEEftpmdblff f/.rjjzíírwrJ fjjt Hfjdíri, jcl.i.i Utti/Sr^rJú-y FnX'f.f.ífÑjí, VOÍ. 141, pp.245-250. VUavuíI, K.P., and G.N. Saridk, L992. NarwcIL MA: Kluwer. Valíant, L.G., 1984. ,LA tbcory of thc leamable." Cmmiim/cvJhuu ilnKndhM_for Ctrmpjrrfflg jW^cArócn'. vol.27, pplí 34-1142. X'andcrbci, R. b 1994. ‘ímcrior poi nt mclbnds: Algorirhms and foraiu latinus/' F7R.74.AiJrrwdJ rwr Compúrúr^, vdA pp. 32-34. Van Eiven, D.C., C.H. Andcrscm, and D.J. Fcllcman, 1992. "'Inionnarian proccssing in itic primate visual systcin: An integrated systcms pcrspcclivc," Srfa®ppP ^'qI.255, pp.419-423. van.dc.La3r, P-.í. Heskes, and S. Ciiclrn, L997. "Task-dependent leaming DfaCtmtion/A'frd^/.VerH'ork?, vol.K), pp.9B 1-992. van La&rtiüvenP P.J.M., and L.H.L. Aads, 19S8.5j>»?rjJd/£j4tJÑé,a!^jg.- Boston: Kluwcr Acadcmic Pub..silera. VknTms, H.L., LíóH. üc^cíjm. ¿.sfrwjjftat AAiAobJ^v? 77iefl/n, Part J, NcwYeirk: Wilcy. 14fl Uutlr, M.M., 1997. uNünparamcrric dcms-ilv cal natiun and irgression achicved with tüfwgra.phic maps riLaximízing lite inFormaiion-iheortúc tncrvpyof ilitir ouipuis." wl.77, pp.49-61
88S BlííLJDCJlAFCA Víib HuLlv, M.M., 1996. nlTopügraphLC map fnrinaLion by maKimtzing unctmditional cntropy: A plausible straiegy for L,oh-linen' unsupcrvised Dümpciitbvc leaming and nanparamctric densily cstimadon,” IEEE Transaeriotfs onr Afeurui Atm^r+.v. voL7, pp.l 299-1303. Vari Vttft B-, 1992. “Mínimum vjrianec buntfbfinin^? in S Haykiti and A. SleiríharcH, cds., JJü/írA-ir Jtafar Auo'ejíriJí fnílMtfott; Ne^York: Wiley ([nierscicnce). Vapnik, VPN-, 199S. SrdfUjjíüüütmiÉFJjí TAton', New York: Wiiry. \^pnbkflV-N-, 1995. ArjfHf¥^.5ftldjrfC3/ í-ctrrnrrjí Tjfrcon', New York: Springrr-Veriag- Vipnik, VN,B 1992. "Principies of risk mniníotmi ibr learning íhcory? 4diumrei m jVvjhjíz! J^bnwtfcfl ftwmúlg íla^'ftt.y, Vülr4, pp.SS l-RSS, San Maieo, CA. Morgan KaufnLann. Vapnik, V.H, 1982. E.sfrnddrríortofDTHdflKtffAmrfM Effl/Ai>j?uJ Éferta, Newlfork: Springcr-Vtrlag. Vupnik; VNm iid A-Ya. ClHvoonkiL L9?l, L,On thc utiiform coiwrgcnce of relave frequnñi of c-cnis to their probabjbticR? TTien^rjcj/ AraJwfu/r¡(^ áhdltt Xppíj'co/ro/rs. vul.l7, pp. 264-28ÍJ. Vapnik». V.Nr. and A. Ya. Cherwncnkífi, 1964. ”A noteon a claHS of perceptrons,"¿jfjJ Eewwje Cowrníí» vol.25, pp. 103-109. VcLmans, M.» 1995- 'ConRciousncss, Thenrics oí? En M. A. Arbib. cd„ ntfMuidbíKAD/jRhaOr ZletwT.'mNÍ A'eNrjM'íYiiw.ts, pp.247-250, Cambridge. MA: MIT YcnJcataraman, S., 1994. "Ün entodmg nonbnear útcblhLlidm in neural nctworks for locomotion,’" qffhe JfrAi Ka/e HwtíAopnn djrJíeunfrpE^iJfems, pp_ 14-20, New Haven, CT. Venkatesh, S.J., O. Ranche. D_ Prallis, and G. Sítbí, 1990 "Shapmgattraction basins in neural ncE^orks,"' MwqJMrTMwfc. votJ, pp.ól 3-623. Vellerli, M„ and J. KoraCevií, 1995. Wivc/c/j ont? Sbb&Md Coiíj>rg. Englewoud Cliífs, NJ: Prvnóce-Hall. Vidyusiigiir, M B 1997-yf TTwwj1 afEwitiqg t™/ Gt'm'iWta/tal 1 xindon Springcr'Vtrhg. Vidyasagar, M . 1993 Nufllwr Swww d-Wi-rf.v. 2nd ediiiop. Enftavood ClilTs. NJ: Pninciw-Hall. Viterbiif A.J., L967l Tin» bounds íúr cünvoLutiortíl túdte and an ásympltMically úptimuaíl deeudirtg algoriLhm.?1 JEFE TraM.raoíioru oh /^Etrnuriwi Tfríwy. vol. 1¿'-L3P pp.?60-2&9. ven drr Malsburg, C._ L990t '"Stíwork sclf-arganizaE]™,"- in An /jrriWHcrfou ro Mfwui ¿md E/ccfranír Atn+'onfcj S.F. Zümctzcr, JL. Davts, and C. Lau, eds., pp.421-432, San Diego, CA: Acadcmic Press. ven dcTMalsbur^ C., 1990b. '"Consideralians for a visual architccturc,"' an AAun(Jw/Afurj? Ctmfipjrí£,r.rP R. EctmiLlcr, cd., pp-303-3 L2, Amsterdam: Morth-Hnlland- von de - MaLstaji^C., 19K1. 'Tticcnrrelalion theory ofbrain ftiDction,'" /iepo^í Í/-2, Departnumtof N™rohtíklngy, Max-Plank-lnitbtuLc tbr Biophysical Ctttmislry, CioLtingcn, Gcrmany. ven der Malsburg, 1973. "ScIf-üTganitaliün of orteatatk» HUlUvt colk in ihe Btrílte turfes? vqI.H, pp.W5-lÜÜ. von der Malsburg, C^and WtSchneidcrH 1986. 'A neural cocktail p.irfyprwesjHjr^JUWS^gi^CbfrcrmVícs. ‘ol M, pp.29-4Ü. vnn Ncumann, J., L9S6. wnt M idmm tur ComptiXúrg tuwí CtN^pNíer JAwry W. Aspray and A. burles, cds., Cambridge, MA: MtT Press. von Ncumann, J., 195S. Tfte CowrptJíerüÑJ rfre ífriaúr. New Raven, CT: Yalc Univcrsity Press. W Neumann, J., 1956. ,LPlühabilisJic Logjcs and tbe synthesiH of rehable organillos from unrcliable coI^p^nenLIí,,, in CE. Shannon and J. McCarthy, cds., pp. -43-9S, PrinccttMi, NJ: PrinccEtm UnivcraLty Prcas. Wahha, G.% 1990. .Wode¿í /ór Ofrserva/JíWfi:! Arlo. SIAM. Wahha,G. HR-Johnson, F. Gao, and J-<long, L995L*lAdaptivc tun.ngofnumcrkal weatber predictionmodch: Randomiied CfCV in rhrce and tour dimcnsianal data assimtlalion/" .WbnrA¿i- Eeirfeib, vol. 123, pp_3JSS-1369- Wathel, A.. T. Hanazawa, ü. Hinton, K_ Stiikano. and KJ. Lang, L9H9. "Pltoncme rccognitinn using time-delay Dflnl nciworkñ? /£££ Trurtsocrforis Pr&cej.íújffp vol. ASSP-37, pp.32R-339P Waltz, D., 1997. ‘'Neural nets and Al: Time for a synlhcsis," plcnary 1alt, Jjrfe/vwrfíoÑdJ Cr?jf/LWÑ¿df nq jVeAWTitf, vol. I, p. k¡¡¡, Housrnn. WaLtz, M.D., and K..S. Fu, 1965. “‘A heurisíic appmach 1o rcinforcenbenr learoing CúiblTCíl qyvtefu? JEFE TfflrijcTrffons twr vol. AC-10, pp.390-]9S. Wan, E.A., L994. "‘Time Renes predietion by using a conncelionist network wilh internal dcl^y linas? in finre ütritJ EreJíbfro^.- J¿?n?c¿zíf^j_í íAeí'uftdñíüFjJ Anfp A.S. WcigtndandN-A. GfrshcnÉield^eds., pp. 195-217. Readmg, MA:: Addaacm-Weslcy. Wan, E.A., 1990. "TfthpCrfal bdekprúpagaiiun forFtk neural ncfworkp? Cbft/iTúflCí1 cu .Venrtrl At-fiLorís, wl. J, pp. 575-580, San Diego. CA. Wan, E-A., .i i.J F. Bcaufays, 1996. ,LDÍagraítl]naiic derivzlion OÍ gradient algorilhms for neural nerworks/1 Mnira/ Gwnpiífciftcj'JT. v&l.8, pp. L82-20Lr WbteHbe. H., YamagurhL ud S. Kadgiri. 1997,. ,LDiscrimiiwlne mtínc design for rebutí pattem mogniiion? JEEE TrjFj.wM-jjowjt iw SjjjmJ vol .45, pp.2655-2662.
Walcrhraiic, S., D. MacKay, and A. Rohinson. 1996. "Baycsian mcíhods ibr mixiures of cxpcrts/ ín Afenraf /Vtwesriltg StWrfl.r. vol.K, pp35|-357TCamhridfB; MA: MIT Pfims. Wattm-CJCH.. L9S9. /-fiTJTjjí^g-/rrjrtT RfWffllfr, Ph.D. Thesij, llwversiiy of Cambridge, Fngjand.. W^ikins. C.JC.Hf., urtd P. Dwyui. 1992- 'X^leaniing,'1 Jfcrtfeí' /.j-xr™rjg. w|. S, pf\179-292, WtÉTüUt»R L I9R7. "l^irrting al^cinihiiií Fot iMirtütiMiónisi rttiwLwkfl Applied gjadiLnl incitada of nonlincarof^.m-ization," CF /jaft'JTiüJj'rjJzti/í -jri L . .'i. । irJ iWjíruf AíVut^ÍJC, wd, 2, pp.619-627B Sm Di-tg.0, CA. WatuaG.S., 1964. "Srawttrcpenufi.1-1.1 x -.¡C .^nzMv¿.- ÜerteM. vol. 26,pp.359-372 Webb, A.R._ 1994. “FiiMlfcnl apprcnümalun by feed-forward neiwrki: A lca*l'Sqiwcf appnwh io general i sal ion," IEEE Thrn/mrJjt™ €?□ iVcirniJ A'brM^rír, wlJ. pp.4R0-488. Wrhb,A.E., and D. Lowt. 1990. *The upiimal intenulreprerentilionoftnuliiliyercliMiliernctwwkiperibnnsiMiükKir discriminant arulyEis.'" .Yei/nrf AfeTwwfa, vol. 3, pp367-375. Wrigcnd, A_S., 13. Hubrnmm, and D. humclhacl, 199U. "Predklipg (he filtUK A tkmnw;lioni.sL uppruach? M-TrrHnfifru/W JitMíma/ jVíejjyt/ ^i'sXerws. vol. .k pp. 193-209. Weigend, A.S„ D.E. Rumelhad, and B.A. Hubennun, 1991. “GuenlÍKdioih by wetfH-eliiniitólicn wilh appiicvtÍM to forocaRting, ^tñ-üFicrj ¿fi .Vcjrnf?//níunm?fí<?n ftiMüiiiHgSvjfcmy. Vúl 3, pp. 875-882, Sun Mulcu.CA: Morgan Kaufmami. Weiperid, A.Sl, and. M.A. Cenhenficld, cds., 1994. 7¡heÍe,^ks/pnv/rríjí?n.- fiwrcm/fFig /fie Furtr/r ¿tuJ LWcn/a/rJíng rfce Fasr, vol. 15, Santa Fe Inslilute SLud]« in 1hc ScicncES ofLompk\ily_ Rciding, MA: Addiüon-Wcslcy. WbWHllW, K-i 1885, ,LUhcr dir analyEischc □arRlcllharkcil Kogcnannter wilIkürJichcr Funktioncn cincr rccllcn vcrdndtrlichcti,” Srriudj.tfier/úArí t/¿'F.4ÁdJ¿?flíde pp.W3-639a 7S9- POS. Würbo^i PJ.i 1992, “Neural fKíwotto and ihe human mind: N«- maihem^iics fiti hunani*tK iuigfrV1 JEES ZhttnM/taBdí CcnA'irmrc M ^>WWP Wfln. ffnf? Ci-ficraríM-A-. v<il, I pp.784)3, Chka^o. Wertrtn^ PJ.,1990 "Daekprupflgiiúuri chruugh túne: Wbart ii doe^ ud how to do ¡t" FtocMrtqgf </ rfir ¿EFE. vol ,78, pp.l5$U-l56O.. WedxH, RJ.i 1989. L,BatkpnipagaLion and onmcniliol: A rtvieu and prospector AMmoffoM/Jtrj>Tf Caitffemtce ch? AfauraT AAtfMirib wl. 1, pp.209-2lb. WastiingCuni D€ Wrrbos- P.I., 1974 "[^yondi rejreiSLiici: Xvw moh íflf predieiiofll^nd anaL^RÍR h [he behavinrftl Kíencu" Ph.D. ThesiS; I lañan! Uahmil^ Cambridge, M a VfettKbereck» D^udT. Diecccriclk L99?. -Imprrivingthe pcnTnmLancc of radial buh fancti-nn ndwnrkñ hy Lcaming center loGaírans,"' XjA-lj riL-c? m iVfunuJA^i^uricHi wl 4, pp.l ] 33 - ] 140, Sun Mú1tü,CA"Mw^n Kiniímann. WhaCr, D.A., and D.A. Sofgr. rds, 1992. í^ieNfetn/ CMfHrf.1 FirZ2>\ ípmíádtapfh'c1 í4pp*wchcsNew York: Van Nostrand Rc iitiold. White, H., L992. ^rrr/jcúaJ i\cjrnra¿A'c/iii&r-ij.-rfl/íjpiTi.ví^uJítw ít^í? ¿tvrrníní rficxiFT. CambriJgth MA: BluikwálJ. WTntr, H_> r/JO/X-onneclioniüt nojipD.TamLlnL_TvgreHsiun: Mullilaycr ftvdfwward neTwofks Cun Itram arbilrury mappmgSi"- Msira? .VcOr^riU «13. ppJJ5-549 White. H.» 19R9a. “LeinwiJ ifl arñílcial neural nccworks-: A slatÍKtka! pc^fipccLixx:,,, Afewi?/ L'rtfFiyiH/ürirw?. vol.], pp.425-464. While, H-i Í9R9hi “Somc asymploLie ieuí1i& ibr leaming in single hidden-laycr tbcdEonvard nrtwork modrls/" Jónnw/ o/ Mt StatfctiMÍ Aíej'*.1/r, wpl-Mp pp. LOM -10 L 3. Whicncv, H., L936. '"DilFcncnEÍablc manifolds,"1 vúL 37, pp.M5-6KU-_ WhíEEakcr,, E.T., 1923. ’XJn a ncw method of graduation." F/ücre^j/rgi qf/fie fAn^urgA SocrrA; vol.41, pp.63- 7JP Widmw, R.. 1962. '’CjcncraliHation anuí Information Hlnrage in networks-ufadalinc 'ncurunsV in M.C. YoyiI.é, CLT. Jacohi, and (i I) , Cmldslcin. cds., Si aten?, pp. 435-46 L Washington, DC: Apartan Booka. W¡dnowLH.LJ.M. McCool,M.G. Larimora, and C.R. fohnson, Jr.. 3976. "Slationajy and nonjrtationziry leamipgcharactcriEtics cf"Lhr LMS adaptLvc lilter,'" f£C£. «1.64. pp. I L51-1162. Widnmy, ñ., J.lt Cilovcr,Jr., J.M. McL'ool, J. Kaunitz,CS-Williams RJi. Hram,J.R. Zridlor, J. Dong,Jr.,and k.C.CrDodlin, 197S. "Adíptiví noific esncelling: Principies and applicationsf F/tJr?jYt/./iy.r a//fre JEEE. «o|. 63, pp. 1692-1716. W'idrvw, B.. ^I.K. Gl^tB^ind S. Maura, 1973. "Pv.iiish-ncuard 1 evnin^. wiíhicntic in^daptive thnpthúld s^sccmE," JEFE unJCj ¿uTYk'/ñ .h. vol. SMCv3-, pp.455-4ri5. Widmw, B., and M.F_ HolT- Jr._ L460L '"Adaplivc swibdhing circuils,’' 7í£ fíEÍCfJjV í"i«n.í,fl//D/r Itacwil pp. 96-1Ü4. Widnow, B., and M.A. Lchr, IMO. "30 ycars ofadaptrvE neural nctworks: Pcrecp^njn, madalinc, and backpropag^L on,” í-rf/Ngs rfií tatiJWfc ctf tTc-cP íclIÍ and Efeí-fliPÑjeí E/igrt?cc/T. vül.78, pp. 1415- I44J. Widrow, B., F.E. Manley, LJ_ GnfUths- and ElB. £joodc, IMT/’.AdaptivcanlcnnasyFEemñf F™?£i?íÍ/ñí’s o/fAe !££EP voL 55, pp. 2143-2I5*J. Wídrvw, B.i fiíid S-.D. Steuvw, 1985. EnBjewwdClifft; NJ: Preinke-FitíL WiAow. R., íimJ E. Walích, 1996. Atw» CmívA Upper Siddle Rr- >t. NJ:¡ FtwlkeJtaH Wiclítíid, A . and 1? Leighcnn, 1987. ,lGwmclrie analysis of neural neiwcrk capabiIiúeC ftnt XEEECwi^wkí jjn- A'ítj™-? AVfiLT.hi-JLx, voL ][], pp-jS-S’192, Diego, CA.
890 BítUKftAHA WteoerpN.J961. Qtarndtaf, índedátion, NcwYorfc: Witey. Wiener. H, I9S8 NMflteKr r-a Séjír/w 7Wwn*¡ New York: Wilcy- Wiener, N.P 1949- Esírupaífl^mr- /flffrpüJaJ/w?. erro/^ífflfrúi^wn' íjítt< Strfet ki/fi ¿'ijgjmvriffg /Tppífrarráas. Cambridge MA: VÍT Press (Foi mgindmcntc laucado comoNalimíil Dcfrnsc Rtsrarch RrportCiHssificado, r'cbruary 1942). Wiener. N.b 194J1. CyAejwitfks. Oír ConfirJmrfCbmflrHFUMfJtwr in ^ñe dirima! and ^4 AfcrcAifleP New York: Wüey. Wilki, $.$., 1962. Mrt*swriu!5ta¿¿F^cs. New York: Wiley. Wilhams, R.J.. L992. "S.mpleslacEtcal gr&drnt-fallrwing algorilhms farcaainMlionist reiiforccmcnl leaming.” Afirefl'úw ¿fff^nrr^g. voLi. pp.229-256. Williams, RJ.p L988. "'loward atheury üfremfaTcrmeni-IrajriingtüínnrcliünLEt syslcmiC Trcfi^iciJi1 Eep^rTATU-GCS-fií-J. Coltrge i?f CcimpuLcr Science, NoctheasLCm Univrrailyh Boston. Williams, RJ._ 1915. ^Peature disco^rry fflnugh <?nvT-corrrvli<in leaming?1 ItaJtafto! JtíjBrt ÍCS-X5OJ. Univcrsity of California, San DiegutCA. WilkLams, R.J.. and J. Fmg. 199ü. “AnefificicnJ gradimt-basedalgorilhm furon-line tramijigüfrccurTrnInclwcirk IrüicclüriK/1 Venra/CompuXcTfj^n. ™l.2tppi49O-S0l Williams, R.J., and D. /ipser, 1995. “tirad-L-nC-bíiscd leaming algurilhms fot recurrent nrtworks and ihrir computaLimaJ cúmplcxity,’' in Y. Chauvin and D.E. Rumelhar1,-EdE.,EaelpnvMguriüFr.- TAcYjn'.djrArrcrfrdres. unJ^ppiietf/iQiu. pp-433- 4156, HitLadaLc, NJ: Lawrencc Erlbaum. Williams. R.J.. and D. Zípsrr. 1989. "A Iraní.ngalgorilhm íbrcontinually nmning fidly recurrenl neural nel works,"" .Veiiraj1 CtapulariMl vol. L pp. 27(^280. Willshaw, D-J.. O.P. Buncman. andH. C. Lnnguct-Higginfi, L969. HNon-hokigrapihLC aRsoctativcmcmory/Aüfn^v-r4-ü*t4Íüra/. TCI222, pp,960-962, Wílkhaw, D.J.. and C vnn der Halshur^. 1974 “Huw pacccmed neural nfimctiofW can be sci irp by $d_ n-:i-:;iirj.iíí^h '' ffjyj/ Sbetan ¿íwfofl JJ. toL. 194, pp_431 -44S. WLLson. G. V^andCirS- Pawley, 19158. ’,Onlhcslabihty ofthe trawdling salcsman prohlem algürilhm of HeipÍLcldand Tank,” C। Acnwrtu; vol .SU. pp.63-70. Wríht>ik H.R.. fifld J.D. Go^ac, 1972. "'Esteilaccwy and inhihiiory inieractioníi in local¡zed popularifltis úf rriodtL rteurcns.H JtfUrritfV (r/“V0L12, pp-1 -24. Windef, R.G., 1961. '^¡n^LcficageihitúwLd Iqfjcf SMCriAQ Cfrndf AEEE Spwiab htikllHK» vol. S-1,14, pp.]? 1-332. WlhQgRd^ S-n and J.D Cflwan, 1963. JteffaMr Ctaptfürtwi tóf qFMÍM. Cambridge. MA: MIT Rress. WoJpert+ D.H.i 1992. "StacLed geDenllattoaf1 .^'ewrtJÍ Mtfworfs; voL5, pp 241-259. Wroodt N.L..jind N. ('uwan. L995. "ThewcJtLail putyptnonHnDnrevdfUed; Aueniiom ai&d menuey in ihc tlussicwlcciwe llilealqgpfwedm ofCbenydmJjrJfcwrwf Gíjíiíjuf. vol. 124. pp.2-43-262. WdckLvW. A.l 1986. "'ImporLaiU ¡fatucs in kriowlcdgc npwHivnr1 r^7te7íiífdfidfí ¿?fFkvr?^ydíriJÍSBC#wtfar vol.74_ pp. I 322-1J34. IS^C-FJ., L93_l. 'Xht Ituc cíinvcr^ence prapertiei qí thc LM algorithmr' ü/Sdfüfr£frejP vol_ L1, pp.9^-1 Ü3. Wylic, C.R.. and L.C. Barrete. 1982. jidwiMd fjrgrncm-rrg AfíTrórrTiLirkr. 5th ediliem. New York: McGraw HilL Xu, L.. A. Krxyiak, ai>d A. Tullir, 1994. ,L(Jn fhJij. bufl íunCliun neis and kcmrl regressiun: Slalistical rcinsiítcnry; conven;cituy rales, and nxrplive field sizt.L| Ar™r¿n’ A'íFhwíí. wl.7P pp.6O9-628_ Xu, L„ E. Op, and C.Y. Sutn, 1992. "*Modlfird Hebbian leaming for curve and siirfacr fitting,’1 iVeurai A’efwürfcí. vo]Jp pp.441^157. Yang, H., and S. Aman» 1997. "Adaptive onlinr kamtngalgorrhnis forb'md separadon: Máximum cntmpy and mínimum mutual intojmatLuru" Afainf vol-9, pp. 1457-1482. Y«, P_V., I9Ml /iegrJíjrrzfJ RcKÍrul Saris Fwncfwít aVeMo^ts: «rf Cid'sjr/kaj'iari. jaJ Tíme Senes Antaftaq. Ph.D_ ThcsÍE, McMasler University. Hamiliim, Oncario. Yoclcey, BU., 1992. frr/¿n™fw¿r Fíimfv ¿rod .tfoZceií/ijr Cambridge: Cambridge Univcfrity Presí. Vosliizawa- S., M. Morila. and S. Aman. 1993. HCapaeity of asEociative niemo^' uiin¿ a wnnwnDfDnK MURO medd " A'erj^ji Mrftwrb, wl. 6, pp. 167-176. Píulch. i hA^ 1973. “Üul lint oía ne^ íipprrwh Co the analys-is afeomplcx systcms and dec ision procesan," 7EEE ThSMSKftMl oh Sysr^M. AÍüm. Q'AfMieji^je, yol. SMC-3. pp.2S-44 ZadehP L.A., 1965. HFuzzy scK' Jñy¿?™íjjiüri uriJ GwrJrrji. vol8. pp.338-353. Zadch- L.A., 1953. fcA eontribution to 1be [htúry «f nonlineár qrUMur/ AhinAfin Arsrfíjrte. voi. 255, pp_3157-4QI. Zadch. L.A^ and CA. Drsorr, 1963. ¿j'^r Srsíerw Tlkwy; rteNew York: McQf*W Bill. Zamrs G., 1981. 'Teedback aj>d óptima! EenEitivity: Modcl referente iransíbrTnaCiüiis. multipliati» srminormE. and Sppnox ;nete irwettfo/1 JEEE 7ra#Tsactfons o« uAutoRaiie C.oMfmf. vol. AO26, pp.301- 320-
Zamcst Ci.b and B.A. Francis, 1983, “FccdhackL ntinimax, acnsil iv iíy,. and nptimal mbuslncss," .r/.7-.7T Tmtt.taclifífi.': ati VOÉ- AC'2íh [kp,5R5->6GI. Zcev^ A.-T-, R-- Wcir, and V Mapmv, 199S. n,Errof bfluhdíi frir ftlKtíonal flpprdstnnaliíin ¡ind £*1hsbft1¡flnillÍP¿ ihixhUH cf cxpcnfi,” ÍEEE PdrtMífrflMi dn rtwiy, vq144, pp, 101(^9025. Zcki, S_, 1993. ií r¿idtijr .Brtaw. OkíotcI: Blackwell ScictiliHc PühlicalinnR. ZifMf, D., and D.E. Runiclharl, 199fl. "'The jwiinnhmtügical ^¡¿niilcancv ftf Ihe íkw leming modclsj'' in G>nd/wrrJ'J<^ír/ NwvwtaKV; F..[.. Echwstnj, íd.B pp. 192-200. ranihdd^ MA MIT Ehusíí-
Hidden page
índice Acumuladores, 560 AdaBoost, 394, veja também Rríbnfü, descmpenho de cito, 3% resumo do algoritmo, 396 AgjtipñmenUi hierirquitó, -18 Algoritmo dü minimizaría do valor Esperado (MVÜ), 416-11 aplicado h modelo MHE, HA Algorilmo da rtropropag&cto de erro, vqa TtcrtrprtipagsfÍLó Algoritmo de BroydEn-Fletdirr-GlDdEajb-Shannó, 27Ü Algoritmo de Davídon-FlEtclKr-pDwcll, 22Ú Algoritmo de extracto adapEativa de cómpOncntefi princi- po; s (APEJQp iñ-l-Ur.:-: Algoritmo de Lloyd genrrali^ado. 4Í6 Aljforitmo de rctropropaga^ío, 18S-2D2 «nwerigjfincta acelerada doh 25fr-2fifi cccwtjtoña do. 252 critÉrios do parada, ?DH eficiencia computacional do, 214-2.56 escalamEnto. 253 gradiente local, LOO heurísticas, 2ÜU1L inicipliza^to, 2D0 mínimos locáis. 252 modo por lote doh 132 modo seqüencial 1^199 momento, LSI rcjra drita generalizada, LÍ7 regra delta, L 5L2L represenla^io dr saida r rtgrt de deeistoh 7t 1-214 resumo, 200-202 MJnsibíl ¡dwfe, 256 laxa de aprendizagem, 1Q64M temporal, 7ÍB-7W virtudes e Jimilapfcsh 252-259 Algoritmo do cinnpiáo cerebral ótimo, 252 Algoritmo do mínimo q-ufldrado médio (LMS), 1^5^161 algoritmo LMS normalizarlo. 123 algoritmo LMS-Newlon, 121 curva de aprendizágEm, 119-161 desajustamento, L59 vzriacBO da taxa de aprendizagem, 161 -161 Algoritmo dos mínimos quodrados recursivo (RLS), 177 Algoritmo bdMuo goteral izado (A1IG), 453 convergencij do, 455 otimizafáo do, 456 resumo do, 152 Algoritmo Mcircipoli^ 603-6D6 Algoritmo, crigem do termo, Q2 Amostragcm dr Gibbs; 608-6ID taza do teorema da convergencia da, 610 teorema da convergencia da, 6l0 leorema er^ódicn da, 6 LO AnáLise de componEntcs independentes, 553-570 algoritmo de aprendi^gem para, 5M-.564 corisidcracfc* sobre a eonvtrgftieia do algqrlinio di aprendizagem, S6á «tabLLidaxlc do algoritmo dr aprendizagem, 565-566 ñinfáo de ativacán para, 561-563 gradiente natural para. 565 índice de desempenbo pdra, 170
propriedade cquivarianlc, 564-565 AñJIiic de componentes menores (ACM), 4BD AnáliM de componentes principáis n^-linear. 474, üjj. Anáüsc de compoíiíniíH principáis pw núcleeL 472 resumo. 125 An&llse de componentes principáis 413 algoritmos de decrarelacfri. 469 alguritmos de reeiimif&o, 46fl auto-Eslnrlura da. 434 métodos adaplativos, 47L métodos por loto. 471 iL3o-lincarL 474. 400 SUbopB^C principal. 469 Análíse de dados de mareado financcim,. AC1 pm, 51£¡ Análisr cm trmpo-frrquériCLíl, 854 Aprendizageni anEi-hchbi¿na. 81.4$2 Aprendizagem basada em memória, 23 rejra do vtanho mais prójimo, 2S re^ra dos i i izinhos mui* pnfrrriic*. 2fi Aprendizagem com uní professor, 8fi Aprendizagem competitiva, tL488 regra. para. Si Aprendizagem c-onrinua. IO8J8O3 Aprendizagem drlLa-barra-delí** 177h 279 Aprendizagem hebbiaiw, SU generalizada, L04 hipócew da cowñfliK¡3a 82 postulado de Hebb, 82,4]L retorno sinápticu, 81 Aprefwi:zagcm náo-supeix'is icnada, 90 Aprendizagem por corroí bo de crio, 2fi Aprendizagem pw cwidiflo em encala, 22ñ Aprend* zagem per diferenf* lempucal, íifi L Aprendizagem por reíorcu, S-9-%- 651. 681 Aprendizagem (J, 671-676. 681-682 aproximada, 673-675 esptantefo na. 675-676 Icoremi de convergencia da. 672 Aprendizagem recórreme em lempo-real, 812-819 complete idade computar iunal da. 828 grafo de sensibil idade, 817 imposi^áo de proEessor da. 819.845 rwwF 81? Aprend izaron selcrivn. darwiniana, 122 Aprend izn^em ran um pnrfwor. ES Aprendizagem supcrviEsonada, Efi como um problenu de uúmizasáu. 2££L22i amo um problema de neco«tru0o de hipcrsupcrficic mal-liormulado, 293-294 Aprendizagem, SU dcíin¡QÍD di; 25 Lcoria c^tBlifiliea da. LUI Aprwrnuclo ortoo&rticm Lúl Arvore de duñfi£O(io e regre^á-D íL AKT, cAixr^ldudón turf remita frw)p 408 Amtores; 725 hacia de atraco, 727 cítranhci, 762-775 hiperhólíMS. 7j7t 832 manipulaban de, 730 pontuaLsr 727 Autflfiltro máxima hchhiano. 442 CRtahiLid^e dí\ 446 Autñtnam- 4c cslado& finilos. 804 AuOpCrganizi^O, SQ* 430 principia ih, 4M Autovalores, 435 Autovetores, 435 dnminanlen, 441 Axónio, 13 Jíaci-prapCTgfl/rciHr. veja Algo?:lino de Rcimpropagajíáo Bits. 522 Busca cm linha, ¿66-268 Canias de Markov, 595-603 cl-us-s-i tlizaf-üci, 6Ü2 defin ¡íioh 595 diagrdnu de ttwuiffo de ebladu das, 600 ergódias» 598 idenlidade de Chapm-an-KolnLügorov, 597 irredu1ivcLih 597-598 maíriz cs-locásEica, S96 principio dti halando decalhado, 602^603 probabilidades de 596 propriedades recurrentes das, 597 Icnrcma da ergodie idade, 599 (’am inhada aLearória, 645 Campo Ixni induzkkh difinitíOi 11 Gunpus reteplivos, 53, 7Q Ll?f 11L Cañe el ador de L-úbulo lalenil generalizado, 22 Cm»! 762-771 definicáo deP 768 dimrnsau de torrelabijci, 766 cxpDcntes de Lyapunov, 766-768 recunstruíáü dinámica de. Ttffl-772 Capucidade de separacáu de uma superficie, 288-290 Cari^lcrislicas espacia Imenle eferentes, 549-55 L CaraclerislicaK cspacLalmenlc incítcrcnlcs, 551-553 Cclutaf de Vihiiinoi, 506 Cerebro, 32 organizaba^ eslnnural de níveis,. 15 Cluií-i'ücacíw adaptativa de padróes. L"xpcrimentDS sobre, 314. 335,369,508 Clwsif-eadflr bl(ywkan&a 169-175 rifen bipesiiDCt 169 Ccberta de Miriur, 631 Ccdlfio^o de fantpm. 458 Coeficiente de correlafaD, 5 E 3, S50 Lompartilhamcnlei de pesos, 53, 114 Complexidad^ cumpulac i>nal, L30, 322
algoritmos do tempo exponencial,. ISO algoritmos de lempo pohnomia]p J8£i Complex idade d* amcBlra, Lk¿ Componentes principáis, delin^Aci, 41B ConexiOTismo, 252-253 Conhecimento, deími^ió, 49. ConlrulE adspcaLLYü por rEÍcrencia a modelo, S36-840 Converjéncia cm probabilidade, LLú. Convergencia sinSptic^ 42 Cóftex cerebral, mapa cilúfirquitetural, 3£ Criterio de Neyman-Pearaon, SI Criterio do mínimo romprimenio de descriéao {MCD), 270 Criterio HhJ 77,256 Curvas (superficies) principáis, 48(3. 5ft? [’kcc-rji pc-s n;¿ri cm subtspaco, 441 [>Kümpc4¡cto por valor singular, 471 valores singulares,. 471 vetares singulares, 47] DccottvciIucAci cega, 522 Dendritas, 11 Derivadas ordenadas, 81E Dcsigualdadc de Cauchy-Schwarz; 166 Dcsigualdadc de Jcnscn. 427 Difercnciaclo cm relacio a um vetor, 176-177 Diferencial de Fréchet, 295-298 Dilema bLas'vzriancia, 1_L2 erro de apruximalivo, 112 erro de estimativo, 113 Dilema da estábil ¡dartc-plasticidade, 3Ü Dimensao VC, 119-123 drfini^Ao da, 1211 limites da, 121. 13£l Dinámica da desoída de gradiente - subida do gradiente, 777 DíscriminanlE linear de Fisher. 227-228 Dísláncia de Mahalanobis, 52 Dísláncia euch diana,. SI DislribuiQfto de Boltzmann, veja dislrihuitáo de Grbbs Dislribui^áo de Gibbs, 593f 642. M7 Dislribuii^o talorial, 538, 629 DÍ5lribLLÍQÍfci subgaussiana, 5Í2 DÍBJrLbuipta supergjusiiana, 582 Divergencia (distancia) de Kullback-Lciblrr, 528, 53T- 539 dccomposi^o por Pitigoras, 539 rela^áo wm a iníórmaf-io mutua, 538 Divergencia sináptlca, 41 Dot pruducl, veja Frodulo interno. Energía do erra, 22 Energía Iívtep 593 Enlropia diferencial, 529 Entropía marginal, 539 kntrerpia relativa, veja Divergencia de RuNback-Leiblcr Entropía, no sentido da teoría da infbcmsíJü, S2E Entropía, no sentido lermodinjmico, 595 Equa^Sü de Eulcr-Lagrangr. 298-799 Espado de caraelcrislicas, 225, 285, iúJ Espado de Hilbert, 297. 339 Espato do produto inlcmo, 311 Espato normalizado, 294. 339 Espato rierhamriftiKi, 585 Espetlrograma, 693 Estabilidadr, 722-724 Teorema de Lyapunov, 724-725 Estimado por máxima verosimilhanta para reparaijio cega de fontes, 570-573 retaco com a gnáfise de componente independmecs. 572-573 Esiimatáo por míKima verosimilhonta, 411 Íimf5o Logariimo da vetusimílhanta, 414 prcipnedades da, 414 Estimador per regresoáo de Nadaraya-W&1$on, 326, 519 Esiraiégia de aprendizagem proeura-cntiü-comrerge, lid Exponsfle de Edgeu'orth, 585 Exp^nslo de Gram-Charliw, 558, 582-58^ Faior Q, 659-660 Fenómeno da Testa de wqueteL 97, 135, 53fi Fi Itragem adapcaliva, 144-146. processo adaptativo, 146 processo de fíltragem^ L4t Filtro de Kplmin, cstcrnMo desacoplado, 823-828 comptexidide computaciona], B21L828 inúhiplas oonrenles, 846 resumo, B26-828 ruido de processo artificial. 826 Filtro Untar des minirnos quadrados, 152-155 Filtros de Kalnw, 177, 819-823 erro de aümKlo filtrado, 823 falo? de convcrsáo, S23 fenómeno da divergencia, B23 inciVBcdes, 820 rrualnz de covariancia de erro, 8211 raiz quadrada,. 82D resumo, 82] Filtros de resposta a impulsos de durado Finita, 698 Filrros de Wiener. 151-151 FiEtros neurais, distribuidos, 698 focados, 694 Forma a partir de sombras, 478 Fórmula de Flcicher-Rwcs, 265 Fórmula de Hcsteness-Siiefel, 2BÜ Fórmula de PdWc-RIbtere. 265 Furiíio de mlvftflGp 1L 1^5 definidAo de, 32 níü-moflútonr 3íi 779, 785 i pos de, 38-4L 195-196 Fundo de crtscimento, 1LÜ
Fun^áo de Green. 2S3. Fundió de H caví si de, veja Fun^&o de limiar Funfio de limiar, 33 Funfáo de partirán, 593 Fundió de perda ümhíkí a e, 372-373 Fun^án limitada saturada de um lado, 805 Fundan linear por partes, 4LL 755 Fun^áQ logística, 4<i- 79, LÍ5 Fun^áo sigmótdcP 49 Fum^rs ijngcnte hiperbólica como fundió de ariva^áo, 39. l£fi Funcional de risco empírico, 1 LÜ mautAKÍn esirita do, LU Funcinil de Tikhünnv. 295 Fu rindes (distribuido*) gHussianas multivariadas, 3Ü4, 327. 534 Fuftíóes de bttC radial, 291 jsussianas, 191, 304, 327 muHiquádricax inversas, 291 multiquádricas. 291 Gunuio, LiL Gamáo-DF, uil General izafáo, 28, 51L 232-234 tamanho do conjunto de toe .ñámenlo para, ?~^4 Gradiente natural, 565,585 Gradiente relativa, veja Gradiente natural Gnfo uquitetml. 14 Grifo de ílusto de sinal, 41 regras hásicas do, 12 Hiperplano étimo, 151 método quadrálico para computar o, 553-357-152 propriedades esiatisticas do. 152 H ipótese de Ekarl-uw, 542 H ipótese de Church-Turing, 804 Identidade de üiwn. Ü8 Identifia^Sú de sislemas, 146- 710- 814-837 modelo de entrada-saida, 836-837 modelo de espado de estados, 834-836 Igualdadc de Wbadbury, veja Lema da inverrao matncial Independencia ^StailítifiK 537 ínfimo, 1 Lti Iníoimafáo mutua, 514 para aprendizagem auro-orgimizada. 5411 propriedadec da, 535 Informan. 5_Ü2 Inibi^áo lateral, 84 Inteligencia artificial, 59 llcrac&o de política. fíSO-rWhl aproximada, 6hS-67l liento de valor, 66 i-666 Lema da inveho lUtrkU. 251 Lema de Sauer, 125, 136 Limite de CherrtofTn 22Ü Maldigo da dimcnsi-unalidade, 237-238, 321-322, 606 Mapa de identidade, wja Replicador Mapas auio-orginistáveis (modelo de KoboocaX 4fiü adaptado siniptiea. 43L, SIS algoritmo de coisdAKia. 521 algoritmo normal i oda» 490, 524 casamento de dcn&idade, 5UQ tase de convergcnc a, 493 fase de ordenado, 492 finito de VÍ21IÜMHÍ3, 490 ordena^áo tupológjcat 499 processo competitivo do, 48R, 518 processo cooperario, 489 propriedades- dos, 494 resumo, 493 versáo por lote, 199 Mapas contextuáis, 5 14 Mapas corticais {computacionais), 35,484, 517 Mapas semánticos, veja Mapa* contextuáis Mapas topográficos- 34 Máquina de Boltzmann, 610-617 delerministica, 626-627 regra de aprendizagem paraP 86-86. ril 1-61-6 Máquina de HclmhoEtz, 622-623 Máquina de Turing, 804 Mtquiiiu de omM» 315 Máquinas de vetor de suporre, 349 comparado com a aprendizagcui por retroprepagado-, 370-372 projelo ótimo das. ^64 reconliecimcnta de padreSes petas, IllI rcgressáo, 373 Máquinas eslocásticas bascadas na mecánica cslarísrieaj 591-643 Máquinas inteligcnles, 849-853 para comióle. 851-852 para processaímcuLo de sinais, 852-853 para Tcconhecimenlo de padróes, 85Ü-B51 Matriz de correlato, 153. 434 Matriz de Grecn, Mtt Marriz de influencia, 1L5 Matriz de informado de l'LEher, 474 Matriz de intcrpolacáo, 291 Matriz de núcleo, 473 Mltriz definida pctiummcnl^ defíni^áo, 177 Matriz hessiana, ISO, 2341 computarán da inversa da, 2S£k251 Malrizjaenhiana, 151, ZJft, 72] computarán da, 22:-: I-jj Máxima eslimHQáq ¿f jwferiari (MAR). 425 Mecánica csratlsti^^, 592-595 Memoria aeessivel por cnnKúdü- vqjl fMdelo tk- J-tupficld Memoria de linha de arraso derivada,
Memórin garúa, 669-691 Memória por matriz de correlato, 104408 nlapk) com o algoritmo LMS» US M-emóriá» LÍK1 OSSOCUlliva» $2 de curto prazo, LÜÜ de longo prazo» lllli distribuida, 1QLI interferencia cruzada (cnwftdfcL LCfi por matriz de-otirreLaj?5a, ID4-1Ü8 recordaQiOj 105 Memória, cstnituraa de curto prazo, 6B6-69] profundidadii da memoria, 6SS resolutío da memijri^ ú8fi Método da decida mais íngjcmc» veja Técnicas de atimuzjf&u, irríslnL-ii Método da dire^&o conjugada, 264 Método da máxima entropía para separado cega de Fontes, Í22z52ft algoritmo de aprendizagem, 5??-57ft equivalencia com a máxima, vernsimilhan^fl, 576 Método de aprendizagem por media de ensenóle, 3S7, 421 MdtOÓO de <3auss-Ncwton, veja Técnicas de otimiza^Jo, fcnAÍUs Método de Ntwton, 261 Método de quase-Ncwton, 268 Método do gradiente conjugado, 2Ó2-26H busca cm linha, 2fiSz2úE comparado com o método quaw-Ncwtoo» 270-171 fórmula de Fletcher-Reevcs» ZáS fórmula de Polak-Ribiért, 2ñ5 método de Brenl, 26s residual, 265 rwmo do, 2ú9 Método des multiplicadores de LagrangC. 249, 354, 531 «ndifta de Kutm-Tucbcr, 1S4 problema dual Í54* 359, 375 pl L>bienu primordial, 154, 359, 375 teorema da dualidade, 115 Mínlrpi^án do risco empírico, principio da, 117 Minimizacáo cmrarai de risco, L2fcJ2Z Mínimos glúbais» deilnií Jo, 225 Mínimos locáis. definí^Sr*, 275 Mínimo* quadrados iterativamente ponderados, 425 Mwldo de Hopfield. 730-749 eapacidade de arm&zcnamcnto, 746-749 cenário de wqim 738 estados de mucura. 754 «radas de vidrv de Spín, 7M caradas espurios, 745*746 fase de armazEnamEnto da aprendizagem, 740*741 fase de recuperaba {recordaba 741 -742 fuñado de energía do. 252 memorias fundamentáis (estadas prrtótipusL 739 memórias fundamentáis inversas, 752-754 parámetro de carga, 747 negra de Aprendizagem para, 742 nitflo idnal-niídD. 74? Múdelo aditivo» 701-702. 727-728 Modelo aulú^rtgressivík 56» 511 Modelo de aprendiagem fratí, 392 Modelo de espado de estados da rede reoorrenlc, 794-8Ü2 Modelo de Linsker do sistema visual dos mamíferos, 413 Modelo de Litllc, 779 Modelo de McCullcwh-Pitts. 40, 63, L¿1 Modelo- de ti .! stura de especialistas (ME), 402 Modelo de mistura gaussiano associalivo, «i 1 modelo de mistura de «peeialisras (ME)r 402 modela probahil Fótico de gcracáft, 401 Mwltlo de miaurs hicrtrquica di especialistas (MHE}, 4l~hS estntdgiu de aprendizagem para, 4L5 Modela de WilLshaw-von der Malshtrng, 4S6 Modelo do -estado cerebral cm urna, caixa (BSB, .ífüfí-j/t-d-ñox}. 755-762 agrupamentos, 760-762 dinámica do, 759-7M fun^áo de Lyapunov do, 758-759 rede de redes usando. 775 Modelo provavelmence aproximadamente correto, (PAC), L27431, 391 Modelos de redes neurais buetdtH na tafia da rníbrma- qáo, 121 Modelos de Volterra, KI9 Modelos ocultos de Markov, 644, 693 Modularidade, deñnifflo 3B6 MonOoiín^, 2H6 Morcegú «oixKaliudDf. 27, 58 Nats, 122 Navalha de Oocam, 232, 397 Ncooogniinm. L 34, 277» 454 NETtalk, 693-692 NeurooompuLa^áo aEencional, 99» 852, 854 Neurónio intrgra-c-di.spara, 779-779 Neurónio oculto, 4é» 184 Neurónio vencedor-l-rva-ludo, 43 Neurónio, 31 modelos de, 36, JJ Norma ponderada, 3Ü9 Núcleo do produto interno, 362» 473 Número condiciónenle, I 58 Operador de atraso unílário, í5 Operador pseuctodifcwKiei. 305 Otimla^io combinatória» 608 Análugia ¿úm * física atvtiitíu. 608 Perceptron de Rcwibliítt. veja Fcnjcpt™ Perceptron, 16M69 relav^u vom o ^hssificadút bayesiano, 169-175
PtntptTOtt de múlliplas cantadas, L83 tteiccy o Je earactrrisiicirs dos, 225.213 espado de carairterísticas des, Z25 limites para t> erro dt aprosúma^áo dos, 235-237 nrconmtes, 791-792 Plasdcidadc, 22 Poda. veja Técnicas de poda de rede PoLílL.st 654 Ponrft de sela, 721 PotenciaQBjo de langa prazo (LTP}, 112 Potencia] de aCr/a^ÍQ, veja campo Local induzido Prwidfo; 97- 696, 828 Pn r.¿ ipi<i da fnnTia^aii de mapa topográfico, 485 Principio <U máxima entropía (Max Ent), 531 Principio da máxima inforniacSo mútua (tnfornm), 5ZL 541-546 modelo para wterui pcwpiivos. S42r54fi relaeio com -i ícduQlfl de redundancia, ,546-548 Principio da rrtimm¡i íñcrgií livni, 595 Principio da miniirw redundincÍJ, 542 Principio Ja onogonalidzdc, 110, 44& Principio do balando dctalhado, 6Ü2±£Ü1 Probabil idade Je dassifkarfo eomeim 318 Probabilidade de erro (de clasrilica^^1 taflomctlh 318 Probabilidade muLtLnomial, 404 Problema da diligencia, 664-666.676-679 Problema da utinqlú de gradientes, 83L-814 Problema de atribuirán de crédito, 87, 19l. 6U l’robkmi do KltMltor» 435 Problema do caiseiro viajante, 645-646 soluto usando o modelo de Húrpíield. 776-777 Problema do XOR. 202-205, 278. 287-2SB. 111-314, 167-869 Problemas ilNCHMt 293 condirüw para boa íormvlaciü, 294 Problemas NV-c-LimpItrUw. 186 PíucrsaniCTilo de tirranjo de UlOBM, ACI pGífl-, 556 PlocwMmtnlo tempúfaL 686-714 arquileLurúS de rede parah 691-693 Plucrsscis de dreisáo markovianos, 612-654 Produto ülcmn, 51 Programará o dinámica, 651 zlgcrilme de pr-ügjama^áü dinámica, 656-657 assiiwrona, t£J equa^áo de otimiza^áo de Hcllman, 657-659 método dr Gauss-Scithl, 681 priwipio dfl ottaníziffot 655-656 Ptngrum^áo n^urüd-iúftúbka. 6íl±fifil politiea de, 654 pnMom de horizonte finrkL 654 problemas de horizanit infinim, 654 relajo cerní a aprendizagem por reforto, filL Programado quadrática, 1ZE bibliotecas comerv.as snbrnr 381 Ptopriedadc equivalíante, 564-565 Psendobnversa, 153, 3 L4 P^euduCtmperaCunii 4L 593 vetoriat h.icrarquicaL 510 Quantiza^áo vetorial por aprendizagem, 507 Eazáu dr vrra-imilhanpa, IT. 215 razflo de veniEjnilhan^a logarítmica, L22 RcaJimcnía;do, 40, 44 global, ?15 local, 715, 844 Reconstruyo dinámica- 768-772 atraso de ineerváo, 7ó9 método dos falsos vizinhos mais próximos. 77fí prcvisiü recurniva, 770-771 teorema de Takcn^ 769 Reco^imcnto dctcmiinfsiiío. 634-640 &grupíuiíHm1<k 634-639 analogia com o algj^rirmo MVE, 640 classifiíarfo de piMlnk?, 644 tMdelM 0CU11M de MutOTj 644 quamiza^io vclí-r;i|1 644 r:y:rx<iah 644 Recorimvnlo simulado. 606-608 otimizayo combinatoria, 608-6Ú8 roteirode rceozimento, 607-608- Hede de regularizad^, 3Ü5-3D7 Rede cxcitalóna-inibilória, veja dinámica de descida de grad icntc - subida de gradicnle Rede tKuml de atrasé de tempo» 6G2-693 Redes (neurais) reeorrefites, 44.49, 728-729 Redes alimabda iduÉE atrasadas no tempo, 686. 7 lo distribuidas. 702 ftndti. 691-696 ¡eorema do mapeuKfllo miope universal, 696-697 Recle* ¿1 ¡mimada* adiame. 46, 181, 2S3 COtn IHÚllíplM CUMdMt íú de cantad । úaki 4ú puciiihnente von^iadas. 18 [íHalrrtmr Conreadas, 4K Redes comolulivas, Ü. 27 F-773 Redes de cren^a sigmóide, di 7-632 dctrrmmis1icaEt 627434 diñrribuiyo Je ampo midió da^, 628 cquay o de campa niet±¡ot 631 regia Je aprendizagem das, 619-621 Ri*des dr íün^áo de base radial, 2H3 compara^áo com o perccptron de múltiplas camada. 321 Comple^-idiidc CompuLiunumil das, 122 CMqdflCidode de amostra das, 322 «ttvt^iu de aprendizagem das, 328-335 genrraliradash 107-1(19 normal i zadash 526 propnddades aproxima!ivas das, 320-32.1 r< :: ;. u > Com regmEáo dr núcleo dasn 321 Redes neuiais,
adapiabilictade <3ash 22 anatúgil neurübiolAgtcah Mi anjuiEeturas de, 4ú definipfio de. 28,41 inscrpfio de inrar-incias nas, 54 impcairicnlp d£ enlrada-sakJa das, 2Í prnpricdídts das, 2E loteriincia a falh^i das, 3C Redes recorrenles, dirigidas dinamicamenté, 787-847 a1gontJiKi& de aprendiragera, 8Ú5-808 arquLteüiras de rede das, 788-794 aut-ü-regrcssLVíiH oio-lincares com entradas exógenas, 8Ü2-R-D4 CWKolabilidjdí e oh^ervalidade das, 796-797 CMnrolabilidadc focal dash 79MÜ0 ACÜDpiQ de gradóte*, M l -834 heurísticas dash 808 modelo de cntrftda-saidah 788-790 modelo de espado de estados, 790-791,794-802 modelos de segunda ordnnh 792-794 abservalidadje local das. 8OO-S02 perccptrnnq de múltiplas camadas neccrrentes, 791- 793 poder computacional das, 804-805 rcalimcntacSo local das, 344 RetfufJo de dimenMonalidadc, 419 Redundancia. 4jl, 546 medida deh Sáfi Reflejó vestíbulo-ocular, 31 Reíbipo, »U423 AdaBoost. 194 método por filtragem, 59! método por ponderado, 39 L método por su^míKlragEm, 391 Rqzislius bioméditüS-, ACI para,. 5iíi Regia de preserva^iio de bifonna^iio, 408 Regia do produEo externo, veja Aprendizagem hebbiurta Rcgreasio. de aresta, 342 nlo-linear, 110- 314 jiucteo de, 323-328 ReguLarirac^o dé Tikhonfrv-Phihp^ veja Teoría da regp- lariacki Replicador, 253-254, 276=217 Retina, 3] Retrüpnjpagaé^0 *tra*¿s do tempo, 808-812 eomplexidadc cornpulacionaEp 828 considerandos pláticas, 811-812 derivada ordenada». 81 k8ll por época. 808-811 mineada, 81 l-Sl 1 Robustez. I77b 25fr Sal i ¡Sucia, 349 ScnjíbilidadCp 229.256 Separabilidade linear,. Separado ccg3 de sinais (fonle}, 97, SU Sinapse anti-liebbiaiia, 81 Sinapse hebbianah SÜ propriedades dah Sü Stniptt, sinapse química, 12 Saslcmas difusos (/bzzy), 852 Sislemas dínámicoSp 717-720 endino de Lip^hiu, 719-730 defmirfú de, 717 espado de estados, 117-7L9 retrato de estados (fase), 718 Sistemas híbridos, &2* 852 Sistemas ncuromórfioas, 31 Solu^Bo da norma mínima, veja Psrudo-invrna Splincs, de tolha lina. J43 SuvidBdc. medida deh 341 Stinfafl0t 22 Superfici!.' de dncmpcnlKi dé crn>, 18 Superficie de regrrss&oh 406 Supremo, lió Tarefas de aprendizagem, 91 aprou i ina^áo de fundan, ±1 assorKi^áo de padrón 91 controle, LL5 filtragem, 2fi íormacAo de fcixe. 98. rcconhccimcnto de padrees, 22 Tícnitft de driblo dv Hmcllín^ 455 Técnicas de otitnlufiD imAiilii; 147^152 método da dacídi mü lógreme 147-MR método de Gauss-NewEOn, 110-152 método dfl Ncw|pn. 148-1 5Í1 mélodH quíse-Neuion, ZúE Técnicas de pod^ de wten 244-2S2 cimrgiiü cerebral étimo, M8-Í52 datw cerebral ólimo, 348 dectfanefltc de pcwsP 2dfi climinetilo de pesw regularizadlo da compLcxidadc, 245-248 suavizador aprciimatno. 247-348 Tempo, 6fl5 representado explícita do. 685 represenl&fáo implícita du> ídü Teorema (algoritmo) de vCrrtverjtrtcií d& pctnptnn. L6Z resumo, 168 TcoWMí da flprmiimacáo univcraal. 234-235, 7^4 Teorema di csiabilidade asstniórica, 444 Teorema da LntFrpüIa^ü, 290-291 Teorema da representad 297 Teorema de Cohen-OroasbErg, 754-755. 758 Teorema de Covcr sobre a separabilidadc de padrfcsh 284-288 Teorema de Darmois, 539
Hidden page
Hidden page
Hidden page
Hidden page
SIMON HA/KIN Redes Neurais As redes neurais artificiáis tém raizes em disciplinas como neurocténcia, matemática, estadística, física, ciencia da computando e eagennar id Sutís apkcanóes poden ser encontradas em campos tao diversos quanto modeiagem, análise oe senes temporais, reconhecimentó de padróes, processamento de sinais e controle Este livro fomece as bases para o entendtmento das redes neurais, reconhecendo a natureza multidisciplinar do tema. O material é acompanhado de exemplos, experimentos computaciones, problemas no final de cada capitulo e bibliografía Conta aínda com duas páginas de apoio na Web